Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#multimodal
Tag193건YouTube 3Article 190

#multimodal

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#vision-language-models공동문서 179 · 연관도 95%#llm공동문서 173 · 연관도 34%#ai-architecture공동문서 81 · 연관도 27%#semiconductors공동문서 115 · 연관도 24%#agent-routing공동문서 76 · 연관도 23%#agent-memory공동문서 66 · 연관도 20%#nvidia공동문서 47 · 연관도 17%#service-design공동문서 40 · 연관도 15%#workflow-automation공동문서 25 · 연관도 15%#capex-cycle공동문서 32 · 연관도 14%
A collaborative approach to image generation
Article2025년 10월 2일

A collaborative approach to image generation

Google Research는 사용자의 선택을 여러 턴에 걸쳐 학습해 텍스트 이미지 결과를 점진적으로 개선하는 강화학습 에이전트 PASTA를 소개했다.

research.google
#privacy-design#multimodal#context-compression#prompt-library
Introducing RTEB: A New Standard for Retrieval Evaluation
Article2025년 10월 1일

Introducing RTEB: A New Standard for Retrieval Evaluation

RTEB는 공개·비공개 데이터셋을 함께 활용해 임베딩 모델의 미지 데이터 검색 성능과 실제 응용 적합성을 공정하게 평가하려는 새로운 검색 벤치마크다.

huggingface.co
#multimodal#agent-memory#change-management#organizational-redesign
The anatomy of a personal health agent
Article2025년 9월 30일

The anatomy of a personal health agent

Google Research는 웨어러블 데이터와 건강 데이터를 결합해 개인화된 근거 기반 건강 인사이트와 코칭을 제공하는 다중 에이전트 연구 프레임워크 PHA를 제안하고, 데이터 과학·도메인 전문가·헬스 코치 역할을 분리해 평가했다.

research.google
#service-design#ai-architecture#multimodal#agent-routing
AfriMed-QA: Benchmarking large language models for global health
Article2025년 9월 24일

AfriMed-QA: Benchmarking large language models for global health

AfriMed QA는 아프리카 의료 맥락에 맞춘 대규모 질의응답 벤치마크로, LLM이 지역별 질병·언어·문화·의료 환경 차이를 얼마나 잘 처리하는지 평가하기 위해 구축됐다.

research.google
#multimodal#llm#semiconductors#vision-language-models
Scaleway on Hugging Face Inference Providers 🔥
Article2025년 9월 19일

Scaleway on Hugging Face Inference Providers 🔥

Scaleway가 Hugging Face 추론 제공자로 추가되면서 사용자는 허브와 파이썬·자바스크립트 SDK에서 다양한 공개 가중치 모델을 Scaleway의 서버리스 추론 환경으로 이용할 수 있게 되었습니다.

huggingface.co
#service-design#multimodal#agent-routing#llm
How to Build a Healthcare Robot from Simulation to Deployment with NVIDIA Isaac for Healthcare
Article2025년 9월 17일

How to Build a Healthcare Robot from Simulation to Deployment with NVIDIA Isaac for Healthcare

이 글은 NVIDIA Isaac for Healthcare의 SO ARM 스타터 워크플로를 통해 시뮬레이션 데이터 수집, GR00T N1.5 후학습, Isaac Lab 평가, 실제 SO ARM101 하드웨어 배포까지 이어지는 의료 로봇 개발 과정을 설명한다.

huggingface.co
#nvidia#ai-architecture#multimodal#agent-deployment
Post-Training Isaac GR00T N1.5 for LeRobot SO-101 Arm
Article2025년 9월 17일

Post-Training Isaac GR00T N1.5 for LeRobot SO-101 Arm

이 글은 NVIDIA Isaac GR00T N1.5를 저가형 오픈소스 LeRobot SO 101 로봇팔에 맞게 후학습하고, 데이터 준비부터 평가·실물 배포까지 진행하는 절차를 단계별로 설명한다.

huggingface.co
#service-design#multimodal#agent-deployment#prompt-library
Learn Your Way: Reimagining textbooks with generative AI
Article2025년 9월 16일

Learn Your Way: Reimagining textbooks with generative AI

구글 리서치의 Learn Your Way는 생성형 AI로 교과서를 개인화된 다중 형식 학습 경험으로 바꾸고, 초기 연구에서 디지털 리더보다 학습 성과와 유지 점수를 높인 교육 실험이다.

research.google
#multimodal#agent-routing#llm#semiconductors
SafetyKit scales risk agents with OpenAI’s most capable models
Article2025년 9월 9일

SafetyKit scales risk agents with OpenAI’s most capable models

SafetyKit은 OpenAI의 GPT 5, GPT 4.1, deep research, CUA를 조합해 사기·규정 위반·위험 콘텐츠를 멀티모달로 검토하는 전용 에이전트를 확장하고, 고객 콘텐츠 100% 검토에서 95% 이상 정확도를 보고했다.

openai.com
#openai#safetykit#gpt-5#gpt-4-1
From massive models to mobile magic: The tech behind YouTube real-time generative AI effects
Article2025년 8월 21일

From massive models to mobile magic: The tech behind YouTube real-time generative AI effects

YouTube는 대형 생성 모델의 효과를 지식 증류로 작고 빠른 학생 모델에 옮기고 MediaPipe 기반 온디바이스 파이프라인으로 최적화해 Shorts에서 실시간 생성형 AI 효과를 구현했다.

research.google
#ai-architecture#multimodal#ai-infrastructure#capex-cycle
Finetuning olmOCR to be a faithful OCR-Engine
Article2025년 8월 19일

Finetuning olmOCR to be a faithful OCR-Engine

TNG는 머리말과 꼬리말을 의도적으로 생략하던 olmOCR를 8,000개 문서로 미세조정해, 문서의 논리적 읽기 순서를 유지하면서 업무상 중요한 주변 정보까지 충실하게 추출하는 OCR 모델로 개선했다.

huggingface.co
#multimodal#agent-memory#agent-routing#retrieval-index
Vision Language Model Alignment in TRL ⚡️
Article2025년 8월 16일

Vision Language Model Alignment in TRL ⚡️

TRL은 비전 언어 모델 정렬을 기존 SFT·DPO에서 MPO·GRPO·GSPO와 RLOO·Online DPO까지 확장해, 멀티모달 선호 학습과 강화학습을 더 유연하게 적용할 수 있도록 지원한다.

huggingface.co
#multimodal#capex-cycle#llm#semiconductors
Introducing GPT‑5 for developers
Article2025년 8월 7일

Introducing GPT‑5 for developers

GPT‑5는 코딩 정확도와 도구 호출, 지시 이행, 장문 맥락 검색을 함께 개선하고 개발자가 응답 방식과 추론 수준을 조절할 수 있게 설계된 OpenAI의 API용 추론 모델이다.

openai.com
#openai#long-context#privacy-design#service-design
Introducing GPT-5
Article2025년 8월 7일

Introducing GPT-5

GPT‑5는 빠른 응답과 심층 추론을 실시간으로 조합해 코딩·수학·글쓰기·건강·멀티모달 과제의 성능을 높이고, 환각과 과도한 확신을 줄인 OpenAI의 통합형 AI 시스템이다.

openai.com
#openai#privacy-design#multimodal#ai-safety
Introducing gpt-oss
Article2025년 8월 5일

Introducing gpt-oss

오픈AI는 높은 추론·도구 사용 성능과 효율적인 로컬 실행을 결합한 아파치 2.0 기반 오픈 웨이트 모델 gpt oss 120b와 gpt oss 20b를 공개했다.

openai.com
#ai-architecture#multimodal#agent-memory#agent-routing
SensorLM: Learning the language of wearable sensors
Article2025년 7월 28일

SensorLM: Learning the language of wearable sensors

센서엘엠은 5,970만 시간의 웨어러블 센서 데이터와 자동 생성 설명문을 학습해 신체 신호를 자연어로 해석하고 검색·분류·설명하는 센서 언어 기반 모델군이다.

research.google
#ai-architecture#multimodal#llm#semiconductors
Model ML is helping financial firms rebuild with AI from the ground up
Article2025년 7월 23일

Model ML is helping financial firms rebuild with AI from the ground up

Model ML은 금융 업무에 특화된 AI 에이전트와 애플리케이션으로 리서치, 분석, 발표자료 작성 같은 복잡한 워크플로를 자동화하며 금융사의 운영 구조 자체를 AI 중심으로 재편하고 있다.

openai.com
#service-design#ai-architecture#multimodal#agent-routing
TimeScope: How Long Can Your Video Large Multimodal Model Go?
Article2025년 7월 23일

TimeScope: How Long Can Your Video Large Multimodal Model Go?

TimeScope는 1분부터 8시간까지의 영상에 짧은 동영상 클립을 삽입해 검색·정보 종합·세밀한 시간 지각 능력을 측정하며, 최신 비전 언어 모델의 장시간 영상 이해가 아직 제한적임을 보여주는 오픈소스 벤치마크다.

huggingface.co
#multimodal#llm#semiconductors#vision-language-models
The AI tools for Art Newsletter - Issue 1
Article2025년 7월 16일

The AI tools for Art Newsletter - Issue 1

2024년 창작 AI는 오픈소스 이미지 생성의 구조적 도약과 개인화 기술의 대중화를 이뤘으며, 2025년에는 비디오·오디오·3D 등 더 다양한 형식으로 발전의 중심이 이동하고 있다.

huggingface.co
#ai-architecture#multimodal#agent-memory#agent-routing
Efficient MultiModal Data Pipeline
Article2025년 7월 14일

Efficient MultiModal Data Pipeline

멀티모달 학습의 GPU 유휴 시간과 과도한 패딩을 줄이기 위해, 데이터셋 분석부터 토큰·이미지 제약을 함께 고려하는 균형 잡힌 배낭식 배치 구성까지 단계적으로 개선한 사례다.

huggingface.co
#multimodal#agent-routing#ai-infrastructure#capex-cycle
Building the Hugging Face MCP Server
Article2025년 7월 10일

Building the Hugging Face MCP Server

허깅페이스는 사용자가 도구와 Gradio 애플리케이션을 맞춤 구성할 수 있는 공식 MCP 서버를 구축하면서, 변화가 빠른 MCP 전송 규격 가운데 상태 비저장·직접 응답 방식의 Streamable HTTP를 운영 환경에 선택한 이유와 실제 배포 경험을 설명한다.

huggingface.co
#multimodal#agent-deployment#llm#semiconductors
Reachy Mini - The Open-Source Robot for Today's and Tomorrow's AI Builders
Article2025년 7월 9일

Reachy Mini - The Open-Source Robot for Today's and Tomorrow's AI Builders

Reachy Mini는 Pollen Robotics와 Hugging Face가 공개한 데스크톱 크기의 오픈소스 로봇으로, 인간 로봇 상호작용과 AI 실험을 Python 기반으로 쉽게 시도하도록 설계된 제품입니다.

huggingface.co
#privacy-design#multimodal#llm#semiconductors
Training and Finetuning Reranker Models with Sentence Transformers
Article2025년 7월 5일

Training and Finetuning Reranker Models with Sentence Transformers

이 글은 Sentence Transformers로 reranker 또는 Cross Encoder 모델을 도메인 데이터에 맞게 학습·파인튜닝하는 구성요소, 데이터 형식, hard negative mining의 중요성을 설명하고, 저자가 학습한 ModernBERT 기반 reranker가 자신의 평가 데이터에서 기존 공개 모델들을 앞섰다고 소개한다.

huggingface.co
#multimodal#capex-cycle#llm#vision-language-models
Genspark ships no-code personal agents with GPT-4.1 and OpenAI Realtime API
Article2025년 7월 1일

Genspark ships no-code personal agents with GPT-4.1 and OpenAI Realtime API

Genspark는 검색 중심 제품에서 벗어나 OpenAI 멀티모달 모델과 Realtime API를 기반으로 텍스트·이미지·음성 작업을 자동화하는 노코드 개인 에이전트 Super Agent를 출시했고, 출시 45일 만에 ARR 3,600만 달러에 도달했다.

openai.com
#genspark#super-agent#gpt-4-1#openai-realtime-api
이전1…4567896 / 9다음