Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#vision-language-models
Tag181건YouTube 4Article 177

#vision-language-models

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#multimodal공동문서 179 · 연관도 95%#llm공동문서 165 · 연관도 34%#ai-architecture공동문서 78 · 연관도 27%#agent-routing공동문서 73 · 연관도 23%#semiconductors공동문서 105 · 연관도 22%#agent-memory공동문서 64 · 연관도 20%#nvidia공동문서 45 · 연관도 16%#workflow-automation공동문서 24 · 연관도 15%#capex-cycle공동문서 31 · 연관도 14%#service-design공동문서 36 · 연관도 14%
From massive models to mobile magic: The tech behind YouTube real-time generative AI effects
Article2025년 8월 21일

From massive models to mobile magic: The tech behind YouTube real-time generative AI effects

YouTube는 대형 생성 모델의 효과를 지식 증류로 작고 빠른 학생 모델에 옮기고 MediaPipe 기반 온디바이스 파이프라인으로 최적화해 Shorts에서 실시간 생성형 AI 효과를 구현했다.

research.google
#ai-architecture#multimodal#ai-infrastructure#capex-cycle
Finetuning olmOCR to be a faithful OCR-Engine
Article2025년 8월 19일

Finetuning olmOCR to be a faithful OCR-Engine

TNG는 머리말과 꼬리말을 의도적으로 생략하던 olmOCR를 8,000개 문서로 미세조정해, 문서의 논리적 읽기 순서를 유지하면서 업무상 중요한 주변 정보까지 충실하게 추출하는 OCR 모델로 개선했다.

huggingface.co
#multimodal#agent-memory#agent-routing#retrieval-index
Vision Language Model Alignment in TRL ⚡️
Article2025년 8월 16일

Vision Language Model Alignment in TRL ⚡️

TRL은 비전 언어 모델 정렬을 기존 SFT·DPO에서 MPO·GRPO·GSPO와 RLOO·Online DPO까지 확장해, 멀티모달 선호 학습과 강화학습을 더 유연하게 적용할 수 있도록 지원한다.

huggingface.co
#multimodal#capex-cycle#llm#semiconductors
Introducing GPT‑5 for developers
Article2025년 8월 7일

Introducing GPT‑5 for developers

GPT‑5는 코딩 정확도와 도구 호출, 지시 이행, 장문 맥락 검색을 함께 개선하고 개발자가 응답 방식과 추론 수준을 조절할 수 있게 설계된 OpenAI의 API용 추론 모델이다.

openai.com
#openai#long-context#privacy-design#service-design
Introducing GPT-5
Article2025년 8월 7일

Introducing GPT-5

GPT‑5는 빠른 응답과 심층 추론을 실시간으로 조합해 코딩·수학·글쓰기·건강·멀티모달 과제의 성능을 높이고, 환각과 과도한 확신을 줄인 OpenAI의 통합형 AI 시스템이다.

openai.com
#openai#privacy-design#multimodal#ai-safety
Introducing gpt-oss
Article2025년 8월 5일

Introducing gpt-oss

오픈AI는 높은 추론·도구 사용 성능과 효율적인 로컬 실행을 결합한 아파치 2.0 기반 오픈 웨이트 모델 gpt oss 120b와 gpt oss 20b를 공개했다.

openai.com
#ai-architecture#multimodal#agent-memory#agent-routing
SensorLM: Learning the language of wearable sensors
Article2025년 7월 28일

SensorLM: Learning the language of wearable sensors

센서엘엠은 5,970만 시간의 웨어러블 센서 데이터와 자동 생성 설명문을 학습해 신체 신호를 자연어로 해석하고 검색·분류·설명하는 센서 언어 기반 모델군이다.

research.google
#ai-architecture#multimodal#llm#semiconductors
Model ML is helping financial firms rebuild with AI from the ground up
Article2025년 7월 23일

Model ML is helping financial firms rebuild with AI from the ground up

Model ML은 금융 업무에 특화된 AI 에이전트와 애플리케이션으로 리서치, 분석, 발표자료 작성 같은 복잡한 워크플로를 자동화하며 금융사의 운영 구조 자체를 AI 중심으로 재편하고 있다.

openai.com
#service-design#ai-architecture#multimodal#agent-routing
TimeScope: How Long Can Your Video Large Multimodal Model Go?
Article2025년 7월 23일

TimeScope: How Long Can Your Video Large Multimodal Model Go?

TimeScope는 1분부터 8시간까지의 영상에 짧은 동영상 클립을 삽입해 검색·정보 종합·세밀한 시간 지각 능력을 측정하며, 최신 비전 언어 모델의 장시간 영상 이해가 아직 제한적임을 보여주는 오픈소스 벤치마크다.

huggingface.co
#multimodal#llm#semiconductors#vision-language-models
The AI tools for Art Newsletter - Issue 1
Article2025년 7월 16일

The AI tools for Art Newsletter - Issue 1

2024년 창작 AI는 오픈소스 이미지 생성의 구조적 도약과 개인화 기술의 대중화를 이뤘으며, 2025년에는 비디오·오디오·3D 등 더 다양한 형식으로 발전의 중심이 이동하고 있다.

huggingface.co
#ai-architecture#multimodal#agent-memory#agent-routing
Efficient MultiModal Data Pipeline
Article2025년 7월 14일

Efficient MultiModal Data Pipeline

멀티모달 학습의 GPU 유휴 시간과 과도한 패딩을 줄이기 위해, 데이터셋 분석부터 토큰·이미지 제약을 함께 고려하는 균형 잡힌 배낭식 배치 구성까지 단계적으로 개선한 사례다.

huggingface.co
#multimodal#agent-routing#ai-infrastructure#capex-cycle
Building the Hugging Face MCP Server
Article2025년 7월 10일

Building the Hugging Face MCP Server

허깅페이스는 사용자가 도구와 Gradio 애플리케이션을 맞춤 구성할 수 있는 공식 MCP 서버를 구축하면서, 변화가 빠른 MCP 전송 규격 가운데 상태 비저장·직접 응답 방식의 Streamable HTTP를 운영 환경에 선택한 이유와 실제 배포 경험을 설명한다.

huggingface.co
#multimodal#agent-deployment#llm#semiconductors
Reachy Mini - The Open-Source Robot for Today's and Tomorrow's AI Builders
Article2025년 7월 9일

Reachy Mini - The Open-Source Robot for Today's and Tomorrow's AI Builders

Reachy Mini는 Pollen Robotics와 Hugging Face가 공개한 데스크톱 크기의 오픈소스 로봇으로, 인간 로봇 상호작용과 AI 실험을 Python 기반으로 쉽게 시도하도록 설계된 제품입니다.

huggingface.co
#privacy-design#multimodal#llm#semiconductors
Training and Finetuning Reranker Models with Sentence Transformers
Article2025년 7월 5일

Training and Finetuning Reranker Models with Sentence Transformers

이 글은 Sentence Transformers로 reranker 또는 Cross Encoder 모델을 도메인 데이터에 맞게 학습·파인튜닝하는 구성요소, 데이터 형식, hard negative mining의 중요성을 설명하고, 저자가 학습한 ModernBERT 기반 reranker가 자신의 평가 데이터에서 기존 공개 모델들을 앞섰다고 소개한다.

huggingface.co
#multimodal#capex-cycle#llm#vision-language-models
Genspark ships no-code personal agents with GPT-4.1 and OpenAI Realtime API
Article2025년 7월 1일

Genspark ships no-code personal agents with GPT-4.1 and OpenAI Realtime API

Genspark는 검색 중심 제품에서 벗어나 OpenAI 멀티모달 모델과 Realtime API를 기반으로 텍스트·이미지·음성 작업을 자동화하는 노코드 개인 에이전트 Super Agent를 출시했고, 출시 45일 만에 ARR 3,600만 달러에 도달했다.

openai.com
#genspark#super-agent#gpt-4-1#openai-realtime-api
Exploring Quantization Backends in Diffusers
Article2025년 6월 27일

Exploring Quantization Backends in Diffusers

Diffusers는 Flux의 핵심 구성 요소를 여러 백엔드로 양자화해 이미지 품질을 크게 훼손하지 않으면서 메모리 사용량을 줄일 수 있으며, 정밀도와 백엔드에 따라 속도·메모리·사용 편의성의 차이가 뚜렷하다.

huggingface.co
#ai-architecture#multimodal#agent-memory#context-compression
Transformers backend integration in SGLang
Article2025년 6월 23일

Transformers backend integration in SGLang

SGLang은 트랜스포머스 호환 모델을 자동 대체 백엔드로 실행해 폭넓은 모델 접근성과 고성능 추론·배포 기능을 결합합니다.

huggingface.co
#multimodal#agent-memory#context-compression#retrieval-index
Holo1: New family of GUI automation VLMs powering GUI agent Surfer-H
Article2025년 6월 9일

Holo1: New family of GUI automation VLMs powering GUI agent Surfer-H

H Company는 웹 UI를 이해하고 클릭 위치를 정밀하게 찾는 오픈소스 액션 비전 언어 모델 Holo1과 1,639개 UI 과제로 구성된 WebClick 벤치마크를 공개했으며, 이를 기반으로 브라우저 자동화 에이전트 Surfer H를 구동한다고 밝혔다.

huggingface.co
#ai-architecture#multimodal#workflow-automation#llm
KV Cache from scratch in nanoVLM
Article2025년 6월 4일

KV Cache from scratch in nanoVLM

나노브이엘엠에 계층별 키·값 캐시와 사전 채움·순차 해독 구조를 직접 구현해, 자기회귀 생성의 중복 계산을 줄이고 생성 속도를 38% 높인 과정과 원리를 설명한다.

huggingface.co
#ai-architecture#multimodal#agent-memory#retrieval-index
Introducing AutoRound: Intel’s Advanced Quantization for LLMs and VLMs
Article2025년 5월 27일

Introducing AutoRound: Intel’s Advanced Quantization for LLMs and VLMs

AutoRound는 가중치 반올림과 클리핑 범위를 함께 최적화해 낮은 비트에서도 정확도를 유지하면서 빠른 양자화와 폭넓은 모델·장치·출력 형식 호환성을 제공하는 인텔의 가중치 전용 학습 후 양자화 도구다.

huggingface.co
#multimodal#agent-deployment#ai-infrastructure#capex-cycle
Welcome Llama 4 Maverick & Scout on Hugging Face
Article2025년 5월 22일

Welcome Llama 4 Maverick & Scout on Hugging Face

Meta의 네이티브 멀티모달 MoE 모델 Llama 4 Maverick과 Scout가 출시 당일부터 Hugging Face Hub, Transformers, TGI, 양자화 및 Xet 저장소를 통해 제공되며, 최대 1천만 토큰 문맥과 강력한 추론·이미지·코딩 성능을 지원한다.

huggingface.co
#ai-architecture#multimodal#agent-deployment#agent-routing
LeRobot Community Datasets: The “ImageNet” of Robotics — When and How?
Article2025년 5월 11일

LeRobot Community Datasets: The “ImageNet” of Robotics — When and How?

로봇의 범용화는 모델 구조만의 문제가 아니라 다양한 환경·과제·기체에서 수집된 고품질 데이터를 함께 학습하는 문제이며, LeRobot 공동체는 개방형 로봇 데이터 생태계를 통해 로봇공학의 ‘이미지넷’을 만들어 가고 있다.

huggingface.co
#ai-architecture#multimodal#lerobot#llm
AMIE gains vision: A research AI agent for multimodal diagnostic dialogue
Article2025년 5월 1일

AMIE gains vision: A research AI agent for multimodal diagnostic dialogue

구글 리서치와 딥마인드는 시각 자료를 요청·해석·추론할 수 있는 다중모달 진단 대화 AI 에이전트 AMIE를 공개하고, 시뮬레이션 진료 평가에서 1차 진료의와 비교한 연구 결과를 제시했다.

Google
#google-deepmind#google-research#primary-care-physicians#multimodal
Falcon-Edge: A series of powerful, universal, fine-tunable 1.58bit language models.
Article2025년 5월 1일

Falcon-Edge: A series of powerful, universal, fine-tunable 1.58bit language models.

Falcon Edge는 하나의 사전학습 과정에서 범용 bfloat16 모델, 삼진 가중치 기반 BitNet 모델, 미세조정용 사전 양자화 모델을 함께 제공하는 1.58비트 언어 모델 시리즈다.

huggingface.co
#ai-architecture#multimodal#llm#vision-language-models
이전1…456786 / 8다음