Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#multimodal
Tag193건YouTube 3Article 190

#multimodal

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#vision-language-models공동문서 179 · 연관도 95%#llm공동문서 173 · 연관도 34%#ai-architecture공동문서 81 · 연관도 27%#semiconductors공동문서 115 · 연관도 24%#agent-routing공동문서 76 · 연관도 23%#agent-memory공동문서 66 · 연관도 20%#nvidia공동문서 47 · 연관도 17%#service-design공동문서 40 · 연관도 15%#workflow-automation공동문서 25 · 연관도 15%#capex-cycle공동문서 32 · 연관도 14%
Introducing next-generation audio models in the API
Article2025년 3월 20일

Introducing next-generation audio models in the API

OpenAI는 음성 에이전트 구축을 위해 더 정확한 음성 텍스트 모델과 조절 가능한 텍스트 음성 모델을 API에 출시했다.

openai.com
#service-design#multimodal#ai-safety#llm
Apple innovation and execution — Benedict Evans
Article2025년 3월 14일

Apple innovation and execution — Benedict Evans

베네딕트 에번스는 애플이 여전히 막대한 수익을 내지만, 비전 프로와 새 Siri 지연을 통해 ‘혁신 부족’보다 더 심각한 실행력 저하의 징후가 드러났다고 진단한다.

ben-evans.com
#apple-silicon#multimodal#ai-distribution#capex-cycle
HuggingFace, IISc partner to supercharge model building on India's diverse languages
Article2025년 2월 27일

HuggingFace, IISc partner to supercharge model building on India's diverse languages

허깅페이스와 인도과학원·아트파크는 인도 전역의 언어·방언·지역·인구통계적 다양성을 담은 오픈소스 다중양식 데이터셋 ‘바니’의 접근성과 활용성을 높이기 위해 협력한다.

huggingface.co
#multimodal#llm#semiconductors#vision-language-models
Visual Document Retrieval Goes Multilingual
Article2025년 2월 26일

Visual Document Retrieval Goes Multilingual

LlamaIndex는 문서 화면을 OCR 없이 단일 벡터로 표현하는 다국어 검색 모델과 약 50만 건 규모의 공개 학습 데이터를 선보였으며, 검색 성능·추론 속도·언어 간 검색·저장 효율을 함께 개선했다.

huggingface.co
#multimodal#agent-memory#capex-cycle#retrieval-index
Rogo scales AI-driven financial research with OpenAI o1
Article2025년 2월 13일

Rogo scales AI-driven financial research with OpenAI o1

기업용 금융 인공지능 플랫폼 로고는 오픈AI o1을 비롯한 모델과 대규모 금융 데이터를 결합해 문서 조사, 실사, 분석 자료 작성을 자동화하고 금융 전문가가 고부가가치 의사결정에 집중하도록 지원한다.

openai.com
#openai#ai-architecture#multimodal#llm
nanoVLM: The simplest repository to train your VLM in pure PyTorch
Article2025년 2월 6일

nanoVLM: The simplest repository to train your VLM in pure PyTorch

nanoVLM은 SigLIP 비전 인코더와 Llama 3 계열 언어 구조를 간결한 순수 PyTorch 코드로 연결해, 시각 질의응답용 VLM의 구성부터 학습·평가·추론까지 직접 익힐 수 있게 만든 경량 툴킷이다.

huggingface.co
#ai-architecture#multimodal#agent-routing#ai-infrastructure
DABStep: Data Agent Benchmark for Multi-step Reasoning
Article2025년 2월 4일

DABStep: Data Agent Benchmark for Multi-step Reasoning

DABstep은 실제 결제 데이터 분석 업무에서 나온 450개 이상의 과제를 통해, 현재 LLM 기반 데이터 에이전트가 다단계 추론·도메인 이해·코드 실행을 결합한 현실적 분석 문제를 얼마나 해결할 수 있는지 평가하는 벤치마크입니다.

huggingface.co
#multimodal#agent-routing#llm#semiconductors
Introducing deep research
Article2025년 2월 2일

Introducing deep research

딥 리서치는 복잡한 질문을 위해 수백 개의 온라인 자료를 자율적으로 탐색·분석·종합하고, 출처가 명시된 연구 보고서를 수십 분 안에 작성하는 ChatGPT의 에이전트형 연구 기능이다.

openai.com
#multimodal#llm#semiconductors#vision-language-models
Reinforcement Learning Heats Up, White House Orders Muscular AI Policy, and more...
Article2025년 1월 29일

Reinforcement Learning Heats Up, White House Orders Muscular AI Policy, and more...

DeepSeek R1의 공개는 중국 생성 AI의 추격, 오픈 웨이트 모델의 공급망 중요성, 기반 모델 가격 하락, 그리고 강화학습 기반 추론 모델·컴퓨터 사용 에이전트의 부상을 동시에 부각시켰다.

@DeepLearningAI
#anthropic#service-design#ai-architecture#multimodal
We now support VLMs in smolagents!
Article2025년 1월 24일

We now support VLMs in smolagents!

smolagents에 비전 지원이 추가되어 VLM을 에이전트 파이프라인에서 기본적으로 활용하고, 특히 웹 브라우징처럼 시각 정보가 중요한 작업을 수행할 수 있게 되었습니다.

huggingface.co
#multimodal#agent-memory#context-compression#retrieval-index
Computer-Using Agent
Article2025년 1월 23일

Computer-Using Agent

OpenAI의 Computer Using Agent(CUA)는 화면 픽셀을 이해하고 마우스·키보드로 조작하며, Operator가 웹과 컴퓨터 작업을 수행하도록 뒷받침하는 범용 GUI 기반 에이전트 모델이다.

openai.com
#openai#operator#gpt-4o#computer-using-agent
Operator System Card
Article2025년 1월 23일

Operator System Card

오퍼레이터는 화면을 보고 브라우저를 조작하는 컴퓨터 사용 에이전트로, 오픈AI는 실제 행동에서 발생할 수 있는 피해를 줄이기 위해 위험 작업 거부, 중요 행동 전 사용자 확인, 외부 레드팀, 프런티어 위험 평가를 결합한 다층 안전 체계를 적용했다.

openai.com
#openai#privacy-design#multimodal#context-compression
Vision Language Models (Better, faster, stronger)
Article2025년 1월 12일

Vision Language Models (Better, faster, stronger)

지난 1년간 비전 언어 모델은 다중 모달 입출력, 추론, 소형화, 전문가 혼합 구조, 로봇 행동 제어와 전통적 시각 작업의 통합을 중심으로 더 강력하고 효율적인 형태로 발전했다.

huggingface.co
#privacy-design#ai-architecture#multimodal#agent-deployment
Mastering Long Contexts in LLMs with KVPress
Article2024년 12월 21일

Mastering Long Contexts in LLMs with KVPress

KVPress는 긴 문맥에서 선형으로 증가하는 키·값 캐시를 중요도 기반으로 압축해 메모리 사용량을 줄이고 생성 속도를 높이는 모듈형 도구다.

huggingface.co
#ai-architecture#multimodal#agent-memory#context-compression
Sora System Card
Article2024년 12월 9일

Sora System Card

Sora는 텍스트·이미지·영상을 입력받아 최대 1080p·20초 영상을 생성하거나 편집하는 모델이며, OpenAI는 데이터 필터링, 외부 레드팀, 내부 평가, 입출력 분류기와 제품 제한을 결합해 오용 위험을 줄이고자 했다.

openai.com
#openai#privacy-design#ai-architecture#multimodal
OpenAI o1 System Card
Article2024년 12월 5일

OpenAI o1 System Card

OpenAI o1 계열은 강화학습 기반의 숙고형 추론으로 안전 정책 준수와 탈옥 공격 저항성을 높였지만, 향상된 지능이 새로운 위험을 만들 수 있어 지속적인 정렬·스트레스 테스트·위험 관리가 필요하다.

openai.com
#openai#privacy-design#service-design#multimodal
Welcome PaliGemma 2 – New vision language models by Google
Article2024년 12월 5일

Welcome PaliGemma 2 – New vision language models by Google

PaliGemma 2는 SigLIP 이미지 인코더와 Gemma 2 언어 모델을 결합하고, 3B·10B·28B 규모와 세 가지 해상도, 간편한 미세조정 및 양자화 지원을 제공하는 구글의 새로운 오픈 비전 언어 모델 제품군이다.

huggingface.co
#hotel-review#service-design#multimodal#search-advertising
Bringing Robotics AI to Embedded Platforms: Dataset Recording, VLA Fine‑Tuning, and On‑Device Optimizations
Article2024년 11월 28일

Bringing Robotics AI to Embedded Platforms: Dataset Recording, VLA Fine‑Tuning, and On‑Device Optimizations

NXP는 로봇 VLA를 임베디드 플랫폼에 배포하기 위해 신뢰도 높은 데이터셋 수집, ACT·SmolVLA 미세조정, i.MX 95에서의 모델 분해·양자화·비동기 추론 최적화가 함께 필요하다고 설명한다.

huggingface.co
#multimodal#agent-deployment#agent-memory#context-compression
Rox goes “all in” on OpenAI
Article2024년 11월 19일

Rox goes “all in” on OpenAI

록스는 오픈AI의 모델과 API를 기반으로 데이터, 영업 흐름, 상시 작동 에이전트를 결합한 맞춤형 매출 운영 플랫폼을 구축하고 기업 고객 확대와 영업 생산성 향상을 이루고 있다.

openai.com
#openai#agent-swarms#multimodal#agent-deployment
Letting Large Models Debate: The First Multilingual LLM Debate Competition
Article2024년 11월 13일

Letting Large Models Debate: The First Multilingual LLM Debate Competition

BAAI는 정적 벤치마크와 사용자 투표형 아레나의 한계를 보완하기 위해 대형 언어모델들이 다국어로 직접 토론하며 추론력·논증력·언어 능력을 드러내는 FlagEval Debate를 제안한다.

huggingface.co
#anthropic#multimodal#context-compression#prompt-library
Welcome the NVIDIA Llama Nemotron Nano VLM to Hugging Face Hub
Article2024년 9월 25일

Welcome the NVIDIA Llama Nemotron Nano VLM to Hugging Face Hub

엔비디아 라마 네모트론 나노 VL은 복잡한 문서의 문자·표·차트·수식·배치를 정밀하게 인식하고 위치 정보까지 제공하도록 설계된 80억 매개변수급 시각언어모델이다.

huggingface.co
#nvidia#ai-architecture#multimodal#agent-routing
Train 400x faster Static Embedding Models with Sentence Transformers
Article2024년 8월 9일

Train 400x faster Static Embedding Models with Sentence Transformers

이 글은 Sentence Transformers로 정적 임베딩 모델을 현대식 대조학습과 Matryoshka Representation Learning으로 학습해 CPU 추론 속도를 기존 주요 임베딩 모델보다 100~400배 높이면서도 여러 벤치마크에서 성능의 상당 부분을 유지하는 방법을 소개한다.

huggingface.co
#luxury-hospitality#luxury-travel#ai-architecture#multimodal
Training and Finetuning Sparse Embedding Models with Sentence Transformers
Article2024년 2월 19일

Training and Finetuning Sparse Embedding Models with Sentence Transformers

이 글은 Sentence Transformers로 희소 임베딩 모델을 미세조정하는 이유와 기본 구성요소를 설명하며, SPLADE 계열 모델의 해석 가능성·확장 방식·도메인 적응 필요성을 실용 예제로 보여준다.

huggingface.co
#ai-architecture#multimodal#llm#vision-language-models
No GPU left behind: Unlocking Efficiency with Co-located vLLM in TRL
Article2024년 2월 5일

No GPU left behind: Unlocking Efficiency with Co-located vLLM in TRL

TRL의 co located vLLM은 GRPO의 학습과 생성을 동일한 GPU·분산 프로세스 그룹에서 번갈아 실행해 유휴 시간과 통신 비용을 줄이며, 모델 크기와 텐서 병렬화 설정에 따라 최대 1.73배의 처리량 향상을 보였다.

huggingface.co
#ai-architecture#multimodal#agent-routing#capex-cycle
이전1…67898 / 9다음