Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#multimodal
Tag193건YouTube 3Article 190

#multimodal

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#vision-language-models공동문서 179 · 연관도 95%#llm공동문서 173 · 연관도 34%#ai-architecture공동문서 81 · 연관도 27%#semiconductors공동문서 115 · 연관도 24%#agent-routing공동문서 76 · 연관도 23%#agent-memory공동문서 66 · 연관도 20%#nvidia공동문서 47 · 연관도 17%#service-design공동문서 40 · 연관도 15%#workflow-automation공동문서 25 · 연관도 15%#capex-cycle공동문서 32 · 연관도 14%
Gemini 3.5: frontier intelligence with action
Article2026년 5월 19일

Gemini 3.5: frontier intelligence with action

Google은 복잡한 에이전트형 업무와 코딩 실행을 겨냥한 Gemini 3.5 제품군을 소개하며, 첫 모델인 3.5 Flash를 전 세계 사용자·개발자·기업에 제공한다고 발표했다.

blog.google
#multimodal#agent-deployment#agent-routing#search-advertising
Make your ZeroGPU Spaces go brrr with ahead-of-time compilation
Article2026년 5월 15일

Make your ZeroGPU Spaces go brrr with ahead-of-time compilation

ZeroGPU의 짧게 생성되는 GPU 프로세스에서는 실행 시점 컴파일보다 모델을 한 번 미리 컴파일하고 즉시 다시 불러오는 PyTorch 사전 컴파일이 적합하며, 생성 모델의 추론 속도를 최대 1.8배까지 높일 수 있다.

huggingface.co
#multimodal#agent-routing#ai-infrastructure#capex-cycle
Researchers Worldwide Compete to Shape the Future of AI in Organizations
Article2026년 5월 12일

Researchers Worldwide Compete to Shape the Future of AI in Organizations

스탠퍼드 HAI와 Google DeepMind는 조직 내 AI 활용이 팀워크와 협업을 어떻게 바꿀지 연구하기 위해 국제 공모전을 열었고, 우승팀은 성공적인 조정 과정을 학습하는 ‘대규모 조정 모델’을 제안했다.

hai.stanford.edu
#ai-architecture#multimodal#search-advertising#zero-click-search
Seedance Makes A Splash, Nvidia's AI-Guided Chip Designs, Helping Robots Not Forget
Article2026년 5월 8일

Seedance Makes A Splash, Nvidia's AI-Guided Chip Designs, Helping Robots Not Forget

본문은 AI 대량실업론에 대한 반박으로 시작해 ByteDance의 Seedance 2.0 확산과 Nvidia의 AI 기반 칩 설계 활용 사례를 다룬다.

deeplearning.ai
#nvidia#privacy-design#service-design#ai-architecture
Parloa builds service agents customers want to talk to
Article2026년 5월 7일

Parloa builds service agents customers want to talk to

Parloa는 OpenAI 모델을 활용해 기업용 음성 고객서비스 에이전트를 설계, 시뮬레이션, 평가, 운영하는 AMP 플랫폼을 구축하고 있으며, 실제 운영 환경에서의 신뢰성·지연시간·일관성을 핵심 기준으로 삼고 있다.

openai.com
#openai#parloa#speech-recognition#gpt-5-4
Boosting multimodal inference performance by >10% with a single Python dictionary
Article2026년 5월 4일

Boosting multimodal inference performance by >10% with a single Python dictionary

Modal은 SGLang의 멀티모달 추론 스케줄러에서 반복적인 CUDA IPC 핸들 열기 비용을 Python dict 캐시로 제거해 Qwen2.5 VL 3B Instruct 단일 H100 벤치마크에서 처리량 16.2%, 평균 지연 10% 이상 개선했다고 설명한다.

Modal
#modal#pytorch#sglang#cuda-ipc
Granite Embedding Multilingual R2: Open Apache 2.0 Multilingual Embeddings with 32K Context — Best Sub-100M Retrieval Quality
Article2026년 5월 4일

Granite Embedding Multilingual R2: Open Apache 2.0 Multilingual Embeddings with 32K Context — Best Sub-100M Retrieval Quality

IBM의 Granite Embedding Multilingual R2는 200개 이상의 언어와 32K 토큰 문맥을 지원하며, 97M 소형 모델과 311M 고성능 모델로 다국어·장문·코드 검색의 성능과 배포 효율을 함께 높인 Apache 2.0 임베딩 모델군이다.

huggingface.co
#ai-architecture#multimodal#agent-memory#retrieval-index
Catalyzing scientific impact through global partnerships and open resources
Article2026년 5월 1일

Catalyzing scientific impact through global partnerships and open resources

Google Research Science 팀은 책임 있고 포용적인 개방 과학 원칙 아래 오픈소스 도구, 공개 데이터셋, 글로벌 파트너십을 통해 유전체학·뇌과학·기후·보건·생물다양성 분야의 실제 연구 성과와 사회적 영향을 확장하고 있다고 설명한다.

research.google
#ai-architecture#multimodal#agent-routing#search-advertising
GPT-5.5 Outperforms (and Hallucinates), Kimi K2.6 Leads Open LLMs, AI Strains Climate Pledges, and more...
Article2026년 5월 1일

GPT-5.5 Outperforms (and Hallucinates), Kimi K2.6 Leads Open LLMs, AI Strains Climate Pledges, and more...

글은 최신 AI 모델 사용법 교육 안내를 시작으로, GPT 5.5의 높은 벤치마크 성과와 환각 문제, 대형 AI 기업의 데이터센터 확장으로 흔들리는 탄소 감축 약속, 그리고 오픈 가중치 모델 Kimi K2.6의 경쟁력을 함께 다룬다.

@DeepLearningAI
#kimi-k2-5#anthropic#agent-swarms#service-design
Granite 4.0 3B Vision: Compact Multimodal Intelligence for Enterprise Documents
Article2026년 4월 30일

Granite 4.0 3B Vision: Compact Multimodal Intelligence for Enterprise Documents

Granite 4.0 3B Vision은 복잡한 기업 문서의 표·차트·핵심 값 쌍을 정밀하게 추출하도록 설계된 30억 매개변수급 소형 비전·언어 모델이다.

huggingface.co
#ai-architecture#multimodal#agent-routing#workflow-automation
Demis Hassabis: Agents, AGI & The Next Big Scientific Breakthrough
YouTube2026년 4월 29일

Demis Hassabis: Agents, AGI & The Next Big Scientific Breakthrough

지속 학습, 장기 추론, 기억의 일부 측면은 아직 해결되지 않았고, 이런 능력들은 AGI에 필수적인 구성 요소로 남아 있다

Y Combinator
#alphafold#deepmind#vision-language-models#change-management
Choco automates food distribution with AI agents
Article2026년 4월 27일

Choco automates food distribution with AI agents

Choco는 OpenAI API를 기반으로 이메일·문자·음성·이미지 등 다양한 주문 입력을 구조화된 ERP 주문으로 자동 변환하며, 글로벌 식품 유통망의 수작업 병목을 줄이고 상시 운영 체계를 구축하고 있다.

openai.com
#choco#orderagent#voiceagent#openai-api
GLM 5.1 Thinks Strategically, Data-Center Revolt Intensifies, When Helpful LLMs Turn Unhelpful, and more...
Article2026년 4월 24일

GLM 5.1 Thinks Strategically, Data-Center Revolt Intensifies, When Helpful LLMs Turn Unhelpful, and more...

본문은 코딩 에이전트가 프론트엔드에는 큰 가속을 주지만 백엔드·인프라·연구로 갈수록 한계가 커진다는 판단과, 장시간 자율 작업을 지향하는 GLM 5.1 및 초기 산업 현장의 휴머노이드 로봇 배치를 다룬다.

@DeepLearningAI
#anthropic#ai-architecture#multimodal#agent-routing
The PR you would have opened yourself
Article2026년 4월 16일

The PR you would have opened yourself

transformers 모델을 mlx lm으로 빠르고 정확하게 이식하도록 돕는 스킬과 비에이전트 테스트 하네스를 구축하되, 코드 소유권과 최종 판단은 기여자와 리뷰어에게 남겨 두는 접근을 설명한다.

huggingface.co
#privacy-design#ai-architecture#multimodal#llm
Training and Finetuning Multimodal Embedding & Reranker Models with Sentence Transformers
Article2026년 4월 16일

Training and Finetuning Multimodal Embedding & Reranker Models with Sentence Transformers

이 글은 Sentence Transformers로 텍스트와 이미지 등 여러 모달리티를 다루는 임베딩 모델을 자체 데이터에 맞게 파인튜닝하는 방법을, 시각 문서 검색 사례를 중심으로 설명합니다.

huggingface.co
#ai-architecture#multimodal#llm#vision-language-models
Introducing Fire-PDF: Firecrawl's New PDF Parsing Engine
Article2026년 4월 14일

Introducing Fire-PDF: Firecrawl's New PDF Parsing Engine

Firecrawl은 PDF를 구조화된 마크다운으로 더 빠르고 정확하게 변환하기 위해 Rust 기반 새 PDF 파싱 엔진 Fire PDF를 출시했으며, 모든 API PDF 처리에 자동 적용한다고 밝혔다.

Eric Ciarla
#multimodal#ai-infrastructure#capex-cycle#llm
State of Open Source on Hugging Face: Spring 2026
Article2026년 4월 14일

State of Open Source on Hugging Face: Spring 2026

허깅페이스의 오픈소스 인공지능 생태계는 사용자·모델·데이터셋과 파생 창작물이 급증한 가운데, 중국과 독립 개발자의 영향력 확대, 소형 모델 중심의 실용적 채택, 국가 주권과 지역 생태계의 부상을 동시에 보여준다.

huggingface.co
#ai-architecture#multimodal#agent-deployment#agent-routing
Open ASR Leaderboard: Trends and Insights with New Multilingual & Long-Form Tracks
Article2026년 4월 13일

Open ASR Leaderboard: Trends and Insights with New Multilingual & Long-Form Tracks

개방형 자동 음성 인식 순위표는 정확도와 처리 속도뿐 아니라 다국어·장문 전사 성능까지 비교하며, 언어 범용성·특화 정확도·처리량 사이의 뚜렷한 상충 관계를 보여준다.

huggingface.co
#multimodal#agent-routing#llm#semiconductors
Anthropic’s Claude Mythos Problem, Dark DNA Unveiled, Pitfalls for Assistive Models, and more...
Article2026년 4월 10일

Anthropic’s Claude Mythos Problem, Dark DNA Unveiled, Pitfalls for Assistive Models, and more...

이 글은 AI 코딩 에이전트가 소프트웨어 엔지니어링과 고용 논의를 바꾸는 흐름을 짚고, Anthropic의 Claude Mythos Preview가 제기한 사이버보안 위험과 시각장애인을 위한 보조 AI의 심리적·사회적 함의를 함께 다룬다.

deeplearning.ai
#anthropic#ai-architecture#multimodal#agent-routing
Multimodal Embedding & Reranker Models with Sentence Transformers
Article2026년 4월 10일

Multimodal Embedding & Reranker Models with Sentence Transformers

Sentence Transformers 5.4는 텍스트·이미지·오디오·비디오를 같은 인터페이스로 임베딩하고, 서로 다른 형식의 입력 쌍을 재평가해 교차 모달 검색과 멀티모달 검색 증강 생성 파이프라인을 구축할 수 있게 한다.

huggingface.co
#service-design#ai-architecture#multimodal#llm
Claude Code’s Source Leaks, OpenAI Exits Video Generation, Gemini Adds Music Generation, and more...
Article2026년 4월 3일

Claude Code’s Source Leaks, OpenAI Exits Video Generation, Gemini Adds Music Generation, and more...

원문은 음성 UI가 AI 애플리케이션의 중요한 인터페이스가 될 것이라는 전망을 중심으로, Claude Code 소스 유출이 드러낸 에이전트 구조와 OpenAI의 Sora 종료 계획을 함께 다룬다.

@DeepLearningAI
#anthropic#openai#claude-code#linear-attention
Welcome Gemma 4: Frontier multimodal intelligence on device
Article2026년 4월 2일

Welcome Gemma 4: Frontier multimodal intelligence on device

Gemma 4는 이미지·텍스트·오디오를 처리하면서 긴 문맥, 추론 효율, 기기 내 배포를 함께 겨냥한 Apache 2.0 기반 개방형 멀티모달 모델군이다.

huggingface.co
#service-design#token-efficiency#multimodal#travel-hospitality
Mapping the modern world: How S2Vec learns the language of our cities
Article2026년 3월 24일

Mapping the modern world: How S2Vec learns the language of our cities

구글 리서치의 S2Vec은 도로·건물·상점 같은 구축환경 데이터를 S2 셀 기반 이미지처럼 변환하고 자기지도 학습으로 임베딩해 전 세계 사회경제·환경 패턴 예측에 활용하는 지리 AI 프레임워크다.

research.google
#privacy-design#multimodal#llm#semiconductors
Attacks On Data Centers, Qwen3.5 In All Sizes, DeepSeek’s Huawei Play, and more...
Article2026년 3월 20일

Attacks On Data Centers, Qwen3.5 In All Sizes, DeepSeek’s Huawei Play, and more...

이 글은 AI 발전과 지정학적 불확실성 속에서 커뮤니티와 기술 역량을 안정적 기반으로 삼아야 한다는 메시지와 함께, 데이터센터 공격 및 Qwen3.5 공개가 보여주는 AI 인프라·모델 경쟁의 변화를 다룬다.

deeplearning.ai
#anthropic#privacy-design#service-design#ai-architecture
이전12345…93 / 9다음