Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#vision-language-models
Tag181건YouTube 4Article 177

#vision-language-models

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#multimodal공동문서 179 · 연관도 95%#llm공동문서 165 · 연관도 34%#ai-architecture공동문서 78 · 연관도 27%#agent-routing공동문서 73 · 연관도 23%#semiconductors공동문서 105 · 연관도 22%#agent-memory공동문서 64 · 연관도 20%#nvidia공동문서 45 · 연관도 16%#workflow-automation공동문서 24 · 연관도 15%#capex-cycle공동문서 31 · 연관도 14%#service-design공동문서 36 · 연관도 14%
From PDFs to insights: Architecting an intelligent document processing pipeline with AWS generative AI services
Article2026년 6월 12일

From PDFs to insights: Architecting an intelligent document processing pipeline with AWS generative AI services

이 글은 기존 OCR의 한계를 넘어 문서의 텍스트·표·시각 요소·문맥을 함께 추출하고, 검색·RAG·에이전트 조정을 결합해 지능형 문서 처리 파이프라인을 구성하는 방식을 설명한다.

aws.amazon.com
#service-design#ai-architecture#multimodal#agent-routing
Extract Data with On-demand and Batch Pipelines Dynamically
Article2026년 6월 11일

Extract Data with On-demand and Batch Pipelines Dynamically

이 글은 스캔 PDF 같은 대량 문서에서 데이터를 추출하기 위해 문서별 모델과 프롬프트를 동적으로 지정할 수 있는 온디맨드·배치 추론 파이프라인 구조를 설명합니다.

aws.amazon.com
#anthropic#service-design#multimodal#agent-routing
OpenAI raises $122 billion to accelerate the next phase of AI
Article2026년 6월 11일

OpenAI raises $122 billion to accelerate the next phase of AI

OpenAI는 1,220억 달러 규모의 신규 자금 조달을 통해 AI의 핵심 인프라 기업으로서 소비자·기업·개발자·컴퓨트가 맞물리는 성장 플라이휠을 더 큰 규모로 확장하겠다고 밝혔다.

openai.com
#openai#ai-architecture#multimodal#agent-routing
Hands-free first notice of loss: Using Strands Agents and Amazon Bedrock AgentCore Browser Tool for intelligent claims intake
Article2026년 6월 9일

Hands-free first notice of loss: Using Strands Agents and Amazon Bedrock AgentCore Browser Tool for intelligent claims intake

이 글은 보험 FNOL 접수에서 사진·영상·문서·음성 메모 같은 비정형 증거를 자동으로 해석·태깅해, 손해사정인이 원자료 검증이 아니라 맥락이 정리된 청구 판단에서 출발하도록 만드는 에이전트 기반 접수 구조를 설명한다.

Amazon Web Services
#amazon-dynamodb#amazon-s3#nova-act#strands-agents
How an Agent Built a 3D Paris Gallery by Chaining Two Hugging Face Spaces
Article2026년 6월 9일

How an Agent Built a 3D Paris Gallery by Chaining Two Hugging Face Spaces

이 글은 코딩 에이전트가 Hugging Face의 두 Gradio Space를 문서화된 호출 인터페이스로 연결해 파리 기념물 이미지를 만들고, 이를 3D Gaussian splat 갤러리로 변환·배포한 과정을 설명한다.

huggingface.co
#gradio#agents-md#hugging-face#hugging-face-spaces
Qwen3.7-Max Challenges Google for Third Place, AI Saves Whales, Fine-Tuning Breaks Copyright Alignment
Article2026년 6월 5일

Qwen3.7-Max Challenges Google for Third Place, AI Saves Whales, Fine-Tuning Breaks Copyright Alignment

이번 글은 AI 규제의 균형 필요성을 논한 뒤, 알리바바 Qwen3.7 Max의 성능·폐쇄화 흐름과 WhaleSpotter가 열화상 AI로 선박 고래 충돌을 줄이는 사례를 정리한다.

@DeepLearningAI
#anthropic#service-design#ai-architecture#multimodal
The latest AI news we announced in May 2026
Article2026년 6월 5일

The latest AI news we announced in May 2026

구글은 2026년 5월 발표를 통해 Gemini 3.5와 Gemini Omni를 중심으로 에이전트형 AI, 검색·안드로이드·쇼핑·헬스·하드웨어·과학 분야 전반에 AI 기능을 확대했다고 정리했다.

Google
#google#gemini-app#gemini-omni#gemini-3-5
Nemotron 3.5 Content Safety: Customizable Multimodal Safety for Global Enterprise AI
Article2026년 6월 4일

Nemotron 3.5 Content Safety: Customizable Multimodal Safety for Global Enterprise AI

Nemotron 3.5 Content Safety는 텍스트·이미지·응답을 함께 평가하고, 다국어 지원과 기업별 정책 적용, 감사 가능한 추론 흔적을 하나의 4B 모델 추론 호출로 통합한 콘텐츠 안전 모델이다.

미상
#mlcommons#nvidia#hugging-face#aegis-2-0
Direct Preference Optimization Beyond Chatbots
Article2026년 6월 3일

Direct Preference Optimization Beyond Chatbots

DharmaOCR는 SFT 모델이 스스로 생성한 반복 퇴화 출력을 DPO의 거부 사례로 활용해, 구조화 OCR에서 모든 실험 모델군의 텍스트 퇴화율을 낮췄다.

huggingface.co
#ai-architecture#multimodal#llm#semiconductors
How to Use Transformers.js in a Chrome Extension
Article2026년 6월 3일

How to Use Transformers.js in a Chrome Extension

Manifest V3 크롬 확장 프로그램에서 모델 실행과 상태 관리는 백그라운드 서비스 워커에 집중하고, 사이드 패널과 콘텐츠 스크립트는 각각 사용자 인터페이스와 웹페이지 조작에 전념하도록 구성하는 Transformers.js 구현 안내서다.

huggingface.co
#privacy-design#service-design#ai-architecture#multimodal
LeRobot v0.4.0: Supercharging OSS Robot Learning
Article2026년 6월 3일

LeRobot v0.4.0: Supercharging OSS Robot Learning

LeRobot v0.4.0은 대규모 데이터셋, 시뮬레이션, 데이터 처리, 분산 학습, 범용 로봇 정책, 하드웨어 플러그인을 하나의 개방형 로봇 학습 생태계로 확장한 릴리스다.

huggingface.co
#multimodal#agent-routing#ai-infrastructure#capex-cycle
New in Deep Agents v0.6
Article2026년 6월 3일

New in Deep Agents v0.6

Deep Agents v0.6은 코드 인터프리터, 하네스 프로필, 스트리밍, 델타 채널, ContextHubBackend를 통해 에이전트의 모델 성능·실행 효율·UI 경험·장기 실행 비용을 개선한 릴리스다.

langchain.com
#anthropic#ai-architecture#multimodal#agent-routing
April 2026: LangChain Newsletter
Article2026년 5월 28일

April 2026: LangChain Newsletter

2026년 4월 LangChain 뉴스레터는 LangSmith 평가·비용·도구 관리 업데이트, Deep Agents 배포 기능, Interrupt 2026 행사, 에이전트 개선 루프 콘텐츠와 고객 사례를 소개한다.

langchain.com
#multimodal#agent-deployment#agent-memory#context-compression
How Higgsfield turns simple ideas into cinematic social videos
Article2026년 5월 27일

How Higgsfield turns simple ideas into cinematic social videos

히그스필드는 사용자의 막연한 창작 의도를 GPT‑4.1과 GPT‑5로 구체적인 영상 설계도로 변환하고, 소라 2로 소셜 플랫폼에 맞는 영화적 영상을 생성한다.

openai.com
#service-design#multimodal#agent-routing#search-advertising
LeRobot goes to driving school: World’s largest open-source self-driving dataset
Article2026년 5월 26일

LeRobot goes to driving school: World’s largest open-source self-driving dataset

L2D는 독일 30개 도시의 운전학원 차량 60대에서 수집한 5,000시간 이상·90테라바이트 이상의 주행 기록을 자연어 지시, 미래 경로점, 차량 제어, 환경 정보와 결합한 대규모 오픈소스 자율주행 데이터셋이다.

huggingface.co
#multimodal#agent-routing#capex-cycle#workflow-automation
Issue 354
Article2026년 5월 22일

Issue 354

원문은 하버드의 A 학점 제한을 비판하며 교육의 목적을 ‘판정’보다 ‘성공 지원’에 두어야 한다고 주장하고, 이어 Hermes Agent의 OpenClaw 추격과 실시간 상호작용형 멀티모달 모델 TML Interaction Small을 소개한다.

@DeepLearningAI
#openclaw#anthropic#token-efficiency#ai-architecture
Build a Domain-Specific Embedding Model in Under a Day
Article2026년 5월 20일

Build a Domain-Specific Embedding Model in Under a Day

이 글은 범용 임베딩 모델이 도메인 특유의 미묘한 차이를 놓칠 때, 합성 질의응답 생성·하드 네거티브 마이닝·멀티홉 학습·대조학습·BEIR 평가를 통해 하루 안에 도메인 특화 임베딩 모델로 미세조정하는 절차를 설명한다.

huggingface.co
#nvidia#ai-architecture#multimodal#agent-memory
A new era for AI Search
Article2026년 5월 19일

A new era for AI Search

구글은 AI Mode 성장세를 바탕으로 검색창, 대화형 탐색, 정보 에이전트, 예약·코딩형 기능, 개인 맥락 연결을 결합한 새로운 AI 검색 경험을 발표했다.

Google
#google#ai-mode#ai-overview#google-search
Gemini 3.5: frontier intelligence with action
Article2026년 5월 19일

Gemini 3.5: frontier intelligence with action

Google은 복잡한 에이전트형 업무와 코딩 실행을 겨냥한 Gemini 3.5 제품군을 소개하며, 첫 모델인 3.5 Flash를 전 세계 사용자·개발자·기업에 제공한다고 발표했다.

blog.google
#multimodal#agent-deployment#agent-routing#search-advertising
Make your ZeroGPU Spaces go brrr with ahead-of-time compilation
Article2026년 5월 15일

Make your ZeroGPU Spaces go brrr with ahead-of-time compilation

ZeroGPU의 짧게 생성되는 GPU 프로세스에서는 실행 시점 컴파일보다 모델을 한 번 미리 컴파일하고 즉시 다시 불러오는 PyTorch 사전 컴파일이 적합하며, 생성 모델의 추론 속도를 최대 1.8배까지 높일 수 있다.

huggingface.co
#multimodal#agent-routing#ai-infrastructure#capex-cycle
20시간째 일하는 모습 생중계 중…Figure 03 라이브가 보여준 휴머노이드의 진짜 시험
YouTube2026년 5월 14일

20시간째 일하는 모습 생중계 중…Figure 03 라이브가 보여준 휴머노이드의 진짜 시험

Figure 03의 장시간 택배 분류 라이브는 휴머노이드 경쟁의 초점이 “멋진 시연”에서 “교대근무·내구성·양산성·경제성 검증”으로 이동하고 있음을 보여줍니다.

안될공학 - IT 테크 신기술
#energy-infrastructure#figure#vision-language-models#cayc
AI 기업들이 대놓고 팔란티어를 베끼기 시작한 충격적인 이유
YouTube2026년 5월 14일

AI 기업들이 대놓고 팔란티어를 베끼기 시작한 충격적인 이유

OpenAI와 Anthropic은 단순히 더 좋은 모델을 파는 단계를 넘어, 팔란티어식 FDE 전략처럼 기업 현장에 들어가 업무를 재설계하고 AI 워크플로우를 제품화하려는 방향으로 움직이고 있다는 것이 영상의 핵심 주장입니다.

묘수의 관점
#energy-infrastructure#ai-safety#anthropic#cayc
Researchers Worldwide Compete to Shape the Future of AI in Organizations
Article2026년 5월 12일

Researchers Worldwide Compete to Shape the Future of AI in Organizations

스탠퍼드 HAI와 Google DeepMind는 조직 내 AI 활용이 팀워크와 협업을 어떻게 바꿀지 연구하기 위해 국제 공모전을 열었고, 우승팀은 성공적인 조정 과정을 학습하는 ‘대규모 조정 모델’을 제안했다.

hai.stanford.edu
#ai-architecture#multimodal#search-advertising#zero-click-search
Parloa builds service agents customers want to talk to
Article2026년 5월 7일

Parloa builds service agents customers want to talk to

Parloa는 OpenAI 모델을 활용해 기업용 음성 고객서비스 에이전트를 설계, 시뮬레이션, 평가, 운영하는 AMP 플랫폼을 구축하고 있으며, 실제 운영 환경에서의 신뢰성·지연시간·일관성을 핵심 기준으로 삼고 있다.

openai.com
#openai#parloa#speech-recognition#gpt-5-4
이전1234…82 / 8다음