Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#vision-language-models
Tag181건YouTube 4Article 177

#vision-language-models

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#multimodal공동문서 179 · 연관도 95%#llm공동문서 165 · 연관도 34%#ai-architecture공동문서 78 · 연관도 27%#agent-routing공동문서 73 · 연관도 23%#semiconductors공동문서 105 · 연관도 22%#agent-memory공동문서 64 · 연관도 20%#nvidia공동문서 45 · 연관도 16%#workflow-automation공동문서 24 · 연관도 15%#capex-cycle공동문서 31 · 연관도 14%#service-design공동문서 36 · 연관도 14%
Welcoming Llama Guard 4 on Hugging Face Hub
Article2025년 4월 29일

Welcoming Llama Guard 4 on Hugging Face Hub

메타가 공개한 라마 가드 4는 텍스트와 이미지를 함께 검사해 유해한 입력과 출력을 분류하는 120억 매개변수의 다국어 안전 모델이며, 프롬프트 주입과 탈옥을 탐지하는 라마 프롬프트 가드 2도 함께 제공된다.

huggingface.co
#privacy-design#ai-architecture#multimodal#agent-memory
Introducing our latest image generation model in the API
Article2025년 4월 23일

Introducing our latest image generation model in the API

OpenAI는 ChatGPT에서 인기를 얻은 이미지 생성 모델을 gpt image 1 API로 제공해, 개발자와 기업이 고품질 이미지 생성·편집 기능을 제품에 직접 통합할 수 있게 했다고 발표했다.

openai.com
#multimodal#ai-safety#llm#semiconductors
SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data
Article2025년 4월 21일

SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data

SmolVLA는 공개 커뮤니티 로봇 데이터로 학습한 4.5억 파라미터 규모의 오픈소스 Vision Language Action 모델로, 저렴한 하드웨어와 소비자급 장비에서도 학습·추론할 수 있도록 설계됐다.

huggingface.co
#lerobot#smolvla#smolvlm2#hugging-face
The Future of the Global Open-Source AI Ecosystem: From DeepSeek to AI+
Article2025년 4월 18일

The Future of the Global Open-Source AI Ecosystem: From DeepSeek to AI+

딥시크 R1 이후 중국의 인공지능 생태계는 오픈소스를 개별 모델 공개가 아닌 연구·인프라·산업 적용을 연결하는 기본 설계 원칙으로 받아들이며 대규모 배포와 통합 중심의 자생적 구조로 전환했다.

huggingface.co
#multimodal#agent-deployment#agent-routing#llm
Introducing OpenAI o3 and o4-mini
Article2025년 4월 16일

Introducing OpenAI o3 and o4-mini

오픈AI o3와 o4 mini는 강화학습으로 추론 능력과 도구 선택 능력을 함께 확장해, 복잡한 문제를 분석하고 웹 검색·파일 처리·파이썬·이미지 생성 등 여러 도구를 연계해 해결하는 모델이다.

openai.com
#openai#multimodal#agent-routing#llm
Thinking with images
Article2025년 4월 16일

Thinking with images

OpenAI o3와 o4 mini는 이미지를 단순히 인식하는 데 그치지 않고, 확대·회전·자르기와 다른 도구를 활용해 시각 정보와 텍스트를 함께 추론하는 모델이다.

openai.com
#openai#privacy-design#multimodal#ai-safety
Hugging Face to sell open-source robots thanks to Pollen Robotics acquisition 🤖
Article2025년 4월 14일

Hugging Face to sell open-source robots thanks to Pollen Robotics acquisition 🤖

허깅페이스는 오픈소스 휴머노이드 로봇 기업 폴렌 로보틱스를 인수하고, 르로봇 생태계와 리치 2를 결합해 개방형 로봇 소프트웨어·하드웨어를 직접 제공하기 시작했다.

huggingface.co
#multimodal#agent-routing#llm#semiconductors
Introducing GPT-4.1 in the API
Article2025년 4월 14일

Introducing GPT-4.1 in the API

오픈AI는 코딩, 지시 이행, 장문 맥락 처리 능력을 크게 개선하면서 비용과 지연 시간도 낮춘 API 전용 모델군 GPT‑4.1, GPT‑4.1 미니, GPT‑4.1 나노를 공개했다.

openai.com
#openai#privacy-design#multimodal#agent-routing
Get your VLM running in 3 simple steps on Intel CPUs
Article2025년 4월 8일

Get your VLM running in 3 simple steps on Intel CPUs

소형 비전 언어 모델 SmolVLM2를 Optimum Intel과 OpenVINO로 변환·양자화·추론하면 별도 GPU 없이도 Intel CPU에서 지연시간과 처리량을 크게 개선할 수 있다.

huggingface.co
#privacy-design#service-design#multimodal#agent-memory
Smol2Operator: Post-Training GUI Agents for Computer Use
Article2025년 4월 8일

Smol2Operator: Post-Training GUI Agents for Computer Use

Smol2Operator는 작은 비전 언어 모델에 GUI grounding과 행동 추론 능력을 단계적으로 학습시켜, 화면을 이해하고 클릭·입력·스크롤 같은 GUI 행동을 수행하는 에이전트로 발전시키는 공개 재현 가능한 학습 레시피입니다.

huggingface.co
#aguvis#smol2operator#hugging-face#xlangai-aguvis-stage1
SmolVLM2: Bringing Video Understanding to Every Device
Article2025년 4월 8일

SmolVLM2: Bringing Video Understanding to Every Device

SmolVLM2는 2.2B·500M·256M 세 가지 크기로 영상 이해의 높은 메모리 효율과 온디바이스 실행 가능성을 제시하며, Transformers와 MLX를 통해 출시 직후부터 다양한 환경에서 활용할 수 있도록 공개된 소형 비전·영상 언어 모델군이다.

huggingface.co
#multimodal#capex-cycle#context-compression#prompt-library
🚀 Accelerating LLM Inference with TGI on Intel Gaudi
Article2025년 3월 29일

🚀 Accelerating LLM Inference with TGI on Intel Gaudi

Hugging Face는 Intel Gaudi 하드웨어 지원을 Text Generation Inference(TGI) 본체에 네이티브로 통합해, 별도 포크 없이 Gaudi 기반 LLM 추론 배포를 사용할 수 있게 했습니다.

huggingface.co
#ai-architecture#multimodal#llm#semiconductors
Introducing next-generation audio models in the API
Article2025년 3월 20일

Introducing next-generation audio models in the API

OpenAI는 음성 에이전트 구축을 위해 더 정확한 음성 텍스트 모델과 조절 가능한 텍스트 음성 모델을 API에 출시했다.

openai.com
#service-design#multimodal#ai-safety#llm
Apple innovation and execution — Benedict Evans
Article2025년 3월 14일

Apple innovation and execution — Benedict Evans

베네딕트 에번스는 애플이 여전히 막대한 수익을 내지만, 비전 프로와 새 Siri 지연을 통해 ‘혁신 부족’보다 더 심각한 실행력 저하의 징후가 드러났다고 진단한다.

ben-evans.com
#apple-silicon#multimodal#ai-distribution#capex-cycle
HuggingFace, IISc partner to supercharge model building on India's diverse languages
Article2025년 2월 27일

HuggingFace, IISc partner to supercharge model building on India's diverse languages

허깅페이스와 인도과학원·아트파크는 인도 전역의 언어·방언·지역·인구통계적 다양성을 담은 오픈소스 다중양식 데이터셋 ‘바니’의 접근성과 활용성을 높이기 위해 협력한다.

huggingface.co
#multimodal#llm#semiconductors#vision-language-models
Visual Document Retrieval Goes Multilingual
Article2025년 2월 26일

Visual Document Retrieval Goes Multilingual

LlamaIndex는 문서 화면을 OCR 없이 단일 벡터로 표현하는 다국어 검색 모델과 약 50만 건 규모의 공개 학습 데이터를 선보였으며, 검색 성능·추론 속도·언어 간 검색·저장 효율을 함께 개선했다.

huggingface.co
#multimodal#agent-memory#capex-cycle#retrieval-index
Rogo scales AI-driven financial research with OpenAI o1
Article2025년 2월 13일

Rogo scales AI-driven financial research with OpenAI o1

기업용 금융 인공지능 플랫폼 로고는 오픈AI o1을 비롯한 모델과 대규모 금융 데이터를 결합해 문서 조사, 실사, 분석 자료 작성을 자동화하고 금융 전문가가 고부가가치 의사결정에 집중하도록 지원한다.

openai.com
#openai#ai-architecture#multimodal#llm
nanoVLM: The simplest repository to train your VLM in pure PyTorch
Article2025년 2월 6일

nanoVLM: The simplest repository to train your VLM in pure PyTorch

nanoVLM은 SigLIP 비전 인코더와 Llama 3 계열 언어 구조를 간결한 순수 PyTorch 코드로 연결해, 시각 질의응답용 VLM의 구성부터 학습·평가·추론까지 직접 익힐 수 있게 만든 경량 툴킷이다.

huggingface.co
#ai-architecture#multimodal#agent-routing#ai-infrastructure
DABStep: Data Agent Benchmark for Multi-step Reasoning
Article2025년 2월 4일

DABStep: Data Agent Benchmark for Multi-step Reasoning

DABstep은 실제 결제 데이터 분석 업무에서 나온 450개 이상의 과제를 통해, 현재 LLM 기반 데이터 에이전트가 다단계 추론·도메인 이해·코드 실행을 결합한 현실적 분석 문제를 얼마나 해결할 수 있는지 평가하는 벤치마크입니다.

huggingface.co
#multimodal#agent-routing#llm#semiconductors
Introducing deep research
Article2025년 2월 2일

Introducing deep research

딥 리서치는 복잡한 질문을 위해 수백 개의 온라인 자료를 자율적으로 탐색·분석·종합하고, 출처가 명시된 연구 보고서를 수십 분 안에 작성하는 ChatGPT의 에이전트형 연구 기능이다.

openai.com
#multimodal#llm#semiconductors#vision-language-models
Reinforcement Learning Heats Up, White House Orders Muscular AI Policy, and more...
Article2025년 1월 29일

Reinforcement Learning Heats Up, White House Orders Muscular AI Policy, and more...

DeepSeek R1의 공개는 중국 생성 AI의 추격, 오픈 웨이트 모델의 공급망 중요성, 기반 모델 가격 하락, 그리고 강화학습 기반 추론 모델·컴퓨터 사용 에이전트의 부상을 동시에 부각시켰다.

@DeepLearningAI
#anthropic#service-design#ai-architecture#multimodal
We now support VLMs in smolagents!
Article2025년 1월 24일

We now support VLMs in smolagents!

smolagents에 비전 지원이 추가되어 VLM을 에이전트 파이프라인에서 기본적으로 활용하고, 특히 웹 브라우징처럼 시각 정보가 중요한 작업을 수행할 수 있게 되었습니다.

huggingface.co
#multimodal#agent-memory#context-compression#retrieval-index
Computer-Using Agent
Article2025년 1월 23일

Computer-Using Agent

OpenAI의 Computer Using Agent(CUA)는 화면 픽셀을 이해하고 마우스·키보드로 조작하며, Operator가 웹과 컴퓨터 작업을 수행하도록 뒷받침하는 범용 GUI 기반 에이전트 모델이다.

openai.com
#openai#operator#gpt-4o#computer-using-agent
Operator System Card
Article2025년 1월 23일

Operator System Card

오퍼레이터는 화면을 보고 브라우저를 조작하는 컴퓨터 사용 에이전트로, 오픈AI는 실제 행동에서 발생할 수 있는 피해를 줄이기 위해 위험 작업 거부, 중요 행동 전 사용자 확인, 외부 레드팀, 프런티어 위험 평가를 결합한 다층 안전 체계를 적용했다.

openai.com
#openai#privacy-design#multimodal#context-compression
이전1…56787 / 8다음