Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#vision-language-models
Tag181건YouTube 4Article 177

#vision-language-models

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#multimodal공동문서 179 · 연관도 95%#llm공동문서 165 · 연관도 34%#ai-architecture공동문서 78 · 연관도 27%#agent-routing공동문서 73 · 연관도 23%#semiconductors공동문서 105 · 연관도 22%#agent-memory공동문서 64 · 연관도 20%#nvidia공동문서 45 · 연관도 16%#workflow-automation공동문서 24 · 연관도 15%#capex-cycle공동문서 31 · 연관도 14%#service-design공동문서 36 · 연관도 14%
Vision Language Models (Better, faster, stronger)
Article2025년 1월 12일

Vision Language Models (Better, faster, stronger)

지난 1년간 비전 언어 모델은 다중 모달 입출력, 추론, 소형화, 전문가 혼합 구조, 로봇 행동 제어와 전통적 시각 작업의 통합을 중심으로 더 강력하고 효율적인 형태로 발전했다.

huggingface.co
#privacy-design#ai-architecture#multimodal#agent-deployment
Mastering Long Contexts in LLMs with KVPress
Article2024년 12월 21일

Mastering Long Contexts in LLMs with KVPress

KVPress는 긴 문맥에서 선형으로 증가하는 키·값 캐시를 중요도 기반으로 압축해 메모리 사용량을 줄이고 생성 속도를 높이는 모듈형 도구다.

huggingface.co
#ai-architecture#multimodal#agent-memory#context-compression
Sora System Card
Article2024년 12월 9일

Sora System Card

Sora는 텍스트·이미지·영상을 입력받아 최대 1080p·20초 영상을 생성하거나 편집하는 모델이며, OpenAI는 데이터 필터링, 외부 레드팀, 내부 평가, 입출력 분류기와 제품 제한을 결합해 오용 위험을 줄이고자 했다.

openai.com
#openai#privacy-design#ai-architecture#multimodal
OpenAI o1 System Card
Article2024년 12월 5일

OpenAI o1 System Card

OpenAI o1 계열은 강화학습 기반의 숙고형 추론으로 안전 정책 준수와 탈옥 공격 저항성을 높였지만, 향상된 지능이 새로운 위험을 만들 수 있어 지속적인 정렬·스트레스 테스트·위험 관리가 필요하다.

openai.com
#openai#privacy-design#service-design#multimodal
Welcome PaliGemma 2 – New vision language models by Google
Article2024년 12월 5일

Welcome PaliGemma 2 – New vision language models by Google

PaliGemma 2는 SigLIP 이미지 인코더와 Gemma 2 언어 모델을 결합하고, 3B·10B·28B 규모와 세 가지 해상도, 간편한 미세조정 및 양자화 지원을 제공하는 구글의 새로운 오픈 비전 언어 모델 제품군이다.

huggingface.co
#hotel-review#service-design#multimodal#search-advertising
Bringing Robotics AI to Embedded Platforms: Dataset Recording, VLA Fine‑Tuning, and On‑Device Optimizations
Article2024년 11월 28일

Bringing Robotics AI to Embedded Platforms: Dataset Recording, VLA Fine‑Tuning, and On‑Device Optimizations

NXP는 로봇 VLA를 임베디드 플랫폼에 배포하기 위해 신뢰도 높은 데이터셋 수집, ACT·SmolVLA 미세조정, i.MX 95에서의 모델 분해·양자화·비동기 추론 최적화가 함께 필요하다고 설명한다.

huggingface.co
#multimodal#agent-deployment#agent-memory#context-compression
Rox goes “all in” on OpenAI
Article2024년 11월 19일

Rox goes “all in” on OpenAI

록스는 오픈AI의 모델과 API를 기반으로 데이터, 영업 흐름, 상시 작동 에이전트를 결합한 맞춤형 매출 운영 플랫폼을 구축하고 기업 고객 확대와 영업 생산성 향상을 이루고 있다.

openai.com
#openai#agent-swarms#multimodal#agent-deployment
Letting Large Models Debate: The First Multilingual LLM Debate Competition
Article2024년 11월 13일

Letting Large Models Debate: The First Multilingual LLM Debate Competition

BAAI는 정적 벤치마크와 사용자 투표형 아레나의 한계를 보완하기 위해 대형 언어모델들이 다국어로 직접 토론하며 추론력·논증력·언어 능력을 드러내는 FlagEval Debate를 제안한다.

huggingface.co
#anthropic#multimodal#context-compression#prompt-library
Welcome the NVIDIA Llama Nemotron Nano VLM to Hugging Face Hub
Article2024년 9월 25일

Welcome the NVIDIA Llama Nemotron Nano VLM to Hugging Face Hub

엔비디아 라마 네모트론 나노 VL은 복잡한 문서의 문자·표·차트·수식·배치를 정밀하게 인식하고 위치 정보까지 제공하도록 설계된 80억 매개변수급 시각언어모델이다.

huggingface.co
#nvidia#ai-architecture#multimodal#agent-routing
Train 400x faster Static Embedding Models with Sentence Transformers
Article2024년 8월 9일

Train 400x faster Static Embedding Models with Sentence Transformers

이 글은 Sentence Transformers로 정적 임베딩 모델을 현대식 대조학습과 Matryoshka Representation Learning으로 학습해 CPU 추론 속도를 기존 주요 임베딩 모델보다 100~400배 높이면서도 여러 벤치마크에서 성능의 상당 부분을 유지하는 방법을 소개한다.

huggingface.co
#luxury-hospitality#luxury-travel#ai-architecture#multimodal
Training and Finetuning Sparse Embedding Models with Sentence Transformers
Article2024년 2월 19일

Training and Finetuning Sparse Embedding Models with Sentence Transformers

이 글은 Sentence Transformers로 희소 임베딩 모델을 미세조정하는 이유와 기본 구성요소를 설명하며, SPLADE 계열 모델의 해석 가능성·확장 방식·도메인 적응 필요성을 실용 예제로 보여준다.

huggingface.co
#ai-architecture#multimodal#llm#vision-language-models
No GPU left behind: Unlocking Efficiency with Co-located vLLM in TRL
Article2024년 2월 5일

No GPU left behind: Unlocking Efficiency with Co-located vLLM in TRL

TRL의 co located vLLM은 GRPO의 학습과 생성을 동일한 GPU·분산 프로세스 그룹에서 번갈아 실행해 유휴 시간과 통신 비용을 줄이며, 모델 크기와 텐서 병렬화 설정에 따라 최대 1.73배의 처리량 향상을 보였다.

huggingface.co
#ai-architecture#multimodal#agent-routing#capex-cycle
Asynchronous Robot Inference: Decoupling Action Prediction and Execution
Article2023년 4월 23일

Asynchronous Robot Inference: Decoupling Action Prediction and Execution

로봇 정책이 미래 행동 묶음을 예측하는 동안 실행을 멈추는 문제를 줄이기 위해, 글은 행동 예측과 실행을 분리하는 비동기 추론 구조로 지연을 제거하고 더 촘촘한 제어 루프를 만드는 방법을 설명합니다.

huggingface.co
#ai-architecture#multimodal#agent-routing#llm
이전1…6788 / 8다음