Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#nvidia
Tag419건YouTube 182Article 237

#nvidia

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#ai-infrastructure공동문서 158 · 연관도 45%#capex-cycle공동문서 141 · 연관도 42%#gpu공동문서 57 · 연관도 31%#jensen-huang공동문서 38 · 연관도 29%#applications공동문서 168 · 연관도 25%#llm공동문서 178 · 연관도 24%#ai-architecture공동문서 88 · 연관도 19%#sk-hynix공동문서 46 · 연관도 19%#semiconductor-supply-chain공동문서 22 · 연관도 18%#multimodal공동문서 50 · 연관도 17%
Efficient MultiModal Data Pipeline
Article2025년 7월 14일

Efficient MultiModal Data Pipeline

멀티모달 학습의 GPU 유휴 시간과 과도한 패딩을 줄이기 위해, 데이터셋 분석부터 토큰·이미지 제약을 함께 고려하는 균형 잡힌 배낭식 배치 구성까지 단계적으로 개선한 사례다.

huggingface.co
#multimodal#agent-routing#ai-infrastructure#capex-cycle
SmolLM3: smol, multilingual, long-context reasoner
Article2025년 7월 8일

SmolLM3: smol, multilingual, long-context reasoner

SmolLM3는 공개 데이터와 학습 도구로 구축한 30억 매개변수 모델로, 11조 개가 넘는 토큰의 단계별 사전학습과 장문·추론 중간학습을 결합해 다국어, 최대 128K 문맥, 추론·비추론 이중 모드를 지원한다.

huggingface.co
#long-context#privacy-design#ai-architecture#llm
Exploring Quantization Backends in Diffusers
Article2025년 6월 27일

Exploring Quantization Backends in Diffusers

Diffusers는 Flux의 핵심 구성 요소를 여러 백엔드로 양자화해 이미지 품질을 크게 훼손하지 않으면서 메모리 사용량을 줄일 수 있으며, 정밀도와 백엔드에 따라 속도·메모리·사용 편의성의 차이가 뚜렷하다.

huggingface.co
#ai-architecture#multimodal#agent-memory#context-compression
Efficient Request Queueing – Optimizing LLM Performance
Article2025년 6월 17일

Efficient Request Queueing – Optimizing LLM Performance

다중 사용자 환경의 대규모 언어 모델 서빙에서는 사용자별 공정 스케줄링과 백엔드 지표 기반의 동적 요청 제어를 결합해야 지연 시간을 줄이면서 그래픽 처리 장치 활용률을 유지할 수 있다.

huggingface.co
#context-compression#prompt-library#api-vllm-api#llm
Introducing Training Cluster as a Service - a new collaboration with NVIDIA
Article2025년 6월 11일

Introducing Training Cluster as a Service - a new collaboration with NVIDIA

Hugging Face와 NVIDIA는 연구기관과 기업이 필요한 시점·규모·기간에 맞춰 대규모 GPU 클러스터를 요청하고 학습 작업에 활용할 수 있는 Training Cluster as a Service를 발표했다.

huggingface.co
#nvidia#service-design#ai-infrastructure#capex-cycle
AI metrics — Benedict Evans
Article2025년 6월 9일

AI metrics — Benedict Evans

생성형 AI는 빠르게 커지고 있지만, 지금 쓰이는 사용자 수·토큰 수·성장 비교 지표만으로는 실제 제품 가치와 사용 방식, 시장 변화를 제대로 설명하기 어렵다는 글입니다.

Benedict Evans
#inflation-risk#llm#semiconductors#applications
(LoRA) Fine-Tuning FLUX.1-dev on Consumer Hardware
Article2025년 6월 1일

(LoRA) Fine-Tuning FLUX.1-dev on Consumer Hardware

FLUX.1 dev의 트랜스포머를 4비트로 양자화하고 LoRA, 8비트 옵티마이저, 체크포인팅, 잠재 표현·텍스트 임베딩 캐시를 결합해 단일 GPU에서 약 10GB 미만의 VRAM으로 미세 조정하는 방법을 설명한다.

huggingface.co
#ai-architecture#agent-memory#capex-cycle#context-compression
Introducing AutoRound: Intel’s Advanced Quantization for LLMs and VLMs
Article2025년 5월 27일

Introducing AutoRound: Intel’s Advanced Quantization for LLMs and VLMs

AutoRound는 가중치 반올림과 클리핑 범위를 함께 최적화해 낮은 비트에서도 정확도를 유지하면서 빠른 양자화와 폭넓은 모델·장치·출력 형식 호환성을 제공하는 인텔의 가중치 전용 학습 후 양자화 도구다.

huggingface.co
#multimodal#agent-deployment#ai-infrastructure#capex-cycle
Dell Enterprise Hub is all you need to build AI on premises
Article2025년 5월 23일

Dell Enterprise Hub is all you need to build AI on premises

Dell Enterprise Hub의 새 버전은 Dell AI 서버와 AI PC에서 모델, 애플리케이션, 온디바이스 AI, SDK/CLI를 온프레미스로 빠르게 배포하도록 묶은 엔터프라이즈 AI 툴킷으로 소개된다.

huggingface.co
#nvidia#agent-deployment#ai-infrastructure#capex-cycle
Blazingly fast whisper transcriptions with Inference Endpoints
Article2025년 5월 13일

Blazingly fast whisper transcriptions with Inference Endpoints

허깅페이스는 vLLM과 GPU 최적화를 적용한 새로운 Whisper 추론 엔드포인트를 공개해 기존 버전 대비 최대 8배 빠른 처리 성능을 제공하면서도 전사 품질을 유지했다.

huggingface.co
#service-design#agent-deployment#ai-infrastructure#capex-cycle
Hugging Face to sell open-source robots thanks to Pollen Robotics acquisition 🤖
Article2025년 4월 14일

Hugging Face to sell open-source robots thanks to Pollen Robotics acquisition 🤖

허깅페이스는 오픈소스 휴머노이드 로봇 기업 폴렌 로보틱스를 인수하고, 르로봇 생태계와 리치 2를 결합해 개방형 로봇 소프트웨어·하드웨어를 직접 제공하기 시작했다.

huggingface.co
#multimodal#agent-routing#llm#semiconductors
Building an Efficient GPU Server with NVIDIA GeForce RTX 4090s/5090s
Article2025년 4월 3일

Building an Efficient GPU Server with NVIDIA GeForce RTX 4090s/5090s

이 글은 RTX 4090 8장을 ASUS ESC8000A E12P 서버에 장착해 연구·교육용 로컬 AI GPU 서버를 구성한 이유와 하드웨어 설계, 조립 절차를 설명한다.

Marco Mascorro, a16z
#nvidia#privacy-design#ai-infrastructure#capex-cycle
🚀 Accelerating LLM Inference with TGI on Intel Gaudi
Article2025년 3월 29일

🚀 Accelerating LLM Inference with TGI on Intel Gaudi

Hugging Face는 Intel Gaudi 하드웨어 지원을 Text Generation Inference(TGI) 본체에 네이티브로 통합해, 별도 포크 없이 Gaudi 기반 LLM 추론 배포를 사용할 수 있게 했습니다.

huggingface.co
#ai-architecture#multimodal#llm#semiconductors
Hugging Face and FriendliAI partner to supercharge model deployment on the Hub
Article2025년 3월 4일

Hugging Face and FriendliAI partner to supercharge model deployment on the Hub

Hugging Face와 FriendliAI는 Hugging Face Hub의 “Deploy this model” 버튼 안에 FriendliAI Endpoints를 통합해 생성형 AI 모델 배포와 추론 운영을 더 빠르고 간단하게 만들었다.

huggingface.co
#nvidia#service-design#agent-deployment#agent-routing
Visual Document Retrieval Goes Multilingual
Article2025년 2월 26일

Visual Document Retrieval Goes Multilingual

LlamaIndex는 문서 화면을 OCR 없이 단일 벡터로 표현하는 다국어 검색 모델과 약 50만 건 규모의 공개 학습 데이터를 선보였으며, 검색 성능·추론 속도·언어 간 검색·저장 효율을 함께 개선했다.

huggingface.co
#multimodal#agent-memory#capex-cycle#retrieval-index
Fixing Open LLM Leaderboard with Math-Verify
Article2025년 2월 14일

Fixing Open LLM Leaderboard with Math-Verify

Math Verify로 수학 답안의 추출·해석·동치 비교 오류를 바로잡아 Open LLM Leaderboard의 3,751개 모델을 재평가한 결과, 점수와 순위가 대폭 달라졌다.

huggingface.co
#nvidia#ai-infrastructure#capex-cycle#llm
Welcome to Inference Providers on the Hub 🔥
Article2025년 1월 28일

Welcome to Inference Providers on the Hub 🔥

허깅페이스는 팔, 리플리케이트, 삼바노바, 투게더 에이아이의 서버리스 추론을 허브 모델 페이지와 파이썬·자바스크립트 SDK, HTTP 라우터에 통합하고, 자체 제공자 키와 허깅페이스 경유 방식 중 하나를 선택할 수 있게 했다.

huggingface.co
#privacy-design#service-design#agent-routing#ai-safety
Introducing multi-backends (TRT-LLM, vLLM) support for Text Generation Inference
Article2025년 1월 16일

Introducing multi-backends (TRT-LLM, vLLM) support for Text Generation Inference

Hugging Face는 TGI를 단일 프런트엔드로 유지하면서 TensorRT LLM, vLLM, llama.cpp 등 다양한 추론 엔진을 백엔드로 연결할 수 있는 멀티 백엔드 아키텍처를 소개했다.

huggingface.co
#nvidia#ai-architecture#agent-deployment#ai-infrastructure
Vision Language Models (Better, faster, stronger)
Article2025년 1월 12일

Vision Language Models (Better, faster, stronger)

지난 1년간 비전 언어 모델은 다중 모달 입출력, 추론, 소형화, 전문가 혼합 구조, 로봇 행동 제어와 전통적 시각 작업의 통합을 중심으로 더 강력하고 효율적인 형태로 발전했다.

huggingface.co
#privacy-design#ai-architecture#multimodal#agent-deployment
Controlling Language Model Generation with NVIDIA's LogitsProcessorZoo
Article2024년 12월 23일

Controlling Language Model Generation with NVIDIA's LogitsProcessorZoo

이 글은 언어 모델의 다음 토큰 선택 과정에서 로짓을 직접 조정해 길이, 문맥 유지, 필수 문구, 선택형 답변 같은 생성 제약을 제어하는 방법을 NVIDIA의 LogitsProcessorZoo와 Hugging Face 생성 API 예시로 설명한다.

huggingface.co
#nvidia#privacy-design#agent-routing#capex-cycle
Mastering Long Contexts in LLMs with KVPress
Article2024년 12월 21일

Mastering Long Contexts in LLMs with KVPress

KVPress는 긴 문맥에서 선형으로 증가하는 키·값 캐시를 중요도 기반으로 압축해 메모리 사용량을 줄이고 생성 속도를 높이는 모듈형 도구다.

huggingface.co
#ai-architecture#multimodal#agent-memory#context-compression
Elon Musk wanted an OpenAI for-profit
Article2024년 12월 13일

Elon Musk wanted an OpenAI for-profit

오픈AI는 일론 머스크가 영리 구조 자체에 반대했던 것이 아니라 2017년 영리 전환을 추진하면서 지분 과반, 절대적 통제권, 최고경영자 지위를 요구했고, 그 조건이 받아들여지지 않자 회사를 떠났다고 주장한다.

openai.com
#openai#privacy-design#ai-architecture#agent-routing
Fast LoRA inference for Flux with Diffusers and PEFT
Article2024년 12월 5일

Fast LoRA inference for Flux with Diffusers and PEFT

Diffusers와 PEFT의 LoRA 핫스와핑, torch.compile, FP8 양자화, Flash Attention 3를 조합해 Flux.1 Dev의 재컴파일 문제를 피하고 고성능 GPU에서 약 2.23배, RTX 4090에서 약 2.04배 빠른 LoRA 추론을 구현한 최적화 방법을 설명한다.

huggingface.co
#ai-architecture#agent-memory#agent-routing#context-compression
OpenAI o1 System Card
Article2024년 12월 5일

OpenAI o1 System Card

OpenAI o1 계열은 강화학습 기반의 숙고형 추론으로 안전 정책 준수와 탈옥 공격 저항성을 높였지만, 향상된 지능이 새로운 위험을 만들 수 있어 지속적인 정렬·스트레스 테스트·위험 관리가 필요하다.

openai.com
#openai#privacy-design#service-design#multimodal
이전1…1516171817 / 18다음