이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.
Alias / 동의어
연관 태그
AutoRound는 가중치 반올림과 클리핑 범위를 함께 최적화해 낮은 비트에서도 정확도를 유지하면서 빠른 양자화와 폭넓은 모델·장치·출력 형식 호환성을 제공하는 인텔의 가중치 전용 학습 후 양자화 도구다.
Dell Enterprise Hub의 새 버전은 Dell AI 서버와 AI PC에서 모델, 애플리케이션, 온디바이스 AI, SDK/CLI를 온프레미스로 빠르게 배포하도록 묶은 엔터프라이즈 AI 툴킷으로 소개된다.
허깅페이스는 vLLM과 GPU 최적화를 적용한 새로운 Whisper 추론 엔드포인트를 공개해 기존 버전 대비 최대 8배 빠른 처리 성능을 제공하면서도 전사 품질을 유지했다.
이 글은 Qwen3 8B를 Intel® Core™ Ultra에서 더 빠르게 실행하기 위해 OpenVINO.GenAI의 추측 디코딩과 깊이 가지치기된 Qwen3 0.6B 드래프트 모델을 결합해 약 1.4배 속도 향상을 얻은 과정을 설명한다.
그라디오는 적은 파이썬 코드로 화면을 만드는 도구를 넘어, 기계학습 모델의 사용자 인터페이스와 API, 실행 자원, 실시간 출력, 배포 형태를 하나의 개발 경험으로 통합하는 프레임워크다.
SmolVLM2는 2.2B·500M·256M 세 가지 크기로 영상 이해의 높은 메모리 효율과 온디바이스 실행 가능성을 제시하며, Transformers와 MLX를 통해 출시 직후부터 다양한 환경에서 활용할 수 있도록 공개된 소형 비전·영상 언어 모델군이다.
오픈AI는 유럽이 인공지능의 경제·사회적 이익을 널리 실현하려면 핵심 기반 확충, 규제 정비, 전 사회적 도입, 유럽 가치에 부합하는 책임 있는 개발을 함께 추진해야 한다고 제안한다.
이 글은 RTX 4090 8장을 ASUS ESC8000A E12P 서버에 장착해 연구·교육용 로컬 AI GPU 서버를 구성한 이유와 하드웨어 설계, 조립 절차를 설명한다.
이 글은 Hugging Face 도구를 이용해 DeepSeek R1 계열 모델을 여러 환경에 배포하는 방법과 모델별 하드웨어 구성, 현재 지원되는 기능과 아직 준비 중인 미지원 영역을 정리한 실무 가이드다.
베네딕트 에번스는 애플이 여전히 막대한 수익을 내지만, 비전 프로와 새 Siri 지연을 통해 ‘혁신 부족’보다 더 심각한 실행력 저하의 징후가 드러났다고 진단한다.
Hugging Face와 FriendliAI는 Hugging Face Hub의 “Deploy this model” 버튼 안에 FriendliAI Endpoints를 통합해 생성형 AI 모델 배포와 추론 운영을 더 빠르고 간단하게 만들었다.
PyTorch 메모리 스냅샷으로 GPU 사용량을 단계별로 시각화하고, 학습 과정의 최대 메모리를 구성 요소별로 추정하는 방법을 설명한다.
LlamaIndex는 문서 화면을 OCR 없이 단일 벡터로 표현하는 다국어 검색 모델과 약 50만 건 규모의 공개 학습 데이터를 선보였으며, 검색 성능·추론 속도·언어 간 검색·저장 효율을 함께 개선했다.
Math Verify로 수학 답안의 추출·해석·동치 비교 오류를 바로잡아 Open LLM Leaderboard의 3,751개 모델을 재평가한 결과, 점수와 순위가 대폭 달라졌다.
nanoVLM은 SigLIP 비전 인코더와 Llama 3 계열 언어 구조를 간결한 순수 PyTorch 코드로 연결해, 시각 질의응답용 VLM의 구성부터 학습·평가·추론까지 직접 익힐 수 있게 만든 경량 툴킷이다.
DeepSeek R1의 공개는 중국 생성 AI의 추격, 오픈 웨이트 모델의 공급망 중요성, 기반 모델 가격 하락, 그리고 강화학습 기반 추론 모델·컴퓨터 사용 에이전트의 부상을 동시에 부각시켰다.
Hugging Face는 TGI를 단일 프런트엔드로 유지하면서 TensorRT LLM, vLLM, llama.cpp 등 다양한 추론 엔진을 백엔드로 연결할 수 있는 멀티 백엔드 아키텍처를 소개했다.
이 글은 언어 모델의 다음 토큰 선택 과정에서 로짓을 직접 조정해 길이, 문맥 유지, 필수 문구, 선택형 답변 같은 생성 제약을 제어하는 방법을 NVIDIA의 LogitsProcessorZoo와 Hugging Face 생성 API 예시로 설명한다.
OpenAI는 연속시간 일관성 모델을 단순화·안정화·대규모화한 sCM을 소개하며, 선도적 확산 모델에 가까운 샘플 품질을 단 두 번의 샘플링 단계로 달성했다고 설명합니다.
3B 규모의 큐원 모델을 카운트다운 산술 과제와 그룹 상대 정책 최적화로 훈련해, 별도의 인간 피드백 없이 풀이를 검토하고 탐색하는 딥시크 R1의 작은 ‘아하 순간’을 재현한 강화학습 실험이다.
엔비디아 라마 네모트론 나노 VL은 복잡한 문서의 문자·표·차트·수식·배치를 정밀하게 인식하고 위치 정보까지 제공하도록 설계된 80억 매개변수급 시각언어모델이다.
고해상도 이미지·영상 생성에서 큰 메모리를 차지하는 가변 오토인코더 디코딩을 원격 추론 엔드포인트에 맡겨 소비자용 그래픽 처리 장치의 부담을 줄이고 생성과 디코딩을 병렬화하는 실험적 기능을 소개한다.
Epoch AI는 사전학습 언어모델에서 같은 성능에 필요한 컴퓨트가 약 8개월마다 절반으로 줄었지만, 지난 10년의 성능 향상은 알고리즘 혁신보다 컴퓨트와 데이터 확장의 영향이 더 컸다고 분석한다.
TRL의 co located vLLM은 GRPO의 학습과 생성을 동일한 GPU·분산 프로세스 그룹에서 번갈아 실행해 유휴 시간과 통신 비용을 줄이며, 모델 크기와 텐서 병렬화 설정에 따라 최대 1.73배의 처리량 향상을 보였다.