이 작성자와 연결된 문서를 한곳에서 모아보고, 관련 태그를 따라 같은 맥락의 문서를 이어서 탐색할 수 있습니다.
자주 함께 등장한 태그
이 글은 언어 모델의 다음 토큰 선택 과정에서 로짓을 직접 조정해 길이, 문맥 유지, 필수 문구, 선택형 답변 같은 생성 제약을 제어하는 방법을 NVIDIA의 LogitsProcessorZoo와 Hugging Face 생성 API 예시로 설명한다.
KVPress는 긴 문맥에서 선형으로 증가하는 키·값 캐시를 중요도 기반으로 압축해 메모리 사용량을 줄이고 생성 속도를 높이는 모듈형 도구다.
빅 벤치 오디오 평가 결과, 음성을 직접 처리하는 모델은 텍스트 기반 추론보다 정확도가 크게 낮았으며 추론이 중요한 환경에서는 음성 인식·텍스트 추론·음성 합성을 연결한 파이프라인이 더 우수했다.
팰컨3는 10억~100억 매개변수 규모에서 과학·수학·코딩·추론 성능과 학습 효율을 함께 높이고, 다양한 배포 형식과 개방형 라이선스를 제공하는 디코더 전용 언어 모델 제품군이다.
Models mentioned in this article 1 More Articles from our Blog aws partnerships How to deploy and fine tune DeepSeek models on AWS 56 January 30, 2025…
Diffusers와 PEFT의 LoRA 핫스와핑, torch.compile, FP8 양자화, Flash Attention 3를 조합해 Flux.1 Dev의 재컴파일 문제를 피하고 고성능 GPU에서 약 2.23배, RTX 4090에서 약 2.04배 빠른 LoRA 추론을 구현한 최적화 방법을 설명한다.
간단한 일정 관리 대화 실험에서 대규모 언어 모델의 실수 수정 능력을 비교한 결과, 최신 3B~9B급 모델은 대체로 피드백을 반영했지만 소형·구형 모델은 형식 준수와 문맥 유지에서 반복적으로 실패했으며 모델 크기만으로 성능이 보장되지는 않았다.
PaliGemma 2는 SigLIP 이미지 인코더와 Gemma 2 언어 모델을 결합하고, 3B·10B·28B 규모와 세 가지 해상도, 간편한 미세조정 및 양자화 지원을 제공하는 구글의 새로운 오픈 비전 언어 모델 제품군이다.
AraGen은 아랍어 LLM을 대상으로 사실성·사용성을 함께 평가하기 위해 3C3H 척도, 동적 블라인드 평가 주기, 인간 검증 데이터셋을 결합한 생성형 벤치마크와 리더보드다.
EU AI Act는 오픈소스 AI에도 적용될 수 있으며, 개발자는 시스템·모델의 위험 수준과 공개 방식에 따라 투명성, 학습 데이터 요약, 저작권 및 개인정보 보호 의무를 준비해야 한다.
NXP는 로봇 VLA를 임베디드 플랫폼에 배포하기 위해 신뢰도 높은 데이터셋 수집, ACT·SmolVLA 미세조정, i.MX 95에서의 모델 분해·양자화·비동기 추론 최적화가 함께 필요하다고 설명한다.
BAAI는 정적 벤치마크와 사용자 투표형 아레나의 한계를 보완하기 위해 대형 언어모델들이 다국어로 직접 토론하며 추론력·논증력·언어 능력을 드러내는 FlagEval Debate를 제안한다.
엔비디아는 GTC 2025에서 물리 AI 개발을 가속하기 위해 Cosmos Transfer, Physical AI Dataset, Isaac GR00T N1을 공개했다.
허깅페이스는 대용량 모델·데이터셋 전송의 한계를 극복하기 위해 바이트 단위 중복 제거와 검증을 수행하는 콘텐츠 주소 기반 저장소(CAS)를 도입하고, 전 세계 업로드 분포에 맞춰 세 지역에 노드를 배치하는 새로운 업로드·다운로드 구조를 설계했다.
Bamba 9B는 KV cache 병목을 줄이기 위해 Mamba2와 트랜스포머를 결합한 9B급 하이브리드 모델로, 공개 데이터로 학습되고 주요 오픈소스 추론·학습 생태계에서 바로 실험할 수 있도록 공개된 모델이다.
3B 규모의 큐원 모델을 카운트다운 산술 과제와 그룹 상대 정책 최적화로 훈련해, 별도의 인간 피드백 없이 풀이를 검토하고 탐색하는 딥시크 R1의 작은 ‘아하 순간’을 재현한 강화학습 실험이다.
엔비디아 라마 네모트론 나노 VL은 복잡한 문서의 문자·표·차트·수식·배치를 정밀하게 인식하고 위치 정보까지 제공하도록 설계된 80억 매개변수급 시각언어모델이다.
Digital Green은 농업 RAG 챗봇 Farmer.chat의 응답 품질을 대규모로 평가하기 위해 LLM as a Judge 체계를 구축하고, 충실도와 답변률의 균형을 기준으로 생성 모델을 비교·선정했다.
HUGS는 Hugging Face가 공개 모델을 자체 인프라에서 빠르게 배포·확장하도록 제안한 무설정 최적화 추론 마이크로서비스였으며, 2025년 9월 기준 해당 모델 배포 컨테이너 제공은 중단되었다.
오픈 아랍어 LLM 리더보드 2는 기존 평가의 번역 편향·포화·검증 오류를 바로잡고, 아랍어 고유 특성과 실제 활용을 반영한 원어·인간 검수 벤치마크와 생성형 평가를 확대한 개편판이다.
고해상도 이미지·영상 생성에서 큰 메모리를 차지하는 가변 오토인코더 디코딩을 원격 추론 엔드포인트에 맡겨 소비자용 그래픽 처리 장치의 부담을 줄이고 생성과 디코딩을 병렬화하는 실험적 기능을 소개한다.
이 글은 Sentence Transformers로 정적 임베딩 모델을 현대식 대조학습과 Matryoshka Representation Learning으로 학습해 CPU 추론 속도를 기존 주요 임베딩 모델보다 100~400배 높이면서도 여러 벤치마크에서 성능의 상당 부분을 유지하는 방법을 소개한다.
SyGra Studio는 합성 데이터 생성 흐름을 시각적으로 구성하고, 생성되는 설정과 실행 상태·비용·결과를 한 화면에서 확인할 수 있게 만든 대화형 작업 환경이다.
임베딩젬마는 3억 800만 개 매개변수와 2,048토큰 문맥 길이, 100개 이상 언어 지원, 차원 축소 기능을 결합해 일상적인 기기에서도 고품질 다국어 임베딩을 생성하도록 설계된 구글의 소형 모델이다.