이 작성자와 연결된 문서를 한곳에서 모아보고, 관련 태그를 따라 같은 맥락의 문서를 이어서 탐색할 수 있습니다.
자주 함께 등장한 태그
TRL의 델타 가중치 동기화는 연속된 강화학습 단계에서 실제로 바뀐 극소수의 bf16 원소만 희소 세이프텐서로 저장해 허깅페이스 버킷으로 전달함으로써, 대규모 모델의 반복적인 전체 체크포인트 전송 비용과 추론 중단 시간을 크게 줄이는 방식이다.
허깅페이스 커널 허브는 파이썬·파이토치·쿠다 환경에 맞는 사전 최적화 연산 커널을 허브에서 내려받아, 복잡한 로컬 빌드 없이 모델의 특정 연산에 적용하도록 돕는 체계다.
ZeroGPU의 짧게 생성되는 GPU 프로세스에서는 실행 시점 컴파일보다 모델을 한 번 미리 컴파일하고 즉시 다시 불러오는 PyTorch 사전 컴파일이 적합하며, 생성 모델의 추론 속도를 최대 1.8배까지 높일 수 있다.
OpenAI의 GPT OSS는 Apache 2.0으로 공개된 20B·120B 오픈 웨이트 추론 모델군으로, Hugging Face 생태계에서 API·로컬 추론·GPU별 최적화를 통해 폭넓게 활용할 수 있도록 소개된다.
이 글은 파운데이션 모델의 확장이 사전학습 중심에서 사후학습·추론 시점 연산까지 넓어지면서, AWS 위에서 가속 컴퓨트·저지연 네트워크·분산 스토리지·오픈소스 운영 스택이 어떻게 함께 설계되어야 하는지 설명한다.
연속 배치의 동기식 유휴 시간을 없애기 위해 중앙처리장치의 배치 준비와 그래픽처리장치의 계산을 분리하고, 비기본 CUDA 스트림과 이벤트로 병렬 실행과 작업 순서를 함께 보장하는 방법을 설명한다.
온라인 강화학습의 vLLM V0→V1 전환에서는 목적함수 보정을 서두르기보다 로그확률 의미, 런타임 기본값, 비행 중 가중치 갱신, fp32 출력 헤드를 먼저 일치시켜 추론 백엔드의 정확성을 복원해야 했다.
IBM의 Granite Embedding Multilingual R2는 200개 이상의 언어와 32K 토큰 문맥을 지원하며, 97M 소형 모델과 311M 고성능 모델로 다국어·장문·코드 검색의 성능과 배포 효율을 함께 높인 Apache 2.0 임베딩 모델군이다.
Granite 4.0 3B Vision은 복잡한 기업 문서의 표·차트·핵심 값 쌍을 정밀하게 추출하도록 설계된 30억 매개변수급 소형 비전·언어 모델이다.
딥인프라가 허깅페이스 추론 제공자로 합류해, 사용자는 허깅페이스 토큰과 기존 SDK·에이전트 도구를 통해 다양한 오픈 가중치 언어 모델을 서버리스 방식으로 호출할 수 있게 됐다.
이 글은 OpenAI Privacy Filter의 긴 문맥 PII 탐지 기능을 활용해 문서 탐색기, 이미지 익명화 도구, 자동 비식별 붙여넣기 앱을 gradio.Server 기반으로 구현한 과정을 설명한다.
IBM Research와 UC Berkeley는 ITBench 실행 추적에 MAST 실패 분류법을 적용해 엔터프라이즈 IT 자동화 에이전트가 단순히 실패했는지가 아니라 어디서, 왜, 어떤 방식으로 무너지는지를 진단했다.
QIMMA는 아랍어 LLM 평가에서 벤치마크를 먼저 검증한 뒤 모델을 평가함으로써, 점수가 실제 아랍어 능력을 더 신뢰성 있게 반영하도록 설계된 품질 우선 리더보드입니다.
transformers 모델을 mlx lm으로 빠르고 정확하게 이식하도록 돕는 스킬과 비에이전트 테스트 하네스를 구축하되, 코드 소유권과 최종 판단은 기여자와 리뷰어에게 남겨 두는 접근을 설명한다.
이 글은 Sentence Transformers로 텍스트와 이미지 등 여러 모달리티를 다루는 임베딩 모델을 자체 데이터에 맞게 파인튜닝하는 방법을, 시각 문서 검색 사례를 중심으로 설명합니다.
Transformers.js v4는 새 C++ 기반 WebGPU 런타임, 고성능 모델 실행 전략, 모노레포 구조, 확장된 모델 지원, 경량 빌드와 운영용 API를 도입해 브라우저와 서버 측 자바스크립트 전반의 로컬 AI 실행 기반을 강화한 대규모 업데이트다.
HoloTab은 사용자가 원하는 작업을 말하거나 한 번 시연하면 웹사이트 탐색과 반복 업무를 브라우저 안에서 대신 수행하는 무료 크롬 확장 프로그램이다.
허깅페이스의 오픈소스 인공지능 생태계는 사용자·모델·데이터셋과 파생 창작물이 급증한 가운데, 중국과 독립 개발자의 영향력 확대, 소형 모델 중심의 실용적 채택, 국가 주권과 지역 생태계의 부상을 동시에 보여준다.
개방형 자동 음성 인식 순위표는 정확도와 처리 속도뿐 아니라 다국어·장문 전사 성능까지 비교하며, 언어 범용성·특화 정확도·처리량 사이의 뚜렷한 상충 관계를 보여준다.
Sentence Transformers 5.4는 텍스트·이미지·오디오·비디오를 같은 인터페이스로 임베딩하고, 서로 다른 형식의 입력 쌍을 재평가해 교차 모달 검색과 멀티모달 검색 증강 생성 파이프라인을 구축할 수 있게 한다.
SAIR는 100만 개 이상의 단백질–리간드 쌍에서 생성한 524만 개의 3차원 복합체와 실험 기반 IC₅₀ 값을 연결해, AI 신약 개발의 구조·효능 학습 데이터 부족을 해소하려는 공개 데이터셋이다.
Gradio 5.38.0은 로컬 파일 전달, 실시간 진행 알림, OpenAPI 변환, 인증 헤더 처리, 도구 설명 맞춤화로 MCP 서버의 개발·연결 경험을 개선했다.
Gemma 4는 이미지·텍스트·오디오를 처리하면서 긴 문맥, 추론 효율, 기기 내 배포를 함께 겨냥한 Apache 2.0 기반 개방형 멀티모달 모델군이다.
그라디오 서버는 리액트·스벨트·순수 HTML 같은 사용자 정의 프런트엔드를 유지하면서도 그라디오의 요청 대기열, 동시성 제어, 스트리밍, 클라이언트 호환성 및 허깅페이스 스페이스 실행 환경을 활용하게 해준다.