이 작성자와 연결된 문서를 한곳에서 모아보고, 관련 태그를 따라 같은 맥락의 문서를 이어서 탐색할 수 있습니다.
자주 함께 등장한 태그
허깅페이스는 기존 사용자의 작업 방식을 유지하는 브리지와 무중단 백그라운드 마이그레이션을 기반으로, 50만 개 저장소와 20페타바이트 규모의 허브를 깃 대용량 파일 저장소에서 젯으로 전환하고 있다.
멀티모달 학습의 GPU 유휴 시간과 과도한 패딩을 줄이기 위해, 데이터셋 분석부터 토큰·이미지 제약을 함께 고려하는 균형 잡힌 배낭식 배치 구성까지 단계적으로 개선한 사례다.
팔콘 에이치원 아라빅은 맘바와 트랜스포머를 결합한 하이브리드 구조, 최대 25만 6천 토큰의 문맥 창, 아랍어 특화 데이터와 후속 학습을 통해 규모별 최고 수준의 아랍어 처리 성능을 목표로 한 3종 모델군이다.
ScreenEnv는 Docker 기반의 격리된 우분투 데스크톱과 직접 제어 API·MCP 연동을 제공해 GUI 에이전트의 개발, 테스트, 배포를 단순화하는 Python 라이브러리다.
허깅페이스는 사용자가 도구와 Gradio 애플리케이션을 맞춤 구성할 수 있는 공식 MCP 서버를 구축하면서, 변화가 빠른 MCP 전송 규격 가운데 상태 비저장·직접 응답 방식의 Streamable HTTP를 운영 환경에 선택한 이유와 실제 배포 경험을 설명한다.
김이나 프로버는 중간 보조정리를 재귀적으로 생성·선별·결합하는 테스트 시점 강화학습 탐색과 린 오류 기반 교정 기능을 통해 미니에프투에프에서 92.2%의 최고 통과율을 기록한 형식 정리 증명 모델이다.
Reachy Mini는 Pollen Robotics와 Hugging Face가 공개한 데스크톱 크기의 오픈소스 로봇으로, 인간 로봇 상호작용과 AI 실험을 Python 기반으로 쉽게 시도하도록 설계된 제품입니다.
Gradio의 MCP 지원을 활용하면 Hugging Face Spaces의 다양한 AI 도구를 Cursor 같은 LLM 클라이언트에 연결해 이미지 편집, 영상 전사, OCR, 음성 합성 등의 새로운 기능을 부여할 수 있습니다.
SmolLM3는 공개 데이터와 학습 도구로 구축한 30억 매개변수 모델로, 11조 개가 넘는 토큰의 단계별 사전학습과 장문·추론 중간학습을 결합해 다국어, 최대 128K 문맥, 추론·비추론 이중 모드를 지원한다.
허깅페이스 인프라팀은 네트워크 트래픽 임계치와 로그 보관 성공률 같은 경보를 통해 비용 증가, 구성 오류, 로그 유실을 대형 장애로 번지기 전에 탐지한다.
이 글은 Sentence Transformers로 reranker 또는 Cross Encoder 모델을 도메인 데이터에 맞게 학습·파인튜닝하는 구성요소, 데이터 형식, hard negative mining의 중요성을 설명하고, 저자가 학습한 ModernBERT 기반 reranker가 자신의 평가 데이터에서 기존 공개 모델들을 앞섰다고 소개한다.
Diffusers는 Flux의 핵심 구성 요소를 여러 백엔드로 양자화해 이미지 품질을 크게 훼손하지 않으면서 메모리 사용량을 줄일 수 있으며, 정밀도와 백엔드에 따라 속도·메모리·사용 편의성의 차이가 뚜렷하다.
Hugging Face Hub가 Hyperbolic, Nebius AI Studio, Novita를 새 서버리스 추론 제공자로 추가해 모델 페이지와 JS·Python SDK에서 여러 모델을 더 쉽게 선택해 사용할 수 있게 했다.
SGLang은 트랜스포머스 호환 모델을 자동 대체 백엔드로 실행해 폭넓은 모델 접근성과 고성능 추론·배포 기능을 결합합니다.
다중 사용자 환경의 대규모 언어 모델 서빙에서는 사용자별 공정 스케줄링과 백엔드 지표 기반의 동적 요청 제어를 결합해야 지연 시간을 줄이면서 그래픽 처리 장치 활용률을 유지할 수 있다.
허깅페이스 허브의 추론 제공업체에 Groq가 추가되어, 사용자는 모델 페이지와 Python·JavaScript SDK에서 공개 대규모 언어 모델을 빠르게 호출하고 인증 및 결제 방식도 선택할 수 있게 됐다.
허깅페이스 허브의 Inference Providers에 Featherless AI가 추가되어, 다양한 텍스트·대화형 오픈소스 모델을 서버리스 방식으로 선택해 사용할 수 있게 되었다.
긴 프롬프트가 포함된 요청은 프리필 대기열과 동시 디코딩을 지연시키며, 요청 병렬 프리필은 첫 토큰 지연을 줄이고 프리필·디코드 분리 구조는 토큰 생성 간섭을 완화한다.
Hugging Face와 NVIDIA는 연구기관과 기업이 필요한 시점·규모·기간에 맞춰 대규모 GPU 클러스터를 요청하고 학습 작업에 활용할 수 있는 Training Cluster as a Service를 발표했다.
H Company는 웹 UI를 이해하고 클릭 위치를 정밀하게 찾는 오픈소스 액션 비전 언어 모델 Holo1과 1,639개 UI 과제로 구성된 WebClick 벤치마크를 공개했으며, 이를 기반으로 브라우저 자동화 에이전트 Surfer H를 구동한다고 밝혔다.
AssetOpsBench는 산업 설비 운영 환경에서 AI 에이전트가 실제로 안전하고 신뢰할 수 있게 작동하는지를 다중 에이전트 조정, 근거 기반 판단, 실패 인식, 작업 실행 가능성 중심으로 평가하는 벤치마크입니다.
나노브이엘엠에 계층별 키·값 캐시와 사전 채움·순차 해독 구조를 직접 구현해, 자기회귀 생성의 중복 계산을 줄이고 생성 속도를 38% 높인 과정과 원리를 설명한다.
FLUX.1 dev의 트랜스포머를 4비트로 양자화하고 LoRA, 8비트 옵티마이저, 체크포인팅, 잠재 표현·텍스트 임베딩 캐시를 결합해 단일 GPU에서 약 10GB 미만의 VRAM으로 미세 조정하는 방법을 설명한다.
이 글은 CodeAgent의 유연한 코드 실행 방식에 구조화된 JSON 출력을 결합하면, 충분히 강한 모델에서 파싱 안정성과 추론 명시성이 높아져 여러 벤치마크 성능이 개선된다고 설명한다.