이 작성자와 연결된 문서를 한곳에서 모아보고, 관련 태그를 따라 같은 맥락의 문서를 이어서 탐색할 수 있습니다.
자주 함께 등장한 태그
FFASR 리더보드는 실제 공간의 잔향·소음·마이크 거리로 발생하는 원거리 음성인식 성능 저하를 14개 시뮬레이션 공간과 실측 검증, 정확도·속도 지표를 통해 공개적으로 비교하는 벤치마크다.
huggingface hub v1.0은 모델·데이터셋·스페이스를 공유하는 단순한 Git 보조 도구에서 출발해, 5년 동안 개방형 머신러닝 생태계의 공통 기반으로 성장한 라이브러리의 성숙과 차세대 전환을 담은 릴리스다.
메타·파이토치와 허깅페이스가 에이전트의 도구, 인증, 실행 맥락을 안전하게 묶어 훈련과 배포에 함께 사용할 수 있는 개방형 환경 표준 및 공유 공간인 오픈엔브 허브를 공개했다.
문장 임베딩 생태계의 핵심 오픈소스 프로젝트인 센텐스 트랜스포머스가 다름슈타트 공과대학교의 유비쿼터스 지식 처리 연구실에서 허깅페이스로 이관되며, 기존 개방성과 공동체 중심 운영을 유지한 채 새로운 성장 단계에 들어선다.
허깅페이스는 데이터 파일 목록의 공유 캐시, 요청 최적화, Parquet 사전 가져오기와 버퍼 조정을 통해 대규모 데이터셋 스트리밍의 시작 요청을 최대 100분의 1로 줄이고 처리량을 최대 2배로 높였다.
LLM jp와 허깅페이스가 일본어의 복합적인 언어 특성을 반영한 16개 과제와 20개 이상의 데이터셋으로 개방형 일본어 대규모 언어 모델을 비교·분석하는 공개 리더보드를 구축했다.
허깅페이스 AI Sheets는 스프레드시트 안에서 오픈 비전 모델을 활용해 이미지의 정보를 추출·구조화하고, 텍스트와 이미지를 생성·편집하며, 완성된 데이터셋까지 내보낼 수 있게 확장됐다.
식품 알레르기 연구에 인공지능을 접목하고, 분자·임상·식품 안전 데이터를 개방형으로 연결해 예측과 진단, 치료제 탐색, 소비자 보호를 발전시키려는 공동체 주도 연구 프로젝트를 소개한다.
이 글은 Hugging Face Skills의 hf llm trainer를 통해 Claude 같은 코딩 에이전트가 데이터 검증, GPU 선택, 학습 작업 제출, 모니터링, Hub 업로드까지 오픈소스 LLM 파인튜닝 전 과정을 처리하는 방법을 설명한다.
mmBERT는 1,833개 언어와 3조 개 이상의 토큰으로 학습해 XLM R을 넘어서는 다국어 성능, 최대 8,192토큰의 문맥 처리, 기존 다국어 인코더 대비 2~4배의 효율을 함께 달성한 ModernBERT 기반 인코더 모델이다.
RedNote의 30억 매개변수 OCR 모델 dots.ocr를 단일 이미지 처리에 맞게 단순화하고, 비전 인코더를 Core ML로 변환해 PyTorch와 유사한 출력까지 검증한 온디바이스 구현 기록이다.
RTEB는 공개·비공개 데이터셋을 함께 활용해 임베딩 모델의 미지 데이터 검색 성능과 실제 응용 적합성을 공정하게 평가하려는 새로운 검색 벤치마크다.
Gaia2와 ARE는 기존 GAIA보다 현실적인 실패, 시간 제약, 모호성, 상호작용을 포함해 AI 에이전트를 더 깊이 평가하고 디버깅할 수 있게 하는 공개 벤치마크와 실행 환경이다.
Public AI가 Hugging Face Hub의 Inference Provider로 추가되어, 사용자는 허브 UI와 JS·Python SDK에서 공공·주권 AI 모델을 Public AI 경로로 실행할 수 있게 됐다.
Scaleway가 Hugging Face 추론 제공자로 추가되면서 사용자는 허브와 파이썬·자바스크립트 SDK에서 다양한 공개 가중치 모델을 Scaleway의 서버리스 추론 환경으로 이용할 수 있게 되었습니다.
RiskRubric.ai는 인공지능 모델을 투명성·신뢰성·보안·개인정보 보호·안전성·평판의 여섯 축으로 평가해, 개발자와 조직이 비교 가능한 위험 점수에 근거하여 모델을 선택하고 배포하도록 돕는 공개 표준화 구상이다.
Judge Arena는 LLM 평가자들을 익명·무작위 대결 방식으로 비교하고, 사람들의 투표를 Elo 리더보드로 집계해 어떤 모델이 더 나은 ‘판사’인지 벤치마킹하려는 플랫폼이다.
이 글은 NVIDIA Isaac for Healthcare의 SO ARM 스타터 워크플로를 통해 시뮬레이션 데이터 수집, GR00T N1.5 후학습, Isaac Lab 평가, 실제 SO ARM101 하드웨어 배포까지 이어지는 의료 로봇 개발 과정을 설명한다.
NVIDIA Isaac for Healthcare의 SO ARM 스타터 워크플로는 시뮬레이션 데이터 수집, 혼합 학습, 평가, 실제 하드웨어 배포까지 이어지는 의료 로봇 개발 과정을 하나의 실습형 파이프라인으로 제시한다.
이 글은 NVIDIA Isaac GR00T N1.5를 저가형 오픈소스 LeRobot SO 101 로봇팔에 맞게 후학습하고, 데이터 준비부터 평가·실물 배포까지 진행하는 절차를 단계별로 설명한다.
LeRobotDataset v3.0은 여러 로봇 에피소드를 하나의 데이터·영상 파일로 묶고 관계형 메타데이터로 개별 에피소드를 찾아내는 구조를 도입해, 대규모 데이터셋의 파일 시스템 부담을 줄이고 스트리밍 처리를 지원합니다.
Together AI는 Hugging Face Hub의 호환 LLM을 자사 인프라에서 쉽게 파인튜닝하고 배포·다운로드·허브 재업로드까지 할 수 있는 기능을 발표했다.
FilBench는 타갈로그어·필리피노어·세부아노어에 대한 대규모 언어 모델의 문화 지식, 전통적 자연어 처리, 독해, 생성 능력을 체계적으로 측정하고, 지역 특화 학습 데이터와 공개 가중치 모델의 가능성 및 번역 성능의 한계를 보여 주는 평가 모음이다.
TNG는 머리말과 꼬리말을 의도적으로 생략하던 olmOCR를 8,000개 문서로 미세조정해, 문서의 논리적 읽기 순서를 유지하면서 업무상 중요한 주변 정보까지 충실하게 추출하는 OCR 모델로 개선했다.