이 작성자와 연결된 문서를 한곳에서 모아보고, 관련 태그를 따라 같은 맥락의 문서를 이어서 탐색할 수 있습니다.
자주 함께 등장한 태그
파이토치 프로파일러로 어텐션 구현을 비교한 결과, 제자리 마스킹은 불필요한 메모리 복사를 제거했지만 SDPA 수학 백엔드는 텐서 코어 미사용과 매 호출 마스크 생성으로 인해 단순 구현보다 3.7배 느렸다.
transformers의 vLLM 모델링 백엔드는 여러 호환 LLM 아키텍처에서 별도 vLLM 포팅 없이 네이티브 vLLM 구현과 같거나 더 빠른 추론 성능을 내도록 개선되었다.
NVIDIA는 에이전트 AI가 실제 세계에서 신뢰 있게 작동하려면 모델 가중치만이 아니라 공개 데이터, 합성 데이터, 큐레이션·평가·문서화까지 함께 열려 있어야 한다고 주장한다.
허깅페이스에서 지원 모델을 선택하면 한 번의 클릭으로 모델 정보와 권한이 준비된 아마존 세이지메이커 스튜디오의 미세 조정 또는 배포 화면으로 바로 이동할 수 있게 됐다.
마이크로소프트는 Hugging Face의 주요 오픈 가중치 모델을 선별·검증해 Foundry 카탈로그에 제공하고, 사전 배치된 가중치와 관리형 런타임을 통해 기업이 Foundry Managed Compute에 한 번의 흐름으로 배포하도록 지원한다.
LeRobot v0.6.0은 미래를 상상하는 월드 모델 정책, 성공을 판별하는 보상 모델, 더 풍부하고 빠른 데이터셋, 통합 평가 벤치마크를 묶어 로봇 학습 루프를 닫는 방향으로 확장된 릴리스다.
Hugging Face Storage가 SkyPilot의 정식 스토리지 백엔드가 되면서, 팀은 Hub에 둔 모델·데이터셋을 hf://로 마운트하고 어떤 클라우드의 GPU에서도 읽기 egress 비용 없이 학습·개발·서빙 작업을 실행할 수 있게 되었다.
PRX의 데이터 전략은 공개·내부 데이터셋을 폭넓게 결합하고 이미지마다 일관된 장문 설명을 다시 생성한 뒤, 탐색·가공에는 랜스를, 분산 학습 스트리밍에는 모자이크 데이터 샤드를 사용하는 것이다.
Hugging Face와 Cerebras는 개방형·모듈형 음성 AI 파이프라인에 고속 추론을 결합해 Gemma 4 기반 실시간 음성 대화를 더 자연스럽게 만들 수 있음을 보여준다.
모든 평가 결과를 표준화하는 에브리 에벌 에버와 허깅페이스 커뮤니티 평가가 연동되어, 하나의 평가를 모델 페이지·리더보드·상세 원본 기록에 동시에 게시하고 추적할 수 있게 됐다.
ScarfBench는 기업용 자바 애플리케이션의 프레임워크 마이그레이션에서 AI 코딩 에이전트가 실제로 빌드·배포·동작 보존까지 해내는지를 평가하는 공개 벤치마크입니다.
유한한 자원과 명확한 성과 압력이 존재하는 한, 최적화 이론·진화생물학·시장 경쟁·기계학습은 모두 범용적 폭보다 목표에 맞춘 전문화가 더 높은 성과를 낸다는 결론으로 수렴한다.
Hugging Face Jobs에서 vLLM OpenAI 호환 서버를 한 줄 명령으로 띄우고, 토큰 인증으로 호출하며, 필요에 따라 대형 모델·Gradio UI·SSH 디버깅·코딩 에이전트 백엔드까지 확장하는 방법을 설명한다.
NVIDIA NeMo AutoModel은 HuggingFace Transformers v5 위에 Expert Parallelism, DeepEP, TransformerEngine 커널을 얹어 MoE 모델 파인튜닝 처리량을 3.4~3.7배 높이고 GPU 메모리를 29~32% 줄이는 것을 목표로 한다.
리치 미니 대화 앱은 공개 허깅페이스 스페이스의 MCP 도구를 프로필별로 연결해, 로컬 코드를 수정하거나 내려받지 않고도 날씨 조회와 웹 검색 같은 기능을 추가할 수 있게 됐다.
CUGA는 에이전트 앱에서 반복되는 계획·실행·도구 호출·상태 관리·정책 처리를 하네스가 맡고, 개발자는 도구 목록과 프롬프트에 집중하도록 해 주는 IBM의 오픈소스 에이전트 하네스입니다.
교차 출처 저장소 API는 브라우저 AI 앱이 모델과 웹어셈블리 파일을 암호학적 해시로 식별해 출처가 달라도 하나의 검증된 사본을 공유하도록 제안함으로써, 캐시 격리로 인한 중복 다운로드와 저장 공간 낭비를 줄이려는 초기 단계의 웹 API다.
Hugging Face 팀은 huggingface hub 릴리스를 4~6주 주기에서 주간 배포로 바꾸기 위해 공개 도구, 오픈 웨이트 모델, 결정론적 검증, 사람의 최종 판단을 결합한 GitHub Actions 기반 릴리스 파이프라인을 만들었다.
몰모모션은 영상 관찰, 객체의 3차원 질의점, 행동 지시를 결합해 향후 수초간의 객체 움직임을 예측하고, 그 궤적을 로봇 계획과 제어 가능한 영상 생성에 활용하는 언어 기반 3차원 동작 예측 모델이다.
PP OCRv6는 1.5M~34.5M 규모의 세 가지 모델과 최대 50개 언어 지원, 여러 추론 백엔드를 결합해 실제 환경에서 정확하고 구조화된 OCR 결과를 제공하는 경량 모델 제품군이다.
기존 NVIDIA GB10 장비에서 Gemma와 Qwen을 제한된 에이전트 하네스로 구동해 OpenClaw 이슈·PR을 실시간 분류하고, 필요한 항목만 디스코드로 전달하는 로컬 트리아지 시스템을 구축·평가한 사례다.
LoRA는 강력하고 대중적인 선택이지만, 동일 조건의 다차원 벤치마크에서는 과제와 우선순위에 따라 다른 PEFT 기법이 더 높은 성능이나 더 낮은 메모리 사용량을 제공할 수 있다.
이 글은 transformers를 사례로, 오픈 모델 기반 코딩 에이전트가 도구를 얼마나 쉽게 발견하고 사용하며 정답에 도달하는지 과정을 중심으로 측정하는 벤치마크 방법을 제시한다.
MosaicLeaks는 딥 리서치 에이전트의 외부 웹 쿼리 로그가 사적 문서의 정보를 조각조각 누출할 수 있음을 보이고, 쿼리 구성 방식에 보상 신호를 주는 PA DR이 성능을 유지하면서 누출을 크게 줄인다는 결과를 제시한다.