이 작성자와 연결된 문서를 한곳에서 모아보고, 관련 태그를 따라 같은 맥락의 문서를 이어서 탐색할 수 있습니다.
자주 함께 등장한 태그
이 글은 RGB 이미지를 회색조로 변환하는 CUDA 커널을 예제로 삼아 구현, PyTorch 네이티브 연산자 등록, 재현 가능한 빌드, 다중 환경 컴파일, Hugging Face Hub 배포까지의 전체 과정을 설명한다.
Claude에 Hugging Face MCP 서버와 이미지 생성용 Gradio Space를 연결하면 프롬프트 작성, 결과 확인, 반복 개선을 대화 안에서 수행하며 Krea와 Qwen Image 같은 최신 모델을 활용할 수 있다.
모델 컨텍스트 프로토콜은 논문·구현 코드·모델·데이터셋을 여러 플랫폼에서 찾고 교차 확인하는 연구 탐색 도구를 인공지능이 자연어 지시로 활용하도록 연결하는 표준이다.
TRL은 비전 언어 모델 정렬을 기존 SFT·DPO에서 MPO·GRPO·GSPO와 RLOO·Online DPO까지 확장해, 멀티모달 선호 학습과 강화학습을 더 유연하게 적용할 수 있도록 지원한다.
ExecuTorch 0.7은 KleidiAI를 기본 활성화하고 널리 보급된 Arm의 SDOT 명령어를 활용해, 최신 스마트폰뿐 아니라 구형 안드로이드 기기와 라즈베리 파이 5에서도 실용적인 온디바이스 생성형 인공지능을 지원한다.
TextQuests는 25개의 고전 텍스트 어드벤처 게임을 통해 LLM 에이전트의 장기 문맥 추론, 탐색 학습, 공간 이해, 행동 효율성과 유해 행동 경향을 평가하는 벤치마크다.
Accelerate와 Axolotl은 데이터·완전 샤딩 데이터·텐서·컨텍스트 병렬화를 조합해 대규모 모델의 메모리 사용량, 계산량, 장치 간 통신 비용을 균형 있게 설계하도록 지원한다.
NeurIPS 2025 E2LM Competition은 LLM 초기 학습 단계에서 과학 지식과 추론 신호를 더 잘 포착하는 벤치마크를 함께 만들기 위한 대회다.
NVIDIA의 개방형 딥리서치 에이전트 AI Q는 두 Llama 계열 모델과 검색·오케스트레이션 도구를 결합해 2025년 8월 DeepResearch Bench의 ‘LLM with Search’ 부문에서 종합 40.52점을 기록했다.
Gradio의 MCP 통합을 이용해 웹 탐색 도구와 IDM VTON 가상 피팅 모델을 연결하고, VS Code AI 채팅에서 사용할 수 있는 개인용 AI 쇼핑 도우미를 구현하는 방법을 설명한다.
Hugging Face AI Sheets는 스프레드시트형 인터페이스에서 프롬프트와 공개 AI 모델을 활용해 데이터셋을 만들고, 변환하고, 보강하고, 평가할 수 있게 해주는 오픈소스 노코드 도구다.
Google Cloud의 5세대 Xeon 기반 C4 인스턴스는 3세대 Xeon 기반 N2보다 텍스트 임베딩과 텍스트 생성에서 큰 처리량 및 비용 효율 우위를 보이며, 경량 에이전틱 AI를 CPU만으로 배포할 가능성을 보여준다.
트래키오는 로컬 대시보드, 허깅페이스 스페이스 공유, 기존 wandb 호환 API를 결합한 무료 오픈소스 실험 추적 파이썬 라이브러리다.
동시 요청을 처리하는 LLM 추론에서는 프리필과 디코드의 계산 특성이 달라, 첫 토큰 지연·토큰 생성 지연·총처리량·GPU 활용률 사이의 균형에 맞춰 배칭과 프리필 청크 크기를 조정해야 한다.
Protect AI와 Hugging Face의 6개월 파트너십은 Guardian 스캔으로 447만 개 모델 버전을 검사하고 35.2만 건의 unsafe/suspicious 이슈를 찾아, 공개 모델 사용자가 보안 위험을 더 명확히 판단하도록 돕고 있다.
이 글은 Codex가 Hugging Face Skills를 활용해 데이터 검증, 모델 파인튜닝, 학습 모니터링, 평가, 보고서 갱신, Hub 배포까지 이어지는 오픈소스 모델 실험을 수행하는 방법을 설명한다.
Jupyter Agent 프로젝트는 노트북 안에서 코드 실행과 추론을 결합하는 데이터 과학 에이전트를 만들고, Kaggle 노트북 기반 데이터 파이프라인으로 소형 Qwen3 4B 모델의 DABStep 성능을 끌어올리려는 시도다.
Ulysses Sequence Parallelism은 긴 시퀀스 학습에서 시퀀스와 어텐션 헤드를 함께 나누고 all to all 통신으로 재배치해, 단일 GPU 메모리 한계를 넘어 수십만~백만 토큰 문맥 학습을 가능하게 하는 방식이다.
TimeScope는 1분부터 8시간까지의 영상에 짧은 동영상 클립을 삽입해 검색·정보 종합·세밀한 시간 지각 능력을 측정하며, 최신 비전 언어 모델의 장시간 영상 이해가 아직 제한적임을 보여주는 오픈소스 벤치마크다.
FutureBench는 AI 에이전트가 과거 지식 암기나 고정 벤치마크 풀이를 넘어, 실제 미래 사건을 정보 수집·종합·확률적 추론으로 예측할 수 있는지 평가하려는 벤치마크다.
Consilium은 서로 다른 역할을 맡은 여러 언어 모델이 구조화된 토론과 외부 조사를 거쳐 합의 또는 최종 분석을 도출하도록 만든 시각적 다중 모델 협업 플랫폼이다.
2024년 창작 AI는 오픈소스 이미지 생성의 구조적 도약과 개인화 기술의 대중화를 이뤘으며, 2025년에는 비디오·오디오·3D 등 더 다양한 형식으로 발전의 중심이 이동하고 있다.
CUDA 커널 개발 지식을 에이전트 스킬로 구조화해 Claude와 Codex가 실제 diffusers·transformers 대상의 커널, PyTorch 바인딩, 빌드 구성, 벤치마크까지 완성하도록 한 사례다.
에틴은 동일한 공개 데이터 2조 토큰, 모델 구조, 학습 절차를 적용한 1,700만~10억 매개변수 규모의 인코더·디코더 쌍으로, 두 아키텍처를 공정하게 비교하면서 양쪽 모두에서 공개 데이터 기반 최고 수준의 성능을 달성한 모델군이다.