이 작성자와 연결된 문서를 한곳에서 모아보고, 관련 태그를 따라 같은 맥락의 문서를 이어서 탐색할 수 있습니다.
자주 함께 등장한 태그
이 글은 Sentence Transformers로 희소 임베딩 모델을 미세조정하는 이유와 기본 구성요소를 설명하며, SPLADE 계열 모델의 해석 가능성·확장 방식·도메인 적응 필요성을 실용 예제로 보여준다.
라이거의 청크 단위 손실 계산을 TRL의 그룹 상대 정책 최적화에 통합해 모델 품질을 유지하면서 최대 GPU 메모리를 40% 줄이고, 분산 학습과 매개변수 효율적 미세 조정 및 고속 생성 서버 연계까지 지원한 결과를 소개한다.
TRL의 co located vLLM은 GRPO의 학습과 생성을 동일한 GPU·분산 프로세스 그룹에서 번갈아 실행해 유휴 시간과 통신 비용을 줄이며, 모델 크기와 텐서 병렬화 설정에 따라 최대 1.73배의 처리량 향상을 보였다.
로봇 정책이 미래 행동 묶음을 예측하는 동안 실행을 멈추는 문제를 줄이기 위해, 글은 행동 예측과 실행을 분리하는 비동기 추론 구조로 지연을 제거하고 더 촘촘한 제어 루프를 만드는 방법을 설명합니다.
TRL v1.0은 빠르게 변하는 포스트트레이닝 분야에서 안정적인 핵심 API와 실험적 방법을 함께 수용하도록 설계된 Hugging Face 생태계의 범용 포스트트레이닝 라이브러리다.