Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#asynchronous-policy-correction
Tag1건Article 1

#asynchronous-policy-correction

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#agentic-reinforcement-learning공동문서 1 · 연관도 100%#dense-reasoning-models공동문서 1 · 연관도 100%#granite-4-2공동문서 1 · 연관도 100%#granite42공동문서 1 · 연관도 100%#long-context-pretraining공동문서 1 · 연관도 100%#supervised-fine-tuning공동문서 1 · 연관도 45%#technical-deep-dive공동문서 1 · 연관도 30%#long-context공동문서 1 · 연관도 14%
Granite 4.2 LLMs: How They're Built
Article2026년 8월 25일

Granite 4.2 LLMs: How They're Built

IBM의 Granite 4.2는 3B·8B·30B 밀집형 추론 모델 제품군으로, 약 15T 토큰 사전학습과 지도 미세조정, 다단계 강화학습을 거치며 8B·30B에는 실제 환경에서 도구를 사용하는 에이전트 강화학습이 추가된다.

huggingface.co
#granite-4-2#asynchronous-policy-correction#long-context#agentic-reinforcement-learning