이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.
연관 태그
다중 턴 강화학습에서는 보상 함수가 모델이 실제로 학습할 행동을 결정하므로, 그룹 내 변별력과 안전한 실행·관측성을 갖춘 복합 보상 설계가 핵심이다.