이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.
연관 태그
Stanford AA203 18강은 정책 그래디언트로 기대 누적 보상을 직접 최적화하고, reward to go·베이스라인·actor critic으로 추정량의 고분산을 낮추는 원리를 설명한다.