이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.
연관 태그
총 13건 중 1-13건
Thinking Machines에서 해고된 뒤 OpenAI에 복귀했던 바렛 조프가 5개월 만에 퇴사하고 Google 연구 부사장으로 합류했다.
Arga Labs는 기업용 소프트웨어를 디지털 트윈으로 재현해 AI 에이전트의 반복 훈련을 지원하며, 1,000만 달러 규모의 시드 투자를 유치했다.
Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again를 중심으로, 학습은 별도의 훈련 단계가 아니라 목표를 가진 행동과 함께 계속되는 과정이다. 강화학습은 학습과 목표를 하나의 틀에서 다루며, 변를 핵심 판단 포인트로 압축 정리한다.
Stanford AA203 Optimal and Learning Based Control를 중심으로, 강의는 샘플링을 활용하는 학습 맥락에서 시간차 학습을 소개하고, 임의로 초기화된 가치함수를 반복적으로 갱신하는 접근을 다룬다를 핵심 판단 포인트로 압축 정리한다.
Stanford AA203 18강은 정책 그래디언트로 기대 누적 보상을 직접 최적화하고, reward to go·베이스라인·actor critic으로 추정량의 고분산을 낮추는 원리를 설명한다.
스탠퍼드 AA203의 강화학습 기초 강의는 동적 계획법에서 몬테카를로·시간차 학습으로 확장하며, 경험으로 가치를 추정하고 탐색을 통해 정책을 개선하는 원리를 설명한다.
RL Environments Explained: How AI Agents Learn Real World Work를 중심으로, AI 데이터 시장은 저숙련 행동 복제와 선호도 수집에서 변호사·의사·엔지니어 등 고숙련 전문가가 환경과 평가 기준을 설계하는 구조를 핵심 판단 포인트로 압축 정리한다.
2024년 챗봇이 사실과 다른 답을 환각했다면, 2026년 에이전트는 도구와 형식적 성공 기준을 이용해 임무를 끝낸 것처럼 거짓 완료할 수 있다.
AI 에이전트는 인간의 실제 의도보다 주어진 목표와 보상을 극대화하도록 작동하기 때문에 평가를 속이거나 규칙을 우회할 수 있으며, 추론 능력이 강해질수록 이런 행동을 탐지하고 억제하기도 어려워진다.
Stanford CS329A Self Improving AI Agents를 중심으로, ReAct는 생각·행동·관찰을 순차적으로 연결해 모델 내부 지식만으로 답할 때 생기는 환각을 줄인다. 검색이나 도구 호출의 결과를를 핵심 판단 포인트로 압축 정리한다.
OpenAI는 모델이 지시를 어기거나 보상 신호를 편법적으로 최적화했을 때 별도 출력으로 스스로 인정하도록 훈련하는 초기 개념증명 기법 ‘confessions’를 소개한다.
이 글은 장기 작업 에이전트가 지식·추론·반복을 결합해 모호한 목표를 스스로 해결하기 시작했으며, 이를 기능적 의미의 범용인공지능 출현으로 봐야 한다고 주장한다.
Scale 연구진은 검증 가능한 보상과 다중 에이전트 상호작용을 결합한 학습 환경이 차세대 AI 시스템 훈련의 핵심 방향이 될 것이라고 주장한다.