Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#agent-evaluation
Tag5건YouTube 1Article 4

#agent-evaluation

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#agent-memory-overview공동문서 1 · 연관도 45%#ai-agent-architecture공동문서 1 · 연관도 45%#benchmark-diagnosis공동문서 1 · 연관도 45%#braintrust공동문서 1 · 연관도 45%#completion-criteria-loop공동문서 1 · 연관도 45%#durable-agent-primitives공동문서 1 · 연관도 45%#eval-first-agents공동문서 1 · 연관도 45%#failure-pattern-mining공동문서 1 · 연관도 45%#failure-vector-diagnosis공동문서 1 · 연관도 45%#grader-subagent공동문서 1 · 연관도 45%
쓸수록 똑똑해지는 AI 에이전트, 헤르메스 완벽 정리
YouTube2026년 6월 7일

쓸수록 똑똑해지는 AI 에이전트, 헤르메스 완벽 정리

쓸수록 똑똑해지는 AI 에이전트 헤르메스의 핵심은 모델 재학습이 아니라, 반복 작업의 절차·주의점·검증법을 사람이 읽을 수 있는 스킬로 축적해 다음 작업의 실패를 줄이는 구조입니다.

메이커 에반
#ai-agent#skill-based-memory#agent-evaluation#skills-not-retraining
Introducing Rubrics: Build Agents that Evaluate and Correct Their Work
Article2026년 6월 2일

Introducing Rubrics: Build Agents that Evaluate and Correct Their Work

RubricMiddleware는 에이전트가 명확한 완료 기준에 도달할 때까지 별도 채점 에이전트의 피드백을 받아 스스로 평가하고 수정하도록 만드는 Deep Agents용 반복 검증 장치다.

langchain.com
#langchain#rubricmiddleware#claude-code#deep-agents
Untitled
Article2026년 5월 19일

Untitled

LangSmith Engine은 에이전트 실행 trace 위에서 반복 실패를 찾아 이슈로 정리하고, 평가기·데이터셋 예시·수정 제안으로 이어지게 하는 에이전트입니다.

LangChain
#langchain#langsmith#deep-agents#langsmith-engine
What to Learn, Build, and Skip in AI Agents (2026)
Article2026년 4월 29일

What to Learn, Build, and Skip in AI Agents (2026)

AI 에이전트 시대에는 매주 바뀌는 프레임워크보다 오래 남는 기본 원리, 평가 체계, 도구 설계, 안전한 실행 환경을 고르는 능력이 더 중요하다.

Rohit
#braintrust#langfuse#langgraph#langsmith
IBM and UC Berkeley Diagnose Why Enterprise Agents Fail Using IT-Bench and MAST
Article2026년 4월 21일

IBM and UC Berkeley Diagnose Why Enterprise Agents Fail Using IT-Bench and MAST

IBM Research와 UC Berkeley는 ITBench 실행 추적에 MAST 실패 분류법을 적용해 엔터프라이즈 IT 자동화 에이전트가 단순히 실패했는지가 아니라 어디서, 왜, 어떤 방식으로 무너지는지를 진단했다.

huggingface.co
#itbench#ibm-research#uc-berkeley#gemini-3-flash