Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#agent-benchmarking
Tag2건Article 2

#agent-benchmarking

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#accuracy-cost-tradeoff공동문서 1 · 연관도 71%#agent-debugging-traces공동문서 1 · 연관도 71%#api-chaining공동문서 1 · 연관도 71%#benchmark-deep-dive공동문서 1 · 연관도 71%#execution-trace-evaluation공동문서 1 · 연관도 71%#gaia2공동문서 1 · 연관도 71%#interactive-agent-environments공동문서 1 · 연관도 71%#multi-source-reasoning공동문서 1 · 연관도 71%#realistic-agent-evaluation공동문서 1 · 연관도 71%#rest-bird공동문서 1 · 연관도 71%
Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents
Article2026년 3월 31일

Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents

VAKRA는 기업형 환경에서 에이전트가 API, 문서, 대화 맥락, 정책 제약을 넘나들며 다단계 추론과 도구 사용을 실제 실행 궤적으로 수행할 수 있는지 평가하는 실행 중심 벤치마크다.

huggingface.co
#vakra#hugging-face#ibm-research#rest-bird
Gaia2 and ARE: Empowering the community to study agents
Article2025년 9월 25일

Gaia2 and ARE: Empowering the community to study agents

Gaia2와 ARE는 기존 GAIA보다 현실적인 실패, 시간 제약, 모호성, 상호작용을 포함해 AI 에이전트를 더 깊이 평가하고 디버깅할 수 있게 하는 공개 벤치마크와 실행 환경이다.

huggingface.co
#gaia2#gpt-5#hugging-face#kimi-k2