Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#benchmark-study
Tag3건Article 3

#benchmark-study

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#agent-coordination-gap공동문서 1 · 연관도 58%#agent-teamwork-evaluation공동문서 1 · 연관도 58%#agent-verification공동문서 1 · 연관도 58%#batch-rubric-scoring공동문서 1 · 연관도 58%#big-bench공동문서 1 · 연관도 58%#big-bench-hard공동문서 1 · 연관도 58%#cheap-judge-models공동문서 1 · 연관도 58%#code-integration-checks공동문서 1 · 연관도 58%#compute-scaling-curves공동문서 1 · 연관도 58%#cooperbench공동문서 1 · 연관도 58%
Designing Efficient Verifiers for Legal Agents
Article2026년 6월 2일

Designing Efficient Verifiers for Legal Agents

LangChain과 Harvey는 법률 에이전트 평가에서 검증기 비용이 병목이 되는 문제를 다루며, 기준별 호출을 배치 검증으로 묶고 더 저렴한 오픈 모델을 활용하면 frontier 모델에 가까운 성능을 유지하면서 비용을 크게 줄일 수 있다고 설명한다.

langchain.com
#harvey#langchain#lab-benchmark#deepseek-v4-flash
AI Coding Agents Fail at Teamwork
Article2026년 6월 1일

AI Coding Agents Fail at Teamwork

스탠퍼드 연구진의 CooperBench 연구는 현재의 AI 코딩 에이전트가 단독 작업보다 협업에서 성능이 크게 떨어지며, 병목은 코딩 능력보다 사회적 조정 능력에 있음을 보여준다.

hai.stanford.edu
#cooperbench#python#hao-zhu#stanford-hai
How predictable is language model benchmark performance?
Article2023년 6월 9일

How predictable is language model benchmark performance?

Epoch AI는 11개 최신 언어모델 아키텍처와 36개 모델 크기의 데이터를 분석해, 벤치마크 전체 성능은 컴퓨트 스케일링만으로도 어느 정도 예측 가능하지만 개별 과제 성능은 훨씬 변동성이 크다고 결론낸다.

David Owen
#big-bench#david-owen#epoch-ai#big-bench-hard