Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#llm-evaluation
Tag10건YouTube 1Article 9

#llm-evaluation

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#llm-as-judge공동문서 4 · 연관도 52%#evaluation-methodology공동문서 2 · 연관도 45%#a-b-test공동문서 1 · 연관도 32%#ab-testing공동문서 1 · 연관도 32%#agent-monitoring공동문서 1 · 연관도 32%#agent-reliability-gap공동문서 1 · 연관도 32%#agent-verification공동문서 1 · 연관도 32%#agentic-llm-systems공동문서 1 · 연관도 32%#application-specific-retrieval공동문서 1 · 연관도 32%#arabic-language-models공동문서 1 · 연관도 32%
LangChain State of AI 2023
Article2026년 8월 26일

LangChain State of AI 2023

2023년 하반기 LangSmith의 익명 사용 데이터는 LLM 애플리케이션 개발이 검색, 맞춤형 구성, 다중 평가를 중심으로 진행됐으며 에이전트는 신뢰성과 성능 제약으로 제한적으로 채택됐음을 보여준다.

langchain.com
#langchain#langsmith#agent-reliability-gap#application-specific-retrieval
When to Build Your Own Agent Harness
YouTube2026년 8월 13일

When to Build Your Own Agent Harness

When to Build Your Own Agent Harness를 중심으로, 에이전트의 실질적인 지능은 모델 하나가 아니라 모델·컨텍스트·하네스의 결합에서 나오므로, 세 축을 통제해야 공급자 종속을 줄이고를 핵심 판단 포인트로 압축 정리한다.

Sequoia Capital
#ai-agent#agent-harnesses#llm-evaluation#agent-observability
Empty shelves or lost keys? Recall is the bottleneck for parametric factuality
Article2026년 8월 12일

Empty shelves or lost keys? Recall is the bottleneck for parametric factuality

최전선 대규모 언어 모델의 사실 오류는 지식이 아예 저장되지 않은 ‘빈 선반’보다 이미 부호화된 지식을 꺼내지 못하는 ‘잃어버린 열쇠’형 회상 실패에서 더 많이 발생한다.

research.google
#wikiprofile#gpt-5#gemini-3-pro#recall-bottleneck
Hands-On with Langfuse: Tracing, Sessions, Evaluations, and LLM-as-a-Judge
Article2026년 6월 14일

Hands-On with Langfuse: Tracing, Sessions, Evaluations, and LLM-as-a-Judge

이 글은 Langfuse를 로컬에 self hosted로 설치한 뒤 OpenAI 호출 추적, 메타데이터, 세션·사용자 연결, 내장 평가기와 LLM as a Judge 설정까지 직접 실습한 과정을 정리한다.

ai.plainenglish.io
#langfuse#openai#postgresql#docker-compose
Defining and evaluating political bias in LLMs
Article2026년 6월 4일

Defining and evaluating political bias in LLMs

OpenAI는 ChatGPT가 기본적으로 정치적 편향 없이 객관성을 유지해야 한다는 원칙을 실제 대화형 평가로 측정하기 위해, 약 500개 프롬프트와 다섯 가지 편향 축을 갖춘 자동 평가 체계를 만들고 GPT‑5 계열에서 편향 감소를 확인했다고 설명한다.

openai.com
#chatgpt#openai#gpt-5-instant#gpt-5-thinking
Designing Efficient Verifiers for Legal Agents
Article2026년 6월 2일

Designing Efficient Verifiers for Legal Agents

LangChain과 Harvey는 법률 에이전트 평가에서 검증기 비용이 병목이 되는 문제를 다루며, 기준별 호출을 배치 검증으로 묶고 더 저렴한 오픈 모델을 활용하면 frontier 모델에 가까운 성능을 유지하면서 비용을 크게 줄일 수 있다고 설명한다.

langchain.com
#harvey#langchain#lab-benchmark#deepseek-v4-flash
Better Experiments with LLM Evals — A funnel, not a fork
Article2026년 5월 18일

Better Experiments with LLM Evals — A funnel, not a fork

Spotify Engineering은 LLM 평가를 A/B 테스트의 대체재가 아니라, 실험 전 후보를 걸러내고 실험 후 판단 기준을 보정하는 ‘평가 퍼널’로 사용해야 한다고 설명한다.

Matilda Ankargren (Senior Data Scientist) and Mårten Schultzberg (Senior Manager/Staff Data Scientist)
#llm#spotify#llm-judge#spotify-engineering
Towards a science of scaling agent systems: When and why agent systems work
Article2026년 1월 28일

Towards a science of scaling agent systems: When and why agent systems work

Google Research는 180개 에이전트 구성의 통제 평가를 통해 다중 에이전트가 병렬화 가능한 과제에서는 성능을 크게 높이지만, 순차적 추론 과제에서는 오히려 성능을 떨어뜨릴 수 있다는 정량적 스케일링 원칙을 제시했다.

Google
#gemini#anthropic-claude#google-research#openai-gpt
Announcing NeurIPS 2025 E2LM Competition: Early Training Evaluation of Language Models
Article2025년 8월 5일

Announcing NeurIPS 2025 E2LM Competition: Early Training Evaluation of Language Models

NeurIPS 2025 E2LM Competition은 LLM 초기 학습 단계에서 과학 지식과 추론 신호를 더 잘 포착하는 벤치마크를 함께 만들기 위한 대회다.

huggingface.co
#e2lm-competition#hugging-face#lm-evaluation-harness#llm
Rethinking LLM Evaluation with 3C3H: AraGen Benchmark and Leaderboard
Article2024년 12월 4일

Rethinking LLM Evaluation with 3C3H: AraGen Benchmark and Leaderboard

AraGen은 아랍어 LLM을 대상으로 사실성·사용성을 함께 평가하기 위해 3C3H 척도, 동적 블라인드 평가 주기, 인간 검증 데이터셋을 결합한 생성형 벤치마크와 리더보드다.

huggingface.co
#llm#aragen#chatbot-arena#hugging-face