Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#llm-as-judge
Tag5건Article 5

#llm-as-judge

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#llm-evaluation공동문서 4 · 연관도 68%#agent-evalkit공동문서 1 · 연관도 45%#agent-monitoring공동문서 1 · 연관도 45%#agent-verification공동문서 1 · 연관도 45%#arabic-language-models공동문서 1 · 연관도 45%#aragen공동문서 1 · 연관도 45%#batch-rubric-scoring공동문서 1 · 연관도 45%#benchmark-design공동문서 1 · 연관도 45%#blind-testset-rotation공동문서 1 · 연관도 45%#chatbot-arena공동문서 1 · 연관도 45%
Hands-On with Langfuse: Tracing, Sessions, Evaluations, and LLM-as-a-Judge
Article2026년 6월 14일

Hands-On with Langfuse: Tracing, Sessions, Evaluations, and LLM-as-a-Judge

이 글은 Langfuse를 로컬에 self hosted로 설치한 뒤 OpenAI 호출 추적, 메타데이터, 세션·사용자 연결, 내장 평가기와 LLM as a Judge 설정까지 직접 실습한 과정을 정리한다.

ai.plainenglish.io
#langfuse#openai#postgresql#docker-compose
Evaluate AI agents systematically with Agent-EvalKit
Article2026년 6월 11일

Evaluate AI agents systematically with Agent-EvalKit

Agent EvalKit은 최종 응답만 보는 평가의 한계를 넘어, AI 에이전트의 도구 호출·중간 상태·근거 충실성까지 추적해 코드 수준 개선으로 연결하는 오픈소스 평가 도구입니다.

Amazon Web Services
#agent-evalkit#amazon-bedrock#amazon-web-services#strands-agents-sdk
Defining and evaluating political bias in LLMs
Article2026년 6월 4일

Defining and evaluating political bias in LLMs

OpenAI는 ChatGPT가 기본적으로 정치적 편향 없이 객관성을 유지해야 한다는 원칙을 실제 대화형 평가로 측정하기 위해, 약 500개 프롬프트와 다섯 가지 편향 축을 갖춘 자동 평가 체계를 만들고 GPT‑5 계열에서 편향 감소를 확인했다고 설명한다.

openai.com
#chatgpt#openai#gpt-5-instant#gpt-5-thinking
Designing Efficient Verifiers for Legal Agents
Article2026년 6월 2일

Designing Efficient Verifiers for Legal Agents

LangChain과 Harvey는 법률 에이전트 평가에서 검증기 비용이 병목이 되는 문제를 다루며, 기준별 호출을 배치 검증으로 묶고 더 저렴한 오픈 모델을 활용하면 frontier 모델에 가까운 성능을 유지하면서 비용을 크게 줄일 수 있다고 설명한다.

langchain.com
#harvey#langchain#lab-benchmark#deepseek-v4-flash
Rethinking LLM Evaluation with 3C3H: AraGen Benchmark and Leaderboard
Article2024년 12월 4일

Rethinking LLM Evaluation with 3C3H: AraGen Benchmark and Leaderboard

AraGen은 아랍어 LLM을 대상으로 사실성·사용성을 함께 평가하기 위해 3C3H 척도, 동적 블라인드 평가 주기, 인간 검증 데이터셋을 결합한 생성형 벤치마크와 리더보드다.

huggingface.co
#llm#aragen#chatbot-arena#hugging-face