Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#evaluation-methodology
Tag2건Article 2

#evaluation-methodology

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#a-b-test공동문서 1 · 연관도 71%#ab-testing공동문서 1 · 연관도 71%#eval-funnel공동문서 1 · 연관도 71%#experiment-guardrails공동문서 1 · 연관도 71%#gpt-5-instant공동문서 1 · 연관도 71%#judge-calibration공동문서 1 · 연관도 71%#llm-judge공동문서 1 · 연관도 71%#offline-online-alignment공동문서 1 · 연관도 71%#online-experimentation공동문서 1 · 연관도 71%#political-bias-measurement공동문서 1 · 연관도 71%
Defining and evaluating political bias in LLMs
Article2026년 6월 4일

Defining and evaluating political bias in LLMs

OpenAI는 ChatGPT가 기본적으로 정치적 편향 없이 객관성을 유지해야 한다는 원칙을 실제 대화형 평가로 측정하기 위해, 약 500개 프롬프트와 다섯 가지 편향 축을 갖춘 자동 평가 체계를 만들고 GPT‑5 계열에서 편향 감소를 확인했다고 설명한다.

openai.com
#chatgpt#openai#gpt-5-instant#gpt-5-thinking
Better Experiments with LLM Evals — A funnel, not a fork
Article2026년 5월 18일

Better Experiments with LLM Evals — A funnel, not a fork

Spotify Engineering은 LLM 평가를 A/B 테스트의 대체재가 아니라, 실험 전 후보를 걸러내고 실험 후 판단 기준을 보정하는 ‘평가 퍼널’로 사용해야 한다고 설명한다.

Matilda Ankargren (Senior Data Scientist) and Mårten Schultzberg (Senior Manager/Staff Data Scientist)
#llm#spotify#llm-judge#spotify-engineering