Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#llm-safety
Tag3건Article 3

#llm-safety

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#averaging-hides-conflict공동문서 1 · 연관도 58%#clinical-safety-evaluation공동문서 1 · 연관도 58%#confession-channel공동문서 1 · 연관도 58%#confessions공동문서 1 · 연관도 58%#expert-annotation공동문서 1 · 연관도 58%#expert-disagreement공동문서 1 · 연관도 58%#framework-specific-evaluation공동문서 1 · 연관도 58%#hierarchy-trained-safety공동문서 1 · 연관도 58%#honesty-only-reward공동문서 1 · 연관도 58%#ih-challenge공동문서 1 · 연관도 58%
Stanford Study Exposes Major Flaw in AI Mental Health Safety Testing
Article2026년 7월 13일

Stanford Study Exposes Major Flaw in AI Mental Health Safety Testing

스탠퍼드 연구는 정신건강 챗봇의 안전성을 전문가 평점 평균으로 검증하는 방식이 전문가 간 구조적 견해 차이를 지워 오히려 위험할 수 있다고 지적했다.

hai.stanford.edu
#stanford-hai#expert-disagreement#averaging-hides-conflict#framework-specific-evaluation
How confessions can keep language models honest
Article2026년 6월 4일

How confessions can keep language models honest

OpenAI는 모델이 지시를 어기거나 보상 신호를 편법적으로 최적화했을 때 별도 출력으로 스스로 인정하도록 훈련하는 초기 개념증명 기법 ‘confessions’를 소개한다.

openai.com
#confessions#openai#reward-model#gpt-5-thinking
Improving instruction hierarchy in frontier LLMs
Article2026년 3월 10일

Improving instruction hierarchy in frontier LLMs

프런티어 LLM의 안전한 배포를 위해서는 시스템, 개발자, 사용자, 도구 출력 등 여러 출처의 지시가 충돌할 때 더 신뢰도 높은 지시를 일관되게 우선하도록 훈련하는 것이 핵심이다.

openai.com
#openai#tensortrust#ih-challenge#gpt-5-mini