Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#jailbreak-resistance
Tag2건Article 2

#jailbreak-resistance

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#claude-sonnet-4공동문서 1 · 연관도 71%#instruction-hierarchy-robustness공동문서 1 · 연관도 71%#llm-alignment공동문서 1 · 연관도 71%#model-alignment공동문서 1 · 연관도 71%#o-series공동문서 1 · 연관도 71%#overrefusal-reduction공동문서 1 · 연관도 71%#pilot-evaluation공동문서 1 · 연관도 71%#reasoning-for-safety공동문서 1 · 연관도 71%#reasoning-safety-tradeoff공동문서 1 · 연관도 71%#refusal-utility-balance공동문서 1 · 연관도 71%
Findings from a pilot Anthropic–OpenAI alignment evaluation exercise: OpenAI Safety Tests
Article2025년 8월 27일

Findings from a pilot Anthropic–OpenAI alignment evaluation exercise: OpenAI Safety Tests

OpenAI와 Anthropic은 서로의 공개 모델에 내부 안전성·미스얼라인먼트 평가를 적용한 첫 공동 파일럿 결과를 공개하며, 모델별 강점과 취약점, 평가 협력의 필요성을 정리했다.

openai.com
#anthropic#openai#claude-opus-4#claude-sonnet-4
Deliberative alignment: reasoning enables safer language models
Article2024년 12월 20일

Deliberative alignment: reasoning enables safer language models

OpenAI는 o series 모델에 사람이 쓴 안전 명세를 직접 가르치고 추론 과정에서 이를 검토하게 하는 ‘숙고적 정렬’을 통해 악성 요청 거부와 benign 요청 허용의 균형을 개선했다고 설명한다.

openai.com
#openai#constitutional-ai#gpt-4o#o-series