Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#instruction-hierarchy
Tag4건Article 4

#instruction-hierarchy

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#ai-policy-document공동문서 1 · 연관도 50%#chain-of-command공동문서 1 · 연관도 50%#chatgpt-atlas공동문서 1 · 연관도 50%#claude-sonnet-4공동문서 1 · 연관도 50%#company-framework-explainer공동문서 1 · 연관도 50%#hierarchy-trained-safety공동문서 1 · 연관도 50%#human-confirmation-loop공동문서 1 · 연관도 50%#ih-challenge공동문서 1 · 연관도 50%#instruction-conflict-resolution공동문서 1 · 연관도 50%#instruction-hierarchy-robustness공동문서 1 · 연관도 50%
Inside our approach to the Model Spec
Article2026년 3월 25일

Inside our approach to the Model Spec

OpenAI의 Model Spec은 모델이 지시를 따르고 충돌을 해결하며 사용자 자유와 안전을 함께 지키도록 하기 위한 공개적 행동 기준이자, 훈련·평가·거버넌스의 목표점으로 쓰이는 진화형 문서다.

openai.com
#openai#model-spec#preparedness-framework#chain-of-command
Improving instruction hierarchy in frontier LLMs
Article2026년 3월 10일

Improving instruction hierarchy in frontier LLMs

프런티어 LLM의 안전한 배포를 위해서는 시스템, 개발자, 사용자, 도구 출력 등 여러 출처의 지시가 충돌할 때 더 신뢰도 높은 지시를 일관되게 우선하도록 훈련하는 것이 핵심이다.

openai.com
#openai#tensortrust#ih-challenge#gpt-5-mini
Understanding prompt injections: a frontier security challenge
Article2025년 11월 7일

Understanding prompt injections: a frontier security challenge

OpenAI는 프롬프트 인젝션을 대화형 AI가 외부 콘텐츠의 악성 지시에 속아 사용자의 의도와 다른 행동을 하게 되는 새로운 보안 과제로 설명하며, 모델 훈련·모니터링·제품 보호장치·사용자 통제를 결합한 다층 방어가 필요하다고 강조한다.

openai.com
#chatgpt#openai#chatgpt-atlas#instruction-hierarchy
Findings from a pilot Anthropic–OpenAI alignment evaluation exercise: OpenAI Safety Tests
Article2025년 8월 27일

Findings from a pilot Anthropic–OpenAI alignment evaluation exercise: OpenAI Safety Tests

OpenAI와 Anthropic은 서로의 공개 모델에 내부 안전성·미스얼라인먼트 평가를 적용한 첫 공동 파일럿 결과를 공개하며, 모델별 강점과 취약점, 평가 협력의 필요성을 정리했다.

openai.com
#anthropic#openai#claude-opus-4#claude-sonnet-4