Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#ai-safety-evaluation
Tag6건Article 6

#ai-safety-evaluation

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#activation-analysis공동문서 1 · 연관도 41%#ai-interpretability공동문서 1 · 연관도 41%#alignment-audit-tooling공동문서 1 · 연관도 41%#biosecurity-risk공동문서 1 · 연관도 41%#claude-sonnet-4공동문서 1 · 연관도 41%#coding-agent-leap공동문서 1 · 연관도 41%#cyber-biosecurity-risk공동문서 1 · 연관도 41%#evaluation-awareness-detection공동문서 1 · 연관도 41%#frontier-risk-evaluation공동문서 1 · 연관도 41%#gpt-5-instant공동문서 1 · 연관도 41%
Defining and evaluating political bias in LLMs
Article2026년 6월 4일

Defining and evaluating political bias in LLMs

OpenAI는 ChatGPT가 기본적으로 정치적 편향 없이 객관성을 유지해야 한다는 원칙을 실제 대화형 평가로 측정하기 위해, 약 500개 프롬프트와 다섯 가지 편향 축을 갖춘 자동 평가 체계를 만들고 GPT‑5 계열에서 편향 감소를 확인했다고 설명한다.

openai.com
#chatgpt#openai#gpt-5-instant#gpt-5-thinking
Why the U.S. Needs an Independent AI Evaluation Framework for National Security
Article2026년 5월 20일

Why the U.S. Needs an Independent AI Evaluation Framework for National Security

Scale AI는 미국이 첨단 AI 모델의 국가안보 위험을 기업의 자율 공개에 의존하지 말고, 정부·제3자 평가기관·모델 개발사가 참여하는 독립적 사전 평가 체계를 즉시 구축해야 한다고 주장한다.

scale.com
#anthropic#caisi#scale-ai#claude-mythos-preview
Natural Language Autoencoders
Article2026년 5월 7일

Natural Language Autoencoders

Anthropic은 모델 내부 활성화를 사람이 읽을 수 있는 자연어 설명으로 바꾸는 Natural Language Autoencoders를 소개하며, 이를 통해 Claude가 말하지 않는 평가 인식·숨은 동기·오류 원인을 조사할 수 있음을 보였다.

Anthropic
#anthropic#claude-ai#natural-language-autoencoders#swe-bench-verified
Introducing GPT-5.5
Article2026년 4월 23일

Introducing GPT-5.5

OpenAI는 GPT 5.5를 더 빠른 의도 파악, 장기적 도구 사용, 코딩·지식작업·초기 과학 연구 성능 향상을 결합한 차세대 작업형 모델로 소개하며, GPT 5.4 수준의 지연시간을 유지하면서 더 높은 지능과 효율을 제공한다고 밝혔다.

미상
#codex#openai#gpt-5-4#gpt-5-5
Findings from a pilot Anthropic–OpenAI alignment evaluation exercise: OpenAI Safety Tests
Article2025년 8월 27일

Findings from a pilot Anthropic–OpenAI alignment evaluation exercise: OpenAI Safety Tests

OpenAI와 Anthropic은 서로의 공개 모델에 내부 안전성·미스얼라인먼트 평가를 적용한 첫 공동 파일럿 결과를 공개하며, 모델별 강점과 취약점, 평가 협력의 필요성을 정리했다.

openai.com
#anthropic#openai#claude-opus-4#claude-sonnet-4
Estimating worst case frontier risks of open weight LLMs
Article2025년 8월 5일

Estimating worst case frontier risks of open weight LLMs

OpenAI는 gpt oss 공개 전 생물·사이버보안 영역에서 악의적 미세조정으로 최악의 위험을 추정했으며, 평가 결과 기존 최전선 모델을 넘어서지는 않는다고 밝혔다.

openai.com
#openai#gpt-oss#openai-o3#preparedness-high