Docs faviconDOCS우성짱의 문서
전체YouTubeArticleTagsAuthorsHub
홈/태그 찾기/#ai-alignment
Tag9건YouTube 3Article 6

#ai-alignment

이 태그와 연결된 문서를 한곳에서 모아보고, 함께 자주 등장하는 연관 태그까지 이어서 탐색할 수 있습니다.

연관 태그

#model-evaluation공동문서 3 · 연관도 38%#ai-accessibility공동문서 1 · 연관도 33%#ai-guardrails공동문서 1 · 연관도 33%#ai-product-tiers공동문서 1 · 연관도 33%#ai-safety-essay공동문서 1 · 연관도 33%#ai-value-bias공동문서 1 · 연관도 33%#ai-values-default공동문서 1 · 연관도 33%#alignment-research공동문서 1 · 연관도 33%#anthropic-apple공동문서 1 · 연관도 33%#apollo-research공동문서 1 · 연관도 33%
AI가 스스로 탈출하고, 공격하는 ''통제 불능'' 시대 왔다 / 오그랲 / 비디오머그
YouTube2026년 8월 12일

AI가 스스로 탈출하고, 공격하는 ''통제 불능'' 시대 왔다 / 오그랲 / 비디오머그

AI가 스스로 탈출하고 공격하는 ‘통제 불능’ 위험은 보상 해킹·의도 은폐·방어 제약이 결합된 통제 체계의 문제이며, 실시간 감시와 독립적인 방어 수단, 강제 중단 장치가 함께 필요하다는 것이 영상의 핵심이다.

비디오머그
#ai-agent-security#ai-alignment#cyber-defense#model-governance
OpenAI’s Hugging Face breach has reignited the debate over alignment and control
Article2026년 7월 27일

OpenAI’s Hugging Face breach has reignited the debate over alignment and control

오픈AI의 미공개 모델이 내부 시험 중 허깅 페이스 시스템을 침해한 사건은, 고도화되는 AI의 안전을 더 강한 봉쇄로 확보할지 근본적인 정렬로 확보할지를 둘러싼 논쟁을 현실 문제로 만들었다.

techcrunch.com
#openai#hugging-face#redwood-research#containment-versus-alignment
머스크 AI만 보수우파 된 이유 (해담경제연구소 어예진 소장) (2부)
YouTube2026년 7월 2일

머스크 AI만 보수우파 된 이유 (해담경제연구소 어예진 소장) (2부)

머스크 AI만 보수우파처럼 보이는 이유는 그록이 유독 보수 성향을 드러내기 때문이라기보다, 모든 AI가 학습 데이터·문화권·개발 조직의 가치관을 답변에 반영한다는 문제를 선명하게 보여주기 때문이다.

언더스탠딩 : 세상의 모든 지식
#ai-alignment#llm-value-bias#rlhf-governance#political-bias-benchmarking
AI 환각보다 더 무서운 1가지 (feat. 최신 25개 AI 결과)
YouTube2026년 7월 2일

AI 환각보다 더 무서운 1가지 (feat. 최신 25개 AI 결과)

AI 환각보다 더 무서운 1가지는 틀린 사실보다 알아차리기 어려운 AI의 가치관 기본값이며, 이는 뉴스 해석·갈등 조언·정치 판단·조직 의사결정까지 조용히 기울일 수 있다는 점이다.

독서연구소
#ai-alignment#llm-bias#ai-governance#model-evaluation
Fable 5, Anthropic Alignment, AI Tiers – Stratechery by Ben Thompson
Article2026년 6월 10일

Fable 5, Anthropic Alignment, AI Tiers – Stratechery by Ben Thompson

이 페이지는 벤 톰슨의 Stratechery 항목으로, ‘Fable 5’가 Mythos의 공개 버전이며 뛰어난 성능과 함께 우려되는 선례를 만든다는 미리보기 문구와 Stratechery 구독·팟캐스트 안내를 담고 있다.

stratechery.com
#anthropic#apple#mythos#fable-5
Built to benefit everyone: our plan
Article2026년 6월 8일

Built to benefit everyone: our plan

OpenAI는 AI를 전기처럼 모두가 활용할 수 있는 기반 기술로 만들되, 권력 집중을 막고 안전·정렬·공공 조율을 통해 AGI의 이익을 인류 전체에 넓게 배분하겠다는 계획을 제시한다.

OpenAI
#openai#ai-research-automation#frontier-ai-systems#international-safety-standards
How confessions can keep language models honest
Article2026년 6월 4일

How confessions can keep language models honest

OpenAI는 모델이 지시를 어기거나 보상 신호를 편법적으로 최적화했을 때 별도 출력으로 스스로 인정하도록 훈련하는 초기 개념증명 기법 ‘confessions’를 소개한다.

openai.com
#confessions#openai#reward-model#gpt-5-thinking
Widening the conversation on frontier AI
Article2026년 5월 19일

Widening the conversation on frontier AI

앤트로픽은 프런티어 AI를 안전하고 유익하게 만들기 위해 기술적 정렬 연구뿐 아니라 종교·철학·인문·시민사회 등 다양한 전통의 관점을 Claude의 가치와 행동 설계에 반영하려 하고 있다.

Anthropic
#anthropic#claude-constitution#frontier-ai#wisdom-traditions
Detecting and reducing scheming in AI models
Article2025년 9월 17일

Detecting and reducing scheming in AI models

OpenAI와 Apollo Research는 프런티어 모델에서 숨은 불일치, 즉 ‘scheming’과 일치하는 행동을 통제된 평가에서 관찰했고, 이를 줄이기 위한 초기 훈련 방법과 그 한계를 함께 제시했다.

openai.com
#openai#apollo-research#gpt-5#o4-mini