We’re putting too much faith in AI’s ability to say no
Quick Summary
MIT Technology Review는 AI 안전의 핵심인 LLM의 거부 기능이 확률적이고 충분히 이해되지 않아 위험한 요청을 완전히 차단하지 못하며, 거부 기준을 통제하는 권력의 억압 수단이 될 수도 있다고 경고한다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
MIT Technology Review는 AI 안전의 핵심인 LLM의 거부 기능이 확률적이고 충분히 이해되지 않아 위험한 요청을 완전히 차단하지 못하며, 거부 기준을 통제하는 권력의 억압 수단이 될 수도 있다고 경고한다.
📌 핵심 요약
- Anthropic은 2021년 AI가 유용하고 정직하며 무엇보다 무해해야 한다고 제안했으며, 기업들은 유해한 요청의 거부를 보상하고 무해한 요청의 과도한 거부를 벌하는 훈련과 추가 차단 모델을 활용한다.
- 거부 기능은 유해한 일을 수행할 능력을 모델 안에 남겨 둔 채 작동한다. 기업들은 첨단 AI를 생물학적 병원체 개선과 자율 드론 군집 구축에 이용하려는 시도를 보고하며, 기사는 거부 실패가 세계적 재앙으로 이어질 가능성을 경고한다.
- 바이러스 연구와 컴퓨터 취약점 보수처럼 정당한 용도도 있어 유해성의 경계를 정하는 보편적 공식은 없다. 현재 AI 기업들이 비밀리에 정하는 거부 기준을 정부도 통제하게 되면, 권위주의 정부가 정당한 표현을 억압하는 데 활용할 위험이 있다.
- 거부 행동은 모델 내부의 활성화와 관련되지만 그 작동 원리는 충분히 이해되지 않았다. 입력과 출력을 검사하는 분류기와 내부 활성화를 관찰하는 프로브도 확률적이며, Anthropic은 올해 초 한 유형의 분류기가 챗봇 연산 비용을 24% 늘렸다고 밝혔다.
- AI의 유익한 능력과 유해한 능력은 쉽게 분리되지 않는다. 암 치료에 필요한 유전학 지식은 생물무기에도 활용될 수 있고, 유해한 능력을 제거하면 지능이 크게 낮아질 수 있어 AI 혜택의 확대와 악용 방지가 충돌한다.
🧩 주요 포인트
- 유해한 능력을 유지한 채 확률적 거부에 의존하는 구조 → 차단 장치를 여러 겹 쌓아도 악용 방지의 신뢰성을 보장하기 어렵다.
- 바이러스 연구·컴퓨터 취약점 보수와 악용의 경계가 겹치는 현실 → 거부 기준은 기술적 판단과 함께 정당한 접근 및 표현을 통제하는 권력의 문제가 된다.
- 암 치료와 생물무기에 활용될 수 있는 지식의 중첩 → AI의 유용성 확대, 악용 억제, 안전장치의 연산 비용 사이에 근본적인 절충이 발생한다.
🧠 상세 정리
1. AI 안전의 기본 원칙이 된 거부
기사는 인간을 본뜬 지능을 기계에 부여하려는 초기 구상과 로봇의 불복종을 다룬 공상과학 이야기에서 출발해, 오늘날에는 AI가 모든 요청에 응해서는 안 된다는 생각이 사실상 기본 원칙이 되었다고 설명한다. Anthropic 연구진은 2021년 대규모 언어 모델이 유용하고 정직하며 무엇보다 무해해야 한다고 썼고, 폭탄 제조처럼 위험한 행위를 돕도록 요청받으면 정중히 거절해야 한다고 제안했다. 기업들은 자신들이 유해하다고 판단한 질문을 거부하면 보상하고, 무해하다고 판단한 질문을 과도하게 거부하면 벌하는 훈련으로 이 행동을 조정한다. 여러 경우 다른 AI 모델이 훈련을 수행하며, 위험한 프롬프트가 핵심 모델에 도달하지 못하도록 추가 AI 계층도 배치된다. 이처럼 거부는 현대 AI에 내재한 기능이 되었지만, 저자는 그러한 설계가 실제 안전을 확실하게 보장하는지는 별개의 문제라고 논의를 전환한다.
2. 위험한 능력을 남겨 둔 안전장치
저자는 거부 기능이 종종 실패하고 때로는 폭력적 결과로 이어지며, 모델 안에는 여전히 유해한 지식과 능력이 들어 있다고 지적한다. 기업들의 설명에 따르면 일부 최신 모델은 주요 컴퓨터 네트워크에 침입하는 능력이 최상급 인간 해커에 견줄 만하고, 여론을 왜곡하는 능력도 숙련된 허위정보 유포자에 필적한다. 이런 능력을 그대로 둔 채 사용만 거부하도록 가르치는 방식은 모든 자동차에 기관총을 달고 방아쇠를 보닛 아래 숨기는 것에 비유된다. 거부 메커니즘은 확률적으로 작동하며 이미 집요한 악용자들이 이를 돌파했으므로, 앞으로도 차단을 뚫을 가능성이 있다는 것이 기사의 주장이다. 기업들은 가장 발전한 AI로 생물학적 병원체를 개선하거나 자율 드론 군집을 구축하려는 시도를 보고하고 있으며, 저자는 이를 성공한 사례로 단정하지 않으면서도 거부 실패가 언젠가 세계적 재앙을 초래할 수 있다고 경고한다.
3. 거부의 경계를 정하는 권력
거부에 의존하려면 모델이 따라야 할 요청과 거절해야 할 요청 사이에 선을 그어야 하지만, 바이러스 연구나 컴퓨터 취약점 보수처럼 같은 지식에 정당한 용도와 악용 가능성이 함께 존재하므로 보편적 공식은 없다. OpenAI 이사회 구성원이자 AI 시험 기업 Gray Swan의 공동창업자인 Zico Kolter는 그 경계를 어디에 둘지가 중대한 질문이라고 말하며, 기사는 현재 기업들이 이를 비밀리에 결정한다고 지적한다. 앞으로 정부도 기준을 정하게 되는데, 미 국방부가 거부를 줄이려는 요구로 첨단 모델 기업들과 충돌한 사례와 별개로 저자는 권위주의 정부가 정당한 표현까지 차단할 가능성을 우려한다. 해악을 거부하는 능력이 좋아질수록 통치자에게 불편한 생각을 억누르는 능력도 좋아질 수 있고, AI가 이미 일부 권위주의 국가 지도자에 대한 비판을 거부할 가능성도 제기된다. 저자는 거부를 AI 안전의 핵심 지지 구조로 보면서도, 실패하면 재앙을 낳고 철저히 작동하면 억압을 도울 수 있으며 기계가 스스로 경계를 정하는 상황은 가장 나쁜 결과일 것이라고 주장한다.
4. 레드팀과 미세조정을 통한 거부 학습
기사는 거부 학습의 구체적인 사례로, OpenAI가 ChatGPT 출시를 준비하던 2022년에 수십 명의 레드팀 참가자를 모집해 최신 모델의 능력과 악용 위험을 조사한 일을 소개한다. OpenAI는 이 과정에서 얻은 응답을 데이터셋으로 모았고, 저자는 이것이 미세조정이라는 더 넓은 과정의 일부로 모델에 다시 입력되었을 가능성이 높다고 설명한다. 현재 독일 포츠담의 Hasso Plattner Institute에서 연구하는 Röttger는 자신이 제출한 스프레드시트의 정확한 사용 계획을 듣지 못했으므로, 자료의 활용 방식이 확인된 사실처럼 제시되지는 않는다. 다만 거부 행동과 관련된 작업이라는 점은 분명했으며, 몇 달 뒤 그가 모델에 알카에다 선전물을 요청했을 때 모델은 이를 거절했다. 저자는 거부라는 개념 자체는 어린아이도 이해할 만큼 직관적이지만, 언어 모델이 내부적으로 어떻게 그 행동을 만들어 내는지는 건물의 하중을 지탱하는 벽을 이해하는 방식만큼 명확하지 않다고 강조한다.
5. 거부 활성화의 위치와 설명의 한계
모델의 거부는 겉으로 도덕적 추론처럼 보일 수 있지만, 기사는 거부하도록 훈련된 표현과 닮은 입력이 들어오면 수십억 개 매개변수 사이에서 특정 활성화가 발생하는 현상으로 설명한다. Google의 지원을 받은 연구는 이러한 활성화 공간의 거부 행동을 ‘고차원 다면뿔’로 기술했으나, 논문 저자이자 현재 Apollo Research에서 AI 안전을 연구하는 Jannes Elstner는 이것이 대체로 같은 방향을 향하는 불확정한 수의 선을 표현하는 방식이라고 설명했다. 연구자 Andy Arditi는 관련 활성화를 제거하고 같은 프롬프트를 다시 입력하면 모델이 거부하지 않는다는 결과를 앞서 보여 주었다. 그러나 Elstner에 따르면 거부를 좌우하는 요소를 모두 찾았다고 생각해도 발견하지 못한 다른 요소가 관여할 수 있어, 거부가 일어났다는 사실과 훈련의 영향은 관찰해도 결정 과정에 대한 설명은 가설 수준에 머문다. 저자는 이를 자동차 브레이크를 밟을 때 내부에서 정확히 무슨 일이 일어나는지 모르는 상황에 비유하며 문제를 제기하지만, Elstner는 이해 여부와 관계없이 거부 기능이 필요하다고 답한다.
6. 분류기와 프로브를 쌓는 방어 방식
기업들은 모델 자체의 거부가 다루기 어렵기 때문에 더 작은 모델인 분류기를 주변에 배치해, 위험한 사용자 입력이 모델에 전달되거나 유해한 모델 출력이 사용자에게 도달하는 것을 차단한다. 각각의 장치는 모든 나쁜 요청을 탐지하지 못하므로, 업계는 구멍이 있는 치즈 조각을 여러 겹 쌓아 방어한다는 의미에서 이를 ‘스위스 치즈 모델’이라고 부른다. 이 방어 방식에는 상당한 자원이 필요하며, Anthropic은 올해 초 한 유형의 분류기가 챗봇 연산 비용을 24% 늘렸다고 밝혔고 저자는 그에 따른 물·전력 사용과 배출 증가를 지적한다. 최근 Anthropic과 다른 기업들은 모델 내부의 활성화를 관찰하는 더 효율적인 분류기인 프로브로 전환하기 시작했으며, 기사는 이를 기능적 자기공명영상으로 모델이 거부를 생각하는지 살피는 것에 비유한다. 분류기는 새로운 거부 대상이 생기면 몇 주 안에 수정할 수 있어 전체 모델보다 통제하기 쉬운 것으로 여겨지지만, 그 자체도 확률적 도구라는 한계는 남는다.
7. 규칙과 추론 설명으로도 남는 확률적 실패
Anthropic의 ‘constitution’과 OpenAI의 ‘model spec’처럼 사람이 언어로 작성한 원칙이 있어도, 기사는 기계가 개별 질문을 판단하는 기반은 결국 통계라고 설명한다. 최신 모델이 거부 결정에 이르는 과정을 보여 주더라도, 이른바 사고 연쇄 역시 예측된 단어의 연속이므로 그 설명만으로 안전성이 보장되지는 않는다는 주장이다. 심리학자 McBain의 최근 실험에서는 주요 모델에 자살 방법과 관련된 동일한 위험 질문을 반복하면 대체로 거부하지만 때때로 응답하는 결과가 나타났다. Elstner는 프로브가 언젠가 설명하기 어려운 활성화 전체를 인식해 모델이 거부하거나 거부해야 하는 모든 경우를 완벽하게 탐지할 가능성을 제시한다. 그러나 저자는 그러한 전망에서도 안전이 의존하는 것은 인간의 도덕을 복잡한 통계 구조로 부호화한, 대상만큼 방대하고 이해하기 어려운 또 하나의 지도라고 지적하며 완전한 탐지를 이미 달성한 사실로 다루지 않는다.
8. 유용성과 유해성을 분리하기 어려운 절충
기사는 모델이 수조 개의 단어와 이미지에서 지능을 얻기 때문에 유익한 능력과 유해한 능력을 쉽게 분리할 수 없다는 점을 거부 의존의 근본 원인으로 제시한다. 전 OpenAI 직원 Steven Adler는 미성년자를 성적 대상으로 묘사하는 내용을 훈련 데이터에서 모두 제거하더라도 모델이 다른 지식을 조합해 아동 성착취물을 생성할 수 있으며, 이런 기초 능력을 제거하면 모델의 지능이 크게 낮아진다고 설명한다. 같은 논리로 암 치료를 돕는 데 필요한 유전학 전문지식은 이론적으로 바이러스와 세균을 생물무기용으로 변형하는 데도 사용될 수 있다. OpenAI 직원 Dillon Bowen은 개인 자격으로 AI의 혜택을 널리 제공하면서도 악의적 행위자가 그 능력으로 타인을 해치지 못하게 해야 하는 두 목표를 동시에 추구한다고 말하며, 기사는 AI가 강력해질수록 이 과제가 어려워진다고 주장한다. 제공된 원문은 Anthropic의 Mythos 모델이 매우 위험한 것으로 여겨진다는 대목에서 문장이 끊기므로, 그 뒤에 이어질 접근 제한의 대상이나 구체적인 조건은 확인할 수 없다.
🧾 핵심 주장 / 시사점
- 거부 성공은 위험한 능력의 제거와 다르므로, 평소 거부하는 모델도 반복된 요청이나 차단 우회 앞에서는 안전성을 보장하기 어렵다는 것이 기사의 핵심 문제의식이다.
- 거부 기준은 악용을 막는 장치이면서 지식과 표현에 대한 접근을 결정하는 수단이므로, 기술적 성능 향상만으로 권력 남용의 위험까지 해소되지는 않는다.
- 유익한 지식과 유해한 지식의 중첩은 안전장치 추가만으로 해결하기 어려운 절충을 만든다. 기사는 기술 발전의 속도를 늦추는 대안도 반드시 나쁜 것은 아닐 수 있다고 보지만, 구체적인 대체 체계를 제시하지는 않는다.
✅ 액션 아이템
- LLM의 거부 기능을 평가할 때 확률적 실패와 유해한 능력이 모델에 남아 있다는 제약을 함께 고려한다.
- 바이러스 연구·컴퓨터 취약점 보수의 정당한 활용과 권위주의 정부의 표현 억압 위험을 함께 고려해 거부 기준을 검토한다.
- 암 치료와 생물무기에 활용될 수 있는 유전학 지식의 중첩, Anthropic이 밝힌 연산 비용 24% 증가를 바탕으로 유용성·악용 방지·비용의 절충을 평가한다.
❓ 열린 질문
- 확률적으로 작동하는 LLM의 거부 기능은 생물학적 병원체 개선이나 자율 드론 군집 구축 같은 악용 시도를 어느 수준까지 차단할 수 있는가?
- 바이러스 연구와 컴퓨터 취약점 보수를 허용하면서 권위주의 정부의 표현 억압을 막으려면 거부 기준을 누가 어떻게 정해야 하는가?
- 암 치료와 생물무기에 활용될 수 있는 유전학 지식이 겹치는 상황에서, AI의 유용성과 악용 방지 및 분류기의 연산 비용을 어떻게 조정할 수 있는가?