ArticleRussell Brandom·2026년 9월 2일·0

OpenAI’s new reasoning technique alarms AI safety experts

Quick Summary

OpenAI의 Astra가 ‘불투명 반복’ 추론을 제한적으로 사용한다는 보도에 AI 안전 전문가들은 향후 확대가 사고 사슬 감시 가능성을 훼손할 수 있다고 우려했다.

OpenAI’s new reasoning technique alarms AI safety experts 관련 대표 이미지

🖼️ 인포그래픽

OpenAI’s new reasoning technique alarms AI safety experts 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

OpenAI’s new reasoning technique alarms AI safety experts의 핵심 내용을 4단계로 요약한 인포그래픽
OpenAI’s new reasoning technique alarms AI safety experts 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

OpenAI의 Astra가 ‘불투명 반복’ 추론을 제한적으로 사용한다는 보도에 AI 안전 전문가들은 향후 확대가 사고 사슬 감시 가능성을 훼손할 수 있다고 우려했다.

📌 핵심 요약

  • The Information은 OpenAI의 새 모델 Astra가 순차적 사고에서 벗어나 같은 질의를 반복 처리하는 ‘반복 깊이’, 일명 ‘불투명 반복’ 기법을 사용할 것이라고 보도했다.
  • 사고 사슬은 모델의 실제 추론을 완벽하게 나타내지는 않지만, 오작동이나 정렬 실패를 감시하는 수단이며 OpenAI의 최근 에이전트 일탈 행동 분석에도 활용됐다.
  • Redwood의 벅 슐레게리스와 AI 안전 옹호자 즈비 모쇼비츠는 불투명 반복의 확대가 사고 사슬 감시 가능성을 훼손할 수 있다고 경고했고, 모쇼비츠는 연구소 간 하향 경쟁을 막기 위한 법률의 필요성도 제기했다.
  • Astra의 기법 사용은 제한적인 것으로 전해졌으며 사고 사슬은 여전히 읽을 수 있을 것으로 예상된다. OpenAI는 ‘뉴럴리즈’로 전환한다는 관측을 반박하고 사고 사슬 감시를 핵심 연구 목표로 강조했다.
  • Anthropic과 Google DeepMind도 이 기법을 논의 중이라는 후속 보도가 나왔다. Redwood Research의 라이언 그린블랫은 불투명 추론이 확대되면 추론의 전부 또는 거의 전부가 잠재 공간에서 이뤄질 수 있다고 우려했다.

🧩 주요 포인트

  1. 순차적 기록을 우회하는 불투명 반복 → 사람이 읽을 수 있는 흔적이 줄어들어 모델 행동의 원인 분석과 안전 감시가 어려워질 가능성.
  2. Astra의 제한적 사용과 OpenAI의 감시 유지 방침 → 현재의 가독성 전망과 향후 기법 확대에 따른 위험을 구분할 필요.
  3. Anthropic·Google DeepMind의 논의와 잠재 공간 추론 확대 우려 → 개별 모델의 구현을 넘어 연구소 간 경쟁과 규율의 문제로 논점 확장.

🧠 상세 정리

1. Astra의 새로운 추론 기법과 논란의 출발

The Information은 OpenAI의 새 모델 Astra가 ‘반복 깊이’라는 추론 기법을 사용할 것이라고 보도했으며, 기사에서는 이를 ‘불투명 반복’이라고도 부른다. 이 기법은 대부분의 추론 모델을 특징짓는 순차적 사고에서 벗어나 같은 질의를 여러 차례 반복 처리하는 방식으로 설명된다. 그 결과 사람이 읽을 수 있는 흔적이 줄고, 기존 사고 사슬 기록을 통한 감시가 더 어려워질 가능성이 논란의 출발점이 됐다. Astra에서의 사용 범위는 제한적인 것으로 전해졌지만, AI 안전 전문가들은 이 방식의 등장과 향후 확대 가능성 자체에 상당한 우려를 나타냈다.

2. 안전 전문가들의 경고와 법적 규율 논의

Redwood 최고경영자 벅 슐레게리스는 보도에 강한 우려를 표하면서도 Astra의 사고 사슬 감시 가능성이 이전 모델보다 크게 낮아졌는지는 알지 못한다고 명시했다. 그의 경고는 OpenAI가 이 기법을 더 밀어붙이면 반복의 규모를 대폭 늘려 감시 가능성을 완전히 훼손할 선택지가 생긴다는 데 초점이 맞춰졌다. 오랫동안 AI 안전을 옹호해 온 즈비 모쇼비츠도 더 집중적인 사용이 감시 가능성을 손상할 것이라고 우려했다. 그는 OpenAI와 Anthropic이 사고 사슬의 충실성과 감시 가능성을 가능한 한 오래 유지하려 노력해 왔다고 언급하며, 연구소 간 하향 경쟁을 막으려면 법률이 필요할 수 있다는 견해를 밝혔다.

3. 사고 사슬이 제공하는 감시 근거

일반적인 추론 모델의 사고 사슬은 문제를 풀기 위해 모델이 밟는 순차적 단계를 보여 주는 기록으로 설명된다. 이 표현은 불완전하지만, 모델의 잘못된 행동이나 정렬 실패를 감시하는 데 유용한 수단으로 활용된다. 기사에 따르면 OpenAI의 최근 에이전트 일탈 사례에서도 사고 사슬 기록은 에이전트가 왜 그렇게 행동했는지 분석하는 중요한 근거였다. 불투명 반복은 같은 질의를 반복 처리하면서 덜 선형적인 경로를 취하므로, 통상적인 사고 사슬 기록을 사실상 우회하고 읽을 수 있는 흔적을 더 적게 남긴다. 이 차이 때문에 전문가들은 기법의 확대가 행동 원인을 추적하는 기존 감시 수단을 약화할 수 있다고 우려한다.

4. 제한적 도입과 OpenAI의 감시 유지 방침

기사는 Astra가 불투명 반복을 사용하는 범위가 제한적인 것으로 보인다는 점을 강조하며, 모델의 사고 사슬도 여전히 읽을 수 있을 것으로 예상된다고 전한다. OpenAI는 ‘뉴럴리즈’로 전환할 것이라는 관측에 반박했고, 향후 안전 계획의 일부로 광범위한 사고 사슬 감시 시스템을 마련하겠다는 계획도 이미 발표했다. OpenAI 수석과학자 야쿠프 파호츠키는 엑스 게시물에서 첫 추론 모델부터 사고 사슬 감시를 보존하고 활용하기 위해 노력해 왔다고 밝혔다. 그는 이를 현재 연구 프로그램의 핵심 목표라고 설명했다. 따라서 원문은 현재 Astra의 가독성이 사라졌다고 단정하지 않으며, 제한적 도입에 대한 회사의 설명과 더 큰 규모의 적용을 걱정하는 전문가들의 입장을 함께 제시한다.

5. 불완전한 추론 기록과 업계 확산 우려

기사는 모든 AI 모델이 어느 정도 불투명한 추론을 수행하며, 사고 사슬 기록을 모델 추론의 직접적인 표현으로 받아들이는 연구자는 드물다는 단서를 제시한다. 이는 기존 기록이 내부 추론을 완전히 드러내는 것은 아니라는 뜻이지만, 불투명 반복이 감시를 더 어렵게 만들 수 있다는 우려를 해소하지는 못한다. 특히 이 기법이 여러 모델로 확산될수록 감시 가능성에 관한 논쟁의 범위도 넓어진다는 것이 기사의 논점이다. The Information의 수요일 오전 후속 보도에 따르면 Anthropic과 Google DeepMind도 이미 이 기법을 논의하고 있었다. 원문이 전하는 것은 논의 단계이며, 두 연구소가 실제 모델에 도입했거나 감시 성능이 저하됐다는 확인은 아니다.

6. 잠재 공간으로 추론이 이동할 가능성

Redwood Research 수석과학자 라이언 그린블랫은 불투명 추론이 기존 사고 사슬 추론보다 더 빠르게 확대될 수 있다는 점을 핵심 우려로 제시했다. 그는 이러한 발전이 이어지면 모델이 추론의 전부 또는 거의 전부를 잠재 공간에서 수행하는 방향으로 나아갈 수 있다고 경고했다. 이 경우 추론이 눈에 보이는 경로에서 사실상 사라질 수 있다는 것이 그의 주장으로, 현재 Astra가 이미 그 상태라는 확인과는 구분된다. 그린블랫은 가장 우려스러운 구조를 피하기에 아직 늦지 않았기를 바라며 OpenAI가 여기서 멈추기를 희망한다고 밝혔다. 기사는 이 발언을 통해 현재의 제한적 사용보다 향후 불투명 추론의 규모 확대가 감시 가능성에 미칠 영향을 마지막 쟁점으로 부각한다.

🧾 핵심 주장 / 시사점

  • 안전 논쟁의 핵심은 사고 사슬이 완벽한 추론 기록인지 여부뿐 아니라, 불완전해도 유용한 감시 근거를 계속 확보할 수 있는지에 있다.
  • Astra의 현재 감시 가능성이 크게 저하됐다는 확인과 불투명 반복의 향후 확대에 대한 경고는 구분해서 해석해야 한다.
  • 여러 연구소의 기법 논의는 감시 가능성 유지라는 목표와 추론 구조의 발전 방향을 둘러싼 논쟁을 업계 차원으로 넓힌다.

✅ 액션 아이템

  • Astra의 제한적 사용과 향후 불투명 반복 확대 위험을 구분해 검토.
  • OpenAI의 사고 사슬 감시 유지 방침과 실제 가독성에 관한 근거 확인.
  • Anthropic과 Google DeepMind의 논의 및 연구소 간 하향 경쟁을 막기 위한 법률 논점 검토.

❓ 열린 질문

  • Astra의 제한적 불투명 반복 사용은 기존 모델 대비 사고 사슬 감시 가능성에 어떤 차이를 만드는가?
  • OpenAI는 불투명 반복이 확대되더라도 사고 사슬의 가독성과 감시 가능성을 어떻게 유지할 수 있는가?
  • Anthropic과 Google DeepMind도 기법을 논의하는 상황에서 연구소 간 하향 경쟁을 막기 위한 법률이 필요한가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.