Articletechnologyreview.com·2026년 10월 2일·0

Don’t be fooled—LLMs don’t reason

Quick Summary

Thore Graepel은 LLM의 다음 토큰 예측과 사고 사슬만으로는 진정한 추론이 성립하지 않으며, AlphaGo처럼 명시적 지식 상태와 독립적인 평가를 통해 증거·추론·믿음 수정을 추적할 수 있는 구조가 필요하다고 주장한다.

Don’t be fooled—LLMs don’t reason 관련 대표 이미지

🖼️ 인포그래픽

Don’t be fooled—LLMs don’t reason 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Don’t be fooled—LLMs don’t reason의 핵심 내용을 4단계로 요약한 인포그래픽
Don’t be fooled—LLMs don’t reason 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Thore Graepel은 LLM의 다음 토큰 예측과 사고 사슬만으로는 진정한 추론이 성립하지 않으며, AlphaGo처럼 명시적 지식 상태와 독립적인 평가를 통해 증거·추론·믿음 수정을 추적할 수 있는 구조가 필요하다고 주장한다.

📌 핵심 요약

  • 2016년 서울에서 열린 이세돌과의 대결에서 AlphaGo는 두 번째 경기의 37수로 주목받았고, 최종적으로 4-1로 승리했다. 저자는 전문가가 둘 확률이 약 1만 분의 1인 이 수를 선택하게 한 핵심이 직관적 정책 네트워크가 아니라 수천 갈래의 게임 트리를 탐색하며 미래 결과를 비교한 추론 장치였다고 설명한다.
  • LLM은 다음 토큰을 반복적으로 예측하며, 사고 사슬은 문제 분해와 중간 결과 활용을 통해 수학과 코딩에서 실제 성능 향상을 가져왔다. 그러나 저자는 이것이 동일한 예측 과정을 더 오래 수행하는 방식이며, AlphaGo의 탐색처럼 별도의 추론 메커니즘을 도입한 것은 아니라고 지적한다.
  • 저자가 제시한 현재 챗봇의 세 가지 한계는 명시적·지속적·검사 가능한 인식 상태의 부재, 신경망 가중치에 얽힌 지식과 추론의 분리 부족, 실제 답변 도출 경로와 다르게 사후 구성될 수 있는 사고 사슬이다. 의학·공학·과학 연구에서는 이러한 한계가 오류의 원인과 결론의 근거를 확인하기 어렵게 만든다.
  • 저자는 AlphaGo의 게임 트리처럼 확정된 지식, 의심, 배제한 가능성, 미해결 질문을 유지하고 갱신하는 일반 추론 구조를 제안한다. LLM은 접근법 제안, API나 코드를 통한 도구 사용, 증거 검토에 활용할 수 있지만, 독립적인 구성 요소가 각 단계의 불확실성 감소를 평가하고 증거가 뒷받침하는 경우에만 믿음을 갱신해야 한다고 주장한다.
  • 현실 세계는 상태가 부분적으로만 알려지고 행동과 결과도 가변적이거나 불확실하므로 바둑보다 추론이 어렵다. 저자는 규모 확대가 직관을 개선해도 숙고를 만들어내지는 못한다며, 신약 발견·재료·기후·진단에서 신뢰할 수 있는 새로운 통찰을 얻으려면 증거·추론·믿음 수정의 과정을 감사할 수 있는 시스템이 필요하다고 강조한다.

🧩 주요 포인트

  1. AlphaGo의 직관과 탐색 분리 → 가능성이 낮아 보이는 선택도 미래 결과를 검토해 채택할 수 있다는 점이 창의적 판단의 핵심이다.
  2. 사고 사슬의 성능 향상과 추론 경로의 불투명성 → 답변의 정확도 개선만으로 의학·공학·과학 연구에 필요한 오류 원인 추적이 확보되지는 않는다.
  3. 명시적 인식 상태와 독립적인 증거 평가 → 일반 추론의 발전 방향은 모델 규모 확대뿐 아니라 불확실성 감소와 믿음 수정의 검증 가능성을 확보하는 데 있다.

🧠 상세 정리

1. AlphaGo의 37수가 던진 질문

저자는 2016년 3월 서울에서 자신이 개발에 참여한 AlphaGo가 이세돌과의 다섯 경기 중 두 번째 경기에서 둔 37수를 회상하며 글을 시작한다. 바둑판의 다섯째 줄에 놓인 이 돌은 상대에게 이익을 주는 듯 보였고, 일부 해설자는 프로그램 오류라고 생각했지만 AlphaGo는 해당 경기에서 이긴 뒤 전체 대결에서도 4-1로 승리했다. 이세돌은 이 수를 보고 AlphaGo가 단순한 확률 계산 기계라는 생각을 바꾸었으며 창의적이라고 평가했다. 저자는 1997년 Garry Kasparov를 이긴 Deep Blue가 인간이 정한 규칙으로 각 선수의 수를 6~8수 앞까지 살피고 초당 2억 개의 체스 포지션을 평가했던 사례와 이를 대비한다. 바둑에서는 돌의 가치가 수십 수에 걸친 집단과 영역의 변화에 달려 있고 가능한 결과의 일부만 계산해도 슈퍼컴퓨터에 수십억 년이 걸리므로, AlphaGo의 승리를 단순한 계산량만으로 설명하기는 어렵다는 것이다.

2. 창의적 선택을 만든 직관과 탐색의 결합

저자는 37수를 순수한 기계적 직관의 발현으로 해석하는 통념을 반박하며, 실제로 그 선택을 가능하게 한 것은 AlphaGo의 추론 능력이었다고 설명한다. 강한 인간 선수가 둘 수를 예측하도록 훈련된 정책 네트워크는 37수를 특별히 유망하게 보지 않았고, 전문가가 선택할 확률도 약 1만 분의 1로 판단했다. 반면 탐색 장치는 당장의 그럴듯함을 넘어 후보 수의 미래 결과를 비교했으며, 서로 다른 미래를 나타내는 수천 갈래의 게임 트리를 명시적으로 구성하고 탐색했다. 저자는 이를 Daniel Kahneman이 대중화한 빠르고 직관적인 시스템 1과 느리고 단계적으로 숙고하는 시스템 2의 구분에 연결한다. AlphaGo의 네트워크가 유망한 수와 유리한 국면에 대한 직감을 제공하고 탐색이 이후의 수와 대응 수를 검토했기에, 직관만으로는 선택하기 어려웠던 수를 찾으면서도 무차별 탐색의 부담을 줄일 수 있었다.

3. LLM과 사고 사슬이 이룬 진전의 범위

저자는 오늘날 LLM의 기본 작동을 다음 토큰을 반복해서 선택하는 과정으로 설명하며, 이를 빠른 연상과 패턴 완성에 능한 시스템 1에 가깝다고 본다. ChatGPT 등장 이후 언어를 유창하게 생성하는 능력만으로는 충분한 유용성을 얻기 어렵다는 인식이 생겼고, 이에 즉시 답하는 대신 중간 단계를 생성하는 사고 사슬이 해법처럼 제시되었다. 이 과정은 문제를 작은 부분으로 나누고 중간 결과를 이어받아 이후의 처리에 반영하며, 특히 수학과 코딩에서 실제 성능 향상을 가져왔다. 저자는 이 성과를 인정하면서도, 중간 추론 역시 같은 다음 토큰 예측 과정에서 생성된다는 점을 강조한다. 따라서 답변을 확정하기 전에 예측을 더 오래 반복하는 것과 AlphaGo처럼 별도의 탐색 장치를 갖추는 것은 구별해야 하며, 성능 향상 자체가 독립적인 추론 메커니즘의 존재를 입증하지는 않는다는 주장이다.

4. 현재 챗봇의 추론에 대한 세 가지 비판

저자는 과학자가 인정할 만한 의미의 추론과 현재 챗봇의 작동을 구분하는 이유로 세 가지 한계를 제시한다. 첫째, 모델은 일반적으로 명시적이고 지속적이며 검사 가능한 인식 상태를 유지하지 않아, 검토 중인 가설과 설명별 확신, 고려하는 증거, 미해결 질문을 새 정보에 따라 체계적으로 갱신하는 기록이 없다. 둘째, 지식과 그 지식을 조작하는 방식이 신경망 가중치 안에 얽혀 있어, 시스템이 무엇을 믿는지와 그것을 어떻게 추론하는지를 명확히 분리하기 어렵다. 셋째, 겉으로 숙고처럼 보이는 사고 사슬도 실제 답변 도출 경로를 충실하게 보여주지 않을 수 있으며, 저자는 연구에서 챗봇이 한 경로로 답을 얻고 다른 경로를 사후 설명하는 현상이 확인되었다고 지적한다. 이 비판의 초점은 설명이 자연스럽고 설득력 있다는 사실만으로 그 설명을 실제 추론 과정의 신뢰할 수 있는 기록으로 볼 수 없다는 데 있다.

5. 고위험 분야에서 결론의 도출 과정이 중요한 이유

저자는 의학·공학·과학 연구처럼 결과의 영향이 큰 분야에서는 시스템의 결론뿐 아니라 그 결론에 도달한 방식도 중요하다고 강조한다. 예를 들어 진단이나 치료에서 오류가 발생하면, 추론 자체가 잘못되었는지, 유효하지 않은 증거를 사용했는지, 잘못된 가정을 세웠는지를 구분할 수 있어야 한다. 앞서 제시한 인식 상태의 부재와 지식·추론의 혼재, 사후 구성될 수 있는 설명은 이러한 원인 규명을 어렵게 만든다는 것이 글의 문제의식이다. 저자는 이 때문에 최근 Google DeepMind를 떠났다고 밝히며, AlphaGo의 구조에서 출발하는 새로운 기계 추론 접근이 필요하다고 주장한다. AlphaGo의 게임 트리는 검토한 여러 미래와 수, 국면에 대한 네트워크의 평가를 담고 있고 추론이 진행될수록 갱신되므로, 최종 선택에 이르기까지 어떤 가능성을 고려했는지를 나타내는 명시적인 구조의 사례가 된다.

6. 일반 추론을 인식 상태의 변화로 설계하기

저자는 일반적인 추론 시스템도 AlphaGo의 게임 트리에 대응하는 인식 상태를 유지해야 한다고 제안한다. 이 상태는 시스템이 확정된 것으로 받아들이는 내용, 의심하는 내용, 이미 배제한 가능성, 계속 열어둔 질문을 표현해야 하며, 추론은 그 상태를 바꾸어 지식을 늘리고 불확실성을 줄이는 일련의 움직임으로 이해할 수 있다. 여기에는 기존 지식의 결과를 연역하거나 문제를 여러 부분으로 나누는 활동뿐 아니라, 다음에 어떤 질문을 던지고 어떤 계산을 수행하며 어떤 실험을 할지 결정하는 활동도 포함된다. 특히 다음 행동의 선택은 단순히 이미 가진 정보를 설명하는 데 그치지 않고, 새로운 증거를 확보할 방향을 정한다는 점에서 중요하다. 이 제안의 핵심은 추론을 그럴듯한 문장의 연속으로만 표현하지 않고, 무엇을 알고 무엇을 아직 모르는지가 단계마다 어떻게 달라지는지 명시적으로 나타내는 데 있다.

7. 현실 세계의 난점과 독립적인 평가 장치

저자는 현실 세계의 추론이 바둑이나 체스보다 어렵다는 점을 인정하는데, 현재 상태가 부분적으로만 알려져 있고 가능한 행동의 집합도 크고 가변적이며 행동의 결과는 확률적이거나 알려져 있지 않기 때문이다. 그럼에도 최근 LLM과 다른 신경 모델의 발전은 알려진 정보와 사용할 수 있는 자원에 따라 문제 접근법을 제안하고, API나 코드로 도구를 사용하며, 주장이 증거의 지지를 받는지 검토하는 능력을 제공한다고 본다. 여기서 가장 중요한 조건은 독립적인 구성 요소가 각 움직임이 실제로 불확실성을 얼마나 해소했는지 평가하는 것이다. 믿음의 갱신은 증거가 그 변화를 뒷받침할 때만 허용되어야 하며, 저자는 이런 규칙이 지켜지면 검증된 지식을 축적하고 과거의 추론 경험에서 배워 추론 정책을 개선할 수 있다고 주장한다. 그는 이를 과학적 방법을 크게 강화한 시스템에 비유하며, 목적은 검토와 비판을 견딜 수 있는 지식을 생산하는 것이라고 설명한다.

8. 규모 확대를 넘어 감사 가능한 기계 지능으로

저자는 시스템 1의 규모를 키우는 것만으로 신뢰할 수 있는 기계 지능에 도달할 수 있다고 보지 않는다. 규모 확대는 직관을 정교하게 만들 수 있지만 직관 자체를 더 숙고하는 방식으로 바꾸지는 못하며, AlphaGo의 37수가 중요했던 이유는 명시적인 국면을 바탕으로 가능한 미래를 비교해 직관이 거부했을 법한 수를 선택했기 때문이라고 설명한다. 사회가 필요로 하는 비슷한 창의적 선택의 분야로는 신약 발견, 재료, 기후, 진단을 들지만, 이 영역에서는 바둑판 같은 명확한 환경이나 주어진 규칙을 기대하기 어렵다. 따라서 저자는 새로운 통찰의 기반이 사후에 꾸며낸 설득력 있는 이야기가 아니라, 증거와 추론 및 믿음 수정의 순서를 감사할 수 있는 시스템이어야 한다고 결론짓는다. 필자 Thore Graepel은 University College London의 기계학습 석좌교수이자 DeepMind AlphaGo 팀의 핵심 구성원이었으며, 글의 결론은 그가 제안하는 기계 추론의 방향을 담고 있다.

🧾 핵심 주장 / 시사점

  • AlphaGo 사례에서 창의성은 직관적으로 드문 선택을 생성하는 능력뿐 아니라, 그 선택의 미래 결과를 검토하고 채택할 근거를 확보하는 능력과 연결된다.
  • 사고 사슬의 유용성과 설명의 충실성은 구분해야 한다는 것이 저자의 논지다. 수학과 코딩의 성능 향상을 인정하더라도, 제시된 설명이 실제 답변 도출 과정을 반영하는지는 별도의 문제로 남는다.
  • 제안된 구조에서 LLM은 접근법과 행동을 제안하는 역할을 맡을 수 있지만, 지식의 축적은 독립적인 증거 평가와 명시적인 인식 상태 갱신에 달려 있다.

✅ 액션 아이템

  • 사고 사슬의 수학·코딩 성능 향상과 실제 추론 경로의 검증 가능성을 구분해 평가한다.
  • 의학·공학·과학 연구에서 추론 오류, 잘못된 증거, 잘못된 가정을 구분할 수 있는지 검토한다.
  • AlphaGo의 구조를 참고해 명시적 인식 상태와 독립적인 증거 평가를 결합하는 일반 추론 접근을 검토한다.

❓ 열린 질문

  • 사고 사슬의 수학·코딩 성능 향상이 실제 추론 경로의 충실성을 보장하는지 어떻게 확인할 수 있는가?
  • 명시적 인식 상태와 독립적인 증거 평가는 각 단계의 불확실성 감소를 어떻게 검증할 수 있는가?
  • 상태와 행동 결과가 불확실한 현실 세계에서 AlphaGo의 구조를 신약 발견·재료·기후·진단의 일반 추론에 어떻게 적용할 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.