ArticleOpenAI·2026년 8월 27일·0

Better answers, broader thinking: What students gain from ChatGPT and critical-thinking training

Quick Summary

보코니대학교 실험에서 ChatGPT는 학생 답안의 품질과 논리적 일관성을 높였고, 인과 추론 훈련은 아이디어의 독창성과 다양성을 넓혔으며, 두 개입을 함께 받은 학생들은 양쪽 효과를 보였다.

Better answers, broader thinking: What students gain from ChatGPT and critical-thinking training 관련 대표 이미지

🖼️ 인포그래픽

Better answers, broader thinking: What students gain from ChatGPT and critical-thinking training 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Better answers, broader thinking: What students gain from ChatGPT and critical-thinking training의 핵심 내용을 4단계로 요약한 인포그래픽
Better answers, broader thinking: What students gain from ChatGPT and critical-thinking training 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

보코니대학교 실험에서 ChatGPT는 학생 답안의 품질과 논리적 일관성을 높였고, 인과 추론 훈련은 아이디어의 독창성과 다양성을 넓혔으며, 두 개입을 함께 받은 학생들은 양쪽 효과를 보였다.

📌 핵심 요약

  • 보코니대학교 연구진은 OpenAI 경제연구팀과 협력해 학부 1학년생 1,000명 이상을 대상으로 대학 기념품 매장의 마케팅 방안을 제안하는 실험을 진행했다.
  • 학생들은 수업 시간대별로 ChatGPT(GPT‑4o) 접근권만 제공받는 집단, 인과 추론 훈련만 받는 집단, 둘 다 받는 집단, 어느 쪽도 받지 않는 집단에 무작위 배정됐다.
  • ChatGPT 접근권이 있는 학생들은 5점 척도에서 거의 1점 높은 점수를 받았으며, 답안에 더 많은 아이디어와 명확한 논리를 담고 전문가의 제안과 더 높은 유사성을 보였다.
  • 인과 추론 훈련을 받은 학생들은 아이디어의 성공·실패 조건을 더 명확히 설명했고 집단 전체에서 더 다양하고 동료들과 구별되는 아이디어를 냈지만, 매장 인지도와 이용 증대만 평가한 채점 기준에서는 점수가 높아지지 않았다.
  • 두 개입을 함께 받은 집단은 훈련만 받은 집단 수준의 아이디어 다양성과 ChatGPT만 사용한 집단 수준의 점수·아이디어 수를 보였다. 연구는 최종 답안의 완성도뿐 아니라 독창성, 추론, 여러 접근법의 고려도 평가할 필요성을 제기했다.

🧩 주요 포인트

  1. 성과 지표의 차이 → ChatGPT의 품질 개선과 인과 추론 훈련의 독창성 효과는 채점 점수 하나로 모두 포착되지 않음.
  2. 두 개입의 병행 효과 → AI 활용과 사고력 교육은 서로 다른 성과를 지원하는 상호 보완적 교육 요소.
  3. 전문가와 유사한 답안의 증가 → 최종 결과물의 완성도만으로 학생의 실제 이해를 판단하는 평가에는 한계.

🧠 상세 정리

1. 실험의 질문과 설계

보코니대학교 연구진과 OpenAI 경제연구팀은 학생들이 실제 과제에 ChatGPT를 사용할 때 답안의 품질과 독창성이 어떻게 달라지는지 살폈다. 실험에는 학부 1학년생 1,000명 이상이 참여했으며, 대학 기념품 매장을 위한 마케팅 방안을 제안하는 과제를 수행했다. 학생들은 수업 시간대별로 ChatGPT 접근권만 받거나, 인과 추론 훈련만 받거나, 둘 다 받거나, 어느 쪽도 받지 않는 네 집단에 무작위 배정됐다. 제공된 모델은 GPT‑4o였다. 이러한 설계는 ChatGPT 접근권과 사고 훈련의 개별 효과를 두 개입을 결합했을 때의 효과와 구분해 살펴볼 수 있게 했다.

2. 사고 훈련과 평가 방식

인과 추론 훈련은 원인과 결과를 연결하고 특정 해결책이 작동하거나 실패할 수 있는 이유를 설명하는 비판적 사고 활동이었다. 훈련 자체는 AI와 무관했으며, 게임과 사례, 질문, 피드백을 통해 인과 추론 개념을 가르쳤다. 훈련받은 인간 평가자들은 학생 제출물을 5점 척도의 채점 기준으로 평가했다. 이 기준은 제안이 대학 매장의 인지도와 이용을 높이는 두 가지 마케팅 목표에 얼마나 잘 부합하는지를 측정했다. 연구진은 별도로 자동 텍스트 분석을 실시해 아이디어의 수와 다양성, 인과 추론의 흔적, 전문가 세 명이 작성한 제안과의 유사성을 측정했다.

3. ChatGPT가 높인 답안의 품질

ChatGPT 접근권을 제공받은 학생들은 5점 척도에서 거의 1점 높은 점수를 받았다. 이들의 답안에는 더 많은 아이디어가 포함됐고, 논리 전개가 더 명확했으며, 전문가가 작성한 마케팅 제안과의 유사성도 높았다. 연구는 이를 AI가 초보자의 결과물을 더 전문적인 수준으로 보이게 만드는 데 도움을 준 결과로 설명했다. 다만 학생들은 과제를 ChatGPT에 전적으로 맡긴 것이 아니라, 무엇을 물을지 결정하고 응답을 평가하며 최종 제출물에 넣을 내용을 선택해야 했다. 따라서 관찰된 성과에는 도구가 제공한 도움과 함께 학생이 질문·평가·선택에 참여하는 과정이 포함돼 있었다.

4. 채점 점수에 드러나지 않은 독창성

인과 추론 훈련을 마친 학생들은 자신의 아이디어가 왜 효과를 낼 수 있는지, 어떤 상황에서는 실패할 수 있는지를 더 명확히 설명했다. 그러나 매장 인지도와 이용 증대를 기준으로 한 채점에서는 더 높은 점수를 받지 않았다. 별도의 텍스트 분석에서는 훈련을 받은 집단 전체가 더 폭넓은 아이디어를 내고, 동료들의 제안과 비교해 더 구별되는 내용을 제시한 것으로 나타났다. 이는 훈련의 효과가 없었다는 뜻이 아니라, 해당 채점 기준이 포착하지 못한 성과가 있었다는 뜻이다. 연구는 명확하고 구조가 좋은 답안을 보상하는 전통적인 기준이 다른 학생에게서는 나오지 않은 아이디어의 가치를 놓칠 수 있음을 지적했다.

5. AI 활용과 사고력 교육의 결합

연구는 학생이 스스로 사고하도록 가르치는 일과 AI를 활용하도록 가르치는 일을 양자택일로 볼 필요가 없다고 설명했다. 두 개입을 함께 받은 학생들의 아이디어 다양성은 인과 추론 훈련만 받은 학생들과 비슷했다. 채점 점수와 아이디어 수는 ChatGPT 접근권만 받은 학생들과 유사한 수준이었다. 이들의 답안에서는 더 강한 논리적 일관성과 함께 설명을 찾고 가정에 의문을 제기하는 흔적도 나타났다. 전체적으로 병행 집단은 가장 폭넓은 측정 항목에서 개선을 보였으며, 이는 답안의 품질을 높이는 AI의 역할과 사고의 폭을 넓히는 훈련의 역할이 상호 보완적이라는 해석을 뒷받침했다.

6. 학교 평가에 제기되는 과제

인과 추론 훈련이 만든 변화와 기존 채점 기준이 포착한 결과 사이의 차이는 학교 평가의 과제를 보여준다. AI가 학생의 답안을 매끄럽고 전문가와 유사하게 만드는 데 도움을 줄수록, 최종 답안만 살펴보는 방식으로는 학생이 실제로 무엇을 이해하는지 파악하기 어려워진다. 원문은 많은 교육자가 이미 이러한 변화에 대응해 과제와 평가 방식을 바꿀 필요성을 고민하고 있다고 설명했다. 이는 사회에 필요한 역량을 지원하기 위해 기술과 교육이 함께 변화해 온 흐름과도 연결된다. 연구가 강조하는 방향은 관습적이거나 완성도 높은 답안뿐 아니라 독창성, 추론, 여러 접근법을 고려한 결과물도 평가에서 인정하는 것이다.

🧾 핵심 주장 / 시사점

  • 채점 점수가 높아지지 않았다는 결과만으로 교육 효과가 없다고 판단하면, 인과 추론 훈련이 넓힌 아이디어의 다양성과 독창성을 놓칠 수 있다.
  • 병행 집단의 성과는 AI 활용 교육과 비판적 사고 교육을 서로 다른 능력을 지원하는 조합으로 볼 근거를 제공한다.
  • 전문가와 유사한 결과물을 만드는 능력과 학생 자신의 이해를 평가하는 일은 구분해서 살펴볼 필요가 있다.

✅ 액션 아이템

  • ChatGPT 활용과 인과 추론 훈련을 상호 보완적 교육 요소로 함께 고려.
  • 과제 평가에서 답안의 완성도와 함께 독창성, 추론, 여러 접근법의 고려를 반영하는 방안 검토.
  • 채점 점수와 아이디어 다양성을 구분해 인과 추론 훈련의 성과를 해석.

❓ 열린 질문

  • ChatGPT 활용과 인과 추론 훈련을 수업에서 어떻게 함께 구성할 수 있을까?
  • 매장 인지도와 이용 증대를 평가하면서 독창성과 추론도 인정하려면 채점 기준을 어떻게 바꿔야 할까?
  • ChatGPT로 높아진 최종 답안의 완성도와 학생의 실제 이해를 어떻게 구분해 평가할 수 있을까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.