Articletechnologyreview.com·2026년 9월 28일·0

When can we say AI made a scientific discovery?

Quick Summary

Anthropic과 OpenAI의 과학·수학 성과 논란은 AI의 유용한 연구 기여와 과학적 발견을 구분하고, 신규성·중요성·공로를 신중하게 평가해야 한다는 문제를 제기한다.

When can we say AI made a scientific discovery? 관련 대표 이미지

🖼️ 인포그래픽

When can we say AI made a scientific discovery? 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

When can we say AI made a scientific discovery?의 핵심 내용을 4단계로 요약한 인포그래픽
When can we say AI made a scientific discovery? 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Anthropic과 OpenAI의 과학·수학 성과 논란은 AI의 유용한 연구 기여와 과학적 발견을 구분하고, 신규성·중요성·공로를 신중하게 평가해야 한다는 문제를 제기한다.

📌 핵심 요약

  • Anthropic은 올해 초 개설한 분자생물학 연구소의 첫 발견을 발표했으며, Claude 에이전트가 생물학 문제를 탐색하고 인간 과학자가 실험을 수행하는 방식으로 운영된다고 밝혔다.
  • Anthropic에 따르면 에이전트 950개가 21시간 동안 찾아낸 것은 새로운 DNA 서열이 아니라 알려진 효소 주변의 반복 패턴이며, 회사는 이 패턴이 기존에 목록화되지 않았다고 주장하면서 CRISPR로 이어진 연구를 연상시킨다고 설명했다.
  • 일부 생물학자는 패턴 탐지보다 실제 기능 규명이 발견의 핵심이라고 반박했다. 코펜하겐대학교의 Mario Rodríguez Mestre는 자신의 팀이 이미 같은 패턴을 발견했다고 주장하고 Claude 대화 활용 가능성을 의심했으나, Anthropic은 이를 부인했다.
  • 글은 후보 200,000개를 탐색 가치가 있는 소수로 줄이는 작업도 정당한 과학적 기여라고 평가하며, AI 자체의 발견 여부만 따지는 구도가 인간의 안내와 실험을 포함한 협업의 가치를 가린다고 지적한다.
  • OpenAI가 상금 100만 달러가 걸린 수학 문제를 해결했다고 발표한 뒤에도 해답의 오류보다 결과의 중요성과 기존 연구의 공로 인정 여부가 논란이 됐다. Lucas Harrington은 근본적으로 새로운 생물학적 메커니즘의 발견이 제대로 평가받도록 지금부터 높은 기준을 세우자고 제안했다.

🧩 주요 포인트

  1. 반복 패턴 탐지와 실제 기능 규명은 다른 단계 → AI 성과의 신규성과 과학적 의미를 구분해 평가할 필요가 있다.
  2. 인간의 안내·실험과 AI의 후보 축소가 결합된 연구 → 발견의 주체를 AI 하나로 한정하면 협업의 기여가 양자택일 논쟁에 묻힌다.
  3. Anthropic의 선행 발견 논란과 OpenAI의 공로·중요성 논란 → 발견 기준과 공로 인정이 불명확하면 유효한 성과도 신뢰를 얻기 어렵다.

🧠 상세 정리

1. AI 연구소의 첫 발견이라는 발표

Anthropic은 지난 수요일, 올해 초 분자생물학 연구소를 출범시켰으며 이 연구소가 첫 발견을 했다고 발표했다. 연구소에서는 Claude 에이전트가 어려운 생물학 문제에 관한 자료를 읽고 가설을 제시하며, 인간 과학자들이 그 결과를 바탕으로 실험을 수행한다. 글은 이 성과를 이해하기 위해 생명체의 유전체 분석으로 축적된 수백만 개의 DNA 서열에서 흥미로운 효소를 암호화하는 특이한 서열을 찾는 상황을 예로 든다. 그런 서열을 찾는 것은 돌파구를 향한 한 단계일 수 있지만, 이후 효소가 무엇을 하는지 밝히고 유용한 방식으로 조작하는 방법까지 알아내야 한다는 설명이다.

2. 반복 패턴 탐지와 기능 규명의 간극

Anthropic에 따르면 에이전트 950개가 21시간 동안 찾아낸 것은 완전히 새로운 DNA 서열이 아니라 이미 알려진 효소 주변의 반복 패턴이었다. 회사는 이 특정 패턴이 이전에 목록화되지 않았다고 주장하고, 과학과 의학을 바꾼 유전자 편집 기술 CRISPR로 이어진 발견을 연상시킨다는 표현을 사용했다. 이에 일부 생물학자는 특이한 유전자 군집과 반복을 찾는 일은 비교적 쉬운 부분이며, 진짜 어려운 발견은 그 체계의 실제 기능을 규명하는 데 있다고 반박했다. 이 비판을 담은 게시물에는 제약사 Eli Lilly의 회장 겸 최고경영자도 동의를 표했다. 글은 AI가 방대한 생물학 데이터에서 인간의 눈으로 알아보기 어려운 패턴을 찾더라도, 그것이 생물학자에게는 일상적이거나 과학적 파급력이 크지 않은 결과일 수 있다고 지적한다.

3. 선행 발견 주장과 대화 활용 의혹

논란은 코펜하겐대학교의 생물학자 Mario Rodríguez Mestre가 자신의 연구팀이 이미 해당 패턴을 발견했다고 주장하면서 더 복잡해졌다. New York Times 보도에 따르면 그는 주말 동안 이 같은 입장을 밝혔으며, 평소 연구 과정에서 Claude와 자주 대화해 왔다. Mestre는 Anthropic 연구팀이 자신의 대화를 통해 해당 내용을 알게 된 것은 아닌지 의문을 제기했다. Anthropic은 이를 부인했지만, Mestre는 그럼에도 Claude 사용을 전면 중단하겠다고 말했다. 원문은 대화 활용을 확인된 사실로 제시하지 않으며, 이 사례는 패턴의 신규성뿐 아니라 연구 기여의 출처와 신뢰까지 쟁점이 됐음을 보여준다.

4. 발견의 주체를 둘러싼 양자택일 구도

글은 AI 기업들이 자사 시스템을 현미경이나 슈퍼컴퓨터처럼 과학자가 사용하는 도구로만 소개하지 않고, 스스로 발견하는 주체라고 강조하는 데 문제의 일부가 있다고 본다. 일부 사람에게 이런 설명은 협업과 계속 늘어나는 연구 도구를 통해 지식이 축적되는 실제 과학의 방식과 맞지 않는다. 한편 후보 200,000개를 탐색할 가치가 있는 소수로 줄이는 일은 결코 사소하지 않으며, 정당한 과학적 작업이라는 점도 강조한다. 인간이 방향을 안내하고 최종 실험을 수행했더라도 범용 챗봇이 그 작업을 해냈다는 사실은 주목할 만하다. 그러나 평가 기준이 Claude 자체가 발견했는지로 좁혀지면, 이러한 기여는 돌파구인지 실패인지 두 가지 답만 허용하는 논쟁의 재료로 바뀐다.

5. OpenAI 사례와 달라지는 평가 기준

글은 AI가 발견을 했는지만으로 평가하면, 성과를 거둔 것으로 보이는 경우에도 평가 기준을 뒤늦게 바꾸기 쉽다고 지적한다. 이달 초 OpenAI는 자사 에이전트 팀이 상금 100만 달러가 걸린 수학 문제를 해결했다고 발표했지만, 몇 주 뒤에는 그 문제가 정말 중요한지를 묻는 글이 AI 회의론자들 사이에서 공유됐다. 해당 글은 OpenAI의 해답이 틀렸다고 주장한 것이 아니라, 그 결과가 수학자들이 가장 중요하게 여기는 결과는 아닐 수 있다고 논했다. 여기에 한 수학자가 모델들이 자신의 연구 일부를 공로 인정 없이 사용했을 수 있다고 주장하면서 논쟁이 더해졌다. 그 결과 사람들은 OpenAI가 부정행위를 했거나 해답 자체가 중요하지 않다는 인상, 또는 두 가지 인상을 동시에 갖게 된다는 것이 글의 지적이다.

6. 미래의 진짜 발견을 위한 높은 기준

Anthropic의 발표를 비판한 생물학자 Lucas Harrington은 이런 논쟁이 앞으로 등장할 중요한 성과의 평가에도 영향을 줄 수 있다고 우려한다. 그는 AI가 실제로 근본적으로 새로운 생물학적 메커니즘을 발견했을 때 모두가 그 중요성을 알아볼 수 있도록, 지금부터 발견의 기준을 높게 설정하자고 제안했다. 이 제안은 AI의 연구 기여를 무시하자는 취지보다, 유용한 탐색 작업과 중대한 과학적 발견 사이의 구분을 분명히 하자는 문제의식으로 제시된다. 글은 그러나 OpenAI의 Sam Altman과 Anthropic의 Dario Amodei가 서로를 앞서려 경쟁하는 상황에서, AI의 과학적 돌파구에 적용할 기준을 높이는 일이 이들의 우선순위가 아닐 수 있다는 회의적인 관찰로 마무리된다.

🧾 핵심 주장 / 시사점

  • AI에 새로운 능력이라는 사실과 해당 학문에 새로운 지식이라는 사실은 다르므로, 기술적 성취와 과학적 발견의 의미를 별도로 살펴볼 필요가 있다.
  • 발견 여부를 양자택일로 평가하면 후보 축소처럼 실질적인 연구 기여를 과소평가하거나, 기능이 밝혀지지 않은 패턴을 과대평가할 수 있다.
  • 성과의 정확성·중요성·공로 인정은 서로 다른 쟁점이며, 이를 섞으면 유효한 결과까지 불신받거나 성공 이후 평가 기준이 달라질 수 있다.

✅ 액션 아이템

  • Anthropic의 반복 패턴 탐지를 실제 기능 규명과 구분해 신규성과 과학적 의미를 평가할 필요가 있음.
  • 후보 200,000개 축소의 기여를 인간의 안내·실험과 함께 평가할 필요가 있음.
  • OpenAI의 수학 문제 해결 성과는 결과의 중요성과 기존 연구의 공로 인정 여부를 구분해 검토할 필요가 있음.

❓ 열린 질문

  • Anthropic의 반복 패턴 탐지가 과학적 발견으로 인정받으려면 실제 기능 규명에서 무엇이 더 밝혀져야 하는가?
  • 후보 200,000개를 줄이는 AI의 작업과 인간의 안내·실험에 각각 어떤 기여를 인정해야 하는가?
  • OpenAI의 수학 문제 해결 성과에서 결과의 중요성과 기존 연구의 공로 인정 여부를 어떻게 구분해 평가할 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.