LLMs are stuck in a groupthink groove. This startup is trying to get them out.
Quick Summary
MIT Technology Review는 대규모 언어 모델들이 개방형 질문에서 서로 비슷하고 예측 가능한 답으로 수렴하는 문제를 짚고, 더 다양한 응답을 내도록 만든 Springboards의 모델 Flint를 소개한다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
MIT Technology Review는 대규모 언어 모델들이 개방형 질문에서 서로 비슷하고 예측 가능한 답으로 수렴하는 문제를 짚고, 더 다양한 응답을 내도록 만든 Springboards의 모델 Flint를 소개한다.
📌 핵심 요약
- 기사의 출발점은 챗봇에게 1부터 10 사이의 임의 숫자를 고르게 하면 자주 7이 나오고, 이어서 다른 숫자를 요구하면 3·4 또는 8·9처럼 반복적 패턴이 나타난다는 관찰이다.
- Springboards는 이런 ‘집단사고’식 수렴이 코딩이나 조사처럼 일관성이 중요한 작업에는 괜찮을 수 있지만, 브레인스토밍·여행 계획·광고 아이디어처럼 다양성이 필요한 작업에서는 문제가 된다고 본다.
- 회사는 Qwen 3 기반의 Flint를 만들었고, 일반 LLM보다 개방형 질문에서 더 넓은 범위의 답을 내도록 훈련해 자동차 이름, 신발 캠페인 태그라인, 금융회사 리브랜딩 같은 사례에서 다른 방향을 제시했다고 설명한다.
- 관련 연구인 ‘Artificial Hivemind’ 논문도 여러 LLM이 은유 작성 같은 개방형 과제에서 ‘시간은 강’ 또는 ‘시간은 직조공’처럼 매우 비슷한 답으로 몰리는 현상을 보였으며, 연구진은 비슷한 데이터·훈련 방식·목표가 원인일 수 있다고 추정했다.
- Flint는 아직 프로토타입이고 항상 제대로 작동하는 것은 아니며, 광고·마케팅 실무자들도 평균적인 답이 충분한 상황과 더 낯선 자극이 필요한 상황을 구분해야 한다고 말한다.
🧩 주요 포인트
- 기사의 출발점은 챗봇에게 1부터 10 사이의 임의 숫자를 고르게 하면 자주 7이 나오고, 이어서 다른 숫자를 요구하면 3·4 또는 8·9처럼 반복적 패턴이 나타난다는 관찰이다.
- Springboards는 이런 ‘집단사고’식 수렴이 코딩이나 조사처럼 일관성이 중요한 작업에는 괜찮을 수 있지만, 브레인스토밍·여행 계획·광고 아이디어처럼 다양성이 필요한 작업에서는 문제가 된다고 본다.
- 회사는 Qwen 3 기반의 Flint를 만들었고, 일반 LLM보다 개방형 질문에서 더 넓은 범위의 답을 내도록 훈련해 자동차 이름, 신발 캠페인 태그라인, 금융회사 리브랜딩 같은 사례에서 다른 방향을 제시했다고 설명한다.
- 관련 연구인 ‘Artificial Hivemind’ 논문도 여러 LLM이 은유 작성 같은 개방형 과제에서 ‘시간은 강’ 또는 ‘시간은 직조공’처럼 매우 비슷한 답으로 몰리는 현상을 보였으며, 연구진은 비슷한 데이터·훈련 방식·목표가 원인일 수 있다고 추정했다.
- Flint는 아직 프로토타입이고 항상 제대로 작동하는 것은 아니며, 광고·마케팅 실무자들도 평균적인 답이 충분한 상황과 더 낯선 자극이 필요한 상황을 구분해야 한다고 말한다.
🧠 상세 정리
1. 반복되는 답변에서 출발한 문제의식
기사는 독자에게 Claude, ChatGPT, Gemini 같은 챗봇에 “1부터 10 사이의 임의 숫자”를 물어보라고 제안하며 시작한다. 저자는 이때 대체로 7이 나오고, 다시 “다른 것”을 요구하면 3이나 4, 또다시 요구하면 8이나 9가 나오는 식의 패턴이 자주 나타난다고 설명한다. 이 실험은 항상 성공하는 마술은 아니지만, 대규모 언어 모델들이 사람들이 기대하는 것보다 훨씬 예측 가능하고 덜 창의적이라는 문제를 드러내는 장치로 쓰인다. 기사에서 핵심 문제는 모델이 틀린 답을 한다는 것이 아니라, 열린 질문에서도 많은 사람이 같은 답을 받게 된다는 점이다.
2. Springboards가 겨냥한 ‘집단사고’ 문제
호주 스타트업 Springboards는 이런 수렴 현상을 LLM의 ‘집단사고’ 문제로 보고, Flint라는 모델을 만들었다. Flint는 “유럽 어디로 여행을 가야 할까?”처럼 정답이 하나로 정해져 있지 않은 질문에서 주류 모델보다 더 다양한 답을 내도록 훈련됐다. Springboards의 공동창업자이자 CEO인 Pip Bingemann은 대부분의 언어 모델이 환각을 줄이려 하지만, 자신들은 오히려 그런 낯선 방향성을 어느 정도 환영한다고 말한다. 여기서 환각은 사실 확인이 필요한 영역에서의 오류가 아니라, 아이디어 탐색 과정에서 예상 밖의 방향으로 사고를 넓히는 자극으로 제시된다.
3. 숫자·자동차·태그라인 사례로 본 차이
Bingemann은 시연에서 ChatGPT와 Claude가 모두 7을 내놓은 뒤 Flint도 처음에는 7을 내놓는 모습을 보여준다. 그는 7도 정당한 답이라고 인정한 뒤 세션을 다시 시작했고, 이번에는 ChatGPT와 Claude가 다시 7을 낸 반면 Flint는 3.7916이라는 더 특이한 값을 냈다. 자동차 종류를 묻는 실험에서도 Bingemann은 ChatGPT와 Claude가 Toyota나 Honda를 낼 것이라고 예측했고 실제로 맞혔으며, Flint는 Ford F-150을 제시했다. New Balance 러닝화 캠페인 태그라인에서는 Claude와 ChatGPT가 모두 “Run your way”를 냈고, Flint는 “Built to last, run to win”이라는 다른 문구를 내놓았다.
4. 연구가 포착한 모델 간 동질성
기사에는 이 현상이 Springboards의 주장만이 아니라 연구계에서도 주목받고 있다는 설명이 이어진다. 11월 발표된 ‘Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)’ 논문은 개별 LLM 내부뿐 아니라 서로 다른 LLM 사이에서도 답변 반복이 상당하다는 점을 드러냈다. 연구진은 미국 주요 기업 모델과 중국 등지의 오픈소스 모델을 포함한 25개 LLM에 각각 50번씩 시간에 대한 은유를 쓰게 했다. 그 결과 1,250개 응답의 상당수가 “시간은 강” 또는 “시간은 직조공”의 변형으로 나타났고, 논문은 NeurIPS에서 최우수 논문상을 받았다.
5. 사용자가 알아차리기 어려운 반복성
Springboards의 공동창업자이자 CTO인 Kieran Browne은 대부분의 채팅 인터페이스가 개인적인 대화를 나누는 것처럼 설계돼 있어, 사용자가 자신이 다른 사람들과 같은 답을 받고 있다는 사실을 잘 느끼지 못한다고 말한다. 기사에서는 밴드 이름을 지어 달라는 예시가 제시된다. Browne에 따르면 많은 모델은 ‘glass’, ‘neon’, ‘velvet’, ‘static’ 같은 단어가 들어간 이름으로 수렴하는 경향이 있다. 저자가 직접 시도했을 때 ChatGPT는 ‘Glass Harbor’, ‘Static Empire’, ‘Neon Hearts’, ‘Velvet Echo’를 포함한 목록을 냈고, Gemini도 ‘Static Horizon’을 제안했다.
6. OpenAI의 설명과 신뢰성의 딜레마
기사에는 OpenAI의 입장도 포함된다. OpenAI는 모델이 신뢰할 수 있고 일관된 답을 내도록 훈련되면 익숙하고 확률이 높은 응답 주변으로 수렴할 수 있다고 설명한다. 또한 새로움을 더 강하게 밀어붙이면 응답이 약해지거나 덜 신뢰할 수 있게 될 수 있다고 말한다. 즉, 다양성과 안정성 사이에는 긴장이 있으며, 창의성을 높이는 것이 단순히 좋은 방향으로만 작동하지는 않는다는 지적이다. OpenAI는 또 ‘Artificial Hivemind’ 논문이 2024년 모델들을 연구했으며, 그 이후 모델들이 업데이트됐다는 점도 덧붙였다.
7. 창작 도구 안에서의 Flint 활용
Springboards는 ChatGPT와 Claude 등을 포함한 여러 LLM을 바탕으로 광고·마케팅 창작자들이 아이디어를 브레인스토밍할 수 있는 도구를 개발했다. 이 도구에서는 여러 모델이 만든 텍스트 조각을 끌어다 놓고 마음에 드는 부분을 조합할 수 있으며, Flint는 더 다양한 선택지를 원하는 사용자가 고를 수 있는 대안 모델로 제시된다. 비즈니스 전략 스타트업 Bodacious의 창업자이자 77X의 최고전략책임자인 Zoe Scaman은 Flint가 자신을 완전히 다른 방향으로 던져 주는 데 유용하다고 말했다. 그는 청년층을 위한 금융회사 재창조 과제에서 주류 모델들이 금융 문해력을 재미있게 가르치자는 익숙한 방향으로 갔지만, Flint는 부의 축적이라는 개념 자체를 리브랜딩하자는 다른 제안을 했다고 설명했다.
8. 기술적 접근과 남은 한계
Springboards는 자체 기초 모델을 처음부터 훈련하기에는 비용이 너무 크기 때문에 Alibaba의 오픈소스 모델 Qwen 3 위에 Flint를 만들었다. Browne은 창의성을 높이려면 온도 설정을 올리라는 조언을 먼저 검토했지만, 모델 전체의 무작위성을 높이면 문장 중간에 영어에서 코드로 바뀌는 등 응답이 incoherent해질 수 있었다고 말한다. 그래서 Springboards는 모든 단어에서 무작위성을 높이기보다, 목적지 이름처럼 다양성이 필요한 특정 지점만 찾아 조금 더 무작위적인 단어나 구를 넣도록 모델을 훈련했다. 다만 Flint는 아직 프로토타입이며, Scaman은 너무 밀어붙이면 제대로 작동하지 않을 때도 있다고 말했다.
9. 평균적인 답과 낯선 자극 사이의 선택
마케팅 회사 Uncommon의 공동창업자이자 최고전략책임자인 Maximilian Weigl은 Flint가 ‘이상한 것’을 던져 넣어 더 넓게 생각하도록 초대한다는 점이 흥미롭다고 평가한다. 그의 팀은 Flint를 ChatGPT, Claude, Gemini와 함께 사용하지만, 그는 평균으로 되돌아가게 만드는 도구만으로는 경계를 깨는 것을 만들기 어렵다고 말한다. 동시에 그는 열 번 중 아홉 번은 평균적인 답도 충분하며, 많은 사람들은 대중시장에 익숙한 ‘괜찮은’ 결과를 원한다고 덧붙인다. 또한 어떤 AI든 출력물을 그대로 복사해 쓰는 것은 문제라고 경고하며, 사람은 스스로 생각하고 대화하고 자신의 목소리를 사용해야 한다고 강조한다.
🧾 핵심 주장 / 시사점
- LLM의 반복성은 단순한 재미있는 버그가 아니라, 개방형 사고가 필요한 작업에서 사용자들이 비슷한 아이디어 출발점에 갇히게 만들 수 있는 구조적 문제로 제시된다.
- Flint의 접근은 창의성을 ‘전체 응답의 무작위성’으로 높이기보다, 다양성이 필요한 특정 순간에만 변주를 넣으려는 방식이라는 점에서 온도 조절보다 더 정밀한 문제 설정을 보여준다.
- 기사의 실무자들은 Flint를 최종 답변 생성기보다 사고를 흔드는 도구로 받아들이며, AI 출력물을 그대로 쓰기보다 사람의 판단·대화·목소리와 결합해야 한다고 본다.
✅ 액션 아이템
- 1~10 임의 숫자 반복 실험에서 드러난 7·3/4·8/9 패턴을 기반으로 모델별 개방형 응답 수렴 경향을 체계적으로 재측정한다.
- 코딩·조사처럼 일관성이 중요한 작업과 브레인스토밍·여행 계획·광고 아이디어처럼 다양성이 필요한 작업을 구분해 사용 시나리오를 설정한다.
- Flint의 Qwen3 기반 사례(자동차 이름·신발 캠페인 태그라인·금융 리브랜딩)에서 제시된 넓은 응답 범위를 현재 목적에 맞는 비교 기준으로 점검한다.
❓ 열린 질문
- 임의 선택·연속 질문 조건에서 모델별로 ‘시간은 강’형 유사 답이 반복되는 원인을 어떤 데이터·훈련·목표 조합으로 설명할 것인가?
- 광고·마케팅 실무에서 평균적인 답이 충분한 경우와 더 낯선 자극이 필요한 경우를 구분할 구체적 경계는 어떻게 정의할 것인가?
- Flint의 확장된 응답 폭이 실제 창의 산출의 질 향상으로 증명되려면 어떤 지표를 어느 기간 동안 어떻게 관찰해야 할 것인가?