ArticleJulie Bort·2026년 10월 2일·0

Circuit Breaker Labs hopes to make AI safer for your kids (and you)

Quick Summary

Circuit Breaker Labs는 다양한 연령·언어·문화를 모사하는 AI 에이전트로 챗봇의 심리적 위해 가능성을 시험해 어린이와 성인의 AI 이용 안전성을 높이려는 초기 스타트업이다.

Circuit Breaker Labs hopes to make AI safer for your kids (and you) 관련 대표 이미지

🖼️ 인포그래픽

Circuit Breaker Labs hopes to make AI safer for your kids (and you) 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Circuit Breaker Labs hopes to make AI safer for your kids (and you)의 핵심 내용을 4단계로 요약한 인포그래픽
Circuit Breaker Labs hopes to make AI safer for your kids (and you) 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Circuit Breaker Labs는 다양한 연령·언어·문화를 모사하는 AI 에이전트로 챗봇의 심리적 위해 가능성을 시험해 어린이와 성인의 AI 이용 안전성을 높이려는 초기 스타트업이다.

📌 핵심 요약

  • Character.AI는 올해 초 챗봇과 상호작용한 뒤 자살로 사망한 미성년 이용자 가족들이 제기한 여러 부당 사망 소송을 합의로 마무리했으며, OpenAI도 ChatGPT가 가족의 자살과 망상에 관여했다는 주장으로 여러 가족에게 소송을 당했다.
  • 남매인 Shirali Nigam CEO와 Arul Nigam CTO는 14세 Sewell Setzer의 사망 사건을 계기로 Circuit Breaker Labs를 설립했으며, 이용자가 자연스럽게 대화하는 과정에서 맥락이나 뉘앙스를 잘못 이해해 발생하는 위험을 예방하려 한다.
  • Circuit Breaker Labs는 인간 분야 전문가와 함께 연령·배경·언어·문화가 다양한 이용자를 모사하는 AI 에이전트를 만들고, 실제 말투·은어·암호화된 표현·오타를 반영한 레드팀 테스트를 하루 수만~수십만 건 수행한다.
  • 여러 대화와 시간이 흐르면서 나타나는 위험에 모델이 적절히 대응하는지 시험하며, 자체 평가 방식으로 감사 가능하고 설명 가능한 점수를 산출한다.
  • 현재 AI 코칭·일기 작성·정신건강 지원 앱 등 고위험 분야를 대상으로 작동하는 제품을 제공하지만 직원은 창업자 남매를 포함해 5명이며 주요 고객은 공개하지 않았다. 향후 AI 동료 에이전트 등으로 시험 범위를 넓힐 가능성을 제시하고, AI를 더 안전하게 만들어 이용자의 신뢰를 높이려 한다.

🧩 주요 포인트

  1. 자연스러운 대화에서도 맥락과 뉘앙스 오해가 위험을 낳을 수 있다는 문제의식 → 의도적인 공격뿐 아니라 일상적인 이용 과정도 안전성 시험의 대상이 된다.
  2. 연령·언어·문화별 표현 차이와 여러 대화에 걸친 위험을 함께 시험 → 표준적인 말투에 대한 대응만으로 다양한 이용자의 안전성을 판단하기 어렵다는 시사점을 제시한다.
  3. AI 코칭·정신건강 지원 앱에서 시작해 AI 동료 에이전트로 확장을 구상하는 5명 규모의 초기 기업 → 적용 범위에 대한 기대와 실제 안전성 개선 효과의 검증 필요성을 함께 살펴볼 단계다.

🧠 상세 정리

1. 이미 발생한 심리적 위해와 소송

기사는 AI가 언젠가 인류를 위협할 수 있다는 논의에 앞서, 일부 이용자에게는 이미 심리적인 경로로 생명을 위협하는 문제가 발생했다고 지적한다. Character.AI는 챗봇과 상호작용한 뒤 자살로 사망한 미성년 이용자들의 가족이 제기한 여러 부당 사망 소송을 올해 초 합의로 마무리했다. 여러 가족은 OpenAI를 상대로도 ChatGPT가 가족의 자살과 망상에 관여했다고 주장하며 소송을 제기했다. 이 사례들은 기사에서 AI의 심리적 안전성을 다뤄야 하는 배경으로 제시되며, 소송상 주장과 합의 사실을 인과관계가 확정된 판단으로 바꿔 읽어서는 안 된다. Circuit Breaker Labs는 이러한 문제에 대응해 언어와 문화 전반에서 AI를 더 안전하게 만드는 것을 목표로 한다.

2. 창업 계기와 자연스러운 대화의 위험

Circuit Breaker Labs의 창업자인 Shirali Nigam과 Arul Nigam은 남매이며, 각각 CEO와 CTO를 맡고 있다. 두 사람에게 동기를 준 사건은 Character.AI 챗봇에 정서적 애착을 형성하고 자해 생각을 털어놓은 뒤 자살로 사망한 14세 Sewell Setzer의 사례였다. 부모는 2024년 소송에서 챗봇이 이를 부추겼다고 주장했고, Arul은 챗봇이 ‘너와 함께 있고 싶다’ 같은 말의 실제 함의를 이해하지 못했을 가능성을 언급했다. Arul은 특히 젊은 이용자들이 지원을 얻으려고 이런 시스템을 찾지만 필요한 도움을 받지 못하거나 오히려 해를 입는 경우가 있다고 설명했다. 회사가 예방하려는 것은 이용자가 시스템을 의도적으로 깨뜨리려 하지 않아도, 자연스러운 대화 중 맥락이 오염되거나 뉘앙스를 이해하지 못해 시스템이 위험한 행동을 하는 상황이다.

3. 다양한 이용자를 모사하는 AI 에이전트

Circuit Breaker Labs는 자사의 AI 에이전트를 충돌 시험용 더미의 군대에 비유하며, 다양한 연령·배경·언어·문화를 가진 사람들을 모사하도록 만들었다. 이 에이전트는 모델이 위험하거나 심리적으로 해로운 상호작용을 감지할 수 있는지 시험하는 데 쓰인다. Shirali는 6세 여자아이와 45세 남성의 말투, 영어를 모국어로 쓰는 사람과 제2언어로 쓰는 사람의 표현, 게이머 은어와 다른 집단의 은어가 모델을 혼란스럽게 할 수 있다고 설명했다. 모델은 표준적인 발화 패턴을 처리하는 데 능숙하지만 실제 사람들의 말은 그와 다르며, 뉘앙스나 은어를 오해하면 결과가 매우 나빠질 수 있다는 것이 그의 주장이다. 회사는 인간 분야 전문가와 협력해 현실적인 이용자 시뮬레이션을 만들고, 실제 말투와 은어, 암호화된 표현, 오타를 시험에 반영한다.

4. 대규모 대화 시험과 설명 가능한 평가

회사가 수행하는 레드팀 테스트는 모델의 약점을 찾아내기 위한 적대적 시험이며, 현실적인 이용자 시뮬레이션을 기반으로 한다. Circuit Breaker Labs는 이러한 모의 상호작용을 하루에 수만 건에서 수십만 건까지 실행한다. 시험의 목적은 한 번의 응답만 살피는 데 그치지 않고, 시간이 흐르고 여러 대화가 이어지는 동안 나타날 수 있는 위험한 상호작용에 모델이 적절히 대응하는지 확인하는 것이다. 회사는 이후 자체 평가 방식을 사용해 감사 가능하고 설명 가능한 점수를 산출한다고 설명한다. 다만 기사는 그 평가 방식의 구체적인 기준이나 시험 결과, 실제 위해 감소 효과를 제시하지 않으므로, 시험 규모와 점수의 성격을 안전성 개선이 입증됐다는 의미로 확대해서는 안 된다.

5. 현재 사업 단계와 향후 적용 범위

Circuit Breaker Labs는 현재 AI 코칭, 일기 작성, 기타 정신건강 지원 앱처럼 위험도가 높은 AI 응용 분야를 대상으로 안전성 시험 기관 역할을 하고 있다. 이미 작동하는 제품이 있지만 매우 초기 단계이며, 직원은 Nigam 남매를 포함해 5명뿐이다. Arul은 주요 고객의 이름을 공개하지 않아 기사만으로 구체적인 도입 기업을 확인할 수는 없다. 회사는 장기적으로 이용자가 챗봇과 일방적인 친밀 관계를 형성해 이른바 ‘AI psychosis’에 빠질 위험이 있는 다른 앱에도 시험 플랫폼을 적용할 수 있다고 본다. 기사에서 제시한 예시는 상호작용마다 응답이 달라질 수 있는 AI 동료 에이전트이며, 이는 현재 확보한 적용 실적이 아니라 향후 확장 가능성으로 소개된다.

6. 안전성 개선을 통한 신뢰 형성

Arul은 사람들이 AI 전반을 더 의심하거나 도입을 꺼리고 있다고 말하면서도, 회의적인 태도 자체는 건전하다고 평가했다. 동시에 안전성 우려 때문에 잠재적으로 가치 있는 도구를 금지하는 것은 퇴행적이라는 입장을 제시했다. Circuit Breaker Labs는 이러한 두려움에 대한 해법으로 AI를 더 안전하게 만드는 일을 제안하며, 이를 통해 이용자의 신뢰를 쌓고 싶다고 밝혔다. 회사는 TechCrunch의 2026 Startup Battlefield 200 선정 스타트업 중 하나로 소개됐다. 또한 올해 10월 13~15일 샌프란시스코 Moscone West에서 열리는 TechCrunch Disrupt에서 발표할 예정이며, 기사는 이 초기 기업의 접근법과 목표를 소개하는 데 초점을 맞춘다.

🧾 핵심 주장 / 시사점

  • 이 기사가 제시하는 안전성 문제는 악의적인 공격에 한정되지 않는다. 도움을 구하는 이용자의 자연스러운 대화도 맥락과 뉘앙스 해석에 실패하면 위험해질 수 있다.
  • 다양한 연령·언어·문화와 여러 대화에 걸친 상호작용을 시험한다는 접근은, 안전성을 이용자의 표현 방식과 대화의 흐름까지 포함해 평가해야 한다는 시사점을 준다.
  • 작동하는 제품과 대규모 시험 수행은 현재 사업의 기반이지만, 기사에는 구체적인 평가 결과나 위해 감소 효과가 제시되지 않아 회사의 목표와 검증된 성과를 구분할 필요가 있다.

✅ 액션 아이템

  • AI 코칭·일기 작성·정신건강 지원 앱의 안전성 검토에서 자연스러운 대화와 맥락·뉘앙스 오해 가능성을 함께 검토한다.
  • 연령·언어·문화별 표현 차이와 여러 대화에 걸친 위험이 Circuit Breaker Labs의 레드팀 테스트에 어떻게 반영되는지 확인한다.
  • Circuit Breaker Labs의 감사 가능하고 설명 가능한 점수가 실제 안전성 개선 효과를 판단하는 데 어떤 근거를 제공하는지 검토한다.

❓ 열린 질문

  • Circuit Breaker Labs는 연령·언어·문화별 표현 차이를 레드팀 테스트에 얼마나 충실하게 반영하고 있는가?
  • 자체 평가 방식으로 산출하는 감사 가능하고 설명 가능한 점수는 실제 안전성 개선 효과와 어떻게 연결되는가?
  • 직원 5명 규모의 Circuit Breaker Labs는 AI 코칭·정신건강 지원 앱에서 AI 동료 에이전트로 시험 범위를 어떻게 확대할 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.