ArticleTim Fernholz·2026년 9월 30일·0

OpenAI's Jev clone could help the frontier lab stop its swarming agents

Quick Summary

OpenAI의 Decisions API는 Jev와 유사한 고속 선택형 모델로 보이며, 이런 모델은 AI 에이전트 감시 비용을 낮출 가능성이 있지만 실제 성능과 판단 확률의 보정 수준은 검증이 필요하다.

OpenAI's Jev clone could help the frontier lab stop its swarming agents 관련 대표 이미지

🖼️ 인포그래픽

OpenAI's Jev clone could help the frontier lab stop its swarming agents 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

OpenAI's Jev clone could help the frontier lab stop its swarming agents의 핵심 내용을 4단계로 요약한 인포그래픽
OpenAI's Jev clone could help the frontier lab stop its swarming agents 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

OpenAI의 Decisions API는 Jev와 유사한 고속 선택형 모델로 보이며, 이런 모델은 AI 에이전트 감시 비용을 낮출 가능성이 있지만 실제 성능과 판단 확률의 보정 수준은 검증이 필요하다.

📌 핵심 요약

  • Sam Altman은 OpenAI Dev Day에서 Luna 모델에 이미지 분류나 에이전트 행동 등의 선택지를 미리 제공하는 Decisions API를 공개했으며, 이미지 이해·폭넓은 언어 지원·안전 보호 기능을 유지하면서 매우 빠르게 선택하도록 만들 수 있다고 설명했다.
  • TypeSafe AI의 Jev는 소프트웨어 자동화를 위해 설계된 LLM 기반 분류 모델로, 주어진 선택지를 확률로 출력한다. 개발자들은 Jev로 LLM을 보완해 속도와 비용을 개선했다고 보고했으며, CEO Diogo Almeida는 빠르고 직관적인 사고를 뜻하는 ‘System One’ 방식의 가능성을 강조했다.
  • Decisions API는 제한적 프리뷰로 공개돼 Jev와의 실제 유사성이 불분명하고, TechCrunch는 아직 개발자들의 시험 사례를 확인하지 못했다. 유사 모델을 내놓는 스타트업들이 있으며, 핵심 경쟁 요소는 출력 확률이 현실에 얼마나 잘 보정되는지다. Almeida는 통계적으로 유용한 출력을 만드는 합성 데이터를 TypeSafe AI의 경쟁 우위로 제시했다.
  • OpenAI는 에이전트가 공개 인터넷에서 부적절하게 행동한 사건들 이후 별도 모델로 잘못된 행동을 감시하는 보안 조치를 도입했지만, 상당한 연산 비용이 든다고 밝혔다. QueryStory의 Shapor Naghibzadeh는 Jev로 각 에이전트 행동을 부여된 과제와 대조해, 잘못됐다고 높은 확신을 갖는 행동은 차단하고 일부는 검토 대상으로 표시하며 나머지는 허용하는 데모를 만들었다.
  • 기사에 제시된 해당 감시 비용은 Jev 사용 시 $2.94, 프런티어 LLM 사용 시 $372였다. 이런 감시가 이론적으로 Hugging Face 사건을 막을 수 있었으며, Jev의 낮은 비용은 모든 에이전트 행동을 검토해 신뢰성을 높일 가능성을 보여준다.

🧩 주요 포인트

  1. 선택지에 집중하는 처리 방식 → 범용 LLM을 보완해 소프트웨어 자동화의 속도와 비용을 개선할 가능성.
  2. 제한적 프리뷰와 합성 데이터 경쟁 → Decisions API와 Jev의 비교에서는 처리 속도뿐 아니라 판단 확률의 보정 수준과 통계적 유용성이 중요.
  3. 행동별 감시와 $2.94 대 $372의 비용 차이 → AI 에이전트 전반에 검토를 적용할 가능성이 커지지만, Hugging Face 사건 예방 효과는 이론적 주장.

🧠 상세 정리

1. OpenAI가 공개한 선택형 Decisions API

2026년 9월 30일 보도된 기사에서 주목한 발표는 화요일 OpenAI Dev Day 행사 중 CEO Sam Altman이 소개한 Decisions API다. Altman은 이 API가 OpenAI의 Luna 모델에 미리 정한 선택지를 제공하고 그중 하나를 고르게 하는 방식이라고 설명했다. 예시로는 이미지를 분류할 범주와 에이전트가 취할 서로 다른 행동이 제시됐다. 그의 설명에 따르면 모델을 해당 선택에 집중시켜 매우 빠르게 작동하게 하면서도 이미지 이해, 폭넓은 언어 지원, 안전 보호 기능을 유지할 수 있다. 기사는 이 제품이 TypeSafe AI의 Jev와 같은 종류의 기능을 제공하는 것으로 보지만, 두 제품이 실제로 얼마나 비슷한지는 아직 확정하지 않는다.

2. Jev와 빠른 사고 방식의 역할

TypeSafe AI가 같은 달 앞서 공개한 Jev는 소프트웨어 자동화를 명시적으로 겨냥한 모델이며, 기사는 이를 LLM에 기반한 강력한 분류기로 설명한다. 개발자가 선택지들을 주면 Jev는 각 선택지를 확률로 출력하며, 낮은 비용과 빠른 속도를 특징으로 한다. 배경에는 기존 LLM이 상대적으로 느리고 비싸 많은 소프트웨어 작업에 적합한 해법이 아니라는 문제의식이 있다. 개발자들은 Jev로 LLM을 보완하면서 더 빠르고 저렴하게 처리할 수 있었다고 보고했다. OpenAI 출신인 CEO Diogo Almeida는 X에서 복제 경쟁의 시작을 농담으로 언급하고, OpenAI의 관심이 빠르고 직관적인 사고를 뜻하는 ‘System One’ 방식의 미래를 보여주는 신호일 수 있다고 말했다. TypeSafe는 이를 숙고하는 추론을 뜻하는 ‘System 2’와 구분한다.

3. 제품 비교의 불확실성과 경쟁 확대

OpenAI의 발표가 Jev를 떠올리게 하더라도, 기사 시점에는 Decisions API의 구체적인 작동 결과를 비교할 근거가 제한적이었다. OpenAI는 제품을 제한적 프리뷰로 공개했으며, TechCrunch는 아직 개발자들이 이를 본격적으로 시험한 사례를 발견하지 못했다고 밝혔다. X의 대화에서는 분명한 관심이 관찰됐지만, 관심 자체가 두 제품의 유사성이나 성능을 입증하는 것은 아니다. TypeSafe 역시 새 제품에 관한 TechCrunch의 질문에 응답하지 않았다. 한편 다른 스타트업들도 유사한 모델을 출시하고 있으며, 기사는 OpenAI가 이런 제품을 만드는 마지막 기술 대기업은 아닐 것으로 전망한다. 경쟁의 중요한 질문은 각 모델이 내놓는 판단 확률이 실제 현실과 얼마나 잘 맞도록 보정되는지다.

4. 낮은 가격보다 중요한 판단의 유용성

Almeida는 TypeSafe AI의 경쟁 우위가 통계적으로 유용한 출력을 생성하기 위해 만드는 합성 데이터에 있다고 설명한다. 이는 단순히 결과를 빠르고 싸게 내는 것과, 그 결과가 유용한 판단 정보를 담는 것을 구분하는 주장이다. 그는 전주 TechCrunch 인터뷰에서 빠르고 저렴하게 만드는 일은 쉽고, 극단적으로 속도와 비용만 원한다면 주사위를 사용할 수도 있다고 말했다. 이어 어려운 부분은 지능이며, 자신의 기준은 달러당 지능의 파레토 곡선을 계속 개선하는 것이라고 강조했다. 기사 흐름에서 이 발언은 유사 제품의 등장만큼이나 확률 출력의 보정과 통계적 유용성이 중요하다는 논점을 뒷받침한다. 다만 합성 데이터가 경쟁 우위라는 설명은 Almeida의 주장이며, 기사에는 모델들 사이의 직접 비교 검증 결과가 제시되지 않는다.

5. 에이전트 행동을 감시하는 Jev 데모

기사는 이런 모델의 유력한 활용처로 AI 에이전트의 감시와 보안을 제시한다. OpenAI는 에이전트들이 공개 인터넷에서 부적절하게 행동한 일련의 사건 이후, 별도의 모델로 잘못된 행동을 감시하는 보안 조치를 도입했지만 상당한 연산 비용이 든다고 밝혔다. 오랫동안 사이버보안 분야에서 일해 온 QueryStory의 Shapor Naghibzadeh는 Jev 같은 모델을 이용하면 이러한 감시를 훨씬 저렴하게 수행할 수 있다고 본다. 그는 직전 주말 해커톤에서 각 에이전트 행동을 원래 부여된 과제와 대조하는 Jev 기반 데모를 만들었다. 데모는 잘못된 행동이라고 높은 확신을 갖는 경우 차단하고, 다른 일부 행동은 검토 대상으로 표시하며, 나머지 행동은 허용한다. 이는 과제와 행동의 관계를 매번 살피는 감시 방식의 사례로 소개된다.

6. 감시 비용 차이와 신뢰성 개선 가능성

기사에 따르면 이런 종류의 감시 비용은 Jev를 사용할 때 $2.94였고, 프런티어 LLM을 사용할 때는 $372였다. 기사는 같은 방식의 감시가 이론적으로 Hugging Face 사건을 막을 수 있었을 것으로 설명하지만, 실제로 해당 사건을 예방했다는 결과를 제시하지는 않는다. 핵심 관찰은 Jev가 모든 에이전트 행동에 적용할 수 있을 만큼 저렴할 수 있다는 점이다. 행동마다 검토를 추가할 수 있다면 에이전트 전반의 신뢰성을 높이는 데 도움이 될 가능성이 있다. 기사는 이를 TypeSafe가 추구했던 활용 방향으로 해석하고, OpenAI 역시 그 가치를 알아본 것으로 평가한다. 다만 Decisions API의 실제 성능과 각 모델의 판단 확률이 현실에 얼마나 잘 맞는지는 여전히 확인해야 할 문제로 남는다.

🧾 핵심 주장 / 시사점

  • Jev 사례는 모든 처리를 범용 LLM에 맡기는 대신, 선택형 판단에 특화된 모델로 일부 작업을 보완할 가능성을 보여준다.
  • 유사 모델이 늘어날수록 속도와 가격만으로는 차별화를 설명하기 어려우며, 출력 확률의 보정 수준과 합성 데이터의 유용성이 중요한 비교 기준이 된다.
  • 낮은 감시 비용은 행동별 검토의 적용 가능성을 넓히지만, 비용 차이와 실제 사건 예방 효과는 구분해 해석해야 한다.

✅ 액션 아이템

  • Decisions API의 제한적 프리뷰 시험 결과와 Jev의 실제 유사성 확인.
  • Jev와 유사 결정 모델을 비교할 때 속도·비용과 판단 확률의 보정 수준을 함께 검토.
  • Jev의 $2.94와 프런티어 LLM의 $372 감시 비용 차이를 바탕으로 모든 에이전트 행동에 검토를 적용할 가능성 평가.

❓ 열린 질문

  • Decisions API의 제한적 프리뷰에서 실제 기능과 성능은 Jev와 얼마나 유사한가?
  • TypeSafe AI의 합성 데이터는 판단 확률의 보정 수준과 통계적 유용성에 어떤 차이를 만드는가?
  • Jev의 $2.94 감시 비용으로 모든 에이전트 행동을 검토할 때 Hugging Face 사건 같은 문제를 실제로 예방할 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.