A new kind of AI model from a ChatGPT inventor is thrilling developers
Quick Summary
ChatGPT와 RLHF 개발에 참여한 Diogo Almeida의 TypeSafe AI가 텍스트 대신 확률을 출력하는 Jev를 공개하며, 저비용·고속 소프트웨어 자동화의 가능성과 확률 판단의 책임을 함께 드러냈다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
ChatGPT와 RLHF 개발에 참여한 Diogo Almeida의 TypeSafe AI가 텍스트 대신 확률을 출력하는 Jev를 공개하며, 저비용·고속 소프트웨어 자동화의 가능성과 확률 판단의 책임을 함께 드러냈다.
📌 핵심 요약
- Diogo Almeida는 인간 언어에 최적화된 AI가 컴퓨터 자동화에는 적합하지 않다는 문제의식으로 2년 전 OpenAI를 떠나 TypeSafe AI를 설립했으며, 이번 주 트랜스포머 기반 비LLM 모델 Jev를 공개했다.
- Jev는 텍스트 대신 회사가 ‘보정된 결정’이라고 부르는 확률을 출력한다. 사용자가 출력을 미리 정의하므로 환각이 발생하지 않는다는 설명이며, 출력 토큰은 무료이고 입력 토큰은 100만 개가 아닌 10억 개 단위로 과금된다.
- Vercel의 Pranit Sharma는 명령어 안전성 분류에서 OpenAI의 ChatGPT Luna 5.6을 Jev로 교체한 뒤 속도가 5~18배 빨라지고 정확도도 높아졌다고 밝혔다. Bryo AI의 Nikhil Mudholkar가 진행한 업무 이메일 분류 테스트에서는 Gemini가 조금 더 정확했지만 비용은 10~20배 높았다.
- Jev는 LLM 에이전트 감시와 탈옥 방지, 작업별 모델 라우팅에도 활용될 가능성이 있다. Earendil의 Armin Ronacher는 50%와 95% 같은 확률에 따라 결과를 무시하거나 행동할지 사용자가 결정해야 한다고 지적했다.
- TypeSafe AI는 Jev를 추론보다 직관에 집중하는 ‘System One model’로 설명하며, Almeida는 합성 데이터만으로 학습한다고 밝혔다. 구체적인 아키텍처는 공개되지 않았고 오픈웨이트 LLM 기반이라는 외부 추측이 있으며, 회사는 새로운 모달리티의 후속 버전을 개발할 계획이다.
🧩 주요 포인트
- 텍스트 생성 대신 사전 정의된 결과의 확률 출력 → 자동화의 비용과 지연을 낮출 가능성이 있지만, 출력 범위 제한과 판단의 정확성은 구분할 필요가 있다.
- Vercel과 Bryo AI의 분류 사례에서 서로 다른 정확도 결과 → Jev의 도입 가치는 작업별 정확도·속도·비용의 조합으로 평가해야 한다.
- LLM 에이전트 감시와 모델 라우팅에 저비용 판단 활용 → 기존 LLM을 보완할 여지가 있으며, 확률에 따른 행동 기준은 사용자에게 남는다.
🧠 상세 정리
1. 언어 중심 AI에 대한 불만에서 출발한 Jev
기사에 따르면 Diogo Almeida는 OpenAI에서 ChatGPT 개발과 인간 피드백 기반 강화학습인 RLHF 발명에 참여했지만, 챗봇의 능력이 실질적인 자동화로 충분히 이어지지 않는다는 점에 실망했다. 그는 AI가 지난 4년간 인간 언어를 매우 잘 다뤘어도 컴퓨터는 다른 언어를 사용하기 때문에 자동화에는 적합하지 않다고 주장했다. 이 문제를 해결하기 위해 2년 전 OpenAI를 떠나 TypeSafe AI를 설립했고, 회사는 이번 주 Jev를 공개했다. Jev는 트랜스포머 기반이지만 LLM은 아니며, 텍스트를 생성하는 대신 확률을 반환하도록 설계됐다.
2. 사전 정의된 출력과 낮은 비용
TypeSafe AI는 Jev가 반환하는 확률을 ‘보정된 결정’이라고 부르며, 언어 출력을 포기한 덕분에 모델이 매우 저렴하고 빠르다고 설명한다. 사용자가 가능한 출력을 사전에 정의하므로 환각이 발생할 수 없다는 것이 기사에서 제시하는 설명이지만, 뒤이어 소개되는 사례와 논평은 판단의 정확성과 확률 해석이 여전히 중요함을 보여준다. 출력 토큰은 무료이며 입력 토큰은 통상적인 100만 개가 아니라 10억 개 단위로 과금된다. 개발자들의 관심이 몰리면서 회사는 한때 API로 사용자 요청을 처리하지 못하기도 했다. 현재 개발자들은 특히 소프트웨어 자동화에서 코드에 지능을 더하는 저렴하고 견고한 수단으로 Jev를 주목하고 있다.
3. 분류 작업에서 확인된 성능과 상충 관계
Vercel의 소프트웨어 엔지니어 Pranit Sharma는 회사가 명령어 안전성을 검토하는 분류기에 OpenAI의 ChatGPT Luna 5.6을 사용했다고 밝혔다. 이를 Jev로 교체하자 결과를 얻는 속도가 5~18배 빨라졌고 정확도도 높아졌다는 것이 그의 보고다. 반면 Bryo AI CTO Nikhil Mudholkar의 업무 이메일 분류 테스트에서는 Gemini가 Jev보다 조금 더 정확했지만, 비용은 10~20배 높았다. Mudholkar는 특히 Jev가 실제 확률을 반환한다는 점을 자동화 워크플로에 적합한 특징으로 평가했다. 두 사례는 Jev의 속도와 비용상 매력을 보여주면서도, 정확도 우위가 모든 작업에서 동일하게 나타나는 것은 아니라는 점을 드러낸다.
4. 에이전트 감시와 확률 판단의 책임
Almeida는 Jev가 일부 용도에서 LLM을 대체하는 데 그치지 않고, LLM의 잘못된 행동을 점검하는 보완 수단으로도 쓰일 수 있다고 본다. 에이전트를 다른 에이전트로 감시하면 비용이 빠르게 늘어날 수 있어, Jev로 LLM 에이전트의 실행 기록을 추적하고 탈옥을 방지하는 활용을 제시했다. 오픈소스 모델 하네스 Pi를 만드는 Earendil의 CTO Armin Ronacher는 이 방식이 환각 문제의 일부를 사용자에게 넘긴다고 설명했다. 예컨대 확률이 50%라면 동전 던지기처럼 보고 무시하고, 95%라면 행동에 활용할지를 사용자가 결정해야 한다는 것이다. 따라서 정해진 출력만 반환한다는 특성만으로 자동화의 판단 문제가 끝나는 것은 아니며, 확률을 행동으로 연결하는 기준이 중요해진다.
5. 모델 라우팅과 지능 사용 확대의 구상
Ronacher는 주어진 작업에 어떤 모델이 필요한지 예측하는 모델 라우팅도 Jev의 잠재적 용도로 꼽았다. 이 분류를 LLM에 맡기면 비용이 크지만, Jev의 낮은 비용과 빠른 속도는 실시간 분류를 가능하게 한다는 설명이다. Jev라는 이름은 가격이 내려간 재화의 사용이 오히려 더 늘어날 수 있다는 역설로 알려진 19세기 경제학자 William Stanley Jevons에서 따왔다. Almeida는 지능의 비용 하락도 비슷하게 광범위한 활용으로 이어지기를 기대한다. 그가 그리는 미래는 거대한 앱을 중심으로 모이는 형태보다는 초기 인터넷처럼 곳곳에 지능형 소프트웨어가 분산되고 자생적으로 등장하는 모습이다.
6. 합성 데이터 학습과 남아 있는 불확실성
Almeida는 구체적인 아키텍처를 공개하지 않았으며, 외부 관찰자들은 Jev가 오픈웨이트 LLM 위에 구축됐을 가능성을 추측한다. TypeSafe AI는 이를 추론보다 직관과 적합한 작업에 집중하는 ‘System One model’로 부르고, Almeida는 ‘보정된 결정 기반 강화학습’이라는 기법으로 합성 데이터만 사용해 학습한다고 밝혔다. 그는 모든 데이터를 직접 만들겠다는 초기 선택을 매우 높게 평가하며, 회사의 절반이 통계적으로 잘 이해된 합성 데이터를 연구하는 조직이라고 설명했다. Ronacher는 현재 이런 유형의 모델로 Jev가 독보적이지만 유용성이 드러난 만큼 경쟁자가 등장할 것으로 예상했고, 기존 LLM이 저렴하고 보조금을 받는 상황이 다른 접근을 찾을 유인을 줄였을 수 있다고 말했다. TypeSafe AI는 새로운 모달리티의 모델 버전을 만들 계획이며, Almeida는 프런티어 연구소에 대한 질문에 공포나 과장된 기대보다 지능 자체를 주된 제품으로 삼고 싶다고 답했다.
🧾 핵심 주장 / 시사점
- Jev는 자연어 생성 능력을 확대하는 접근과 별개로, 제한된 선택지에 대한 확률 판단만으로도 소프트웨어 자동화에 가치를 제공할 수 있음을 보여준다.
- 환각이 없다는 설명은 사전 정의된 출력 구조에 관한 것이며, 분류 오류나 불확실한 결과를 어떻게 처리할지까지 해결됐다는 의미로 보기는 어렵다.
- 판단 비용이 충분히 낮아지면 모델 라우팅이나 에이전트 감시처럼 기존에는 비용이 부담이던 기능에 지능을 더 자주 적용할 가능성이 열린다.
✅ 액션 아이템
- Jev의 분류 적용 가능성을 작업별 정확도·속도·비용의 조합으로 검토.
- Jev가 반환하는 50%와 95% 같은 확률에 따라 결과를 무시하거나 행동에 활용할 기준을 정의.
- LLM 에이전트 감시와 모델 라우팅에서 Jev의 보완적 활용 가능성을 평가.
❓ 열린 질문
- Jev의 속도·비용 이점과 정확도는 Vercel과 Bryo AI의 사례 외 다른 분류 작업에서도 유지될까?
- Jev가 반환하는 50%와 95% 같은 확률을 실제 행동으로 연결할 기준은 작업별로 어떻게 정해야 할까?
- 구체적인 아키텍처가 공개되지 않은 Jev에서 합성 데이터만을 사용한 학습은 새로운 모달리티로 어떻게 확장될까?