말을 안 하는 AI가 나왔다 — 클로드보다 440배 싼 Jev, 뭐가 다른가
Quick Summary
Jev는 문장 대신 선택·점수·참거짓 확률을 반환하는 판단 전용 AI로, 클로드 계열 비교 모델보다 440배 저렴하다는 수치는 회사 자체 벤치마크에 한정된다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Jev는 문장 대신 선택·점수·참거짓 확률을 반환하는 판단 전용 AI로, 클로드 계열 비교 모델보다 440배 저렴하다는 수치는 회사 자체 벤치마크에 한정된다.
📌 핵심 요점
- 타입세이프는 사람과 대화하는 모델보다 소프트웨어 안에서 결정을 내리는 모델을 지향한다. Jev는 글쓰기와 코드 생성 대신 반복적인 판단을 맡는다.
- 기능은 보기 선택, 기준표에 따른 점수 산정, 참거짓 확률 판단이다. 답에 확률과 신뢰도를 붙이며, 회사는 RLCD라는 학습 방식으로 확률을 보정했다고 설명한다.
- 회사 자체 평가에서 Jev의 정확도는 약 67.8%, 응답 시간은 0.4초로 소개된다. 비교 대상 오퍼스 5는 정확도 73.1%, 응답 시간 37.8초이며, 비용은 Jev가 440배 저렴하다는 주장이다.
- 주요 활용처는 지원 티켓 분류, 모델 라우팅, 도구 실행 전 위험 판단이다. 신뢰도가 낮으면 더 큰 모델이나 사람에게 넘기는 구조가 제안된다.
- 정해진 출력 형식을 지킨다고 정답이 보장되지는 않는다. 자체 벤치마크의 편향, 작업별 정확도 차이, 설명 부재, 기술 비공개, 가격 지속 가능성이 검증 과제로 남는다.
🧩 배경과 문제 정의
영상은 소프트웨어가 선택 하나만 필요로 하는 상황에서도 대화형 LLM을 호출하고, JSON 출력을 지시하고, 결과를 파싱하거나 재시도하는 비용에 주목한다. 타입세이프의 Jev는 이런 구간에 판단 전용 모델을 넣겠다는 접근으로 소개된다.
설명 틀은 빠른 직관을 뜻하는 시스템 1과 느린 숙고를 뜻하는 시스템 2의 구분이다. 이는 영상이 제품의 역할을 설명하는 비유이며, 모든 LLM의 성질을 입증하는 기술적 분류로 받아들일 필요는 없다. 핵심 문제는 어떤 판단을 작은 비용으로 처리하고, 어떤 판단을 더 큰 모델이나 사람에게 넘길지 정하는 것이다.
🕒 시간순 섹션별 상세정리
1. 말을 하지 않는 모델과 회사의 목표
- 9월 15일 출시됐다고 소개되는 Jev는 질문에 문장 대신 답과 확률을 반환한다. 회사는 프론티어 모델 대비 속도 200배·비용 400배, 오퍼스 5 대비 비용 440배라는 수치를 내세운다. [00:19]
- 타입세이프는 2024년 설립됐으며, 대표의 OpenAI 강화학습 경력과 4천만 달러 시드 투자가 묶인다. 목표는 모델이 소프트웨어 안에서 결정을 내리도록 하는 것이다. [01:27]
- Jev라는 이름은 제번스에서 따왔다. AI가 저렴해지면 더 많은 곳에 쓰일 것이라는 기대를 담았다. [01:53]
2. 시스템 1의 기능과 실제 응답 구조
- Jev는 선택·점수·참거짓 판단을 수행하고, 확률과 신뢰도를 반환한다. 회사는 RLCD와 합성 데이터를 통해 보정된 판단을 학습했다고 보여준다. [03:05]
- 고객의 결제 연동 장애 메시지를 넣고 담당 팀·감정 수준·긴급도를 한 번에 질문하는 예제가 나온다. 응답은 JSON이며, 확률과 별도 신뢰도 값을 후속 처리에 활용한다. [04:06]
- 선택지가 정해져 있어 그 밖의 값을 답할 수 없다는 점을 강조한다. 회사가 말하는 구조화 출력 오류율 0%는 이러한 출력 제약과 연결된다. [04:36]
3. 자체 벤치마크와 에이전트 적용처
- 자체 평가에서 Jev는 정확도 약 67.8%·응답 0.4초, 오퍼스 5는 73.1%·37.8초로 묶인다. 비용 차이와 대량 리뷰 채점 사례도 제시되지만, 전사된 가격 단위와 계산은 확인이 필요하다. [05:44]
- Jev는 코딩 모델을 대체하기보다 코드 안의 판단 지점에 들어간다. 활용 예시는 요청 난도에 따른 모델 라우팅과 도구 실행 전 위험 판단이다. [06:32]
- 높은 신뢰도에서는 실행하고 낮으면 상위 모델이나 사람에게 넘기는 구성이 제안된다. 플러그인과 브라우저 조작·트레이딩·이메일 분류 사례의 공통점은 글 생성 없이 판단을 반복한다는 것이다. [07:14]
4. 성능 주장에 대한 여섯 가지 반론
- 자체 제작 벤치마크와 모델이 부여한 정답 라벨이 편향 요인으로 지적된다. 청구서 처리에서는 Jev가 비교 모델보다 약 17%포인트 낮은 정확도를 보였다. [07:41]
- 선택지 안의 답을 반환해도 오답일 수 있으며, 높은 확률을 붙인 오답도 가능하다. 판단 이유를 설명하지 않는 점은 이유를 기록해야 하는 업무의 제약이다. [08:07]
- RLCD의 논문·가중치·아키텍처 비공개, 초기 가격의 보조금 가능성, 얼리 액세스 제한이 추가로 나온다. 영상은 방향과 검증 수준을 구분해야 한다고 강조한다. [08:35]
5. 시험 방법과 최종 메시지
- 플레이그라운드에서 고객 메시지의 긴급도부터 시험하고, 기존 코드의 분류·점수·참거짓 판단 구간을 찾도록 권한다. 요약·답변 생성·코드 작성은 LLM의 역할로 남긴다. [09:10]
- 답을 곧바로 실행하기보다 신뢰도 임계값을 두고, 지원 티켓 분류 함수를 만들어 적용 방식을 확인하라고 제안한다. [09:33]
- 마지막에는 성능 배수가 회사 자체 주장이라는 한계를 재확인한다. 빠른 판단과 긴 숙고를 서로 다른 모델에 배분하자는 메시지로 마무리하고, 다음 편에서 실제 교체 사례를 다루겠다고 예고한다. [10:04]
🧾 결론
- Jev의 차별점은 대화 능력이 아니라 소프트웨어가 바로 사용할 수 있는 제한된 판단 결과를 반환한다는 데 있다.
- 요약·답변 생성·코드 작성은 기존 LLM이 맡고, 반복적인 선택과 점수 판단을 분리하는 구성이 영상의 핵심 제안이다.
- 도입 여부는 홍보 배수보다 실제 업무의 정확도, 지연 시간, 총비용, 사람에게 넘기는 비율을 기준으로 판단해야 한다.
📈 투자·시사 포인트
- 영상은 타입세이프가 4천만 달러의 시드 투자와 2억 달러의 기업가치를 확보했다고 소개한다. 판단 전용 모델이라는 시장 가설에 자금이 모였다는 사례다.
- 판단 비용 하락이 적용 범위를 넓힌다는 제번스의 역설이 제품 이름과 사업 논리에 담겨 있다. 다만 사용량 확대가 실제로 얼마나 발생할지는 제시되지 않는다.
- 에이전트가 모든 판단에 대형 모델을 호출하지 않게 되면, 모델별 역할 배분과 라우팅 설계가 비용 경쟁력의 중요한 요소가 될 수 있다.
- 초기 가격에 보조금이 포함됐을 가능성과 독립 검증 부재를 고려하면, 현재 가격만으로 장기 수익성이나 경쟁 우위를 단정하기 어렵다.
⚠️ 불확실하거나 확인이 필요한 부분
- 속도 200배·비용 400배라는 홍보 수치와 개별 비교 결과의 조건이 같다고 볼 근거는 없다. 440배 비용 차이도 회사가 선정한 워크플로와 비교 모델에 따른 결과다.
- 벤치마크는 회사가 만들었고 정답 라벨도 다른 모델이 부여했다고 소개된다. 청구서 처리에서는 Jev 61.8%, 비교 모델 79.1%로 작업별 성능 차이가 컸다.
- 구조화 출력 오류가 없다는 설명은 선택지 밖의 답을 내지 않는다는 의미다. 잘못된 선택이나 높은 확률을 붙인 오답까지 배제하지는 않는다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 기존 코드에서 분류·점수·참거짓 판단을 위해 LLM에 JSON 응답을 요청하는 구간을 찾아 도입 후보로 정리한다.
- 접근 가능한 플레이그라운드에서 고객 메시지의 긴급도 판단을 시험하고, 사람이 확인한 정답과 비교한다.
- 같은 업무 표본으로 기존 모델과 Jev의 정확도·응답 시간·비용을 비교하고, 오판 후 재처리 비용도 포함한다.
- 신뢰도 임계값과 사람 또는 상위 모델로 넘기는 조건을 정의하고, 높은 신뢰도의 오답도 점검한다.
❓ 열린 질문
- 회사가 고른 네 가지 워크플로 밖에서도 정확도와 비용 우위가 유지되는가?
- 보정됐다는 확률과 별도 신뢰도 값은 새로운 업무 데이터에서도 실제 오답률을 잘 반영하는가?
- 초기 보조금 가능성이 사라진 이후에도 현재 가격과 서비스 품질을 유지할 수 있는가?