Jev: What is this Viral Decision Model? (Plus Mini Reproduction Experiment)
Quick Summary
Jev는 문장을 생성하는 대신 주어진 선택지를 확률로 평가하는 의사결정 모델이며, 미니 재현 실험은 그 효용이 작업에 맞는 학습과 문제 설계에 달려 있음을 보여준다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Jev는 문장을 생성하는 대신 주어진 선택지를 확률로 평가하는 의사결정 모델이며, 미니 재현 실험은 그 효용이 작업에 맞는 학습과 문제 설계에 달려 있음을 보여준다.
📌 핵심 요점
- Jev의 핵심은 생성이 아닌 판단이다. 앱 상태와 타입이 정해진 질문을 받아 선택·평점·예/아니오 형태로 답한다. 선택형 질문은 최대 255개 선택지의 확률을 반환하며, 여러 질문을 한 번의 상태 읽기로 병렬 처리한다고 설명한다.
- 속도·비용의 이점은 비교 조건에 따라 달라진다. 발표에서는 20~200배 빠르고 40~400배 저렴하다고 주장하지만, 영상이 소개한 외부 테스트의 속도 차이는 5~25배다. 저가 모델과의 비용 차이는 약 1.6배로 줄어든다는 설명도 나온다.
- mini Jev는 원본의 내부 구조를 복제한 모델이 아니다. 제작자는 Qwen 3 0.6B 기반 모델의 언어 출력 헤드를 작은 점수 산출 헤드로 대체하고, 선택지 간 정보 접근을 제한해 비생성형 판단 동작을 구현했다. 원본 Jev의 구조·가중치·학습 데이터는 공개되지 않았다고 밝힌다.
- 게임 실험에서는 작업 전용 학습이 유리했다. 제작자 보고에 따르면 mini Jev는 미학습 코스에서 다음 상황 예측 정확도 약 80%, 판단당 48ms를 기록했다. 코스를 완주한 반면, 원본 Jev는 규칙을 제공해도 피해 회피에 치우쳐 멈추는 행동이 많았다.
- 위키 링크 탐색에서는 결과가 뒤집혔다. 원본 Jev는 여러 페이지 연결 과제를 수행했고, 판단당 약 250ms와 경주당 1센트 미만의 비용이 보고됐다. mini Jev는 경로를 잃었으며, 추가 링크 데이터 학습 후에도 실패했다.
🧩 배경과 문제 정의
영상은 빠르고 저렴한 새 의사결정 모델이라는 Jev의 홍보가 무엇을 의미하는지 설명하고, 관찰 가능한 동작을 소형 모델로 재현하는 실험을 다룬다. 핵심 질문은 문장 생성을 생략한 판단 방식이 어떤 과제에서 유용하며, 소규모 전용 학습으로 어디까지 재현할 수 있느냐는 것이다.
제작자는 Type-Safe AI의 Jev를 소개한 뒤 Qwen 3 0.6B 기반의 mini Jev를 구성한다. 자체 게임에서는 해당 게임을 학습한 mini Jev와 원본 Jev를 비교하고, 이후 위키백과 링크 탐색으로 과제를 바꿔 적용 범위의 차이를 확인한다. 원본 구조가 비공개이므로 이 실험은 내부 구현 복제가 아니라 출력 방식과 판단 동작의 재현에 가깝다.
🕒 시간순 섹션별 상세정리
1. 게임 시연으로 제시한 재현 실험의 목표
- 제작자는 에이전트와 함께 만든 소닉풍 게임에서 피해를 적게 받도록 판단하는 모델을 보여주며, Jev의 개념을 적용한 mini Jev라고 보여준다. [00:20]
- 영상 후반에 제작 과정과 원본 Jev의 게임 결과를 비교하겠다고 예고한다. [00:28]
2. 화제가 된 성능 주장과 생성 기능의 부재
- Diogo Almeida의 발표를 소개하며 20~200배 빠른 속도, 40~400배 낮은 비용, 사실상 무료인 출력 토큰이라는 주장을 전달한다. [01:01]
- 큰 관심을 받은 발표지만 Jev는 텍스트를 생성하지 않으며, 일반적인 LLM과 같은 방식의 제품이 아니라고 보여준다. [01:33]
- 공개 가중치가 없는 상황에서 기술 블로그와 시연을 바탕으로 이해해야 하며, 질문 분류와 Doom 행동 선택을 예로 든다. [02:30]
3. 자체 게임 비교 계획과 제작자 프로젝트 소개
- 로컬 장비에서 mini Jev를 만들고, Astra로 제작한 소닉풍 게임을 원본 Jev와 각각 플레이시키겠다고 보여준다. [03:24]
- Agent Wiki's의 무료 자료와 유료 구독, 향후 에이전트 프로필·자동화 템플릿 계획을 소개하는 홍보 구간이 계속된다. [04:05]
4. 상태를 읽고 타입이 정해진 답을 반환하는 방식
- Jev는 앱 상태와 타입이 정해진 질문을 받아 확률이 붙은 답을 반환하며, 문장을 작성하거나 토큰을 생성하지 않는다고 보여준다. [04:43]
- 여러 질문을 한 번의 상태 읽기로 병렬 처리하고, 최대 255개 후보 중 선택하기·척도로 평가하기·예/아니오 판단하기를 지원한다고 보여준다. [05:21]
- 일반적인 응답 시간은 100ms, 입력 100만 토큰당 가격은 4센트, 출력 토큰은 무료라는 수치를 제시한다. [05:29]
5. 알려진 학습 원리와 비공개 영역
- 토큰을 순차 생성하지 않고 정의된 후보로만 답하며, 정직한 확률을 보상하는 RLCD로 학습했다고 보여준다. [05:52]
- 아키텍처·정확한 크기·가중치는 알려지지 않았고, 확률 보정 곡선과 가격 보조 여부도 확인되지 않았다고 짚어 본다. [06:08]
6. 에이전트와 제어 작업으로 확장되는 활용 구상
- StarCraft, 드론 장애물 코스, 항공 관제와 잠입 게임 등 여러 실험 사례를 보여준다. [06:26]
- 웹 에이전트에서 스크린샷 대신 요소 표를 사용해 브라우저 호출이 1,000회 이상에서 101회로 줄었다는 사례와 도구 필터링·컴퓨터 조작 가능성을 언급한다. [07:14]
- 명령 실행 전 점검, 모델 라우팅, 대규모 데이터 평가도 거론하지만 아직 충분한 실전 검증을 거친 활용은 아니라고 선을 긋는다. [07:43]
7. 홍보 수치의 비교 조건과 취약한 작업
- 영상이 소개한 독립 테스트에서는 속도가 약 5~25배 빨랐으며, 발표에서 강조한 약 200배 수준과는 차이가 있다고 보여준다. [08:08]
- 프런티어 모델 대비 비용 이점은 크지만 저가 모델 대비 차이는 약 1.6배일 수 있다며 비교 대상을 구분한다. [08:28]
- 수학·계수·숫자와 날짜 비교·이중 부정 등의 약점을 언급하고, 텍스트 전용이라는 제약 아래 계산은 코드에 맡기고 판단을 요청하라고 제안한다. [08:49]
8. Qwen 기반 mini Jev의 구현과 재현 범위
- Qwen 3 0.6B 사전학습 모델을 기반으로 입력을 한 번 읽고 제공된 선택지를 평가하는 구조를 만들었다고 보여준다. [09:50]
- 사용자 정의 어텐션 마스크로 각 선택지가 상태와 질문 및 자기 자신을 보되 다른 선택지는 보지 못하게 구성한다. [10:13]
- 약 1억 5,500만 파라미터의 언어 출력 헤드 대신 약 3,000개 파라미터의 점수 산출 헤드를 사용한다. 원본 구조와 학습 데이터는 알 수 없어 관찰 가능한 동작만 재현했다고 강조한다. [11:13]
9. 게임 학습과 반복적인 미래 평가
- mini Jev는 게임 상태와 선택지를 받아 평가하며, 목록에 없는 자유로운 답변은 할 수 없다. [12:07]
- 행동 이후 실제 피해 발생 여부를 관찰해 예측을 조정하는 과정을 설명하고, 약 56,000회의 학습 사례를 사용했다고 드러낸다. [12:30]
- 달리기·점프 후 달리기·멈추기·구르기의 네 미래를 평가하고, 피해 가능성이 낮은 계획의 한 단계만 실행한 뒤 상태를 다시 읽어 판단한다. [13:10]
10. 미학습 코스 성능과 원본 Jev의 규칙 반응
- mini Jev는 보지 않은 코스에서 다음 상황 예측이 약 80% 정확했고, 한 장비에서 여덟 질문을 함께 처리하며 판단당 48ms를 기록했다고 보고한다. [13:38]
- 원본 Jev는 OpenRouter로 호출했으며, Claude Code가 주요 실험을 실행하고 Hermes 에이전트가 진행을 감시하는 작업 흐름을 보여준다. [14:18]
- 원본 Jev에 매번 게임 규칙을 주자 적에게 달려드는 행동은 줄었지만, 대기 행동이 늘어 진행이 정체됐다고 보여준다. [15:07]
11. 게임 비교 결과와 과제 전용 학습의 효과
- 규칙 없는 원본 Jev, 매번 규칙을 받은 Jev, 게임에 맞춰 학습한 mini Jev를 비교한다. 규칙을 받은 Jev는 피해를 피하려고 지나치게 자주 멈춘다. [16:03]
- mini Jev는 미학습 코스를 완주하고 가장 빠른 시간과 높은 점수를 기록했다. 원본 Jev는 규칙을 받아도 완주하지 못했다고 보고한다. [17:02]
- 제작자는 이 결과가 mini Jev의 전반적 우수성을 뜻하지 않으며, 해당 작업에 특화해 학습했기 때문이라고 명시한다. [17:12]
12. 위키 링크 탐색에서 드러난 원본 Jev의 강점
- 위키백과의 한 문서에서 링크만 따라 목표 문서에 도달하는 과제를 소개하며, Jev의 강점에 더 맞는 시연이라고 보여준다. [17:30]
- 연필에서 흑연·탄소·핵융합을 거쳐 블랙홀로 이동한 사례를 들고, 판단당 약 250ms와 경주당 1센트 미만의 비용을 보고한다. [18:02]
- 같은 과제에서 mini Jev는 목표와 관계없는 지역 문서들을 따라가며 길을 잃었다. 이어 12개 허브 페이지에서 수집한 약 8,000개 링크로 추가 학습을 시도한다. [19:27]
13. 추가 학습의 실패와 실험의 최종 교훈
- 추가 학습 뒤에도 mini Jev는 위키 탐색에 실패했다. 제작자는 좁은 게임 과제와 달리 페이지마다 다수의 링크를 판단하는 작업은 재현 모델이 감당하기에 범위가 넓었다고 해석한다. [20:13]
- 제작자는 자신의 재현 모델에는 한계가 있지만 원본 Jev에는 더 다양한 활용 가능성이 있다고 평가하며, 게임과 위키 탐색을 넘어서는 후속 실험을 언급한다. [20:59]
- 흥미로운 실험 주제였다는 소감과 시청자 의견 요청으로 영상을 마친다. [21:08]
🧾 결론
- Jev는 자유로운 문장 생성보다, 미리 정의된 후보를 빠르게 평가해야 하는 작업에 적합한 모델로 소개된다.
- 게임에서 mini Jev가 앞선 결과는 해당 작업에 맞춘 학습의 효과를 보여준다. 원본 Jev보다 전반적으로 우수하다는 근거는 아니다.
- 위키 탐색 결과는 좁은 과제의 성공이 더 넓은 지식 탐색 능력으로 그대로 이어지지 않음을 보여준다.
- 도입의 핵심은 모델의 홍보 수치보다 상태 표현, 선택지 구성, 확률의 신뢰도, 실제 과제 완료 여부를 함께 검증하는 데 있다.
📈 투자·시사 포인트
- 에이전트 운영비 절감 가능성: 도구 선택, 모델 라우팅, 실행 전 점검처럼 반복되는 판단을 분리하면 비용과 지연을 줄일 여지가 있다. 영상에서는 아직 실전 검증이 충분하지 않은 활용 방향으로 제시한다.
- 비교 대상에 따른 경제성 차이: 고가 프런티어 모델을 대체할 때와 이미 저렴한 모델을 대체할 때의 절감 폭이 다르다. 입력 가격만으로 전체 운영비 절감을 단정하기 어렵다.
- 응용 설계의 중요성: 피해 회피를 강조한 게임 에이전트가 정지에 치우친 사례는 빠른 판단만으로 목표 달성이 보장되지 않음을 보여준다.
- 기술 평가와 투자 판단의 구분: 이 영상은 제품 설명과 소규모 재현 실험이다. 시장 규모, 매출, 수익성에 관한 자료가 없어 기업 가치나 투자 수익을 판단하는 근거로는 제한적이다.
⚠️ 불확실하거나 확인이 필요한 부분
- 원본 Jev의 아키텍처, 모델 크기, 가중치, 학습 데이터와 확률 보정 곡선은 공개되지 않았다고 설명한다. mini Jev의 구현을 원본 구조로 해석하면 안 된다.
- 속도·비용 배수와 외부 테스트 수치는 영상에서 소개한 주장이다. 제공된 전사에는 비교 모델, 측정 환경, 반복 횟수 등 재검증에 필요한 조건이 충분히 나오지 않는다.
- 게임 비교는 mini Jev에만 해당 게임 학습이 적용된 비대칭 조건이다. 규칙 제공 전후의 원본 Jev 결과까지 포함하더라도 일반 성능 순위로 확대할 수 없다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 적용할 작업을 상태·질문·선택지로 정의하고, 자유로운 문장 생성 없이도 목표를 달성할 수 있는지 확인한다.
- 동일한 입력과 성공 기준으로 Jev, 저가 모델, 기존 구현을 비교하고 지연·총비용·완료율을 함께 기록한다.
- 숫자 계산과 날짜 비교는 코드에서 처리하고, 모델에는 판단에 필요한 결과를 전달하는 구성을 시험한다.
- 학습에 사용하지 않은 사례를 확보해 정확도와 확률 보정을 별도로 평가한다.
❓ 열린 질문
- Jev가 반환하는 확률은 작업 종류와 입력 분포가 달라져도 얼마나 잘 보정되어 있는가?
- 같은 상태 표현과 학습 기회를 제공한다면 원본 Jev와 소형 전용 모델의 성능 차이는 어떻게 달라질까?
- 도구 필터링·라우팅·실행 전 점검에서 판단 속도의 이점이 전체 작업 완료 시간과 비용 절감으로 얼마나 이어질까?