YouTubeTonbi''s AI Garage·2026년 9월 21일·0

Jev: What is this Viral Decision Model? (Plus Mini Reproduction Experiment)

Quick Summary

Jev는 문장을 생성하는 대신 주어진 선택지를 확률로 평가하는 의사결정 모델이며, 미니 재현 실험은 그 효용이 작업에 맞는 학습과 문제 설계에 달려 있음을 보여준다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Jev: What is this Viral Decision Model? (Plus Mini Reproduction Experiment) 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Jev: What is this Viral Decision Model? (Plus Mini Reproduction Experiment)의 핵심 내용을 4단계로 요약한 인포그래픽
Jev: What is this Viral Decision Model? (Plus Mini Reproduction Experiment) 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Jev는 문장을 생성하는 대신 주어진 선택지를 확률로 평가하는 의사결정 모델이며, 미니 재현 실험은 그 효용이 작업에 맞는 학습과 문제 설계에 달려 있음을 보여준다.

📌 핵심 요점

  1. Jev의 핵심은 생성이 아닌 판단이다. 앱 상태와 타입이 정해진 질문을 받아 선택·평점·예/아니오 형태로 답한다. 선택형 질문은 최대 255개 선택지의 확률을 반환하며, 여러 질문을 한 번의 상태 읽기로 병렬 처리한다고 설명한다.
  2. 속도·비용의 이점은 비교 조건에 따라 달라진다. 발표에서는 20~200배 빠르고 40~400배 저렴하다고 주장하지만, 영상이 소개한 외부 테스트의 속도 차이는 5~25배다. 저가 모델과의 비용 차이는 약 1.6배로 줄어든다는 설명도 나온다.
  3. mini Jev는 원본의 내부 구조를 복제한 모델이 아니다. 제작자는 Qwen 3 0.6B 기반 모델의 언어 출력 헤드를 작은 점수 산출 헤드로 대체하고, 선택지 간 정보 접근을 제한해 비생성형 판단 동작을 구현했다. 원본 Jev의 구조·가중치·학습 데이터는 공개되지 않았다고 밝힌다.
  4. 게임 실험에서는 작업 전용 학습이 유리했다. 제작자 보고에 따르면 mini Jev는 미학습 코스에서 다음 상황 예측 정확도 약 80%, 판단당 48ms를 기록했다. 코스를 완주한 반면, 원본 Jev는 규칙을 제공해도 피해 회피에 치우쳐 멈추는 행동이 많았다.
  5. 위키 링크 탐색에서는 결과가 뒤집혔다. 원본 Jev는 여러 페이지 연결 과제를 수행했고, 판단당 약 250ms와 경주당 1센트 미만의 비용이 보고됐다. mini Jev는 경로를 잃었으며, 추가 링크 데이터 학습 후에도 실패했다.

🧩 배경과 문제 정의

영상은 빠르고 저렴한 새 의사결정 모델이라는 Jev의 홍보가 무엇을 의미하는지 설명하고, 관찰 가능한 동작을 소형 모델로 재현하는 실험을 다룬다. 핵심 질문은 문장 생성을 생략한 판단 방식이 어떤 과제에서 유용하며, 소규모 전용 학습으로 어디까지 재현할 수 있느냐는 것이다.

제작자는 Type-Safe AI의 Jev를 소개한 뒤 Qwen 3 0.6B 기반의 mini Jev를 구성한다. 자체 게임에서는 해당 게임을 학습한 mini Jev와 원본 Jev를 비교하고, 이후 위키백과 링크 탐색으로 과제를 바꿔 적용 범위의 차이를 확인한다. 원본 구조가 비공개이므로 이 실험은 내부 구현 복제가 아니라 출력 방식과 판단 동작의 재현에 가깝다.

🕒 시간순 섹션별 상세정리

1. 게임 시연으로 제시한 재현 실험의 목표

  • 제작자는 에이전트와 함께 만든 소닉풍 게임에서 피해를 적게 받도록 판단하는 모델을 보여주며, Jev의 개념을 적용한 mini Jev라고 보여준다. [00:20]
  • 영상 후반에 제작 과정과 원본 Jev의 게임 결과를 비교하겠다고 예고한다. [00:28]

2. 화제가 된 성능 주장과 생성 기능의 부재

  • Diogo Almeida의 발표를 소개하며 20~200배 빠른 속도, 40~400배 낮은 비용, 사실상 무료인 출력 토큰이라는 주장을 전달한다. [01:01]
  • 큰 관심을 받은 발표지만 Jev는 텍스트를 생성하지 않으며, 일반적인 LLM과 같은 방식의 제품이 아니라고 보여준다. [01:33]
  • 공개 가중치가 없는 상황에서 기술 블로그와 시연을 바탕으로 이해해야 하며, 질문 분류와 Doom 행동 선택을 예로 든다. [02:30]

3. 자체 게임 비교 계획과 제작자 프로젝트 소개

  • 로컬 장비에서 mini Jev를 만들고, Astra로 제작한 소닉풍 게임을 원본 Jev와 각각 플레이시키겠다고 보여준다. [03:24]
  • Agent Wiki's의 무료 자료와 유료 구독, 향후 에이전트 프로필·자동화 템플릿 계획을 소개하는 홍보 구간이 계속된다. [04:05]

4. 상태를 읽고 타입이 정해진 답을 반환하는 방식

  • Jev는 앱 상태와 타입이 정해진 질문을 받아 확률이 붙은 답을 반환하며, 문장을 작성하거나 토큰을 생성하지 않는다고 보여준다. [04:43]
  • 여러 질문을 한 번의 상태 읽기로 병렬 처리하고, 최대 255개 후보 중 선택하기·척도로 평가하기·예/아니오 판단하기를 지원한다고 보여준다. [05:21]
  • 일반적인 응답 시간은 100ms, 입력 100만 토큰당 가격은 4센트, 출력 토큰은 무료라는 수치를 제시한다. [05:29]

5. 알려진 학습 원리와 비공개 영역

  • 토큰을 순차 생성하지 않고 정의된 후보로만 답하며, 정직한 확률을 보상하는 RLCD로 학습했다고 보여준다. [05:52]
  • 아키텍처·정확한 크기·가중치는 알려지지 않았고, 확률 보정 곡선과 가격 보조 여부도 확인되지 않았다고 짚어 본다. [06:08]

6. 에이전트와 제어 작업으로 확장되는 활용 구상

  • StarCraft, 드론 장애물 코스, 항공 관제와 잠입 게임 등 여러 실험 사례를 보여준다. [06:26]
  • 웹 에이전트에서 스크린샷 대신 요소 표를 사용해 브라우저 호출이 1,000회 이상에서 101회로 줄었다는 사례와 도구 필터링·컴퓨터 조작 가능성을 언급한다. [07:14]
  • 명령 실행 전 점검, 모델 라우팅, 대규모 데이터 평가도 거론하지만 아직 충분한 실전 검증을 거친 활용은 아니라고 선을 긋는다. [07:43]

7. 홍보 수치의 비교 조건과 취약한 작업

  • 영상이 소개한 독립 테스트에서는 속도가 약 5~25배 빨랐으며, 발표에서 강조한 약 200배 수준과는 차이가 있다고 보여준다. [08:08]
  • 프런티어 모델 대비 비용 이점은 크지만 저가 모델 대비 차이는 약 1.6배일 수 있다며 비교 대상을 구분한다. [08:28]
  • 수학·계수·숫자와 날짜 비교·이중 부정 등의 약점을 언급하고, 텍스트 전용이라는 제약 아래 계산은 코드에 맡기고 판단을 요청하라고 제안한다. [08:49]

8. Qwen 기반 mini Jev의 구현과 재현 범위

  • Qwen 3 0.6B 사전학습 모델을 기반으로 입력을 한 번 읽고 제공된 선택지를 평가하는 구조를 만들었다고 보여준다. [09:50]
  • 사용자 정의 어텐션 마스크로 각 선택지가 상태와 질문 및 자기 자신을 보되 다른 선택지는 보지 못하게 구성한다. [10:13]
  • 약 1억 5,500만 파라미터의 언어 출력 헤드 대신 약 3,000개 파라미터의 점수 산출 헤드를 사용한다. 원본 구조와 학습 데이터는 알 수 없어 관찰 가능한 동작만 재현했다고 강조한다. [11:13]

9. 게임 학습과 반복적인 미래 평가

  • mini Jev는 게임 상태와 선택지를 받아 평가하며, 목록에 없는 자유로운 답변은 할 수 없다. [12:07]
  • 행동 이후 실제 피해 발생 여부를 관찰해 예측을 조정하는 과정을 설명하고, 약 56,000회의 학습 사례를 사용했다고 드러낸다. [12:30]
  • 달리기·점프 후 달리기·멈추기·구르기의 네 미래를 평가하고, 피해 가능성이 낮은 계획의 한 단계만 실행한 뒤 상태를 다시 읽어 판단한다. [13:10]

10. 미학습 코스 성능과 원본 Jev의 규칙 반응

  • mini Jev는 보지 않은 코스에서 다음 상황 예측이 약 80% 정확했고, 한 장비에서 여덟 질문을 함께 처리하며 판단당 48ms를 기록했다고 보고한다. [13:38]
  • 원본 Jev는 OpenRouter로 호출했으며, Claude Code가 주요 실험을 실행하고 Hermes 에이전트가 진행을 감시하는 작업 흐름을 보여준다. [14:18]
  • 원본 Jev에 매번 게임 규칙을 주자 적에게 달려드는 행동은 줄었지만, 대기 행동이 늘어 진행이 정체됐다고 보여준다. [15:07]

11. 게임 비교 결과와 과제 전용 학습의 효과

  • 규칙 없는 원본 Jev, 매번 규칙을 받은 Jev, 게임에 맞춰 학습한 mini Jev를 비교한다. 규칙을 받은 Jev는 피해를 피하려고 지나치게 자주 멈춘다. [16:03]
  • mini Jev는 미학습 코스를 완주하고 가장 빠른 시간과 높은 점수를 기록했다. 원본 Jev는 규칙을 받아도 완주하지 못했다고 보고한다. [17:02]
  • 제작자는 이 결과가 mini Jev의 전반적 우수성을 뜻하지 않으며, 해당 작업에 특화해 학습했기 때문이라고 명시한다. [17:12]

12. 위키 링크 탐색에서 드러난 원본 Jev의 강점

  • 위키백과의 한 문서에서 링크만 따라 목표 문서에 도달하는 과제를 소개하며, Jev의 강점에 더 맞는 시연이라고 보여준다. [17:30]
  • 연필에서 흑연·탄소·핵융합을 거쳐 블랙홀로 이동한 사례를 들고, 판단당 약 250ms와 경주당 1센트 미만의 비용을 보고한다. [18:02]
  • 같은 과제에서 mini Jev는 목표와 관계없는 지역 문서들을 따라가며 길을 잃었다. 이어 12개 허브 페이지에서 수집한 약 8,000개 링크로 추가 학습을 시도한다. [19:27]

13. 추가 학습의 실패와 실험의 최종 교훈

  • 추가 학습 뒤에도 mini Jev는 위키 탐색에 실패했다. 제작자는 좁은 게임 과제와 달리 페이지마다 다수의 링크를 판단하는 작업은 재현 모델이 감당하기에 범위가 넓었다고 해석한다. [20:13]
  • 제작자는 자신의 재현 모델에는 한계가 있지만 원본 Jev에는 더 다양한 활용 가능성이 있다고 평가하며, 게임과 위키 탐색을 넘어서는 후속 실험을 언급한다. [20:59]
  • 흥미로운 실험 주제였다는 소감과 시청자 의견 요청으로 영상을 마친다. [21:08]

🧾 결론

  • Jev는 자유로운 문장 생성보다, 미리 정의된 후보를 빠르게 평가해야 하는 작업에 적합한 모델로 소개된다.
  • 게임에서 mini Jev가 앞선 결과는 해당 작업에 맞춘 학습의 효과를 보여준다. 원본 Jev보다 전반적으로 우수하다는 근거는 아니다.
  • 위키 탐색 결과는 좁은 과제의 성공이 더 넓은 지식 탐색 능력으로 그대로 이어지지 않음을 보여준다.
  • 도입의 핵심은 모델의 홍보 수치보다 상태 표현, 선택지 구성, 확률의 신뢰도, 실제 과제 완료 여부를 함께 검증하는 데 있다.

📈 투자·시사 포인트

  • 에이전트 운영비 절감 가능성: 도구 선택, 모델 라우팅, 실행 전 점검처럼 반복되는 판단을 분리하면 비용과 지연을 줄일 여지가 있다. 영상에서는 아직 실전 검증이 충분하지 않은 활용 방향으로 제시한다.
  • 비교 대상에 따른 경제성 차이: 고가 프런티어 모델을 대체할 때와 이미 저렴한 모델을 대체할 때의 절감 폭이 다르다. 입력 가격만으로 전체 운영비 절감을 단정하기 어렵다.
  • 응용 설계의 중요성: 피해 회피를 강조한 게임 에이전트가 정지에 치우친 사례는 빠른 판단만으로 목표 달성이 보장되지 않음을 보여준다.
  • 기술 평가와 투자 판단의 구분: 이 영상은 제품 설명과 소규모 재현 실험이다. 시장 규모, 매출, 수익성에 관한 자료가 없어 기업 가치나 투자 수익을 판단하는 근거로는 제한적이다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 원본 Jev의 아키텍처, 모델 크기, 가중치, 학습 데이터와 확률 보정 곡선은 공개되지 않았다고 설명한다. mini Jev의 구현을 원본 구조로 해석하면 안 된다.
  • 속도·비용 배수와 외부 테스트 수치는 영상에서 소개한 주장이다. 제공된 전사에는 비교 모델, 측정 환경, 반복 횟수 등 재검증에 필요한 조건이 충분히 나오지 않는다.
  • 게임 비교는 mini Jev에만 해당 게임 학습이 적용된 비대칭 조건이다. 규칙 제공 전후의 원본 Jev 결과까지 포함하더라도 일반 성능 순위로 확대할 수 없다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 적용할 작업을 상태·질문·선택지로 정의하고, 자유로운 문장 생성 없이도 목표를 달성할 수 있는지 확인한다.
  • 동일한 입력과 성공 기준으로 Jev, 저가 모델, 기존 구현을 비교하고 지연·총비용·완료율을 함께 기록한다.
  • 숫자 계산과 날짜 비교는 코드에서 처리하고, 모델에는 판단에 필요한 결과를 전달하는 구성을 시험한다.
  • 학습에 사용하지 않은 사례를 확보해 정확도와 확률 보정을 별도로 평가한다.

❓ 열린 질문

  • Jev가 반환하는 확률은 작업 종류와 입력 분포가 달라져도 얼마나 잘 보정되어 있는가?
  • 같은 상태 표현과 학습 기회를 제공한다면 원본 Jev와 소형 전용 모델의 성능 차이는 어떻게 달라질까?
  • 도구 필터링·라우팅·실행 전 점검에서 판단 속도의 이점이 전체 작업 완료 시간과 비용 절감으로 얼마나 이어질까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.