Meet Jev: you''ve never seen AI like this...
Quick Summary
Jev는 문장을 생성하는 대신 주어진 선택지에서 빠르게 답을 고르는 AI로, 반복적인 분류 업무의 비용을 줄이지만 복잡한 판단까지 대신하지는 못한다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Jev는 문장을 생성하는 대신 주어진 선택지에서 빠르게 답을 고르는 AI로, 반복적인 분류 업무의 비용을 줄이지만 복잡한 판단까지 대신하지는 못한다.
📌 핵심 요점
- Jev의 입력은 텍스트·질문·허용된 선택지다. 예·아니요, 최대 255개 항목 중 선택, 최대 10단계 척도 평가를 지원하며 확률과 신뢰도 수치를 반환한다.
- 영상은 속도의 이유를 순차적인 문장 생성 없이 선택지를 평가하는 구조로 설명한다. 같은 텍스트에 대한 13개 질문을 한 번에 처리한 제공사 사례에서는 개별 호출보다 11배 이상 저렴하고 약 10배 빨랐다고 소개한다.
- 영상에 제시된 가격은 입력 100만 토큰당 4.2센트이며 출력 비용은 없다. 다만 홈페이지의 193배 빠름·440배 저렴함은 제공사 자체 시험 결과로, 모든 업무의 실효 성능을 뜻하지 않는다.
- 시연에서는 계약의 자동 갱신 여부와 통지 기간처럼 명시된 사실을 찾는 문제에 강했다. 반면 이메일 긴급도와 웹사이트 문구의 문제 원인처럼 판단이 필요한 항목에서는 비교 모델보다 정확도가 낮았다.
- 도입의 핵심은 업무 분담이다. 반복적인 선택은 Jev에 맡기되 신뢰도가 낮거나 해석·문장 생성이 필요한 작업은 사람 또는 더 강한 모델로 넘기고, 자동 실행 전 실제 업무에서 결과를 관찰해야 한다.
🧩 배경과 문제 정의
영상은 빠르게 확산된 Jev의 활용 사례를 출발점으로, 문장을 쓰지 않는 AI가 어디에 유용한지 설명한다. 계약의 자동 갱신 여부, 이메일 분류, 잠재 고객의 요청 서비스처럼 결과가 정해진 선택지로 표현되는 업무가 주요 대상이다.
발표자는 일반 LLM이 답변을 순차적으로 생성하는 방식과 Jev가 선택지를 평가하는 방식을 비교한다. 핵심 문제는 모든 작업을 큰 모델에 맡기는 비용을 줄이면서, 단순한 사실 확인과 복잡한 판단을 어떻게 구분할 것인가다. 영상은 제공사 주장, 발표자의 네 가지 비교 시연, 응용 사례, 제약 사항 순으로 이를 검토한다.
🕒 시간순 섹션별 상세정리
1. 확산된 사례와 Jev의 정체
- 도입부는 코딩 세션의 토큰 축소, 저비용 항공편 탐색, 게임 50개 동시 실행 사례를 보여준다. 이는 영상에서 인용한 활용 사례이며 독립 검증 결과는 제시되지 않는다. [00:29]
- Jev는 문장을 생성하지 않고 결정을 내리는 모델로 묶인다. 개발사는 샌프란시스코의 Typesafe AI이며, 약 2년간 비공개 개발 후 내놓은 첫 제품이라고 보여준다. [00:53]
2. 입력 방식과 세 가지 질문 유형
- 텍스트 정보, 그 정보에 대한 질문, 허용된 답을 입력하면 선택 결과와 확신 정도를 나타내는 수치를 받는다. 계약의 자동 갱신 여부가 예시로 등장한다. [01:12]
- 예·아니요 확률, 최대 255개 항목 중 선택, 최대 10단계의 사용자 정의 척도 평가를 지원한다고 보여준다. 고객의 불만 정도처럼 순서가 있는 항목은 단계 사이 값으로도 표현할 수 있다. [01:48]
3. 속도와 비용의 구조적 설명
- 발표자는 일반 LLM의 순차적 답변 생성을 서술형 시험에, Jev의 선택지 평가를 객관식 시험에 비유한다. 동일 텍스트의 여러 질문을 함께 처리할 수 있다는 점을 강조한다. [02:19]
- 13개 질문을 한 번에 호출한 제공사 시험은 개별 처리보다 11배 이상 저렴하고 약 10배 빨랐다고 보여준다. 과금은 읽은 입력에만 적용된다는 설명이 계속된다. [02:31]
- 본질적으로 분류기지만, 사용자가 먼저 대량의 라벨 데이터를 제공해 훈련할 필요 없이 영어로 선택지를 적어 사용할 수 있다는 점을 차별점으로 제시한다. [02:48]
4. 접근 경로와 제공사 벤치마크 읽기
- typesafe.ai 가입과 키 발급 또는 OpenRouter를 통한 접근을 보여준다. 에이전트 도구에 연결하는 방법은 설명하지만 실제 설치 명령은 전사에 포함되지 않는다. [03:29]
- 홈페이지의 자체 시험 수치는 193배 빠름·440배 저렴함이며, 가격은 입력 100만 토큰당 4.2센트라고 보여준다. 명령 안전성 점검에 적용해 최대 18배 빨라졌다는 외부 기업 사례도 인용한다. [04:17]
- 제공사 표의 네 업무에서 Jev는 가장 저렴하고 빠르지만 정확도 1위는 아니었다고 짚어 본다. 고객 서비스는 약 76% 대 78.3%로 소개하며, 정확도 기준이 비교 모델과의 일치율임을 드러낸다. [05:00]
5. 이메일 시연과 신뢰도에 따른 이관
- OpenRouter를 이용해 같은 입력과 질문을 세 모델에 적용한다. 이메일 시연에서는 답장 필요 여부, 이메일 종류, 긴급도를 평가한다. [06:29]
- Jev는 2초 미만·1센트 미만, 비교 모델은 약 15초와 30초로 묶인다. 긴급도 결과는 Jev 24/40, 비교 모델 35/40과 33/40으로 낭독되어 판단 항목의 격차를 보여준다. [07:25]
- 발표자는 판단이 많이 필요한 질문일수록 격차가 커진다고 해석한다. 신뢰도 90% 초과는 실행하고 그 이하는 사람이나 더 강한 모델에 넘기는 운영 규칙을 제안한다. [08:03]
6. 계약과 웹사이트 문구에서 갈리는 성능
- 계약 시연은 자동 갱신 여부, 갱신 중단 통지 기간, 조항의 위험도를 묻는다. 자동 갱신과 통지 기간은 세 모델 모두 30/30으로 소개되어 명시적 사실 확인에서의 강점을 보여준다. [09:30]
- 웹사이트 문구 시연은 일반적인 AI 문구 여부, 가장 큰 문제, 수정 필요 수준을 평가한다. Jev는 다시 2초 미만·1센트 미만으로 묶인다. [10:25]
- 일반적인 AI 문구 여부는 모두 30/30이지만 문제 유형 분류는 Jev 14/30, 비교 모델은 각각 25/30이었다. 단순 식별보다 문제를 해석하는 단계에서 더 강한 모델이 필요하다는 결론을 제시한다. [10:43]
7. 잠재 고객 선별과 소규모 도입 원칙
- 연락 양식의 메시지 약 30개에서 영업 통화 가치, 요청 서비스, 시작 긴급도를 평가한다. Jev는 각각 29/30, 30/30, 30/30으로 소개되며 통화 가치에서 비교 모델보다 한 건 낮았다. [11:28]
- 네 시연을 종합해 텍스트에 명시된 사실에서는 비용 대비 성능이 좋고, 판단이 필요하면 큰 모델이 유리하다고 보여준다. 영업 담당자가 읽기 전에 연락 순서를 정하는 활용도 제시한다. [11:55]
- 반복 결정 하나를 골라 선택지를 작성하고, 일주일 동안 확률 수치를 관찰한 뒤 독립적인 실행을 허용하라고 권한다. [12:20]
8. 광고 분석부터 파일 탐색까지 여섯 가지 응용
- 경쟁사 광고를 인지 단계·후킹 문구·제안으로 분류하거나, 고객 이메일의 긴급도를 스프레드시트 열에 채우는 사례를 보여준다. [13:17]
- 요청 난이도를 먼저 판별해 저렴한 모델과 강한 모델로 나누는 라우팅, 에이전트가 사용할 스킬을 고르는 작업을 제시한다. 스킬 선택 사례에서는 잘못된 로드가 절반 이상 줄었다는 제공사 결과를 인용한다. [14:05]
- 여러 브라우저의 웹사이트 시험에서 다음 행동을 선택하거나, 사용자의 설명에 맞는 파일을 후보 중에서 찾는 활용을 보여준다. [14:40]
9. 선택형 출력의 한계와 비용 절감의 조건
- '환각 없음'은 선택지 밖의 답을 만들 수 없다는 뜻이며 오답 방지를 뜻하지 않는다. 정답이 없는 경우에도 항목을 고르므로 '해당 없음'과 '명시되지 않음'을 포함하라고 보여준다. [15:15]
- 수학과 날짜 비교에 약하고, 질문을 문자 그대로 받아들이며, 불필요한 내용이 많은 긴 문서에서 성능이 떨어진다고 보여준다. 당시 텍스트만 지원하며 입력은 약 2만 단어라고 보여준다. [15:40]
- 수백 배 저렴하다는 수치는 현실에서 기대할 수 있는 절감 폭의 상단이라고 짚어 본다. 문장 한 줄이라도 생성해야 하면 일반 모델이 다시 필요해진다. [15:53]
10. 체스 사례와 마지막 도입 제안
- 속기 체스 사례에서는 한 비교 모델이 사고 시간 때문에 패배했지만 다른 모델은 Jev를 18수 만에 이겼다고 보여준다. 발표자는 이를 빠른 결정과 앞을 내다보는 계획 능력의 차이로 해석한다. [16:16]
- 마무리에서는 기존 스킬·예약 자동화·반복 작업 중 Jev가 비용과 시간을 줄일 수 있는 단계를 찾아보라고 권한다. 이 권고는 앞서 제시한 업무별 성능 차이와 함께 해석해야 한다. [16:45]
- 마지막 부분은 무료 도입 가이드와 사업자 상담 안내로 이어지고, 시청 감사 인사로 끝난다. [17:15]
🧾 결론
- Jev는 자유롭게 글을 쓰는 범용 도우미보다, 텍스트를 읽고 정해진 답을 고르는 분류 구성요소로 이해하는 편이 적절하다.
- 영상의 시연은 명시적 사실 추출과 복잡한 판단 사이에서 성능 차이가 커진다는 패턴을 보여준다. 소규모 사례의 결과를 모든 업무로 일반화할 수는 없다.
- 선택지 밖의 답을 생성하지 않는다는 특성이 정답을 보장하지는 않는다. 선택지 설계와 오답 처리 절차가 실제 활용도를 좌우한다.
📈 투자·시사 포인트
- 업무 자동화의 경제성은 토큰 단가보다 결정 한 건의 총비용으로 비교필요가 있다. 재검토와 상위 모델 호출까지 포함해야 실제 절감액을 판단할 수 있다.
- 저렴한 분류 모델을 앞단에 두고 어려운 요청만 고성능 모델로 보내는 구조는 모델 라우팅과 에이전트 운영의 비용 절감 가능성을 보여준다.
- 이메일 분류·잠재 고객 선별·계약 항목 확인처럼 반복량이 큰 업무가 우선 검토 대상이다. 판단 오류의 손실이 큰 업무에서는 속도보다 검증과 이관 기준이 중요하다.
- 영상에는 기업 실적이나 가치평가 자료가 없다. 제시된 성능·가격 수치는 특정 기업에 대한 투자 판단보다 업무 도입 가설을 세우는 근거로 활용하는 것이 적절하다.
⚠️ 불확실하거나 확인이 필요한 부분
- 최고 속도·비용 배수는 제공사 자체 시험과 일부 사례에 기반한다. 영상에서도 440배 안팎의 비용 절감은 상단 수치이며, 실제 업무에서는 절감 폭이 작아질 수 있다고 설명한다.
- 제공사 표의 정확도는 Astra·Fable과의 답변 일치율로 설명된다. 사람의 검증을 거친 정답률과 동일하게 해석하기 어렵고, 시연 데이터의 정답 작성·검증 절차도 충분히 제시되지 않는다.
- 이메일 시연은 약 40개 입력이라고 소개하지만 일부 결과 낭독에는 분모 48이 등장한다. 원본 결과표 없이 해당 항목의 정확한 비율을 확정하기 어렵다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 반복 업무 하나를 골라 입력 텍스트, 질문, 선택지를 명시하고 '해당 없음' 또는 '명시되지 않음'을 포함한다.
- 실제 업무 사례에 사람이 확인한 정답을 붙여 사실 추출과 주관적 판단의 성능을 따로 비교한다.
- 최소 일주일 동안 자동 실행 없이 결과와 신뢰도를 기록하고, 신뢰도 구간별 실제 정답률을 확인한다.
- 오답의 손실과 검증 결과를 바탕으로 자동 처리 기준을 정하고, 나머지는 사람이나 더 강한 모델에 이관한다.
❓ 열린 질문
- 실제 업무에서 사람이나 상위 모델로 넘겨야 하는 비율은 얼마이며, 이를 포함해도 비용 절감이 충분한가?
- Jev의 신뢰도 수치는 이메일·계약·잠재 고객 선별에서 각각 실제 정답률과 얼마나 일치하는가?
- 선택지가 많아지거나 정답이 없는 사례가 늘면 정확도와 '해당 없음' 선택 성능은 어떻게 변하는가?