Why Developers Are Losing Their Minds Over AI That Can''t Write
Quick Summary
Why Developers Are Losing Their Minds Over AI That Can't Write를 중심으로, Jev는 생성 대신 선택에 집중한다. 질문과 허용된 답을 지정하면 입력을 해석해 선택 결과·점수·확률을 반환한다. 서로 다를 핵심 판단 포인트로 압축 정리한다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
Why Developers Are Losing Their Minds Over AI That Can't Write를 중심으로, Jev는 생성 대신 선택에 집중한다. 질문과 허용된 답을 지정하면 입력을 해석해 선택 결과·점수·확률을 반환한다. 서로 다를 핵심 판단 포인트로 압축 정리한다.
📌 핵심 요점
- Jev는 생성 대신 선택에 집중한다. 질문과 허용된 답을 지정하면 입력을 해석해 선택 결과·점수·확률을 반환한다. 서로 다른 분류 작업마다 새 모델을 학습할 필요가 없다는 것이 범용성의 핵심이다.
- 적용 대상은 복잡한 입력과 단순한 출력이 만나는 작업이다. 고객 이탈 징후, 이메일의 사업 기회, 지원 티켓의 긴급도처럼 규칙만으로 판단하기 어렵지만 결과는 몇 가지 범주로 정리되는 문제가 해당한다.
- 선택지를 제한해도 판단 오류는 남는다. 영상의 ‘반결정적’ 구조는 가능한 결과와 후속 행동을 미리 정하지만, 모델의 분류 자체는 확률적이다. 에이전트의 실행 허용·거부·사람 확인을 고르는 용도도 실제 정확도 검증이 필요하다.
- 비용·속도 개선 사례는 유망하지만 조건을 구분해야 한다. 세금 문서 처리 사례에서는 비용이 약 34분의 1, 처리 속도가 6배로 개선됐다고 소개한다. 속도 약 100배·비용 100배 이상 개선이라는 수치는 Typesafe의 자체 출시 평가다.
- 저렴한 판단은 AI 사용 범위를 넓힐 수 있다. 분류기가 다음 행동을 고르고, 생성형 LLM이 추론·계획·글쓰기를, 일반 코드가 계산·조회를 담당하는 구상이다. 호출 비용이 낮아지면 표본 검사에 그치던 업무를 전체 자료나 각 실행 단계로 확대할 여지가 생긴다.
🧩 배경과 문제 정의
- 고객 이탈 징후나 사업 기회처럼 문맥 해석이 필요한 문제는 명시적인 코드 규칙만으로 처리하기 어렵다. 그러나 필요한 결과는 분류, 점수, 승인 여부처럼 단순한 선택인 경우가 많다.
- 기존 머신러닝 분류기는 데이터 수집·라벨링·학습·유지보수 비용이 들고, 범용 LLM을 분류에 사용하면 텍스트 생성 모델의 비용과 지연을 감수해야 한다.
- Jev는 글을 생성하지 않고 미리 정의된 선택지 중에서 답을 고르는 범용 분류기다. 핵심 쟁점은 LLM을 대체하는지가 아니라, 저렴하고 빠른 판단을 소프트웨어의 얼마나 많은 지점에 넣을 수 있는지다.
- 출력 형식을 제한해도 판단 자체는 확률적이다. 비용과 속도의 이점뿐 아니라 실제 업무에서의 정확도와 실패 가능성을 함께 검증해야 한다.
🕒 시간순 섹션별 상세정리
1. 글을 쓰지 않는 모델의 빠른 초기 도입
- Jev는 입력을 읽되 단어를 생성하지 않고, 사용자가 사전에 제공한 답 중 하나만 선택한다. 글쓰기 능력의 부재가 이 모델의 의도적인 설계다. [00:22]
- 영상에 제시된 출시 성과에 따르면, Typesafe가 9월 15일 공개한 Jev는 24시간 안에 Vercel AI Gateway에서 가장 빠르게 도입된 모델이 됐다. 같은 출시 초기 24시간을 비교했을 때 유료 도입 팀 수가 이전 어떤 모델보다도 두 배 이상 많았다. [00:37]
2. 복잡한 문맥을 읽고 단순한 결과를 고르는 문제
- 청구서가 30일 연체됐는지, 주문액이 한도를 초과했는지는 명시적인 조건으로 처리할 수 있다. 반면 고객 이메일에 계약 해지 징후가 있는지, 실제 사업 기회인지 판단하려면 표현의 의미와 문맥을 해석해야 한다. [02:18]
- 이런 문제는 입력이 복잡해도 출력은 범주, 점수, 진행 여부로 제한된다. 서툴게 작성된 이메일 속 유망한 기회를 찾는 작업처럼, 규칙으로 처리하기 어렵고 LLM으로 처리하면 비용이 드는 영역이 Jev의 적용 대상이다. [03:32]
3. 확률적 판단과 정해진 후속 행동을 결합하는 ‘반결정적’ 처리
- 에이전트의 텍스트와 코드를 검토해 실행 허용, 실행 거부, 사람에게 확인 중 하나를 선택할 수 있다. 이런 판단이 충분히 저렴하고 빠르면 에이전트 실행 과정의 더 많은 지점에 안전 검사를 배치할 수 있다. [04:29]
- 영상에서 ‘반결정적’이라고 부르는 방식은 가능한 결과와 각 결과의 후속 행동을 먼저 정한 뒤, 복잡한 입력을 모델이 분류하게 하는 구조다. 출력은 제한되지만 트랜스포머가 수행하는 판단 자체는 여전히 확률적이다. [05:01]
4. 맞춤형 분류기의 구축 부담과 LLM 분류의 확산
- 전통적인 머신러닝 분류기는 예제를 모으고 라벨을 붙여 학습·평가한 뒤, 문제가 변하면 유지보수해야 한다. 구축 후 실행 비용은 낮지만 새로운 분류 문제마다 데이터와 전문성이 필요해, 작고 흩어진 판단 작업에는 투자하기 어려웠다. [06:07]
- LLM은 작업 설명만으로 여러 분류 문제를 처리할 수 있어 메시지 정리, 도구 선택, 관련성 판단, 문서 선별, 다른 모델의 결과 검토에 쓰이기 시작했다. 이 과정에서 텍스트 생성 모델이 사실상 범용 분류기 역할을 맡게 됐다. [07:21]
5. 질문과 선택지를 정의해 재사용하는 범용 판단 기능
- Jev에는 질문과 허용된 답을 설명하고, 프로그램은 선택 결과·점수·확률을 받는다. 여러 질문을 함께 평가할 수 있고, 서로 다른 분류 문제마다 새 모델을 학습할 필요가 없다는 점이 범용성의 핵심이다. [09:31]
- 도입 후보는 ‘복잡한 텍스트 입력, 단순한 선택 출력’ 구조에서 찾아야 한다. 기존 LLM, 이미 운영 중인 머신러닝 분류기, 사람의 개별 판단과 비교해 실제로 더 나은지 시험해야 하며, 저렴할 것이라는 기대만으로 적합성이 확정되지는 않는다. [10:31]
6. 생성 모델·분류기·일반 코드의 역할 분담
- 언어 이해와 선택을 일반적인 소프트웨어 함수처럼 사용할 수 있으면, 기존 제품의 여러 기능에 판단 능력을 삽입할 수 있다. Jev를 새로운 소프트웨어 구성 요소로 보는 근거는 이런 조합 가능성이다. [11:34]
- 제안된 역할 분담에서 생성형 LLM은 추론·계획·글쓰기를, 범용 분류기는 정의된 결과 사이의 선택을, 결정적 코드는 계산과 기록 조회를 맡는다. 이를 컴퓨터과학의 매우 큰 변화로 평가하는 것은 영상 화자의 견해다. [12:31]
7. 비정형 입력을 기존 업무 절차로 연결하는 분류기
- 지원 티켓의 청구 관련 여부, 당일 대응 필요성, 고객 이탈 위험을 판단하면 담당 팀과 처리 우선순위를 정할 수 있다. 이메일에서도 사업 기회와 회신 가치를 먼저 분류하고, 답장 초안 작성은 생성 모델에 맡길 수 있다. [13:52]
- 코딩 에이전트가 빌드 폴더 삭제나 강제 푸시를 제안하는 상황에서는 사용자 확인이 필요하다는 결과를 선택할 수 있다. 이 구조에서 분류기는 다음 행동의 조건을 판단하고, 실제 실행이나 콘텐츠 생성은 후속 절차가 담당한다. [15:16]
8. 세금 문서와 업무 기록 분류에서 제시된 비용·속도 개선
- 수천 건의 세금 문서를 처리하던 기존 LLM 파이프라인을 Jev 분류기로 바꾼 개발자 사례에서는 비용이 기존의 약 34분의 1로 줄고 속도는 6배 빨라졌다는 비교 결과가 제시됐다. 이는 해당 업무 사례의 결과다. [15:56]
- 다른 사용자 사례에서는 이메일·Slack 메시지·대화 기록 2만 건 이상을 불만, 추가 판매 기회, 놓친 후속 조치 등의 관점에서 분류하는 데 7분과 총 1달러가 들었다. 낮은 처리 비용은 쌓여 있던 업무 정보를 대량으로 검토할 여지를 넓힌다. [16:39]
9. 대규모 연구 후보에서 주의를 기울일 대상을 선별
- 면역학 연구 사례에서는 문헌에 근거한 질문 후보 1만 개 중 중요한 질문 100개를 고르는 실험이 이뤄졌다. 실험자는 Jev가 빠르고 저렴하게 대체로 적절한 상위 100개를 골랐다고 평가했다. [17:14]
- 이 사례의 기능은 면역학 질문을 곧바로 해결하는 것이 아니라, 큰 후보 집합에서 우선 검토할 대상을 추리는 것이다. 정보량이 빠르게 늘어날수록 어디에 주의를 배분할지 결정하는 기능의 가치가 커진다는 주장으로 계속된다. [18:15]
10. 분류기가 다음 행동을 선택하는 에이전트 제어 구조
- 분류기를 에이전트 실행 구조의 바깥쪽 제어 루프에 두면, 생성 모델은 그 안에서 호출되는 도구가 된다. 문서의 현재 상태에 따라 일반 도구 실행, LLM의 글쓰기, 고성능 모델의 예외적 추론, 사람의 개입 중 다음 단계를 선택할 수 있다. [18:58]
- Browser Use가 공개한 오픈소스 에이전트 사례에서는 Jev가 브라우저의 조작과 대상 요소를 선택한다. 화면의 버튼·링크처럼 제한된 선택지를 고르거나, 디자인 시스템의 정해진 구성 요소를 조합해 인터페이스를 구성하는 작업에도 같은 원리를 적용할 수 있다. [20:03]
11. 스프레드시트에 들어가는 즉각적인 언어 판단과 검증 필요성
- 스프레드시트 시연에서는 열 제목에 ‘urgency’를 입력하면 Jev가 분류 의도를 파악해 각 행의 긴급도를 판단한다. 코드가 가능한 구성 요소와 동작을 제공하면, 생성형 LLM 없이도 사용자 의도를 해석해 빠르게 반응하는 기능을 구성할 수 있다. [21:09]
- 이 패턴을 확장하면 긴급도, 누락 정보, 담당 팀을 각각 판단하고 일반 수식으로 날짜·금액과 결합할 수 있다. 언어에 대한 판단과 기존 계산 기능이 같은 작업 공간에서 함께 작동하는 방식이다. [22:04]
12. 에이전트로 도입 후보를 찾고 비교 실험하기
- 제시된 시작 절차는 Typesafe 웹사이트의 설정 프롬프트를 코딩 에이전트 등에 전달해 스킬을 설치하고, 계정과 API 키를 만든 뒤 프로젝트에 연결하는 것이다. 에이전트가 연결 작업을 지원하는 흐름이다. [24:12]
- 기존 프로젝트에서 LLM이 정해진 결과 중 하나를 고르는 작업을 찾아 Jev 버전을 만들고, 결과·속도·비용을 비교하는 실험이 권장된다. 대체할 부분을 구체적으로 정하고 기존 구현과 비교하는 것이 도입 판단의 기준이다. [24:48]
13. 낮은 호출 비용과 출시 평가 수치의 의미
- 영상의 가격 설명에서 출력에는 요금이 붙지 않는다. 요청당 입력 1,000토큰을 가정한 예시 비용은 1,000회 호출에 약 4센트, 1만 회 호출에 42센트로, 많은 예제를 사용하는 실험의 비용 부담이 작다는 근거로 드러난다. [25:12]
- 같은 입력량으로 100만 회 요청하는 예시 비용은 42달러다. Typesafe의 자체 출시 평가에서는 LLM 대비 속도가 100배에 근접하고 비용은 100배 넘게 저렴한 개선이 제시됐지만, 이 수치는 회사의 출시 평가 결과라는 맥락을 갖는다. [26:29]
14. 비용 절감이 판단의 빈도와 적용 범위를 바꾸는 효과
- 분류 비용의 하락은 기존 AI 청구액을 줄이는 데서 끝나지 않고, 비용 때문에 하지 않던 판단을 실행할 수 있게 만든다. 비쌀 때 지불할 가치가 있던 작업의 범위와 저렴해졌을 때 수행하고 싶은 작업의 범위는 다르다. [27:20]
- 고객 통화를 표본으로만 검토하던 회사가 모든 통화를 여러 기준으로 검사하거나, 새 기회가 생길 때 전체 문서 이력을 다시 분류하는 방식이 가능해진다는 전망이다. 인터페이스도 사용자가 매번 요구를 설명하기 전에 작업 중 유용한 제안을 제공할 수 있다. [28:03]
15. 제번스의 역설과 일상 기능에 스며드는 판단 능력
- 제번스의 역설은 효율 향상이 자원의 활용 범위를 넓혀 전체 소비를 오히려 증가시킬 수 있다는 관찰이다. Jev라는 이름에는 저렴한 지능이 이전에는 감당하기 어려웠던 영역의 수요까지 크게 늘릴 수 있다는 발상이 담겨 있다. [28:57]
- 충분히 저렴하고 빠른 판단은 평범한 소프트웨어 기능과 인터페이스 안에 자연스럽게 들어갈 수 있다는 전망이다. 분류가 더 많은 기회를 찾아내면 고성능 생성 모델의 가치도 함께 커질 수 있다는 가능성이 드러난다. [29:21]
16. 저렴한 판단 기능이 넓히는 소프트웨어의 활용 범위
- 탐구할 질문과 처리할 예외가 늘어나면서 추론과 언어 작성 모델이 수행할 일도 생긴다. 이런 관점에서 LLM 작업을 포함한 유용한 AI 작업의 전체 규모는 빠르게 커지고 있다 [30:18]
- 기존에는 해석이 필요한 곳에 규칙을 쓰고, 투자가 타당할 때 전용 분류기를 만들며, 즉각적인 출력이 결정인 곳에도 LLM을 넣었다. 새로운 구성 요소는 이런 작업을 구현할 선택지를 넓히며, TypeSafe 홈페이지의 내용을 복사해 에이전트에 전달하는 사용 방식은 비개발자의 접근도 돕는다 [31:00]
17. 작은 팀의 새로운 발상과 실제 문제를 통한 검증
- 혼자 몰두하는 개인의 뜻밖의 통찰이 산업 전체를 전진시킬 수 있다는 관점에서, 작은 팀이 만든 Jev는 그런 전환점으로 평가된다. 다른 개인이나 소규모 팀도 아무도 요구하지 않은 낯선 아이디어를 계속 발전시키면 다음 사례가 될 수 있다는 격려로 계속된다 [32:37]
- Jev는 100배 빠르고 100배 저렴하다는 주장과 함께 사용을 권장받는다. 실제 시험 대상으로는 복잡하고 정돈되지 않은 입력이 들어오지만 출력은 몇 가지 선택지로 좁혀지는 문제가 제시되며, 직접 적용해 기존 방식과의 차이와 결과를 확인하는 것이 핵심이다 [32:57]
🧾 결론
- Jev의 핵심 가치는 언어 이해를 정해진 선택으로 연결해 재사용 가능한 소프트웨어 기능으로 제공하는 데 있다.
- 도입 여부는 기존 LLM·운영 중인 분류기·사람의 판단과 결과, 속도, 비용을 비교해 결정해야 한다.
- 분류로 검토할 기회와 예외를 더 많이 찾아내면, 후속 추론과 작성을 맡는 생성 모델의 활용도 함께 늘어날 수 있다.
📈 투자·시사 포인트
- 단가 하락과 수요 확대를 함께 봐야 한다. 영상은 제번스의 역설을 통해 저렴해진 판단이 호출 빈도와 적용 범위를 늘릴 가능성을 제시한다. 단가 감소가 전체 지출 감소로 이어지는지는 별도 확인이 필요하다.
- 제품의 차별화 지점이 판단의 배치로 넓어진다. 문서 재분류, 통화 전수 검토, 단계별 안전 검사처럼 기존에 비용 때문에 생략했던 기능이 도입 후보가 된다.
- 분류기와 생성 모델의 보완 관계가 중요하다. 분류가 후속 작업을 늘린다면 고성능 모델의 수요도 커질 수 있지만, 이는 영상에서 제시한 전망이다.
- 초기 도입 성과와 지속적인 사업 성과는 구분해야 한다. 영상이 소개한 출시 첫 24시간의 빠른 유료 도입만으로 장기 사용량이나 고객 유지, 수익성을 판단할 수는 없다.
⚠️ 불확실하거나 확인이 필요한 부분
- Typesafe의 자체 출시 평가와 개별 사용자 사례는 비교 대상·입력 구성·정확도 조건이 충분히 제시되지 않아 모든 업무에 같은 비용·속도 개선을 적용하기 어렵다.
- 정해진 답만 반환한다는 특성이 판단의 정확성을 보장하지 않는다. 고객 이탈이나 실행 안전성처럼 오분류의 영향이 큰 작업은 오류 유형과 사람의 검토 필요성을 확인해야 한다.
- 영상의 호출 비용은 요청당 입력 1,000토큰이라는 가정에 따른 예시다. 실제 입력량과 적용 시점의 가격 조건을 확인해야 한다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 기존 프로젝트에서 LLM이 몇 가지 정해진 결과 중 하나를 고르는 작업을 찾아 도입 후보를 정리한다.
- 후보 하나를 골라 질문, 허용된 답, 각 답에 따른 후속 행동과 사람에게 확인할 조건을 정의한다.
- 실제 업무 입력에 Jev와 기존 방식을 적용해 정확도, 오류 유형, 처리 시간, 비용을 같은 조건으로 비교한다.
- 에이전트 실행 판단에 적용한다면 실행 허용·거부·사람 확인이 필요한 사례를 포함해 검증한다.
❓ 열린 질문
- 실제 업무에서 어느 정도의 정확도와 오류 비용을 충족해야 Jev가 기존 LLM이나 전용 분류기보다 유리한가?
- 분류기를 에이전트의 바깥쪽 제어 루프에 둘 때, 어떤 판단은 자동화하고 어떤 판단은 사람에게 넘겨야 하는가?
- 판단 단가가 낮아지면 전체 AI 지출은 줄어들까, 아니면 분류와 후속 생성 작업이 늘면서 커질까?