YouTubeJulian Goldie SEO·2026년 9월 19일·0

Jev + Needle 3 AI Started Something NEW!

Quick Summary

Jev와 Needle 3는 대화보다 구조화된 실행에 집중하는 AI의 흐름을 보여주며, 반복 업무를 작은 전문 모델에 맡기는 에이전트 설계를 제안한다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Jev + Needle 3 AI Started Something NEW! 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Jev + Needle 3 AI Started Something NEW!의 핵심 내용을 4단계로 요약한 인포그래픽
Jev + Needle 3 AI Started Something NEW! 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Jev와 Needle 3는 대화보다 구조화된 실행에 집중하는 AI의 흐름을 보여주며, 반복 업무를 작은 전문 모델에 맡기는 에이전트 설계를 제안한다.

📌 핵심 요점

  1. Needle 3는 기기 내 실행을 겨냥한 소형 모델이다. 영상은 일반 CPU에서 66ms 응답, 약 35~36MB 배포 크기, 인터넷 없는 실행을 소개하지만 측정 조건은 충분히 제시하지 않는다.
  2. 핵심 기능은 도구 호출, 구조화된 정보 추출, 임베딩이다. 범용 대화 능력을 의도적으로 줄이고 정해진 작업에 집중한다.
  3. Jev는 구조화된 출력과 분류에 초점을 맞춘 더 큰 모델로 소개된다. 두 모델의 공통점은 설명문 생성보다 바로 처리할 수 있는 출력을 지향한다는 점이며, 실제 결합 구현은 제시되지 않는다.
  4. 스키마 기반 출력 제약, 가변 깊이, 업무별 미세조정, 신뢰도 점수가 주요 설계 요소다. 다만 형식이 맞는 출력도 잘못된 호출이나 부정확한 값을 포함할 수 있다.
  5. 실무 적용의 관건은 요청 사이 상태 초기화, 인자 기본값, 입력 품질, 신뢰도별 실행 정책이다. 영상은 작은 모델에 반복 작업을 맡기고 큰 모델은 필요한 경우에 호출하는 구성을 권한다.

🧩 배경과 문제 정의

영상은 모든 작업을 큰 클라우드 모델에 보내는 에이전트 구성에 문제를 제기한다. 단순한 도구 선택이나 필드 채우기에도 범용 모델을 사용하면 호출 비용과 지연이 발생하고, 생성된 문장에서 JSON을 추출하는 후처리가 실패할 수 있다는 설명이다.

대안으로 Cactus의 Needle 3와 Type Safe AI의 Jev를 소개한다. Needle 3는 기기 내 도구 호출·추출·임베딩에, Jev는 구조화된 출력과 분류에 초점을 맞춘 것으로 설명된다. 제목은 두 모델을 함께 내세우지만 본문 대부분은 Needle 3의 기능과 한계에 할애된다. 중간과 후반에는 발표자의 코칭·Agent OS 상품 홍보가 포함된다.

🕒 시간순 섹션별 상세정리

1. 작은 로컬 모델이 제안하는 변화

  • Needle 3를 휴대전화·노트북·시계에서 인터넷 없이 실행할 수 있는 Cactus의 소형 모델로 소개하고, Jev와 함께 에이전트의 속도와 실행 방식을 바꾸는 흐름으로 보여준다. [00:41]
  • 일반 CPU에서 66ms, 전체 모델 36MB라는 수치를 제시하며 GPU와 서버 연결 없이 동작한다는 점을 강조한다. [00:56]

2. 자연어 요청을 여러 도구 호출로 변환

  • 선풍기 켜기, 온도 10도로 설정하기, 침실 조명 켜기를 한 문장으로 요청하면 각각의 실행과 인자로 변환한다는 사례를 든다. [01:32]
  • Cactus가 두 함수 호출을 CPU에서 97ms 미만에 반환한다고 주장한다. 이어 크기·구성에 따라 배포 용량이 달라지고, 엔진 포함 시험 버전은 약 35MB라고 보여준다. [02:11]
  • Apache 2.0 라이선스와 오픈소스를 강조하며, 당시 GitHub 별이 11,000개를 넘었다고 보여준다. [02:36]

3. 세 가지 기능과 범용 대화의 포기

  • 도구 목록에서 적절한 함수를 선택하고 인자를 채우며, 지원 도구가 없으면 빈 목록을 반환한다고 보여준다. [02:59]
  • 청구서·예약·양식의 텍스트를 정해진 필드로 추출하고, 임베딩으로 기기 내 검색과 매칭도 수행한다고 보여준다. [03:32]
  • 범용 대화 능력을 의도적으로 포기한 설계라고 밝히며, 1억 2,100만 매개변수 모델이 특정 도구 호출과 추출 작업에서 더 큰 모델과 경쟁한다고 주장한다. [04:01]

4. 벤치마크 설명과 첫 번째 홍보 구간

  • 모바일 명령, Droid call, Berkeley 함수 호출 평가와 세 가지 추출 평가를 보여준다. 호출의 정확성·순서·부적합 요청 거절 등을 평가 대상으로 제시한다. [04:58]
  • 비교 모델은 전체 정밀도, Needle 3는 배포용 2비트 파일로 실행했다고 드러낸다. Raspberry Pi 5에서 출력 초당 400~4,000토큰, 입력 초당 1,000~10,000토큰이라는 수치도 보여준다. [05:24]
  • 반복적인 조회·필드 채우기를 로컬 모델에 맡기는 사업적 의미를 설명한 뒤, 코칭과 여러 에이전트가 기억을 공유하는 Agent OS 상품을 홍보한다. [06:24]

5. Jev와 구조화된 출력의 의미

  • Jev를 Type Safe AI의 더 큰 모델로 소개하며, 분류 중심 학습과 빠른 구조화 출력, Doom에서 프레임별 행동을 출력하는 사례를 언급한다. [07:09]
  • 두 모델을 설명문 대신 실행 가능한 출력을 만드는 흐름으로 묶는다. 일반적인 자동화에서는 응답에서 JSON을 추출하고 검사하는 과정이 실패 지점이 된다고 보여준다. [07:50]
  • Needle 3는 사용자 스키마에서 만든 문법으로 출력을 제한한다고 보여준다. 이는 형식 유효성에 관한 주장으로, 실제 호출 내용의 정확성과는 구별필요가 있다. [08:12]

6. 가변 깊이와 업무별 미세조정

  • 20개 층 중 2~20개 층의 각 깊이가 작동하도록 학습해, 하나의 가중치 묶음에서 19개 깊이를 선택할 수 있다고 보여준다. 2개 층 구성은 약 13MB라고 보여준다. [08:57]
  • 매개변수 상당 부분을 단어 패턴 조회용 engram에 배치해 연산을 줄였으며, 1억 2,100만 매개변수 구성이 약 5,000만 매개변수 모델 수준의 계산을 수행한다고 주장한다. [09:21]
  • Droid call 미세조정에서 각 하위 네트워크가 18~36포인트 개선됐다고 보여준다. 업무 예제로 어댑터를 만들고 플랫폼과 깊이에 맞춰 배포 파일을 생성하는 절차를 보여준다. [10:23]

7. 신뢰도 점수와 트리거

  • 학습된 점수 산출부가 응답에 신뢰도를 붙이고, 엔진은 0.1 미만 호출을 별도 목록으로 보류한다고 보여준다. [10:58]
  • 신뢰도에 따라 실행·사용자 확인·거절을 구분하는 운영 방식을 제안한다. 다만 이 구간의 전사 문장은 일부 불명확하다. [11:22]
  • 특정 단어 패턴을 도구에 연결하는 트리거는 낮은 신뢰도에서도 도구 사용을 강제한다고 보여준다. 놓치면 안 되는 의도를 처리하기 위한 기능이라는 설명이다. [11:46]

8. 실제 적용에서 드러난 네 가지 한계

  • 요청 사이 초기화가 없으면 이전 상태의 영향으로 잘못된 호출이 나올 수 있다고 보여준다. 존재하지 않는 피자 도구 호출 사례와 초기화 관련 엔진 수정도 언급한다. [12:32]
  • 필수 인자에 기본값도 요청 내 근거도 없으면 추정 대신 보류하며, 장황한 메시지에서는 추출 필드가 비는 문제가 나타날 수 있다고 보여준다. [13:17]
  • 순수 분류에서는 Needle 3가 가장 강한 선택이 아니라고 드러낸다. Jev는 더 크고 해당 작업에 특화돼 있으며, Needle 3는 열거형을 이용한 추출 방식으로 분류를 수행한다고 보여준다. [13:43]

9. 실행 환경과 모델 배분 전략

  • 데스크톱·모바일·시계·브라우저 등 여러 실행 환경과 1MB 미만 사전 빌드 엔진을 보여준다. 텔레메트리는 기본 활성화지만 환경변수 두 개로 끌 수 있다고 보여준다. [14:34]
  • 모든 작업을 유료 API에 보내는 구성에서 벗어나, 읽기·선택·필드 채우기를 사용자 기기의 작은 모델에 맡기는 방향을 제안한다. 독점 구조화 데이터 3,600억 토큰으로 학습했다는 설명도 덧붙인다. [15:16]
  • 반복되는 작은 판단을 안정적으로 처리하는 것이 중요하며, 작업에 맞는 크기의 모델을 쓰고 비싼 모델은 필요한 경우에 호출해야 한다고 정리한다. [15:43]

10. 후반 홍보와 최종 메시지

  • 코칭, 튜토리얼, 지역 커뮤니티, 로컬 모델 교육 등 발표자의 유료 프로그램을 다시 홍보한다. [16:26]
  • 마지막으로 약 35MB 크기, Raspberry Pi 실행, Apache 2.0에 따른 상업적 활용·수정·제품 배포 가능성을 강조하고 설치 접근성이 높아졌다는 메시지로 마무리한다. [16:44]

🧾 결론

  • 이 영상의 핵심은 범용 지능의 대체가 아니라 작업별 모델 선택이다. 조회·추출·도구 선택처럼 범위가 좁은 업무가 우선 적용 대상으로 제시된다.
  • 구조화된 출력은 응답에서 JSON을 찾아내는 후처리 부담을 줄일 수 있다. 그러나 출력 형식의 유효성과 실행 내용의 정확성은 별도로 검증해야 한다.
  • 작은 모델의 효과는 업무 데이터와 실행 설계에 달려 있다. 미세조정뿐 아니라 상태 관리와 스키마 설계도 결과를 좌우한다.

📈 투자·시사 포인트

  • 단순 작업이 로컬 모델로 이동하면 호출마다 비용을 지불하던 자동화의 비용 구성이 달라질 수 있다. 다만 영상의 ‘무료 실행’ 표현만으로 통합·운영 비용까지 없어진다고 볼 수는 없다.
  • 휴대전화·시계·브라우저 등에서 실행하는 접근은 서버 연결 없이 작동하는 제품 설계 가능성을 넓힌다. 지원 플랫폼과 실제 기기별 성능은 구분해서 살펴야 한다.
  • 경쟁력의 평가 기준으로 모델 크기뿐 아니라 반복 업무의 정확도, 지연, 실패 처리, 큰 모델 호출 비율이 중요해진다는 시사점을 준다.
  • 영상은 특정 기업의 매출이나 수익성을 검증하지 않는다. 소개된 기술적 방향을 곧바로 투자 수익 전망으로 연결할 근거는 부족하다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 속도·크기·비교 성능은 영상이 전달하는 주장이다. 66ms, 두 호출 97ms 미만, Raspberry Pi 처리량에는 재현에 필요한 하드웨어·입력·측정 조건이 충분히 포함되지 않는다.
  • 모델 크기는 36MB, 엔진 포함 약 35MB, 깊이에 따른 다른 크기로 설명된다. 전사에 ‘8 and 29 MGB’ 같은 불명확한 표현도 있어 파일 구성과 단위를 확인해야 한다.
  • ‘형식이 깨지지 않는다’는 설명과 별개로, 후반에는 상태를 초기화하지 않았을 때 존재하지 않는 도구 호출이 나왔다는 사례가 등장한다. 출력 제약이 의미적 오류까지 막는다는 해석은 피해야 한다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 반복 업무 하나를 골라 입력, 출력 스키마, 허용 도구, 성공 기준을 명시한다.
  • 정상 요청뿐 아니라 지원하지 않는 요청, 누락된 인자, 장황한 입력을 포함한 평가 사례를 만든다.
  • 독립 요청 사이 상태 초기화를 적용하고, 초기화 관련 엔진 수정이 사용 버전에 포함됐는지 확인한다.
  • 인자별로 적절한 기본값과 정보 부족 시 보류 조건을 정하고, 임의 추정이 실행으로 이어지지 않는지 점검한다.

❓ 열린 질문

  • 한국어와 실제 업무의 장황한 입력에서도 소개된 추출·도구 호출 성능이 유지되는가?
  • 순수 분류, 정보 추출, 복합 요청 중 어떤 조건에서 Jev·Needle 3·대형 모델을 각각 선택해야 하는가?
  • 미세조정 후 정확도 향상이 학습에 없던 요청과 도구에도 유지되는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.