YouTubeTonbi''s AI Garage·2026년 9월 28일·0

Laya: Fine-tuning the Open Jev-style Decision Model on Skill Routing

Quick Summary

Laya는 실제 에이전트 기록으로 파인튜닝하면 스킬 라우팅의 상위 3개 후보 적중률을 높일 수 있지만, 최종 실험에서도 Jev에 못 미쳤고 상위 10개 후보 성능은 오히려 하락했다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

Laya: Fine-tuning the Open Jev-style Decision Model on Skill Routing 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Laya: Fine-tuning the Open Jev-style Decision Model on Skill Routing의 핵심 내용을 4단계로 요약한 인포그래픽
Laya: Fine-tuning the Open Jev-style Decision Model on Skill Routing 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Laya는 실제 에이전트 기록으로 파인튜닝하면 스킬 라우팅의 상위 3개 후보 적중률을 높일 수 있지만, 최종 실험에서도 Jev에 못 미쳤고 상위 10개 후보 성능은 오히려 하락했다.

📌 핵심 요점

  1. 실험의 출발점은 122개 스킬 중 필요한 것을 고르는 작업을 작은 의사결정 모델에 맡기는 것이다. 후보를 3~10개로 좁혀 주 모델의 선택 부담을 줄이는 방식을 제안한다.
  2. 제목의 Laya는 영상에서 개방형 가중치를 가진 Jev 방식 모델로 소개된다. 질문·상태·선택지를 입력받아 자유로운 문장 대신 선택지별 점수와 확률을 출력하며, 로컬 실행과 작업별 파인튜닝이 핵심 특징이다.
  3. 실제 Hermes 에이전트의 Telegram 대화 364개 메시지와 스킬 로딩 기록을 사용했다. 소규모 학습에서는 8월의 221개 메시지로 학습하고, 9월의 143개 메시지로 평가했다. 평가 기준은 에이전트가 실제로 불러온 스킬이다.
  4. 소규모 파인튜닝 결과 설명에서 Laya의 Top-1은 18%→35%, Top-3는 41%→56%로 개선됐고 Top-10은 79%에 도달했다. 도입부와 앞선 비교에서는 다른 기준값도 제시되므로 모든 수치를 동일한 평가 조건으로 연결하면 안 된다.
  5. 학습을 12,144개 질문 규모로 확대하고 300개를 신뢰도 보정용으로 따로 두자, Top-1은 44%, Top-3는 71%까지 상승했다. 최종 비교에서 Jev의 Top-3는 79%였으며, Laya의 Top-10 성능은 이전보다 낮아지고 처리 속도도 느려졌다고 설명한다.

🧩 배경과 문제 정의

발표자의 에이전트 환경에는 122개 스킬이 있고, 기존에는 고성능 모델이 필요한 스킬을 직접 골랐다. 영상은 이 선택 작업을 작은 의사결정 모델로 처리하거나, 우선 후보 목록을 줄여 주 모델에 넘길 수 있는지 실험한다.

비교 대상은 Jev와 제목에서 Laya로 명명한 개방형 가중치 모델이다. Laya는 질문·현재 상태·선택지를 함께 읽고 선택지별 점수를 내는 모델로 소개된다. 발표자는 기본 상태의 성능뿐 아니라 실제 Hermes 운영 기록으로 파인튜닝했을 때의 변화를 확인한다. 핵심 평가 대상은 에이전트가 실제로 로딩한 스킬이 추천 목록에 들어가는지이며, 최종 작업의 성공 여부까지 측정한 실험은 아니다.

🕒 시간순 섹션별 상세정리

1. 122개 스킬 선택을 작은 모델에 맡기는 발상

  • 고성능 모델이 직접 수행하던 스킬 선택을 Jev 같은 의사결정 모델에 맡기거나, 선택 후보를 먼저 추리는 용도로 활용하자는 문제를 제기한다. [00:29]
  • 실제 세션의 스킬 로딩 기록으로 처음 시험했을 때 Top-3에 로딩된 스킬이 포함된 비율을 Jev 69%, Laya 28%로 소개하고, 작업별 파인튜닝을 예고한다. [01:07]

2. 공개 모델 탐색과 Agent Wiki 소개

  • Jev 방식의 공개 대안 가운데 관심을 받은 모델의 구조를 살펴보고, 기본 성능을 Jev와 비교하겠다고 보여준다. 전사에서는 모델명이 여러 형태로 나타난다. [01:56]
  • Agent Wiki의 무료 지식 자료와 유료 맞춤 스킬을 홍보한다. 영상에서 Pro는 월 9.99달러이며 향후 기능 출시와 가격 인상 계획이 있다고 안내한 뒤 본론으로 복귀한다. [02:40]

3. 모델 공개 경로와 의사결정 출력

  • Hugging Face·GitHub의 공개 모델과 커뮤니티 변형을 보여준다. 브라우저 에이전트용 변형도 언급하지만, 개발사와 모델 이름의 전사 표기는 일관되지 않다. [03:26]
  • 중복 청구와 해지 요청 사례로 담당 부서 선택, 긴급도 점수, 이탈 의사에 대한 예·아니오 판단을 보여 준다. [04:16]
  • 자유로운 텍스트를 생성하지 않아 별도 문장 파싱이 필요 없으며, 로컬 실행에서는 입력이 장치 밖으로 나가지 않는다고 보여준다. [04:32]

4. 입력 구성과 선택지 수의 제약

  • 질문·상태·선택지를 하나의 입력으로 구성하고 각 선택지 표식에서 점수를 읽어 확률로 변환하는 구조를 보여준다. [05:21]
  • Laya에서는 선택지가 192~256토큰의 공간을 공유해 약 20개 이후 간섭이 생긴다고 주장하며, Jev는 255개를 처리한다고 비교한다. 이는 뒤의 122개 스킬 평가 방식과 함께 확인해야 할 설명이다. [05:40]
  • 영어용 1억 2,100만 매개변수, 다국어용 3억 2,200만 매개변수와 파인튜닝 모델을 소개하며 작은 로컬 모델이라는 점을 강조한다. [06:13]

5. 마스크 기반 점수화와 작업별 학습

  • 각 선택지 앞에 마스크를 두고, 28개 기반 층에 두 개의 의사결정 층을 더하는 구조로 보여준다. 국소 범위를 보는 층과 전체 입력을 보는 층이 섞여 있다고 드러낸다. [06:57]
  • 선택지끼리 비교할 수 있어 입력 순서가 영향을 줄 수 있으며, 마스크 위치에서 읽은 점수를 온도 보정된 소프트맥스로 확률화한다고 보여준다. [07:22]
  • Laya를 범용 제로샷 판단기보다 빠르게 맞춤화할 수 있는 기반으로 규정한다. 소개된 0.36→0.77 수치는 뒤의 실제 스킬 라우팅 결과와 구분해서 읽어야 한다. [08:22]

6. 일반 비교의 한계와 실제 평가 설계

  • 공개 비교 수치는 미확인이라고 밝히면서 정확도·보정·속도·호출 비용을 논한다. 선택지가 많은 작업에서는 Jev가 유리하고, 로컬 모델에는 실행 위치와 학습 가능성의 이점이 있다고 보여준다. [09:17]
  • Hermes의 Telegram 대화 364개 메시지와 122개 스킬을 사용한다. 메시지마다 각 스킬을 불러야 하는지 평가하고, 실제 로딩 기록을 기준으로 삼는다. [10:17]
  • 이 실험에서 Jev API는 약 0.25초, Laya 로컬 실행은 약 0.5초로 묶인다. 스킬 선택을 저렴하고 빠르게 분리한다는 구상은 아직 실용성을 확인하는 단계라고 드러낸다. [10:39]

7. 기본 모델 비교와 후보 축소 전략

  • 중간 비교에서 Jev의 Top-3는 73%, Top-10은 84%로 드러난다. AUROC와 일부 작은 표본 결과도 설명하지만 수치별 평가 조건은 전사만으로 완전히 구분하기 어렵다. [11:14]
  • 미조정 Laya는 Top-3 33%, Top-10 55%로 묶인다. 무작위보다 낫지만 특정 선택지를 반복해서 선호하는 문제가 관찰됐다. [12:07]
  • 발표자는 모델이 스킬을 최종 확정하기보다 122개를 3~10개로 좁히고, 주 모델이 그 안에서 선택하는 방식을 제안한다. [12:22]

8. 소규모 파인튜닝의 개선과 남은 문제

  • 8월의 221개 메시지로 학습하고 보지 않은 9월의 143개 메시지로 평가한다. 발표자는 분리 평가를 강조하지만 표본은 작다고 인정한다. [12:26]
  • 해당 결과 설명에서 Laya의 Top-1은 18%→35%, Top-3는 41%→56%, Top-10은 79%로 개선된다. 순위 판별 지표도 약 0.88로 드러난다. [13:23]
  • 필요 없는 스킬을 다수 추천하던 경향은 줄었지만, 스킬을 전혀 불러오지 않아야 하는 경우는 여전히 어렵다. Jev가 더 나은 즉시 사용 라우터이며, 파인튜닝 Laya는 로컬 후보 축소 수단으로 압축된다. [14:05]

9. 여러 세션으로 학습을 확대한 결과

  • 같은 에이전트의 여러 세션으로 학습 범위를 넓힌다. 12,144개 학습 질문을 언급하고 300개는 신뢰도 보정용으로 따로 두며, 기존 9월 평가 세트를 다시 사용한다. [14:53]
  • 확대 학습 후 Laya의 Top-1은 35%→44%, Top-3는 56%→71%로 상승한다. 이 최종 비교에서 Jev의 Top-3는 79%로 드러난다. [15:29]
  • Top-10은 오히려 하락했고 처리 속도도 느려졌다고 드러낸다. 더 긴 학습 행을 속도 저하의 가능한 이유로 언급하지만 확인된 원인으로 제시하지는 않는다. [15:55]

10. 실험의 평가와 후속 활용 제안

  • 상위 후보의 개선을 긍정적으로 평가하면서도 Jev의 정확한 학습 방식은 모른다고 드러낸다. DGX Spark에서 약 한 시간 넘게 진행한 학습을 언급하지만 비용 비교를 뒷받침할 상세 내역은 제시하지 않는다. [16:21]
  • 특정 에이전트의 스킬 선택 기록에 맞춘 실험을 마무리하고, 시청자에게 사용 경험과 후속 실험 아이디어를 요청한다. 작은 의사결정 모델의 다른 활용도 계속 탐색하겠다고 드러낸다. [16:52]

🧾 결론

  • Laya의 강점은 바로 쓰는 범용 라우터 성능보다 실제 사용 기록에 맞춰 개선할 수 있다는 데 있다. 이번 실험에서는 데이터 확대가 특히 상위 후보의 품질을 높였다.
  • 영상이 제안하는 활용은 주 모델에 전달할 스킬 후보 목록을 줄이는 것이다. 후보에서 필요한 스킬이 빠질 수 있으므로, 이 결과만으로 선택 과정을 완전히 맡길 근거는 부족하다.
  • 최종 실험에서도 Jev가 더 좋은 즉시 사용 성능을 보였다. Laya는 로컬 실행과 학습 가능성을 원하는 경우 검토할 수 있는 대안으로 제시된다.
  • Top-3 개선과 Top-10 하락이 동시에 나타났다. 실제로 몇 개의 후보를 넘길지에 따라 유용한 모델과 학습 설정이 달라질 수 있다.

📈 투자·시사 포인트

  • 에이전트의 모든 판단에 대형 모델을 사용하는 대신, 반복적인 스킬 분류를 작은 모델로 분리하는 설계 가능성을 보여 준다. 다만 이번 영상은 전체 비용 절감이나 작업 성공률 개선까지 검증하지 않았다.
  • 실제 스킬 로딩 기록이 모델을 작업에 맞추는 학습 자원으로 쓰였다. 에이전트 운영 기록의 수집·정리·평가 체계가 모델 도입만큼 중요한 과제가 된다.
  • 로컬 실행은 데이터가 장치 밖으로 나가지 않는 방식으로 소개되지만, 속도 우위는 자동으로 따라오지 않았다. 해당 스킬 실험에서는 Jev API가 약 0.25초, Laya 로컬 실행이 약 0.5초로 설명됐다.
  • 개방형 가중치는 호출료 외에 학습·장비·운영 부담까지 함께 비교해야 의미가 있다. 영상에는 특정 기업의 투자 가치나 수익성을 판단할 재무 근거는 제시되지 않는다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 모델명이 제목에서는 Laya지만 전사에는 Liya·Lya·Lyra·LLaMA 등으로 섞여 나온다. Jev 역시 여러 표기로 등장한다. 이 노트는 제목의 이름을 기준으로 정리했으며, 정확한 모델·개발사·체크포인트는 원문 저장소 확인이 필요하다.
  • Top-3 수치가 도입부에서는 Jev 69%·Laya 28%, 중간 비교에서는 73%·33%, 소규모 학습 비교에서는 Laya 41%→56%, 최종 비교에서는 Jev 79%·Laya 71%로 제시된다. 평가 표본과 집계 조건의 차이가 충분히 설명되지 않는다.
  • 영상은 선택지 공간 때문에 약 20개를 넘기기 어렵다고 설명하면서, 실험에서는 122개 스킬을 한 번에 평가한다고 말한다. 다중 선택과 스킬별 이진 판단을 어떻게 구현·배치했는지는 전사만으로 확정할 수 없다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 제목에 해당하는 모델 저장소와 모델 카드를 확인해 이름·라이선스·체크포인트·선택지 제한을 확정한다.
  • 각 비교의 평가 메시지, 스킬 수, 무스킬 메시지 처리 방식과 Top-k 집계 정의를 표로 맞춘다.
  • 학습·보정·평가 데이터를 세션과 시간 기준으로 분리하고, 확대 학습 데이터에 평가 메시지나 유사한 대화가 포함됐는지 점검한다.
  • Top-1·Top-3·Top-10 외에 스킬이 필요 없는 메시지의 오추천과 실제 작업 성공률을 측정한다.

❓ 열린 질문

  • 학습 데이터를 늘렸을 때 상위 3개 후보는 좋아졌는데 상위 10개 후보는 왜 나빠졌으며, 후보 개수별로 어떤 학습 설정이 적절할까?
  • 같은 에이전트의 기록에서 얻은 개선이 다른 사용자·세션·스킬 목록에도 유지될까?
  • 스킬이 필요 없는 메시지를 먼저 걸러 내는 판단을 추가하면 불필요한 스킬 로딩을 얼마나 줄일 수 있을까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.