YouTubeTonbi''s AI Garage·2026년 10월 7일·0

My Fine-Tuned Open Laya Beat Jev at Agent Tool-Calling

Quick Summary

실제 에이전트 기록으로 파인튜닝한 공개 모델 Laya는 응답 전체의 도구 사용을 예측하는 실험에서 Jev를 앞섰으며, 새로운 프로필의 데이터에서도 우위를 보였다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

My Fine-Tuned Open Laya Beat Jev at Agent Tool-Calling 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

My Fine-Tuned Open Laya Beat Jev at Agent Tool-Calling의 핵심 내용을 4단계로 요약한 인포그래픽
My Fine-Tuned Open Laya Beat Jev at Agent Tool-Calling 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

실제 에이전트 기록으로 파인튜닝한 공개 모델 Laya는 응답 전체의 도구 사용을 예측하는 실험에서 Jev를 앞섰으며, 새로운 프로필의 데이터에서도 우위를 보였다.

📌 핵심 요점

  1. 작은 의사결정 모델의 성능은 과제에 따라 달랐다. 이전 스킬 선택 실험에서는 상위 3개 적중률이 Jev 79%, Laya 제로샷 41%, 파인튜닝 Laya 71%였다.
  2. 승인 여부 예측은 거절 사례가 부족해 학습에 적합하지 않았다. 할 일 목록 생성 여부 예측은 파인튜닝 후 점수가 0.60에서 0.72로 개선됐지만 Jev의 0.74에는 미치지 못했다.
  3. 도구 선택 실험의 전환점은 평가 대상의 수정이었다. 첫 번째 호출 도구만 맞히던 평가를 응답 전체에서 사용한 도구를 예측하는 평가로 바꾸면서 실제 사용 패턴을 더 충실하게 반영했다.
  4. 실제 사용 기록과 어려운 음성 사례를 활용해 학습한 Laya는 홀드아웃 평가에서 상위 1개·3개·10개 적중률 76%·89%·96%를 기록했다. 같은 평가에서 Jev는 36%·65%·91%였다.
  5. 새로운 43개 세션에서도 Laya의 상위 1개 적중률은 72%로 Jev의 40%를 앞섰다. 다만 도구가 필요 없는 상황을 제대로 판별하지 못하는 과도한 선택 성향이 남았다.

🧩 배경과 문제 정의

발표자는 큰 프런티어 모델이 담당하는 에이전트 의사결정 일부를 작은 모델로 처리할 수 있는지 탐색한다. 이전 영상에서는 실제 Hermes Agent 세션을 바탕으로 스킬 선택을 비교했고, 이번에는 승인 여부, 할 일 목록 생성 여부, 도구 선택으로 실험을 확장했다.

핵심 과제는 사용자 요청과 에이전트 상태를 보고 어떤 도구가 사용될지 예측하는 것이다. 초기에는 첫 번째 호출 도구만 평가했지만, 이후 응답 전체에서 사용되는 도구를 대상으로 수정했다. 이는 도구 호출의 인자 생성이나 작업 완수 능력 전체를 검증하는 실험과는 범위가 다르다.

🕒 시간순 섹션별 상세정리

1. 이전 스킬 선택 실험과 이번 비교의 출발점

  • 실제 Hermes Agent 세션에서 기존 에이전트가 선택한 스킬을 기준으로 작은 의사결정 모델의 예측을 비교했다. 기존 에이전트에는 GPT, Grok, Claude 같은 프런티어 모델이 사용됐다고 보여준다. [01:03]
  • 스킬 선택의 상위 3개 적중률은 Jev 79%, 제로샷 Laya 41%, 파인튜닝 Laya 71%였다. 학습하지 않은 데이터에서 개선을 확인했지만 당시에는 Jev를 넘지 못했다. [01:38]

2. 승인과 도구 선택으로 실험 확장

  • 작은 모델을 에이전트 작업과 자동화에 활용하기 위해 자동 승인 판단과 도구 선택을 후속 과제로 제안한다. [02:29]
  • AgentWikis의 무료 위키와 월 19.99달러 Pro 서비스를 소개하고, 이번 실험에서 개발한 Laya 파인튜닝 스킬을 Pro에서 제공한다고 안내한다. [03:25]

3. Laya의 선택 구조와 실제 세션 예시

  • Laya는 Hugging Face에서 구할 수 있는 공개 모델로 묶인다. 상태와 선택지를 입력하면 선택지의 순위를 매기는 구조이며, 발표자는 유효한 활용을 위해 데이터 기반 파인튜닝이 필요하다고 보여준다. [04:21]
  • 수개월간의 Hermes Agent 기록을 사용했다. 로컬 모델을 끄라는 요청에서 Jev는 terminal, Laya는 Hermes profiles를 골랐고, 실제 에이전트는 terminal을 사용해 이 사례에서는 Jev가 일치했다. [05:04]

4. 승인 판단의 데이터 부족과 할 일 목록 실험

  • 승인 판단은 실제 기록에 거절된 명령이 거의 없어 학습 신호가 부족했다. 합성 데이터도 시도했지만 기대한 결과를 얻지 못했다. [05:31]
  • 할 일 목록 생성 여부의 점수는 Jev 0.74, 제로샷 Laya 0.60, 파인튜닝 Laya 0.72로 드러난다. 개선은 있었으나 Jev에는 미치지 못했다. [05:59]
  • 발표자는 스킬 122개보다 선택지가 적은 도구 38개를 대상으로 다음 실험을 진행한다. [06:12]

5. 첫 호출만 평가한 초기 실험의 한계

  • 첫 번째 호출 도구를 평가했을 때 Jev의 상위 1개·3개 적중률은 27%·45%, 제로샷 Laya는 4%·13%였다. Laya는 요청과 무관하게 일부 도구를 반복 선택했고, 문서상 20개를 넘는 선택지에서 품질이 떨어진다는 경고도 나온다. [07:08]
  • 평가가 응답 전체의 도구 사용을 놓쳤다는 문제가 드러났다. vision analyze는 실제 호출 368회 중 첫 번째 호출이 12회뿐이어서 첫 호출 중심 평가로는 사용 패턴을 충분히 반영하지 못했다. [07:41]
  • 평가 질문을 응답 중 어느 시점에서든 해당 도구를 사용했는지로 바꿨다. 이전 스킬 선택 실험도 처음 로드한 스킬만이 아니라 전체 과정의 로드 여부를 봤다는 점을 확인한다. [08:07]

6. 수정한 평가와 학습 데이터 구성

  • 수정된 평가에서 Jev의 상위 1개·3개·10개 적중률은 36%·65%·91%, 제로샷 Laya는 7%·19%·55%였다. 평가 변경만으로 두 모델의 점수가 모두 개선됐다. [08:39]
  • 영상 제작용 두 번째 Hermes 프로필에서 메시지 490개를 추가하고, 실제 양성 사례를 균형 조정에 활용했다. 제로샷 모델의 주요 오답을 어려운 음성 사례로 사용하고 무작위 음성 사례도 더했다. [09:26]
  • 각 메시지를 최대 37개의 개별 예·아니요 질문으로 구성해 초기 시도보다 학습 행이 약 17배 늘었다. 학습은 4에포크였으며 에포크당 거의 한 시간이 걸렸다고 보여준다. [09:50]

7. 홀드아웃 평가에서 Jev를 앞선 Laya

  • 같은 프로필에서 학습에 사용하지 않은 데이터로 평가한 Laya는 상위 1개·3개·10개 적중률 76%·89%·96%를 기록했다. [10:17]
  • 영상에서 AROC로 소개한 지표는 Laya가 0.57에서 0.90으로 개선됐고 Jev는 0.77이었다. 발표자는 파인튜닝으로 Jev를 앞섰다고 정리한다. [10:30]
  • 도구 빈도별 점수도 자주 쓰는 도구 0.83, 중간 빈도 도구 0.86, 희소 도구 0.79로 드러난다. 발표자는 여러 빈도 구간의 개선을 단순한 빈도 암기 이상의 학습 근거로 해석한다. [11:15]

8. 성공 조건과 적용 범위 정리

  • 승인 판단은 데이터 신호가 부족했고, 할 일 목록 판단은 개선됐지만 Jev와의 격차를 없애지 못했다. 가장 큰 성과는 응답 전체의 도구 사용을 대상으로 한 도구 선택 실험이었다. [11:54]
  • 발표자는 평가 질문의 범위가 데이터만큼 중요하다고 강조한다. 승인 사례에서는 약 2,000개 명령 중 거절이 한 번뿐이었다며 모든 의사결정이 현재 데이터로 검증 가능한 것은 아니라고 보여준다. [12:33]

9. 새로운 프로필 검증과 공개 계획

  • 학습에 사용한 세션과 별개의 43개 새 세션으로 다시 평가했다. 여러 프로필과 모델이 섞인 데이터에서 Jev는 상위 1개 40%, 상위 10개 88%, 영상의 AOROC 지표 0.73을 기록했다. [13:48]
  • 파인튜닝 Laya는 상위 1개·3개·10개 적중률 72%·80%·92%, AOROC 0.91로 다시 우위를 보였다. 다만 도구가 필요 없는 상황은 제대로 판별하지 못했고, 이 부분에서는 Jev가 더 나았다고 보여준다. [14:24]
  • 발표자는 추가 실험 후 Hermes Agent용 파인튜닝 모델 공개를 검토하며 학습용 스킬은 AgentWikis Pro에서 제공한다고 안내한다. 마지막에는 시청자의 작은 공개 의사결정 모델 활용 경험을 요청하며 영상을 마친다. [15:32]

🧾 결론

  • 이 실험에서는 파인튜닝이 Laya와 Jev의 격차를 줄이는 수준을 넘어 도구 사용 예측 성능의 역전을 만들었다.
  • 데이터 확보만큼 평가 질문의 정의가 중요했다. 첫 호출만 보는 방식은 뒤이어 사용되는 도구의 학습 신호를 상당 부분 놓쳤다.
  • 자주 쓰는 도구뿐 아니라 중간 빈도·희소 도구에서도 점수가 개선됐다. 발표자는 이를 사용 빈도만 외운 결과가 아니라는 근거로 해석했다.
  • 새로운 프로필에서도 우위가 관찰됐지만, 도구 미사용 판단과 실제 에이전트 운영 효과는 추가 검증이 필요하다.

📈 투자·시사 포인트

  • 에이전트의 도구 선택을 작은 전문 모델에 맡기는 구조는 검토할 만한 가능성을 보여준다. 다만 영상은 비용·지연시간 절감 효과를 수치로 입증하지 않는다.
  • 실제 에이전트 사용 기록, 적절한 정답 정의, 어려운 음성 사례 구성이 전문 의사결정 모델의 성능을 좌우할 수 있다.
  • 도구 선택과 승인 판단은 데이터 조건이 다르다. 한 과제의 성공을 다른 의사결정 기능 전체로 확대해 해석하기 어렵다.
  • 공개 기반 모델의 존재와 파인튜닝 결과물의 공개 여부는 구분해야 한다. 발표자는 추가 실험 후 모델 공개를 검토하고, 학습용 스킬은 AgentWikis Pro에서 제공한다고 설명했다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 영상에서 지표 이름이 AROC와 AOROC로 전사된다. 정확한 지표 명칭과 계산 방식은 원본 화면이나 실험 자료에서 확인해야 한다.
  • 학습 데이터의 총 행 수와 새 데이터 평가에서 Jev의 상위 3개 수치는 전사가 불명확하다. 해당 숫자를 확정해 인용하기 어렵다.
  • Laya는 새 데이터에서 도구가 필요 없는 경우를 제대로 맞히지 못했다. 높은 순위 적중률만으로 실제 실행의 적절성까지 판단할 수 없다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 원본 평가 화면에서 지표 명칭, 학습 행 수, Jev의 새 데이터 상위 3개 적중률을 확인한다.
  • 자신의 에이전트 기록에서 응답 전체의 도구 사용을 정답으로 정의하고, 도구 미사용 사례도 별도로 확보한다.
  • 학습 데이터와 평가 데이터를 세션·프로필 기준으로 구분하고 중복 여부를 점검한다.
  • 제로샷 Laya, 파인튜닝 Laya, Jev를 같은 조건에서 비교하고 상위 순위 적중률과 도구 미사용 판단을 함께 기록한다.

❓ 열린 질문

  • 도구 미사용 사례와 판단 기준을 보강하면 Laya의 과도한 선택 성향을 줄이면서 현재 적중률을 유지할 수 있을까?
  • 도구 설명이나 도구 목록이 달라져도 이번에 관찰된 성능 우위가 유지될까?
  • 기존 에이전트의 선택을 예측하는 성능이 실제 작업 성공률과 운영 효율 개선으로 이어질까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.