Articleresearch.google·2026년 9월 10일·0

ToolGrad: Efficient tool-use dataset generation with textual \"gradients\

Quick Summary

ToolGrad는 검증된 도구 사용 체인을 먼저 만들고 사용자 질의를 생성하는 프레임워크로, 데이터 생성 비용을 낮추고 Gemma 3의 도구 사용 성능을 높였다.

ToolGrad: Efficient tool-use dataset generation with textual \"gradients\ 관련 대표 이미지

🖼️ 인포그래픽

ToolGrad: Efficient tool-use dataset generation with textual \"gradients\ 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

ToolGrad: Efficient tool-use dataset generation with textual \"gradients\의 핵심 내용을 4단계로 요약한 인포그래픽
ToolGrad: Efficient tool-use dataset generation with textual \"gradients\ 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

ToolGrad는 검증된 도구 사용 체인을 먼저 만들고 사용자 질의를 생성하는 프레임워크로, 데이터 생성 비용을 낮추고 Gemma-3의 도구 사용 성능을 높였다.

📌 핵심 요약

  • ACL 2026에서 발표된 ToolGrad는 사용자 질의를 먼저 생성하고 깊이 우선 탐색(DFS)으로 해법을 찾는 기존 방식과 달리, 도구 사용 체인을 먼저 생성한 뒤 대응하는 질의를 작성한다.
  • ToolGrad는 텍스트 형태의 피드백인 ‘텍스트 그래디언트’를 활용하며, API Proposer, API Executors, API Selector, LLM Updater가 제안·실행·선택·갱신을 반복해 검증된 API 워크플로를 구성한다.
  • 16k+ 실제 API를 포함한 ToolBench 기반 실험에서 ToolGrad는 기존 질의 우선 방식보다 낮은 비용으로 더 복잡한 도구 사용 데이터를 생성했다. 도표 설명에 제시된 생성 통과율은 99.8%다.
  • gemini-2.5-flash-lite로 생성한 ToolGrad-500으로 Gemma-3의 1B·4B·12B 모델을 미세 조정하자 모든 시험 규모에서 도구 사용 성능이 개선됐다. 평가는 ToolBench와 다른 도구 집합을 사용하는 Berkeley Function Calling Leaderboard(BFCL)에서 수행됐다.
  • ToolGrad-12B의 BFCL 점수는 83.1로, 발표 시점의 gemini-2.5-pro 83.2에 근접하고 claude-4.5 Opus 82.8과 gpt-5 74.4를 웃돌았다. 데이터 생성 교사 모델과 ToolACE 등 공개 도구 사용 특화 모델도 능가했으며, 동적 API 생태계 확장과 개인화를 위한 지속 학습은 향후 연구로 제시됐다.

🧩 주요 포인트

  1. 질의에서 해법을 탐색하던 순서를 도구 사용 체인에서 질의를 작성하는 순서로 전환 → 주석 생성의 모호성과 탐색 부담을 줄임.
  2. API 실행 보고서에 근거한 반복 선택과 99.8% 생성 통과율 → 복잡하고 검증된 학습 데이터를 더 낮은 비용으로 확보할 가능성을 제시.
  3. ToolGrad-500 학습 모델의 BFCL 성능 개선과 교사 모델 추월 → 보지 못한 도구로의 일반화와 소규모 데이터 기반 성능 향상을 뒷받침하되, 동적 API 생태계와 지속 학습으로의 확장은 미검증 과제로 남음.

🧠 상세 정리

1. 도구 사용 학습 데이터의 확장 문제

AI 에이전트가 Google Search를 수행하거나 로컬 파일을 읽고 생성된 Python 스크립트를 실행하려면, LLM이 도구를 정확하고 효율적으로 사용하는 방법을 배워야 한다. 이를 위한 학습 데이터에는 도구 사용 체인과 이에 대응하는 사용자 질의가 함께 필요하다. 연구진은 앞선 InstructPipe 연구에서 평가 데이터를 수작업으로 주석 처리했지만, 고도화된 LLM 미세 조정에 필요한 규모로 이 방식을 확대하기는 어렵다고 설명한다. ToolBench와 ToolACE 등의 기존 접근은 표본 API 집합에서 가상의 사용자 지시를 만든 뒤, 깊이 우선 탐색(DFS) 에이전트가 시행착오로 해법을 찾는다. 저자들은 복잡한 탐색 과정에서 유용한 실행 경로를 추출해야 하는 구조가 데이터 생성의 비효율을 초래한다고 지적한다.

2. 해답을 먼저 만드는 생성 순서의 전환

ACL 2026에서 발표된 ToolGrad는 정답에 해당하는 도구 사용 체인을 먼저 생성하고, 그 체인에 맞는 사용자 프롬프트를 나중에 작성하는 대안을 제시한다. 핵심 논리는 명시적인 도구 사용 해법이 사용자 프롬프트보다 모호하지 않은 정보를 제공한다는 것이다. 따라서 이미 구성된 도구 사용 체인을 질의로 표현하는 주석 작업은 더 쉬우며, 연구진은 이 변환에 LLM 한 단계만 필요하다고 설명한다. 이는 전체 워크플로 생성이 한 단계로 끝난다는 뜻이 아니라, 해법에서 질의로 변환하는 작업에 관한 설명이다. 연구 결과에 따르면 이러한 해답 우선 접근은 더 긴 단계의 복잡한 데이터를 낮은 비용으로 생성하며, 해당 데이터로 학습한 모델은 기존 방식의 데이터로 학습한 모델보다 높은 성능을 보였다.

3. 텍스트 그래디언트와 네 가지 구성 요소

일반적인 머신러닝은 수치적인 손실 그래디언트로 모델 가중치를 갱신하지만, TextGrad는 LLM 비평자가 제공하는 자연어 피드백으로 프롬프트를 개선한다. ToolGrad는 이 ‘텍스트 그래디언트’ 개념을 합성 데이터 생성으로 확장해, 대규모 도구 라이브러리에서 유효한 API 워크플로를 반복적으로 구성한다. API Proposer는 표본으로 뽑은 API 중 현재 워크플로를 확장할 유망한 후보를 추린다. API Executors는 후보들을 병렬 실행하고 상세한 실행 보고서를 생성한다. API Selector는 보고서를 검토해 가장 잘 수행된 API 호출 하나를 선택하고 워크플로에 추가하며, 이 선택이 개선 방향을 제공하는 텍스트 그래디언트 역할을 한다. LLM Updater는 변경된 API 구성에 맞춰 합성 사용자 질의와 AI 응답을 수정하고, 반복 결과로 사용자 질의·검증된 API 워크플로·최종 AI 응답이 포함된 표본을 완성한다.

4. 데이터 생성 효율과 통과율

연구진은 데이터 생성 비용과 품질을 평가하기 위해 16k+ 실제 API를 포함하는 ToolBench를 API 데이터베이스로 사용했다. 비교 대상은 ToolBench의 기존 질의 우선·DFS 기반 생성 방식과 ToolGrad의 해답 우선 생성 방식이다. 결과는 ToolGrad가 더 높은 통과율과 더 낮은 생성 비용으로 더 복잡한 도구 사용 데이터를 만들 수 있음을 보여준다고 보고한다. 본문 결론은 생성 통과율을 거의 100%로 표현하며, 도표 설명에는 99.8%라는 수치와 더 적은 최적화 단계가 명시되어 있다. 제공된 본문에는 비용 절감의 정확한 금액이나 비율, 최적화 단계 수가 적혀 있지 않아 개선 폭을 추가로 수치화할 수는 없다. 이 실험은 성공한 체인을 먼저 확보하는 설계가 기존 탐색 방식의 비용과 확장성 병목을 줄일 수 있다는 주장의 근거다.

5. BFCL에서 확인한 성능과 교사 모델 추월

연구진은 ToolBench의 API를 바탕으로 소규모 데이터셋 ToolGrad-500을 생성하고, Gemma-3의 1B·4B·12B 모델을 미세 조정해 ToolGrad-1B·ToolGrad-4B·ToolGrad-12B를 만들었다. 평가는 ToolBench와 다른 도구 집합을 사용하는 Berkeley Function Calling Leaderboard(BFCL)에서 진행했으며, 모든 시험 규모에서 기본 모델 대비 성능이 개선됐다고 보고한다. ToolGrad-12B는 83.1점을 기록해 발표 시점의 gemini-2.5-pro 83.2에 근접했고, claude-4.5 Opus 82.8 및 gpt-5 74.4를 웃돌았다. 따라서 제시된 점수는 일부 주요 독점 모델을 능가하고 다른 모델과 경쟁할 수준임을 보여주지만, 모든 독점 모델보다 높다는 뜻은 아니다. ToolGrad-500을 생성한 gemini-2.5-flash-lite보다 이를 학습한 Gemma-3-12B의 성능이 높았다는 결과는 학생 모델이 교사 모델을 넘어설 수 있음을 보여준다. 또한 연구진은 ToolGrad-12B가 더 고도화된 API 데이터베이스로 미세 조정된 ToolACE를 포함한 공개 도구 사용 특화 모델보다 앞섰다고 설명한다.

6. 결론과 향후 확장 방향

ToolGrad의 결론은 해답 우선 생성과 텍스트 그래디언트를 이용한 반복적 API 연결이 고품질 도구 사용 데이터를 효율적이고 신뢰성 있게 만드는 데 기여한다는 것이다. 연구진은 거의 100%의 생성 통과율, 비교적 작은 모델의 높은 도구 사용 성능, 학생 모델의 교사 모델 추월을 주요 성과로 제시한다. 향후에는 더 동적이고 방대한 API 생태계를 처리하도록 프레임워크를 확장해 현실의 폭넓은 응용으로 연결할 계획이다. 시간에 따른 개인화를 위해 지속적이고 즉각적인 학습을 지원하도록 자기 발전 능력을 확장하는 방향도 탐색 대상으로 언급한다. 이러한 확장과 개인화는 이번 실험에서 달성한 결과가 아니라 향후 연구 방향이며, 저자들은 ToolGrad가 유능하면서도 경제적으로 확장 가능한 디지털 에이전트 학습의 기반이 될 수 있다고 전망한다.

🧾 핵심 주장 / 시사점

  • ToolGrad의 핵심은 질의에 맞는 해법을 찾는 탐색을 줄이고, 검증된 해법에서 질의를 도출하도록 데이터 생성 문제의 순서를 바꾼 데 있다.
  • ToolBench와 다른 도구 집합을 사용하는 BFCL에서의 개선은 학습 데이터에 쓰인 도구를 넘어서는 일반화의 근거지만, 동적 API 환경 전반의 성능까지 입증한 결과는 아니다.
  • ToolGrad-12B가 데이터 생성 교사 모델을 능가한 결과는 합성 데이터로 학습한 학생의 도구 사용 성능이 교사 성능에 반드시 제한되지는 않음을 보여준다.

✅ 액션 아이템

  • 도구 사용 데이터 생성에 ToolGrad의 해답 우선 방식을 적용할 가능성 검토.
  • ToolBench 기반 생성에서 비용·복잡도·99.8% 생성 통과율을 함께 고려해 효율성 평가.
  • ToolGrad-500의 BFCL 성과와 동적 API 생태계·지속 학습의 미검증 범위를 구분해 활용 범위 판단.

❓ 열린 질문

  • ToolGrad의 99.8% 생성 통과율과 비용상 이점은 더 복잡한 도구 사용 체인에서도 유지될까?
  • ToolGrad-500 학습 모델이 BFCL에서 보인 일반화 성능은 동적 API 생태계에서도 이어질까?
  • ToolGrad의 교사 모델 추월 성과를 개인화를 위한 지속 학습으로 확장할 수 있을까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.