Introducing LangSmith Fine-Tuning
Quick Summary
LangSmith Fine Tuning은 smithtune CLI로 에이전트 실행 궤적의 데이터 선별부터 Fireworks·Baseten 기반 SFT, 평가·배포까지 연결해 특화 모델 개발을 지원하는 Public Beta 기능이다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
LangSmith Fine-Tuning은 smithtune CLI로 에이전트 실행 궤적의 데이터 선별부터 Fireworks·Baseten 기반 SFT, 평가·배포까지 연결해 특화 모델 개발을 지원하는 Public Beta 기능이다.
📌 핵심 요약
- 2026년 9월 24일 공개된 LangSmith Fine-Tuning의 smithtune은 현재 지도 미세조정(SFT)을 지원하며, LangSmith 실행 궤적으로 데이터셋을 만들고 Fireworks 또는 Baseten에서 학습한 뒤 LangSmith에서 평가 결과를 분석하도록 연결한다.
- LangSmith 실행 궤적은 메시지·도구 호출·도구 결과의 순서와 각 턴의 실제 문맥을 보존한다. smithtune은 좋은 궤적 선별, 모델 시퀀스 길이 제한에 따른 필터링, 학습·검증·테스트 분할과 지속적으로 보관되는 데이터셋 생성을 지원한다.
- smithtune은 관리형 LoRA 학습으로 사용자 측 GPU 준비 부담을 없애고, 검증 손실이 가장 낮은 체크포인트를 선택한다. 이후 기본 모델과 미세조정 모델을 재생 평가로 비교하며, 결과에 따라 배포하거나 데이터·학습 설정을 수정해 반복한다.
- Engine의 축소된 에이전트로 수행한 내부 IssueBench 일부 평가에서 과제 점수는 GPT-5.6 Sol 87.0, Kimi K3 90.0, Kimi K3 + SFT 96.0이었다. OpenSWE Review에서는 Qwen-3.8-27B의 SFT 후 F1이 48.9%에서 53.7%로 상승하고 모델 호출은 29.8%, 도구 요청은 29.4% 감소했다.
- OpenSWE Review의 초기 덜 선별된 학습 데이터는 SFT 후 F1을 낮췄으며, 이후 궤적별 검토를 추가해 데이터 선별을 개선했다. 글은 하네스 엔지니어링을 먼저 시도하고 반복 오류와 올바른 수행 사례가 있을 때 SFT를 검토하도록 권하며, 시작에는 에이전트 추적 기록이 있는 LangSmith 계정, Fireworks 또는 Baseten API 키, smithtune CLI가 필요하다고 설명한다.
🧩 주요 포인트
- 턴별 문맥 보존과 좋은 궤적 선별 → 성공 행동을 당시의 도구·메시지 문맥과 연결해 SFT 학습 근거를 구성하며, 데이터 선택이 성능 개선의 핵심 변수로 작용한다.
- smithtune과 Fireworks·Baseten의 관리형 학습 연계 → 데이터 준비·학습·평가·배포를 연결하고 사용자 측 데이터 파이프라인 및 학습 인프라 구축 부담을 줄인다.
- Engine의 점수 개선과 OpenSWE Review의 호출 감소 → 특정 내부 평가에서는 전문화의 성능·효율 이점이 관찰됐지만, 초기 F1 하락 사례는 하네스 엔지니어링 이후에도 데이터 선별과 기본 모델 대비 평가가 필요함을 보여준다.
🧠 상세 정리
1. LangSmith Fine-Tuning의 공개와 지원 범위
Ankush Gola, Jake Broekhuizen, Vivek Trivedy가 2026년 9월 24일 소개한 LangSmith Fine-Tuning은 에이전트의 실행 궤적을 특화 모델 학습으로 연결하는 기능이다. 중심 도구인 smithtune CLI는 LangSmith 데이터셋 생성과 준비, Fireworks 또는 Baseten을 통한 학습, LangSmith 평가를 하나의 흐름으로 제공하며 직접 실행하거나 코딩 에이전트와 함께 사용할 수 있다. 현재 지원하는 방식은 좋은 행동의 입력·출력 예시를 모방하도록 모델 가중치를 갱신하는 지도 미세조정(SFT)이다. 글은 이 접근이 수작업 데이터 파이프라인 구축 부담을 줄이고 특정 과제에서 범용 프런티어 모델과 동등하거나 더 나은 성능을 더 낮은 비용과 지연시간으로 얻을 가능성을 제시하지만, 모든 과제에서의 개선을 보장하지는 않는다.
2. 실행 궤적이 보존하는 학습 문맥
실행 궤적은 에이전트가 과제를 처리한 과정을 보여주는 메시지, 도구 호출, 도구 결과의 순서 있는 기록이다. LangSmith는 추적 기록이나 스레드에서 이 순서를 구성하고, 지원되는 메시지 형식을 공통 표현으로 통합하며, 도구 정의를 보존하고 중복 이력을 제거한다. SFT에서는 학생 모델에 교사 모델이 성공적인 결과를 만들 때 보았던 정확한 문맥을 제공해야 하므로, 최종 메시지 목록만 단순히 내보내는 방식으로는 충분하지 않을 수 있다. 특히 오래 실행되는 복잡한 에이전트에서는 도구의 지연 로딩처럼 사용 가능한 도구가 도중에 바뀔 수 있는데, LangSmith 궤적은 각 턴에서 실제로 보았던 정보를 기록해 행동과 당시 문맥을 연결한다. smithtune은 이러한 궤적의 응답과 도구 호출을 학습에 사용하고, 학습에서 제외한 궤적은 평가용 문맥과 기준 행동으로 활용한다.
3. 좋은 궤적의 선별과 데이터셋 보관
데이터셋 구축은 목표 모델이 따라 배울 좋은 사례인 골든 궤적을 확보하는 과정이며, smithtune은 선택적 필터를 적용해 LangSmith 추적 프로젝트의 궤적을 로컬 디렉터리로 가져온다. 이어 사람과 에이전트가 좋은 추적 기록의 특징을 파악하고 평가 기준을 만든 뒤, 여러 에이전트가 궤적을 검토하고 SFT에 적합한 후보를 선별한다. 합의된 골든 궤적은 LangSmith 데이터셋에 업로드되어 학습과 평가에 사용되며, 나중에도 학습에 사용한 데이터를 확인할 수 있도록 지속적으로 보관된다. 이 과정에서 선택한 모델의 시퀀스 길이 제한을 초과하는 기록을 제외하고 데이터를 학습·검증·테스트용으로 나누는 작업도 처리한다. 데이터 수집부터 선별과 보관까지 연결하는 구조는 좋은 행동의 예시를 확보하는 일과 사후에 학습 근거를 확인하는 일을 함께 지원한다.
4. 학습 설정 검토와 관리형 SFT
학습을 시작하기 전 smithtune plan은 선택한 모델, 학습 예시 수, 학습률, 배치 크기, 에포크 등의 설정을 사람이 검토할 수 있게 한다. 사용자는 이 설정을 조정한 뒤 smithtune train으로 작업을 제출하며, 준비된 궤적에 대한 LoRA 학습은 Fireworks managed SFT 또는 Baseten Loops에서 수행된다. 따라서 사용자 측에서 GPU를 준비하거나 학습 인프라를 직접 관리할 필요가 없고, smithtune은 학습 중 검증 데이터 성능을 확인해 검증 손실이 가장 낮은 저장 체크포인트를 선택한다. Fireworks의 Pranav Jain은 선별된 운영 추적 기록을 관리형 학습과 제공되는 모델로 연결하는 흐름을 강조했으며, Baseten의 Aaron Ellis-Bloor는 Loops의 관리형 인프라로 데이터 수집에서 미세조정 실험까지 빠르게 이동하고 데이터 품질을 지속적으로 개선할 수 있다고 설명했다.
5. 재생 평가에서 배포와 재학습으로
학습이 끝나면 smithtune evaluate를 실행해 선택된 체크포인트와 기본 모델을 비교하며, 내장된 재생 평가는 골든 궤적에 기록된 행동을 모델이 수행할 수 있는지 시험한다. 평가자는 모델의 예측을 실제 기록된 기준 예시와 비교해 점수를 부여하고, CLI가 반환하는 LangSmith 비교 링크에는 평가가 진행되는 동안 결과가 나타난다. 사용자는 점수뿐 아니라 개별 응답과 도구 선택을 살펴보면서 미세조정이 개선을 만든 부분과 성능 저하를 일으킨 부분을 확인할 수 있다. 결과가 만족스럽다면 smithtune deploy로 모델을 제공하고 애플리케이션에 연결하며, 그렇지 않다면 데이터셋이나 학습 설정을 수정한 뒤 학습과 평가를 반복한다. 코딩 에이전트와 함께 LangSmith의 비교 결과를 검토하는 방식도 지원하므로, 어떤 응답이나 도구 선택이 추가 개선을 필요로 하는지 분석할 수 있다.
6. Engine에서 관찰한 전문화의 성능 개선
LangChain은 smithtune 흐름의 품질을 확인하기 위해 많이 사용하는 에이전트인 Engine과 OpenSWE Review에 이를 적용했다. Engine은 에이전트 추적 기록을 분석해 실패를 찾고 관련 문제를 묶는 시스템이며, 실험에서는 그 안의 에이전트 하나를 축소한 버전으로 문제 식별과 정리 능력을 평가했다. 연구진은 좋은 궤적을 선별해 기본 Kimi K3를 미세조정했는데, 기본 모델이 이미 강력했고 Kimi와 GPT-5.6 Sol 모두 하네스 엔지니어링으로 더 개선할 여지를 소진했다고 설명했다. 내부 문제 탐지·그룹화 벤치마크인 IssueBench의 일부에서 GPT-5.6 Sol은 87.0, Kimi K3는 90.0, Kimi K3 + SFT는 96.0의 과제 점수를 기록했다. 이 결과는 해당 에이전트와 제한된 내부 평가 범위에서 SFT를 통한 전문화가 두 비교 모델보다 높은 점수를 냈다는 근거로 제시된다.
7. OpenSWE Review의 효율 개선과 데이터 선별의 반례
OpenSWE Review 실험은 실제 저장소의 풀 리퀘스트로 구성한 내부 평가셋에서 Qwen-3.8-27B의 코드 리뷰 품질과 버그 탐지를 측정했다. SFT 전후 F1은 48.9%에서 53.7%, 정밀도는 62.9%에서 81.5%로 상승했고 재현율은 40.0%로 유지됐다. 리뷰당 모델 호출은 55.9에서 39.2로 29.8% 감소했으며, 도구 요청은 65.8에서 46.5로 29.4% 줄었다. 다만 앞선 덜 선별된 학습 데이터로는 SFT 후 F1이 하락해, 연구진은 각 추적 기록을 검토하는 단계를 추가하고 에이전트가 잠재적 문제가 실제로 있다고 판단한 기록의 표집 비중을 높이려 했다. 글은 이 사례의 실용적 기회를 유사한 리뷰 품질을 더 적은 모델 호출과 도구 요청으로 달성하는 데서 찾으며, 그 효과를 리뷰당 비용 절감과 풀 리퀘스트 리뷰 시간 단축으로 설명한다.
8. SFT 적용 조건과 Public Beta 시작 요건
글은 반복되는 과제를 수행하고 기대하는 행동의 예시가 있는 애플리케이션에서 SFT가 특히 유용하다고 설명하며, 학습할 패턴으로 워크플로 준수, 도구 결과에 따른 다음 행동 결정, 작업 검증을 든다. 권장 순서는 먼저 하네스 엔지니어링으로 성능 개선 가능성을 확인하고, 이후에도 반복되는 오류가 있으며 올바른 수행 궤적을 확보한 경우 SFT를 시도하는 것이다. 성공적인 사후학습에서는 데이터 선별에 시간을 들이는 것이 중요하며, 도메인 전문가가 에이전트와 함께 SFT용 추적 기록을 검토하면 성공 가능성을 높일 수 있다고 강조한다. LangSmith Fine-Tuning은 Public Beta로 제공되며, 시작하려면 에이전트 추적 기록이 있는 LangSmith 계정과 Fireworks 또는 Baseten API 키, smithtune CLI가 필요하다. GitHub 저장소에서 smithtune을 사용하고 해당 스킬을 설치하면 코딩 에이전트가 전체 미세조정 과정을 진행하도록 할 수 있다.
🧾 핵심 주장 / 시사점
- 실행 궤적의 가치는 성공한 최종 응답뿐 아니라 행동 당시의 문맥을 보존하는 데 있다. 도구 가용성이 바뀌는 에이전트에서는 이러한 문맥 보존이 학습 예시의 충실도와 연결된다.
- OpenSWE Review에서 초기 F1 하락 후 데이터 선별을 수정한 과정은 SFT 자체만으로 개선이 보장되지 않으며, 어떤 궤적을 학습시키는지가 중요한 실험 변수임을 보여준다.
- Engine은 과제 점수 상승을, OpenSWE Review는 품질을 유지·개선하면서 호출 수를 줄이는 가능성을 보여준다. 다만 제시된 근거는 특정 내부 평가에 한정되므로 다른 과제의 효과는 별도 평가로 확인해야 한다.
✅ 액션 아이템
- 하네스 엔지니어링 적용 후에도 남는 반복 오류와 올바른 수행 궤적의 확보 여부를 바탕으로 SFT 적용 가능성 검토.
- LangSmith 실행 궤적에서 좋은 사례를 선별하고 모델 시퀀스 길이 제한, 학습·검증·테스트 분할을 반영해 smithtune 학습 데이터 준비.
- smithtune 재생 평가로 기본 모델 대비 품질과 성능 저하 여부를 비교하고, 결과에 따라 배포 또는 데이터·학습 설정 수정 후 재학습 결정.
❓ 열린 질문
- 하네스 엔지니어링 이후에도 반복되는 오류 중 올바른 LangSmith 실행 궤적을 확보한 과제는 무엇인가?
- OpenSWE Review의 초기 F1 하락 사례를 고려할 때, SFT에 사용할 좋은 궤적의 선별 기준을 어떻게 정할 것인가?
- smithtune 재생 평가에서 기본 모델 대비 어느 정도의 품질 개선과 모델 호출·도구 요청 감소가 확인되면 배포를 결정할 것인가?