Articleaws.amazon.com·2026년 10월 2일·0

Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI

Quick Summary

Amazon SageMaker AI MTRL로 Qwen3.6 27B 검색 에이전트의 전체 다중 턴 과정을 미세 조정한 결과, 4개 평가 벤치마크 중 3개에서 검색 품질이 개선되고 턴·토큰 제한 내 작업 완료의 신뢰성이 높아졌다.

Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI 관련 대표 이미지

🖼️ 인포그래픽

Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI의 핵심 내용을 4단계로 요약한 인포그래픽
Fine-tune a search agent with multi-turn RL on Amazon SageMaker AI 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Amazon SageMaker AI MTRL로 Qwen3.6-27B 검색 에이전트의 전체 다중 턴 과정을 미세 조정한 결과, 4개 평가 벤치마크 중 3개에서 검색 품질이 개선되고 턴·토큰 제한 내 작업 완료의 신뢰성이 높아졌다.

📌 핵심 요약

  • 검색 에이전트는 여러 턴에 걸쳐 검색어와 검색 전략을 선택한다. 원문은 전문가 시연이 필요한 지도 미세 조정(SFT)과 개별 응답을 평가하는 단일 턴 강화학습의 한계를 지적하며, 최종 결과에 대한 보상으로 전체 의사결정 과정을 최적화하는 다중 턴 강화학습(MTRL)을 제시한다.
  • 실험은 US West (Oregon), us-west-2에서 Qwen3.6-27B에 BM25와 벡터 검색 도구를 연결했다. Amazon SageMaker AI MTRL은 서버리스 실행, 비동기 궤적 수집, 학습 재개, 관찰 및 평가 기능을 제공하며, 원문은 작은 특화 모델을 통해 추론 속도와 비용 측면의 이점을 얻을 수 있다고 설명한다.
  • FRAMES, BRIGHT, Enterprise RAG, ESCI, Musique, MLQA를 학습에 사용하고 각 데이터셋의 5%를 검증용으로 남겼다. FreshStack, WixQA, BrowseComp-Plus, Wands는 별도 테스트에 사용했으며, 학습 설정은 max_epochs=1, global_batch_size=128, rollout_max_concurrency=32만 변경하고 나머지는 기본값을 유지했다.
  • 전체 검색 과정이 끝난 뒤 최종 문서 순위의 nDCG@10을 보상으로 사용했다. 최대 턴 수 또는 한 턴의 최대 샘플링 토큰 수에 도달하면 -1 보상을 부여해 검색 품질과 턴·토큰 제한 준수를 함께 학습하도록 했다.
  • BrowseComp-Plus의 nDCG@10은 23.7%, WixQA는 18.4% 개선됐고, Wands도 개선됐지만 FreshStack은 소폭 하락했다. BrowseComp-Plus 실패율은 22.89%에서 0.68%로 감소했다. WixQA와 Wands는 평균 턴 수가 늘었으며, 제공된 원문은 FreshStack의 질문 수 672에서 끊겨 FreshStack과 BrowseComp-Plus의 상세 비교표는 확인할 수 없다.

🧩 주요 포인트

  1. 전체 다중 턴 궤적 최적화 → 검색어 선택과 도구 사용 사이의 의존성을 학습 대상으로 포함.
  2. nDCG@10 보상과 -1 제한 도달 패널티의 결합 → 검색 결과의 적합성과 작업 완료 신뢰성을 함께 유도.
  3. 벤치마크별 품질 차이와 평균 턴 수 증가 → 미세 조정의 효과를 검색 품질·실패율·상호작용 길이로 함께 판단할 필요.

🧠 상세 정리

1. 검색 에이전트에 다중 턴 학습이 필요한 이유

LLM 기반 검색 에이전트는 사용자가 완벽한 검색어를 작성하도록 요구하는 대신, 무엇을 검색하고 어떤 검색 전략을 사용하며 언제 검색을 끝낼지 스스로 결정한다. 이 과정은 여러 차례의 상호작용으로 이어지고, 이미 검색한 내용을 바탕으로 다음 행동을 수정한다. 원문은 기본 모델이 특정 도구와 환경을 미리 알지 못하므로 작은 모델에 프롬프트만 제공하면 안정적인 다중 턴 행동을 얻기 어렵고, 프런티어 모델은 종종 작동하지만 지연 시간과 비용 부담이 있다고 설명한다. 지도 미세 조정(SFT)은 이상적인 다중 턴 과정을 보여 주는 전문가 시연이 필요하지만, 이런 자료는 수집 비용이 높고 해당 환경에 존재하지 않는 경우가 많다. 검증 가능한 보상을 사용하는 RLVR 같은 단일 턴 강화학습도 응답을 개별적으로 평가하므로 앞선 맥락에 의존하는 연속적인 검색 결정을 충분히 다루지 못한다. 이에 원문은 최종 결과의 좋고 나쁨을 보상으로 삼아 전체 다중 턴 궤적을 최적화하는 MTRL을 대안으로 제시한다.

2. Amazon SageMaker AI MTRL의 구성과 기능

Amazon SageMaker AI MTRL은 에이전트 작업을 일련의 의사결정으로 표현하고, 다중 턴 롤아웃으로 학습 데이터를 생성한 뒤 정책 경사 알고리즘으로 모델을 최적화한다. 모듈형 에이전트·환경 인터페이스를 통해 사용자 정의 보상, 도구 실행 루프, 다중 턴 대화 형태를 구성할 수 있으며, 서버리스 실행은 GPU 클러스터를 직접 준비하거나 관리하지 않고 토큰당 과금으로 학습하도록 지원한다. 생성과 경사 업데이트를 병렬로 수행하는 비동기 궤적 수집은 현재 정책에서 지나치게 벗어나지 않도록 오프폴리시 지연을 제한한다. 알고리즘 선택지에는 PPO, CISPO, 중요도 샘플링(IS) 손실이 있고, GRPO, GRPO pass@k, RLOO 등의 그룹 기반 어드밴티지 추정기를 결합할 수 있다. 학습 재개 기능은 긴 실행을 여러 작업으로 나누도록 지원하며, Amazon SageMaker AI가 관리하는 MLflow에서는 턴별 행동과 학습 단계별 보상을 관찰할 수 있다. 평가 작업에서는 Amazon SageMaker AI 엔드포인트나 Amazon Bedrock에 배포하기 전에 보상, pass@k, 궤적 지표를 보고할 수 있다.

3. 실험 환경과 두 가지 검색 도구

실험에는 US West (Oregon), us-west-2 리전에서 Amazon SageMaker AI에 접근할 수 있는 AWS 계정과 서비스가 요구하는 형식으로 Amazon S3에 올린 학습·검증 데이터가 필요하다. 또한 롤아웃 중 MTRL 환경이 호출할 수 있도록 BM25와 벡터 검색 도구를 제공하는 에이전트 엔드포인트가 배포되어 있어야 하며, Amazon SageMaker AI와 Python에 대한 이해를 전제로 한다. 미세 조정 대상은 해당 리전에서 지원되는 Qwen3.6-27B이고, 적용 상황은 기업 검색 환경이다. BM25는 단어 빈도를 바탕으로 정확한 키워드 일치를 찾으므로 특정 용어나 식별자가 포함된 질의에 적합하다. 벡터 검색은 질의와 문서를 임베딩 벡터로 변환해 유사도를 계산하며, 의미나 개념 중심의 질의에 권장된다. 실험은 사용자와 어시스턴트의 한 차례 상호작용을 한 턴으로 정의하고 턴 수를 제한해, 지나치게 긴 응답을 방지하면서 효율적인 검색 행동을 유도한다.

4. 학습·검증·테스트 데이터의 역할

학습에는 여러 Wikipedia 문서의 정보를 종합해야 하는 FRAMES와, 키워드 일치보다 추론을 통한 관련성 판단이 필요한 12개 도메인의 BRIGHT를 사용한다. Enterprise RAG는 500,000개 이상의 합성 기업 문서와 500개 질문으로 구성되며, ESCI는 다국어 질의·제품 쌍을 Exact, Substitute, Complement, Irrelevant로 분류한 제품 검색 데이터다. Musique는 단일 단계 질문을 조합한 다중 단계 추론 문제를 제공하고, MLQA는 7개 언어를 포괄하는 병렬 추출형 질의응답 벤치마크다. 모든 학습 데이터는 MTRL이 인식하는 형식으로 전처리하며, 각 데이터셋 학습 사례의 5%를 검증용으로 남긴다. 별도 테스트에는 5개 주제의 Stack Overflow와 문서를 다루는 FreshStack, Wix 지식 기반의 도움말 질의응답인 WixQA, 약 100K개의 사람이 검증한 공개 웹 문서를 사용하는 BrowseComp-Plus가 포함된다. Wands는 Wayfair 제품 검색 데이터로 42,000개 이상의 질의·제품 관련성 판단을 포함하며, 이는 뒤의 평가표에 제시된 질문 수 147과는 구분된다.

5. 최종 검색 품질과 제한 준수를 반영하는 보상

주요 지표인 nDCG@10은 상위 10개 검색 문서의 순위가 이상적인 순위와 얼마나 잘 일치하는지 측정하는 정보 검색 지표다. 관련성이 높은 문서가 목록 앞부분에 배치될수록 높은 점수를 주며, 1.0은 완벽한 순위, 0.0은 관련 문서를 검색하지 못한 상태를 의미한다. 실험은 이 지표를 MTRL 보상 함수로 직접 사용하고, 에이전트가 전체 다중 턴 검색을 마친 뒤 최종 문서가 정답 기준과 얼마나 부합하는지 평가한다. 에이전트가 최대 턴 수나 한 턴의 최대 샘플링 토큰 수에 도달하면 -1 보상을 부여해 해당 실패 행동을 피하도록 학습한다. 원문은 이런 패널티 설계가 복잡한 중간 보상을 직접 만들지 않고도 바람직하지 않은 행동을 억제하는 데 효과적이라고 설명한다. 한편 테스트 결과표에서는 실패한 작업의 nDCG@10을 0으로 처리하므로, 학습 중 제한 도달에 부여하는 -1 보상과 평가표의 점수 처리 방식은 구분해야 한다.

6. 세 가지 변경값으로 구성한 학습 작업

학습 작업은 MultiTurnRLTrainer SDK로 구성하며, model_id에 qwen3.6-27b를 지정하고 에이전트 엔드포인트, 학습·검증 데이터의 S3 경로, 출력 S3 경로를 전달한다. 원문에서 변경한 하이퍼파라미터는 max_epochs=1, global_batch_size=128, rollout_max_concurrency=32의 세 가지다. max_epochs는 전체 학습 데이터를 몇 차례 순회할지 정하고, global_batch_size는 학습 단계당 프롬프트 수를 정하며, rollout_max_concurrency는 궤적 수집 중 병렬로 실행하는 롤아웃 수를 제한한다. 설정 후 trainer.train()을 호출해 학습을 시작한다. 알고리즘, 어드밴티지 추정기, 오프폴리시 지연 범위처럼 강화학습 전문성이 요구될 수 있는 선택은 모두 기본값으로 실행했다. 원문은 기본 모델에서 제시된 결과에 도달하는 데 이 구성만 사용했다고 설명하지만, 실제 최대 턴 수와 한 턴의 최대 샘플링 토큰 수에 대한 수치는 제공하지 않는다.

7. 학습 곡선과 장시간 작업의 재개

원문은 학습 단계에 따른 학습·검증 데이터의 nDCG@10 변화를 그림으로 설명하며, 두 곡선 모두 지속적으로 상승하다가 학습 후반에 평탄해졌다고 보고한다. 학습 데이터와 검증 데이터의 보상이 함께 증가한 모습은 미세 조정이 진행되면서 두 집합에서 검색 품질이 개선됐음을 보여 준다. 원문은 학습 종료 무렵 두 곡선이 포화된 점을 근거로 추가 학습이 유익하지 않을 가능성을 제시하지만, 이는 해당 학습 곡선에 대한 해석이다. MTRL 학습은 여러 날에 걸쳐 진행될 수 있고, 서비스의 기본 작업 시간 제한은 24시간이며 CreateJob JSON 스키마로 조정할 수 있다. 시간 초과나 인프라 오류로 작업이 중단되거나 실패한 경우에는 이전 체크포인트에서 학습을 이어갈 수 있다. 제공된 본문에는 그림의 설명만 있어, 특정 단계의 보상값이나 정확한 수렴 시점을 수치로 확인할 수는 없다.

8. 평가 결과와 제공된 자료의 한계

원문은 별도 테스트 벤치마크 4개 중 3개에서 검색 품질이 개선됐다고 보고하며, nDCG@10 증가율은 BrowseComp-Plus 23.7%, WixQA 18.4%이고 Wands는 더 작은 개선, FreshStack은 소폭 하락을 보였다. BrowseComp-Plus 실패율은 22.89%에서 0.68%로 줄어, 검색 품질뿐 아니라 턴·토큰 예산 안에서 작업을 끝내는 능력도 개선됐다는 근거로 제시된다. 질문 400개인 WixQA에서는 nDCG@10이 0.5725에서 0.6781로, 실패율이 0.67%에서 0.17%로 바뀌었고 평균 턴 수는 4.3에서 4.5로 늘었다. 질문 147개인 Wands에서는 nDCG@10이 0.5762에서 0.6112로 상승했으며 실패율은 두 모델 모두 0.00%, 평균 턴 수는 2.2에서 2.9로 증가했다. 평가표는 오류 발생 비율을 실패율로 정의하고 턴 제한이나 토큰 예산 초과를 그 예로 들며, 실패 작업에는 nDCG@10 0을 부여한다. 제공된 원문은 FreshStack의 질문 수 672를 제시한 지점에서 끊기므로, FreshStack과 BrowseComp-Plus의 나머지 상세 수치는 확인할 수 없다.

🧾 핵심 주장 / 시사점

  • 최종 검색 결과만 평가하는 보상으로도 전체 다중 턴 행동을 학습할 수 있다는 점이 핵심이다. 다만 원문은 턴·토큰 제한 도달에 별도의 -1 패널티를 함께 사용했다.
  • BrowseComp-Plus의 실패율 감소는 검색 결과의 순위 개선과 작업 완료 능력이 서로 다른 평가 축임을 보여 준다. 두 지표를 함께 보면 미세 조정 효과를 더 구체적으로 판단할 수 있다.
  • WixQA와 Wands에서는 검색 품질 개선과 평균 턴 수 증가가 함께 나타났고 FreshStack은 소폭 하락했다. 따라서 이 결과만으로 모든 검색 과제의 품질 향상이나 상호작용 단축을 일반화하기는 어렵다.

✅ 액션 아이템

  • BM25와 벡터 검색을 사용하는 Qwen3.6-27B 검색 에이전트에 전체 다중 턴 궤적을 최적화하는 Amazon SageMaker AI MTRL 적용 검토.
  • nDCG@10, 실패율, 평균 턴 수를 함께 평가해 검색 품질과 턴·토큰 제한 준수의 변화 확인.
  • FreshStack의 소폭 성능 하락과 BrowseComp-Plus의 개선을 판단하기 위해 누락된 상세 비교표 추가 확인.

❓ 열린 질문

  • FreshStack의 nDCG@10 소폭 하락은 어떤 검색 특성과 관련이 있는가?
  • WixQA와 Wands의 평균 턴 수 증가를 고려할 때 검색 품질 개선과 상호작용 길이 사이의 균형은 어떻게 평가할 수 있는가?
  • nDCG@10 보상과 -1 패널티는 BrowseComp-Plus 실패율이 22.89%에서 0.68%로 감소하는 데 각각 얼마나 기여했는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.