Articleaws.amazon.com·2026년 8월 26일·0

Preparing data for supervised fine-tuning Part 1: Formatting and quality

Quick Summary

지도 미세 조정(SFT)의 성과는 데이터의 정확성·다양성·일관성과 실제 추론 환경에 맞춘 대화 형식 및 추론 예시의 품질에 달려 있다.

Preparing data for supervised fine-tuning Part 1: Formatting and quality 관련 대표 이미지

🖼️ 인포그래픽

Preparing data for supervised fine-tuning Part 1: Formatting and quality 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Preparing data for supervised fine-tuning Part 1: Formatting and quality의 핵심 내용을 4단계로 요약한 인포그래픽
Preparing data for supervised fine-tuning Part 1: Formatting and quality 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

지도 미세 조정(SFT)의 성과는 데이터의 정확성·다양성·일관성과 실제 추론 환경에 맞춘 대화 형식 및 추론 예시의 품질에 달려 있다.

📌 핵심 요약

  • 지속 사전 학습(CPT)은 도메인 지식을 확장하고, SFT는 입력·출력 예시로 응답 행동을 조정하며, 강화 미세 조정(RFT)은 보상 신호로 행동을 최적화한다.
  • 정확한 예시의 선별이 데이터 규모보다 중요하며, LIMA는 엄선한 1,000개 예시의 효과를, AlpaGasus는 가장 깨끗한 20%로 걸러낸 데이터의 학습 속도와 성능 개선을 보여줬다.
  • 데이터는 표현·주제·난이도·예외 상황을 폭넓게 포함하되, 같은 과제의 응답 규칙은 일관돼야 하며 중복 제거와 유해성 검토가 필요하다.
  • 학습 데이터의 시스템 프롬프트를 실제 추론 환경과 맞추고, 대화형 JSONL에서는 한 줄에 하나의 JSON 객체를 담아 구문과 사용자·어시스턴트 역할 교대를 검증해야 한다.
  • Amazon Nova 2.0의 추론 예시는 reasoningContent에 기록하며, 정답으로 이어지는 완전하고 난이도에 비례한 과정이 중요하다. 학습과 추론의 추론 활성화 설정을 맞춰야 하며, 도구 호출은 toolUse·toolResult와 toolUseId로 연결한다.

🧩 주요 포인트

  1. CPT·SFT·RFT의 역할 구분 → 지식 부족, 응답 행동 문제, 보상 기반 최적화 요구에 맞춰 조정 방식을 선택하는 기준이 된다.
  2. 정확성·다양성·일관성과 중복 제거 → 잘못된 패턴의 모방과 특정 예시에 대한 과적합을 줄이고 실제 요청 전반의 일반화를 뒷받침한다.
  3. 시스템 프롬프트·JSONL·추론 활성화 설정의 정합성 → 학습과 실제 추론 사이의 분포 불일치를 줄이고 원하는 응답 행동을 유지하는 조건이 된다.

🧠 상세 정리

1. SFT의 목적과 다른 조정 기법의 역할

원문은 기반 모델을 평가한 뒤 출력 스키마 준수, 도메인 분류, 응답 어조 등이 운영 요구를 충족하지 못해 미세 조정을 결정한 상황을 전제로 한다. CPT는 대량의 비정형 도메인 텍스트로 지식 기반을 확장하고, SFT는 엄선한 입력·출력 쌍으로 기존 지식을 적용하는 응답 행동을 가르치는 방식으로 설명된다. RFT는 명시적인 시범 답변 대신 보상 신호를 사용하며, 출력 품질은 프로그램으로 평가할 수 있지만 추론 경로를 대규모로 시연하기 어려울 때 적합하다. 세 기법은 함께 사용할 수 있고, 지식 확장 뒤 행동 조정과 피드백 최적화를 수행하는 순서가 제시된다. 다만 Amazon Nova처럼 폭넓은 자료로 사전 학습한 모델은 핵심 도메인 지식이 부족한 경우가 아니라면 일반적으로 SFT 이후 RFT를 적용하는 것으로 충분하다고 설명한다.

2. 정확한 정답과 선별된 데이터의 가치

원문은 형식을 정비하거나 학습 인프라에 투자하기 전에 원시 데이터를 점검해야 이후의 시간과 연산 비용을 절약할 수 있다고 강조한다. 데이터셋의 모든 응답은 실제 서비스에 내보내도 될 만큼 정확한 모범 답변이어야 하며, 잘못된 시범은 모델이 지속적으로 모방하는 나쁜 습관이 될 수 있다. 이는 SFT가 새로운 사실의 습득보다 어떤 응답 패턴을 따라야 하는지 학습하는 데 초점을 두기 때문에 특히 중요하다. 근거로 LIMA는 엄선한 1,000개 예시로 훨씬 많은 데이터를 사용한 모델에 견줄 수 있음을 보여줬고, AlpaGasus는 지시 데이터에서 가장 깨끗한 20%만 남겼을 때 전체 데이터보다 빠르게 학습하고 더 높은 점수를 얻었다. 사람이 주석을 작성하는 경우에는 예시를 학습 데이터에 넣기 전에 여러 차례 검토하는 절차를 적용하도록 권한다.

3. 실제 요청을 포괄하는 다양성과 빈 영역 탐색

데이터 다양성은 SFT 성공의 강력한 예측 요인으로 제시되며, 일반화를 좌우하는 속성은 과제와 표현의 폭을 뜻하는 의미적 범위와 개별 예시의 풍부함을 뜻하는 정보 깊이로 구분된다. 같은 의도를 표현하는 다양한 요청을 포함하고, 여러 도메인을 다루는 과제라면 실제 서비스에서 나타나는 빈도에 비례해 각 도메인을 반영해야 한다. 쉬운 사례와 복잡한 다단계 문제도 실제 요청의 난이도 분포에 맞춰 구성하며, 모호한 입력·불완전한 정보·범위 밖 요청에는 원하는 대응을 명시적으로 연결한다. 실무적인 탐색 방법으로는 임베딩 유사도에 따라 예시를 군집화하고, 예시가 드물거나 빠진 영역을 살피는 방식이 제시된다. 고객 지원 데이터에 비밀번호 재설정·결제·배송 군집은 있지만 실제로 자주 들어오는 환불 요청 군집이 없다면, 학습 전에 환불 예시를 수집하거나 작성해야 한다.

4. 같은 과제에서 지켜야 할 응답 일관성

원문은 데이터 전체의 다양성과 같은 유형의 과제 안에서 지켜야 하는 일관성을 별개의 요구로 구분한다. 비슷한 상황에 서로 다른 응답 규칙을 적용하면 모델은 어떤 행동이 올바른지에 대해 모순된 신호를 받는다. 예를 들어 유사한 요청에 어떤 예시는 글머리표로, 다른 예시는 문단으로 답한다면 안정적인 기본 응답 구조를 학습하기 어렵다. 고정된 집합에서 소문자 라벨 하나만 반환해야 하는 분류 과제라면 설명 문장을 섞지 않고 동일한 라벨 형식을 유지해야 한다. 두 문장 요약이 목표라면 머리말이나 긴 문단을 넣지 않고, 범위 밖 요청을 정해진 한 문장으로 거절해야 한다면 거절 예시에도 같은 문장을 사용해야 한다. 따라서 일관성은 단순한 문체 통일을 넘어 출력 형식·길이·거절 행동처럼 실제로 학습시키려는 규칙을 모든 관련 예시에 적용하는 문제다.

5. 중복 예시가 만드는 학습 편중

완전히 같거나 거의 같은 예시가 반복되면 모델이 해당 패턴에 과적합하고, 나머지 데이터에 비해 그 패턴의 중요성을 과도하게 학습할 수 있다. 원문은 중복 문제가 사전 학습보다 SFT에서 덜 결정적이라고 설명하지만, 데이터 구성 과정에서 쉽게 유입될 수 있다는 점도 함께 짚는다. 특히 여러 주석 작성자의 결과를 합치거나 서로 다른 프로젝트의 데이터셋을 결합할 때, 또는 합성 데이터를 생성할 때 중복이 생길 수 있다. 이러한 경우에는 학습 전에 정확히 일치하는 예시를 제거하는 방식과 의미적으로 유사한 예시를 걸러내는 방식을 모두 적용하도록 권한다. 이 점검은 같은 과제의 응답 규칙을 일관되게 유지하는 요구와 함께 다뤄지며, 특정 예시의 반복 때문에 전체 데이터의 상대적인 비중이 왜곡되는 문제를 줄이는 데 목적이 있다.

6. 유해성 검토와 사람의 판단

데이터 품질 점검에는 정확성과 중복 여부뿐 아니라 유해하거나 편향되거나 부적절한 내용이 포함됐는지 살피는 작업도 들어간다. 사용 사례가 좁더라도 모델이 문제 있는 예시의 패턴을 내면화한 뒤 예상하지 못한 맥락에서 드러낼 수 있기 때문에, 적용 범위가 제한적이라는 이유만으로 검토를 생략해서는 안 된다는 취지다. 원문은 공개된 Llama Guard 같은 자동 분류기로 검토할 내용을 표시하고, 사람이 해당 내용을 검토하는 방식을 제시한다. 또한 도메인별로 어떤 자료를 허용 가능한 학습 데이터로 볼 것인지 명확한 기준을 세우도록 권한다. 여기서 자동 분류기는 사람의 검토 대상을 식별하는 수단으로 제시되며, 유해성 검토는 형식 정비에 앞서 수행하는 원시 데이터 품질 점검의 일부로 배치된다.

7. 운영 환경과 일치하는 시스템 프롬프트와 JSONL

품질 점검 이후에는 학습용 구조를 갖추되, 형식은 단순한 구문 문제가 아니라 모델이 익히는 입력과 응답의 형태를 결정하는 요소로 다뤄야 한다. 실제 추론에서 시스템 프롬프트를 사용할 계획이라면 학습 예시에도 포함해야 하며, 학습에는 없던 시스템 프롬프트가 운영에서 추가되면 분포 불일치로 행동이 저하될 수 있다. Amazon Nova 학습 방식 등을 포함한 현대적인 SFT 파이프라인은 각 줄이 독립적인 대화 객체인 JSONL을 사용하며, Amazon Nova 2.0의 예시는 Converse API 형식을 따른다. 원문은 한 JSON 객체를 여러 줄로 보기 좋게 펼치지 말고 한 줄에 담으며, 업로드 전에 모든 줄이 유효한 JSON으로 해석되는지 검증하도록 요구한다. 사용자와 어시스턴트 발화는 엄격히 교대해야 하고, 시스템 메시지 역시 실제 서비스에서 사용하는 조건과 맞춰 포함해야 한다.

8. 추론 예시의 품질과 도구 호출 형식

Amazon Nova 2.0처럼 추론 기능이 있는 모델에서 추론을 활성화한다면 어시스턴트 발화의 reasoningContent에 중간 사고 단계를 포함하며, 원문은 이를 추론 행동 자체를 학습시키는 방법으로 설명한다. 유용한 추론 예시는 실제로 최종 답변으로 이어져야 하고, 문제 난이도에 비례하는 길이를 가지며, 모델이 아직 익히지 못한 중간 단계를 건너뛰지 않아야 한다. s1과 LIMO는 역량 있는 기반 모델에서 엄선한 1,000개 미만의 추론 시범으로도 강한 추론 성능을 이끌어낼 수 있다는 근거로 제시된다. 추론 내용은 문제 해결에 직접 관련된 일반 텍스트로 작성하고, 학습에서 추론을 활성화했다면 실제 추론에서도 활성화해야 한다. 추론 예시가 없는 데이터로 추론 활성화 상태에서 학습하면 모델이 추론 없이 답하는 방식을 배워 추론 역량을 잃을 수 있다고 경고한다. 이어 문서·이미지·영상의 멀티모달 이해와 도구 사용 학습을 소개하며, 도구 호출은 어시스턴트의 toolUse와 사용자의 toolResult가 고유한 toolUseId를 참조하는 구조로 설명하지만 제공된 본문은 코드 예시 도중 끝난다.

🧾 핵심 주장 / 시사점

  • SFT에서 잘못된 예시는 단순한 정보 오류를 넘어 모방할 행동의 기준이 되므로, 데이터의 정확성은 응답 신뢰성과 직접 연결된다.
  • 다양성과 일관성은 상충하는 목표가 아니다. 입력 상황은 폭넓게 다루면서 같은 과제의 출력 규칙은 안정적으로 유지해야 한다.
  • 학습 데이터의 형식과 추론 설정도 학습 신호의 일부이므로, 내용이 정확하더라도 운영 환경과 다르면 원하는 행동이 저하될 수 있다.

✅ 액션 아이템

  • 해결하려는 문제가 지식 부족, 응답 행동, 보상 기반 최적화 중 어디에 해당하는지에 따라 CPT·SFT·RFT 적용 목적 구분.
  • SFT 데이터의 정확성·다양성·일관성을 검토하고 중복 제거와 유해성 검토 수행.
  • 시스템 프롬프트·JSONL·추론 활성화 설정의 정합성을 확인하고, reasoningContent의 품질과 toolUse·toolResult의 toolUseId 연결 검증.

❓ 열린 질문

  • 현재 해결하려는 요구는 CPT의 지식 확장, SFT의 응답 행동 조정, RFT의 보상 기반 최적화 중 어디에 해당하는가?
  • 현재 데이터는 표현·주제·난이도·예외 상황의 다양성을 갖추면서 같은 과제의 응답 규칙을 일관되게 유지하는가?
  • 학습과 실제 추론의 시스템 프롬프트 및 추론 활성화 설정이 일치하고, JSONL의 구문과 사용자·어시스턴트 역할 교대가 검증됐는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.