Articlehuggingface.co·2026년 10월 7일·0

One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO

Quick Summary

Nemotron 3를 분야별로 미세조정하고 피드백 기반 추론과 결합한 시스템이 IOI 2026과 IMO 2026에서 모두 금메달 수준의 점수를 기록했다.

One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO 관련 대표 이미지

🖼️ 인포그래픽

One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO의 핵심 내용을 4단계로 요약한 인포그래픽
One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Nemotron 3를 분야별로 미세조정하고 피드백 기반 추론과 결합한 시스템이 IOI 2026과 IMO 2026에서 모두 금메달 수준의 점수를 기록했다.

📌 핵심 요약

  • IOI 2026에서 SFT와 GenCorrect를 적용한 Nemotron-3-Ultra-CC는 535.4/600점을 기록해 금메달 기준 361.12점과 인간 최고점 498.27점을 넘었다. 인간 참가자와 동일한 시간·인터넷 접근·제출 제약을 적용한 실시간 사전 계획 평가였지만, 비공식·비감독 벤치마크로 공식 순위에는 포함되지 않았다.
  • IMO 2026에서는 Nemotron 3 Ultra의 일반 모델과 SFT·RL 체크포인트를 결합한 생성·검증·개선 시스템이 30/42점을 받아 공식 금메달 기준 29점을 넘고 6문제 중 4문제에서 만점을 받았다. 공식 IMO 채점진이 제출 증명을 평가했으며, 시스템은 형식 증명기·외부 도구·인터넷 없이 자연어로 작동했다.
  • 두 프로젝트는 강력한 기반 모델, 분야별 문제와 고품질 추론 과정, SFT 및 필요한 경우 RL, 후보 답안을 생성·평가·개선하는 추론 루프라는 공통 특화 방식을 사용했다. 학습과 추론에는 상당한 연산이 필요했으며, 성과는 미세조정만으로 얻어진 것이 아니다.
  • 경쟁 프로그래밍에서는 22,000개 문제로 Nano와 Ultra 특화 모델을 학습했다. IMO에서는 SFT에 고유 증명 문제 15,818개에 걸친 414,890개 예제를, RL에 모델 능력의 경계 부근에서 선정한 증명 문제 9,597개를 사용했다.
  • Hugging Face에는 Nemotron Labs IMO 2026 collection과 Nemotron-3-Ultra-CC가 공개됐다. IMO 컬렉션은 SFT·RL 체크포인트, 두 학습 데이터셋, 200개 문제의 Nemotron-IMO-Bench를 제공하며, 논문과 NeMo-Skills에는 학습 방법 및 추론·평가 파이프라인 등 재현을 위한 자료가 공개됐다.

🧩 주요 포인트

  1. 모델 규모에 따라 후학습 효과가 달랐다 → Nano는 SFT에서 대부분의 향상을 얻고 RL에서 작지만 일관된 추가 개선을 보였으며, Ultra는 SFT 1회 학습만으로 완전 후학습된 Nano를 여러 평가에서 앞서 특화 방식을 규모별로 달리할 근거를 제공했다.
  2. 특화 모델과 추론 루프의 결합이 성과를 키웠다 → IOI의 GenCorrect는 반복 피드백으로 미세조정 효과를 확대했고, IMO에서는 상호 보완적인 SFT·RL 체크포인트의 조합이 단일 체크포인트에서 표본을 더 많이 생성하는 방식보다 유용했다.
  3. 성과의 해석과 재현에는 평가 조건과 공개 자료가 중요하다 → IOI 2026의 비공식 평가와 IMO 2026의 공식 채점은 구분해야 하며, Hugging Face·논문·NeMo-Skills의 공개 자료는 특화 및 추론 방식을 재현할 기반을 제공한다.

🧠 상세 정리

1. 서로 다른 두 경시대회에서 확인한 금메달 수준 성과

IOI는 엄격한 시간과 제출 제한 아래 숨겨진 테스트를 통과하는 알고리즘과 코드를 요구하고, IMO는 엄밀한 자연어 증명을 요구한다. 저자들은 이처럼 다른 능력을 평가하는 두 대회에서의 성과가 Nemotron의 분야별 적응 가능성을 보여준다고 주장한다. IOI 2026에서는 SFT와 GenCorrect를 적용한 Nemotron-3-Ultra-CC가 600점 중 535.4점을 얻어 금메달 기준 361.12점과 인간 최고점 498.27점을 모두 넘었다. 이 결과는 인간 참가자와 동일한 시간·인터넷 접근·제출 제약을 적용한 실시간 사전 계획 실행에서 나왔지만, 비공식·비감독 벤치마크였으며 공식 IOI 순위에는 포함되지 않았다. IMO 2026 시스템은 공식 IMO 채점진의 평가에서 42점 중 30점을 받아 공식 금메달 기준 29점을 넘었으므로, 두 결과의 평가 지위는 구분해서 이해해야 한다.

2. 새 기반 모델 대신 재사용 가능한 특화 방식

글은 미세조정이 쉽다는 말이 단순히 체크포인트를 학습할 수 있다는 뜻을 넘어, 유능한 기반 모델을 까다로운 분야에 명확하고 재사용 가능한 방식으로 적응시킬 수 있다는 의미여야 한다고 설명한다. 두 프로젝트의 공통 출발점은 강력한 Nemotron 기반 모델과 분야별로 선별한 문제, 고품질 추론 과정이었다. 여기에 SFT를 적용하고 유용한 경우 RL을 추가한 뒤, 특화 모델을 후보 답안의 생성·평가·개선을 반복하는 추론 루프와 결합했다. 학습과 추론 실행의 규모는 상당했지만, 저자들은 그 바탕이 되는 접근법 자체는 익숙하고 재현 가능하다고 주장한다. 핵심은 각 과제를 위해 새로운 기반 모델을 만드는 대신 기존 Nemotron을 특화하고, 그 모델의 결과를 피드백으로 개선하는 시스템을 함께 구성했다는 데 있다.

3. 경쟁 프로그래밍의 후학습과 GenCorrect 효과

경쟁 프로그래밍에서는 22,000개 문제를 선별하고 합성 추론 과정을 생성해 두 특화 모델을 학습했다. Nemotron-3-Nano-CC는 전체 300억·활성 30억 매개변수 모델로 SFT와 RL을 모두 적용했고, Nemotron-3-Ultra-CC는 전체 5,500억·활성 550억 매개변수 모델로 SFT를 적용했다. IOI 2025에서 Nano는 후학습 전 130점에서 SFT 후 280점, RL 후 291점으로 향상됐으며, 반복 생성·평가·개선 전략인 GenCorrect를 더하자 468점으로 금메달 기준 438.3점을 넘었다. Ultra-CC는 같은 추론 전략으로 502점을 기록해, 후학습과 추론 시점 연산을 결합했을 때의 추가 효과를 보여줬다. Nano에서는 SFT가 향상의 대부분을 차지하고 RL이 작지만 일관된 개선을 더했으며, 더 강한 Ultra는 SFT 1회 학습만으로 IOI·ICPC·LiveCodeBench Pro에서 완전 후학습된 Nano를 앞섰다. 이 관찰은 IOI 2026용 Ultra-CC 시스템의 구성에 반영됐고, 해당 시스템은 600점 중 535.4점을 기록했다.

4. 증명 생성·검증·수정을 함께 학습한 IMO 시스템

IMO 프로젝트는 Nemotron 3 Ultra를 기반으로 SFT 특화 모델과 RL 특화 모델을 각각 학습했다. SFT 데이터는 고유 증명 문제 15,818개에 걸친 품질 필터링 예제 414,890개로 구성됐으며, 증명 생성뿐 아니라 개선·검증·메타 검증을 포함해 논증의 빈틈을 찾고 비판에 대응하며 완결성을 판단하도록 학습했다. RL 모델에는 모델 능력의 경계 부근에서 선정한 증명 문제 9,597개를 사용했고, 개발 실험에서 두 후학습 체크포인트 모두 일반 제공 모델을 앞섰다. SFT 체크포인트는 첫 탐색 라운드에서 가장 강했고 RL 체크포인트는 단일 체크포인트 기준 최상의 전체 성과를 보여, 최종 시스템은 두 특화 모델과 일반 모델을 함께 사용했다. 각 문제에서 후보 증명을 생성·채점·비판하고 유망한 시도를 개선한 뒤 별도의 고연산 단계에서 최종 제출물을 선정했으며, 전체 과정은 형식 증명기·외부 도구·인터넷 없이 자연어로 수행됐다. 공식 채점 결과는 42점 중 30점이었고, 6문제 중 4문제에서 만점을 받아 공식 금메달 기준을 넘었다.

5. 미세조정과 추론 시점 연산의 공동 설계

이전 IOI 2025 Hugging Face 게시물은 추론 시점 연산이 공개 가중치 모델을 금메달 수준으로 끌어올릴 수 있음을 보여줬고, 이번 결과는 더 나은 특화가 그 추론 시스템에 더 좋은 후보·비평·개선안을 제공한다는 점을 추가했다. IOI에서는 GenCorrect가 여러 차례의 피드백을 통해 미세조정으로 얻은 향상을 더 큰 성과로 연결했다. IMO에서는 상호 보완적인 SFT와 RL 체크포인트를 함께 사용하는 것이 하나의 체크포인트에서 단순히 더 많은 표본을 뽑는 것보다 가치가 있었다. 따라서 저자들은 금메달 수준의 점수를 미세조정만의 성과나 무차별적인 표본 생성만의 성과로 설명하지 않는다. 두 프로젝트 모두 유능한 특화 모델과 탐색·검증·개선 시스템을 결합했으며, 모델·데이터·추론 루프를 함께 설계하는 것이 핵심이었다고 해석한다.

6. 공개 모델·데이터·추론 자료와 재현 기반

저자들은 경시대회 성과를 다른 용도로도 활용할 수 있도록 Hugging Face와 NeMo-Skills에 관련 자원을 공개했다고 설명한다. Nemotron Labs IMO 2026 collection은 SFT·RL 체크포인트와 두 학습 데이터셋, 올림피아드 수준의 200개 문제로 구성한 새 벤치마크 Nemotron-IMO-Bench를 모은다. IMO 논문은 학습 접근법과 생성·검증·개선 시스템을 설명하며, NeMo-Skills 저장소에는 IMO 추론 파이프라인·프롬프트·제출 증명·재현 가능한 빠른 시작 안내가 포함된다. 경쟁 프로그래밍용 Nemotron-3-Ultra-CC는 Hugging Face에서 제공되고, IOI 논문은 학습 방식과 GenCorrect 방법론을 설명하며 IOI 평가·추론 파이프라인 역시 NeMo-Skills에 공개돼 있다. 글은 두 대회의 결과를 Nemotron을 세계적 수준의 분야별 특화 모델로 미세조정하고 투명한 추론 흐름과 결합할 수 있다는 주장에 대한 까다로운 검증 사례로 제시하며, 공개 자료를 바탕으로 커뮤니티가 이어갈 활용에 기대를 표한다.

🧾 핵심 주장 / 시사점

  • 두 대회의 금메달 수준 점수는 Nemotron의 적응 가능성을 뒷받침하지만, IOI의 비공식 평가와 IMO의 공식 채점을 동일한 지위의 결과로 해석해서는 안 된다.
  • Nano와 Ultra의 후학습 차이, IMO의 체크포인트별 강점은 모델 규모와 과제에 따라 SFT·RL의 역할과 조합을 달리할 필요가 있음을 시사한다.
  • 성과를 이해하고 재현하려면 특화 체크포인트뿐 아니라 후보 생성·평가·개선 과정과 상당한 추론 연산까지 함께 고려해야 한다.

✅ 액션 아이템

  • IOI 2026의 535.4/600점과 IMO 2026의 30/42점을 각각 비공식 평가와 공식 채점이라는 조건에 맞춰 해석.
  • Nano와 Ultra의 SFT·RL 효과 및 IMO의 상호 보완적 체크포인트 성과를 바탕으로 분야별 후학습 조합 검토.
  • Hugging Face·논문·NeMo-Skills의 공개 자료를 활용해 Nemotron 특화 모델과 추론 파이프라인의 재현 가능성 검토.

❓ 열린 질문

  • IOI 2026의 비공식·비감독 평가라는 조건은 535.4/600점과 인간 최고점 498.27점의 비교를 해석할 때 어떤 한계를 두는가?
  • Nano와 Ultra에서 달랐던 SFT·RL의 효과는 모델 규모별 특화 방식 선택에 어떤 기준을 제공하는가?
  • Hugging Face·논문·NeMo-Skills의 공개 자료로 성과를 재현하려면 상당한 학습·추론 연산이 구체적으로 얼마나 필요한가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.