IBM releases SOTA Granite Time Series PatchTST-FM-r2 model with commercial-friendly license
Quick Summary
IBM은 2026년 9월 8일 기준 GIFT Eval의 재현 가능한 제로샷 모델 중 종합 2위이자 상업 친화적 허용 라이선스 모델 중 최고 성능을 기록한 약 3억 8,500만 파라미터의 Granite Time Series PatchTST FM r2를 공개했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
IBM은 2026년 9월 8일 기준 GIFT-Eval의 재현 가능한 제로샷 모델 중 종합 2위이자 상업 친화적 허용 라이선스 모델 중 최고 성능을 기록한 약 3억 8,500만 파라미터의 Granite Time Series PatchTST-FM-r2를 공개했다.
📌 핵심 요약
- PatchTST-FM-r2는 별도 미세조정 없이 시계열을 예측하며, 최대 8,192스텝의 문맥, 유연한 예측 길이, 99개 분위수를 통한 확률적 예측과 결측값 대치를 지원한다.
- 2026년 9월 8일 기준 GIFT-Eval에서 테스트 데이터 누출 없이 평가된 재현 가능한 제로샷 모델 중 CRPS와 MASE 모두 2위이며, 기하평균은 각각 0.467과 0.6846이다. 벤치마크 학습 데이터를 사용할 수 있는 사전학습 모델까지 포함하면 각각 3위와 4위다.
- 기존 PatchTST-FM-r1의 트랜스포머 블록을 자기주의와 시간축 합성곱을 결합한 conformer 블록으로 바꾸고, 50% 중첩 패치와 Hamming 창 가중치 등을 적용했으며, 블록 수를 20개에서 30개로 늘렸다.
- 사전학습에는 선별한 GiftEvalPretrain, KernelSynth 기반 합성 데이터, GIFT-Eval 평가 세트 밖의 데이터로 만든 TSMixup, 길이 4,096의 CauKer 합성 시퀀스 약 50만 개를 사용했다. Apache 2.0과 OpenMDW 1.0 중 하나를 선택할 수 있으며 가중치·아키텍처·추론 파이프라인·벤치마크 재현 코드를 공개했다.
- granite-tsfm>=0.3.9와 Hugging Face를 통해 자체 데이터로 평가할 수 있다. Confluent Cloud의 Early Access 초기 포트폴리오는 PatchTST-FM-r1, FlowState-r1.1, TTM-r3, TSPulse이며, Apache Flink를 통해 실시간 스트림의 예측과 이상 탐지를 지원한다.
🧩 주요 포인트
- 제로샷 여부·재현 가능성·라이선스 조건에 따라 순위의 의미가 달라지므로, GIFT-Eval 성능 주장은 비교 대상과 2026년 9월 8일이라는 기준일을 함께 해석해야 한다.
- conformer와 50% 중첩 패치는 장기·단기 패턴 처리와 패치 경계 완화를 겨냥한 설계이며, 99개 분위수는 단일 예측값에 더해 불확실성 구간을 활용할 수 있게 한다.
- 학습 데이터 문서화와 Apache 2.0·OpenMDW 1.0 선택권은 도입 검토에 필요한 정보를 제공하지만 조직 자체의 모델 거버넌스·라이선스 검토를 대체하지 않으며, Confluent Cloud 초기 목록에는 PatchTST-FM-r2가 명시되지 않았다.
🧠 상세 정리
1. 별도 학습 없이 사용하는 시계열 기반 모델
IBM은 2026년 9월 9일 게시한 글에서 Granite Time Series 제품군의 새 모델인 PatchTST-FM-r2를 소개했다. 시계열 기반 모델은 데이터셋마다 별도의 모델을 학습하고 유지하는 대신, 사전학습된 모델로 처음 접하는 시계열을 제로샷 예측하는 접근을 제공한다. 이번 모델은 PatchTST-FM-r1의 후속 버전으로, 갱신된 아키텍처와 더 큰 사전학습 코퍼스에 확률적 예측 및 결측값 대치 지원을 결합했다. 약 3억 8,500만 파라미터 규모이며 수요, 가격, 에너지 부하, 교통량, 텔레메트리 등 다양한 시계열을 대상으로 한다. IBM은 모델 가중치뿐 아니라 아키텍처, 추론 파이프라인, 벤치마크 결과를 재현하는 코드까지 공개했다고 설명한다.
2. GIFT-Eval 제로샷 성능과 순위의 조건
원문은 기반 모델의 유용성을 개별 학습 대상이 아니었던 시계열에 대한 일반화 능력에서 찾으며, 제로샷 성능을 먼저 제시한다. 다양한 데이터셋과 예측 상황을 평가하는 GIFT-Eval에서 PatchTST-FM-r2는 2026년 9월 8일 기준 재현 가능하고 테스트 데이터 누출 없이 평가된 제로샷 모델 중 CRPS와 MASE 모두 2위를 기록했다. 두 지표는 낮을수록 좋으며, 기하평균 CRPS는 0.467, MASE는 0.6846이다. CRPS 비교에서는 TimesFM-3 바로 뒤에 위치했고, 같은 범주의 상업 친화적 허용 라이선스 모델 중에서는 최고 성능이라고 설명한다. 따라서 제목의 최고 성능 주장은 전체 모델에서 무조건 1위라는 의미가 아니라, 평가 범주와 라이선스 조건을 포함한 주장으로 읽어야 한다.
3. 벤치마크 학습 데이터를 허용한 모델과의 비교
GIFT-Eval에는 엄격한 제로샷 모델과 별도로 사전학습 모델로 분류되는 참가 모델도 있다. 이 범주의 모델은 GIFT-Eval 평가 데이터셋에서 학습용으로 나뉜 부분을 사전학습 코퍼스에 포함할 수 있으므로, 제로샷 범주와 허용되는 데이터 사용 조건이 다르다. 원문은 이러한 사전학습 모델까지 비교에 추가해도 PatchTST-FM-r2가 재현 가능한 모델 중 CRPS 3위와 MASE 4위를 유지한다고 제시한다. 또한 일부 경쟁 모델의 크기가 상당히 더 큰 상황에서도 Chronos-2, Timer-S1, Toto 계열의 여러 모델을 앞선다고 설명한다. 이 비교는 데이터 사용 범위를 넓힌 경쟁군에서도 성능이 상위권이라는 근거이지만, 제로샷 범주에서의 2위와는 구분해야 한다.
4. conformer로 장기·단기 시간 관계를 분담
PatchTST-FM-r2는 PatchTST 계열의 패치 기반 표현을 유지하면서 내부 블록을 conformer 방식으로 재설계했다. r1이 다중 헤드 자기주의와 피드포워드 네트워크를 결합했다면, r2는 다중 헤드 자기주의와 시간축 합성곱을 두 개의 반 단계 피드포워드 층이 감싸는 구성을 사용한다. 음성 처리에서 유래한 이 구조에서 합성곱은 가까운 시점의 국소적 패턴을 포착하고, 자기주의는 패치 사이의 장거리 관계에 집중할 수 있도록 설계됐다. 원문은 ETTh1 실제 표본의 주의 패턴을 근거로, 트랜스포머의 주의가 대각선 주변에 많이 모이는 반면 conformer에서는 먼 거리의 관계에 대한 주의가 나타난다고 설명한다. 백본의 합성곱 커널 크기는 3과 5를 사용하며, {5, 5, 3, 3} 순서가 반복된다.
5. 패치 경계 완화와 확률적 예측 확대
장기·단기 관계를 처리하는 블록 변경 외에도, r2는 패치 경계에서 예측이 매끄럽게 이어지도록 50% 중첩 패치를 적용했다. 여기에 Hamming 창 가중치와 중첩 후 합산하는 예측 방식을 사용해 패치 사이의 경계를 완화하고 예측 정확도를 높였다고 설명한다. 안정성을 위한 정규화도 추가했으며, 모델의 블록 수는 기존 20개에서 30개로 확대했다. 이러한 변경을 거친 모델은 약 3억 8,500만 파라미터를 가지며 최대 8,192스텝의 긴 문맥과 유연한 예측 길이를 지원한다. 출력은 점 예측에 한정되지 않고 99개 분위수 예측을 포함하므로, 사용자는 미래 값의 분포와 불확실성 구간을 함께 다룰 수 있다.
6. 사전학습 데이터의 구성과 투명성
원문은 실제 도입에서 모델 성능뿐 아니라 학습 데이터의 출처, 벤치마크 데이터 누출 가능성, 배포 시 고려사항도 중요하다고 강조한다. 문서화된 사전학습 코퍼스의 첫 두 구성요소는 선별한 GiftEvalPretrain 데이터셋과, 주기 커널을 수정하고 제한적인 증강을 적용한 KernelSynth 기반 맞춤 합성 데이터다. 세 번째는 Chronos에서 설명한 접근으로 생성하되 GIFT-Eval 평가 세트 밖의 데이터셋으로 제한한 TSMixup 코퍼스이며, 네 번째는 각각 길이가 4,096인 CauKer 합성 시퀀스 약 50만 개다. IBM은 이러한 투명성이 기업 사용자에게 순위표의 추가적인 성능 개선만큼 중요할 수 있다고 주장한다. 다만 데이터 공개가 조직 자체의 모델 거버넌스와 라이선스 검토 필요성을 없애지는 않으며, 불투명한 코퍼스보다 검토에 필요한 정보를 더 제공한다는 의미다.
7. 선택 가능한 라이선스와 Python 사용 예시
PatchTST-FM-r2는 Apache 2.0과 OpenMDW 1.0의 이중 라이선스로 제공되며, 사용자는 둘 중 하나를 선택할 수 있다. 원문은 두 라이선스 모두 사용·수정·배포에 폭넓은 권리를 제공하고, Linux Foundation의 OpenMDW는 AI 모델과 관련 자료를 위해 설계된 체계라고 설명한다. 아키텍처 구현은 Granite-TSFM 저장소에서 제공되며 PatchTST-FM-r1 체크포인트와도 하위 호환된다. Python 예시는 granite-tsfm>=0.3.9를 설치하고 Hugging Face에서 모델을 불러온 뒤, ETTh1의 HUFL 시계열에 문맥 길이 512와 예측 길이 64, 분위수 0.1·0.5·0.9를 설정한다. 파이프라인은 최근 512개 표본만으로 별도 미세조정이나 작업별 모델 적합 없이 예측하며, 입력은 수요·센서 텔레메트리·CPU 사용률 등 자체적인 정규 간격 시계열로 대체할 수 있다.
8. Confluent Cloud를 통한 스트리밍 활용
글의 마지막은 이번 공개를 Granite Time Series 모델 포트폴리오 확대와 연결하고, 정적인 DataFrame을 넘어 데이터가 지속적으로 유입되는 환경의 활용 방식을 소개한다. IBM과 Confluent는 최근 Confluent Cloud의 Early Access 프로그램을 통해 여러 Granite Time Series 모델을 제공하기 시작했다고 설명한다. 초기 포트폴리오에 명시된 모델은 PatchTST-FM-r1, FlowState-r1.1, TTM-r3, TSPulse이며, 이 목록에 PatchTST-FM-r2는 포함되어 있지 않다. 통합은 Confluent Cloud의 Apache Flink를 통해 기반 모델 추론을 스트리밍 애플리케이션 안에서 수행하도록 한다. 이에 따라 팀이 별도 머신러닝 환경을 마련하고 데이터를 옮기는 과정 없이도 실시간 스트림에서 예측과 이상 탐지 결과를 생성할 수 있다는 것이 원문의 설명이다.
🧾 핵심 주장 / 시사점
- PatchTST-FM-r2의 도입 가치는 제로샷 정확도와 상업 친화적 라이선스 선택권의 결합에 있으며, 성능 비교에서는 평가 범주와 기준일을 유지하는 것이 중요하다.
- 아키텍처 변경은 합성곱을 통한 국소 패턴 처리, 자기주의를 통한 장거리 관계 포착, 중첩 패치를 통한 경계 완화라는 서로 다른 문제를 겨냥한다.
- 공개된 학습 구성과 재현 코드는 자체 검증의 근거를 제공하지만, 실제 데이터에서의 성능 평가와 조직별 라이선스 검토까지 대신하지는 않는다.
✅ 액션 아이템
- granite-tsfm>=0.3.9와 Hugging Face를 이용해 자체 시계열에서 PatchTST-FM-r2의 제로샷 성능과 분위수 예측을 평가한다.
- GIFT-Eval의 CRPS 0.467·MASE 0.6846을 검토할 때 2026년 9월 8일 기준과 제로샷·재현 가능성·라이선스 조건을 함께 확인한다.
- 문서화된 학습 데이터와 Apache 2.0·OpenMDW 1.0을 근거로 조직의 모델 거버넌스·라이선스 적합성을 검토한다.
❓ 열린 질문
- 자체 시계열에서 PatchTST-FM-r2의 제로샷 예측과 99개 분위수 출력은 어느 정도의 성능을 보이는가?
- Apache 2.0과 OpenMDW 1.0 중 조직의 모델 거버넌스·라이선스 요구에 더 적합한 선택은 무엇인가?
- 초기 목록에 PatchTST-FM-r2가 명시되지 않은 Confluent Cloud Early Access에서 향후 이 모델도 제공될 예정인가?