The OlmoEarth Platform: Geospatial inference at planetary scale
Quick Summary
OlmoEarth Platform은 위성영상의 검색·전처리·모델 추론·지도 생성을 분산 처리해 대륙 규모의 지리공간 추론을 약 하루 만에 저비용으로 수행하는 운영 인프라다.
🖼️ 인포그래픽
🖼️ 4컷 인포그래픽
💡 한 줄 요약
OlmoEarth Platform은 위성영상의 검색·전처리·모델 추론·지도 생성을 분산 처리해 대륙 규모의 지리공간 추론을 약 하루 만에 저비용으로 수행하는 운영 인프라다.
📌 핵심 요약
- OlmoEarth 모델군은 약 10테라바이트의 다중 모달 위성 데이터로 사전학습됐으며, 산림 파괴 감시·식량 안보·산불 위험 분석 등에 활용되고 있다.
- Ai2는 환경 분야 조직이 데이터 라벨링부터 미세조정, 평가, 대규모 추론까지 직접 운영하기 어렵다는 문제를 해결하기 위해 OlmoEarth Platform을 구축했다.
- 위성 추론은 여러 공급자의 영상과 센서·분광 대역·시점을 다루면서 서로 다른 투영법과 해상도를 정렬하고, 구름이나 누락 관측을 처리하며, 모든 예측을 동일한 좌표 격자에 맞춰야 한다.
- 플랫폼은 작업을 CPU 기반 데이터 준비, GPU 기반 추론, CPU 기반 후처리로 분리하고 지역을 독립적인 파티션과 윈도로 나눠 수천 대의 컴퓨팅 인스턴스에서 병렬 실행한다.
- 현재 대륙 규모 지역을 대략 하루 안에 처리할 수 있으며, 자체 영상 메타데이터 색인, 필요한 구간만 읽는 데이터 접근 방식, 멱등적 작업 재시도와 공급자 대체를 통해 속도와 복원력을 확보한다.
🧩 주요 포인트
- 영상 확보와 전처리가 모델 실행보다 오래 걸리는 경우가 많다 → CPU·입출력 중심 작업을 GPU 추론과 분리해 고가의 GPU가 모델 계산에 집중하도록 했다.
- 각 지역 파티션과 윈도를 독립적으로 계산할 수 있다 → 대규모 병렬화뿐 아니라 실패한 부분만 안전하게 다시 실행하는 복구 구조도 가능해졌다.
- 외부 영상 카탈로그에 추론 시점마다 대량 질의를 보내지 않고 자체 색인을 지속적으로 갱신한다 → 공급자 부하를 줄이면서 필요한 픽셀만 빠르게 선택하고 읽을 수 있다.
🧠 상세 정리
1. 개방형 모델만으로 해결되지 않는 운영 격차
OlmoEarth는 약 10테라바이트의 다중 모달 위성 데이터로 사전학습된 지구관측 기반 모델군이다. 정부, 비정부기구, 사명 중심 조직들은 이를 산림 파괴 감시, 식량 안보, 산불 위험과 같은 과제에 맞게 적용하고 있다. 강한 엔지니어링 조직이라면 공개된 모델만으로도 자체 시스템을 구축할 수 있지만, 환경 분야의 많은 조직은 데이터 라벨링, 모델 미세조정, 평가, 대규모 추론을 모두 운영할 인력과 기반시설을 갖추지 못했다. Ai2는 Skylight와 EarthRanger 같은 실사용 플랫폼을 10년 이상 운영하면서 모델을 적절한 시점과 장소에서 비용 효율적으로 실행하고, 성능을 감시하며, 원시 출력을 실행 가능한 정보로 바꾸는 과정이 실제 성과에 필수적이라고 판단했다. 또한 산출물이 협력 조직이 원하는 결과로 이어지는지 검증하는 일까지 운영 범위에 포함돼야 한다고 보았다. OlmoEarth Platform은 이런 전체 과정을 지원하기 위해 미세조정과 평가에서 대규모 지리공간 추론까지 연결하는 인프라로 구축됐다.
2. 일반적인 모델 추론과 다른 위성 데이터의 복잡성
일반적인 언어 또는 컴퓨터 비전 모델은 수 메가바이트의 입력을 받아 짧은 시간 안에 결과를 내는 경우가 많지만, 지구관측 작업은 입력 규모와 공간적 제약이 크게 다르다. 최대 성능을 위한 기반 모델 미세조정 작업 하나가 테라바이트 단위 데이터를 이동시키고 수 시간 동안 실행될 수 있으며, 입력에는 여러 분광 대역과 센서 유형, 시간대가 함께 포함된다. 영상은 서로 다른 공급자로부터 오고 각각의 투영법과 해상도가 다르며, 일부 관측은 누락되거나 구름에 가려져 있을 수도 있다. 출력 자체가 지도이기 때문에 개별 예측은 주변 지역과 동일한 투영법 및 좌표 격자에 정확하게 정렬돼야 하고, 파티션 경계에서도 지리적 일관성을 유지해야 한다. 특히 예측 작업은 모델을 실행하는 시간보다 영상을 내려받고 준비하는 데 더 많은 시간을 쓸 수 있으므로, 대용량 입출력과 재투영·리샘플링 계산을 함께 처리하는 데이터 파이프라인이 전체 성능을 좌우한다.
3. 작업 성격에 맞춘 3단계 하드웨어 분리
OlmoEarth Platform은 데이터 준비가 추론 시간을 지배하는 상황에서 고가의 GPU를 내려받기나 좌표 변환에 사용하지 않도록 작업을 세 단계로 나눈다. 첫 단계인 데이터 확보와 전처리는 높은 입출력 성능을 갖춘 CPU 환경에서 영상을 가져오고, 재투영·정렬·정규화한 뒤 추론 중 빠르게 읽을 수 있는 형식으로 저장한다. 두 번째 단계는 GPU에서 모델의 순전파를 실행하고, 최소한으로 처리한 출력을 곧바로 저장소에 기록한다. 세 번째 단계는 다시 CPU를 사용해 윈도별 출력을 하나의 지도에 결합하고, 마스크나 값 재조정을 적용한 뒤 Zarr, GeoTIFF, GeoJSON과 같은 사용자 친화적 형식으로 내보낸다. 이 단계들은 여러 머신에 분산되며, 다중 프로세스 데이터 로더가 각 GPU에 입력을 계속 공급하고 완료된 결과는 블롭 저장소로 바로 전송된다. 결과적으로 데이터 준비와 지도 조립이 GPU를 기다리게 하는 시간을 줄이고, 각 하드웨어를 가장 적합한 작업에 배치할 수 있다.
4. 파티션과 윈도를 이용한 독립적 병렬 실행
대규모 추론 실행 계층인 OlmoEarth Run은 요청된 지리적 영역을 개별 컴퓨팅 인스턴스가 담당할 수 있는 파티션으로 나누고, 각 파티션을 모델이 처리하는 더 작은 윈도로 다시 세분한다. 윈도 하나는 별도의 순전파로 독립 처리할 수 있으므로 한 지역의 계산이 다른 지역의 완료를 기다릴 필요가 없다. 주 단위 크기의 지역은 약 100개 안팎의 파티션이 될 수 있고, 대륙 규모 작업은 수천 개의 파티션으로 확장될 수 있다. 인접 파티션에는 작은 중첩 영역을 두며, 최종 래스터를 조립할 때 이 부분을 조정해 경계선이 드러나지 않도록 한다. 같은 처리 단계를 수천 대의 컴퓨팅 인스턴스에서 동시에 실행할 수 있기 때문에, 단일 요청이 수백 명의 워커와 수천 개의 프로세스로 확장되는 구조가 만들어진다. 이러한 독립성은 처리량을 높이는 동시에 특정 파티션만 실패했을 때 전체 지도를 처음부터 다시 계산하지 않아도 되는 기반이 된다.
5. 대륙 규모 병렬화의 성능과 조정 가능한 비용
북미 전체를 대상으로 한 산불 위험 지도 생성 작업에서는 최고점 기준 약 19,600개의 CPU와 994개의 GPU가 병렬로 사용됐고, 네트워크 처리량은 초당 168기가바이트를 넘었다. 이 병렬화는 순차 실행 시 약 4,737시간으로 추정된 계산을 실제 경과 시간 약 30.5시간으로 줄여 155배의 속도 향상을 만들었다. 플랫폼은 일반적으로 수십 테라바이트의 영상을 처리하면서 대륙 규모 영역의 추론을 대략 하루 안에 수행하며, 비용은 제곱킬로미터당 1센트의 일부 수준이다. 다만 워커 수를 계속 늘릴 수 있는 것은 아니며, 많은 워커는 클라우드 자원 할당 한도에 부딪히므로 병렬도는 실행별로 조정해야 하는 변수다. 출력 해상도를 높이면 세부 표현과 함께 데이터량 및 계산량이 늘고, 더 큰 모델은 정확도를 위해 GPU 시간을 더 사용하며, 원본 영상을 캐시하면 저장 공간을 소비하는 대신 같은 지역의 반복 실행을 빠르게 할 수 있다. 따라서 최적 설정은 요구되는 상세도와 정확도, 반복 실행 여부, 사용 가능한 예산에 따라 달라진다.
6. 위성 장면 선택과 자체 메타데이터 색인
플랫폼은 주어진 지역과 기간에 대해 어떤 위성 장면을 모델 입력으로 사용할지 먼저 결정해야 한다. 광학 영상인 Sentinel-2에서는 일반적으로 구름이 가장 적은 장면이 우선되지만, 합성개구레이더 영상에서는 사용 가능한 편파 채널이 더 중요한 선택 조건이 될 수 있다. 공개 STAC 카탈로그와 개방형 표준을 우선 활용하지만, 대규모 추론 작업이 한꺼번에 만드는 수천 건의 메타데이터 질의를 외부 서비스가 동시에 처리하기는 어렵다. 이를 해결하기 위해 플랫폼은 새 영상이 게시될 때마다 갱신되는 자체 메타데이터 색인을 운영하며, 변경 알림을 제공하지 않는 공급자에 대해서는 상위 색인을 몇 분 간격으로 확인한다. 색인에는 장면 정보뿐 아니라 실제 픽셀을 가져올 수 있는 모든 위치가 기록되고, 실행 시 가장 적합한 출처를 선택해 COG나 Zarr 같은 클라우드 최적화 형식에서 파티션에 필요한 바이트 범위만 읽는다. 같은 색인은 Sentinel-1, Sentinel-2, Landsat, NISAR 영상을 제공하는 주석 도구에도 활용되므로 별도의 영상 수집 파이프라인을 만들 필요가 없다. Ai2는 새 영상에 대한 큐 기반 알림, 별도 병목이나 특수한 속도 제한이 없는 주요 클라우드 저장소, 범위 읽기를 지원하는 데이터 형식을 지구관측 데이터 공개의 권장 조건으로 제시한다.
7. 실패를 정상 상황으로 취급하는 복구 구조
대규모 분산 처리에서는 공급자 지연이나 일시적 중단, 잘못된 메타데이터, 필요한 대역 또는 윈도의 누락, 과도한 구름, 개별 작업 충돌이 반복적으로 발생할 수 있다. OlmoEarth Platform은 각 처리 단계와 지리 파티션의 작업마다 실행용 도커 컨테이너를 담은 가상 머신을 동적으로 준비한다. 러너는 작업 매개변수를 받아 실행하고 결과를 반환한 뒤 종료하며, 모든 작업은 재진입 가능하고 멱등적으로 설계돼 같은 작업을 다시 실행해도 안전하다. 플랫폼은 작업 상태 추적과 자동 재시도를 수행하고, 이용 가능한 경우 다른 공급자로 전환하며, 재시도로 해결할 수 있는 오류와 즉시 중단해야 하는 치명적 오류를 명확히 구분한다. 별도의 모니터링 프로세스는 멈추거나 응답하지 않는 러너를 감지해 해당 작업을 다시 시작한다. 이 구조는 실패 자체를 예외적인 사건으로 없애려 하기보다, 일부 작업의 실패를 전제로 전체 대규모 실행이 자동으로 진행되도록 만든다.
8. 자동 실행·변화 알림·임베딩으로 확장되는 로드맵
향후 플랫폼은 미리 추론 일정을 설정하거나 관심 지역에 새 영상이 색인될 때 작업을 자동으로 시작하는 기능을 개발하고 있다. 산림 파괴나 홍수와 같은 지표면 변화가 발생하면 사용자가 직접 래스터를 찾아 확인하지 않아도 알림으로 받을 수 있도록 변화 탐지 기능도 추진한다. 에이전트형 도구와 인터페이스는 데이터 선별, 특징 설계, 미세조정 모델의 개선점 탐색을 지원해 숙련된 머신러닝 연구자가 필요했던 작업의 접근 장벽을 낮추는 방향이다. 연구팀과 함께 윈도당 GPU 시간을 줄이는 효율적인 모델 구조를 개발하고, ERA-5 기상 데이터와 환경 요인을 더 자세히 보여주는 위성 등 새로운 센서 및 데이터 소스를 모델과 영상 색인에 추가할 계획이다. 전용 임베딩 모델과 전 지구 규모의 사전 계산 임베딩도 개발 대상으로, 많은 작업에서 원본 영상을 매번 전체 순전파하는 방식을 대체해 속도와 비용을 줄이는 것이 목적이다. 어려운 과제의 최대 성능을 위해 미세조정과 직접 추론은 계속 필요하지만, 임베딩은 더 넓은 범위의 효율적인 응용을 가능하게 할 수 있다. OlmoEarth Run은 도커 이미지를 실행할 수 있는 가상 머신과 블롭 저장소만 요구하며, 현재 운영 환경을 넘어 여러 클라우드와 협력 조직 자체 계정 및 컴퓨팅 환경에 배포할 수 있도록 설계됐다.
🧾 핵심 주장 / 시사점
- 지리공간 추론의 핵심 병목은 모델 순전파만이 아니라 영상 검색·전송·재투영·정렬이다. 플랫폼이 CPU 및 입출력 단계와 GPU 단계를 분리한 것은 이 병목의 실제 위치에 맞춰 자원을 배분한 결과다.
- 독립적인 파티션 구조는 속도와 복원력을 동시에 제공한다. 동일한 단위로 수천 개 작업을 병렬 실행할 수 있고, 재진입 가능하며 멱등적인 작업만 다시 실행함으로써 분산 환경의 일상적인 실패를 전체 작업 중단으로 확산시키지 않는다.
- 자체 메타데이터 색인과 범위 기반 픽셀 읽기는 외부 카탈로그에 추론 시점의 순간적인 질의 폭주를 전가하지 않으면서 전체 장면 다운로드도 피한다. 이 색인을 추론과 주석 도구가 함께 사용함으로써 하나의 영상 접근 체계를 여러 작업에 재사용한다.
✅ 액션 아이템
- OlmoEarth Platform의 CPU 기반 데이터 준비와 GPU 기반 추론 분리 기준을 영상 확보·전처리 병목에 맞춰 재정의한다.
- 대륙 규모 지역을 대략 하루 안에 처리하는 목표에 맞춰 독립적인 파티션과 윈도 단위 병렬 실행 범위를 점검한다.
- 자체 영상 메타데이터 색인과 필요한 구간만 읽는 접근이 공급자 부하와 복원력에 미치는 효과를 비교한다.
❓ 열린 질문
- OlmoEarth 모델군의 약 10테라바이트 다중 모달 위성 데이터 사전학습이 산림 파괴 감시·식량 안보·산불 위험 분석에 얼마나 유효한가?
- 여러 공급자의 센서·분광 대역·시점과 투영법·해상도를 동일 좌표 격자에 맞출 때 구름이나 누락 관측은 어떻게 처리할 것인가?
- 멱등적 작업 재시도와 공급자 대체가 수천 대 컴퓨팅 인스턴스 병렬 실행에서 실패 구간 복구를 어디까지 보장하는가?