Source-linked AI summary

WeatherNext 3: Increasing resolution and performance of global weather models with raw observations

Stephan Rasp, Boris Babenko, Dominic Masters, Andrew El-Kadi, Samier Merchant, Guy Shalev, Ilan Price, Fred Zyda, Remi Lam, Sasha Shysheya, Matthew Willson, Stratis Markou, Shreya Agrawal, Suhani Vora, Mohammed Alewi Hassen, Sunny Mak, Tom R. Andersson, Megan Bela, Akib Uddin, Nofar Peled Levi, Ben Gaiarin, Ferran Alet, Aaron Bell, Peter Battaglia, Alvaro Sanchez-Gonzalez

arXiv:2609.03582v1cs.LG

TL;DR

AI 날씨 모델은 낮은 해상도와 직접 관측이 아닌 분석 자료에 의존한다는 한계가 있다. WeatherNext 3는 low-latency 위성 자료와 희소 관측을 입력해 시간별 0.1° 예측을 생성하며, 다양한 평가에서 state-of-the-art 확률적 예보 성능을 달성한다.

  • 문제

    분석 자료만으로 학습된 AI 날씨 모델은 분석 자료의 편향, 오래된 업데이트 주기, 간접적인 관측 동화에 따른 정보 손실을 물려받는다.

  • 방법

    WeatherNext 3는 low-latency 위성 영상을 직접 입력하고, 위성 유도 강수량·사이클론·희소 지점 관측 자료를 대상으로 prediction head를 학습한다.

  • 결과

    WN3는 state-of-the-art 확률적 날씨 예보 성능을 달성했으며, 대부분의 분석 지표에서 WN2와 ECMWF’s AIFS ENS v2를 능가하는 동시에 시간별 0.1° 단일 고도 출력을 제공한다.

  • 시사점 및 한계

    정보 밀도가 높은 관측을 모델의 입력과 출력에 활용하면 AI 기반 날씨 예측에서 분석 자료만을 이용한 학습의 한계를 완화할 수 있다.

  • 시사점 및 한계

    개별 WN3 샘플에는 공간적·시간적 인공 패턴이 나타나며, 지점 예측에서 격자 형태의 강수 패턴과 6시간 경계에 걸친 불연속성이 포함된다.

Abstract

from arXiv · show

State-of-the-art AI weather models have shown impressive medium-range forecast skill and computational efficiency, but suffer two key shortcomings: their forecasts have lower spatial and temporal resolution than the best physics-based models and they are exclusively initialized with and trained on analysis data. As a result, they cannot directly make use of observations, and any biases in the analysis are inherited by the forecast. WeatherNext 3 addresses these shortcomings and establishes a new state-of-the-art for probabilistic medium-range forecasting skill. First, WeatherNext 3 generates new forecasts every hour (rather than every 6 hours like traditional global models) by ingesting low-latency geostationary satellite data. Second, WeatherNext 3's temporal and spatial resolution are on par with physics-based global models, with hourly time steps and 0.1 degree resolution for single-level variables, including solar radiation and cloud cover. Third, WeatherNext 3 moves beyond traditional analysis variables by learning to predict satellite-derived precipitation estimates, as well as tropical cyclone and station observations. Modelling sparse station data allows WeatherNext 3 to make 2m temperature and dewpoint predictions at any location and time, conditioned on local geographical features, with substantially lower error than competing global models, even when evaluated against unseen stations. Together, WeatherNext 3's capabilities move operational AI-based weather forecasting beyond emulating the traditionally distinct stages of data assimilation, forecasting and post-processing, which helps to further push the frontier of performance and granularity for global weather prediction.

1. 서론

WeatherNext 3는 raw observation을 직접 입력하고 예측해, analysis-only AI weather model에서 물려받은 편향과 지연을 해결한다. Analysis 및 observation benchmark에서 새로운 최첨단 성능을 확립하는 동시에, 시간 단위의 고해상도 전 지구 예보를 제공한다.

  • Analysis-only model은 analysis 편향과 6시간 주기의 생산 사이클을 물려받아 raw observation을 직접 활용하는 능력이 제한된다.지적된 한계에는 강수량과 지표면 기온의 편향, 그리고 operational analysis의 제공 지연이 포함된다.
  • WeatherNext 3는 raw observation을 직접 입력하고 예측해, analysis 및 observation benchmark에서 새로운 최첨단 성능을 확립한다.이 model은 AI weather forecasting에서 observation을 직접 활용하려는 기존 연구를 확장하는 방법으로 소개된다.
  • WN3는 최신 geostationary satellite imagery를 입력해 매시간 새로운 예보를 생성한다.Satellite input은 매시간 제공되며, 최신 frame의 operational latency는 1시간보다 약간 짧다.
  • WN3는 WeatherNext 2에서 제공되지 않던 solar radiation과 cloud cover를 포함해, 모든 single-level variable에 대해 시간 단위 0.1° output을 생성한다.
  • WN3는 satellite data에서 유도된 전 지구 시간 단위 precipitation product를 예측하도록 학습되며, 전 세계 어느 위치에서나 지리 정보를 반영한 2m temperature와 dewpoint를 예측한다.

2. WeatherNext 3

WeatherNext 3는 raw satellite 및 sparse station observations를 analyses와 함께 입력해, 확률적 전지구 예측을 multimodal·시간별 초기화 예측으로 확장한다. 이 second-order trajectory model은 혼합 temporal resolution, 연속적인 local output, 그리고 WN2보다 공간·시간 해상도가 크게 세밀한 15일 64-member ensemble을 지원한다.

  • 모델링과 불확실성: 이 모델은 autoregressive field와 target-only field를 공동 예측하며, aleatoric noise와 epistemic dropout을 결합한 functional perturbation ensemble을 통해 불확실성을 표현한다.Autoregressive field는 이후 단계에 입력되지만 target-only field는 재입력 없이 예측된다. WN3는 두 개의 seed와 epistemic dropout을 사용한다.
  • Trajectory modeling: WN3는 날씨 trajectory를 6시간 outer window상에서 더 세밀한 inner time step을 갖는 second-order Markov process로 모델링해 15일, 64-member ensemble forecast를 생성한다.각 factor는 앞선 두 window로부터 6시간 window를 예측하며, 더 세밀한 temporal support를 갖는 field는 고유한 inner step에서 예측된다.
  • 다중 데이터 modality와 해상도: WN3는 서로 다른 공간 해상도, 시간 주기, latency를 갖는 modality를 별도의 native-resolution encoder와 decoder로 처리하고, 이를 공유 icosahedral processor mesh를 통해 연결한다.이 설계는 모든 modality를 하나의 공통 입력 해상도로 regrid할 필요를 없앤다.
  • 관측 입력과 시간별 초기화: 정지궤도 위성을 직접 ingest하면 6시간 간격 초기화 대신 시간별 예측 초기화가 가능해지며, 특히 빠르게 변화하는 강수에서 short-lead skill이 향상된다.위성 데이터는 HRES analysis보다 더 자주 이용 가능하므로 예측을 더 신속하게 갱신할 수 있다.
  • Latent interpolation을 통한 시간·공간 연속 출력: 연속 latent interpolation은 지역 관측소 metadata와 0.1° latent representation을 결합해 임의의 위치와 시간에서 2m temperature와 dewpoint를 예측한다.조건화 metadata에는 정확한 고도, 육지·해양 여부, 그리고 해당 관측이 outer 6시간 step 내에서 갖는 offset이 포함된다.

3. 평가 방법론

평가는 CRPS를 주요 metric으로 사용하고 task-specific measure를 추가하면서, task별 state-of-the-art baseline과 독립적인 ground truth를 식별한다. 또한 미관측 station 성능, 여러 product에 걸친 precipitation, 매시간 forecast update의 operational benefit을 별도로 평가한다.

  • 평가 설계: WN3의 확장된 capability는 단일 model이나 reference로 포괄되지 않으므로, 과제별 state-of-the-art baseline과 독립적인 ground truth를 선정한다.비교를 위해 서로 다른 forecast resolution을 interpolation한다.
  • Analysis와 weather station: Analysis prediction은 HRES-fc0와 비교하고, AIFS ENS는 자체 control fc0와 비교하며, unseen METAR 및 Mesonet station은 bilinear interpolation을 통해 독립적인 station evaluation을 제공한다.Station evaluation은 wind speed에도 적용되며, WN3 station-head prediction은 interpolation 전에 0.05° grid에서 query한다.
  • Precipitation: 서로 다른 product trade-off를 반영하기 위해 precipitation은 IMERG Final, MRMS Pass-2, rain gauge와 비교해 평가하지만, IMERG는 WN3의 training target이므로 독립적이지 않다.계산상의 이유로 MRMS는 0.05°로 subsample하고, rain-gauge prediction은 station location으로 bilinear interpolation한다.
  • Metrics: CRPS를 주요 evaluation metric으로 사용하며, 값이 낮을수록 forecast가 우수하다. Precipitation에는 Brier Score, reliability diagram, 그리고 4 mm/6h로 제한한 evaluation을 추가로 사용한다.신뢰할 수 있는 evaluation을 수행하기에는 true positive가 지나치게 희소하므로, extreme precipitation은 future work로 남긴다.
  • Latency-adjusted evaluation: Update frequency 증가에 따른 skill benefit을 정량화하기 위해, hourly WN3 forecast를 6-hourly initialization을 사용하는 그 외에는 동일한 model과 비교하며, 7 hours of operational latency를 가정한다.Latency 가정에는 raw-input availability에 필요한 6시간과 model execution 및 dissemination에 필요한 최대 1시간이 포함된다.

4. 결과

WeatherNext 3는 분석, 관측소, 강수, 사이클론 및 운영 baseline 평가 전반에서 state-of-the-art 성능을 달성하며, 시간별 위성 기반 초기화와 고해상도가 초기 lead-time 성능을 향상시킨다. 그러나 marginal 및 spatial 성능이 우수함에도 개별 sample에서는 공간적·시간적 artifact가 나타난다.

  • Analysis scorecards: WN3는 대부분의 상층 target과 평가된 모든 지표면 variable에서 WN2를 앞서며, 상층의 약 5% 개선은 동일한 skill에 도달하는 lead time을 약 6시간 늘리는 효과로 이어진다.지표면 variable의 가장 큰 개선은 2m temperature에서 나타나며, 상층 humidity는 geostationary satellite imagery로 특히 큰 혜택을 얻는다.
  • Observational targets: WN3 station-head prediction은 WN2 대비 단기 lead의 2m-temperature CRPS를 최대 30%, ENS 대비 40% 낮추며, ENS 대비 relative-humidity도 유사한 폭으로 개선한다.0.1° analysis prediction은 초기 lead의 10m-wind-speed CRPS도 5% 낮추며, station-head prediction은 불필요한 lapse-rate post-processing을 피한다.
  • Precipitation: WN3 precipitation head는 IMERG 대비 초기 lead CRPS를 최대 60%, MRMS 대비 30%, rain gauge 대비 10% 낮추며, 15일까지 calibration을 유지한다.시간별 satellite-enabled update는 latency-adjusted 6-hourly forecast보다 lead time을 2–3시간 확보하며, PARDIG는 실시간 MRMS CRPS가 상당한 차이로 가장 낮다.
  • Distribution and artifacts: WN3는 cyclone track과 intensity에서 비교적 작지만 일관된 개선을 보이고, 1–3일에서 더 큰 extent 개선을 보이지만, ensemble은 전반적으로 WN2보다 under-spread가 심하다.Spatially pooled precipitation skill은 pooling size가 커져도 체계적으로 저하되지 않지만, 개별 sample에는 hexagonal grid artifact와 station-head temperature의 6-hour boundary jump가 나타난다.
  • Operational comparison: WN3는 첫 forecast week 동안 모든 상층 variable에서 AIFS ENS를 약 10% 앞서며, 대부분의 single-level variable, station metric 및 lead time에서도 이를 능가한다.실시간 precipitation에서는 PARDIG의 MRMS CRPS가 가장 낮고, rain gauge 기준으로 PARDIG와 IMERG는 대체로 동등한 수준이다.

5. 논의

WeatherNext 3는 확률적 중기예측 성능의 state-of-the-art 달성, 0.1° 단일 레벨 해상도, 시간별 초기화를 통해 예측 성능과 운용 역량을 향상한다. 또한 분석 데이터에만 의존하지 않고 위성 유래 강수 재분석과 관측소 관측을 포함한 관측 데이터를 직접 학습한다.

  • 예측 성능: WeatherNext 3는 확률적 날씨 예측에서 새로운 state-of-the-art를 수립하며, 대다수의 분석 지표에서 WN2와 ECMWF’s AIFS ENS v2를 능가한다.이는 선행 모델과 주요 운용 AI 모델을 모두 대상으로 한 본 논문의 핵심 예측 성능 결과를 확립한다.
  • 해상도와 초기화: WeatherNext 3는 0.1° 해상도에서 단일 레벨 변수를 생성해 ECMWF ENS와 보조를 맞추며, low-latency 위성 입력을 사용해 매시간 예측을 초기화한다.이러한 역량을 통해 공간적·시간적 출력 세분성이 최상위 전통적 전지구 수치예보 시스템과 동등해진다.
  • 관측 기반 학습: 고품질 관측에 대한 직접 학습은 WeatherNext 3가 분석 데이터에 알려진 편향과 부정확성을 우회하도록 돕는다.강수의 경우 모델은 전지구 우주 탑재 레이더 데이터에서 도출된 강수 재분석인 PARDIG를 사용하며, 예측은 여러 ground truth와 비교해 평가된다.
  • 분석 데이터 너머: WeatherNext 3는 분석 데이터에만 의존하지 않고 정보 밀도가 높고 low-latency인 관측을 사용하며, 동시에 분석 자료가 조밀하고 중단 없는 학습 데이터를 제공하지만 대기의 최선의 추정치에 불과하다는 점을 인식한다.ERA5는 분석 데이터만 사용하는 방식의 한계에도 불구하고 AI 날씨 모델 발전에 중요한 기여를 한 것으로 평가된다.

면책 조항

WeatherNext는 실험적 AI 예보 시스템으로, 그 예측은 공식 경보가 아닌 정보 제공 목적이다. 사용자는 비상 당국과 각국 기상청의 안내를 우선해야 한다.

  • 면책 조항: WeatherNext 예보는 실험적으로 제공되며 현 상태 그대로 사용해야 하고 공식 악천후 경보가 아니다. 생명과 재산을 보호하려면 현지 비상 당국과 각국 기상청의 안내를 따라야 한다.WeatherNext와 그 출력의 사용에는 Terms of Service가 적용된다.
  • 면책 조항: 이 문서는 European Centre for Medium-Range Weather Forecasts (ECMWF)의 데이터와 제품을 기반으로 한다.

부록 · A.1. 모델 세부사항 · A.1.1. 모델 정식화

WeatherNext 3는 다중 해상도 입력을 정제된 mesh로 인코딩하고 격자형 및 연속 예측을 모두 디코딩하는 probabilistic operator로 대기의 시공간 필드를 표현한다. End-to-end composite objective는 이질적이고 희소하며 불규칙한 관측에 대한 autoregressive training을 지원한다.

  • A.1.1. 모델 정식화: 대기는 각 timestep과 location에서 N개의 시공간 물리 필드로 표현되며, 각 필드는 고유한 domain, time subset, value space 위에 정의된다.
  • A.1.1. 모델 정식화: 단일 noise vector는 conditional normalization layer를 통해 aleatoric forecast uncertainty를 parameterize하며, operator는 FGN (Alet et al., 2025)을 기반으로 구축된다.
  • A.1.1. 모델 정식화: Encode–process–decode operator는 두 해상도의 input grid, pointwise latent encoding, 그리고 각 입력을 40962×1024 latent feature를 갖는 6-times-refined icosahedral mesh로 매핑하는 GNN을 사용한다.
  • A.1.1. 모델 정식화: 격자형 필드는 native latitude–longitude resolution에서 pointwise로 디코딩되는 반면, station prediction은 0.1° latent grid를 연속적으로 query한다.
  • A.1.1. 모델 정식화: 연속 query는 bilinear interpolation, 4-layer width-768 CNN, local surface feature, query time을 결합하여 sparse-observation training과 임의의 시공간 추론을 가능하게 한다.
  • A.1.1. 모델 정식화: Training은 두 개의 sampled trajectory에서 계산한 fair CRPS를 사용해 R개의 autoregressive rollout step에 걸쳐 end-to-end로 수행되며, modality별 weight가 grid size와 sampling density에 무관하게 상대적 중요도를 독립적으로 조절한다.
  • A.1.1. 모델 정식화: 이용 가능한 station report와 결측이 아닌 cyclone target에 대해 loss를 평균내면 희소한 modality가 압도되는 것을 방지할 수 있으며, input-output variable은 일반적으로 preceding frame에 대한 residual target을 사용한다.

A.1.2. 추가 모델 수정

추가 수정은 training calibration을 개선하고, 누적 및 결측 input을 처리하며, operational robustness와 scalable processing을 지원한다. WN3는 대규모 구현을 위해 특정 sea-surface-temperature preprocessing과 spatial sharding도 적용한다.

  • Global mean loss: 대응하는 base-variable loss의 0.3으로 가중한 globally pooled CRPS term은 precipitation과 cloud cover에서 sample별 ensemble-member bias를 줄인다.이 수정은 local point-wise marginal CRPS만 사용해 training할 때 관찰된 bias를 해결한다.
  • Cumulative variables: Cumulative variables는 interval accumulations로 표현하고 HRES input과 target에서 de-accumulation하며, HRES-fc0은 de-accumulation 후 항상 0이 된다.변수는 cdir, fdir, ssrd, tp이며, interval은 initialization time부터 해당 lead time까지로 정의한다.
  • Input dropout for operational robustness: Input dropout은 autoregressive input을 사용할 수 없어도 WN3가 skilful forecasts를 생성하도록 training하여 별도의 initialization-time 처리를 없앤다.여기에는 첫 단계 cumulative input의 부재, operationally unavailable한 IMERG와 PARDIG, 그리고 이전 training 연도의 결측 input이 포함된다.
  • Sea surface temperature (sst): Sea-surface temperature에서는 Alet et al. (2026)과 같이 ERA5 및 HRES land mask를 사용해 결측 HRES-fc0-5 land value를 dataset의 minimum value로 대체한다.ERA5의 SST validity mask는 0.25°이고 HRES의 land-sea mask는 0.1°이다.
  • Spatial sharding: Spatial sharding은 기본적으로 icosahedral mesh node를 longitude 기준으로 partition하여 grid-to-mesh와 대부분의 고비용 sharding operation을 local로 만들고, mesh-to-grid scatter에는 global communication을 유지한다.이 설계는 대규모 WN3 processing에서 partition 간 communication을 줄인다.

A.1.3. 학습

WeatherNext 3는 관측 modality를 추가하면서 시간·공간 해상도를 점진적으로 높이는 다단계 curriculum을 사용한다. 특화 finetuning, normalization, inference-time clipping으로 cyclone, station, autoregressive, bounded-variable prediction을 지원한다.

  • 해상도의 점진적 증가: curriculum은 ERA5 또는 HRES-fc0-5, geostationary satellite imagery, IMERG 및 PARDIG precipitation, hourly sub-step analysis target으로 시작한 뒤 추가 modality를 도입한다.학습 과정에서 spatial resolution을 점진적으로 높이고 추가 observation modality를 도입한다.
  • Cyclone finetuning: Cyclone finetuning에서는 먼저 backbone을 고정한 채 새로운 output head를 학습한 다음, 전체 model의 고정을 해제해 joint optimization을 수행한다.이 2단계 과정은 별도의 warmup phase를 유지하면서 cyclone attribute map을 도입한다.
  • Autoregressive 및 frozen finetuning: Autoregressive finetuning에서는 rollout을 2에서 8 step으로 늘리며, frozen high-resolution finetuning에서는 station head를 학습하고 이를 autoregressive stage와 교차 배치한다.최종 schedule은 7 autoregressive step 이후 step의 75%를 차지하는 frozen stage, 8-step stage, 그리고 backbone과 station weight를 병합해 사용하는 두 번째 frozen stage로 구성된다.
  • Output clipping: Inference 중 bounded variable을 clipping하면 rollout value가 training distribution을 벗어나 발생하는 stationary pixel artifact를 방지한다.Cloud cover는 [0, 1]로 clipping하고, specific humidity, solar radiation, precipitation은 autoregressive feedback 전에 ≥0으로 clipping한다.

A.2. 평가에 관한 추가 정보 … A.3.8. IBTrACS 격자장

부록은 WeatherNext 3의 평가 선택과 데이터셋 구성을 명시하며, 운용상 중요한 CRPS 변형, baseline 데이터 처리, 관측 전처리, 특수한 강수 및 사이클론 target을 포함한다. 또한 비교와 모델 출력에 영향을 미치는 데이터셋의 한계와 구현 세부사항을 기술한다.

  • A.2. 평가에 관한 추가 정보; A.2.1. CRPS: WN3 multi-seed ensemble은 i.i.d. 가정을 위반하므로 Biased CRPS를 사용하며, ENS는 전체 ensemble을 사용할 수 없어 예외를 적용한다.이 biased metric은 운용 예보 skill을 더 잘 반영하며, 약 50개 member로 구성된 ensemble에서는 unbiased CRPS와의 차이가 작다.
  • A.2.2. Pooled CRPS: Pooled CRPS는 위도 가중 spatial averaging에 앞서, 차원을 보존하는 spatial average 또는 max pooling을 거의 동일한 면적의 위도–경도 patch에 적용한다.각 grid point를 중심으로 하는 patch마다 pooled value를 계산한다.
  • A.3. 데이터셋에 관한 추가 정보: 부록은 누적 변수의 accumulation-period suffix를 포함해 보충 데이터셋 설명과 variable-abbreviation table을 제공한다.이 자료는 평가 전반에서 사용된 추가 데이터셋을 다룬다.
  • A.3.1. ECMWF ENS와 AIFS ENS baseline: ECMWF ENS와 AIFS ENS baseline은 TIGGE, MARS 또는 ECMWF open data에서 다운로드하고, 평가 grid로 보간한 뒤, 불완전한 ensemble 사용 가능성에 맞게 조정한다.ENS 평가는 control forecast 없이 48개 member만 다운로드했으므로 fair CRPS를 사용하며, TIGGE–MARS 해상도 차이로 6시간 lead time에서 작은 error spike가 발생한다.
  • A.3.2. Geostationary satellite mosaic: WN3 학습에는 여러 instrument와 0.1°로 regrid된 11 visible and infrared channels를 결합한 실시간 geostationary satellite mosaic을 사용한다.Historical mosaic은 2016년까지 확장되며 여러 satellite 및 instrument generation을 포괄한다.
  • A.3.3. 현장 지표면 관측; A.3.4. 고도 및 육지-해양 마스크: 시간별 현장 관측 데이터셋은 2001년 유월부터 METAR, Mesonet, ICOADS 관측을 결합하며, 신뢰할 수 없는 기록을 제거하기 위해 품질 필터링, 시간 선택, 물리적 범위를 적용한다.관측소 예측에는 전 지구 고도 및 토지 피복 데이터셋에서 도출한 위도, 경도, 고도, 육지/해양 메타데이터도 필요하다.
  • A.3.5. IMERG; A.3.7. MRMS: IMERG Final은 30분 데이터를 hourly accumulation으로 집계한 0.1° precipitation estimate를 제공하며, MRMS는 독립적으로 평가된 radar- 및 gauge-calibrated hourly estimate를 제공한다.MRMS 평가는 radar quality가 낮은 영역을 제외하고 spatial domain을 제한한다.
  • A.3.6. PARDIG; A.3.8. IBTrACS gridded fields: PARDIG는 satellite 및 reanalysis 기반으로 별도 학습된 precipitation estimator로, preliminary evaluation에서 radar 또는 rain gauge와 비교할 때 IMERG Final보다 substantially more skillful한 것으로 나타났다. IBTrACS는 modified wind-radius imputation을 적용해 gridded cyclone target으로 변환한다.PARDIG는 four-hour geostationary-satellite, pressure-level, surface-variable, microwave-sounder input window를 사용하며, cyclone target에는 34kt, 50kt, 64kt threshold를 사용한다.
Loading 2609.03582v1…