Source-linked AI summary
A Station-Based Evaluation of Machine Learning-based Weather Forecasting Models in Northern Norway
Siyan Chen, Lars Uebbing, Eirik Mikal Samuelsen, Georgios Leontidis, Arnt-Børre Salberg, Sébastien Lefèvre, Robert Jenssen, Kristoffer Wickstrøm
TL;DR
복잡한 지형에서는 대부분의 근거가 전 지구 격자형 benchmark에서 나오기 때문에 MLWP 모델의 국지적 바람 예측 성능이 여전히 불확실하다. 본 연구는 Northern Norway의 관측소 관측자료를 사용해 다양한 예측 선행시간, 학습 기간, 위치, 바람 조건에서 FCN3과 GraphCast를 HRES와 비교 평가한다. HRES의 전체 오차가 가장 낮고, MLWP는 학습 기간 이후에도 비슷한 성능을 유지하지만, 강풍은 여전히 크게 과소평가된다.
문제
복잡한 지형에서 관측소 수준의 국지적 바람 예측에 대한 MLWP 성능은, 특히 학습 기간 이후와 강풍 사례에서 충분히 규명되지 않았다.
방법
본 연구는 격자형 FCN3, GraphCast, HRES 예측을 관측소 좌표로 보간하고, 해당하는 유효 시각의 관측값과 매칭한다.
결과
HRES는 전체 RMSE가 2.89 m s^-1로 가장 낮았으며, FCN3의 2.96 m s^-1 및 GraphCast의 2.98 m s^-1와 비교된다. 모든 모델은 강풍을 과소평가한다.
시사점 및 한계
MLWP 모델은 Northern Norway의 관측소 수준 바람 예측에서 HRES와 비슷한 성능을 유지하지만, 복잡한 지리와 강풍 예측은 추가 개선이 필요하다.
시사점 및 한계
평가는 Northern Norway의 관측소 12곳만 대상으로 하며, bilinear interpolation으로는 국지적 고도, 해안선, 지표면 거칠기, 미해상 지형 효과를 완전히 나타낼 수 없다.
Abstract
from arXiv · showhide
Recent machine learning weather prediction (MLWP) models have demonstrated remarkable forecasting skill on global reanalysis-based benchmarks. However, their performance remains unclear in challenging environments such as Northern Norway, where narrow fjords and rapidly changing weather result in highly variable local wind conditions. In this case study, we evaluate FourCastNet3 (FCN3), GraphCast, and ECMWF High Resolution Forecast (HRES) for wind speed forecasting using multi-year station observations from Northern Norway, focusing on their relative performance, generalization beyond the training period, and performance under high-wind conditions. Our results show that HRES slightly outperforms FCN3 and GraphCast, with an overall RMSE of 2.89 $\mathrm{m\,s^{-1}}$, compared to 2.96 $\mathrm{m\,s^{-1}}$ for FCN3 and 2.94 $\mathrm{m\,s^{-1}}$ for GraphCast. Notably, the MLWP models maintain comparable performance beyond their respective training periods, with no clear evidence of noticeable degradation. FCN3 performs best under high-wind conditions, although all models substantially underestimate strong winds. Our findings suggest that MLWP has become competitive with NWP for local wind, but further refinements are still needed to capture complex terrain better.
1 서론
Global MLWP 모델은 격자 기반 benchmark에서 높은 성능을 보이지만, 복잡한 지형에서 국지적 바람을 예측하는 정확도는 여전히 불확실하다. 본 연구는 Northern Norway의 station 관측을 사용해 FCN3와 GraphCast를 HRES와 비교하고, lead time, 위치, training period 일반화, high-wind event를 중점적으로 평가한다.
- Global benchmark 성능만으로는 미세 규모 지형이 국지적 바람 변동을 유발하는 복잡한 지형의 station level에서 MLWP 모델이 어떻게 작동하는지 알 수 없다.
- 평가에서는 MLWP 및 physics-based 모델이 10 m 바람을 얼마나 정확하게 예측하는지, training 및 non-training year에 따라 성능이 어떻게 변하는지, 그리고 lead time, station, wind intensity에 따라 어떻게 달라지는지를 검토한다.
- MLWP 모델은 서로 다른 architecture를 사용하고 HRES는 physics-based reference를 제공하므로, 본 연구는 FCN3와 GraphCast를 HRES와 함께 평가한다.
- 이 case study는 Northern Norway의 12개 weather station에 걸친 station-level 비교를 제공하고, lead time, 위치, wind-force category에 따른 성능을 특성화한다.
- HRES가 전체 RMSE에서 가장 낮은 값을 달성하는 반면, FCN3는 bias가 가장 작고 high-wind condition에서 가장 우수한 성능을 보인다. 모든 모델은 강한 바람을 상당히 과소평가한다.
2 관련 연구
날씨 예측 연구는 물리 기반 NWP와 점점 더 역량이 향상되는 MLWP 모델을 아우른다. 전 지구 평가에서 MLWP가 경쟁력 있는 예측 성능을 보이지만, 국지 관측과 복잡한 환경으로의 전이 성능을 평가하려면 station-based 연구가 필요하다.
- NWP는 물리 방정식, 수치 해법, 관측, data assimilation을 결합하며, IFS와 GFS는 주요 operational global system을 대표한다.
- Deep-learning MLWP 모델은 대규모 reanalysis dataset에서 등장했으며, neural operator, Earth-specific transformer, graph network, cascaded system을 포함한 다양한 architecture를 사용한다.
- ERA5와 WeatherBench 2에 대한 전 지구 평가에서는 MLWP의 경쟁력 있는 예측 성능이 확인되지만, temporal generalization과 extreme-event prediction의 한계도 보고된다.
- Station-based 연구는 대규모 전 지구 평가와 183개 synoptic station에서 수행된 노르웨이 Pangu-Weather 평가를 포함해, 모델 출력을 in-situ observation과 비교한다.
3 기상예보 모델의 관측소 기반 평가
평가 체계는 북부 노르웨이 전역의 관측소 관측값과 전 지구 기상예보를 예측 선행시간, 위치, 연도 및 강풍 조건별로 비교한다. 예보는 12개 관측소에서 공간적·시간적으로 일치시킨 뒤 오차 및 범주형 예보능력 지표를 계산한다.
- 평가 체계: 예보를 각 관측소 위치로 보간하고 정확한 유효 시각의 관측값과 매칭하여, FCN3, GraphCast 및 HRES에서 공통 station–time 샘플을 유지한다.이를 통해 현장 측정값과 비교 가능한 관측소 수준의 예보 시계열 및 오차를 산출한다.
- 평가 체계: 예보는 00:00 UTC에 초기화하고 +6 to +72 h 구간에서 6 h 간격으로 평가하여, 예보 사이클마다 12개의 선행시간을 산출한다.각 예보는 해당 유효 시각의 관측값과 비교한다.
- 강풍 평가: 강풍 사례는 관측소의 관측 풍속이 10.8 m s−1 이상인 경우로 정의하며, 이 하위 집합에 대해 지표를 다시 계산하고 산점도를 사용해 체계적 오차를 평가한다.이 임계값은 노르웨이 기상 서비스 Yr에서 채택한 강풍 정의를 따른다.
- 실험 설정: 이 연구는 2016–2022년 동안 북부 노르웨이의 12개 관측소에서 수집한 현장 관측값을 사용하여 FCN3, GraphCast 및 HRES를 평가한다.관측소는 지리적 범위, 충분한 관측 자료, 그리고 10-m 풍속 측정에 대한 인근 장애물의 영향을 제한하는 노출 조건을 기준으로 선정했다.
- 평가 지표: 성능은 전체, 시간적, 공간적 및 풍속별 평가에서 RMSE, bias, normalized RMSE, normalized bias, Pearson correlation 및 Equitable Threat Score로 정량화한다.RMSE는 전체 오차 크기, bias는 체계적 오차를 측정하며, normalized 지표는 풍속 크기가 서로 다른 관측소 간 비교를 지원한다.
4 결과
Northern Norway 전역에서 HRES가 가장 낮은 overall RMSE를 보이며, FCN3는 bias가 가장 작고 high-wind events에서 가장 우수하다. 오차는 lead time, station, terrain, wind-force category에 따라 크게 달라지지만, MLWP 성능에서 일관된 temporal degradation은 나타나지 않는다.
- Overall Forecasting Performance: 전체 RMSE가 2.89 m s−1인 HRES가 aggregate model 중 가장 우수하며, 2.94 m s−1인 GraphCast와 2.96 m s−1인 FCN3를 앞선다.FCN3–HRES 차이만 통계적으로 유의했으며, 다른 pairwise difference에는 0이 포함되었다.
- Overall Forecasting Performance: FCN3는 -0.85 m s−1로 overall bias가 가장 작고, HRES와 GraphCast는 각각 -1.21 m s−1 및 -1.26 m s−1의 더 큰 음의 bias를 보인다.모든 model이 관측 wind speed를 체계적으로 과소평가한다.
- High-Wind Analysis: ETS는 낮은 Beaufort category에서 가장 높으며, HRES는 force 1–4에서, FCN3는 force 5–8에서 우수하고 force 10을 넘으면 skill은 negligible하다.가장 강한 wind category는 관측에서도 훨씬 드물다.
- Lead Time Analysis: RMSE는 +6 h의 약 2.7–2.8 m s−1에서 +72 h의 3.1–3.2 m s−1로 증가하며, HRES가 모든 lead time에서 가장 낮다.FCN3와 GraphCast는 짧은 lead에서 유사하지만, FCN3는 +48 h 이후 뚜렷하게 증가한다.
- Station-based and Terrain-based Analysis: Station effect는 대부분의 model 차이보다 크다. Bardufoss의 RMSE는 1.8 m s−1 미만인 반면, Fakken에서는 HRES가 4.58 m s−1에 이른다.model ranking은 station별로 달라지지만, station-wise error pattern은 대체로 유사하다.
- Training and Non-Training Years: 연도별 성능에서는 시간에 따른 오차의 일관된 증가가 나타나지 않아, training year와 non-training year 전반에서 systematic degradation이 없음을 시사한다.MLWP model과 HRES에서 나타나는 유사한 연도별 변동은 systematic drift보다 연간 forecast difficulty의 차이에 기인하는 것으로 해석된다.
- High-Wind Analysis: High-wind RMSE is around twice the overall value, with normalized biases from -43.42% to -45.59%; FCN3 performs best but all models substantially underestimate strong winds.FCN3 has the lowest high-wind RMSE and nRMSE and the smallest absolute bias, while HRES has the largest errors.
5 논의
관측소 수준에서 HRES는 FCN3 및 GraphCast보다 수치적으로 근소하게 우수하지만, 공간적 이질성과 해상되지 않은 지형이 예측 오차를 크게 좌우한다.
- 5 논의: Northern Norway에서 FCN3와 GraphCast는 이전 비교에서 MLWP 모델이 ERA5에 대해 더 우수한 성능을 보였음에도 HRES와 여전히 비슷한 성능을 유지한다.논의에서는 기준 데이터셋의 선택이 겉보기 순위에 영향을 준다고 지적한다.
- 5 논의: 거친 전 지구 격자는 fjord 지형, 해안 능선, wind channelling, 그리고 내리막 바람 폭풍을 포함한 국지 지형을 해상하지 못하므로 예측 성능은 공간적으로 달라진다.이러한 영향으로 국지적 동역학을 포착하지 못한 채 바람이 차단된 계곡에서는 낮은 RMSE가, 바람에 노출된 해안 관측소에서는 더 큰 오차가 나타날 수 있다.
- 5 논의: 관측소 수준에서 HRES는 FCN3 및 GraphCast보다 근소하게 우수하지만, 이들의 RMSE 차이는 less than 0.07 m s−1이며 관측소 간 변동보다 작다.종합 비교는 일관된 HRES 우위라기보다 수치적으로 근소한 우위를 뒷받침한다.
- 5 논의: 평가는 Northern Norway의 only 12 stations만을 대상으로 하므로, 그 결론을 기후, 지형 또는 관측 네트워크가 다른 지역에 직접 일반화하기는 어렵다.저자들은 추가적인 복잡한 해안 및 산악 지역에서의 검증을 권고한다.
- 5 논의: Bilinear interpolation은 고도, 해안선 형상, 지표 거칠기 또는 해상되지 않은 지형을 완전히 포착할 수 없으므로 관측소-격자 간 representativeness error를 유발한다.향후 개선을 위해서는 더 높은 해상도의 지역 모델이나 국지적 지표 특성을 명시적으로 반영하는 downscaling이 필요할 수 있다.
6 결론
이 연구는 Northern Norway의 관측소 수준 풍속 예측에서 FCN3과 GraphCast를 ECMWF HRES와 비교한다. HRES의 전체 오차가 가장 낮았으며, 강풍 조건에서는 모든 모델의 상당한 약점이 드러난다.
- 6 결론: HRES의 전체 오차는 2.89 m s−1로, FourCastNet3의 2.96 m s−1 및 GraphCast의 2.98 m s−1과 비교된다.HRES의 오차가 가장 낮았으며, MLWP 모델들은 유사한 성능을 보였다.
- 6 결론: 예측 lead time이 늘어날수록 오차가 증가하며, 관측소 간 spatial differences가 더 뚜렷해진다.
- 6 결론: 모든 모델은 강풍 조건에서 정확도가 낮아지며 풍속을 유의하게 과소추정한다.강풍 조건에서의 성능 저하는 RMSE 증가와 더 음의 bias로 나타난다.
- 6 결론: 복잡한 지형 표현과 강풍 예측의 개선이 향후 MLWP 개발의 우선 과제로 제시된다.
A 계산 자원
부록에서는 관측소 평가에 필요한 계산 자원과 지리·기상학적 맥락을 정리한다. 자원 및 관측소 메타데이터는 관측소별 차이를 해석하는 데 근거를 제공한다.
- A 계산 자원: 각 FCN3 및 GraphCast 연간 작업에는 GPU 1개, CPU 코어 4개, 메모리 192 GB, 최대 실행 시간 40시간이 요청되었다.각 SLURM 작업 배열에는 2016년부터 2022년까지 연도별 작업 1개씩, 총 7개의 연간 작업이 제출되었다.
- A 계산 자원: Beaufort 풍력 계급은 연구에서 사용한 풍속 범위에 따라 풍력 강도를 분류한다.
- A 계산 자원: 평가 관측소는 Northern Norway 전역의 해안, 피오르드, 내륙 계곡 환경에 분포하며, 고도는 해수면 부근부터 약 76 m까지 이른다.좌표, 고도, 지형 범주는 관측소별 예보 차이를 해석하기 위한 맥락을 제공한다.
D ERA5와의 평가
모델들은 366,948개 샘플을 사용해 ERA5와 추가로 비교 평가되었다. 세 모델 모두 이 비교에서 RMSE 값이 훨씬 낮았으며, GraphCast는 RMSE와 nRMSE에서 가장 우수했고 FCN3는 체계적 편향이 가장 작았다.
- D ERA5와의 평가: 세 모델의 ERA5 대비 RMSE 범위는 366,948개 샘플에서 1.14–1.31 m s−1이다.
- D ERA5와의 평가: GraphCast는 ERA5 대비 RMSE와 nRMSE가 가장 낮았으며, FCN3는 nBias가 0.81%로 체계적 편향이 가장 작았다.GraphCast와 HRES의 nBias는 각각 −3.30%와 −4.95%로 음수였다.
E CARRA1과 ERA5 및 지점 관측 비교
CARRA1은 선택된 지점의 지표면 부근 바람을 ERA5보다 정확하게 나타내며, 이는 복잡한 북극 지형을 위해 설계된 더 높은 해상도와 지역적 설계에 부합한다.
- 이 비교에서는 CARRA1과 ERA5가 지점 관측에 기반한 국지적 지표면 부근 바람 조건을 어떻게 나타내는지 평가한다.
- CARRA1은 HARMONIE-AROME에 기반한 지역 북극 재분석 자료로, 격자 간격은 약 2.5 km이며 ERA5의 약 31 km 해상도와 비교된다.더 높은 공간 해상도는 지역 지리와 국지적 대기 조건을 더 잘 나타내도록 설계되었다.
- CARRA1의 2.41 m s−1 RMSE와 ERA5의 2.71 m s−1 RMSE는 지점 관측과 더 가까운 일치를 보여준다.CARRA1 also has lower nRMSE: 44.67% versus 50.19%.
- CARRA1은 풍속 편향을 −0.28 m s−1로 줄이며, ERA5는 −0.89 m s−1이다.Its nBias is −3.78%, versus −16.47% for ERA5.
F 관측소 수준 Heatmap
관측소 Heatmap은 세 가지 예보 모델과 12개 관측소에서 정규화 오차와 Bias가 상당한 공간적 변이를 보임을 드러낸다.
- 관측소와 모델 전반의 nRMSE가 33.52%–77.03% 범위로 나타나 정규화된 예보 오차의 뚜렷한 변이를 보여준다.가장 높은 nRMSE 값은 Bardufoss, Sørkjosen Lufthavn, Tromsø-Langnes에서 나타난다.
- Heatmap은 12개 관측소에서 FCN3, GraphCast, HRES의 RMSE, nRMSE, Bias, nBias를 제시한다.
- Bias는 −3.50에서 1.02 m s−1까지이며, 대부분의 관측소-모델 조합에서 음수다.가장 음의 Bias는 Fakken, Banak, Tromsø-Langnes에서 나타난다.
- Bardufoss는 절대 RMSE가 가장 낮지만, 관측소-모델 결과 전반에서는 nRMSE가 가장 높은 편에 속한다.높은 정규화 오차는 부분적으로 전반적으로 낮은 관측 풍속을 반영한다.
G 관측소 수준 산점도
관측소 수준 산점도는 관측 풍속과 FCN3, GraphCast, HRES 예측을 비교하여 모델 성능을 관측소별로 보여준다.
- 산점도는 나머지 관측소에서 관측 풍속과 FCN3, GraphCast, HRES의 예측을 비교한다.이 시각화는 모델 성능을 관측소별로 보여준다.
- Figures G.1과 G.2는 Skrova Fyr와 Bardufoss의 관측소별 산점도를 보여준다.
- Figure G.3은 관측 및 예측 풍속의 관측소별 산점도를 제시한다.
- Figure G.4는 관측소별 RMSE, nRMSE, Bias, nBias를 보고하며, Figure G.5는 12개 관측소의 주변 지역을 확대한 결과를 보여준다.