Benchmark previsioni puntuali⚠ rodaggio
Verifica comparativa product-to-product su 7 stazioni istituzionali terze — protocollo pre-registrato.
🔒 Contenuto riservato
La dashboard del benchmark è riservata.
Errore per orizzonte di previsione
Aggregato sui 7 punti; la stessa osservazione è usata per tutti i provider (confronto appaiato). Meno è meglio (per il bias conta la vicinanza allo zero).
Skill rispetto alle baseline
1 − MAE/MAEbaseline su coppie appaiate: >0 = batte la baseline. La persistenza (obs di 24 h prima) è difficile da battere sotto le 6-12 h: il vero test dei modelli è da 12 h in su.
Precipitazione — accumuli 6h / 24h
MAE e bias sugli accumuli (mm); ETS a soglie quando il campione è sufficiente (n≥50).
Probabilità di precipitazione — Brier score
Più basso è meglio; BSclim = riferimento climatologico (frequenza osservata nel periodo). Le PoP Open-Meteo dei vari modelli coincidono spesso (fonte ensemble unica): leggerle come un solo prodotto.
Significatività statistica (Diebold-Mariano)
Δ = MAEmeteo.sm − MAEaltro su differenziali giornalieri (HAC): Δ<0 = meteo.sm meglio. In grassetto p<0.05. Serve una serie di ≥10 giorni per confronto.
Temperatura 0-24h — chi vince dove
MAE (°C) per punto di verifica; in verde il migliore di ciascun punto.
Caricamento dashboard…