Índices de validación
Índices estadísticos para la validación del modelo
Esta página describe en detalle los índices utilizados en la validación para comparar los valores modelados con los observados por las estaciones. Cada índice mide un aspecto distinto del acuerdo modelo-observaciones (sesgo sistemático, error, correlación, capacidad de reproducir la variabilidad, capacidad de detectar las superaciones de umbral): para una evaluación robusta hay que leerlos juntos, no por separado.
Notación. Para cada par de valores alineados en el tiempo: \( o_i \) = valor observado, \( m_i \) = valor modelado, con \( i = 1 \dots n \) (número de pares válidos). Las medias se indican con \( \bar o \) y \( \bar m \), las desviaciones típicas con \( \sigma_o \) y \( \sigma_m \). Los índices fraccionales y normalizados (NMB, NME, MFB, MFE) solo tienen sentido para magnitudes no negativas (concentraciones); para magnitudes que cambian de signo hay que usar los índices «absolutos» (MB, MAE, RMSE, R, KGE, NSE).
1. Sesgo (error sistemático)
Miden la tendencia media del modelo a sobrestimar (valor positivo) o subestimar (valor negativo) las observaciones. Valor óptimo: 0.
MB — Mean Bias
Sesgo medio en las unidades físicas del fenómeno. Es el más inmediato de interpretar, pero depende de la escala: útil sobre todo para concentraciones bajas, donde los índices porcentuales se vuelven inestables.
NMB — Normalized Mean Bias
Sesgo normalizado sobre la suma de las observaciones: expresa en porcentaje la sobrestimación o subestimación global. Es la referencia típica para la evaluación normativa (p. ej. la media anual de NO2).
MFB — Mean Fractional Bias
Sesgo fraccional simétrico y acotado: pondera igual las sobrestimaciones y las subestimaciones y es robusto frente a los valores atípicos y a las distribuciones asimétricas. Recomendado por las directrices de la EPA (Boylan & Russell, 2006) para las partículas, con umbral de aceptabilidad \( |\mathrm{MFB}| < 60\% \).
Ejemplo interactivo — sesgo
2. Error (exactitud)
Miden la magnitud de las desviaciones, independientemente del signo. Valor óptimo: 0. El RMSE penaliza más los errores grandes (picos).
MAE — Mean Absolute Error
Error absoluto medio: el error «típico» en unidades físicas. Más robusto que el RMSE frente a los valores anómalos.
RMSE — Root Mean Square Error
Raíz del error cuadrático medio: al elevar al cuadrado pondera mucho las desviaciones grandes, de modo que es sensible a la capacidad del modelo de reproducir los picos. Siempre se cumple \( \mathrm{RMSE} \ge \mathrm{MAE} \).
CRMSE — Centered RMSE
RMSE «centrado», es decir, depurado del sesgo medio: aísla el error de forma/amplitud (fase y variabilidad) del de nivel absoluto. Es la cantidad representada en los diagramas de Taylor.
NME — Normalized Mean Error
Error absoluto medio normalizado sobre las observaciones: el MAE expresado en porcentaje, comparable entre contaminantes de escala distinta.
MFE — Mean Fractional Error
Error fraccional simétrico, contrapartida «en módulo» del MFB. Recomendado por la EPA para el PM con umbral \( \mathrm{MFE} < 75\% \).
Ejemplo interactivo — RMSE frente a MAE
3. Correlación (asociación)
Miden cuánto «se mueven juntos» en el tiempo el modelo y las observaciones, con independencia del sesgo y de la escala. Valor óptimo: 1.
R — Coeficiente de correlación de Pearson
Mide la fuerza de la relación lineal. No ve ni el sesgo ni la diferencia de amplitud: un modelo puede tener \( r=1 \) aun estando trasladado o escalado. Por eso hay que acompañarlo siempre de un índice de sesgo y de uno de variabilidad.
R² — Coeficiente de determinación
Cuadrado de Pearson: fracción de la varianza de las observaciones explicada linealmente por el modelo (p. ej. \( R^2 = 0.8 \) → 80% de la variabilidad). Es redundante con R, así que normalmente no se pondera en la puntuación, pero sigue siendo seleccionable.
Spearman — Correlación de rangos
Es el coeficiente de Pearson calculado sobre los rangos de los datos (\( R_{o_i} \) y \( R_{m_i} \)): mide la asociación monótona (no solo lineal) y es robusto frente a los valores atípicos y a las distribuciones asimétricas.
Solo en ausencia de rangos repetidos (ningún valor igual) se reduce a la forma compacta \( \rho = 1 - \dfrac{6\sum_i d_i^{\,2}}{n\left(n^2-1\right)} \), con \( d_i = R_{o_i}-R_{m_i} \). El cálculo efectivo usa la definición general, corregida para los rangos repetidos (ties), no la aproximación. Útil donde la relación es no lineal (p. ej. SO2, O3, NOx).
MI — Mutual Information (información mutua)
Mide la dependencia general entre lo observado y el modelo, incluso no lineal y no monótona: cuánta incertidumbre sobre una variable se reduce conociendo la otra. A diferencia de R y de Spearman, capta cualquier forma de relación.
Estimada con un histograma 2D de las dos series: vale 0 si lo observado y el modelo son independientes y crece con la dependencia. Atención: mide la dependencia, no el acuerdo — sigue siendo alta incluso para un modelo muy distorsionado o anticorrelado (ignora el sesgo y la escala) y no está normalizada. Por eso en UISH tiene peso 0: está prevista como diagnóstico de dependencia no lineal para otros proyectos.
Ejemplo interactivo — correlación (R, R², Spearman, MI)
4. Eficiencia (skill scores globales)
Índices sintéticos que combinan varios aspectos en una única puntuación. Valor óptimo: 1.
IOA — Index of Agreement (Willmott)
Mide el acuerdo global normalizando el error cuadrático respecto de la máxima diferencia posible. \( d=1 \) acuerdo perfecto, \( d=0 \) ningún acuerdo.
KGE — Kling-Gupta Efficiency
Descompone explícitamente el rendimiento en tres componentes — correlación \( r \), sesgo \( \beta \) y variabilidad \( \gamma \) — y las combina. Es un skill score muy informativo: un valor bajo indica enseguida cuál de las tres componentes falla.
NSE — Nash-Sutcliffe Efficiency
Compara el error del modelo con la variabilidad de las observaciones. \( \mathrm{NSE}=1 \) modelo perfecto; \( \mathrm{NSE}=0 \) el modelo vale lo mismo que usar simplemente la media observada; \( \mathrm{NSE}<0 \) el modelo es peor que la media.
Ejemplo interactivo — KGE / NSE
5. Regresión y variabilidad (diagnósticos)
Magnitudes de apoyo: normalmente no entran en la puntuación ponderada, pero ayudan a interpretar los demás índices (se usan en el gráfico de dispersión y en el diagrama de Taylor).
Pendiente y ordenada en el origen (regresión lineal)
Recta de regresión del modelo sobre las observaciones. La pendiente \( a \) indica un error proporcional (de escala/amplitud), la ordenada \( b \) un error constante (desplazamiento). Idealmente \( a=1 \) y \( b=0 \).
Desviaciones típicas y su razón
Miden la variabilidad de las observaciones y del modelo. La razón de las desviaciones típicas dice si el modelo reproduce la amplitud de las fluctuaciones: >1 el modelo es demasiado «movido», <1 demasiado plano. Es una de las coordenadas del diagrama de Taylor.
6. Índices categóricos sobre umbral
No evalúan el valor continuo, sino la capacidad del modelo de detectar los eventos, es decir las superaciones de un umbral \( \tau \) (p. ej. un límite normativo). Se construyen a partir de la matriz de contingencia que clasifica cada instante según el umbral observado y el modelado:
| Observado \( \ge \tau \) | Observado \( < \tau \) | |
|---|---|---|
| Modelo \( \ge \tau \) | \( a \) — acierto | \( b \) — falsa alarma |
| Modelo \( < \tau \) | \( c \) — alarma fallada | \( d \) — negativo correcto |
POD — Probability of Detection
Fracción de eventos reales correctamente detectados por el modelo (tasa de detección). No penaliza las falsas alarmas: hay que leerlo junto con el FAR.
FAR — False Alarm Ratio
Fracción de alarmas del modelo que resultan falsas. Por sí solo se puede «burlar» no alarmando nunca: es complementario del POD.
CSI — Critical Success Index
Combina aciertos, falsas alarmas y alarmas falladas en una única puntuación (ignora los negativos correctos \( d \), a menudo numerosísimos). Buen resumen de la calidad de detección de los eventos.
HSS — Heidke Skill Score
Mide la habilidad del modelo respecto de una previsión aleatoria: \( \mathrm{HSS}=1 \) detección perfecta, \( \mathrm{HSS}=0 \) equivalente al azar, \( \mathrm{HSS}<0 \) peor que el azar. Tiene en cuenta también los negativos correctos.
Ejemplo interactivo — índices categóricos sobre umbral
7. Índices de exposición y descomposición del error
Indicadores derivados usados en los gráficos más recientes de la página de validación: los índices normativos de exposición al ozono (comparando modelo y medidas) y la descomposición del RMSE en parte sistemática y estocástica.
SOMO35 — Sum of Ozone Means Over 35 ppb
Suma anual de los excesos del máximo diario de la media móvil de 8 horas (\( \mathrm{MDA8} \)) por encima de 70 µg/m³ (≈ 35 ppb). Es el indicador sanitario de referencia para la exposición crónica al ozono. Al ser un índice acumulado sobre las colas altas de la distribución, amplifica los sesgos sistemáticos del modelo en los picos.
AOT40 — Accumulated Ozone exposure over Threshold 40 ppb
Suma de los excesos horarios por encima de 80 µg/m³ (≈ 40 ppb) en las horas de luz del periodo de crecimiento vegetativo: es el indicador de protección de la vegetación (Dir. 2008/50/CE). La comparación modelo-observado dice si el modelo es fiable para los usos regulatorios.
Descomposición del error (Willmott)
A partir de la regresión lineal \( \hat m_i = a + b\,o_i \), la parte sistemática \( \mathrm{RMSE}_s \) mide el error explicado por la recta (reducible con una calibración o corrección del sesgo), y la parte estocástica \( \mathrm{RMSE}_u \) la dispersión residual en torno a ella (ligada a la física y a la resolución del modelo). Saber cuál domina indica el camino de mejora más eficaz.
Episodios (estratificación)
Además de las particiones temporales (estación del año, hora, mes…), las
métricas se calculan también solo sobre los episodios de pico de lo
observado: day_p90 (horas de los días con media diaria > P90),
hour_p90 (horas con valor > P90 horario) y exceed
(superaciones del umbral normativo). La comparación con las métricas sobre
todos los datos muestra cuánto se degrada la calidad del modelo justo en los
episodios relevantes para la salud y para los límites legales.
Keywords: validación, métricas, estadística, sesgo, RMSE, correlación, KGE, NSE, Pearson, Spearman, índices