Articulo de referencia

Regla de puntuación

Visualización de la puntuación esperada según diversas predicciones de algunas funciones de puntuación comunes. Línea negra discontinua: creencia verdadera del pronosticador, ro...

Visualización de la puntuación esperada según diversas predicciones de algunas funciones de puntuación comunes. Línea negra discontinua: creencia verdadera del pronosticador, roja: lineal, naranja: esférica, morada: cuadrática, verde: logarítmica.

En la teoría de la decisión , tanto una regla de puntuación [ 1 ] como una función de puntuación [ 2 ] proporcionan una medida resumen a posteriori para evaluar la calidad de una predicción o pronóstico. Asignan una puntuación numérica a una predicción individual en función del resultado real. Dependiendo de la convención de signos, esta puntuación puede interpretarse como una pérdida o una recompensa para el pronosticador. Las reglas de puntuación evalúan predicciones o pronósticos probabilísticos , es decir, predicciones de toda la distribución de probabilidad.F{\displaystyle F}del resultado. Por otro lado, las funciones de puntuación evalúan predicciones de puntos, es decir, predicciones de una propiedad o función.T(F){\displaystyle V(F)}de la distribución de probabilidadF{\displaystyle F}del resultado. Ejemplos de dicha propiedad son la esperanza y la mediana .

La puntuación logarítmica promedio de 10 puntos, obtenida mediante muestreo independiente e idéntico de una distribución normal estándar (histograma azul), se evaluó en diversas distribuciones (línea roja). Si bien esto no es necesariamente cierto para muestras individuales, en promedio, una regla de puntuación adecuada dará la puntuación más baja si la distribución prevista coincide con la distribución de los datos.
Una curva de calibración permite evaluar la precisión de las predicciones del modelo, comparando los cuantiles predichos con los observados. El color azul representa el modelo mejor calibrado; consulte la sección de calibración (estadísticas) .

Las reglas de puntuación responden a la pregunta: "¿Qué tan buena es una distribución de probabilidad predicha dada la observación del resultado real?". Se ha demostrado que las reglas de puntuación (estrictamente) correctas tienen la puntuación esperada más baja si la distribución predicha es igual a la distribución subyacente de la variable objetivo. Si bien esto puede variar para observaciones individuales, debería resultar en una minimización de la puntuación esperada si se predicen las distribuciones "correctas".

De la misma manera, las funciones de puntuación responden a la pregunta "¿qué tan buena es una predicción puntual dada la observación del resultado real?". Las funciones de puntuación que son (estrictamente) consistentes (para la funciónT{\displaystyle T}) se demuestra que tienen la puntuación esperada más baja si la predicción del punto es igual a (o está entre) el verdadero funcional de la distribución subyacente de la variable objetivo.

Las reglas y funciones de puntuación se utilizan a menudo como funciones de coste o de pérdida en los modelos de predicción. Si se recopila una muestra de predicciones y observaciones del resultado, se puede evaluar como la media empírica de dicha muestra, también conocida como puntuación. Posteriormente, se comparan las puntuaciones de las predicciones de diferentes modelos o pronosticadores para determinar cuál es el mejor.

Por ejemplo, consideremos un modelo probabilístico que predice (en función de una entrada)incógnita{\displaystyle x}) una distribución gaussiananorte(μ,σ2){\displaystyle {\mathcal {N}}(\mu,\sigma ^{2})}con significaμR{\displaystyle \mu \in \mathbb {R} }y desviación estándarσR+{\displaystyle \sigma \in \mathbb {R} _{+}}Una interpretación común de los modelos probabilísticos es que pretenden cuantificar su propia incertidumbre predictiva. En este ejemplo, una variable objetivo observadayR{\displaystyle y\in \mathbb {R} }Luego se compara con la distribución prevista.norte(μ,σ2){\displaystyle {\mathcal {N}}(\mu,\sigma ^{2})}y se le asignó una puntuaciónS(norte(μ,σ2),y)R{\displaystyle \mathbf {S} ({\mathcal {N}}(\mu ,\sigma ^{2}),y)\in \mathbb {R} }Cuando se entrena un modelo probabilístico con una regla de puntuación, este debería "enseñarle" a predecir cuándo su incertidumbre es baja y cuándo es alta, y debería dar como resultado predicciones calibradas , minimizando al mismo tiempo la incertidumbre predictiva.

Si bien el ejemplo presentado se refiere a la predicción probabilística de una variable objetivo de valor real , se han diseñado diversas reglas de puntuación para diferentes variables objetivo. Existen reglas de puntuación para la clasificación probabilística binaria y categórica , así como para la regresión probabilística univariante y multivariante .

Definiciones

Consideremos un espacio muestral o dominio de observación,Ω{\displaystyle \Omega }, que comprende los resultados potenciales de una observación futura; un álgebra σA{\displaystyle {\mathcal {A}}}de subconjuntos deΩ{\displaystyle \Omega }y una clase convexaF{\displaystyle {\mathcal {F}}}de medidas de probabilidad en(Ω,A){\displaystyle (\Omega,{\mathcal {A}})}. Una función definida enΩ{\displaystyle \Omega }y tomando valores en la recta real extendida,R¯=[,]{\displaystyle {\overline {\mathbb {R} }}=[-\infty ,\infty ]}, esF{\displaystyle {\mathcal {F}}}-cuasi integrable si es medible con respecto aA{\displaystyle {\mathcal {A}}}y es cuasi-integrable con respecto a todosFF{\displaystyle F\in {\mathcal {F}}}.

Una función (estadística)T{\displaystyle T}es una aplicación potencialmente multivaluada de la clase de distribuciones de probabilidadF{\displaystyle {\mathcal {F}}}a un espacio euclidiano , es decirT:FRd{\displaystyle T\colon {\mathcal {F}}\rightarrow \mathbb {R} ^{d}}conFT(F){\displaystyle F\rightarrow T(F)}.

Pronóstico probabilístico

Un pronóstico probabilístico es cualquier medida de probabilidad.FF{\displaystyle F\in {\mathcal {F}}}, es decir, una distribución de posibles observaciones futuras.

Pronóstico puntual

Una previsión puntual para la funciónT{\displaystyle T}es algún valorincógnitaRd{\displaystyle x\in \mathbb {R} ^{d}}.

Regla de puntuación

Una regla de puntuación es cualquier función extendida de valor real.S:F×ΩR{\displaystyle \mathbf {S} \colon {\mathcal {F}}\times \Omega \rightarrow \mathbb {R} }de tal manera queS(F,){\displaystyle \mathbf {S} (F,\cdot )}esF{\displaystyle {\mathcal {F}}}-cuasi integrable para todosFF{\displaystyle F\in {\mathcal {F}}}.S(F,y){\displaystyle \mathbf {S} (F,y)}representa la pérdida o penalización cuando el pronósticoFF{\displaystyle F\in {\mathcal {F}}}se emite y la observaciónyΩ{\displaystyle y\in \Omega }se materializa .

Función de puntuación

Una función de puntuación es cualquier función de valor real.S:Rd×ΩR{\displaystyle S\colon \mathbb {R} ^{d}\times \Omega \rightarrow \mathbb {R} }dóndeS(incógnita,y){\displaystyle S(x,y)}representa la pérdida o penalización cuando el pronóstico puntualincógnitaRd{\displaystyle x\in \mathbb {R} ^{d}}se emite y la observaciónyΩ{\displaystyle y\in \Omega }se materializa.

Orientación / Convención de signos

Reglas de puntuaciónS(F,y){\displaystyle \mathbf {S} (F,y)}y funciones de puntuaciónS(incógnita,y){\displaystyle S(x,y)}están orientados negativamente (positivamente) si los valores más pequeños (más grandes) significan mejor. Cambiar la convención se puede lograr multiplicando la puntuación por1{\displaystyle -1}Aquí nos adherimos a la orientación negativa, de ahí la asociación con la "pérdida".

Puntuación esperada

Escribimos para la puntuación esperada de una predicción probabilísticaFF{\displaystyle F\in {\mathcal {F}}}con respecto a la distribución subyacenteQF{\displaystyle Q\in {\mathcal {F}}}:

miYQ[S(F,Y)]=S(F,ω)dQ(ω){\displaystyle \mathbb {E} _{Y\sim Q}[\mathbf {S} (F,Y)]=\int \mathbf {S} (F,\omega )\mathrm {d} Q(\omega )}

De manera similar, la puntuación esperada de una predicción de puntosincógnitaRd{\displaystyle x\in \mathbb {R} ^{d}}con respecto a la distribución subyacenteQF{\displaystyle Q\in {\mathcal {F}}}:

miYQ[S(incógnita,Y)]=S(incógnita,ω)dQ(ω){\displaystyle \mathbb {E} _{Y\sim Q}[S(x,Y)]=\int S(x,\omega )\mathrm {d} Q(\omega )}

Puntuación promedio de la muestra

Una forma de estimar la puntuación esperada es mediante la puntuación promedio de la muestra. Dado un conjunto de pares predicción-observación, por ejemplo(Fi,yi){\displaystyle (F_{i},y_{i})}para predicciones probabilísticasFi{\displaystyle F_{i}}y observacionesyiΩ{\displaystyle y_{i}\in \Omega },i=1norte{\displaystyle i=1\ldots n},(incógnitai,yi){\displaystyle (x_{i},y_{i})}para predicciones puntualesincógnitai{\displaystyle x_{i}}, la puntuación media se calcula como

  • para las reglas de puntuación:
mi[S]^=1nortei=1norteS(Fi,yi){\displaystyle {\widehat {E[\mathbf {S} ]}}={\frac {1}{n}}\sum _{i=1}^{n}\mathbf {S} (F_{i},y_{i})}
  • para funciones de puntuación:
mi[S]^=1nortei=1norteS(incógnitai,yi){\displaystyle {\widehat {E[S]}}={\frac {1}{n}}\sum _{i=1}^{n}S(x_{i},y_{i})}

Al invocar algún argumento de la ley de los grandes números , las puntuaciones promedio de la muestra son estimadores consistentes de la esperanza.

Propiedades

Inocuidad y coherencia

Las reglas de puntuación estrictamente adecuadas y las funciones de puntuación estrictamente consistentes fomentan pronósticos honestos mediante la maximización de la recompensa esperada: Si a un pronosticador se le da una recompensa deS(F,y){\displaystyle -\mathbf {S} (F,y)}siy{\displaystyle y}se da cuenta (por ejemplo,y=rainorte{\displaystyle y=rain}), entonces la recompensa esperada más alta (puntuación más baja) se obtiene informando la distribución de probabilidad verdadera. [ 1 ]

Reglas de puntuación adecuadas

Una regla de puntuaciónS{\displaystyle \mathbf {S} }es apropiado en relación conF{\displaystyle {\mathcal {F}}}si (suponiendo una orientación negativa) su puntuación esperada se minimiza cuando la distribución pronosticada coincide con la distribución de la observación.

miYQ[S(Q,Y)]miYQ[S(F,Y)]{\displaystyle \mathbb {E} _{Y\sim Q}[\mathbf {S} (Q,Y)]\leq \mathbb {E} _{Y\sim Q}[\mathbf {S} (F,Y)]}a pesar deF,QF{\displaystyle F,Q\in {\mathcal {F}}}.

Es estrictamente correcto que la ecuación anterior se cumpla con igualdad si y solo siF=Q{\displaystyle F=Q}.

Funciones de puntuación consistentes

Una función de puntuaciónS{\displaystyle S}es consistente para el funcionalT{\displaystyle T}relativo a la claseF{\displaystyle {\mathcal {F}}}si

miYF[S(t,Y)]miYF[S(incógnita,Y)]{\displaystyle \mathbb {E} _{Y\sim F}[S(t,Y)]\leq \mathbb {E} _{Y\sim F}[S(x,Y)]}a pesar deFF{\displaystyle F\in {\mathcal {F}}}, todotT(F){\displaystyle t\in T(F)}y todoincógnitaRd{\displaystyle x\in \mathbb {R} ^{d}}.

Es estrictamente consistente si es consistente y la igualdad en la ecuación anterior implica queincógnitaT(F){\displaystyle x\in T(F)}.

transformación afín

Después de una transformación afín, una regla de puntuación estrictamente propia sigue siendo estrictamente propia, una función de puntuación estrictamente consistente (para alguna función)T{\displaystyle T}) permanece estrictamente consistente. [ 3 ] Es decir, siS(F,y){\displaystyle \mathbf {S} (F,y)}entonces es una regla de puntuación estrictamente correctaa+bS(F,y){\displaystyle a+b\mathbf {S} (F,y)}conb0{\displaystyle b\neq 0}También es una regla de puntuación estrictamente correcta, aunque sib<0{\displaystyle b<0}Entonces, el sentido de optimización de la regla de puntuación cambia entre maximización y minimización. Para las funciones de puntuación, se aplica la misma afirmación con los cambios obvios.

Localidad

Se dice que una regla de puntuación adecuada es local si su estimación de la probabilidad de un evento específico depende únicamente de la probabilidad de dicho evento. Esta afirmación suele ser ambigua, pero en la mayoría de los casos podemos entenderla como que la solución óptima del problema de puntuación "en un evento específico" es invariante ante cualquier cambio en la distribución de las observaciones que no altere la probabilidad de ese evento. Todas las puntuaciones binarias son locales porque la probabilidad asignada al evento que no ocurrió está determinada, por lo que no existe margen de variación.

Las funciones afines de la regla de puntuación logarítmica son las únicas reglas de puntuación locales estrictamente propias en un conjunto finito que no es binario.

Descomposición

El valor esperado de una regla de puntuación adecuadaS{\displaystyle S}puede descomponerse en la suma de tres componentes, llamados incertidumbre , confiabilidad y resolución , [ 4 ] [ 5 ] que caracterizan diferentes atributos de los pronósticos probabilísticos:

mi(S)=Unortedo+RmiLRmiS.{\displaystyle E(S)=\mathrm {UNC} +\mathrm {REL} -\mathrm {RES} .}

Si una puntuación es adecuada y de orientación negativa (como la puntuación de Brier), los tres términos son definidos positivos. El componente de incertidumbre es igual a la puntuación esperada del pronóstico, que predice constantemente la frecuencia promedio de los eventos. El componente de fiabilidad penaliza los pronósticos mal calibrados, en los que las probabilidades predichas no coinciden con las frecuencias de los eventos.

Las ecuaciones para los componentes individuales dependen de la regla de puntuación particular. Para la puntuación de Brier, vienen dadas por:

Unortedo=incógnita¯(1incógnita¯){\displaystyle \mathrm {UNC} ={\bar {x}}(1-{\bar {x}})}
RmiL=mi(pagπ(pag))2{\displaystyle \mathrm {REL} =E(p-\pi (p))^{2}}
RmiS=mi(π(pag)incógnita¯)2{\displaystyle \mathrm {RES} =E(\pi (p)-{\bar {x}})^{2}}

dóndeincógnita¯{\displaystyle {\bar {x}}}es la probabilidad promedio de ocurrencia del evento binarioincógnita{\displaystyle x}, yπ(pag){\displaystyle \pi (p)}es la probabilidad de evento condicional, dadopag{\displaystyle p}, es decirπ(pag)=PAG(incógnita=1pag){\displaystyle \pi (p)=P(x=1\mid p)}

Ejemplos de reglas de puntuación adecuadas

Existen infinidad de reglas de puntuación, incluyendo familias completas de reglas de puntuación estrictamente propias, todas ellas parametrizadas. Las que se muestran a continuación son simplemente ejemplos populares.

Variables categóricas

Para una variable de respuesta categórica conmetro{\displaystyle m}eventos mutuamente excluyentes,YΩ={1,,metro}{\displaystyle Y\in \Omega =\{1,\ldots ,m\}}Un pronosticador o algoritmo probabilístico devolverá un vector de probabilidad.pag[0,1]metro{\displaystyle \mathbf {p} \in [0,1]^{m}}con probabilidades para cada uno de losmetro{\displaystyle m}resultados.

Siy=i{\displaystyle y=i}Cuando se materializa, a menudo se abrevia la partitura comoS(pag,i){\displaystyle \mathbf {S} (\mathbf {p} ,i)}.

Puntuación logarítmica

Valor esperado de la regla logarítmica. Cuando se espera que el Evento 1 ocurra con una probabilidad de 0,8, la línea azul se describe mediante la función0,8registro(incógnita)+(10,8)registro(1incógnita){\displaystyle 0.8\log(x)+(1-0.8)\log(1-x)}.

La regla de puntuación logarítmica es una regla de puntuación estrictamente propia y local. Es también el opuesto de la entropía de Shannon , que se utiliza comúnmente como criterio de puntuación en la inferencia bayesiana . Esta regla de puntuación tiene sólidos fundamentos en la teoría de la información .

S(pag,i)=ln(pagi){\displaystyle \mathbf {S} (\mathbf {p} ,i)=\ln(p_{i})}

Aquí, la puntuación se calcula como el logaritmo de la estimación de probabilidad para el resultado real. Es decir, una predicción del 80% que resultó ser cierta recibiría una puntuación de ln(0,8) = −0,22 . Esta misma predicción también asigna una probabilidad del 20% al caso contrario, por lo que si la predicción resulta falsa, recibiría una puntuación basada en ese 20%: ln(0,2) = −1,6 . El objetivo de un pronosticador es maximizar la puntuación y que esta sea lo más alta posible, y −0,22 es, de hecho, mayor que −1,6.

Si se trata la veracidad o falsedad de la predicción como una variable x con valor 1 o 0 respectivamente, y la probabilidad expresada como p , entonces se puede escribir la regla de puntuación logarítmica como x ln( p ) + (1 − x ) ln(1 − p ) . Nótese que se puede usar cualquier base logarítmica, ya que las reglas de puntuación estrictamente propias siguen siendo estrictamente propias bajo una transformación lineal. Es decir:

L(pag,i)=registrob(pagi){\displaystyle L(\mathbf {p} ,i)=\log _{b}(p_{i})}

es estrictamente apropiado para todosb>1{\displaystyle b>1}.

Puntuación cuadrática/de Brier

La regla de puntuación cuadrática es una regla de puntuación estrictamente propia.

SQ(pag,i)=2pagipagpag=2pagij=1metropagj2{\displaystyle \mathbf {S} _{Q}(\mathbf {p} ,i)=2p_{i}-\mathbf {p} \cdot \mathbf {p} =2p_{i}-\sum _{j=1}^{m}p_{j}^{2}}

dóndepagi{\displaystyle p_{i}}es la probabilidad asignada a la respuesta correctai{\displaystyle i}.

La puntuación de Brier , propuesta originalmente por Glenn W. Brier en 1950, [ 6 ] se puede obtener mediante una transformación afín a partir de la regla de puntuación cuadrática.

SB(pag,i)=j=1metro(yjpagj)2{\displaystyle \mathbf {S} _{B}(\mathbf {p} ,i)=\sum _{j=1}^{m}(y_{j}-p_{j})^{2}}

Dóndeyj=1{\displaystyle y_{j}=1}cuando elj{\displaystyle j}El evento es correcto yyj=0{\displaystyle y_{j}=0}De lo contrario, puede considerarse una generalización del error cuadrático medio a las predicciones probabilísticas.

Una diferencia importante entre estas dos reglas es que un pronosticador debe esforzarse por maximizar la puntuación cuadrática.SQ{\displaystyle \mathbf {S} _{Q}}pero minimizando la puntuación de BrierSB{\displaystyle \mathbf {S} _{B}}Esto se debe a un signo negativo en la transformación lineal entre ellos.

Puntuación esférica

La regla de puntuación esférica es también una regla de puntuación estrictamente correcta.

S(pag,i)=pagipag=pagipag12++pagmetro2{\displaystyle \mathbf {S} (\mathbf {p} ,i)={\frac {p_{i}}{\lVert \mathbf {p} \rVert }}={\frac {p_{i}}{\sqrt {p_{1}^{2}+\cdots +p_{m}^{2}}}}}

También su generalización conα>1{\displaystyle \alpha >1}es estrictamente apropiado

S(pag,i)=pagiα1(j=1metropagjα)(α1)/α{\displaystyle \mathbf {S} (\mathbf {p} ,i)={\frac {p_{i}^{\alpha -1}}{\left(\sum _{j=1}^{m}p_{j}^{\alpha }\right)^{(\alpha -1)/\alpha }}}}

Puntuación de probabilidad clasificada

La puntuación de probabilidad clasificada [ 7 ] (RPS) es una regla de puntuación estrictamente apropiada, que se puede expresar como:

RPAGS(pag,i)=k=1metro1(j=1kpagjyj)2{\displaystyle RPS(\mathbf {p} ,i)=\sum _{k=1}^{m-1}\left(\sum _{j=1}^{k}p_{j}-y_{j}\right)^{2}}

Dóndeyj=1{\displaystyle y_{j}=1}cuando elj{\displaystyle j}El evento es correcto yyj=0{\displaystyle y_{j}=0}de lo contrario, ymetro{\displaystyle m}es el número de clases. Aparte de otras reglas de puntuación, la puntuación de probabilidad clasificada considera la distancia entre clases, es decir, las clases 1 y 2 se consideran más cercanas que las clases 1 y 3. La puntuación asigna mejores puntuaciones a las predicciones probabilísticas con altas probabilidades asignadas a clases cercanas a la clase correcta. Por ejemplo, al considerar predicciones probabilísticaspag1=(0,5,0,5,0){\displaystyle \mathbf {p} _{1}=(0.5,0.5,0)}y pag2=(0,5,0,0,5){\displaystyle \mathbf {p} _{2}=(0.5,0,0.5)}, encontramos queRPAGS(pag1,1)=0,25{\displaystyle RPS(\mathbf {p} _{1},1)=0.25}, mientrasRPAGS(pag2,1)=0,5{\displaystyle RPS(\mathbf {p} _{2},1)=0.5}, a pesar de que ambos pronósticos probabilísticos asignan una probabilidad idéntica a la clase correcta.

Comparación de reglas de puntuación estrictamente propias categóricas

A continuación, a la izquierda, se muestra una comparación gráfica de las reglas de puntuación logarítmica, cuadrática y esférica para un problema de clasificación binaria . El eje x indica la probabilidad reportada para el evento que realmente ocurrió.

Es importante destacar que cada una de las puntuaciones tiene magnitudes y ubicaciones diferentes. Sin embargo, las diferencias de magnitud no son relevantes, ya que las puntuaciones se mantienen válidas tras la transformación afín. Por lo tanto, para comparar distintas puntuaciones, es necesario trasladarlas a una escala común. Una opción de normalización adecuada se muestra en la imagen, donde todas las puntuaciones intersecan los puntos (0,5,0) y (1,1). Esto garantiza que el resultado sea 0 para una distribución uniforme (dos probabilidades de 0,5 cada una), lo que refleja que no hay coste ni beneficio por informar sobre lo que suele ser la distribución de referencia. Todas las puntuaciones normalizadas que se muestran a continuación también dan como resultado 1 cuando a la clase verdadera se le asigna una probabilidad de 1.

Variables continuas univariadas

Las reglas de puntuación que se enumeran a continuación tienen como objetivo evaluar las predicciones probabilísticas cuando las distribuciones predichas son distribuciones de probabilidad continuas univariadas , es decir, las distribuciones predichasF{\displaystyle F}se definen sobre una variable objetivo univariadaYR{\displaystyle Y\in \mathbb {R} }y tienen una función de densidad de probabilidadF:RR+{\displaystyle f:\mathbb {R} \to \mathbb {R} _{+}}Se pueden clasificar en 3 grupos:

  • Reglas de puntuación para predicciones de la densidad de probabilidadF{\displaystyle f}
  • Reglas de puntuación para la predicción de la función de distribución acumulada (CDF)F{\displaystyle F}
  • Reglas de puntuación que dependen únicamente del primer y segundo impulso

Puntuación logarítmica para variables continuas

La puntuación logarítmica es una regla de puntuación local y estrictamente propia. Se define como

L(F,y)=ln(F(y)){\displaystyle L(F,y)=-\ln(f(y))}.

La puntuación logarítmica para variables continuas tiene fuertes vínculos con la estimación de máxima verosimilitud y con la divergencia de Kullback-Leibler .

Puntuación cuadrática para variables continuas

La regla de puntuación cuadrática para variables continuas dice:

S(F,y)=2F(y)F22{\displaystyle S(f,y)=2f(y)-\|f\|_{2}^{2}}

Es estrictamente apropiado para densidades para las cuales la normaF22=(F(y)2dy)12{\displaystyle \|f\|_{2}^{2}=\left(\int f(y)^{2}dy\right)^{\frac {1}{2}}}existe.

Puntuación de probabilidad clasificada continua

Ilustración de la puntuación de probabilidad clasificada continua (CRPS). Dada una muestra y y una distribución acumulativa predicha F, la CRPS se obtiene calculando la diferencia entre las curvas en cada punto x del soporte, elevándola al cuadrado e integrándola sobre todo el soporte.

La puntuación de probabilidad clasificada continua (CRPS) [ 8 ] es una regla de puntuación estrictamente apropiada muy utilizada en meteorología. Está estrechamente relacionada con la distancia de energía unidimensional y se define como

doRPAGS(F,y)=R(F(incógnita)H(incógnitay))2dincógnita{\displaystyle CRPS(F,y)=\int _{\mathbb {R} }(F(x)-H(x-y))^{2}dx}

dóndeH{\displaystyle H}es la función escalón de Heaviside yyR{\displaystyle y\in \mathbb {R} }es la observación. Para distribuciones con primer momento finito , la puntuación de probabilidad clasificada continua se puede escribir como: [ 1 ]

doRPAGS(F,y)=miincógnitaF|incógnitay|12miincógnita,incógnitaF|incógnitaincógnita|{\displaystyle CRPS(F,y)=\mathbb {E} _{X\sim F}|X-y|-{\frac {1}{2}}\mathbb {E} _{X,X'\sim F}|X-X'|}

dóndeincógnita{\displaystyle X}yincógnita{\displaystyle X'}son variables aleatorias independientes, ambas muestreadas de la distribuciónF{\displaystyle F}. Esta es la forma energética de CRPS y abre la puerta a la estimación de CRPS mediante muestreo de Monte Carlo (a través de la aproximación del valor esperado).

Además, cuando la función de probabilidad acumuladaF{\displaystyle F}es continuo, la puntuación de probabilidad clasificada continua también se puede escribir como [ 9 ]

doRPAGS(F,y)=miincógnitaF|incógnitay|+miincógnitaF[incógnita]2miincógnitaF[incógnitaF(incógnita)]{\displaystyle CRPS(F,y)=\mathbb {E} _{X\sim F}|X-y|+\mathbb {E} _{X\sim F}[X]-2\mathbb {E} _{X\sim F}[X\cdot F(X)]}

La puntuación de probabilidad clasificada continua puede considerarse tanto una extensión continua de la puntuación de probabilidad clasificada como una regresión de cuantiles . La puntuación de probabilidad clasificada continua sobre la distribución empíricaF^q{\displaystyle {\hat {F}}_{q}}de un conjunto ordenado de puntosq1qnorte{\displaystyle q_{1}\leq \ldots \leq q_{n}}(es decir, cada punto tiene1/norte{\displaystyle 1/n}probabilidad de ocurrencia), es igual al doble de la pérdida de cuantil media aplicada en aquellos puntos con cuantiles distribuidos uniformemente.(τ1,,τnorte)=(1/(2norte),,(2norte1)/(2norte)){\displaystyle (\tau _{1},\ldots ,\tau _{n})=(1/(2n),\ldots ,(2n-1)/(2n))}: [ 10 ]

doRPAGS(F^q,y)=2nortei=1norteτi(yqi)++(1τi)(qiy)+{\displaystyle CRPS\left({\hat {F}}_{q},y\right)={\frac {2}{n}}\sum _{i=1}^{n}\tau _{i}(y-q_{i})_{+}+(1-\tau _{i})(q_{i}-y)_{+}}

Para muchas familias populares de distribuciones, se han derivado expresiones de forma cerrada para la puntuación de probabilidad clasificada continua. Esta puntuación se ha utilizado como función de pérdida para redes neuronales artificiales , en las que las predicciones meteorológicas se procesan posteriormente a una distribución de probabilidad gaussiana . [ 11 ] [ 12 ]

CRPS también se adaptó al análisis de supervivencia para cubrir eventos censurados. [ 13 ]

El CRPS puede considerarse como la generalización del error absoluto medio (MAE) a pronósticos probabilísticos, y para una sola muestra es equivalente al MAE. Otra forma de verlo es como la puntuación de Brier/cuadrática de la función de distribución acumulativa muestreada.F{\displaystyle F}para el evento binario{incógnitay}{\displaystyle \{X\leq y\}}.

CRPS es un caso especial de la distancia de Cramér y puede considerarse una mejora de la distancia de Wasserstein, frecuentemente utilizada en aprendizaje automático. La distancia de Cramér tuvo un mejor desempeño en regresión ordinal que la distancia KL o la métrica de Wasserstein. [ 14 ]

CRPS se utiliza ampliamente para evaluar pronósticos probabilísticos y se compara con otras reglas de puntuación, véase, por ejemplo, [ 15 ] . Sin embargo, presenta algunas limitaciones teóricas importantes: se ha demostrado que CRPS puede generar evaluaciones sistemáticamente engañosas al favorecer los pronósticos probabilísticos cuyas medianas se aproximan al resultado observado, independientemente de la probabilidad real asignada a esa región, lo que podría resultar en puntuaciones más altas para pronósticos que asignan una masa de probabilidad insignificante (o incluso nula) al resultado verdadero. Además, CRPS no es invariante ante transformaciones suaves de la variable de pronóstico, y su clasificación de los sistemas de pronóstico puede invertirse bajo dichas transformaciones, lo que genera dudas sobre su consistencia para fines de evaluación. [ 16 ]

Puntuación de Dawid-Sebastiani

La puntuación de Dawid-Sebastiani (DSS) [ 17 ] solo depende del primer y segundo momento, o equivalentemente, de la mediaμF{\displaystyle \mu _{F}}y desviación estándarσF{\displaystyle \sigma _{F}}de la distribuciónF{\displaystyle F}:

S(F,y)=(yμFσF)2+registroσF2{\displaystyle S(F,y)=\left({\frac {y-\mu _{F}}{\sigma _{F}}}\right)^{2}+\log \sigma _{F}^{2}}

Variables continuas multivariadas

Las reglas de puntuación que se enumeran a continuación tienen como objetivo evaluar las predicciones probabilísticas cuando las distribuciones predichas son distribuciones de probabilidad continuas univariadas , es decir, las distribuciones predichas se definen sobre una variable objetivo multivariada.incógnitaRnorte{\displaystyle X\in \mathbb {R} ^{n}}y tienen una función de densidad de probabilidadF:RnorteR+{\displaystyle f:\mathbb {R} ^{n}\to \mathbb {R} _{+}}.

Puntuación logarítmica multivariada

La puntuación logarítmica multivariante es similar a la puntuación logarítmica univariante:

L(D,y)=ln(FD(y)){\displaystyle L(D,y)=-\ln(f_{D}(y))}

dóndeFD{\displaystyle f_{D}}denota la función de densidad de probabilidad de la distribución multivariada predichaD{\displaystyle D}Es una regla de puntuación local y estrictamente apropiada.

Regla de puntuación de Hyvärinen

La función de puntuación de Hyvärinen (de una densidad p) se define por [ 18 ].

s(pag)=2Δyregistropag(y)+yregistropag(y)22{\displaystyle s(p)=2\Delta _{y}\log p(y)+\|\nabla _{y}\log p(y)\|_{2}^{2}}

DóndeΔ{\displaystyle \Delta }denota la traza hessiana y{\displaystyle \nabla }denota el gradiente . Esta regla de puntuación puede usarse para simplificar computacionalmente la inferencia de parámetros y abordar la comparación de modelos bayesianos con priors arbitrariamente vagos. [ 18 ] [ 19 ] También se usó para introducir nuevas cantidades de la teoría de la información más allá de la teoría de la información existente . [ 20 ]

La regla de puntuación de Hyvärinen es local de orden 2 (lo que significa que tiene en cuenta localmente las derivadas hasta de segundo orden).

Puntuación energética

La puntuación de energía es una extensión multivariada de la puntuación de probabilidad clasificada continua: [ 1 ]

miSβ(D,Y)=miincógnitaD[incógnitaY2β]12miincógnita,incógnitaD[incógnitaincógnita2β]{\displaystyle ES_{\beta }(D,Y)=\mathbb {E} _{X\sim D}[\lVert X-Y\rVert _{2}^{\beta }]-{\frac {1}{2}}\mathbb {E} _{X,X'\sim D}[\lVert X-X'\rVert _{2}^{\beta }]}

Aquí,β(0,2){\displaystyle \beta \in (0,2)},2{\displaystyle \lVert \rVert _{2}}denota elnorte{\displaystyle n}distancia euclidiana dimensional yincógnita,incógnita{\displaystyle X,X'}son variables aleatorias muestreadas independientemente de la distribución de probabilidadD{\displaystyle D}. La puntuación de energía es estrictamente apropiada para distribucionesD{\displaystyle D}para quémiincógnitaD[incógnita2]{\displaystyle \mathbb {E} _{X\sim D}[\lVert X\rVert _{2}]}es finito. Se ha sugerido que la puntuación de energía es algo ineficaz al evaluar la estructura de dependencia intervariable de la distribución multivariada pronosticada. [ 21 ] Aparte de un término que depende solo de la distribución de la observación, la puntuación de energía es igual al doble de la distancia de energía entre la distribución predicha y la distribución empírica de la observación.

Puntuación del variograma

La puntuación del variograma de ordenpag{\displaystyle p}está dado por: [ 22 ]

VSpag(D,Y)=i,j=1nortewij(|YiYj|pagmiincógnitaD[|incógnitaiincógnitaj|pag])2{\displaystyle VS_{p}(D,Y)=\sum _{i,j=1}^{n}w_{ij}(|Y_{i}-Y_{j}|^{p}-\mathbb {E} _{X\sim D}[|X_{i}-X_{j}|^{p}])^{2}}

Aquí,wij{\displaystyle w_{ij}}son pesos, a menudo establecidos en 1, ypag>0{\displaystyle p>0}puede ser elegido arbitrariamente, peropag=0,5,1{\displaystyle p=0.5,1}o2{\displaystyle 2}se utilizan con frecuencia.incógnitai{\displaystyle X_{i}}está aquí para denotar eli{\displaystyle i}variable aleatoria marginal deincógnita{\displaystyle X}. La puntuación del variograma es apropiada para distribuciones para las cuales el(2pag){\displaystyle (2p)}El momento es finito para todos los componentes, pero nunca es estrictamente propio. En comparación con la puntuación de energía, se afirma que la puntuación del variograma es más discriminatoria con respecto a la estructura de correlación prevista.

Puntuación de probabilidad clasificada continua condicional

La puntuación de probabilidad condicional continua clasificada (CRPS condicional o CCRPS) es una familia de reglas de puntuación (estrictamente) adecuadas. La CRPS condicional evalúa una distribución multivariada pronosticada.D{\displaystyle D}mediante la evaluación de CRPS sobre un conjunto prescrito de distribuciones de probabilidad condicional univariadas de la distribución multivariada predicha: [ 23 ]

dodoRPAGST(D,Y)=i=1kdoRPAGS(PAGincógnitaD(incógnitavi|incógnitaj=Yj para jdoi),Yvi){\displaystyle CCRPS_{\mathcal {T}}(D,Y)=\sum _{i=1}^{k}CRPS(P_{X\sim D}(X_{v_{i}}|X_{j}=Y_{j}{\text{ for }}j\in {\mathcal {C}}_{i}),Y_{v_{i}})}

Aquí,incógnitai{\displaystyle X_{i}}es eli{\displaystyle i}'ª variable marginal deincógnitaD{\displaystyle X\sim D},T=(vi,doi)i=1k{\displaystyle {\mathcal {T}}=(v_{i},{\mathcal {C}}_{i})_{i=1}^{k}}es un conjunto de tuplas que define una especificación condicional (convi{1,,norte}{\displaystyle v_{i}\in \{1,\ldots ,n\}}ydoi{1,,norte}{vi}{\displaystyle {\mathcal {C}}_{i}\subseteq \{1,\ldots ,n\}\setminus \{v_{i}\}}), yPAGincógnitaD(incógnitavi|incógnitaj=Yj para jdoi){\displaystyle P_{X\sim D}(X_{v_{i}}|X_{j}=Y_{j}{\text{ for }}j\in {\mathcal {C}}_{i})}denota la distribución de probabilidad condicional paraincógnitavi{\displaystyle X_{v_{i}}}dado que todas las variablesincógnitaj{\displaystyle X_{j}}parajdoi{\displaystyle j\in {\mathcal {C}}_{i}}son iguales a sus respectivas observaciones. En el caso de quePAGincógnitaD(incógnitavi|incógnitaj=Yj para jdoi){\displaystyle P_{X\sim D}(X_{v_{i}}|X_{j}=Y_{j}{\text{ for }}j\in {\mathcal {C}}_{i})}está mal definido (es decir, su evento condicional tiene probabilidad cero), las puntuaciones CRPS sobre esta distribución se definen como infinitas. El CRPS condicional es estrictamente propio para distribuciones con primer momento finito, si la regla de la cadena se incluye en la especificación condicional, lo que significa que existe una permutaciónϕ1,,ϕnorte{\displaystyle \phi _{1},\ldots ,\phi _{n}}de1,,norte{\displaystyle 1,\ldots ,n}de tal manera que para todos1inorte{\displaystyle 1\leq i\leq n}:(ϕi,{ϕ1,,ϕi1})T{\displaystyle (\phi _{i},\{\phi _{1},\ldots ,\phi _{i-1}\})\in {\mathcal {T}}}.

Interpretación de las reglas de puntuación adecuadas

Todas las reglas de puntuación adecuadas son iguales a sumas ponderadas (integrales con una función de ponderación no negativa) de las pérdidas en un conjunto de problemas de decisión simples de dos alternativas que utilizan la predicción probabilística, cada uno de dichos problemas de decisión tiene una combinación particular de parámetros de costo asociados para decisiones falsas positivas y falsas negativas . Una regla de puntuación estrictamente adecuada corresponde a tener una ponderación distinta de cero para todos los posibles umbrales de decisión. Cualquier regla de puntuación adecuada dada es igual a las pérdidas esperadas con respecto a una distribución de probabilidad particular sobre los umbrales de decisión; por lo tanto, la elección de una regla de puntuación corresponde a una suposición sobre la distribución de probabilidad de los problemas de decisión para los cuales finalmente se emplearán las probabilidades predichas, con, por ejemplo, la regla de puntuación de pérdida cuadrática (o Brier) correspondiente a una probabilidad uniforme de que el umbral de decisión esté en cualquier punto entre cero y uno. La puntuación de precisión de clasificación (porcentaje clasificado correctamente), una regla de puntuación de umbral único que es cero o uno dependiendo de si la probabilidad predicha está en el lado apropiado de 0,5, es una regla de puntuación adecuada pero no una regla de puntuación estrictamente adecuada porque se optimiza (en expectativa) no solo prediciendo la probabilidad verdadera sino prediciendo cualquier probabilidad en el mismo lado de 0,5 que la probabilidad verdadera. [ 24 ] [ 25 ] [ 26 ] [ 27 ] [ 28 ] [ 29 ]

Ejemplos de funciones de puntuación consistentes

Existe un número infinito de funciones de puntuación, incluyendo familias parametrizadas completas de funciones de puntuación estrictamente consistentes para ciertos funcionales.T{\displaystyle T}Los que se muestran a continuación son una selección de los más conocidos.

Expectativa

Las siguientes funciones de puntuación son estrictamente consistentes para el valor esperado , es decirT(F)=miYF[Y]{\displaystyle T(F)=E_{Y\sim F}[Y]}.

Error cuadrático

S(incógnita,y)=(incógnitay)2{\displaystyle S(x,y)=(x-y)^{2}}

Cuantiles

Las siguientes funciones de puntuación son estrictamente consistentes para laα{\displaystyle \alpha }- cuantil , es decirT(F)=qα{\displaystyle T(F)=q_{\alpha }}es el conjunto de valoresq{\displaystyle q}satisfactoriolímiteyqF(y)αF(q){\displaystyle \lim _{y\uparrow q}F(y)\leq \alpha \leq F(q)}.

Pérdida de cuantiles / pérdida de pinball

S(incógnita,y)=(1{incógnitay}α)(incógnitay){\displaystyle S(x,y)=(\mathbf {1} \{x\geq y\}-\alpha )(x-y)}

Intervalos

La predicción puntual consiste en un elemento central(1α){\displaystyle (1-\alpha )}intervalo de predicción,incógnita=(l,){\displaystyle x=(l,u)}donde el punto final inferiorl{\displaystyle l}predice elα2{\displaystyle {\frac {\alpha }{2}}}cuantil y el punto final superior{\displaystyle u}predice el1α2{\displaystyle 1-{\frac {\alpha }{2}}}cuantil.

Puntuación del intervalo

La puntuación inverval es una combinación de las dos pérdidas de pinball para los cuantiles correspondientes.

Sα(l,;y)=(l)+2α(ly)1{y<l}+2α(y)1{y>}{\displaystyle S_{\alpha }(l,u;y)=(u-l)+{\frac {2}{\alpha }}(l-y)\,\mathbf {1} \{y<l\}+{\frac {2}{\alpha }}(y-u)\,\mathbf {1} \{y>u\}}

"El pronosticador es recompensado por intervalos de predicción estrechos, y sufre una penalización, cuyo tamaño depende de α, si la observación no se encuentra dentro del intervalo" [ 1 ].

Aplicaciones

La regla logarítmica

Pronósticos meteorológicos

Un ejemplo de pronóstico probabilístico se encuentra en la meteorología, donde un meteorólogo puede indicar la probabilidad de lluvia para el día siguiente. Se podría observar la frecuencia con la que se mencionó una probabilidad del 25% durante un período prolongado y compararla con la proporción real de veces que llovió. Si el porcentaje real difiere sustancialmente de la probabilidad indicada, decimos que el pronosticador está mal calibrado . Un sistema de bonificación podría incentivar a un pronosticador mal calibrado a mejorar . Un sistema de bonificación diseñado con una regla de puntuación adecuada lo incentivará a reportar probabilidades que se ajusten a sus creencias personales . [ 3 ]

Además del caso sencillo de una decisión binaria , como asignar probabilidades a "lluvia" o "no lluvia", se pueden utilizar reglas de puntuación para múltiples clases, como "lluvia", "nieve" o "cielo despejado", o respuestas continuas como la cantidad de lluvia por día.

La imagen muestra un ejemplo de regla de puntuación, la regla de puntuación logarítmica, en función de la probabilidad reportada para el evento que realmente ocurrió. Una forma de usar esta regla sería como un costo basado en la probabilidad que asigna un pronosticador o algoritmo, para luego verificar qué evento ocurrió realmente.

Las reglas de puntuación pueden utilizarse más allá de las métricas de evaluación para servir directamente como función de pérdida para construir estimadores. [ 1 ]

Véase también

Literatura

  • Reglas de puntuación, predicción y estimación estrictamente correctas. Tilmann Gneiting y Adrian E. Raftery, páginas 359-378, https://doi.org/10.1198/016214506000001437 , pdf
  • Reglas de puntuación para distribuciones de probabilidad continuas, James E. Matheson, Robert L. Winkler, (1976) Reglas de puntuación para distribuciones de probabilidad continuas. Management Science 22(10):1087-1096. http://dx.doi.org/10.1287/mnsc.22.10.1087

Referencias

  1. 1 2 3 4 5 6 Gneiting, Tilmann; Raftery, Adrian E. (2007). "Reglas de puntuación estrictamente apropiadas, predicción y estimación" (PDF) . Journal of the American Statistical Association . 102 (447): 359– 378. doi : 10.1198/016214506000001437 . S2CID 1878582 . 
  2. Gneiting, Tilmann (2011). "Making and Evaluating Point Forecasts". Journal of the American Statistical Association. 106 (494): 746–762. arXiv:0912.0902. doi:10.1198/jasa.2011.r10138. S2CID 88518170.
  3. 12Bickel, E.J. (2007). "Some Comparisons among Quadratic, Spherical, and Logarithmic Scoring Rules"(PDF). Decision Analysis. 4 (2): 49–65. doi:10.1287/deca.1070.0089.
  4. Murphy, A.H. (1973). "A new vector partition of the probability score". Journal of Applied Meteorology. 12 (4): 595–600. Bibcode:1973JApMe..12..595M. doi:10.1175/1520-0450(1973)012<0595:ANVPOT>2.0.CO;2.
  5. Bröcker, J. (2009). "Reliability, sufficiency, and the decomposition of proper scores"(PDF). Quarterly Journal of the Royal Meteorological Society. 135 (643): 1512–1519. arXiv:0806.0813. Bibcode:2009QJRMS.135.1512B. doi:10.1002/qj.456. S2CID 15880012.
  6. Brier, G.W. (1950). "Verification of forecasts expressed in terms of probability"(PDF). Monthly Weather Review. 78 (1): 1–3. Bibcode:1950MWRv...78....1B. doi:10.1175/1520-0493(1950)078<0001:VOFEIT>2.0.CO;2.
  7. Epstein, Edward S. (1969-12-01). "A Scoring System for Probability Forecasts of Ranked Categories". Journal of Applied Meteorology and Climatology. 8 (6). American Meteorological Society: 985–987. doi:10.1175/1520-0450(1969)008<0985:ASSFPF>2.0.CO;2. Retrieved 2024-05-02.
  8. Matheson, James E.; Winkler, Robert L. (junio de 1976). "Reglas de puntuación para distribuciones de probabilidad continuas". Management Science . 22 (10): 1087– 1096. doi : 10.1287/mnsc.22.10.1087 .
  9. Taillardat, Maxime; Mestre, Olivier; Zamo, Michaël; Naveau, Philippe (2016-06-01). "Pronósticos de conjunto calibrados utilizando bosques de regresión de cuantiles y estadísticas de salida de modelos de conjunto" (PDF) . Monthly Weather Review . 144 (6). American Meteorological Society: 2375– 2393. doi : 10.1175/mwr-d-15-0260.1 . ISSN 0027-0644 . 
  10. Bröcker, Jochen (2012). "Evaluación de conjuntos sin procesar con la puntuación de probabilidad clasificada continua". Quarterly Journal of the Royal Meteorological Society . 138 (667): 1611– 1617. doi : 10.1002/qj.1891 . ISSN 0035-9009 . 
  11. Rasp, Stephan; Lerch, Sebastian (31 de octubre de 2018). "Redes neuronales para el postprocesamiento de pronósticos meteorológicos de conjunto". Monthly Weather Review . 146 (11). American Meteorological Society: 3885–3900 . arXiv : 1805.09091 . doi : 10.1175/mwr-d-18-0187.1 . ISSN 0027-0644 . 
  12. Grönquist, Peter; Yao, Chengyuan; Ben-Nun, Tal; Dryden, Nikoli; Dueben, Peter; Li, Shigang; Hoefler, Torsten (2021-04-05). "Aprendizaje profundo para el postprocesamiento de pronósticos meteorológicos de conjunto". Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences . 379 (2194) 20200092. arXiv : 2005.08748 . doi : 10.1098/rsta.2020.0092 . ISSN 1364-503X . PMID 33583263 .  
  13. Regresión de cuenta regresiva: predicciones de supervivencia precisas y calibradas, https://arxiv.org/abs/1806.08324
  14. La distancia de Cramer como solución a los gradientes de Wasserstein sesgados https://arxiv.org/abs/1705.10743
  15. Bjerregård, Mathias Blicher; Møller, Jan Kloppenborg; Madsen, Henrik (2021). "Una introducción a la evaluación de pronósticos probabilísticos multivariados" . Energía e IA . 4 100058. Elsevier BV. doi : 10.1016/j.egyai.2021.100058 . ISSN 2666-5468 . 
  16. Más allá de las reglas de puntuación estrictamente correctas: la importancia de ser local https://doi.org/10.1175/WAF-D-19-0205.1
  17. Dawid, A. Philip; Sebastiani, Paola (1 de marzo de 1999). "Criterios de dispersión coherente para un diseño experimental óptimo". The Annals of Statistics . 27 (1). doi : 10.1214/AOS/1018031101 .
  18. 1 2 Hyvärinen, Aapo (2005). "Estimación de modelos estadísticos no normalizados mediante ajuste de puntuación" . Journal of Machine Learning Research . 6 (24): 695– 709. ISSN 1533-7928 . 
  19. Shao, Stephane; Jacob, Pierre E.; Ding, Jie; Tarokh, Vahid (2019-10-02). "Comparación de modelos bayesianos con la puntuación de Hyvärinen: cálculo y consistencia". Journal of the American Statistical Association . 114 (528): 1826– 1837. arXiv : 1711.00136 . doi : 10.1080/01621459.2018.1518237 . ISSN 0162-1459 . S2CID 52264864 .  
  20. Ding, Jie; Calderbank, Robert; Tarokh, Vahid (2019). "Información de gradiente para representación y modelado" . Avances en sistemas de procesamiento de información neuronal . 32 : 2396–2405 .
  21. Pinson, Pierre; Tastu, Julija (2013). "Capacidad de discriminación del puntaje de energía" . Universidad Técnica de Dinamarca . Recuperado el 11 de mayo de 2024 .
  22. Scheuerer, Michael; Hamill, Thomas M. (31 de marzo de 2015). "Reglas de puntuación adecuadas basadas en variogramas para pronósticos probabilísticos de cantidades multivariadas*". Monthly Weather Review . 143 (4). American Meteorological Society: 1321– 1334. doi : 10.1175/mwr-d-14-00269.1 . ISSN 0027-0644 . 
  23. Roordink, Daan; Hess, Sibylle (2023). «Redes de reglas de puntuación: Más allá de la predicción del objetivo medio en la regresión multivariante». Aprendizaje automático y descubrimiento de conocimiento en bases de datos: Línea de investigación . Vol. 14170. Cham: Springer Nature Suiza. págs. 190-205. doi : 10.1007/978-3-031-43415-0_12 . ISBN   978-3-031-43414-3.
  24. Leonard J. Savage. Obtención de probabilidades y expectativas personales. J. of the American Stat. Assoc., 66(336):783–801, 1971.
  25. Schervish, Mark J. (1989). "Un método general para comparar evaluadores de probabilidad", Annals of Statistics 17 (4) 1856–1879, https://projecteuclid.org/euclid.aos/1176347398
  26. Rosen, David B. (1996). "¿Qué tan buenas fueron esas predicciones de probabilidad? La regla de puntuación de pérdida de recomendación esperada (ERL)" . En Heidbreder, G. (ed.). Métodos bayesianos y de máxima entropía (Actas del decimotercer taller internacional, agosto de 1993) . Kluwer, Dordrecht, Países Bajos.
  27. Roulston, MS, & Smith, LA (2002). Evaluación de pronósticos probabilísticos mediante la teoría de la información. Monthly Weather Review, 130, 1653–1660. Véase el APÉNDICE "Puntuaciones de habilidad y costo-pérdida".
  28. "Funciones de pérdida para la estimación de probabilidad de clase binaria y clasificación: estructura y aplicaciones", Andreas Buja, Werner Stuetzle, Yi Shen (2005) http://citeseerx.ist.psu.edu/viewdoc/summary?doi=10.1.1.184.5203
  29. Hernandez-Orallo, Jose; Flach, Peter; y Ferri, Cesar (2012). "Una visión unificada de las métricas de rendimiento: Traduciendo la elección del umbral en la pérdida de clasificación esperada". Journal of Machine Learning Research 13 2813–2869. http://www.jmlr.org/papers/volume13/hernandez-orallo12a/hernandez-orallo12a.pdf
  • Vídeo que compara las reglas de puntuación esféricas, cuadráticas y logarítmicas.
  • Reglas de puntuación locales adecuadas
  • Educación sobre reglas de puntuación y análisis de decisiones
  • Reglas de puntuación estrictamente correctas
  • Reglas de puntuación e incertidumbre
  • Daños causados ​​por la precisión de la clasificación y otras reglas de puntuación de precisión incorrectas y discontinuas.
  • Expresiones en forma cerrada de la puntuación de probabilidad clasificada continua