Articulo de referencia

entropía cruzada

En teoría de la información , la entropía cruzada entre dos distribuciones de probabilidad pag {\displaystyle p} y q {\displaystyle q} Sobre el mismo conjunto subyacente de even...

En teoría de la información , la entropía cruzada entre dos distribuciones de probabilidadpag{\displaystyle p}yq{\displaystyle q}Sobre el mismo conjunto subyacente de eventos, mide el número promedio de bits necesarios para identificar un evento extraído del conjunto cuando el esquema de codificación utilizado para el conjunto está optimizado para una distribución de probabilidad estimada.q{\displaystyle q}, en lugar de la distribución verdaderapag{\displaystyle p}.

Definición

La entropía cruzada de la distribuciónq{\displaystyle q} en relación con una distribuciónpag{\displaystyle p}sobre un conjunto dado se define de la siguiente manera:

H(pag,q)=mipag[registroq],{\displaystyle H(p,q)=-\operatorname {E} _{p}[\log q],}

dóndemipag[]{\displaystyle \operatorname {E} _{p}[\cdot ]}es el operador de valor esperado con respecto a la distribuciónpag{\displaystyle p}.

La definición puede formularse utilizando la divergencia de Kullback-Leibler.DKL(pagq){\displaystyle D_{\mathrm {KL} }(p\parallel q)}, divergencia depag{\displaystyle p}deq{\displaystyle q}(también conocida como la entropía relativa depag{\displaystyle p}con respecto aq{\displaystyle q}).

H(pag,q)=H(pag)+DKL(pagq),{\displaystyle H(p,q)=H(p)+D_{\mathrm {KL} }(p\parallel q),}

dóndeH(pag){\displaystyle H(p)}es la entropía depag{\displaystyle p}.

Para distribuciones de probabilidad discretaspag{\displaystyle p}yq{\displaystyle q}con el mismo apoyoincógnita{\displaystyle {\mathcal {X}}}, esto significa

H(pag,q)=incógnitaincógnitapag(incógnita)registroq(incógnita).{\displaystyle H(p,q)=-\sum _{x\in {\mathcal {X}}}p(x)\,\log q(x).}   ( Ecuación 1 )

La situación para las distribuciones continuas es análoga. Tenemos que suponer quepag{\displaystyle p}yq{\displaystyle q}son absolutamente continuos con respecto a alguna medida de referenciar{\displaystyle r}(generalmenter{\displaystyle r}es una medida de Lebesgue en un σ-álgebra de Borel ).PAG{\displaystyle P}yQ{\displaystyle Q}sean funciones de densidad de probabilidad depag{\displaystyle p}yq{\displaystyle q}con respecto ar{\displaystyle r}. Entonces

incógnitaPAG(incógnita)registroQ(incógnita)dincógnita=mipag[registroQ],{\displaystyle -\int _{\mathcal {X}}P(x)\,\log Q(x)\,\mathrm {d} x=\operatorname {E} _{p}[-\log Q],}

y por lo tanto

H(pag,q)=incógnitaPAG(incógnita)registroQ(incógnita)dincógnita.{\displaystyle H(p,q)=-\int _{\mathcal {X}}P(x)\,\log Q(x)\,\mathrm {d} x.}   ( Ecuación 2 )

Nota: La notaciónH(pag,q){\displaystyle H(p,q)}También se utiliza para un concepto diferente, la entropía conjunta depag{\displaystyle p}yq{\displaystyle q}.

Motivación

En teoría de la información , el teorema de Kraft - McMillan establece que cualquier esquema de codificación directamente decodificable para codificar un mensaje para identificar un valorincógnitai{\displaystyle x_{i}}de un conjunto de posibilidades{incógnita1,,incógnitanorte}{\displaystyle \{x_{1},\ldots ,x_{n}\}}puede considerarse como la representación de una distribución de probabilidad implícitaq(incógnitai)=(12)i{\displaystyle q(x_{i})=\left({\frac {1}{2}}\right)^{\ell _{i}}}encima{incógnita1,,incógnitanorte}{\displaystyle \{x_{1},\ldots ,x_{n}\}}, dóndei{\displaystyle \ell _{i}}es la longitud del código paraincógnitai{\displaystyle x_{i}}en bits. Por lo tanto, la entropía cruzada puede interpretarse como la longitud esperada del mensaje por dato cuando una distribución incorrectaq{\displaystyle q}Se asume que los datos en realidad siguen una distribución.pag{\displaystyle p}Por eso se toma la esperanza sobre la distribución de probabilidad verdadera.pag{\displaystyle p}y noq.{\displaystyle q.}De hecho, la longitud esperada del mensaje bajo la distribución verdaderapag{\displaystyle p}es

mipag[]=mipag[lnq(incógnita)ln(2)]=mipag[registro2q(incógnita)]=incógnitaipag(incógnitai)registro2q(incógnitai)=incógnitapag(incógnita)registro2q(incógnita)=H(pag,q).{\displaystyle {\begin{aligned}\operatorname {E} _{p}[\ell ]&=-\operatorname {E} _{p}\left[{\frac {\ln {q(x)}}{\ln(2)}}\right]\\[1ex]&=-\operatorname {E} _{p}\left[\log _{2}{q(x)}\right]\\[1ex]&=-\sum _{x_{i}}p(x_{i})\,\log _{2}q(x_{i})\\[1ex]&=-\sum _{x}p(x)\,\log _{2}q(x)=H(p,q).\end{aligned}}}

Estimación

Hay muchas situaciones en las que es necesario medir la entropía cruzada, pero la distribución depag{\displaystyle p}es desconocido. Un ejemplo es el modelado del lenguaje , donde se crea un modelo basado en un conjunto de entrenamiento.T{\displaystyle T}y luego se mide su entropía cruzada en un conjunto de prueba para evaluar qué tan preciso es el modelo al predecir los datos de prueba. En este ejemplo,pag{\displaystyle p}es la verdadera distribución de palabras en cualquier corpus, yq{\displaystyle q}es la distribución de palabras según lo predicho por el modelo. Dado que se desconoce la distribución real, la entropía cruzada no se puede calcular directamente. En estos casos, se calcula una estimación de la entropía cruzada utilizando la siguiente fórmula:

H(T,q)=i=1norte1norteregistro2q(incógnitai){\displaystyle H(T,q)=-\sum _{i=1}^{N}{\frac {1}{N}}\log _{2}q(x_{i})}

dóndenorte{\displaystyle N}es el tamaño del conjunto de prueba yq(incógnita){\displaystyle q(x)}es la probabilidad del eventoincógnita{\displaystyle x}estimado a partir del conjunto de entrenamiento. En otras palabras,q(incógnitai){\displaystyle q(x_{i})}es la estimación de probabilidad del modelo de que la i-ésima palabra del texto seaincógnitai{\displaystyle x_{i}}. La suma se promedia sobre elnorte{\displaystyle N}palabras de la prueba. Esta es una estimación de Monte Carlo de la verdadera entropía cruzada, donde el conjunto de prueba se trata como muestras depag(incógnita){\displaystyle p(x)}.

Relación con la máxima probabilidad

La entropía cruzada surge en los problemas de clasificación al introducir un logaritmo bajo la forma de la función de log-verosimilitud .

Esta sección trata sobre la estimación de las probabilidades de diferentes resultados discretos. Para ello, denotamos una familia parametrizada de distribuciones porqθ{\displaystyle q_{\theta }}, conθ{\displaystyle \theta }sujeto al esfuerzo de optimización. Considere una secuencia finita dada denorte{\displaystyle N}valoresincógnitai{\displaystyle x_{i}}a partir de un conjunto de entrenamiento, obtenido mediante muestreo condicionalmente independiente . La probabilidad asignada a cualquier parámetro consideradoθ{\displaystyle \theta }del modelo viene dado entonces por el producto sobre todas las probabilidadesqθ(incógnita=incógnitai){\displaystyle q_{\theta }(X=x_{i})}. Son posibles ocurrencias repetidas, lo que lleva a factores iguales en el producto. Si el recuento de ocurrencias del valor es igual aincógnita{\displaystyle x}se denota por#incógnita{\displaystyle \#x}, entonces la frecuencia de ese valor es igual a#incógnita/norte{\displaystyle \#x/N}. Sipag(incógnita=incógnita){\displaystyle p(X=x)}es la distribución de probabilidad subyacente, para grandes norte{\displaystyle N}esperamospag(incógnita=incógnita)#incógnita/norte{\displaystyle p(X=x)\approx \#x/N}, por la ley de los grandes números .

Escribimos nuestra función de verosimilitud como el producto de observaciones de la distribuciónqθ{\displaystyle q_{\theta }}: L(θ;incógnita)=iqθ(incógnita=incógnitai)=incógnitaqθ(incógnita=incógnita)#incógnitaincógnitaqθ(incógnita=incógnita)nortepag(incógnita=incógnita)=expregistro[incógnitaqθ(incógnita=incógnita)nortepag(incógnita=incógnita)]=exp(incógnitanortepag(incógnita=incógnita)registroqθ(incógnita=incógnita)),{\displaystyle {\begin{aligned}{\mathcal {L}}(\theta ;{\mathbf {x} })&=\prod _{i}q_{\theta }(X=x_{i})=\prod _{x}q_{\theta }(X=x)^{\#x}\\&\approx \prod _{x}q_{\theta }(X=x)^{N\cdot p(X=x)}=\exp \log \left[\prod _{x}q_{\theta }(X=x)^{N\cdot p(X=x)}\right]\\&=\exp \left(\sum _{x}N\cdot p(X=x)\log q_{\theta }(X=x)^{}\right),\end{aligned}}} donde hemos utilizado las reglas de cálculo para el logaritmo en la última línea. Observe cómo el exponente contiene unH(pag,qθ){\displaystyle -H(p,q_{\theta })}término. Tomando el logaritmo de ambos lados se obtiene: registroL(θ;incógnita)=norteH(pag,qθ).{\displaystyle \log {\mathcal {L}}(\theta ;{\mathbf {x} })=-N\cdot H(p,q_{\theta }).} Dado que el logaritmo es una función monótonamente creciente , el valor que maximiza θ{\displaystyle \theta }no se ve afectado por este paso final. De manera similar, el valor maximizador de θ{\displaystyle \theta }no se ve afectado por el factor denorte{\displaystyle N}. Así pues, observamos que la maximización de la verosimilitud equivale a la minimización de la entropía cruzada.

Minimización de la entropía cruzada

La minimización de la entropía cruzada se utiliza con frecuencia en la optimización y la estimación de la probabilidad de eventos raros. Al comparar una distribuciónq{\displaystyle q}frente a una distribución de referencia fijapag{\displaystyle p}, la entropía cruzada y la divergencia KL son idénticas salvo una constante aditiva (ya quepag{\displaystyle p}está fijo): Según la desigualdad de Gibbs , ambos toman sus valores mínimos cuandopag=q{\displaystyle p=q}, que es0{\displaystyle 0}para la divergencia KL yH(pag){\displaystyle \mathrm {H} (p)}para la entropía cruzada. En la literatura de ingeniería, el principio de minimizar la divergencia KL (el " Principio de información de discriminación mínima " de Kullback) se denomina a menudo Principio de entropía cruzada mínima (MCE) o Minxent .

Sin embargo, como se analiza en el artículo Divergencia de Kullback-Leibler , a veces la distribuciónq{\displaystyle q}es la distribución de referencia previa fija y la distribuciónpag{\displaystyle p}está optimizado para estar lo más cerca posible deq{\displaystyle q}como sea posible, sujeto a alguna restricción. En este caso, las dos minimizaciones no son equivalentes. Esto ha llevado a cierta ambigüedad en la literatura, y algunos autores intentan resolver la inconsistencia reformulando la entropía cruzada comoDKL(pagq){\displaystyle D_{\mathrm {KL} }(p\parallel q)}, en vez deH(pag,q){\displaystyle H(p,q)}. De hecho, la entropía cruzada es otro nombre para la entropía relativa ; véase Cover y Thomas [ 1 ] y Good. [ 2 ] Por otro lado,H(pag,q){\displaystyle H(p,q)}No coincide con la bibliografía y puede resultar engañoso.

Función de pérdida de entropía cruzada y regresión logística

La entropía cruzada se puede utilizar para definir una función de pérdida en el aprendizaje automático y la optimización . Mao, Mohri y Zhong (2023) ofrecen un análisis exhaustivo de las propiedades de la familia de funciones de pérdida de entropía cruzada en el aprendizaje automático, incluyendo garantías de aprendizaje teóricas y extensiones al aprendizaje adversario . [ 3 ] La probabilidad verdaderapagi{\displaystyle p_{i}}es la etiqueta verdadera y la distribución dadaqi{\displaystyle q_{i}}es el valor predicho del modelo actual. Esto también se conoce como pérdida logarítmica (o pérdida logarítmica [ 4 ] o pérdida logística ); [ 5 ] los términos "pérdida logarítmica" y "pérdida de entropía cruzada" se usan indistintamente. [ 6 ]

Más específicamente, consideremos un modelo de regresión binaria que se puede utilizar para clasificar las observaciones en dos clases posibles (a menudo simplemente etiquetadas como0{\displaystyle 0}y1{\displaystyle 1}). La salida del modelo para una observación dada, dado un vector de características de entrada.incógnita{\displaystyle x}, puede interpretarse como una probabilidad, que sirve de base para clasificar la observación. En la regresión logística , la probabilidad se modela utilizando la función logística.gramo(z)=1/(1+miz){\displaystyle g(z)=1/(1+e^{-z})}dóndez{\displaystyle z}es alguna función del vector de entradaincógnita{\displaystyle x}, comúnmente solo una función lineal. La probabilidad de la saliday=1{\displaystyle y=1}es dado por qy=1=y^gramo(wincógnita)=11+miwincógnita,{\displaystyle q_{y=1}={\hat {y}}\equiv g(\mathbf {w} \cdot \mathbf {x} )={\frac {1}{1+e^{-\mathbf {w} \cdot \mathbf {x} }}},} donde el vector de pesosw{\displaystyle \mathbf {w} }se optimiza mediante algún algoritmo apropiado como el descenso de gradiente . De manera similar, la probabilidad complementaria de encontrar la saliday=0{\displaystyle y=0}simplemente se da por qy=0=1y^.{\displaystyle q_{y=0}=1-{\hat {y}}.}

Habiendo establecido nuestra notación,pag{y,1y}{\displaystyle p\in \{y,1-y\}}yq{y^,1y^}{\displaystyle q\in \{{\hat {y}},1-{\hat {y}}\}}, podemos usar la entropía cruzada para obtener una medida de disimilitud entrepag{\displaystyle p}yq{\displaystyle q}: H(pag,q)=metropagmetroregistroqmetro=yregistroy^(1y)registro(1y^).{\displaystyle {\begin{aligned}H(p,q)&=-\sum _{m}p_{m}\log q_{m}=-y\log {\hat {y}}-(1-y)\log(1-{\hat {y}}).\end{aligned}}}

La gráfica muestra diferentes funciones de pérdida que se pueden usar para entrenar un clasificador binario. Solo se muestra el caso en que la salida objetivo es 1. Se observa que la pérdida es cero cuando el objetivo es igual a la salida y aumenta a medida que la salida se vuelve cada vez más incorrecta.

La regresión logística generalmente optimiza la pérdida logarítmica para todas las observaciones con las que se entrena, lo que equivale a optimizar la entropía cruzada promedio en la muestra. También se pueden usar otras funciones de pérdida que penalizan los errores de manera diferente para el entrenamiento, lo que da como resultado modelos con diferente precisión de prueba final. [ 7 ] Por ejemplo, supongamos que tenemosnorte{\displaystyle N}muestras con cada muestra indexada pornorte=1,,norte{\displaystyle n=1,\dots ,N}El promedio de la función de pérdida viene dado por

J(w)=1nortei=1norteH(pagi,qi)=1nortei=1norte [yiregistroy^i+(1yi)registro(1y^i)],{\displaystyle {\begin{aligned}J(\mathbf {w} )&={\frac {1}{N}}\sum _{i=1}^{N}H(p_{i},q_{i})\\&=-{\frac {1}{N}}\sum _{i=1}^{N}\ \left[y_{i}\log {\hat {y}}_{i}+(1-y_{i})\log(1-{\hat {y}}_{i})\right],\end{aligned}}}

dóndey^igramo(wincógnitai)=1/(1+miwincógnitai){\displaystyle {\hat {y}}_{i}\equiv g(\mathbf {w} \cdot \mathbf {x} _{i})=1/(1+e^{-\mathbf {w} \cdot \mathbf {x} _{i}})}, congramo(z){\displaystyle g(z)}como la función logística como antes.

Relación con la regresión lineal

El gradiente de la pérdida de entropía cruzada para la regresión logística es igual al gradiente de la pérdida de error cuadrático para la regresión lineal (salvo un factor constante). Para ver esto, defina

incógnita(1incógnita11incógnita1pag1incógnita21incógnita2pag1incógnitanorte1incógnitanortepag)Rnorte×(pag+1),{\displaystyle X\equiv {\begin{pmatrix}1&x_{11}&\dots &x_{1p}\\1&x_{21}&\cdots &x_{2p}\\\vdots &\vdots &&\vdots \\1&x_{N1}&\cdots &x_{Np}\\\end{pmatrix}}\in \mathbb {R} ^{N\times (p+1)},}yi^=gramo(wincógnitai)=11+exp(w0w1incógnitai1wpagincógnitaipag),{\displaystyle {\hat {y_{i}}}=g(\mathbf {w} \cdot X^{i})={\frac {1}{1+\exp(-w_{0}-w_{1}x_{i1}-\dots -w_{p}x_{ip})}},}L(w)i=1norte[yilny^i+(1yi)ln(1y^i)].{\displaystyle L(\mathbf {w} )\equiv -\sum _{i=1}^{N}\left[y_{i}\ln {\hat {y}}_{i}+(1-y_{i})\ln(1-{\hat {y}}_{i})\right].}

Entonces tenemos el resultado

wL(w)=incógnitaT(y^y).{\displaystyle \nabla _{\mathbf {w} }L(\mathbf {w} )=X^{\mathsf {T}}({\hat {\mathbf {y} }}-\mathbf {y} ).}

Prueba: Para cualquiery^i{\displaystyle {\hat {y}}_{i}}tenemos

w0lny^i=w0ln11+miw0+k0=miw0+k01+miw0+k0=1y^i,{\displaystyle {\frac {\partial }{\partial w_{0}}}\ln {\hat {y}}_{i}={\frac {\partial }{\partial w_{0}}}\ln {\frac {1}{1+e^{-w_{0}+k_{0}}}}={\frac {e^{-w_{0}+k_{0}}}{1+e^{-w_{0}+k_{0}}}}=1-{\hat {y}}_{i},}w0ln(1y^i)=w0ln(111+miw0+k0)=11+miw0+k0=y^i{\displaystyle {\frac {\partial }{\partial w_{0}}}\ln(1-{\hat {y}}_{i})={\frac {\partial }{\partial w_{0}}}\ln \left(1-{\frac {1}{1+e^{-w_{0}+k_{0}}}}\right)={\frac {-1}{1+e^{-w_{0}+k_{0}}}}=-{\hat {y}}_{i}} y por lo tanto Lw0=i=1norte[yi(1y^i)(1yi)y^i]=i=1norte[yiy^i]=i=1norteincógnitai0(y^iyi).{\displaystyle {\begin{aligned}{\frac {\partial L}{\partial w_{0}}}&=-\sum _{i=1}^{N}[y_{i}(1-{\hat {y}}_{i})-(1-y_{i}){\hat {y}}_{i}]=-\sum _{i=1}^{N}[y_{i}-{\hat {y}}_{i}]=\sum _{i=1}^{N}X_{i0}({\hat {y}}_{i}-y_{i}).\end{aligned}}}

De manera similar, para cualquiery^i{\displaystyle {\hat {y}}_{i}}yj=1,,pag{\displaystyle j=1,\dots ,p}tenemos wjlny^i=wjln11+miwjincógnitaij+kj=incógnitaijmiwjincógnitaij+kj1+miwjincógnitaij+kj=incógnitaij(1y^i),{\displaystyle {\frac {\partial }{\partial w_{j}}}\ln {\hat {y}}_{i}={\frac {\partial }{\partial w_{j}}}\ln {\frac {1}{1+e^{-w_{j}x_{ij}+k_{j}}}}={\frac {x_{ij}e^{-w_{j}x_{ij}+k_{j}}}{1+e^{-w_{j}x_{ij}+k_{j}}}}=x_{ij}(1-{\hat {y}}_{i}),}wjln(1y^i)=wjln[111+miwjincógnitaij+kj]=incógnitaij1+miwjincógnitaij+kj=incógnitaijy^i{\displaystyle {\frac {\partial }{\partial w_{j}}}\ln(1-{\hat {y}}_{i})={\frac {\partial }{\partial w_{j}}}\ln \left[1-{\frac {1}{1+e^{-w_{j}x_{ij}+k_{j}}}}\right]={\frac {-x_{ij}}{1+e^{-w_{j}x_{ij}+k_{j}}}}=-x_{ij}{\hat {y}}_{i}} y por lo tanto Lwj=i=1norteincógnitaij[yi(1y^i)(1yi)y^i]=i=1norteincógnitaij(y^iyi).{\displaystyle {\begin{aligned}{\frac {\partial L}{\partial w_{j}}}&=-\sum _{i=1}^{N}x_{ij}[y_{i}(1-{\hat {y}}_{i})-(1-y_{i}){\hat {y}}_{i}]=\sum _{i=1}^{N}X_{ij}({\hat {y}}_{i}-y_{i}).\end{aligned}}}

En conjunto, obtenemos el resultado deseado. Nótese que aquí utilizamos el logaritmo natural.lnorte{\displaystyle ln}en lugar delogramo{\displaystyle log}(canónicamentelogramo2{\displaystyle log_{2}}) en la función de pérdidaL{\displaystyle L}Esto simplemente cambia el resultado por un factor delogramo(mi){\displaystyle log(e)}Sin embargo. Además, para todosi{\displaystyle i}reutilizamosk0:=l=1pagwlincógnitail{\displaystyle k_{0}:=-\sum _{l=1}^{p}w_{l}x_{il}}ykj:=w0ljwlincógnitail{\displaystyle k_{j}:=-w_{0}-\sum _{l\neq j}w_{l}x_{il}}como constantes con respecto a cada unowj{\displaystyle w_{j}}.

entropía cruzada modificada

Puede ser beneficioso entrenar un conjunto de modelos que tengan diversidad, de modo que cuando se combinen, su precisión predictiva aumente. [ 8 ] [ 9 ] Suponiendo un conjunto simple deK{\displaystyle K}Los clasificadores se ensamblan promediando las salidas, luego la entropía cruzada modificada viene dada por mik=H(pag,qk)λKjkH(qj,qk){\displaystyle e^{k}=H(p,q^{k})-{\frac {\lambda }{K}}\sum _{j\neq k}H(q^{j},q^{k})} dóndemik{\displaystyle e^{k}}es la función de costo de lakth{\displaystyle k^{th}}clasificador,qk{\displaystyle q^{k}}es la probabilidad de salida de lakth{\displaystyle k^{th}}clasificador,pag{\displaystyle p}es la verdadera probabilidad que se debe estimar, yλ{\displaystyle \lambda }es un parámetro entre 0 y 1 que define la 'diversidad' que nos gustaría establecer entre el conjunto. Cuandoλ=0{\displaystyle \lambda =0}queremos que cada clasificador haga lo mejor posible independientemente del conjunto y cuandoλ=1{\displaystyle \lambda =1}Nos gustaría que el clasificador fuera lo más diverso posible.

Véase también

Referencias

  1. Thomas M. Cover, Joy A. Thomas, Elementos de la teoría de la información, 2.ª edición, Wiley, pág. 80
  2. IJ Good, Máxima entropía para la formulación de hipótesis, especialmente para tablas de contingencia multidimensionales, Ann. of Math. Statistics, 1963
  3. Anqi Mao, Mehryar Mohri, Yutao Zhong. Funciones de pérdida de entropía cruzada: análisis teórico y aplicaciones. ICML 2023. https://arxiv.org/pdf/2304.07288.pdf
  4. Las matemáticas de la codificación, extracción y distribución de la información , por George Cybenko, Dianne P. O'Leary, Jorma Rissanen, 1999, pág. 82
  5. Probabilidad para el aprendizaje automático: Descubre cómo aprovechar la incertidumbre con Python , Jason Brownlee, 2019, pág. 220: "La pérdida logística se refiere a la función de pérdida comúnmente utilizada para optimizar un modelo de regresión logística. También puede denominarse pérdida logarítmica (lo cual resulta confuso) o simplemente pérdida logarítmica."
  6. "sklearn.metrics.log_loss" . Referencia de la API documentación de scikit-learn 1.7.1 .
  7. Noel, Mathew; Banerjee, Arindam; D, Geraldine Bessie Amali; Muthiah-Nakarajan, Venkataraman (17 de marzo de 2023). "Las funciones de pérdida alternativas para la clasificación y la regresión robusta pueden mejorar la precisión de las redes neuronales artificiales". arXiv : 2303.09935 [ cs.NE ].
  8. Shoham, Ron; Permuter, Haim H. (2019). "Costo de entropía cruzada modificado: un enfoque para fomentar la diversidad en conjuntos de clasificación (Anuncio breve)". En Dolev, Shlomi; Hendler, Danny; Lodha, Sachin; Yung, Moti (eds.). Criptografía de ciberseguridad y aprendizaje automático: tercer simposio internacional, CSCML 2019, Beer-Sheva, Israel, 27-28 de junio de 2019, Actas . Lecture Notes in Computer Science. Vol. 11527. Springer. pp. 202-207 . doi : 10.1007/978-3-030-20951-3_18 . ISBN   978-3-030-20950-6.
  9. Shoham, Ron; Permuter, Haim (2020). "Costo de entropía cruzada modificado: marco para el fomento explícito de la diversidad". arXiv : 2007.08140 [ cs.LG ].

Lecturas adicionales

  • de Boer, Kroese, DP, Mannor, S. y Rubinstein, RY (2005). Un tutorial sobre el método de entropía cruzada . Annals of Operations Research 134 (1), 19–67.