La pérdida de tripletas es una función de pérdida de aprendizaje automático ampliamente utilizada en el aprendizaje de una sola muestra , un entorno donde los modelos se entrenan para generalizar eficazmente a partir de ejemplos limitados. Fue concebida por investigadores de Google para su destacado algoritmo FaceNet para la detección de rostros. [ 1 ]

La función de pérdida de tripletas está diseñada para apoyar el aprendizaje métrico . Es decir, para ayudar a los modelos de entrenamiento a aprender una representación vectorial (mapeo a un espacio de características) donde los puntos de datos similares están más cerca entre sí y los diferentes están más separados, lo que permite una discriminación robusta en diversas condiciones. En el contexto de la detección de rostros, los puntos de datos corresponden a imágenes.
Definición
La función de pérdida se define utilizando tríos de puntos de entrenamiento de la forma. En cada triplete,(llamado "punto de anclaje") denota un punto de referencia de una identidad particular,(llamado "punto positivo") denota otro punto de la misma identidad en punto, y(llamado "punto negativo") denota un punto de identidad diferente de la identidad en puntoy.
Dejarser algún punto y dejarser la incrustación deen el espacio euclidiano de dimensión finita . Se asumirá que la norma L2 dees la unidad (la norma L2 de un vector)en un espacio euclidiano de dimensión finita se denota por.) Nosotros reunimostríos de puntos del conjunto de datos de entrenamiento. El objetivo del entrenamiento aquí es asegurar que, después del aprendizaje, la siguiente condición (llamada "restricción de trío") sea satisfecha por todos los tríos.en el conjunto de datos de entrenamiento :
La variablees un hiperparámetro llamado margen, y su valor debe establecerse manualmente. En el sistema FaceNet , su valor se estableció en 0,2.
Por lo tanto, la forma completa de la función que se va a minimizar es la siguiente:
Intuición
Un punto de referencia para comprender la efectividad de la pérdida de tripletas es la pérdida contrastiva , [ 2 ] que opera en pares de muestras (en lugar de tripletas). El entrenamiento con la pérdida contrastiva acerca las incrustaciones de pares similares y aleja las de pares disímiles. Su enfoque por pares es voraz, ya que considera cada par de forma aislada .
La función de pérdida de tripletas innova al considerar las distancias relativas . Su objetivo es que la incrustación de un punto de anclaje (consulta) esté más cerca de los puntos positivos que de los negativos (teniendo en cuenta también el margen). Una vez cumplido este requisito, no intenta optimizar aún más las distancias. Esto se aproxima considerando simultáneamente dos pares (anclaje-positivo y ancla-negativo), en lugar de cada par de forma aislada.
Triplete "minería"

Un detalle crucial en la implementación del entrenamiento con pérdida de tripletas es la "minería" de tripletas, que se centra en la selección inteligente de tripletas para la optimización. Este proceso añade una capa adicional de complejidad en comparación con la pérdida contrastiva.
Un enfoque ingenuo para preparar los datos de entrenamiento para la pérdida de tripletas implica seleccionar aleatoriamente tripletas del conjunto de datos. En general, el conjunto de tripletas válidas de la formaes muy grande. Para acelerar la convergencia del entrenamiento, es esencial centrarse en tripletes desafiantes. En el artículo de FaceNet , se exploraron varias opciones, llegando finalmente a la siguiente. Para cada par ancla-positivo, el algoritmo considera solo negativos semidifíciles . Estos son negativos que violan el requisito del triplete (es decir, son "difíciles"), pero se encuentran más lejos del ancla que el positivo (no demasiado difíciles). Reformulado, para caday ellos buscande tal manera que:
La justificación de esta elección de diseño es heurística. Puede parecer desconcertante que el proceso de minería ignore los negativos "muy difíciles" (es decir, los que están más cerca del ancla que los positivos). Los experimentos realizados por los diseñadores de FaceNet demostraron que esto suele conducir a una convergencia hacia mínimos locales degenerados .
La extracción de tripletes se realiza en cada paso del entrenamiento, a partir de los puntos de muestra contenidos en el lote de entrenamiento (esto se conoce como extracción en línea ), después de que se hayan calculado las incrustaciones para todos los puntos del lote. Si bien idealmente se podría usar todo el conjunto de datos, esto no es práctico en general. Para admitir un amplio espacio de búsqueda de tripletes, los autores de FaceNet utilizaron lotes muy grandes (1800 muestras). Los lotes se construyen seleccionando un gran número de puntos de muestra de la misma categoría (40) y negativos seleccionados aleatoriamente para ellos.
Extensiones
La función de pérdida de tripletas se ha extendido para mantener simultáneamente una serie de órdenes de distancia optimizando un grado de relevancia continuo con una cadena (es decir, una escalera ) de desigualdades de distancia. Esto da lugar a la función de pérdida de escalera , que ha demostrado ofrecer mejoras en el rendimiento de la incrustación visual-semántica en tareas de aprendizaje de clasificación . [ 3 ]
En el procesamiento del lenguaje natural , la pérdida de tripletas es una de las funciones de pérdida consideradas para el ajuste fino de BERT en la arquitectura SBERT. [ 4 ]
Otras extensiones implican especificar múltiples negaciones (pérdida de clasificación por múltiples negaciones).
Véase también
Referencias
- ↑ Schroff, Florian; Kalenichenko, Dmitry; Philbin, James (2015). "FaceNet: Un modelo unificado para el reconocimiento y la agrupación de rostros" . Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones, CVPR 2015, Boston, MA, EE. UU., 7-12 de junio de 2015. IEEE Computer Society. págs. 815-823 . arXiv : 1503.03832 . doi : 10.1109/CVPR.2015.7298682 . ISBN 978-1-4673-6964-0.
- ↑ Bekuzarov, Maksym (19 de abril de 2020). "Pérdidas explicadas: Pérdida contrastiva" . Medium . Archivado del original el 5 de junio de 2024. Recuperado el 6 de enero de 2025 .
- ↑ Zhou, Mo; Niu, Zhenxing; Wang, Le; Gao, Zhanning; Zhang, Qilin; Hua, Gang (2020-04-03). "Ladder Loss for Coherent Visual-Semantic Embedding" (PDF) . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 34 (7): 13050– 13057. doi : 10.1609/aaai.v34i07.7006 . ISSN 2374-3468 . S2CID 208139521 .
- ↑ Reimers, Nils; Gurevych, Iryna (2019-08-27). "Sentence-BERT: Incrustaciones de oraciones usando redes BERT siamesas". arXiv : 1908.10084 [ cs.CL ].
- Redes neuronales artificiales
- algoritmos de aprendizaje automático