Articulo de referencia

minería negativa dura

Esquema general de la extracción de negativos difíciles a partir de datos. En el ejemplo anterior, el modelo se entrena para clasificar gatos grises y distinguirlos de cualquier...

Esquema general de la extracción de negativos difíciles a partir de datos. En el ejemplo anterior, el modelo se entrena para clasificar gatos grises y distinguirlos de cualquier otro color. El "Selector de Negativos Difíciles" prioriza otras imágenes de gatos con un color de pelaje diferente, ya que son los negativos más difíciles de diferenciar de las muestras positivas.

La minería de negativos difíciles , también conocida como muestreo de negativos difíciles , es una familia de técnicas en aprendizaje automático para seleccionar o construir muestras negativas más difíciles de distinguir de un ejemplo positivo correspondiente con respecto a los negativos muestreados uniformemente, lo que conduce a una señal de entrenamiento más informativa para clasificadores discriminativos y modelos de similitud . [ 1 ]

La técnica se utiliza cuando el conjunto de posibles ejemplos negativos es mucho mayor que el conjunto de positivos y la mayoría de los negativos elegidos aleatoriamente son fáciles de clasificar por el modelo, contribuyendo poco al aprendizaje. [ 2 ] [ 3 ] Concentrar el entrenamiento en la pequeña fracción de negativos difíciles tiene como objetivo proporcionar una señal de gradiente más fuerte y una convergencia más rápida que el muestreo uniforme. [ 1 ] [ 4 ]

La minería de negativos difíciles se originó en la detección de objetos en la década de 1990, donde se la conocía como bootstrapping (que no debe confundirse con el remuestreo bootstrap estadístico ), y posteriormente se formalizó para modelos de máquinas de vectores de soporte . [ 5 ] [ 2 ] [ 6 ] Ideas estrechamente relacionadas aparecen en el aprendizaje métrico profundo, la recuperación de información , los sistemas de recomendación , el aprendizaje contrastivo autosupervisado y los modelos de visión-lenguaje . Los estudios distinguen la minería de negativos difíciles de la práctica más amplia del muestreo negativo , en la que los negativos se extraen al azar o en proporción a la frecuencia en lugar de por dificultad. [ 1 ] [ 7 ]

Fondo

En muchos problemas de aprendizaje, el número de ejemplos negativos supera ampliamente al de ejemplos positivos. En la detección de objetos con ventana deslizante, una sola imagen produce aproximadamente 10⁵ ventanas candidatas, casi todas de las cuales son fondo. [ 2 ] [ 6 ] [ 8 ] Los trabajos en línea sobre minería de ejemplos difíciles informan que el desequilibrio puede alcanzar aproximadamente 100 000 regiones de fondo por objeto para los detectores de ventana deslizante y mantenerse en torno a 70:1 incluso para los detectores basados ​​en propuestas. [ 9 ] Utilizar todos los ejemplos negativos es computacionalmente inviable y estadísticamente perjudicial, porque el gran número de negativos fáciles domina la pérdida y el gradiente. [ 6 ] [ 10 ]

Una motivación similar surge en el aprendizaje de similitud . Cuando los ejemplos de entrenamiento se agrupan en pares o tríos, el número de tuplas candidatas crece cuadrática o cúbicamente con el número de imágenes, y una vez que un modelo ha convergido, la mayoría de dichas tuplas ya satisfacen el objetivo de entrenamiento y producen poco o ningún gradiente. [ 4 ] [ 11 ] [ 12 ] En espacios de incrustación de alta dimensión, los negativos extraídos aleatoriamente también tienden a ser poco informativos porque un porcentaje significativo de ellos podría estar ya distante de las muestras positivas en el espacio latente . [ 13 ] Seleccionar los ejemplos más informativos ("difíciles") se presenta, por lo tanto, como una forma de mantener la señal de entrenamiento más estable e informativa durante todo el proceso de entrenamiento. [ 5 ] [ 14 ] [ 15 ]

Definición y terminología

En todas las áreas de aplicación, un negativo duro se define consistentemente en relación con el modelo que se está entrenando: es un negativo (un ejemplo cuya etiqueta difiere de la del ancla o consulta) que el modelo actual, sin embargo, clasifica como positivo. [ 16 ] [ 1 ] Por ejemplo, en un detector basado en márgenes, como una SVM , un negativo duro es un ejemplo de fondo que se clasifica erróneamente o que cae dentro del margen del clasificador. [ 2 ] En los métodos basados ​​en incrustaciones, es un ejemplo con una etiqueta diferente que se encuentra cerca del ancla en el espacio de características aprendido . [ 17 ] [ 18 ]

Se suelen utilizar varias distinciones más sutiles:

  • Negativos difíciles, semidifíciles y fáciles. En el entrenamiento de pérdida de tripletas , un negativo difícil es el ejemplo con etiqueta diferente más cercano al ancla; un negativo fácil es el más distante (y proporciona poco gradiente útil); y un negativo semidifícil es aquel que está más lejos del ancla que el positivo correspondiente, pero aún dentro del margen de pérdida. [ 3 ] [ 18 ] [ 15 ] El término semidifícil se introdujo en el sistema FaceNet. [ 3 ]
  • Dificultad relativa a la capacidad del modelo. Que un ejemplo se considere difícil depende de la complejidad del modelo: un modelo de alta complejidad trata la mayoría de los ejemplos como fáciles, mientras que un modelo de baja complejidad trata la mayoría como difíciles. [ 12 ]
  • Minería de ejemplos negativos difíciles versus minería de ejemplos difíciles. Algunos autores generalizan el término, prefiriendo la minería de ejemplos difíciles para extender estas técnicas y centrarse también en muestras positivas que el modelo encuentra más difíciles de clasificar correctamente. [ 9 ]

Técnicas

Detección de objetos

En los detectores clásicos, la minería de negativos difíciles es un procedimiento iterativo, basado en caché, que se superpone a una SVM u otro clasificador: el modelo se entrena con los positivos y un pequeño conjunto de negativos, el modelo entrenado se ejecuta sobre datos de fondo para recopilar nuevos falsos positivos, se descartan los ejemplos fáciles y el modelo se vuelve a entrenar, repitiendo el proceso varias veces. [ 2 ] [ 19 ] [ 14 ] Un negativo se trata como difícil cuando su puntuación de margen indica una clasificación errónea o una posición dentro del margen. [ 2 ]

La minería de ejemplos difíciles en línea (OHEM) adapta esta idea al entrenamiento de detectores profundos basados ​​en regiones. En lugar de alternar la minería fuera de línea y el reentrenamiento, OHEM forma cada mini-lote SGD puntuando todas las regiones candidatas de interés con una pasada hacia adelante de solo lectura y luego retropropagando solo a través de las regiones de mayor pérdida. [ 9 ] [ 8 ] Una implementación eficiente mantiene dos copias de la red de regiones: una copia de solo lectura que puntúa todas las regiones y una copia entrenable que procesa solo los ejemplos difíciles seleccionados. [ 9 ] La minería de negativos difíciles también se ha aplicado a detectores de rostros convolucionales mediante la recolección de falsos positivos de un detector de rostros Faster R-CNN de primera ronda y el reentrenamiento con ellos, etiquetando una región detectada como un negativo difícil cuando su intersección sobre unión máxima con cualquier rostro de verdad fundamental cae por debajo de un cierto umbral. [ 20 ]

Aprendizaje métrico profundo

Ejemplos de muestreo negativo para la pérdida de tripletes. Los negativos fáciles quedan fuera del margen seleccionado, los negativos semiduros están dentro del margen, los negativos duros están más cerca que la coincidencia positiva. [ 1 ]

En el aprendizaje métrico profundo, los modelos se entrenan con pérdidas por pares o tripletes, de modo que los ejemplos de la misma clase se mapean a puntos cercanos y los ejemplos de clases diferentes se mapean a puntos distantes. Debido a que la mayoría de los tripletes muestreados aleatoriamente satisfacen rápidamente el margen de pérdida y dejan de contribuir al gradiente, la selección de pares o tripletes difíciles se considera esencial. [ 11 ] [ 4 ] La pérdida de tripletes , de hecho, penaliza los tripletes en los que la distancia ancla-positiva no es menor que la distancia ancla-negativa por al menos un margen.α{\displaystyle \alpha }. [ 3 ] [ 21 ]

El sistema FaceNet introdujo la minería de negativos semidifíciles , en la que el negativo elegido está más alejado del ancla que el positivo correspondiente, pero aún así cae dentro del margen, después de descubrir que seleccionar siempre los negativos más difíciles podría llevar la incrustación hacia una solución colapsada (degenerada); FaceNet también calculó positivos y negativos difíciles en línea dentro de cada lote de entrenamiento en lugar de buscar en todo el conjunto de datos. [ 3 ]

Un ejemplo temprano de selección top- K en lote aparece en el aprendizaje de representación de video no supervisado, donde se seleccionan los negativos que incurren en la mayor pérdida de triplete dentro de un mini-lote. [ 22 ] Una variante ampliamente citada es la minería de lotes difíciles , donde un lote se construye muestreando un número fijo de clases y un número fijo de ejemplos por clase, y para cada ancla solo se utilizan el positivo más difícil y el negativo más difícil dentro de ese lote ; debido a que estos son los más difíciles dentro de un pequeño subconjunto aleatorio en lugar de todo el conjunto de datos, los autores argumentaron que actúan como tripletes "moderados" y evitan el costo y la inestabilidad de la minería fuera de línea. [ 21 ]

Existen varios métodos para reducir el coste de la minería o cambiar lo que se extrae:

  • La pérdida de pares N multiclase : una sola actualización contrasta el ancla con muchas clases negativas a la vez; para conjuntos de datos con muchas clases, su autor propuso además un esquema voraz de minería de clases negativas difíciles que selecciona clases negativas completas en lugar de muestras individuales. [ 23 ]
  • El método de incrustación estructurada elevada extrae negativos difíciles en relación con ambos extremos de un par positivo y, al observar que seleccionar solo el negativo más difícil puede llevar a la red a un óptimo local deficiente, optimiza una función objetivo log-sum-exp suavizada que agrega todos los negativos dentro del margen. [ 24 ]
  • La minería inteligente define la minería de negativos difíciles como una búsqueda aproximada del vecino más cercano sobre las incrustaciones, construyendo un grafo de vecinos una vez por época y seleccionando negativos fuera de un radio de exclusión por ancla. [ 4 ]
  • El incrustamiento en cascada profundo (HDC) con conciencia de la dificultad selecciona ejemplos difíciles clasificando las pérdidas por muestra dentro de cada mini-lote y enruta muestras de diferente dificultad a subredes en cascada de complejidad creciente, motivado por la observación de que la dificultad es relativa a la capacidad del modelo. [ 12 ]
  • La minería estocástica basada en clases reduce el costo de búsqueda de negativos difíciles al identificar primero un pequeño conjunto de clases vecinas y buscar instancias difíciles solo dentro de ellas, mientras que el conjunto de candidatos varía estocásticamente a lo largo de las iteraciones. [ 17 ]

Recuperación y recomendación de información

En los sistemas de recomendación y recuperación de información neuronal , el entrenamiento empareja cada elemento observado (relevante) con elementos no observados como negativos implícitos. Bayesian Personalized Ranking construye triples de entrenamiento en los que un elemento observado se trata como positivo y un elemento no observado como negativo implícito, y entrena un objetivo por pares extrayendo dichos triples uniformemente al azar; no utiliza selección negativa dura o dinámica, y las revisiones lo describen como la línea base de muestreo uniforme que los métodos negativos duros posteriores mejoraron. [ 25 ] [ 1 ] En la recuperación densa neuronal, se entrena un codificador dual de modo que los pares consulta-documento relevantes tengan mayor similitud que los irrelevantes, y la elección de negativos es decisiva. [ 26 ]

Existen varias estrategias de uso común:

  • Negativos dentro del lote más un negativo léxico difícil. El entrenamiento de recuperación de pasajes densos (DPR) utiliza los pasajes de las otras preguntas en el mismo minilote como negativos, junto con un único negativo difícil seleccionado por BM25 , un pasaje que obtiene una puntuación alta para la pregunta léxicamente pero no contiene la respuesta. [ 27 ]
  • Negativos duros globales y actualizados dinámicamente. La Estimación Contrastiva Negativa del Vecino Más Cercano Aproximado (ANCE) extrae negativos duros de todo el corpus utilizando un índice aproximado del vecino más cercano sobre las propias incrustaciones del modelo que se reconstruye periódicamente a partir de un punto de control reciente, de modo que los negativos extraídos se mantienen alineados con el modelo en evolución. [ 28 ]
  • Negativos duros sin ruido. RocketQA observó que tratar los pasajes mejor clasificados como negativos puede introducir pasajes relevantes pero no etiquetados como "falsos negativos", y utilizó un codificador cruzado más fuerte para puntuar los candidatos extraídos, conservando solo aquellos que se predijeron con confianza como negativos. [ 29 ]
  • Negativos duros estáticos versus dinámicos. Zhan y sus colegas establecieron una distinción explícita entre negativos duros estáticos , recuperados previamente una vez y mantenidos fijos durante el entrenamiento, y negativos duros dinámicos , recalculados a partir del modelo actual, y analizaron ambos como optimizadores de objetivos diferentes, argumentando que el muestreo de negativos duros enfatiza el rendimiento de clasificación superior. [ 30 ]

Aprendizaje autosupervisado contrastivo

Los métodos de aprendizaje autosupervisado contrastivo aprenden representaciones reuniendo diferentes vistas de la misma instancia (positivas) y separando las no relacionadas (negativas). [ 31 ] El objetivo InfoNCE, ampliamente utilizado e introducido en la codificación predictiva contrastiva, puntúa una positiva contranorte1{\displaystyle N-1}Imágenes negativas extraídas de una distribución de propuestas:

Lnorte=mi[registroFk(incógnitat+k,dot)incógnitajincógnitaFk(incógnitaj,dot)].{\displaystyle {\mathcal {L}}_{N}=-\,\mathbb {E} \!\left[\,\log {\frac {f_{k}(x_{t+k},c_{t})}{\sum _{x_{j}\in X}f_{k}(x_{j},c_{t})}}\,\right].}

En su forma original, la codificación predictiva contrastiva extrae sus negativos al azar y recomienda usar más negativos porque el objetivo limita una cantidad de información mutua que se estrecha a medida quenorte{\displaystyle N}crece. [ 32 ] Varios métodos influyentes aumentan de manera similar el suministro de negativos en lugar de su dificultad: SimCLR trata todos los demás ejemplos aumentados en un lote de entrenamiento grande como negativos y argumenta que su pérdida de entropía cruzada escalada por temperatura pondera implícitamente los negativos por dureza, mientras que las pérdidas de estilo margen y triplete requieren minería semidura explícita para seguir siendo competitivas; [ 33 ] y Momentum Contrast (MoCo) mantiene los negativos en una cola desacoplada del tamaño del lote, codificada por un codificador de momento de actualización lenta para mantenerlos consistentes. [ 34 ]

No obstante, los métodos explícitos de negatividad estricta se han adaptado al entorno no supervisado.

  • Ponderación de importancia . Una distribución de muestreo ajustable que pondera positivamente los negativos en los mapas de incrustación actuales cercanos al ancla, descartando aproximadamente los posibles falsos negativos, implementada como una reponderación de la pérdida contrastiva; un parámetro de dureza interpola entre el muestreo uniforme y una distribución adversaria del peor caso. [ 16 ]
  • Incrustaciones sintéticas . En lugar de seleccionar ejemplos difíciles, MoCHi los sintetiza en el espacio de incrustación, formando nuevos negativos como combinaciones convexas normalizadas de los negativos existentes más difíciles y mezclando la consulta con negativos difíciles para obtener ejemplos aún más difíciles, después de observar que la mayoría de los negativos almacenados en la memoria contribuyen poco a la pérdida a medida que avanza el entrenamiento. [ 35 ]
  • Perturbaciones adversarias . El método CLAE aplica perturbaciones adversarias calculadas conjuntamente en todo el lote, que sus autores caracterizan como realizar minería negativa difícil sin etiquetas. [ 36 ]

Modelos de lenguaje visual

Extraje imágenes negativas duras y creé subtítulos negativos duros de NegCLIP. [ 37 ]

En los modelos de lenguaje visual de estilo CLIP , se utilizan negativos duros para abordar el comportamiento de "bolsa de palabras" de dichos modelos, ignorando el orden de las palabras y la vinculación objeto-atributo. [ 37 ] Los métodos en esta área difieren en si seleccionan , construyen o reponderan negativos:

  • Construcción de subtítulos negativos difíciles. NegCLIP genera subtítulos negativos intercambiando sustantivos, adjetivos y frases verbales dentro de un subtítulo correcto, y agrega imágenes vecinas más cercanas a cada lote contrastivo, informando una sensibilidad mejorada al orden de las palabras y la vinculación. [ 37 ] TripletCLIP utiliza en cambio modelos de IA generativos , generando un subtítulo negativo difícil fluido con un modelo de lenguaje grande y una imagen coincidente con un modelo de difusión de texto a imagen , y entrenando con un objetivo contrastivo de triplete. [ 38 ]
  • Reponderación de negativos dentro del lote. DiHT utiliza una pérdida contrastiva ponderada por negativos duros para el preentrenamiento de imagen-texto que aumenta el peso de cada negativo muestreado uniformemente dentro del lote en proporción a su similitud con el ancla, extendiendo el enfoque de ponderación de importancia a la alineación intermodal. [ 39 ]
  • Selección a nivel de pares. HELIP propone un algoritmo para extraer pares negativos difíciles de imagen-texto y añade una función de pérdida de margen que mantiene los negativos difíciles extraídos más cerca del positivo que los negativos ordinarios. [ 40 ]

Aspectos teóricos

Para los detectores SVM , la minería de negativos difíciles tiene una garantía de convergencia. Un algoritmo que alternativamente extrae ejemplos que violan el margen en una caché y descarta los fáciles converge al modelo que produciría el entrenamiento en el conjunto de datos completo. [ 2 ] Una línea de análisis complementaria trata la elección de negativos como un problema de muestreo de importancia en el que la distribución óptima de muestreo de negativos es proporcional a la norma del gradiente por ejemplo, de modo que los negativos más difíciles (de mayor pérdida) deberían muestrearse con más frecuencia; esto motiva la minería de los negativos mejor clasificados actuales del modelo. [ 28 ]

Al mismo tiempo, los análisis del entrenamiento de incrustaciones profundas advierten que los negativos más difíciles pueden ser contraproducentes. A medida que la distancia entre el ancla y el negativo se reduce, la dirección del gradiente pasa a estar dominada por el ruido, lo que produce actualizaciones de alta varianza que pueden colapsar la incrustación. [ 13 ] Un estudio teórico de 2023 modeló el muestreo de negativos difíciles como una inclinación de la distribución negativa hacia negativos más alineados con el ancla y demostró que tal endurecimiento nunca disminuye la pérdida contrastiva mientras deja la geometría de representación globalmente óptima sin cambios en el caso supervisado, mientras que, en algunos entornos, perjudica el caso no supervisado. [ 41 ]

Limitaciones y desafíos

Colapso de incrustación a partir de negativos demasiado duros

Varios autores informan que extraer solo el negativo más difícil desestabiliza el entrenamiento de incrustaciones. FaceNet descubrió que seleccionar siempre los negativos más difíciles podría llevar a la incrustación a una solución colapsada, y adoptó la extracción semidura en su lugar. [ 3 ] La incrustación estructurada elevada observó de manera similar que seleccionar solo el negativo más difícil converge a un óptimo local deficiente, lo que motiva una función objetivo suavizada sobre todos los negativos dentro del margen. [ 24 ] El muestreo ponderado por distancia diagnostica el mecanismo como gradientes de alta varianza dominados por el ruido, [ 13 ] y una comparación empírica en el trabajo de pérdida de tripletas jerárquicas encontró que la extracción ingenua del negativo más difícil proporciona poca mejora sobre el muestreo aleatorio, con una variante semidura que funciona mejor, en parte porque la extracción dentro de un mini-lote no puede capturar la distribución global de los datos. [ 11 ]

Falsos negativos

La minería de datos negativos rigurosa basada únicamente en una métrica de similitud puede incluir falsos positivos en entornos no supervisados.

Cuando las etiquetas no están disponibles o están incompletas, los negativos más difíciles también son los más propensos a ser falsos negativos: ejemplos que se extraen como negativos pero que en realidad comparten la clase o relevancia del ancla. [ 42 ] [ 16 ] El problema se ha documentado en el aprendizaje contrastivo no supervisado, donde se denomina sesgo de muestreo (que no debe confundirse con el sesgo de muestreo en estadística), [ 42 ] y en la recuperación densa, donde un estudio estimó que una gran fracción de los pasajes recuperados principales pero sin etiquetar eran de hecho relevantes, por lo que extraerlos como negativos sin eliminar el ruido degradó la calidad de la recuperación. [ 29 ] Las soluciones propuestas incluyen correcciones de eliminación de sesgo, [ 42 ] eliminación de ruido entre codificadores, [ 29 ] selección consciente de la incertidumbre y la diversidad, [ 43 ] y, en entornos multimodales, el uso de una tercera modalidad para filtrar los posibles falsos negativos antes de la reponderación. [ 44 ]

Véase también

Referencias

  1. 1 2 3 4 5 6 Yang, Zhen; Ding, Ming; Huang, Tinglin; Cen, Yukuo; Song, Junshuai; Xu, Bin; Dong, Yuxiao; Tang, Jie (agosto de 2024). "¿Importa el muestreo negativo? Una revisión con perspectivas sobre su teoría y aplicaciones". IEEE Transactions on Pattern Analysis and Machine Intelligence . 46 (8): 5692– 5711. Bibcode : 2024ITPAM..46.5692Y . doi : 10.1109/TPAMI.2024.3371473 . ISSN 1939-3539 . PMID 38421844 .  
  2. 1 2 3 4 5 6 7 Felzenszwalb, Pedro F.; Girshick, Ross B.; McAllester, David; Ramanan, Deva (2010). "Detección de objetos con modelos basados ​​en partes entrenados de forma discriminativa". IEEE Transactions on Pattern Analysis and Machine Intelligence . 32 (9). IEEE: 1627– 1645. Bibcode : 2010ITPAM..32.1627F . doi : 10.1109/TPAMI.2009.167 . PMID 20634557 . 
  3. 1 2 3 4 5 6 Schroff, Florian; Kalenichenko, Dmitry; Philbin, James (2015). FaceNet: Un incrustamiento unificado para el reconocimiento y agrupamiento de rostros . Conferencia IEEE de 2015 sobre visión por computadora y reconocimiento de patrones (CVPR). IEEE. págs. 815–823 . arXiv : 1503.03832 . doi : 10.1109/CVPR.2015.7298682 . 
  4. 1 2 3 4 Harwood, Ben; Kumar BG, Vijay; Carneiro, Gustavo; Reid, Ian; Drummond, Tom (2017). Minería inteligente para el aprendizaje métrico profundo . Conferencia internacional IEEE de 2017 sobre visión por computadora (ICCV). págs. 2821–2829 . doi : 10.1109/ICCV.2017.307 . 
  5. 1 2 Sung, K.-K.; Poggio, T. (enero de 1998). "Aprendizaje basado en ejemplos para la detección de rostros humanos basada en la vista". IEEE Transactions on Pattern Analysis and Machine Intelligence . 20 (1): 39– 51. Bibcode : 1998ITPAM..20...39S . doi : 10.1109/34.655648 . hdl : 1721.1/7193 . ISSN 1939-3539 . 
  6. 1 2 3 Zou, Zhengxia; Chen, Keyan; Shi, Zhenwei; Guo, Yuhong; Ye, Jieping (2023). "Detección de objetos en 20 años: una encuesta". Actas del IEEE . 111 (3): 257–276 . arXiv : 1905.05055 . doi : 10.1109/JPROC.2023.3238524 .
  7. Desai, Shasvat; Ghose, Debasmita; Chakraborty, Deep (2025). "Un estudio sobre la curación de datos para el aprendizaje contrastivo visual: por qué es importante crear pares positivos y negativos efectivos". arXiv : 2502.08134 [ cs.CV ].
  8. 1 2 Oksuz, Kemal; Cam, Baris Can; Kalkan, Sinan; Akbas, Emre (2021). "Problemas de desequilibrio en la detección de objetos: una revisión". IEEE Transactions on Pattern Analysis and Machine Intelligence . 43 (10): 3388– 3415. arXiv : 1909.00169 . Bibcode : 2021ITPAM..43.3388O . doi : 10.1109/TPAMI.2020.2981890 . PMID 32191882 . 
  9. 1 2 3 4 Shrivastava, Abhinav; Gupta, Abhinav; Girshick, Ross (2016). Entrenamiento de detectores de objetos basados ​​en regiones con minería de ejemplos difíciles en línea . Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR). pp. 761– 769. arXiv : 1604.03540 . doi : 10.1109/CVPR.2016.89 . 
  10. Lin, Tsung-Yi; Goyal, Priya; Girshick, Ross; He, Kaiming; Dollár, Piotr (2017). Focal Loss for Dense Object Detection . 2017 IEEE International Conference on Computer Vision (ICCV). IEEE. pp. 2980– 2988. arXiv : 1708.02002 . doi : 10.1109/ICCV.2017.324 . 
  11. 1 2 3 Ge, Weifeng; Huang, Weilin; Dong, Dengke; Scott, Matthew R. (2018). Aprendizaje métrico profundo con pérdida de tripletas jerárquicas . Conferencia Europea sobre Visión por Computadora (ECCV) 2018. Notas de conferencias en ciencias de la computación. Vol. 11210. págs. 272–288 . doi : 10.1007/978-3-030-01231-1_17 .  
  12. 1 2 3 Yuan, Yuhui; Yang, Kuiyuan; Zhang, Chao (2017). Hard-Aware Deeply Cascaded Incedding . 2017 IEEE International Conference on Computer Vision (ICCV). IEEE. pp. 814– 823. arXiv : 1611.05720 . doi : 10.1109/ICCV.2017.94 . 
  13. 1 2 3 Wu, Chao-Yuan; Manmatha, R.; Smola, Alexander J.; Krähenbühl, Philipp (2017). El muestreo importa en el aprendizaje de incrustaciones profundas . Conferencia Internacional IEEE de Visión por Computadora (ICCV) de 2017. IEEE. arXiv : 1706.07567 . doi : 10.1109/ICCV.2017.309 .
  14. 1 2 Kaya, Mahmut; Sentina, Hasan Şakir (2019). "Aprendizaje métrico profundo: una encuesta" . Simetría . 11 (9). MDPI: 1066. Código Bib : 2019Symm...11.1066K . doi : 10.3390/sym11091066 .
  15. 1 2 Musgrave, Kevin; Belongie, Serge; Lim, Ser-Nam (2020). "Una comprobación de la realidad del aprendizaje métrico". Visión por computadora – ECCV 2020. Notas de clase en ciencias de la computación. Vol. 12370. Springer. págs. 681–699 . arXiv : 2003.08505 . doi : 10.1007/978-3-030-58595-2_41 .  
  16. 123Robinson, Joshua; Chuang, Ching-Yao; Sra, Suvrit; Jegelka, Stefanie (2020). Contrastive Learning with Hard Negative Samples. International Conference on Learning Representations (ICLR). arXiv:2010.04592.
  17. 12Suh, Yumin; Han, Bohyung; Kim, Wonsik; Lee, Kyoung Mu (June 2019). "Stochastic Class-Based Hard Example Mining for Deep Metric Learning". 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). pp. 7244–7252. Bibcode:2019cvpr.conf..742S. doi:10.1109/CVPR.2019.00742. ISBN 978-1-7281-3293-8.
  18. 12Xuan, Hong; Stylianou, Abby; Pless, Robert (March 2020). "Improved Embeddings with Easy Positive Triplet Mining". 2020 IEEE Winter Conference on Applications of Computer Vision (WACV). pp. 2463–2471. Bibcode:2020wacv.conf..260X. doi:10.1109/WACV45572.2020.9093432. ISBN 978-1-7281-6553-0.
  19. Girshick, Ross; Donahue, Jeff; Darrell, Trevor; Malik, Jitendra (June 2014). "Rich Feature Hierarchies for Accurate Object Detection and Semantic Segmentation". 2014 IEEE Conference on Computer Vision and Pattern Recognition. pp. 580–587. Bibcode:2014cvpr.conf...82G. doi:10.1109/CVPR.2014.81. ISBN 978-1-4799-5118-5.
  20. Wan, Shaohua; Chen, Zhijun; Zhang, Tao; Zhang, Bo; Wong, Kong-kat (2016). "Bootstrapping Face Detection with Hard Negative Examples". arXiv:1608.02236 [cs.CV].
  21. 12Hermans, Alexander; Beyer, Lucas; Leibe, Bastian (21 November 2017), In Defense of the Triplet Loss for Person Re-Identification, arXiv:1703.07737
  22. Wang, Xiaolong; Gupta, Abhinav (December 2015). "Unsupervised Learning of Visual Representations Using Videos". 2015 IEEE International Conference on Computer Vision (ICCV). pp. 2794–2802. Bibcode:2015iccv.conf..321W. doi:10.1109/ICCV.2015.320. ISBN 978-1-4673-8391-2.
  23. Sohn, Kihyuk (2016). "Aprendizaje métrico profundo mejorado con objetivo de pérdida de N pares multiclase" . Avances en sistemas de procesamiento de información neuronal . Vol. 29. Barcelona, ​​España: Curran Associates, Inc. pp. 1857–1865 .  
  24. 1 2 Song, Hyun Oh; Xiang, Yu; Jegelka, Stefanie; Savarese, Silvio (junio de 2016). "Aprendizaje métrico profundo mediante incrustación de características estructuradas elevadas". Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 4004–4012 . arXiv : 1511.06452 . Bibcode : 2016cvpr.conf..434S . doi : 10.1109/CVPR.2016.434 . ISBN  978-1-4673-8851-1.
  25. Rendle, Steffen; Freudenthaler, Christoph; Gantner, Zeno; Schmidt-Thieme, Lars (2009). "BPR: Clasificación personalizada bayesiana a partir de retroalimentación implícita". Actas de la Vigésimo Quinta Conferencia sobre Incertidumbre en Inteligencia Artificial (UAI 2009) . AUAI Press. págs. 452–461 . arXiv : 1205.2618 . 
  26. Zhao, Wayne Xin; Liu, Jing; Ren, Ruiyang; Wen, Ji-Rong (2024). "Recuperación densa de texto basada en modelos de lenguaje preentrenados: una revisión". ACM Transactions on Information Systems . 42 (4): 1– 60. arXiv : 2211.14876 . doi : 10.1145/3637870 .
  27. Karpukhin, Vladimir; Oğuz, Barlas; Min, Sewon; Lewis, Patrick; Wu, Ledell; Edunov, Sergey; Chen, Danqi; Yih, Wen-tau (2020). "Recuperación densa de pasajes para la respuesta a preguntas en dominio abierto". Actas de la Conferencia de 2020 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP) . Asociación para la Lingüística Computacional. págs. 6769–6781 . arXiv : 2004.04906 . doi : 10.18653/v1/2020.emnlp-main.550 . 
  28. 1 2 Xiong, Lee; Xiong, Chenyan; Li, Ye; Tang, Kwok-Fung; Liu, Jialin; Bennett, Paul; Ahmed, Junaid; Overwijk, Arnold (2021). Aprendizaje contrastivo negativo aproximado del vecino más cercano para la recuperación densa de texto . Conferencia internacional sobre representaciones de aprendizaje (ICLR). arXiv : 2007.00808 .
  29. 1 2 3 Qu, Yingqi; Ding, Yuchen; Liu, Jing; Liu, Kai; Ren, Ruiyang; Zhao, Wayne Xin; Dong, Daxiang; Wu, Hua; Wang, Haifeng (2021). "RocketQA: Un enfoque de entrenamiento optimizado para la recuperación de pasajes densos para la respuesta a preguntas de dominio abierto". Actas de la Conferencia de 2021 del Capítulo Norteamericano de la Asociación de Lingüística Computacional: Tecnologías del lenguaje humano . Asociación de Lingüística Computacional. págs. 5835–5847 . arXiv : 2010.08191 . doi : 10.18653/v1/2021.naacl-main.466 . 
  30. Zhan, Jingtao; Mao, Jiaxin; Liu, Yiqun; Guo, Jiafeng; Zhang, Min; Ma, Shaoping (2021). Optimizing Dense Retrieval Model Training with Hard Negatives . Proceedings of the 44th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '21). Association for Computing Machinery. arXiv : 2104.08051 .
  31. Le-Khac, Phuc H.; Healy, Graham; Smeaton, Alan F. (2020). "Aprendizaje de representación contrastiva: un marco y una revisión" . IEEE Access . 8 : 193907–193934 . arXiv : 2010.05113 . Bibcode : 2020IEEEA ...8s3907L . doi : 10.1109/ACCESS.2020.3031549 .
  32. van den Oord, Aaron; Li, Yazhe; Vinyals, Oriol (2018). "Representation Learning with Contrastive Predictive Coding". arXiv : 1807.03748 [ cs.LG ].
  33. Chen, Ting; Kornblith, Simon; Norouzi, Mohammad; Hinton, Geoffrey (2020). Un marco simple para el aprendizaje contrastivo de representaciones visuales . Actas de la 37.ª Conferencia Internacional sobre Aprendizaje Automático (ICML). Vol. 119. PMLR. págs. 1597–1607 . arXiv : 2002.05709 .  
  34. He, Kaiming; Fan, Haoqi; Wu, Yuxin; Xie, Saining; Girshick, Ross (2020). Momentum Contrast for Unsupervised Visual Representation Learning . 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE. pp. 9726– 9735. arXiv : 1911.05722 . doi : 10.1109/CVPR42600.2020.00975 . 
  35. Kalantidis, Yannis; Sariyildiz, Mert Bulent; Pion, Noe; Weinzaepfel, Philippe; Larlus, Diane (2020). "Mezcla negativa dura para el aprendizaje contrastivo". Advances in Neural Information Processing Systems 33 (NeurIPS 2020) . Curran Associates, Inc. arXiv : 2010.01028 .
  36. Ho, Chih-Hui; Vasconcelos, Nuno (2020). "Aprendizaje contrastivo con ejemplos adversarios". Advances in Neural Information Processing Systems 33 (NeurIPS 2020) . arXiv : 2010.12050 .
  37. 1 2 3 Yuksekgonul, Mert; Bianchi, Federico; Kalluri, Pratyusha; Jurafsky, Dan; Zou, James (2023). ¿Cuándo y por qué los modelos de visión-lenguaje se comportan como bolsas de palabras y qué hacer al respecto? Conferencia Internacional sobre Representaciones de Aprendizaje (ICLR). arXiv : 2210.01936 .
  38. Patel, Maitreya; Kusumba, Abhiram; Cheng, Sheng; Kim, Changhoon; Gokhale, Tejas; Baral, Chitta; Yang, Yezhou (2024). TripletCLIP: Mejora del razonamiento compositivo de CLIP mediante negaciones sintéticas de visión-lenguaje . Advances in Neural Information Processing Systems 37 (NeurIPS 2024). arXiv : 2411.02545 .
  39. Radenovic, Filip; Dubey, Abhimanyu; Kadian, Abhishek; Mihaylov, Todor; Vandenhende, Simon; Patel, Yash; Wen, Yi; Ramanathan, Vignesh; Mahajan, Dhruv (2023). Filtrado, destilación y negativos duros para el preentrenamiento de visión-lenguaje . Actas de la Conferencia IEEE/CVF sobre Visión por Computadora y Reconocimiento de Patrones (CVPR). págs. 6967–6977 . arXiv : 2301.02280 . 
  40. Wang, Haonan; Huang, Minbin; Huang, Runhui; Hong, Lanqing; Xu, Hang; Hu, Tianyang; Liang, Xiaodan; Li, Zhenguo; Cheng, Hong; Kawaguchi, Kenji (abril de 2025). "Obteniendo más jugo de sus datos: el refinamiento de pares duros mejora los modelos de lenguaje visual sin datos adicionales". En Chiruzzo, Luis; Ritter, Alan; Wang, Lu (eds.). Actas de la Conferencia de 2025 del Capítulo de las Naciones de las Américas de la Asociación de Lingüística Computacional: Tecnologías del lenguaje humano (Volumen 1: Artículos extensos) . Albuquerque, Nuevo México: Asociación de Lingüística Computacional. págs. 7854–7873 . doi : 10.18653/v1/2025.naacl-long.399 . ISBN  979-8-89176-189-6.
  41. Jiang, Ruijie; Nguyen, Thuan; Aeron, Shuchin; Ishwar, Prakash (2025). "Muestreo negativo duro para aprendizaje contrastivo: geometría de representación óptima y colapso neuronal vs. dimensional". arXiv : 2311.05139 [ cs.LG ].
  42. 1 2 3 Chuang, Ching-Yao; Robinson, Joshua; Lin, Yen-Chen; Torralba, Antonio; Jegelka, Stefanie (2020). "Aprendizaje contrastivo sin sesgo". Advances in Neural Information Processing Systems 33 (NeurIPS 2020) . arXiv : 2007.00224 .
  43. Tabassum, Afrina; Wahed, Muntasir; Eldardiry, Hoda; Lourentzou, Ismini (2022). "Estrategias de muestreo negativo duro para el aprendizaje de representaciones contrastivas". arXiv : 2206.01197 [ cs.LG ].
  44. ^ Li, Guangping; Gao, Yanan; Huang, Xianhui; Ling, Bingo Wing-Kuen (2025). "Un método de mejora y extracción de negativos duros para el aprendizaje contrastivo multimodal" . Electrónica . 14 (4). MDPI: 767. doi : 10.3390/electrónica14040767 .
  • Documentación de PyTorch Metric Learning : biblioteca de código abierto que proporciona "mineros" configurables para la selección negativa dura y semidura en el entrenamiento basado en pares y tripletes.
  • Sentence Transformers: utilidad para la extracción de negaciones difíciles : documentación y código de la mine_hard_negatives()función utilizada para construir conjuntos de entrenamiento de negaciones difíciles para modelos de recuperación densa y similitud semántica.
  • Aprendizaje de Representación Contrastiva : una descripción general explicativa de Lilian Weng que abarca los objetivos contrastivos y el papel del muestreo negativo riguroso.
  • Página del proyecto TripletCLIP : descripción general ilustrada del uso de subtítulos e imágenes negativas sintéticas para mejorar el razonamiento compositivo de los modelos de lenguaje visual de estilo CLIP.