BERT ( Bidirectional encoder representations from transformers ) es un modelo de lenguaje presentado en octubre de 2018 por investigadores de Google . [ 2 ] [ 3 ] Aprende a representar texto como una secuencia de vectores mediante aprendizaje autosupervisado . Utiliza la arquitectura de transformador solo con codificador . BERT mejoró drásticamente el estado del arte para modelos de lenguaje grandes . A partir de 2020, BERT es una línea base omnipresente en los experimentos de procesamiento del lenguaje natural (PLN). [ 4 ]
BERT se entrena mediante la predicción de tokens enmascarados y la predicción de la siguiente oración. Con este entrenamiento, BERT aprende representaciones contextuales y latentes de los tokens en su contexto, de forma similar a ELMo y GPT-2 . [ 5 ] Encontró aplicaciones en muchas tareas de procesamiento del lenguaje natural, como la resolución de correferencias y la resolución de polisemia . [ 6 ] Mejoró a ELMo y dio origen al estudio de la "BERTología", que intenta interpretar lo que aprende BERT. [ 4 ]
BERT se implementó originalmente en inglés en dos tamaños de modelo: BERT BASE (110 millones de parámetros) y BERT LARGE (340 millones de parámetros). Ambos se entrenaron con el Toronto BookCorpus [ 7 ] (800 millones de palabras) y la Wikipedia en inglés (2500 millones de palabras). [ 2 ] : 5 Los pesos se publicaron en GitHub . [ 8 ] El 11 de marzo de 2020, se publicaron 24 modelos más pequeños, siendo el más pequeño BERT TINY con solo 4 millones de parámetros. [ 8 ]
Arquitectura

BERT es una arquitectura de transformador "solo codificador" . A grandes rasgos, BERT consta de 4 módulos:
- Tokenizador: Este módulo convierte un texto en inglés en una secuencia de números enteros ("tokens").
- Incrustación : Este módulo convierte la secuencia de tokens en una matriz de vectores de valores reales que representan los tokens. Representa la conversión de tipos de tokens discretos a un espacio euclidiano de menor dimensión .
- Codificador: una pila de bloques Transformer con autoatención , pero sin enmascaramiento causal.
- Encabezado de la tarea: Este módulo convierte los vectores de representación finales en tokens codificados de una sola vez, generando una distribución de probabilidad predicha sobre los tipos de tokens. Puede considerarse como un decodificador simple que decodifica la representación latente en tipos de tokens, o como una "capa de desincrustación".
El módulo de tarea es necesario para el preentrenamiento, pero a menudo resulta innecesario para las llamadas "tareas posteriores", como la respuesta a preguntas o la clasificación de sentimientos . En su lugar, se elimina el módulo de tarea y se reemplaza por un módulo recién inicializado adecuado para la tarea, y se ajusta dicho módulo. La representación vectorial latente del modelo se introduce directamente en este nuevo módulo, lo que permite un aprendizaje por transferencia eficiente en cuanto al uso de muestras . [ 2 ] [ 9 ]

Incrustación
Esta sección describe la incrustación utilizada por BERT BASE . La otra, BERT LARGE , es similar, solo que de mayor tamaño.
El tokenizador de BERT es WordPiece, que utiliza una estrategia de subpalabras similar a la codificación de pares de bytes . Su vocabulario tiene un tamaño de 30 000 palabras, y cualquier token que no aparezca en él se reemplaza por [UNK]("desconocido").

La primera capa es la capa de incrustación, que contiene tres componentes: incrustaciones de tipo token, incrustaciones de posición e incrustaciones de tipo segmento.
- Tipo de token: El tipo de token es una capa de incrustación estándar que traduce un vector one-hot en un vector denso en función de su tipo de token.
- Posición: Las incrustaciones de posición se basan en la posición de un token en la secuencia. BERT utiliza incrustaciones de posición absoluta, donde cada posición en una secuencia se asigna a un vector de valores reales. Cada dimensión del vector consiste en una función sinusoidal que toma como entrada la posición en la secuencia.
- Tipo de segmento: Utilizando un vocabulario de solo 0 o 1, esta capa de incrustación produce un vector denso basado en si el token pertenece al primer o segundo segmento de texto en la entrada. En otras palabras, los tokens de tipo 1 son todos los que aparecen después del
[SEP]token especial. Todos los tokens anteriores son de tipo 0.
Los tres vectores de incrustación se suman para representar la representación inicial del token en función de estas tres piezas de información. Tras la incrustación, la representación vectorial se normaliza mediante una operación LayerNorm , generando un vector de 768 dimensiones para cada token de entrada. Posteriormente, los vectores de representación se procesan a través de 12 bloques codificadores Transformer y se decodifican de nuevo a un espacio de vocabulario de 30 000 dimensiones mediante una capa de transformación afín básica.
Familia arquitectónica
La pila de codificadores de BERT tiene 2 parámetros libres:, el número de capas y, el tamaño oculto . Siempre haycabezas de autoatención, y el tamaño del filtro/alimentación directa es siempreAl variar estos dos números, se obtiene toda una familia de modelos BERT. [ 10 ]
Para BERT:
- El tamaño de la red neuronal de alimentación directa y el tamaño del filtro son sinónimos. Ambos indican el número de dimensiones en la capa intermedia de la red neuronal de alimentación directa.
- El tamaño oculto y el tamaño de incrustación son sinónimos. Ambos indican la cantidad de números reales utilizados para representar un token.
La notación para la pila del codificador se escribe como L/H. Por ejemplo, BERT BASE se escribe como 12L/768H, BERT LARGE como 24L/1024H y BERT TINY como 2L/128H.
Capacitación
Entrenamiento previo
BERT fue preentrenado simultáneamente en dos tareas: [ 11 ]
- Modelado de lenguaje enmascarado (MLM): En esta tarea, BERT procesa una secuencia de palabras, donde una palabra puede modificarse aleatoriamente ("enmascarada"), y BERT intenta predecir las palabras originales que se modificaron. Por ejemplo, en la oración "El gato se sentó en el
[MASK]", BERT tendría que predecir "alfombra". Esto ayuda a BERT a aprender el contexto bidireccional, lo que significa que comprende las relaciones entre las palabras no solo de izquierda a derecha o de derecha a izquierda, sino en ambas direcciones simultáneamente.
- Predicción de la siguiente oración (NSP): En esta tarea, BERT se entrena para predecir si una oración sigue lógicamente a otra. Por ejemplo, dadas dos oraciones, "El gato se sentó en la alfombra" y "Era un día soleado", BERT debe decidir si la segunda oración es una continuación válida de la primera. Esto ayuda a BERT a comprender las relaciones entre oraciones, lo cual es importante para tareas como responder preguntas o clasificar documentos.
Modelado de lenguaje enmascarado

En el modelado de lenguaje enmascarado, el 15 % de los tokens se seleccionarían aleatoriamente para la tarea de predicción enmascarada, y el objetivo del entrenamiento sería predecir el token enmascarado dado su contexto. En detalle, el token seleccionado es:
- reemplazado por un
[MASK]token con una probabilidad del 80%, - reemplazado con un token de palabra aleatoria con una probabilidad del 10%,
- no se reemplaza con una probabilidad del 10%.
La razón por la que no se enmascaran todos los tokens seleccionados es para evitar el problema del desplazamiento del conjunto de datos. Este problema surge cuando la distribución de las entradas observadas durante el entrenamiento difiere significativamente de la distribución encontrada durante la inferencia. Un modelo BERT entrenado podría aplicarse a la representación de palabras (como Word2Vec ), donde se ejecutaría sobre oraciones que no contienen ningún [MASK]token. Posteriormente se ha descubierto que, en general, es mejor utilizar objetivos de entrenamiento más diversos. [ 12 ]
Como ejemplo ilustrativo, consideremos la oración "mi perro es lindo". Primero se dividiría en tokens como "mi 1 perro 2 es 3 lindo 4 ". Luego se elegiría un token al azar en la oración. Digamos que es el cuarto: "lindo 4 ". A continuación, habría tres posibilidades:
- con una probabilidad del 80%, el token elegido se enmascara, lo que resulta en "mi 1 perro 2 es 3
[MASK]4 "; - con una probabilidad del 10%, el token elegido se reemplaza por un token aleatorio muestreado uniformemente, como "feliz", lo que da como resultado "mi 1 perro 2 está 3 feliz 4 ";
- con una probabilidad del 10%, no se hace nada, lo que resulta en "mi 1 perro 2 es 3 lindo 4 ".
Tras procesar el texto de entrada, el cuarto vector de salida del modelo se pasa a su capa decodificadora, que genera una distribución de probabilidad sobre su espacio de vocabulario de 30.000 dimensiones.
Predicción de la siguiente frase

Dados dos enunciados, el modelo predice si aparecen secuencialmente en el corpus de entrenamiento, devolviendo verdadero [IsNext]o falso [NotNext]. Durante el entrenamiento, el algoritmo a veces toma muestras de dos enunciados de un único segmento continuo en el corpus de entrenamiento, mientras que en otras ocasiones toma muestras de dos segmentos discontinuos.
La primera oración comienza con un token especial, [CLS](de "clasificar"). Las dos oraciones están separadas por otro token especial, [SEP](de "separar"). Después de procesar las dos oraciones, el vector final para el [CLS]token se pasa a una capa lineal para la clasificación binaria en [IsNext]y [NotNext].
Por ejemplo:
- Dado que "
[CLS]mi perro es lindo[SEP]y le gusta jugar[SEP]", el modelo debería predecir[IsNext]. - Dado "
[CLS]mi perro es lindo,[SEP]¿cómo funcionan los imanes[SEP]?", el modelo debería predecir[NotNext].
Sintonia FINA
Clasificación de sentimientos
Clasificación de oraciones
Responder preguntas de opción múltiple
BERT está diseñado como un modelo preentrenado general para diversas aplicaciones en el procesamiento del lenguaje natural. Es decir, después del preentrenamiento, BERT puede ajustarse con menos recursos en conjuntos de datos más pequeños para optimizar su rendimiento en tareas específicas como la inferencia del lenguaje natural y la clasificación de texto , y tareas de generación de lenguaje basadas en secuencias, como la respuesta a preguntas y la generación de respuestas conversacionales. [ 13 ]
El artículo original de BERT publicó resultados que demostraban que una pequeña cantidad de ajuste fino (para BERT LARGE , 1 hora en 1 Cloud TPU) le permitía alcanzar un rendimiento de vanguardia en varias tareas de comprensión del lenguaje natural : [ 2 ]
- Conjunto de tareas GLUE ( Evaluación de la comprensión general del lenguaje ) (que consta de 9 tareas);
- SQuAD (Stanford Question Answering Dataset [ 14 ] ) v1.1 y v2.0;
- SWAG (Situaciones con generaciones adversarias [ 15 ] ).
En el artículo original, se ajustan todos los parámetros de BERT y se recomienda que, para aplicaciones posteriores de clasificación de texto, el token de salida en el [CLS]token de entrada se introduzca en una capa softmax lineal para producir las etiquetas de salida. [ 2 ]
El código base original definía la capa lineal final como una "capa de agrupación", en analogía con la agrupación global en visión artificial, aunque simplemente descarta todos los tokens de salida excepto el que corresponde a [CLS]. [ 16 ]
Costo
BERT fue entrenado con BookCorpus (800 millones de palabras) y una versión filtrada de la Wikipedia en inglés (2500 millones de palabras) sin listas, tablas ni encabezados.
El entrenamiento de BERT BASE en 4 TPU en la nube (16 chips TPU en total) tardó 4 días, con un costo estimado de 500 USD. [ 8 ] El entrenamiento de BERT LARGE en 16 TPU en la nube (64 chips TPU en total) tardó 4 días. [ 2 ]
Interpretación
Los modelos de lenguaje como ELMo, GPT-2 y BERT dieron origen al estudio de la "BERTología", que intenta interpretar lo que aprenden estos modelos. Su desempeño en estas tareas de comprensión del lenguaje natural aún no se comprende bien. [ 4 ] [ 17 ] [ 18 ] Varias publicaciones de investigación en 2018 y 2019 se centraron en investigar la relación detrás de la salida de BERT como resultado de secuencias de entrada cuidadosamente elegidas, [ 19 ] [ 20 ] el análisis de representaciones vectoriales internas a través de clasificadores de sondeo, [ 21 ] [ 22 ] y las relaciones representadas por pesos de atención . [ 17 ] [ 18 ]
El alto rendimiento del modelo BERT también podría atribuirse al hecho de que se entrena bidireccionalmente. [ 23 ] Esto significa que BERT, basado en la arquitectura del modelo Transformer, aplica su mecanismo de autoatención para aprender información de un texto desde el lado izquierdo y derecho durante el entrenamiento, y en consecuencia obtiene una comprensión profunda del contexto. Por ejemplo, la palabra fine puede tener dos significados diferentes dependiendo del contexto ( I feel fine today , She has fine blonde hair ). BERT considera las palabras que rodean la palabra objetivo fine desde el lado izquierdo y derecho.
Sin embargo, esto tiene un costo: debido a que la arquitectura solo utiliza un codificador y carece de un decodificador, BERT no puede recibir indicaciones ni generar texto , mientras que los modelos bidireccionales en general no funcionan eficazmente sin el lado derecho, lo que dificulta su uso. Como ejemplo ilustrativo, si se desea utilizar BERT para continuar un fragmento de oración como "Hoy fui a", ingenuamente se enmascararían todos los tokens como "Hoy fui a [MASK][MASK][MASK]... [MASK]", donde el número de tokens [MASK] representa la longitud de la oración que se desea extender. Sin embargo, esto implica un cambio en el conjunto de datos, ya que durante el entrenamiento, BERT nunca ha visto oraciones con tantos tokens enmascarados. En consecuencia, su rendimiento se degrada. Técnicas más sofisticadas permiten la generación de texto, pero a un alto costo computacional. [ 24 ]
Historia
BERT fue publicado originalmente por los investigadores de Google Jacob Devlin, Ming-Wei Chang, Kenton Lee y Kristina Toutanova. Su diseño tiene su origen en el preentrenamiento de representaciones contextuales, incluyendo el aprendizaje de secuencias semisupervisado , [ 25 ] el preentrenamiento generativo, ELMo , [ 26 ] y ULMFit. [ 27 ] A diferencia de los modelos anteriores, BERT es una representación del lenguaje profundamente bidireccional y no supervisada , preentrenada utilizando únicamente un corpus de texto plano . Los modelos libres de contexto, como word2vec o GloVe, generan una única representación de incrustación de palabras para cada palabra del vocabulario, mientras que BERT tiene en cuenta el contexto de cada aparición de una palabra dada. Por ejemplo, mientras que el vector para "correr" tendrá la misma representación vectorial word2vec para ambas apariciones en las oraciones "Él dirige una empresa" y "Él corre una maratón", BERT proporcionará una incrustación contextualizada que será diferente según la oración. [ 5 ]
El 25 de octubre de 2019, Google anunció que había comenzado a aplicar modelos BERT a las consultas de búsqueda en inglés en Google Search dentro de los EE. UU. [ 28 ] El 9 de diciembre de 2019, se informó que Google Search había adoptado BERT para más de 70 idiomas. [ 29 ] [ 30 ] En octubre de 2020, casi todas las consultas basadas en inglés fueron procesadas por un modelo BERT. [ 31 ]
Variantes
Los modelos BERT fueron influyentes e inspiraron muchas variantes.
RoBERTa (2019) [ 32 ] fue una mejora de ingeniería. Conserva la arquitectura de BERT (ligeramente más grande, con 355 millones de parámetros), pero mejora su entrenamiento, cambiando hiperparámetros clave, eliminando la tarea de predicción de la siguiente oración y utilizando tamaños de minilotes mucho mayores .
XLM-RoBERTa (2019) [ 33 ] fue un modelo RoBERTa multilingüe. Fue uno de los primeros trabajos sobre modelado de lenguaje multilingüe a gran escala.
DistilBERT (2019) destila BERT BASE a un modelo con solo el 60% de sus parámetros (66M), mientras que conserva el 95% de sus puntuaciones de referencia. [ 34 ] [ 35 ] De manera similar, TinyBERT (2019) [ 36 ] es un modelo destilado con solo el 28% de sus parámetros.
ALBERT (2019) [ 37 ] utilizó parámetros compartidos entre capas y experimentó variando independientemente el tamaño oculto y el tamaño de salida de la capa de incrustación de palabras como dos hiperparámetros. También reemplazaron la tarea de predicción de la siguiente oración con la tarea de predicción del orden de las oraciones (SOP), donde el modelo debe distinguir el orden correcto de dos segmentos de texto consecutivos de su orden inverso.
ELECTRA (2020) [ 38 ] aplicó la idea de redes generativas antagónicas a la tarea MLM. En lugar de enmascarar tokens, un modelo de lenguaje pequeño genera sustituciones plausibles aleatorias, y una red más grande identifica estos tokens reemplazados. El modelo pequeño busca engañar al modelo grande.
DeBERTa (2020) [ 39 ] es una variante arquitectónica significativa, con atención desenredada . Su idea clave es tratar las codificaciones posicionales y de tokens por separado a lo largo del mecanismo de atención. En lugar de combinar la codificación posicional () y codificación de tokens () en un único vector de entrada (), DeBERTa los mantiene separados como una tupla:. Luego, en cada capa de autoatención, DeBERTa calcula tres matrices de atención distintas, en lugar de la única matriz de atención utilizada en BERT: [ nota 1 ]
Las tres matrices de atención se suman elemento a elemento, luego se pasan a través de una capa softmax y se multiplican por una matriz de proyección.
La codificación de posición absoluta se incluye en la capa final de autoatención como entrada adicional.
Notas
- ↑ Los autores omitieron el tipo de posición a posición por considerarlo inútil.
Referencias
- ↑ "Versión inicial de BERT · google-research/bert@fe35475" . GitHub . Archivado del original el 26 de mayo de 2026 . Recuperado el 26 de mayo de 2026 .
- 1 2 3 4 5 6 Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (11 de octubre de 2018). "BERT: Pre-entrenamiento de transformadores bidireccionales profundos para la comprensión del lenguaje". arXiv : 1810.04805v2 [ cs.CL ].
- ↑ "BERT de código abierto: Preentrenamiento de vanguardia para el procesamiento del lenguaje natural" . Blog de IA de Google . 2 de noviembre de 2018. Consultado el 27 de noviembre de 2019 .
- 1 2 3 Rogers, Anna; Kovaleva, Olga; Rumshisky, Anna (2020). "Una introducción a la BERTología: lo que sabemos sobre cómo funciona BERT" . Transactions of the Association for Computational Linguistics . 8 : 842–866 . arXiv : 2002.12327 . doi : 10.1162/tacl_a_00349 . S2CID 211532403 .
- 1 2 Ethayarajh, Kawin (1 de septiembre de 2019), ¿ Qué tan contextuales son las representaciones de palabras contextualizadas? Comparando la geometría de las incrustaciones de BERT, ELMo y GPT-2 , arXiv : 1909.00512
- ↑ Anderson, Dawn (5 de noviembre de 2019). "Una inmersión profunda en BERT: Cómo BERT impulsó un cohete hacia la comprensión del lenguaje natural" . Search Engine Land . Recuperado el 6 de agosto de 2024 .
- ↑ Zhu, Yukun; Kiros, Ryan; Zemel, rico; Salakhutdinov, Ruslan; Urtasún, Raquel; Torralba, Antonio; Fidler, Sanja (2015). "Alinear libros y películas: hacia explicaciones visuales similares a historias viendo películas y leyendo libros". págs. 19 a 27. arXiv : 1506.06724 [ cs.CV ].
- 1 2 3 "BERT" . GitHub . Consultado el 28 de marzo de 2023 .
- ↑ Zhang, Tianyi; Wu, Felix; Katiyar, Arzoo; Weinberger, Kilian Q.; Artzi, Yoav (11 de marzo de 2021), Revisiting Few-sample BERT Fine-tuning , arXiv : 2006.05987
- ↑ Turc, Iulia; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (25 de septiembre de 2019), Los estudiantes bien leídos aprenden mejor: sobre la importancia del preentrenamiento de modelos compactos , arXiv : 1908.08962
- ↑ "Resumen de los modelos — documentación de transformers 3.4.0" . huggingface.co . Consultado el 16 de febrero de 2023 .
- ↑ Tay, Yi; Dehghani, Mostafa; Tran, Vinh Q.; Garcia, Xavier; Wei, Jason; Wang, Xuezhi; Chung, Hyung Won; Shakeri, Siamak; Bahri, Dara (28 de febrero de 2023), UL2: Unifying Language Learning Paradigms , arXiv : 2205.05131
- 1 2 Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "11.9. Preentrenamiento a gran escala con Transformers" . Sumérgete en el aprendizaje profundo . Cambridge Nueva York Puerto Melbourne Nueva Delhi Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
- ↑ Rajpurkar, Pranav; Zhang, Jian; Lopyrev, Konstantin; Liang, Percy (10 de octubre de 2016). "SQuAD: más de 100 000 preguntas para la comprensión automática de texto". arXiv : 1606.05250 [ cs.CL ].
- ^ Zellers, Rowan; Bisk, Yonatan; Schwartz, Roy; Choi, Yejin (15 de agosto de 2018). "SWAG: un conjunto de datos contradictorios a gran escala para inferencias de sentido común fundamentadas". arXiv : 1808.05326 [ cs.CL ].
- ↑ "bert/modeling.py en master · google-research/bert" . GitHub . Consultado el 16 de septiembre de 2024 .
- 1 2 Kovaleva, Olga; Romanov, Alexey; Rogers, Anna; Rumshisky, Anna (noviembre de 2019). "Revelando los oscuros secretos de BERT" . Actas de la Conferencia de 2019 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural y la 9.ª Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural (EMNLP-IJCNLP) . págs. 4364–4373 . doi : 10.18653/v1/D19-1445 . S2CID 201645145 .
- 1 2 Clark, Kevin; Khandelwal, Urvashi; Levy, Omer; Manning, Christopher D. (2019). "¿Qué observa BERT? Un análisis de la atención de BERT" . Actas del taller ACL 2019 BlackboxNLP: Análisis e interpretación de redes neuronales para PLN . Stroudsburg, PA, EE. UU.: Asociación para la Lingüística Computacional: 276–286 . arXiv : 1906.04341 . doi : 10.18653/v1/w19-4828 .
- ↑ Khandelwal, Urvashi; He, He; Qi, Peng; Jurafsky, Dan (2018). "Nítido cerca, difuso lejos: cómo los modelos de lenguaje neuronales usan el contexto". Actas de la 56.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos largos) . Stroudsburg, PA, EE. UU.: Asociación de Lingüística Computacional: 284–294 . arXiv : 1805.04623 . doi : 10.18653/v1/p18-1027 . S2CID 21700944 .
- ↑ Gulordava, Kristina; Bojanowski, Piotr; Grave, Edouard; Linzen, Tal; Baroni, Marco (2018). "Redes recurrentes verdes incoloras sueñan jerárquicamente". Actas de la Conferencia de 2018 del Capítulo Norteamericano de la Asociación de Lingüística Computacional: Tecnologías del lenguaje humano, Volumen 1 (Artículos extensos) . Stroudsburg, PA, EE. UU.: Asociación de Lingüística Computacional. págs. 1195–1205 . arXiv : 1803.11138 . doi : 10.18653/v1/n18-1108 . S2CID 4460159 .
- ↑ Giulianelli, Mario; Harding, Jack; Mohnert, Florian; Hupkes, Dieuwke; Zuidema, Willem (2018). "Under the Hood: Using Diagnostic Classifiers to Investigate and Improve how Language Models Track Agreement Information". Proceedings of the 2018 EMNLP Workshop BlackboxNLP: Analyzing and Interpreting Neural Networks for NLP . Stroudsburg, PA, USA: Association for Computational Linguistics: 240– 248. arXiv : 1808.08079 . doi : 10.18653/v1/w18-5426 . S2CID 52090220 .
- ↑ Zhang, Kelly; Bowman, Samuel (2018). "El modelado del lenguaje enseña más que la traducción: lecciones aprendidas mediante el análisis de tareas sintácticas auxiliares" . Actas del taller EMNLP 2018 BlackboxNLP: análisis e interpretación de redes neuronales para PLN . Stroudsburg, PA, EE. UU.: Asociación de Lingüística Computacional: 359–361 . doi : 10.18653/v1/w18-5448 .
- ↑ Sur, Chiranjib (enero de 2020). "RBN: mejora en la predicción de atributos del lenguaje utilizando la representación global de la tecnología de aprendizaje por transferencia del lenguaje natural como Google BERT" . SN Applied Sciences . 2 (1) 22. doi : 10.1007/s42452-019-1765-9 .
- ↑ Patel, Ajay; Li, Bryan; Mohammad Sadegh Rasooli; Constant, Noah; Raffel, Colin; Callison-Burch, Chris (2022). "Los modelos de lenguaje bidireccionales también son aprendices con pocos ejemplos". arXiv : 2209.14500 [ cs.LG ].
- ↑ Dai, Andrew; Le, Quoc (4 de noviembre de 2015). "Aprendizaje de secuencias semisupervisado". arXiv : 1511.01432 [ cs.LG ].
- ↑ Peters, Matthew; Neumann, Mark; Iyyer, Mohit; Gardner, Matt; Clark, Christopher; Lee, Kenton; Luke, Zettlemoyer (15 de febrero de 2018). "Representaciones de palabras contextualizadas profundas". arXiv : 1802.05365v2 [ cs.CL ].
- ↑ Howard, Jeremy; Ruder, Sebastian (18 de enero de 2018). "Ajuste fino del modelo de lenguaje universal para la clasificación de texto". arXiv : 1801.06146v5 [ cs.CL ].
- ↑ Nayak, Pandu (25 de octubre de 2019). "Comprender las búsquedas mejor que nunca" . Blog de Google . Consultado el 10 de diciembre de 2019 .
- ↑ "Comprender las búsquedas mejor que nunca" . Google . 25 de octubre de 2019. Consultado el 6 de agosto de 2024 .
- ↑ Montti, Roger (10 de diciembre de 2019). "Google lanza BERT a nivel mundial" . Search Engine Journal . Consultado el 10 de diciembre de 2019 .
- ↑ "Google: BERT ahora se usa en casi todas las consultas en inglés" . Search Engine Land . 15 de octubre de 2020. Consultado el 24 de noviembre de 2020 .
- ↑ Liu, Yinhan; Ott, Myle; Goyal, Naman; Du, Jingfei; Joshi, Mandar; Chen, Danqi; Levy, Omer; Lewis, Mike; Zettlemoyer, Luke; Stoyanov, Veselin (2019). "RoBERTa: Un enfoque de preentrenamiento de BERT optimizado de forma robusta". arXiv : 1907.11692 [ cs.CL ].
- ^ Conneau, Alexis; Khandelwal, Kartikay; Goyal, Naman; Chaudhary, Vishrav; Wenzek, Guillaume; Guzmán, Francisco; Tumba, Eduardo; Ott, Myle; Zettlemoyer, Lucas; Stoyanov, Veselin (2019). "Aprendizaje de representación multilingüe no supervisado a escala". arXiv : 1911.02116 [ cs.CL ].
- ↑ Sanh, Victor; Debut, Lysandre; Chaumond, Julien; Wolf, Thomas (29 de febrero de 2020), DistilBERT, una versión destilada de BERT: más pequeño, más rápido, más barato y más ligero , arXiv : 1910.01108
- ↑ "DistilBERT" . huggingface.co . Consultado el 5 de agosto de 2024 .
- ^ Jiao, Xiaoqi; Yin, Yichun; Shang, Lifeng; Jiang, Xin; Chen, Xiao; Li, Linlin; Wang, colmillo; Liu, Qun (15 de octubre de 2020), TinyBERT: Destilación de BERT para la comprensión del lenguaje natural , arXiv : 1909.10351
- ↑ Lan, Zhenzhong; Chen, Mingda; Goodman, Sebastian; Gimpel, Kevin; Sharma, Piyush; Soricut, Radu (8 de febrero de 2020), ALBERT: Un BERT ligero para el aprendizaje autosupervisado de representaciones del lenguaje , arXiv : 1909.11942
- ↑ Clark, Kevin; Luong, Minh-Thang; Le, Quoc V.; Manning, Christopher D. (23 de marzo de 2020), ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators , arXiv : 2003.10555
- ^ Él, Pengcheng; Liu, Xiaodong; Gao, Jianfeng; Chen, Weizhu (6 de octubre de 2021), DeBERTa: BERT mejorado con decodificación con atención desenredada , arXiv : 2006.03654
Lecturas adicionales
- Rogers, Anna; Kovaleva, Olga; Rumshisky, Anna (2020). "Una introducción a la BERtología: lo que sabemos sobre cómo funciona BERT". arXiv : 2002.12327 [ cs.CL ].
Enlaces externos
- Repositorio oficial de GitHub
- Software de Google
- Modelos de lenguaje a gran escala
- Software de 2018
- 2018 en inteligencia artificial