Articulo de referencia

n -grama

Un n -grama es una secuencia de n símbolos adyacentes en un orden particular. [ 1 ] Los símbolos pueden ser n letras adyacentes (incluidos signos de puntuación y espacios en bla...

Un n -grama es una secuencia de n símbolos adyacentes en un orden particular. [ 1 ] Los símbolos pueden ser n letras adyacentes (incluidos signos de puntuación y espacios en blanco), sílabas o, raramente, palabras completas encontradas en un conjunto de datos lingüísticos; o fonemas adyacentes extraídos de un conjunto de datos de grabación de voz, o pares de bases adyacentes extraídos de un genoma. Se recopilan de un corpus de texto o un corpus de voz .

Si se utilizan prefijos numéricos latinos , un n -grama de tamaño 1 se denomina "unigrama", uno de tamaño 2 " bigrama " (o, menos comúnmente, "digrama"), etc. Si, en lugar de los latinos, se utilizan los números cardinales ingleses , se denominan "cuatro-gramas", "cinco-gramas", etc. De manera similar, en biología computacional se utilizan prefijos numéricos griegos como "monómero", "dímero", "trímero", "tetrámero", "pentámero", etc., o números cardinales ingleses como "one-mero", "dos-mero", "tres-mero", etc., para polímeros u oligómeros de tamaño conocido , denominados k -meros . Cuando los elementos son palabras, los n -gramas también pueden denominarse tejas . [ 2 ]

En el contexto del procesamiento del lenguaje natural (PLN), el uso de n -gramas permite que los modelos de bolsa de palabras capturen información como el orden de las palabras, lo que no sería posible en el entorno tradicional de bolsa de palabras.

Ejemplos

En 1951, Shannon [ 3 ] analizó los modelos n -grama del inglés. Por ejemplo:

  • Modelo de caracteres de 3-gramas (selección aleatoria basada en las probabilidades de cada trigrama): in no ist lat whey cratict froure birs grocid pondenome of demonstures of the retagin is regiactiona of cre
  • Modelo de palabras de 2-gramas (selección aleatoria de palabras teniendo en cuenta sus probabilidades de transición): la cabeza y en ataque frontal a un escritor inglés que el carácter de este punto es por lo tanto otro método para las letras que el tiempo de quien alguna vez dijo el problema para un inesperado

La Figura 1 muestra varias secuencias de ejemplo y las secuencias correspondientes de 1-grama, 2-grama y 3-grama.

Aquí hay más ejemplos; estos son trigramas y tetragramas a nivel de palabra (y recuentos de la cantidad de veces que aparecieron) del corpus de n- gramas de Google. [ 4 ]

3 gramos

  • objetos de colección de cerámica (55)
  • Cerámica de colección fina (130)
  • cerámicas recolectadas por (52)
  • cerámica, alfarería de colección (50)
  • objetos de colección de cerámica para cocinar (45)

4 gramos

  • servir como entrante (92)
  • servir como incubadora (99)
  • servir como independiente (794)
  • servir como índice (223)
  • servir como indicación (72)
  • servir como indicador (120)

Véase también

Referencias

  1. Deller, John R .; Hansen, John (2005). «Métodos, modelos y algoritmos para el procesamiento moderno del habla». The Electrical Engineering Handbook . págs. 861–890 . doi : 10.1016/B978-012170960-0/50063-3 . ISBN  978-0-12-170960-0.
  2. Broder, Andrei Z.; Glassman, Steven C.; Manasse, Mark S.; Zweig, Geoffrey (1997). "Agrupamiento sintáctico de la web". Computer Networks and ISDN Systems . 29 (8): 1157– 1166. doi : 10.1016/s0169-7552(97)00031-7 .
  3. Shannon, Claude E. "La redundancia del inglés". Cibernética; Actas de la 7ª Conferencia, Nueva York: Fundación Josiah Macy, Jr. . 1951.
  4. Franz, Alex; Brants, Thorsten (2006). "Todos nuestros N -gramas te pertenecen" . Blog de investigación de Google . Archivado del original el 17 de octubre de 2006. Recuperado el 16 de diciembre de 2011 .

Lecturas adicionales

  • Manning, Christopher D.; Schütze, Hinrich (1999). Fundamentos del procesamiento estadístico del lenguaje natural . Cambridge, Masa: MIT Press. ISBN 978-0-262-13360-9.
  • White, Owen; Dunning, Ted; Sutton, Granger; Adams, Mark; Venter, J. Craig; Fields, Chris (1993). " Un algoritmo de control de calidad para proyectos de secuenciación de ADN" . Nucleic Acids Research . 21 (16): 3829– 3838. doi : 10.1093/nar/21.16.3829 . PMC 309901. PMID 8367301 .  
  • Damerau, Frederick J. (1971). Modelos de Markov y teoría lingüística . La Haya: Mouton. OCLC 200370 . 
  • Figueroa, Alejandro; Atkinson, John (2012). "Modelos de lenguaje contextual para clasificar respuestas a preguntas de definición en lenguaje natural". Inteligencia Computacional . 28 (4): 528– 548. doi : 10.1111/j.1467-8640.2012.00426.x .
  • Brocardo, Marcelo Luiz; Traore, Issa; Saad, Sherif; Woungang, Isaac (2013). «Verificación de autoría de mensajes cortos mediante estilometría». Conferencia Internacional de 2013 sobre Sistemas Informáticos, de Información y de Telecomunicaciones (CITS) . pp. 1–6 . doi : 10.1109/CITS.2013.6705711 . ISBN  978-1-4799-0168-5.
  • Extractor de n-gramas: Proporciona el peso de los n -gramas en función de su frecuencia.
  • Visor de n -gramas de Google Books y base de datos de n- gramas web de Google (septiembre de 2006)
  • Proyecto STATOPERATOR N-gramas: Visor de n -gramas ponderados para cada dominio en el Top 1M de Alexa.
  • 1.000.000 de 2, 3, 4, 5-gramas más frecuentes del corpus de 425 millones de palabras del inglés americano contemporáneo.
  • Visor de n-gramas musicales de Peachnote
  • Especificación de modelos de lenguaje estocásticos ( n -gramas) (W3C)
  • Notas de Michael Collins sobre los modelos de lenguaje n -grama.
  • OpenRefine: Agrupamiento en profundidad