La detección de palabras clave (o más simplemente, detección de palabras ) es un problema que históricamente se definió por primera vez en el contexto del procesamiento del habla . [ 1 ] [ 2 ] En el procesamiento del habla, la detección de palabras clave se ocupa de la identificación de palabras clave en enunciados .
La detección de palabras clave también se define como un problema separado, pero relacionado, en el contexto del procesamiento de imágenes de documentos. [ 1 ] En el procesamiento de imágenes de documentos, la detección de palabras clave es el problema de encontrar todas las instancias de una palabra de consulta que existen en una imagen de documento escaneada, sin reconocerla completamente.
En el procesamiento del habla
Los primeros trabajos sobre detección de palabras clave aparecieron a finales de la década de 1980. [ 2 ]
Un caso especial de detección de palabras clave es la detección de la palabra de activación (también llamada palabra clave) que utilizan los asistentes digitales personales como Alexa o Siri para activar el altavoz inactivo, es decir, para "despertarlo" cuando se pronuncia su nombre.
En Estados Unidos, la Agencia de Seguridad Nacional ha utilizado la detección de palabras clave desde al menos 2006. [ 3 ] Esta tecnología permite a los analistas buscar en grandes volúmenes de conversaciones grabadas y aislar menciones de palabras clave sospechosas. Las grabaciones se pueden indexar y los analistas pueden realizar consultas en la base de datos para encontrar conversaciones de interés. IARPA financió la investigación sobre la detección de palabras clave en el programa Babel .
Algunos algoritmos utilizados para esta tarea son:
- Ventana corrediza y modelo de basura
- hipótesis K-mejor
- Decodificación iterativa de Viterbi
- Red neuronal convolucional sobre coeficientes cepstrales de frecuencia Mel [ 4 ]
- Detección de palabras clave de tamaño reducido basada en transformadores [ 5 ]
En el procesamiento de imágenes de documentos
La detección de palabras clave en el procesamiento de imágenes de documentos puede considerarse un ejemplo del problema más general de recuperación de imágenes basada en contenido (CBIR). Dada una consulta, el objetivo es recuperar las instancias más relevantes de palabras en una colección de documentos escaneados. [ 1 ] La consulta puede ser una cadena de texto (detección de palabras clave por cadena) o una imagen de palabras (detección de palabras clave por ejemplo).
Referencias
- 1 2 3 Giotis, AP; Sfikas, G.; Gatos, B.; Nikou, C. (2017). "Un estudio de las técnicas de detección de palabras en imágenes de documentos". Pattern Recognition . 68 : 310–332 . Bibcode : 2017PatRe..68..310G . doi : 10.1016/j.patcog.2017.02.023 .
- 1 2 Rohlicek, J.; Russell, W.; Roukos, S.; Gish, H. (1989). "Modelado continuo de Markov oculto para la detección de palabras independiente del hablante". Conferencia Internacional sobre Acústica, Habla y Procesamiento de Señales . Vol. 1. pp. 627– 630. doi : 10.1109/ICASSP.1989.266505 .
- ↑ Froomkin, Dan (5 de mayo de 2015). "LAS COMPUTADORAS ESTÁN ESCUCHANDO" . The Intercept . Archivado del original el 27 de junio de 2015. Recuperado el 20 de junio de 2015 .
- ↑ Sainath, Tara N ; Parada, Carolina (2015). "Redes neuronales convolucionales para la detección de palabras clave con baja huella". Decimosexta Conferencia Anual de la Asociación Internacional de Comunicación del Habla . arXiv : 1711.00333 .
- ↑ Wei, Bo; Yang, Meirong; Zhang, Tao; Tang, Xiao; Huang, Xing; Kim, Kyuhong; Lee, Jaeyun; Cho, Kiho; Park, Sung-Un (30 de agosto de 2021). Detección de palabras clave de vocabulario abierto basada en transformadores de extremo a extremo con atención local guiada por ubicación (PDF) . Interspeech 2021.
- Reconocimiento de patrones