Articulo de referencia

Algoritmo fonético

Un algoritmo fonético es un algoritmo para indexar palabras según su pronunciación . Si el algoritmo se basa en la ortografía, depende fundamentalmente del sistema ortográfico d...

Un algoritmo fonético es un algoritmo para indexar palabras según su pronunciación . Si el algoritmo se basa en la ortografía, depende fundamentalmente del sistema ortográfico del idioma para el que está diseñado: como la mayoría de los algoritmos fonéticos se desarrollaron para el inglés, son menos útiles para indexar palabras en otros idiomas. [ 1 ] Debido a que la ortografía inglesa varía significativamente según múltiples factores, como el origen de la palabra y su uso a lo largo del tiempo, así como los préstamos de otros idiomas, los algoritmos fonéticos necesariamente tienen en cuenta numerosas reglas y excepciones. [ 2 ] Los algoritmos de coincidencia fonética más generales tienen en cuenta las características articulatorias . [ 3 ]

La búsqueda fonética tiene muchas aplicaciones, y uno de los primeros casos de uso ha sido la búsqueda de marcas registradas para garantizar que las marcas recién registradas no corran el riesgo de infringir marcas existentes debido a su pronunciación. [ 4 ] [ 5 ]

Algoritmos

Entre los algoritmos fonéticos más conocidos se encuentran:

  • Soundex , desarrollado para codificar apellidos para su uso en censos. Los códigos Soundex son cadenas de cuatro caracteres compuestas por una letra seguida de tres números.
  • Daitch–Mokotoff Soundex es una versión mejorada de Soundex diseñada para coincidir mejor con apellidos de origen eslavo y germánico. Los códigos Daitch–Mokotoff Soundex son cadenas compuestas por seis dígitos numéricos.
  • Fonética de Colonia : Es similar a Soundex, pero más adecuada para palabras alemanas.
  • Metaphone y Double Metaphone son adecuados para su uso con la mayoría de las palabras en inglés, no solo con nombres. Los algoritmos de Metaphone son la base de muchos correctores ortográficos populares .
  • El Sistema de Identificación e Inteligencia del Estado de Nueva York (NYSIIS) asigna fonemas similares a la misma letra. El resultado es una secuencia que el lector puede pronunciar sin necesidad de decodificarla.
  • El método Match Rating Approach, desarrollado por Western Airlines en 1977, utiliza una técnica de codificación y comparación de rangos.
  • Caverphone , creado para facilitar la comparación de datos entre los censos electorales de finales del siglo XIX y principios del XX, está optimizado para los acentos presentes en algunas zonas de Nueva Zelanda.

Usos comunes

  • Los correctores ortográficos suelen incluir algoritmos fonéticos. El algoritmo Metaphone , por ejemplo, toma una palabra mal escrita y crea un código. Este código se busca en un directorio para encontrar palabras con el mismo Metaphone o uno similar. Las palabras que tienen el mismo Metaphone o uno similar se convierten en posibles grafías alternativas.
  • La función de búsqueda suele utilizar algoritmos fonéticos para encontrar resultados que no coinciden exactamente con el término o términos utilizados en la búsqueda. Buscar nombres puede ser difícil, ya que a menudo existen varias grafías alternativas. Un ejemplo es el nombre Claire . Tiene dos alternativas, Clare/Clair, que se pronuncian igual. Buscar una grafía no mostraría resultados para las otras dos. Usando Soundex, las tres variaciones producen el mismo código Soundex, C460. Al buscar nombres basándose en el código Soundex, se devolverán las tres variaciones.
  • Los procesos de deduplicación de datos utilizan algoritmos fonéticos para agrupar fácilmente los registros según nombres con sonidos similares, para su posterior evaluación.
  • Los módulos de conversión de voz a texto utilizan la codificación fonética para encontrar el conjunto de palabras del diccionario que se pronuncian de forma similar a los fonemas generados por la señal de audio procesada.

Véase también

Referencias

  1. Li, Nan; Hitchcock, Peter; Blustein, James; Bliemel, Michael (2011). H. Raghav Rao; Raj Sharman; TS Raghu (eds.). Explorando los grandes desafíos para la próxima generación de comercio electrónico  : 8.º Taller sobre Comercio Electrónico, WEB 2009, Phoenix, AZ, EE. UU., 15 de diciembre de 2009, Artículos seleccionados revisados . Berlín: Springer. pág.  232. ISBN 9783642174483Consultado el 31 de diciembre de 2020 .
  2. Cohen, Eli B. (2009). Growing Information: Part 2. Santa Rosa, California: Informing Science. pág. 498. ISBN  978-1-932886-17-7.
  3. Ladefoged, Peter. "La medición de la similitud fonética". En Conferencia Internacional sobre Lingüística Computacional COLING 1969: Preimpresión n.° 57. 1969.
  4. McAllister, Robert y Benny Brodda. «Desarrollo de una nueva prueba de comprensión del habla con una métrica de distancia fonológica». En Actas de Fonetik, vol. 44, págs. 149-152. 2002.
  5. Fall, Caspas J., y Christophe Giraud-Carrier. "Búsqueda de similitudes verbales en bases de datos de marcas registradas". World Patent Information 27, n.º 2 (2005): 135-143.
  • Algoritmo para convertir palabras en fonemas y viceversa.
  • StringMetric es un proyecto de biblioteca Scala de algoritmos fonéticos.
  • clj-fuzzy es un proyecto que desarrolla una biblioteca de algoritmos fonéticos escrita en Clojure .
  • Biblioteca SoundexBR de algoritmos fonéticos implementada en R.
  • Talismán es una biblioteca de JavaScript que recopila varios algoritmos fonéticos que se pueden probar en línea.