La lingüística computacional china es un subconjunto de la lingüística computacional ; se trata del estudio científico y el procesamiento de información del idioma chino mediante computadoras. Su propósito es comprender mejor el funcionamiento del idioma y facilitar su uso en aplicaciones lingüísticas . El término «lingüística computacional china» se emplea a menudo indistintamente con « procesamiento de información chino» , aunque el primero puede sonar más teórico, mientras que el segundo es más técnico. [ 1 ]
En lugar de presentar la lingüística computacional en un sentido general, este artículo se centrará en los problemas únicos que implica la implementación del idioma chino en comparación con otros idiomas. El contenido incluye el procesamiento de información de caracteres chinos , la segmentación de palabras , el reconocimiento de nombres propios , la comprensión y generación del lenguaje natural, la lingüística de corpus y la traducción automática . [ 1 ]
Procesamiento de información de caracteres chinos
La tecnología de la información (TI) para caracteres chinos es la tecnología de procesamiento informático de caracteres chinos . Mientras que el sistema de escritura inglés utiliza unas pocas docenas de caracteres diferentes, el idioma chino necesita un conjunto de caracteres mucho mayor. Hay más de diez mil caracteres en el Diccionario Xinhua . [ 2 ] En el conjunto de caracteres multilingües Unicode de 149 813 caracteres, 98 682 (aproximadamente 2/3) son caracteres chinos. [ 3 ] Esto significa que el procesamiento informático de caracteres chinos es el más intensivo entre todos los idiomas.
Entrada de caracteres chinos
La introducción de caracteres chinos en un ordenador es más compleja que en idiomas con sistemas de caracteres más sencillos. Por ejemplo, el inglés se escribe con 26 letras y algunos otros caracteres, y cada carácter se asigna a una tecla del teclado . En teoría, los caracteres chinos podrían introducirse de forma similar, pero este método resulta poco práctico para la mayoría de las aplicaciones debido a la cantidad de caracteres; requeriría un teclado enorme con miles de teclas, y al usuario le resultaría difícil y laborioso localizar cada carácter individualmente. [ 4 ] Un método alternativo consiste en utilizar la distribución del teclado inglés y codificar cada carácter chino con caracteres ingleses; este es el método predominante para la introducción de caracteres chinos en la actualidad.
La codificación basada en sonido se basa normalmente en un esquema de caracteres latinos existente para la fonética china, como el esquema Pinyin para el chino mandarín o Putonghua , y el esquema Jyutping para el dialecto cantonés . El código de entrada de un carácter chino es su cadena de letras pinyin seguida de un número opcional que representa el tono. Por ejemplo, el código de entrada Pinyin Putonghua de香港(Hong Kong) es "xianggang" o "xiang1gang3", y el código Jyutping cantonés es "hoenggong" o "hoeng1gong2", todos los cuales se pueden introducir fácilmente mediante un teclado en inglés.
Un carácter chino también puede introducirse mediante codificación basada en la forma . La mayoría de los caracteres chinos se pueden dividir en una secuencia de componentes, cada uno de los cuales, a su vez, se compone de una secuencia de trazos en orden de escritura. Existen unos pocos cientos de componentes básicos, [ 5 ] muchos menos que el número de caracteres. Al representar cada componente con una letra inglesa y colocarlos en el orden de escritura del carácter, el creador del método de entrada puede obtener una cadena de letras lista para usarse como código de entrada en el teclado inglés. Por supuesto, el creador también puede diseñar una regla para seleccionar letras representativas de la cadena si es demasiado larga. Por ejemplo, en el método de entrada Cangjie , el carácter疆(borde) se codifica como "NGMWM", correspondiente a los componentes "弓土一田一", omitiendo algunos componentes. Entre los métodos de codificación basados en la forma más populares se encuentran Wubi (五笔) en China continental y Cangjie (仓颉) en Taiwán y Hong Kong. [ 6 ]
La característica más importante de la entrada inteligente es la aplicación de restricciones contextuales para la selección de personajes candidatos. Por ejemplo, en Microsoft Pinyin, cuando el usuario escribe el código de entrada "daxuejiaoshou", obtendrá "大学教授 / 大學教授" (profesor universitario), cuando escribe "daxuepiaopiao" la computadora sugerirá "大雪飘飘 / 大雪飄飄" (nieve intensa volando). Aunque las letras Pinyin sin tono de 大学 y 大雪 son ambas "daxue", la computadora puede hacer una selección razonable basándose en las palabras siguientes. [ 7 ]
Codificación de caracteres chinos para el intercambio de información
Dentro del ordenador, cada carácter está representado por un código interno. Cuando un carácter se envía entre dos máquinas, se transmite mediante un código de intercambio de información. Actualmente, los códigos de intercambio de información, como ASCII y Unicode, se utilizan con frecuencia como códigos internos.
El primer estándar de codificación de caracteres chinos GB es GB2312 , publicado por la República Popular China en 1980. Incluye 6763 caracteres chinos, de los cuales 3755 son de uso frecuente y están ordenados por Pinyin , mientras que el resto se ordenan por radicales (componentes de indexación). GB2312 fue diseñado para caracteres chinos simplificados . Los caracteres tradicionales que han sido simplificados no están incluidos. El código de un carácter se representa mediante un número hexadecimal de dos bytes; por ejemplo, los códigos GB de Hong Kong son CFE3 y B8DB, respectivamente. GB2312 todavía se utiliza en algunos ordenadores y en la WWW, aunque se han publicado versiones más recientes con conjuntos de caracteres ampliados, como GB13000.1 y GB18030. [ 8 ] La última versión de la codificación GB es GB18030 , que admite caracteres chinos tanto simplificados como tradicionales y es compatible con el conjunto de caracteres Unicode. [ 9 ]
El estándar de codificación Big5 fue diseñado por cinco grandes empresas de TI en Taiwán a principios de la década de 1980 y, desde entonces, ha sido el estándar de facto para representar el chino tradicional en computadoras. Big5 se usa popularmente en Taiwán, Hong Kong y Macao. El estándar Big5 original incluía 13.053 caracteres chinos, sin caracteres simplificados de China continental. Cada carácter se codifica con un código hexadecimal de dos bytes, por ejemplo, 香 (ADBB), 港 (B4E4), 龍 (C073). Los caracteres chinos en el conjunto de caracteres Big5 están organizados por radicales. Las versiones extendidas de Big5 incluyen Big-5E y Big5-2003, que incluyen algunos caracteres simplificados y caracteres cantoneses de Hong Kong . [ 10 ]
La versión completa del estándar Unicode representa un carácter con un código digital de 4 bytes, lo que proporciona un enorme espacio de codificación para cubrir todos los caracteres de todos los idiomas del mundo. El Plano Multilingüe Básico (BMP) es una versión básica de Unicode de 2 bytes con 2^16 = 65 536 puntos de código para caracteres importantes de muchos idiomas. Hay 27 522 caracteres en el Área de Ideogramas CJKV (China, Japón, Corea y Vietnam), incluidos todos los caracteres chinos simplificados y tradicionales en GB2312 y Big5 tradicionales. En Unicode 15.0, hay un conjunto de caracteres multilingües de 149 813 caracteres, entre los cuales más de 98 682 (aproximadamente 2/3) son chinos ordenados por radicales Kangxi . Incluso están disponibles caracteres de uso muy poco frecuente. Por ejemplo: H (0048) K (004B), 香 (9999), 港 (6E2F), 龍(9F8D), 龙 (9F99), 龖 (9F96), 龘 (9F98), 𪚥 (2A6A5). [ 11 ] [ 12 ]
Unicode se está volviendo cada vez más popular. Se informa que el 98,1 % de todos los sitios web utilizan UTF-8 (Unicode). Existe la creencia generalizada de que Unicode acabará reemplazando a todos los demás códigos de intercambio de información y códigos internos, y que ya no habrá más confusión de códigos. [ 13 ]
Salida de caracteres chinos
Al igual que el inglés y otros idiomas, los caracteres chinos se imprimen en impresoras y pantallas con diferentes fuentes y estilos. Las fuentes chinas más populares son las familias Song (宋体), Kai (楷体), Hei (黑体) y Fangsong (仿宋体). [ 14 ]
Las fuentes aparecen en diferentes tamaños. Además del sistema internacional de medición de puntos , los caracteres chinos también se miden mediante números de tamaño (llamados zihao , 字号) inventados por un estadounidense para la impresión china en 1859. [ 15 ]
Segmentación de palabras
Es sencillo reconocer palabras en textos en inglés porque están separadas por espacios. Sin embargo, las palabras en chino no están separadas por ningún marcador de límite. Por lo tanto, la segmentación de palabras es el primer paso para el análisis de texto en chino. Por ejemplo,
中文信息学报(texto original chino) 中文 信息 学报(texto segmentado por palabras) Revista informativa china (traducción palabra por palabra al inglés) Revista de Procesamiento de Información China (nombre en inglés)
La segmentación de palabras chinas en una computadora se lleva a cabo comparando los caracteres del texto chino con un léxico (lista de palabras chinas) desde el principio de la oración hacia adelante o desde el final hacia atrás. Existen dos tipos de ambigüedades de segmentación: la de tipo intersección (交集型歧义字段) y la de tipo polinomial (多义型歧义字段). [ 16 ]
Normalmente, una ambigüedad de intersección tiene el formato de
ABC, donde A, AB, BC y C son todas palabras del léxico.
Es posible dividir la cadena de caracteres original en la palabra AB seguida de C, o A seguida de BC. Por ejemplo, '美国会' puede significar '美 国会' (el Parlamento de los EE. UU.) o '美国 会' (los EE. UU. pueden/lo harán).
La forma más común de ambigüedad de segmentación polinómica es AB, donde A, B y AB son palabras. Esto significa que la cadena de caracteres puede considerarse una sola palabra o dividirse en dos. Por ejemplo, la cadena '可以' en las siguientes oraciones:
(1) 你 可以 坐下。 Puedes sentarte. Puedes sentarte. (2) 你 可 以 他们 为 样板。 Puedes tomarlos como ejemplo. Puedes tomarlos como ejemplo.
Las ambigüedades en la segmentación de palabras pueden resolverse con información contextual, utilizando reglas lingüísticas y la probabilidad de colocaciones de palabras derivadas de corpus chinos. Generalmente, la coincidencia de palabras más largas es más fiable. La tasa de corrección de la segmentación automática de palabras ha alcanzado el 95 %. [ 17 ] Sin embargo, no habrá garantía de una corrección del 100 % en el futuro previsible, ya que esto implicará una comprensión completa del texto. Una solución alternativa es animar a las personas a escribir de forma segmentada, como en el caso del inglés. [ 18 ] Pero esto no significa que la segmentación de palabras por computadora ya no sea necesaria, porque incluso en inglés, la segmentación de palabras es necesaria para el análisis del habla.
Reconocimiento de nombres propios
Un nombre propio es el nombre de una persona, un lugar, una institución, etc., y se escribe en inglés con la letra inicial de cada palabra en mayúscula; por ejemplo, "Sr. John Nealon", "América" y "Universidad de Cambridge". Sin embargo, los nombres propios chinos generalmente no se marcan de ninguna manera. [ 19 ]
El reconocimiento de nombres de personas y lugares en textos chinos puede facilitarse mediante una lista de nombres. Sin embargo, dicha lista nunca puede ser completa, dada la enorme cantidad de lugares y personas en todo el mundo, sin mencionar su naturaleza dinámica de aparición, cambio y desaparición. Además, existen nombres similares a sustantivos comunes. Por ejemplo, hay una ciudad llamada 民众 (Minzhong) en el sur de China, que también es un sustantivo común que significa "gente". Por lo tanto, el reconocimiento de nombres de personas y lugares debe aprovechar sus características distintivas en la composición interna y el contexto externo. Los corpus con nombres propios anotados también pueden servir como referencia útil. [ 19 ]
Un nombre que no se encuentra en el diccionario puede reconocerse con una lista de apellidos y títulos, por ejemplo "张大方先生",李经理", donde 张 (Zhang) y 李 (Li) son apellidos chinos, y 先生 (Sr.) y 经理 (Gerente) son títulos. En 张大方说, 张大方 puede reconocerse como un nombre de persona por la regla de que un nombre de pila chino normalmente sigue al apellido y consta de 1 o 2 caracteres, y por el hecho de que la gente puede hablar (说).
Los nombres de lugares también tienen características útiles para el reconocimiento informático. Por ejemplo, en "在广东省中山市民众镇", las palabras componentes 省 (provincia), 市 (ciudad) y 镇 (pueblo) son marcadores finales de nombres de lugares, mientras que 在 (en, en, en) es una preposición que aparece con frecuencia delante de una ubicación.
La tasa de acierto del reconocimiento informático ha alcanzado alrededor del 90% para nombres de personas y el 95% para nombres de lugares. [ 17 ]
Véase también
Referencias
Citas
- 1 2 Zhang 2016 , pág. 420.
- ↑ Instituto de Idiomas 2020 .
- ↑ "Estadísticas Unicode" . www.unicode.org . Consultado el 8 de diciembre de 2023 .
- ↑ Su 2014 , p. 218.
- ↑ Comisión Nacional de la Lengua 1997 .
- ↑ Zhang 2016 , pág. 422.
- ↑ Su 2014 , p. 222.
- ↑ Su 2014 , pp. 213–215.
- ^ Lunde, Ken (4 de agosto de 2022). "El estándar GB 18030-2022" . Medio . Consultado el 7 de agosto de 2022 .
- ↑ " [ Chinese mac ] Conjuntos de caracteres" . chinesemac.org . Consultado el 24/11/2023 .
- ↑ "Estadísticas Unicode" .
- ↑ Consorcio Unicode 2023 .
- ↑ "Estadísticas de uso y cuota de mercado de UTF-8 para sitios web, diciembre de 2023" . w3techs.com . Consultado el 8 de diciembre de 2023 .
- ↑ Li 2013 , pág. 62.
- ↑ Zhang 2006 .
- ↑ Liu 2000 , págs. 58–61.
- 1 2 Xu 2006 .
- ↑ Zhang 1998 .
- 1 2 Zhang 2016 , pág. 427.
Obras citadas
- Fromkin, Victoria; Rodman, Robert (1993). Introducción al lenguaje (5.ª ed.). Nueva York: HBJ. ISBN 0-03-075379-1.
- Instituto de Lenguas, Academia China de Ciencias Sociales (2020). Diccionario Xinhua (en chino) (12.ª ed.). Pekín: Commercial Press. ISBN 978-7-100-17093-2.
- Li, Dasui李大遂 (2013). 简明实用汉字学[ Caracteres chinos concisos y prácticos ] (en chino) (3.ª ed.). Pekín: Editorial de la Universidad de Pekín. ISBN 978-7-301-21958-4.
- Liu, Kaiying (刘开瑛) (2000). 中文文本自动分词和标注[ Segmentación y anotación automática de palabras en texto chino ] (en chino). Pekín: Commercial Press. ISBN 7-100-03068-4.
- Comisión Nacional de la Lengua (1997). Estándar de componentes de caracteres chinos del conjunto de caracteres GB13000.1 para el procesamiento de información (PDF) . Pekín: Comisión Nacional de la Lengua de China.
- Su, Peicheng苏培成 (2014). 现代汉字学纲要[ Conceptos básicos de los caracteres chinos modernos ] (en chino) (3ª ed.). Beijing: 商务印书馆 (La Prensa Comercial, Shangwu). ISBN 978-7-100-10440-1.
- Consorcio Unicode (2023). Estándar Unicode, versión 15.1.0 . Mountain View, CA: Consorcio Unicode.
- Xu, Jialu (y Fu Yonghe) (2006). 中文信息处理现代汉语词汇研究[ Estudios morfológicos en el procesamiento de información chino moderno ] (en chino). Guangzhou: 广东教育出版社 (Prensa educativa de Guangdong).
- Zhang, Xiaoheng (1998). "也谈汉语书面语的分词问题 - 分词连写十大好处 ('Segmentación de palabras escritas en chino revisada: diez ventajas de la escritura segmentada de palabras')". Revista de procesamiento de información china . 12 (3): 57-63 .
- Zhang, Xiaoheng (2006). "Los sistemas numéricos, de puntos y métricos de tamaño de fuente (字形的"号制""点制"与"米制")". Ingeniería Informática y Aplicaciones (计算机工程与应用) . 42 (2006) (10): 175–177 y pág. 215.
- Zhang, Xiaoheng (2016). «Lingüística computacional». En La enciclopedia Routledge de la lengua china . Oxfordford: Routledge. pp. 420–437 . ISBN 978-0-415-53970-8.
Revistas y actas
- Revista de Procesamiento de Información China ( http://jcip.cipsc.org.cn/CN/home )
- Revista Internacional de Lingüística Computacional y Procesamiento del Lenguaje Chino (IJCLCLP) ( https://www.aclclp.org.tw/journal/index.php )
- Conferencia Nacional de China sobre Lingüística Computacional China ( https://link.springer.com/conference/cncl )
- Actas de Rocling ( https://www.aclclp.org.tw/pub_proce.php )
- Lingüística computacional
- idioma chino
- Informática en idioma chino