La tecnología de la información para caracteres chinos , o simplemente TI para caracteres chinos, es la tecnología de la información para el procesamiento informático de caracteres chinos . Mientras que el sistema de escritura inglés utiliza unas pocas docenas de caracteres diferentes, el idioma chino necesita un conjunto de caracteres mucho mayor. Hay más de diez mil caracteres en el Diccionario Xinhua . [ 1 ] En el conjunto de caracteres multilingüe Unicode de 149.813 caracteres, 98.682 (aproximadamente dos tercios) son chinos. [ 2 ] Esto significa que el procesamiento informático de caracteres chinos es el más difícil entre todos los idiomas.
El chino enfrenta problemas especiales en comparación con otros idiomas, incluyendo la tecnología de entrada de datos en computadoras, la codificación interna y la salida de caracteres chinos. [ 3 ]
Entrada de caracteres
Introducir caracteres chinos en un ordenador no es ni mucho menos tan fácil como introducirlos en inglés. El inglés se escribe con 26 letras y un puñado de otros caracteres, y cada carácter se asigna a una tecla del teclado. El chino se puede introducir de forma similar. Sin embargo, eso requeriría un teclado enorme con al menos miles de teclas. Buscar un carácter en el teclado sería una tarea titánica. [ 4 ]
La gente intentó "reducir" el teclado chino colocando varios caracteres en una sola tecla. Eso convirtió el procedimiento original de entrada de un solo paso en dos pasos para el escritor:
- pulsando la tecla del grupo de caracteres del personaje objetivo,
- seleccionar el personaje objetivo en el grupo.
El teclado resultante seguía siendo torpe, ya que si se colocaban varios caracteres en una tecla, esta se agrandaba para que los caracteres fueran reconocibles, y seleccionar un carácter de un grupo grande resultaba difícil. Además, no era fácil agrupar los caracteres de manera uniforme de forma razonable y fácil de aprender. Otro inconveniente de un teclado chino para la introducción directa de caracteres completos era su inconsistencia con la introducción en inglés. [ 5 ]
Una alternativa consiste en codificar cada carácter chino en caracteres ingleses, lo que permite introducir caracteres chinos en un teclado inglés. De hecho, este método se ha vuelto predominante para la introducción de caracteres chinos en ordenadores. El software de un método de codificación incluye una tabla de códigos de caracteres (码表;碼表; mǎbiǎo ). Al teclear un código ASCII en el teclado inglés, el software busca caracteres chinos coincidentes en la tabla. Si hay varios caracteres con el mismo código, se muestran al usuario para su selección. Para facilitar el aprendizaje del método de entrada, la codificación debe basarse en características distintivas de la forma, el sonido o el significado de los caracteres chinos. Dado que el significado de los caracteres tiende a ser más abstracto y complejo, la codificación de entrada se basa normalmente en el sonido o la forma. [ 5 ]
Codificaciones basadas en sonido
La codificación basada en sonido normalmente se basa en un esquema de caracteres latinos existente para la fonética china, como pinyin para Putonghua (mandarín) y Jyutping para cantonés. El código de entrada de un carácter chino es su cadena de letras pinyin seguida de un número opcional que representa el tono. Por ejemplo, el código de entrada pinyin de Putonghua de香港(Hong Kong) es xianggang o xiang1gang3 , y el código Jyutping de cantonés es hoenggong o hoeng1gong2 , todos los cuales se pueden ingresar fácilmente a través de un teclado en inglés. En el pinyin de Putonghua, hay dos letras que no aparecen en el teclado en inglés: ê y ü. Según el estándar nacional, [ 6 ] ê debe representarse como 'ea', y ü como 'v' en el código de entrada pinyin. En algunos programas de entrada de chino, ê también se representa como 'e^', y ü como 'u:' o 'uu'. Entre los métodos de entrada de texto basados en sonido más populares en China se encuentran Microsoft Pinyin, Sogou Pinyin, Google Pinyin y Jyutping en China continental y Hong Kong, y bopomofo en Taiwán.
La codificación basada en sonido presenta varias ventajas:
- Es fácil de aprender porque la mayoría de los escritores chinos ya dominan bien el Putonghua y el pinyin.
- En consonancia con el aprendizaje del idioma chino.
- Permite introducir caracteres chinos simplificados y tradicionales de forma similar.
- Permite escribir en chino e inglés con el mismo teclado.
Las deficiencias de la codificación basada en sonido radican en su alto grado de codificación duplicada, ya que los caracteres chinos homófonos comparten el mismo código. Un carácter chino normalmente se pronuncia con una sílaba. El mandarín (Putonghua) solo tiene alrededor de 400 sílabas diferentes sin considerar los tonos, o aproximadamente 1200 sílabas cuando se consideran los tonos. Por otro lado, existen decenas de miles de caracteres chinos. Esto significa que, en promedio, cada sílaba debe abarcar más de 10 caracteres. Este problema se puede resolver en gran medida ingresando el chino palabra por palabra en lugar de carácter por carácter, ya que la mayoría de las palabras en chino moderno constan de más de un carácter y la codificación duplicada es mucho menos frecuente a nivel de palabra. Por ejemplo, el pinyin de 香港 (Hong Kong) es único para la palabra, mientras que los caracteres 香 o 港 comparten su pronunciación con muchos otros caracteres. Otra limitación de la entrada de chino basada en sonido es que se debe conocer la pronunciación de un carácter chino antes de poder ingresarlo en la computadora. Este problema se puede resolver mediante la codificación basada en la forma. [ 7 ]
Codificaciones basadas en la forma
Un carácter chino puede introducirse alternativamente según su forma y estructura. La mayoría de los caracteres chinos se pueden dividir en una secuencia de componentes, cada uno de los cuales, a su vez, está compuesto por una secuencia de trazos en orden de escritura. Por ejemplo, el carácter福('buena fortuna', 'felicidad') se puede descomponer como
Componentes: 礻, 一, 口, 田
Trazos: 丶㇇丨丶, 一, 丨𠃍一, 丨𠃍一丨一Hay unos cientos de componentes básicos, [ 8 ] muchos menos que el número de caracteres. Al representar cada componente con una letra inglesa y colocarlos en el orden de escritura del carácter, el creador del método de entrada puede obtener una cadena de letras lista para ser utilizada como código de entrada en el teclado inglés. Por supuesto, el creador también puede diseñar una regla para seleccionar letras representativas de la cadena si es demasiado larga. Por ejemplo, en el método de entrada Cangjie , el carácter 疆 ('borde') se codifica como "NGMWM" correspondiente a los componentes "弓土一田一", con algunos componentes omitidos.
La codificación basada en trazos es más simple que la codificación basada en componentes. Pero los códigos tienden a ser más largos. Hay aproximadamente 30 a 40 trazos distintivos de caracteres chinos. [ 9 ] Por lo general, se clasifican en cinco categorías de heng (一), shu (丨), pie (丿), dian (丶) y zhe (𠃍) para la consulta de diccionarios y la entrada de chino en un teléfono móvil. Para la entrada de chino con un teclado ASCII, 2 trazos se pueden combinar para formar 5*5=25 pares diferentes para mapear a las letras inglesas. Por ejemplo, en el método de entrada ZYQ, [ 10 ] la secuencia de pares de trazos '一一, 一丨, 一丿, ..., 𠃍丿, 𠃍丶, 𠃍𠃍' se representan por 'a, b, c, ..., w, x, y' respectivamente. Entre los métodos de codificación basados en formas más populares se encuentran Wubi en China continental y Cangjie en Taiwán y Hong Kong. [ 11 ]
Las ventajas y desventajas de los métodos de entrada basados en la forma son complementarias a las de los métodos basados en el sonido. La principal ventaja de los métodos basados en la forma radica en su bajo grado de codificación duplicada, lo que permite una entrada de caracteres chinos de alta velocidad. Su principal inconveniente es la dificultad de aprendizaje. Normalmente, los estudiantes deben recordar más de cien componentes y sus correspondientes letras en inglés. Además, deben aprender las complejas reglas para descomponer un carácter en una secuencia de componentes y seleccionar entre ellos. [ 12 ]
Reconocimiento óptico de caracteres
Los caracteres chinos también se pueden introducir en el ordenador mediante reconocimiento óptico de caracteres (OCR), reconocimiento de escritura a mano y reconocimiento de voz , basados en tecnología similar a la del inglés. [ 13 ] En comparación con el inglés, el OCR y el reconocimiento de escritura a mano en chino son más difíciles, porque existen miles de caracteres diferentes de uso común en lugar de 26 letras. En general, el reconocimiento de caracteres impresos es más preciso que el de caracteres manuscritos porque sus formas están más estandarizadas. Existen herramientas OCR para diferentes fuentes, incluidas las populares Song, Kai y Hei. En comparación con la escritura a mano sin conexión, el reconocimiento de escritura a mano en línea es más eficiente, porque el ordenador no solo "ve" el carácter escrito, sino también el procedimiento para escribirlo. [ 14 ]
Reconocimiento de voz
El reconocimiento de voz convierte una señal de voz continua en una secuencia de palabras. Existen dos problemas: la variación en la pronunciación de las palabras por diferentes hablantes y la existencia de homófonos como «pair», «pear» y «pare» en inglés, y 攻势, 公式, 公示 (gong1shi4) en chino. El reconocimiento de voz se basa en métodos estadísticos de corpus y reglas lingüísticas. Una característica útil del chino es que cada carácter se pronuncia con una sílaba. [ 14 ]
Tanto el reconocimiento de caracteres chinos como el reconocimiento de voz han alcanzado un nivel de aplicación. Sin embargo, ninguno puede garantizar una precisión del 100 % sin la revisión humana o la selección de caracteres en línea. [ 14 ]
Motores de entrada inteligentes
La característica más importante de la entrada inteligente es la aplicación de restricciones contextuales para la selección de caracteres candidatos. Por ejemplo, en Microsoft Pinyin, cuando el usuario escribe el código de entrada "daxuejiaoshou", obtendrá 大学教授 (Profesor Universitario), cuando escribe "daxuepiaopiao", la computadora sugiere 大雪飘飘 (Nevando intensamente). Aunque las letras pinyin sin diacríticos de 大学 y 大雪 son ambas "daxue", la computadora puede hacer una selección razonable basándose en las palabras subsiguientes. [ 15 ]
La entrada inteligente de caracteres chinos también utiliza información de corpus y reglas lingüísticas. La selección que hace el ordenador entre caracteres chinos ambiguos no siempre es correcta, y se requiere una mayor mejora. [ 15 ]
Otra información
En el sistema de escritura chino , existen grafemas además de los caracteres chinos completos, como signos de puntuación (por ejemplo, '。', '、' y '《》'), trazos (por ejemplo, '丿', '𠃍' y '乚'), radicales (por ejemplo, '氵', '宀' y '刂') y letras utilizadas para la romanización, como las vocales con diacríticos utilizadas en el pinyin y la romanización Yale del cantonés (por ejemplo, 'ā', 'á', 'ǎ', 'à').
Existen herramientas disponibles en Microsoft Windows, Office y la web que nos permitirán introducir casi todos estos caracteres auxiliares chinos, desde la introducción de signos de puntuación en métodos generales de entrada de chino, hasta la introducción de pinyin diacrítico con teclados virtuales, la introducción de trazos y radicales desde el sitio web de Unicode y mediante la conversión de caracteres Unicode, así como la aplicación de herramientas especiales en la web para introducir pinyin y otros caracteres. Puede encontrar más información sobre la introducción de caracteres no logogramas en el artículo [ 16 ] , que incluye una lista de 280 caracteres no logogramas no ASCII, cada uno anotado con su punto de código Unicode y el código de entrada diseñado por el autor. También es posible introducir un carácter en Microsoft Word escribiendo su punto de código Unicode y pulsando las teclas Alt+X.
Codificación de caracteres chinos para el intercambio de información
Dentro de la computadora, cada carácter se representa mediante un código interno. Cuando un carácter se envía entre dos máquinas, se utiliza un código de intercambio de información. Actualmente, los códigos de intercambio de información, como ASCII y Unicode, se emplean con frecuencia como códigos internos. Las siguientes secciones presentarán los estándares de codificación más importantes utilizados en la tecnología de la información china, incluyendo GB , Big5 y Unicode .
Gran Bretaña
GB significa Guobiao , "Guojia Biaozhun" (国家标准, o 'estándar nacional') en Putonghua , y es el prefijo de los números de referencia de los estándares oficiales emitidos por la República Popular China .
El primer estándar de codificación de caracteres chinos GB es GB 2312 , publicado en 1980. Incluye 6763 caracteres chinos, de los cuales 3755 son de uso frecuente y están ordenados por Pinyin , mientras que el resto se ordenan por radicales (componentes de indexación). GB2312 fue diseñado para caracteres chinos simplificados . Los caracteres tradicionales que han sido simplificados no están incluidos. El código de un carácter se representa mediante un número hexadecimal de dos bytes; por ejemplo, los códigos GB de香港(Hong Kong) son CFE3 y B8DB, respectivamente. GB2312 todavía se utiliza en algunos ordenadores y en la WWW, aunque se han publicado versiones más recientes con conjuntos de caracteres ampliados, como GB13000.1 y GB18030. [ 17 ]
La última versión de la codificación GB es GB18030 . GB18030 admite caracteres chinos simplificados y tradicionales, y es consistente con el conjunto de caracteres de Unicode. [ 18 ]
Los cinco grandes
La codificación Big5 fue diseñada por cinco grandes empresas de TI en Taiwán a principios de la década de 1980 y, desde entonces, ha sido el estándar de facto para representar el chino tradicional en computadoras. Big5 se usa popularmente en Taiwán, Hong Kong y Macao. El estándar Big5 original incluía 13.053 caracteres chinos, sin caracteres simplificados de China continental. Cada carácter se codifica con un código hexadecimal de dos bytes, por ejemplo, 香 (ADBB), 港 (B4E4), 龍 (C073). Los caracteres chinos en el conjunto de caracteres Big5 están organizados por radicales. Las versiones extendidas de Big5 incluyen Big-5E y Big5-2003, que incluyen algunos caracteres simplificados y caracteres cantoneses de Hong Kong. [ 19 ]
Unicode
Unicode es el estándar internacional más influyente para la codificación de caracteres multilingües. Es consistente con (o prácticamente equivalente a) el estándar ISO/IEC 10646. La versión completa de Unicode representa un carácter con un código digital de 4 bytes, lo que proporciona un enorme espacio de codificación para cubrir todos los caracteres de todos los idiomas del mundo. El Plano Multilingüe Básico (BMP) es una versión de núcleo de Unicode de 2 bytes con 2^16 = 65 536 puntos de código para caracteres importantes de muchos idiomas. Hay 27 522 caracteres en el Área de Ideogramas CJKV (China, Japón, Corea y Vietnam), incluidos todos los caracteres chinos simplificados y tradicionales en GB2312 y Big5 tradicional. [ 20 ]
En Unicode 15.0, existe un conjunto de caracteres multilingüe de 149.813 caracteres, entre los cuales 98.682, aproximadamente dos tercios, son chinos ordenados por radicales Kangxi . Incluso están disponibles caracteres de uso muy poco frecuente. A continuación se muestran algunos ejemplos de caracteres con su Unicode entre paréntesis: H (0048), K (004B), 香 (9999), 港 (6E2F), 龍 (9F8D), 龙 (9F99), 龖 (9F96), 龘 (9F98), 𪚥 (2A6A5). [ 21 ]
Los 5009 caracteres del Conjunto de Caracteres Suplementarios de Hong Kong ( HKSCS ) [ 22 ] están incluidos en Unicode. El HKSCS fue desarrollado por el gobierno de Hong Kong como una colección de caracteres chinos específicos de la región que no estaban disponibles en las computadoras en sus inicios, por ejemplo 咗 (ya), 嘢 (cosa), 脷 (lengua) y 曱甴 (cucaracha).
Dado que GB, Big5 y Unicode se utilizan simultáneamente en la codificación china, cuando el ordenador interpreta erróneamente un texto con un estándar de codificación distinto al original, se mostrarán caracteres incorrectos. Este fenómeno, conocido como "luànmǎ" (confusión de códigos), suele ocurrir en la web o en los correos electrónicos. Este problema se soluciona a menudo seleccionando manualmente la codificación o el conjunto de caracteres (como en los navegadores web) o mediante la conversión previa del código.
Unicode se está volviendo cada vez más popular. Se informa que el 98,1 % de todos los sitios web utilizan UTF-8 (Unicode). Existe la creencia generalizada de que Unicode acabará reemplazando a todos los demás códigos de intercambio de información y códigos internos, y que ya no habrá más confusión de códigos. [ 23 ]
Producción
Tipografías
Al igual que el inglés y otros idiomas, los caracteres chinos se imprimen en impresoras y pantallas con diferentes fuentes y estilos. Las fuentes chinas más populares son las familias Song (宋体), Kai (楷体), Hei (黑体) y Fangsong (仿宋体). [ 24 ]


Tamaño de fuente
Las fuentes aparecen en diferentes tamaños. Además del sistema internacional de medición de puntos , los caracteres chinos también se miden mediante números de tamaño (llamados zihao , 字号), inventados por un estadounidense para la impresión china en 1859. La siguiente tabla enumera todos los tamaños de fuente de uso común en números y sus equivalentes en puntos estadounidenses disponibles en la versión china de Microsoft Word , lo cual resulta particularmente útil para la composición tipográfica en chino en ordenadores que no admiten tamaños de fuente en números. [ 25 ]
La imagen de un carácter chino en una fuente particular se representa en la computadora mediante una matriz de puntos (llamada fuente de matriz de puntos o fuente de mapa de bits ) o mediante contornos (llamada fuente de contorno ), de nuevo como en el caso del inglés. [ 13 ]
Véase también
Referencias
Citas
- ↑ Instituto de Idiomas 2020 .
- ↑ "Estadísticas Unicode" .
- ^ Fu 1999 , págs. 5-232.
- ↑ Su 2014 , p. 218.
- 1 2 Zhang 2016 , pág. 421.
- ↑ Comisión Nacional de Idiomas de China 2001 .
- ↑ Li 2013 , pág. 333.
- ↑ Comisión Nacional de Idiomas de China 1997 .
- ↑ "CJK Strokes" (PDF) .
- ↑ Zhang 2003 .
- ↑ Zhang 2016 , pág. 422.
- ^ Li 2013 , págs. 333–334.
- 1 2 Blanco 2008 .
- 1 2 3 Su 2014 , p. 225.
- 1 2 Su 2014 , p. 222.
- ↑ Zhang 2012 .
- ↑ Su 2014 , pp. 213–215.
- ^ Lunde, Ken (4 de agosto de 2022). "El estándar GB 18030-2022" . Medio . Consultado el 7 de agosto de 2022 .
- ↑ " [ Chinese mac ] Conjuntos de caracteres" . chinesemac.org . Consultado el 24/11/2023 .
- ↑ Consorcio Unicode 2023 .
- ↑ "Estadísticas Unicode" .
- ↑ "OGCIO : Conjunto de caracteres suplementarios de Hong Kong (HKSCS)" .
- ↑ "Estadísticas de uso y cuota de mercado de UTF-8 para sitios web, marzo de 2024" .
- ↑ Li 2013 , pág. 62.
- ↑ Zhang 2006 .
Obras citadas
- Fu Yonghe (傅永和) (1999). 中文信息处理[ Procesamiento de información en chino ] (en chino) (3.ª ed.). Guangzhou: Guangdong Education Press. ISBN 978-7-540-64080-4.
- Instituto de Lenguas, Academia China de Ciencias Sociales, ed. (2020). 新华字典[ Diccionario Xinhua ] (en chino) (12.ª ed.). Pekín: The Commercial Press. ISBN 978-7-100-17093-2.
- Li Dasui (李大遂) (2013). 简明实用汉字学[ Caracteres chinos concisos y prácticos ] (en chino) (3.ª ed.). Pekín: Editorial de la Universidad de Pekín. ISBN 978-7-301-21958-4.
- Mullaney, Thomas S. (2024). La computadora china: una historia global de la era de la información . Cambridge, MA: MIT Press. ISBN 978-0-262-04751-7.
- Estándar de componentes de caracteres chinos del conjunto de caracteres GB13000.1 para el procesamiento de información (PDF) . Pekín: Comisión Nacional de Idiomas de China. 1997.
- 汉语拼音方案的通用键盘表示规范[ Estándar para el esquema de entrada del alfabeto fonético chino con teclado universal ] (en chino). Pekín: Comisión Nacional de Idiomas de China. 2001.
- Su Peicheng (苏培成) (2014). 现代汉字学纲要[ Fundamentos de los caracteres chinos modernos ] (en chino) (3.ª ed.). Pekín: The Commercial Press. ISBN 978-7-100-10440-1.
- Estándar Unicode, versión 15.1.0 . South San Francisco, CA: Consorcio Unicode. 2023.
- White, R. (2008). Cómo funcionan las computadoras (9.ª ed.). Indianápolis, IN: QUE.
- Zhang, Xiaoheng (2003). 正易全: 一个动态结构笔组汉字编码输入法[ Hacia la corrección, la facilidad y la exhaustividad: Creación de un método de entrada de codificación de caracteres chinos basado en grupos de trazos estructurados dinámicos ] . Revista de Procesamiento de Información China . 17 (3): 59– 65.
- Zhang, Xiaoheng (2006). "Los sistemas numérico, de puntos y métrico del tamaño de fuente"字形的"号制""点制"与"米制"Ingeniería Informática y Aplicaciones计算机工程与应用(en chino). 42 (10): 175– 177, 215.
- Zhang, Xiaoheng (2012). "Entrada de caracteres chinos no ASCII ni Hanzi en computadora" . Revista de modernización de la enseñanza del idioma chino . 1 (2): 18– 36.
- Zhang, Xiaoheng (2016). «Lingüística computacional». En La enciclopedia Routledge de la lengua china . Oxford: Routledge. pp. 420–437 . ISBN 978-0-415-53970-8.
- Lingüística computacional
- caracteres chinos
- Informática en idioma chino