El conjunto de caracteres CNS 11643 (Estándar Nacional Chino 11643), también conocido oficialmente como Código de Intercambio Estándar Chino o CSIC [ 1 ] ( chino :中文標準交換碼), es oficialmente el conjunto de caracteres estándar de Taiwán (República de China). Las ediciones publicadas y los borradores de CNS 11643 siguen siendo los estándares fuente para los glifos de referencia Unicode para los ideogramas unificados CJK presentados para su uso en Taiwán, [ 2 ] y el repertorio de caracteres de CNS 11643 continúa actualizándose y utilizándose con fines administrativos en Taiwán. [ 3 ]
EUC-TW es una representación codificada de CNS 11643 y ASCII en formato de Código Unix Extendido (EUC). En la práctica, las variantes del conjunto de caracteres Big5 , estrechamente relacionadas con los dos primeros planos de CNS 11643, sirvieron como codificación estándar de facto para el chino tradicional antes de la introducción de Unicode. Otras codificaciones capaces de representar ciertos planos CSIC incluyen ISO-2022-CN (planos 1 y 2) e ISO-2022-CN-EXT (planos 1 a 7).
Estructura
CNS 11643 está diseñado para cumplir con ISO 2022 , aunque solo los primeros siete planos de 94×94 caracteres tienen registros ISO-IR . El número total de planos ha variado con revisiones sucesivas del estándar; los borradores pendientes más recientes tienen 19 planos, [ 2 ] por lo que el número máximo posible de caracteres codificables en todos los planos es 19×94×94 = 167884. Los planos 1 a 7 están definidos por el estándar; desde 2007, los planos 10 a 15 también han sido definidos por el estándar. [ 4 ] : 115–122 Antes de esto, los planos 12 a 15 (35344 puntos de código) fueron designados específicamente para caracteres definidos por el usuario. A diferencia de CCCII , la codificación de caracteres variantes en CNS 11643 no está relacionada.
Historia
La primera edición del estándar se publicó en 1986 e incluía los planos 1 y 2, derivados de los niveles 1 y 2 de Big5 , con algunas reordenaciones debido a la corrección del número de trazos, la omisión de dos caracteres duplicados y la adición de 213 radicales clásicos en el plano 1 (de los 214 radicales Kangxi , de los cuales 210 son efectivamente duplicados de caracteres Big5 existentes y los tres restantes de caracteres HKSCS ; [ 5 ] véase también Radicales Kangxi (bloque Unicode) ). Posteriormente se publicaron extensiones del estándar en 1988 (6319 caracteres, que ocupan el plano 14) y 1990 (7169 caracteres, que ocupan el plano 15). [ 4 ] : 115–122
Unicode 1.0.0, aunque aún no incluía caracteres chinos (hanzi) , sí incluía caracteres para la compatibilidad con CNS 11643: el bloque de Formas de Compatibilidad CJK se titulaba "Compatibilidad con CNS 11643" en Unicode 1.0.0. [ 6 ] Cuando se estaba compilando el conjunto de Ideogramas Unificados CJK de Unicode para Unicode 1.0.1, los organismos nacionales presentaron conjuntos de caracteres al Grupo Conjunto de Investigación CJK para su inclusión. La versión de CNS 11643 presentada incluía la extensión del plano 14, además de otros caracteres deseados añadidos al plano 14 (después de 68-21, el último punto de código utilizado en la versión estándar de la extensión). [ 4 ] : 179-180
En la segunda edición del estándar, publicada en 1992, se definió una colección mucho mayor de caracteres chinos (hanzi) en siete planos. La mayor parte de la extensión del plano 14 de 1988, que comprende los 6148 puntos de código del 01-01 al 66-38, se adoptó como plano 3 (mientras que los 171 caracteres restantes, puntos de código del 66-39 al 68-21, se distribuyeron en el plano 4). La extensión del plano 15 no se incluyó, aunque 338 de sus caracteres se incluyeron en los planos 4 al 7. [ 4 ] : 115–122
La tercera edición del estándar, publicada en 2007, añadió el símbolo del euro , el cero ideográfico, el kana y extensiones al soporte existente para el bopomofo y el alfabeto romano en el plano 1. Introdujo los planos 10 a 14, que contienen hanzi adicionales, e incorporó la extensión existente del plano 15 en el propio estándar (dejando huecos donde los caracteres ya existían en los planos 4 a 7). También añadió 128 hanzi más al plano 3, a partir del punto de código 68–40, [ 4 ] : 115–122 basado en las adiciones a la versión del plano 14 de 1988 que se había presentado para su inclusión en Unicode.
Numeración de aviones
Propósito actual y relación con Unicode
El repertorio CNS 11643 incluye caracteres utilizados para fines administrativos en Taiwán, incluyendo el registro de hogares y tarjetas de identificación , [ 3 ] además de caracteres utilizados en la educación. [ 11 ] En particular, los caracteres en los planos 1 y 2 se utilizan en la educación. [ 12 ] Solo los caracteres utilizados en la educación están sujetos a la normalización de la forma del glifo en CNS 11643. [ 11 ] Continúa expandiéndose, con planos adicionales numerados hasta 19 que han sido redactados, pero aún no publicados como parte de una edición de CNS 11643. [ 2 ] Una enmienda de 2022 a la edición de 2007 agregó U+7934礴CJK UNIFIED IDEOGRAPH-7934 al final del plano 2 y corrigió varias formas de glifos en los planos 1 y 2. [ 12 ]
Aunque las ediciones de 1992 y 2007 de CNS 11643, además de borradores de trabajo más recientes, sirven como fuentes Unihan para glifos de referencia para ideogramas unificados CJK presentados para su uso en Taiwán, [ 2 ] aún queda, a partir de 2017, varios miles de caracteres CNS 11643 sin un carácter Unicode correspondiente, o que no pasan por Unicode en ambos sentidos, principalmente en los planos 10 a 14. Estos se asignan al Área de Uso Privado Suplementario de Unicode . [ 13 ]
En algunos casos, dos o más caracteres CNS 11643 corresponden a un único ideograma unificado CJK de Unicode . Estos casos (excepto cuando están cubiertos por el bloque Suplemento de ideogramas de compatibilidad CJK ) se asignan actualmente a puntos de código del Área de uso privado suplementaria de Unicode, [ 11 ] pero la Asociación de Computación de Taipéi, que participa en el Grupo de Investigación Ideográfica , ha estado evaluando la viabilidad de registrarlos como Secuencias de variación ideográfica en algún momento futuro. [ 11 ] [ 14 ]
Relación con las Cinco Grandes
Los niveles 1 y 2 de la codificación Big5 corresponden principalmente a los planos 1 y 2 de CNS 11643, respectivamente, con diferencias ocasionales en el orden y con dos hanzi duplicados que existen en Big5 pero no en CNS 11643. Se pueden mapear usando una lista de rangos. [ 15 ] [ 16 ] Sin embargo, los 213 radicales clásicos en el plano 1 de CNS 11643 son adicionales a los caracteres disponibles en Big5 (aunque se pueden mapear con pérdida a los caracteres hanzi correspondientes en Big5 o HKSCS), [ 5 ] y se agregaron más caracteres adicionales al plano 1 de CNS 11643 en 2007. [ 4 ] : 115–122 La variante Big5-2003 de Big5 se define como una codificación parcial de CNS 11643.
Dentro del repertorio de hanzi Big5, solo un carácter del plano 1 se asigna convencionalmente a Unicode de manera diferente del carácter correspondiente de los dos primeros planos CNS 11643: a U+5F5D (彝), mientras que su contraparte del plano 1 de CNS se asigna a una variante relacionada en U+5F5E (彞); [ 17 ] U+5F5D se incluye por separado en el plano 3 de CNS 11643. [ 5 ] Sin embargo, algunas asignaciones de variantes para Big5, como algunas definidas por IBM , incluyen U+5F5E en lugar de U+5F5D. [ 18 ] De manera similar, un solo carácter del nivel 2 de Big5 (incluida su variante de IBM) [ 19 ] se asigna a un punto de código Unicode diferente al de su contraparte del plano 2 de CNS 11643: a U+5284 (劄), mientras que la base de datos Unihan actualmente asigna el carácter CNS 11643 a U+7B9A (箚); U+5284 aparece en el plano 14 del CNS 11643. [ 5 ]
Referencias
- Esta página se basa en la información del sitio web oficial del SNC .
- ↑ ECMA (21-01-1993). Código de Intercambio Estándar Chino (CSIC) - Conjunto 1 (PDF) . ITSCJ/ IPSJ . ISO-IR -171.
- 1 2 3 4 5 Lunde, Ken ; Cook, Richard (2024-07-31). "kIRG_TSource" . Base de datos Unicode Han (Unihan) (Anexo estándar Unicode). Revisión 37. Consorcio Unicode . UAX #38.
- 1 2 "Presentación de TCA para el conjunto de trabajo IRG 2021 de extensión CJK" (PDF) . 2021-05-07. ISO/IEC JTC1 / SC2 /WG2/ IRG N2486.
- 1 2 3 4 5 6 Lunde, Ken (2008). "3. Estándares de conjuntos de caracteres". Procesamiento de información CJKV (2.ª ed.). O'Reilly Media . ISBN 9780596514471.
- 1 2 3 4 Lunde, Ken (30-11-2022). "Propuesta para mejorar la propiedad provisional kBigFive" (PDF) . UTC L2/22-288.
- ↑ "3.8: Tablas bloque por bloque" (PDF) . El estándar Unicode . Versión 1.0. Consorcio Unicode .
- ↑ "IBM-964_P110-1999" . Repositorio de datos de la UCI . IBM / Consorcio Unicode . 2009 [1999].
- ↑ Viswanadha, Raghuram (2003) [2000-08-30]. "CNS-11643-1992" . Componentes internacionales para Unicode . IBM / Consorcio Unicode .
- ↑ "EUC-TW-2014: Actualización de EUC-TW basada en IBM-964" . Componentes internacionales para Unicode . IBM / Consorcio Unicode . 2014.
- ↑ p. ej. "Datos de Unihan para U+2E83A" , Búsqueda en la base de datos de Unihan , Consorcio Unicodetiene la referencia de origen
T3-6734, es decir, el punto de código del plano 371-20. - 1 2 3 4 "4. Acerca de la normalización de glifos" (PDF) . Respuesta a los problemas de normalización y significado de los caracteres TCA en WS2021 . 14 de marzo de 2022. págs. 3–5 . ISO/IEC JTC1 / SC2 /WG2/ IRG N2546.
- 1 2 "Corrección de glifos de fuente T y extensión horizontal" (PDF) . 18-10-2022. ISO/IEC JTC1 / SC2 /WG2/ IRG N2580.
- ↑ "CNS 11643 en el Área de Uso Privado Suplementario de Unicode" . [chino mac] . Consejo de Estudios de Asia Oriental de la Universidad de Yale.
- ↑ Asociación de Computación de Taipéi (10 de septiembre de 2021). "Informe de actividad de la TCA" (PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N2502.
- ↑ Lunde, Ken (1995-12-18). "4.3: Problemas de compatibilidad del conjunto de caracteres CJK - Chino (Taiwán)". CJK.INF Versión 1.9 .
- ↑ Zhu, HF.; Hu, DY.; Wang, ZG.; Kao, TC.; Chang, WCH.; Crispin, M. (1996). "RFC 1922: Codificación de caracteres chinos para mensajes de Internet" . Solicitudes de comentarios . IETF .
- ↑ Lunde, Ken (15 de febrero de 2018). "Explorando IICore—Parte 4" . Blog de CJK Type . Adobe Inc.
- ↑ "ibm-950_P110-1999 (byte inicial 0xC2)" . Componentes internacionales para Unicode Converter Explorer . Consorcio Unicode . Archivado del original el 12 de julio de 2021.
- ↑ "ibm-950_P110-1999.ucm" . Repositorio de datos de la UCI . IBM / Consorcio Unicode . 2007.
<U5284> \xE3\x5A |0
Enlaces externos
- Sitio web oficial de CNS 11643
- Datos abiertos actuales de CNS 11643 , incluidos los datos de mapeo.
- Mapeos del Consorcio Unicode para CNS 11643-1986 : planos 1 y 2, más el plano 14 de 1988 (no el plano 14 de 2007) con extensiones. Utiliza un único dígito hexadecimal con prefijo para indicar el plano.
- Mapeos CNS 11643 de Componentes Internacionales para Unicode (ICU):
- "CNS-11643-1992": versión original , versión actual . La versión original del mapeo incluye los planos estándar 1 a 7, pero incluye la disposición del plano 15 como plano 9; la versión actual incluye solo los planos 1 y 2. Utiliza los prefijos 0x81 a 0x89 para indicar el plano.
- "EUC-TW-2014" : asignaciones estándar para los planos 1 a 7 y 15, y asignaciones corporativas de IBM en los planos 12 y 13. Códigos CNS en formato EUC con plano 1 de dos bytes.
- Tablas de códigos CNS-11643 registradas según ISO-IR : plano 1 , plano 2 , plano 3 , plano 4 , plano 5 , plano 6 , plano 7
- Codificaciones de caracteres chinos