El Código de caracteres chinos para el intercambio de información ( chino :中文資訊交換碼) o CCCII es un conjunto de caracteres desarrollado por el Grupo de análisis de caracteres chinos en Taiwán . Se publicó por primera vez en 1980 y se amplió significativamente en 1982 y 1987. [1]
Se utiliza principalmente en sistemas de bibliotecas . [2] [3] Es una de las codificaciones más antiguas y sofisticadas para el chino tradicional (anterior al establecimiento de Big5 en 1984 y CNS 11643 en 1986). [2] Se distingue por su sistema único para codificar versiones simplificadas y otras variantes de su conjunto principal de caracteres hanzi . [1]
La Biblioteca del Congreso utiliza una variante de una versión anterior de CCCII como parte de MARC-8 , bajo el nombre de Código de caracteres de Asia Oriental ( EACC , ANSI/NISO Z39.64), [4] donde comprende parte del soporte JACKPHY de MARC 21. Sin embargo, EACC contiene menos caracteres que las versiones más recientes de CCCII. [5] [1] El trabajo en Apple basado en el Tesauro CJK de Research Libraries Group , que se utilizó para mantener EACC, fue uno de los predecesores directos del conjunto Unihan de Unicode . [6]
Diseño

Rangos de bytes
CCCII está diseñado como un conjunto de 94 n , según lo definido por ISO/IEC 2022. [ 1] Cada carácter chino está representado por un código de 3 bytes en el que cada byte es de 7 bits, entre 0x 21 y 0x7E inclusive. Por lo tanto, el número máximo de caracteres chinos representables en CCCII es 94×94×94 = 830584. En la práctica, el número de caracteres codificables por CCCII sería menor que este número, porque los caracteres variantes se codifican en planos ISO 2022 relacionados bajo CCCII, por lo que la mayoría de los puntos de código tendrían que reservarse para variantes.
En la práctica, sin embargo, a veces se utilizan bytes fuera de estos rangos. El código 0x212320 es utilizado por algunas implementaciones como un espacio ideográfico . [8] Una especificación CCCII utilizada por bibliotecas en Hong Kong utiliza códigos que comienzan con 0x2120 para puntuación y símbolos. [9] El primer byte 0x7F es utilizado por algunas variantes para codificar códigos para algunos hanzi de Repertorio y Ordenamiento Unificado o Extensión A de Ideógrafos Unificados CJK que de otra manera no estarían disponibles (por ejemplo, 0x7F3449 para U+3449 o 0x7F796E para U+796E; [9] observe cómo los bytes de continuación coinciden con el código UCS-2BE ), y esto puede incluir bytes fuera del rango 0x21–0x7E o incluso 0x20–0x7F, por ejemplo, 0x7F551C para U+551C, [10] 0x7F5AA4 para U+5AA4 [10] o 0x7F8EDA para U+8EDA. [9]
Interacción con la norma ISO 2022
CCCII/EACC no está registrado en el Registro Internacional de Conjuntos de Caracteres Codificados para Usarse con Secuencias de Escape , [11] y como tal, no tiene una designación estándar de escape para su uso con ISO 2022. MARC-8 asigna a EACC el byte F de uso privado 0x31 ( 1) en su implementación de ANSI X3.41 (ISO 2022). [12]
Capas y caracteres variantes
Los 94 planos ISO 2022 se agrupan en 16 capas de 6 planos cada una (excepto la capa 16, que contiene los cuatro planos 91-94). [1] La capa 1 contiene caracteres hanzi y no hanzi , con los no hanzi y los hanzi más utilizados colocados en el plano 1, y con los cinco planos restantes compuestos por hanzi menos común. [1] La capa 2 contiene caracteres chinos simplificados , con sus números de fila y celda siendo los mismos que sus equivalentes chinos tradicionales en la capa 1. Las capas 3 a 12 contienen formas variantes adicionales , en números de fila y celda homólogos a las primeras dos capas. [13]
Las últimas cuatro capas se utilizan para otros fines. En concreto, la capa 13 contiene caracteres adicionales para la compatibilidad con el idioma japonés ( kana y kokuji japonés ), y la capa 14 contiene caracteres adicionales para la compatibilidad con el idioma coreano ( hangul ). [13] La capa 15 no se utiliza (está reservada), mientras que la capa 16 se utiliza para otros caracteres. [1]
Este diseño distintivo ha sido criticado por Christian Wittern del Instituto Internacional de Investigación para el Budismo Zen en la Universidad de Hanazono , quien afirma que la relación de las variantes de caracteres "es muy compleja y no se puede expresar en una tabla de códigos fija, unidimensional y cableada". [3] Ken Lunde lo describe como "uno de los estándares de conjuntos de caracteres mejor pensados de Taiwán", describiendo su estructura como "realmente admirable", pero concluyendo que la sustitución de formas variantes OpenType puede proporcionar el mismo nivel de funcionalidad. [1]
El CCCII define aproximadamente 53.940 puntos de código en su edición de 1987, aunque un borrador más reciente de 1989 amplía esta cifra a 75.684 puntos de código (que comprenden 44.167 caracteres únicos y 31.517 variantes). El EACC, la variante utilizada por la Biblioteca del Congreso, incluye sólo un conjunto más pequeño de 15.686 caracteres. [1]
Adopción
En 1995, CCCII o EACC se utilizaba principalmente en bibliotecas de Estados Unidos , Hong Kong y Taiwán . Aunque CCCII prometía una cobertura pan- CJK , su soporte se limitaba a hardware especializado; la dificultad para determinar cuándo se debía utilizar el carácter raíz frente al carácter variante, exacerbada por la falta de glifos de referencia firmemente establecidos, limitó aún más su adopción, lo que dio como resultado que Big5 se utilizara más comúnmente para el chino en esos territorios fuera del uso de bibliotecas (ya que Unicode aún no se había adoptado ampliamente en ese momento). [3]
En 2009 [actualizar], el EACC todavía se utiliza ampliamente para fines bibliográficos especializados. [1] También fue un precursor importante de Unicode: [1] el trabajo en Apple sobre una base de datos de referencia cruzada de caracteres CJK basada en el Tesauro CJK del Research Libraries Group , utilizado para mantener el EACC, se incorporó directamente al desarrollo del conjunto Unihan de Unicode . [6] Los caracteres hanzi de Unicode se referencian a sus códigos CCCII y EACC correspondientes en la base de datos Unihan , en las claves y ; [4] sin embargo, dado que los criterios de unificación de caracteres de Unicode (basados en los utilizados por la JIS X 0208 japonesa y en los desarrollados por la Asociación para un Código Chino Común en China) difieren de los utilizados por CCCII, no todos los caracteres variantes se asignan individualmente. [6] Las tablas de asignación para hanzi, hangul , kana y puntuación entre EACC y Unicode están disponibles en la Biblioteca del Congreso. [14]kCCCIIkEACC
Tablas de puntuación, símbolos, kana y jamo
A continuación se muestran cuadros de puntuación, símbolos, kana y hangul jamo , que muestran los caracteres y brindan posibles asignaciones Unicode. Cuando es posible, se hacen referencias a estos datos de asignación publicados.
Las asignaciones Unicode para sílabas Hangul se omiten a continuación por razones de brevedad, pero están documentadas por la Biblioteca del Congreso. [15] Los números hanzi del CCCII se expresan en decenas de miles [1] [3] y no se muestran a continuación (excepto cuando también se incluyen en el rango no hanzi, como radicales o numerales), pero las asignaciones a Unicode están disponibles en la base de datos Unihan [4] y en otros lugares. [10] [9]
Conjunto de caracteres 0x2120 (plano 1, fila 0: puntuación de Hong Kong)
Aunque CCCII suele ser un conjunto de 94 n , [1] y por lo tanto no suele utilizar códigos que comiencen con 0x2120, [10] la siguiente distribución es utilizada por una variante utilizada por las bibliotecas en Hong Kong: [9]
Conjunto de caracteres 0x2121 (plano 1, fila 1: reservado para controles)
No se asignan caracteres en el plano 1 fila 1, que está reservado para códigos de control . [1]
Conjunto de caracteres 0x2122 (plano 1, fila 2: operadores matemáticos)
Esta fila contiene operadores matemáticos. EACC deja esta fila vacía. [14] La siguiente tabla se basa en fuentes de Taiwán. [2] [10]
La siguiente tabla se basa en datos del CCCII proporcionados por el Hong Kong Innovative Users Group, un grupo de bibliotecas de Hong Kong, y alojado por la Universidad de Hong Kong . [17] [9] Utiliza un diseño completamente diferente en esta fila:
Conjunto de caracteres 0x2123 (plano 1, fila 3: romanos y puntuación)
Esta fila incluye puntuación, números arábigos occidentales y letras romanas. [10] Compare la fila 3 del código Wansung y la fila 3 de GB 2312 .
Diferentes variantes codifican de forma variada el espacio ideográfico (U+3000) en 0x212320 (que la especificación MARC reconoce), [8] [9] 0x212321 (que figura en el estándar ANSI y también es reconocido por MARC), [8] [9] o 0x21635F. [10] EACC incluye solo el guión-menos , los paréntesis y el espacio ideográfico en este conjunto. [8]
Conjunto de caracteres 0x212A (plano 1, fila 10: caracteres IME internos y marca geta)
En EACC, esta fila incluye varios caracteres asignados al Área de Uso Privado que se utilizan internamente para representar componentes de caracteres mediante el método de entrada RLIN , [18] que utiliza la Biblioteca del Congreso para la catalogación no latina. [19] Estos caracteres componentes solo deben ser utilizados internamente por un IME y, si se encuentran en otro lugar, pueden reemplazarse con la marca geta (U+3013), [18] que esta fila también incluye en 0x212A46. Esta fila no está asignada en CCCII, [1] pero la marca geta también aparece en esa ubicación en algunas asignaciones para CCCII. [10]
Conjunto de caracteres 0x212B (plano 1, fila 11: puntuación)
Esta fila contiene varios signos de puntuación utilizados en chino, [1] [8] además de otros símbolos. CCCII incluye un conjunto de 35 signos de puntuación en esta fila. [1] EACC incluye solo 13 caracteres en esta fila (mostrados en el recuadro a continuación). [8]
Conjuntos de caracteres 0x212C–0x212E (plano 1, filas 12–14: radicales y ordinales)
Estas filas contienen radicales chinos , [1] números romanos , [10] tallos celestes y ramas terrestres . [16]
Conjunto de caracteres 0x212F (plano 1, fila 15: números chinos y bopomofo)
Esta fila incluye números chinos y caracteres bopomofo . [1] EACC incluye solo el cero ideográfico (〇). [8]
Conjunto de caracteres 0x272B (plano 7, fila 11: marca de referencia)
Esta fila contiene la marca de referencia ( kome jirushi ). [10]
Conjunto de caracteres 0x272E–0x272F (plano 7, filas 14–15: bopomofo alternativo)
Una variante utilizada por las bibliotecas de Hong Kong no incluye caracteres bopomofo en la fila 15 del plano 1, sino que los incluye en un diseño diferente en el plano 7. [9]
Conjunto de caracteres 0x6921 (plano 73, fila 1: puntuación japonesa)
Esta fila está en el plano 73, el primer plano de la capa 13, que contiene caracteres incluidos para la compatibilidad con el idioma japonés . [13] Contiene puntuación. [8] Compárese con la fila 1 de JIS X 0208 , que esta fila tiende a seguir el diseño de los caracteres que incluye.
Conjunto de caracteres 0x6924 (plano 73, fila 4: hiragana)
Esta fila contiene hiragana . Compárese con la fila 4 de JIS X 0208 .
Conjunto de caracteres 0x6925 (plano 73, fila 5: katakana)
Esta fila contiene katakana . Compárese con la fila 5 de JIS X 0208 , a la que corresponde esta fila, además de la adición de dakuten y handakuten por separado .
Conjunto de caracteres 0x6F24–0x6F25 (plano 79, filas 4-5: jamo)
Estas filas contienen jamo coreano .
Conjunto de caracteres 0x6F76 (plano 79, fila 86: Hangul arcaico)
Esta fila contiene varios caracteres Hangul históricos que ya no se usan con regularidad. Varios de ellos están asignados al Área de uso privado . [18]
Conjunto de caracteres 0x7B25 (plano 91, fila 5: Katakana suplementario)
Esta fila contiene katakana adicional utilizado para escribir fonemas extranjeros. [10]
Véase también
Notas al pie
- ^ Fuera del rango de bytes de seguimiento de un conjunto ISO 2022 94 n , pero se indica que está en uso en algunas implementaciones. [8]
- ^ Codificación del espacio ideográfico especificado en el estándar ANSI para EACC. [8] Esto se utiliza como signo de exclamación en CCCII, [10] además del signo de exclamación en 0x212B3D. [16] La variante HKIUG de Hong Kong de CCCII sigue a EACC aquí. [9]
- ^ Las asignaciones Encode::HanExtra utilizan U+FE52 para este carácter. [10] Sin embargo, aparece aquí después de ˊ, ˇ y ˋ, [16] que son las otras tres marcas de tono para bopomofo . La asignación U+02D9 se utiliza más comúnmente para esta marca de tono en los rangos de codificaciones de bopomofo, por ejemplo Big5 . [20]
Referencias
- ^ abcdefghijklmnopqrs Lunde, Ken (2009). Procesamiento de información CJKV: computación china, japonesa, coreana y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . Págs. 122-124. ISBN. 978-0-596-51447-1.
- ^ abc Tang, Audrey (10 de noviembre de 2007). "Encode::HanExtra - Conjuntos adicionales de codificaciones chinas".
CCCII: La codificación china tradicional más antigua (y más sofisticada)... utilizada principalmente en sistemas de bibliotecas... El mapa para "CCCII" es proporcionado por el
proyecto
Koha Taiwan.
- ^ abcd Wittern, Christian (1 de mayo de 1995). "Códigos de caracteres chinos: una actualización". Instituto Internacional de Investigación para el Budismo Zen / Universidad de Hanazono . Archivado desde el original el 12 de octubre de 2004.
- ^ abc Jenkins, John H.; Cocinero, Richard; Lunde, Ken (5 de marzo de 2020). "Base de datos Unicode Han (Unihan)". Anexo #38 del estándar Unicode.
- ^ "Copia archivada". Archivado desde el original el 15 de junio de 2016. Consultado el 15 de junio de 2016 .
{{cite web}}: CS1 maint: copia archivada como título ( enlace ) - ^ abc "Apéndice E: Historia de la unificación Han" (PDF) . Versión 15.0 del estándar Unicode: especificación básica . Consorcio Unicode . 2022.
- ^ Diccionario Kangxi, pag. 1296, carácter. 1
- ^ abcdefghij Biblioteca del Congreso (5 de diciembre de 2007). "Tabla de códigos de signos de puntuación de Asia oriental". Especificaciones MARC 21 para estructura de registros, conjuntos de caracteres y medios de intercambio .
- ^ abcdefghijklmnopq Grupo de trabajo Unicode del Grupo de usuarios innovadores de Hong Kong. "Tabla de códigos HKIUG para caracteres CJK: asignación a Unicode". Bibliotecas de la Universidad de Hong Kong .
- ^ abcdefghijklmnopqrstu vw Tang, Audrey; Koha Taiwán. "Mapa para CCCII". Encode::HanExtra . CPAN .
- ^ "2.4: Conjuntos de caracteres gráficos de múltiples bytes". Registro internacional de conjuntos de caracteres codificados para su uso con secuencias de escape (ISO-IR) (PDF) . ITSCJ/ IPSJ . pág. 14.
- ^ Biblioteca del Congreso (5 de diciembre de 2007). "Técnica 2: uso de conjuntos de caracteres gráficos alternativos estándar". Especificaciones MARC 21 para estructura de registros, conjuntos de caracteres y medios de intercambio .
- ^ abc Lunde, Ken (18 de diciembre de 1995). "2.5.2: CCCII". CJK.INF Versión 1.9.
- ^ abcdefghijkl Biblioteca del Congreso (5 de diciembre de 2007). "Tablas de códigos de Asia oriental". Especificaciones MARC 21 para estructura de registros, conjuntos de caracteres y medios de intercambio .
- ^ Biblioteca del Congreso (5 de diciembre de 2007). "Tabla de códigos del hangul coreano". Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
- ^ abcdefghij Los caracteres que se muestran son, en parte, referencias cruzadas con una fuente BDF representativa para CCCII, distribuida por Koichi Yasuoka de la Universidad de Kioto.
- ^ Grupo de usuarios innovadores de Hong Kong (7 de enero de 2013). "Introducción al grupo de usuarios innovadores de Hong Kong". Bibliotecas de la Universidad de Hong Kong .
- ^ abc Biblioteca del Congreso (2004-09-02). "Lista resumida de caracteres MARC 21 asignados al área de uso privado (PUA)". Especificaciones MARC 21 para estructura de registros, conjuntos de caracteres y medios de intercambio .
- ^ Morris, Susan (2007). "Encontrar JACKPHY: catalogación en línea para incluir árabe, hebreo y otras escrituras". Boletín de información de la Biblioteca del Congreso . Vol. 66, núm. 12.
- ^ van Kesteren, Ana. "grande5". Estándar de codificación . QUÉ WG .
- Parte de la información de esta página se basa en la información del sitio web oficial del CNS.
Enlaces externos
- El sitio web oficial de CNS 11643 (versión en inglés de las páginas disponibles) tiene información sobre el conjunto de caracteres CCCII en la sección "Código de información chino"
- Asignación completa de EACC a Unicode, de la Biblioteca del Congreso