Articulo de referencia

Los cinco grandes

'''Partial support:''' [[Simplified Chinese]], [[Greek language|Greek]], [[Japanese language|Japanese]], [[Russian language|Russian]], [[Bulgarian language|Bulgarian]], some of ...

Big-5 o Big5 ( en chino :大五碼) es un método de codificación de caracteres chinos utilizado en Taiwán , Hong Kong y Macao para los caracteres chinos tradicionales .

La República Popular China (RPC) , que utiliza caracteres chinos simplificados , utiliza el conjunto de caracteres GB 18030 (aunque también puede sustituirlo por Big-5 o UTF-8).

Big5 debe su nombre al consorcio de cinco empresas en Taiwán que lo desarrollaron. [ 2 ]

Codificación

El conjunto de caracteres original Big5 se ordena primero por frecuencia de uso, segundo por número de trazos y, por último, por radical Kangxi .

El conjunto de caracteres original de Big5 carecía de muchos caracteres de uso común. Para solucionar este problema, cada proveedor desarrolló su propia extensión. La extensión ETen se incorporó al estándar Big5 actual gracias a su popularidad.

La estructura de Big5 no se ajusta al estándar ISO 2022 , sino que guarda cierta similitud con la codificación Shift JIS . Se trata de un conjunto de caracteres de doble byte (DBCS) con la siguiente estructura:

(el prefijo 0x indica números hexadecimales).

Las asignaciones estándar (excluyendo las extensiones definidas por el proveedor o el usuario) no utilizan los bytes 0x7F a 0xA0 ni 0xFF como bytes inicial (primer byte) ni final (segundo byte). Los bytes 0xA1 a 0xFE se utilizan como bytes inicial y final para códigos de doble byte (Big5). Los bytes 0x40 a 0x7E se utilizan como bytes finales después de un byte inicial, o para códigos de un solo byte en otros casos. Si el segundo byte no se encuentra en ninguno de estos rangos, el comportamiento no está especificado (es decir, varía de un sistema a otro). Además, ciertas variantes del conjunto de caracteres Big5, por ejemplo HKSCS , utilizan un rango ampliado para el byte inicial, incluyendo valores en el rango 0x81 a 0xA0 (similar a Shift JIS ), mientras que otras utilizan rangos reducidos de bytes iniciales (por ejemplo, la variante de Apple Macintosh utiliza 0xFD a 0xFF como códigos de un solo byte, limitando el rango del byte inicial a 0xA1 a 0xFC ). [ 3 ]

El valor numérico de los códigos Big5 individuales se suele expresar como un número hexadecimal de 4 dígitos, que describe los dos bytes que componen el código Big5 como si fueran una representación big-endian de un número de 16 bits. Por ejemplo, el código Big5 para un espacio de ancho completo, que son los bytes 0xa1 0x40 , se suele escribir como 0xa140 o simplemente A140.

Estrictamente hablando, la codificación Big5 solo contiene caracteres DBCS. Sin embargo, en la práctica, los códigos Big5 siempre se utilizan junto con un conjunto de caracteres de un solo byte (SBCS) no especificado y dependiente del sistema (como ASCII o la página de códigos 437 ), de modo que el texto codificado en Big5 contiene una mezcla de caracteres de doble byte y de un solo byte. Se asume que los bytes en el rango de 0x00 a 0x7f que no forman parte de un carácter de doble byte son caracteres de un solo byte. (Para una descripción más detallada de este problema, consulte la sección "El SBCS coincidente" a continuación).

El significado de los bytes individuales no ASCII que se encuentran fuera de los valores permitidos y que no forman parte de un carácter de doble byte varía según el sistema. En los sistemas antiguos basados ​​en MSDOS, es probable que se muestren como caracteres de 8 bits; en los sistemas modernos, es probable que produzcan resultados impredecibles o generen un error.

Un análisis más detallado de la organización

En el Big5 original, la codificación está compartimentada en diferentes zonas:

Los "caracteres gráficos" en realidad comprenden signos de puntuación, signos de puntuación parciales (por ejemplo, la mitad de un guion, la mitad de puntos suspensivos; véase más abajo), símbolos , caracteres extranjeros y otros caracteres especiales (por ejemplo, formas de presentación de "ancho completo", dígitos para numerales de Suzhou , zhuyin fuhao , etc.).

En la mayoría de las extensiones de proveedor, los caracteres extendidos se ubican en las distintas zonas reservadas para caracteres definidos por el usuario, cada una de las cuales se considera asociada a la zona precedente. Por ejemplo, se esperaría que los caracteres gráficos adicionales (como los signos de puntuación) se ubicaran en el rango 0xa3c00xa3fe , y los logotipos adicionales en el rango 0xc6a10xc8fe o en el rango 0xf9d60xfefe . En ocasiones, esto no es posible debido a la gran cantidad de caracteres extendidos que se deben agregar; por ejemplo, las letras cirílicas y los caracteres kana japoneses se han ubicado en la zona asociada a los caracteres de uso frecuente.

Duplicados

Big5 ha codificado dos caracteres duplicados: "兀" en 0xA461 (U+5140) y 0xC94A (U+FA0C), "嗀" en 0xDCD1 (U+55C0) y 0xDDFC (U+FA0D).

Algunos mapas de codificación también asignan los tres numerales de Suzhou, "〸", "〹" y "〺", en la sección gráfica a caracteres ideográficos (U+5341, U+5344 y U+5345 respectivamente) [ 4 ] [ 5 ] en lugar de símbolos y puntuación CJK (U+3038, U+3039 y U+303A respectivamente). [ 6 ] [ 7 ]

Lo que realmente codifica un código Big5

Un código Big5 individual no siempre representa una unidad semántica completa. Los códigos Big5 de los logogramas siempre son logogramas, pero los códigos de la sección de "caracteres gráficos" no siempre son "caracteres gráficos" completos. Lo que Big5 codifica son representaciones gráficas particulares de caracteres o partes de caracteres que caben en el espacio ocupado por dos caracteres ASCII monoespaciados. Esta es una propiedad de los conjuntos de caracteres CJK de doble byte y no un problema exclusivo de Big5.

(Lo anterior podría requerir una explicación contextualizada históricamente, ya que teóricamente es incorrecto: Cuando la informática personal en modo texto era la norma, los caracteres se representaban normalmente como bytes individuales y cada carácter ocupaba una posición en la pantalla. Por lo tanto, existía una razón práctica para insistir en que los caracteres de doble byte debían ocupar dos posiciones en la pantalla: que el software comercial estadounidense pudiera utilizarse sin modificaciones en un sistema basado en DBCS. Si un carácter puede ocupar un número arbitrario de posiciones en la pantalla, el software que asume que un byte de texto ocupa una posición produciría una salida incorrecta. Por supuesto, si un ordenador nunca tuviera que lidiar con la pantalla de texto, el fabricante no impondría esta restricción artificial; el Apple Macintosh es un ejemplo. Sin embargo, la codificación en sí misma debe diseñarse para que funcione correctamente en sistemas basados ​​en pantallas de texto).

Para ilustrar este punto, consideremos el código Big5 0xa14b (…). Para los angloparlantes, esto parece una elipsis y el estándar Unicode la identifica como tal; sin embargo, en chino, la elipsis consta de seis puntos que caben en el espacio de dos caracteres chinos (……), por lo que, de hecho, no existe un código Big5 para la elipsis china, y el código Big5 0xa14b solo representa la mitad de una elipsis china. Representa solo la mitad de una elipsis porque la elipsis completa debería ocupar el espacio de dos caracteres chinos, y en muchos sistemas DBCS un carácter DBCS debe ocupar exactamente el espacio de un carácter chino.

Los caracteres codificados en Big5 no siempre representan elementos que puedan utilizarse fácilmente en archivos de texto plano; un ejemplo es la "señal de cita" ( 0xa1ca , ﹋), que, cuando se utiliza, debe ir precedida del título de las obras literarias. Otro ejemplo son los numerales de Suzhou, una notación científica que exige que el número se represente en dos dimensiones, con al menos dos filas.

El SBCS coincidente

En la práctica, Big5 no puede utilizarse sin un SBCS compatible; esto se debe principalmente a problemas de compatibilidad. Sin embargo, al igual que con otros conjuntos de caracteres CJK DBCS, nunca se ha especificado el SBCS a utilizar. Big5 siempre se ha definido como un DBCS, aunque al usarlo debe combinarse con un SBCS adecuado y no especificado , por lo que se utiliza como lo que algunos denominan un MBCS ; no obstante, Big5 por sí mismo, tal como se define, es estrictamente un DBCS.

El hecho de que no se especifique el SBCS a utilizar implica que, en teoría, puede variar de un sistema a otro. Actualmente, ASCII es el único SBCS posible. Sin embargo, en los sistemas antiguos basados ​​en DOS , la página de códigos 437 —con sus símbolos especiales adicionales en el área de códigos de control, incluida la posición 127— era mucho más común. Aun así, en un sistema Macintosh con el kit de idioma chino o en un sistema Unix que ejecute el emulador de terminal cxterm, el SBCS asociado a Big5 no sería la página de códigos 437.

Fuera del rango válido de Big5, los antiguos sistemas basados ​​en DOS interpretaban habitualmente los datos según el SBCS asociado a Big5 en dicho sistema. En estos sistemas, los caracteres del 127 al 160, por ejemplo, probablemente no se evitaban porque generarían un Big5 inválido, sino que se utilizaban porque eran caracteres válidos en la página de códigos 437.

La caracterización moderna de Big5 como un MBCS que consiste en el DBCS de Big5 más el SBCS de ASCII es, por lo tanto, históricamente incorrecta y potencialmente errónea, ya que la elección del SBCS correspondiente era, y teóricamente sigue siendo, bastante independiente de la variante de Big5 que se utilice.

Historia

La incapacidad del ASCII para admitir los extensos conjuntos de caracteres chinos, japoneses y coreanos (CJK) llevó a gobiernos e industrias a buscar soluciones creativas para que sus idiomas pudieran ser representados en computadoras. Diversos métodos de entrada improvisados ​​y generalmente propietarios impulsaron los esfuerzos para desarrollar un sistema estándar. Como resultado, el Instituto de la Industria de la Información de Taiwán definió la codificación Big5 en 1984.

El nombre "Big5" reconoce que el estándar surgió de la colaboración de cinco de las mayores empresas de TI de Taiwán:

Big5 se popularizó rápidamente en Taiwán y en todo el mundo entre los chinos que utilizaban el alfabeto chino tradicional, gracias a su adopción en varios paquetes de software comerciales, en particular el sistema de entrada E-TEN Chinese DOS ( Sistema Chino E-TEN ). El gobierno de la República de China declaró Big5 como su estándar a mediados de la década de 1980, ya que para entonces se había convertido en el estándar de facto para el uso del chino tradicional en ordenadores.

Extensiones

Los cinco grandes originales solo incluyen logogramas CJK de las Tablas de Formas Estándar de Caracteres Nacionales Comunes (4808 caracteres) y de Caracteres Nacionales Menos Comunes (6343 caracteres), pero no letras de nombres propios, topónimos, dialectos, química , biología ni kana japonés. Por consiguiente, muchos programas que apoyan a los cinco grandes incluyen extensiones para solucionar estos problemas.

La gran cantidad de variantes hacen que UTF-8 (o UTF-16 o el estándar chino GB 18030 , que también es un formato de transformación Unicode completo, es decir, no solo para chino simplificado) sea una página de códigos más consistente para el uso moderno.

Extensiones de proveedores

Extensiones ETen

En el sistema operativo chino ETen (倚天), se agregan los siguientes puntos de código para dar soporte a algunos caracteres presentes en la página de códigos del IBM 5550 pero ausentes en el Big5 genérico:

En algunas versiones de ETen, hay símbolos gráficos adicionales y caracteres chinos simplificados .

Páginas de código de Microsoft

Microsoft (微軟) creó su propia versión de la extensión Big5 como página de códigos 950 para su uso con Microsoft Windows , que admite los puntos de código F9D6–F9FE de las extensiones de ETEN. En algunas versiones de Windows, el símbolo de la moneda euro se asigna al punto de código Big-5 A3E1.

Tras instalar el parche HKSCS de Microsoft sobre una versión tradicional china de Windows (o cualquier versión de Windows 2000 o posterior con el paquete de idioma adecuado), las aplicaciones que utilizan la página de códigos 950 usan automáticamente una tabla oculta de la página de códigos 951. Esta tabla admite todos los puntos de código de HKSCS-2001, excepto los puntos de código de compatibilidad especificados por el estándar. [ 8 ]

Páginas de código de IBM

A diferencia de la página de códigos 950 de Microsoft, el CCSID 950 de IBM comprende la página de códigos de un solo byte 1114 (CCSID 1114) y la página de códigos de doble byte 947 (CCSID 947). [ 9 ] [ 10 ] [ 11 ] Incorpora extensiones ETEN para los bytes iniciales 0xA3 , [ 12 ] 0xC6 , [ 13 ] [ 14 ] 0xC7 [ 15 ] y 0xC8 , [ 13 ] [ 16 ] mientras omite aquellos con el byte inicial 0xF9 (que Microsoft incluye), asignándolos en cambio al Área de uso privado como caracteres definidos por el usuario. [ 13 ] [ 17 ] También incluye dos regiones de extensión no ETEN con bytes de cola 0x81–A0 , es decir, fuera del rango habitual de bytes de cola de Big5 pero similar al rango de bytes de cola de Big5+: el área 5 tiene bytes de inicio 0xF2–F9 y contiene caracteres seleccionados por IBM, mientras que el área 9 tiene bytes de inicio 0x81–8C y es una región definida por el usuario. [ 18 ]

IBM se refiere a la actualización del símbolo del euro de su variante Big-5 como CCSID 1370, que incluye símbolos de euro de un byte ( 0x80 ) y de doble byte ( 0xA3E1 ). [ 19 ] Comprende la página de códigos de un byte 1114 (CCSID 5210) y la página de códigos de doble byte 947 (CCSID 21427). [ 19 ] [ 20 ] [ 21 ] Para una mejor compatibilidad con la variante de Microsoft en IBM Db2 , IBM también define la página de códigos de doble byte pura 1372 [ 22 ] y el CCSID de ancho variable asociado 1373, que corresponde a la página de códigos 950 de Microsoft. [ 23 ]

IBM asigna CCSID 5471 a la página de códigos Big5 de HKSCS-2001 (con CPGID 1374 como CCSID 5470 como componente de doble byte), [ 24 ] [ 25 ] CCSID 9567 a la página de códigos de HKSCS-2004 (con CPGID 1374 como CCSID 9566 como componente de doble byte), [ 26 ] y CCSID 13663 a la página de códigos de HKSCS-2008 (con CPGID 1374 como CCSID 13662 como componente de doble byte), [ 27 ] mientras que CCSID 1375 se asigna a una página de códigos HKSCS en crecimiento, actualmente equivalente a CCSID 13663. [ 28 ]

Fuente ChinaSea

Las fuentes ChinaSea (中國海字集) [ 29 ] son ​​fuentes chinas tradicionales creadas por ChinaSea. Rara vez se venden por separado, sino que se incluyen con otros productos, como la versión china de Microsoft Office 97. Las fuentes admiten kana japonés, kokuji y otros caracteres que faltan en Big-5. Como resultado, las extensiones de ChinaSea se han vuelto más populares que las extensiones oficiales. Algunos BBS de Hong Kong ya utilizaban codificaciones en fuentes ChinaSea antes de la introducción de HKSCS.

Fuente 'Sakura'

La fuente 'Sakura' (日和字集 Sakura Version) se desarrolló en Hong Kong y está diseñada para ser compatible con HKSCS. Añade compatibilidad con kokuji y dingbats propietarios (incluido Doraemon ) que no se encuentran en HKSCS.

Unicode-en-el-en

Unicode-at-on ( Unicode補完計畫), anteriormente conocida como extensión BIG5, amplía BIG-5 modificando las tablas de páginas de códigos, pero utiliza las extensiones ChinaSea a partir de la versión 2. Sin embargo, debido a la quiebra de ChinaSea, el retraso en su desarrollo y la creciente popularidad de HKSCS y Unicode (el proyecto no es compatible con HKSCS), el éxito de esta extensión es, en el mejor de los casos, limitado.

A pesar de los problemas, los caracteres previamente asignados al Área de Uso Privado de Unicode se reasignan a sus equivalentes estandarizados al exportar caracteres al formato Unicode.

OPG

Los sitios web del Oriental Daily News y del Sun Daily , pertenecientes al Oriental Press Group Limited (東方報業集團有限公司) en Hong Kong, utilizaban una fuente descargable con una codificación de extensión Big-5 diferente a la del HKSCS.

Extensiones oficiales

Fuente del Ministerio de Educación de Taiwán

El Ministerio de Educación de Taiwán proporcionó su propia fuente, la fuente del Ministerio de Educación de Taiwán (臺灣教育部造字檔) para uso interno.

Fuente del Consejo de Agricultura de Taiwán

El Yuan Ejecutivo introdujo una fuente personalizada de 133 caracteres, la fuente del Consejo de Agricultura de Taiwán (臺灣農委會常用中文外字集), que incluye 84 caracteres del radical pez y 7 del radical pájaro .

Big5+

La Fundación China para la Tecnología de Digitalización (中文數位化技術推廣委員會) introdujo Big5+ en 1997, que utilizaba más de 20000 puntos de código para incorporar todos los logogramas CJK en Unicode 1.1. Sin embargo, los puntos de código adicionales excedían la definición original de Big-5 (Big5+ utiliza valores de byte altos 81-FE y valores de byte bajos 40-7E y 80-FE), lo que impedía su instalación en Microsoft Windows sin nuevos archivos de página de códigos.

Big-5E

Para permitir a los usuarios de Windows usar fuentes personalizadas, la Fundación China para la Tecnología de Digitalización introdujo Big-5E, que añadió 3954 caracteres (en tres bloques de puntos de código: 8E40-A0FE, 8140-86DF, 86E0-875C) y eliminó los caracteres kana japoneses de la extensión ETEN. A diferencia de Big-5+, Big-5E extiende Big-5 dentro de su definición original. Mac OS X 10.3 y versiones posteriores admiten Big-5E en las fuentes LiHei Pro (儷黑 Pro.ttf) y LiSong Pro (儷宋 Pro.ttf).

Big5-2003

La Fundación China para la Tecnología de la Digitalización elaboró ​​una definición de los Cinco Grandes y la incluyó en la norma CNS 11643 en forma de nota, convirtiéndola así en parte del estándar oficial en Taiwán.

Big5-2003 incorpora todos los caracteres Big-5 introducidos en las extensiones ETEN de 1984 (puntos de código A3C0-A3E0, C6A1-C7F2 y F9D6-F9FE) y el símbolo del euro. No se incluyeron caracteres cirílicos porque la autoridad afirmó que CNS 11643 no los incluye.

CDP

La Academia Sinica creó una fuente china para el procesamiento de datos (漢字構形資料庫) a finales de la década de 1990, cuya última versión, la 2.5, incluía 112.533 caracteres, algunos menos que las fuentes Mojikyo .

HKSCS

Hong Kong también adoptó Big5 para la codificación de caracteres. Sin embargo, el cantonés escrito tiene caracteres propios que no están disponibles en el conjunto de caracteres Big5 estándar. Para solucionar este problema, el Gobierno de Hong Kong creó las extensiones de Big5: el Conjunto de Caracteres Chinos del Gobierno (GCCS) en 1995 y el Conjunto de Caracteres Suplementarios de Hong Kong en 1999. Estas extensiones se distribuían habitualmente como un parche. Microsoft aún las distribuye como un parche, pero también se puede obtener una fuente Unicode completa en el sitio web del Gobierno de Hong Kong.

Existen dos esquemas de codificación de HKSCS: uno para el estándar de codificación Big-5 y otro para el estándar ISO 10646. Tras su lanzamiento inicial, también se publicaron HKSCS-2001 y HKSCS-2004. HKSCS-2004 se ajusta técnicamente a la norma ISO/IEC 10646:2003 y su Enmienda 1, publicada en abril de 2004 por la Organización Internacional de Normalización (ISO).

HKSCS incluye todos los caracteres de la extensión ETen común, además de algunos caracteres del chino simplificado, nombres de lugares, nombres de personas y frases cantonesas (incluidas palabrotas ).

A partir de 2020La edición más reciente de HKSCS es HKSCS-2016; sin embargo, la última edición de HKSCS que codificó todos sus caracteres en Big5 fue HKSCS-2008, mientras que los caracteres agregados en ediciones más recientes se asignan solo a ISO 10646 / Unicode (como una extensión de glifo horizontal de Ideogramas Unificados CJK cuando corresponde). [ 30 ] Además, de manera similar a la situación de Hong Kong, también hay caracteres que Macao necesita pero que no están incluidos ni en Big5 ni en HKSCS; por lo tanto, se desarrolló el Conjunto de Caracteres Suplementarios de Macao , que comprende caracteres que no se encuentran en Big5 ni en HKSCS; sin embargo, este tampoco está codificado en Big5. El primer lote de 121 caracteres MSCS se presentó para su inclusión o asignación a Unicode en 2009, [ 31 ] y la primera versión final de MSCS se estableció en 2020. [ 30 ]

Kana y cirílico

Existen dos diseños de extensión Big5 principales para codificar kana, caracteres cirílicos rusos y marcadores de lista en el rango 0xC6A1 a 0xC875. Estos no son compatibles entre sí. [ 32 ] Se comparan en la tabla a continuación.

La disposición ETEN de kana y cirílico también es utilizada por las variantes HKSCS [ 33 ] (incluido HTML5 ) [ 34 ] y Unicode-At-On [ 35 ] , así como por la versión de IBM de la página de códigos 950, [ 36 ] [ 37 ] [ 38 ] y la disposición ETEN de kana (con cirílico omitido) también es utilizada por la variante Big5-2003. [ 39 ] Los archivos de mapeo publicados para Windows-950 no incluyen ninguno, y este rango Big5 es mapeado al Área de uso privado por la implementación de Windows-950 de International Components for Unicode . [ 40 ] La implementación de códec integrada de Pythoncp950 está utilizando la disposición BIG5.TXT. [ 41 ] La versión clásica de Mac OS no incluye ninguna disposición. [ 3 ]

Véase también

Referencias

  1. "Tabla de códigos de caracteres Big5 (chino tradicional)" . Archivado del original el 4 de mayo de 2002. Consultado el 23 de agosto de 2007 .
  2. "Conjuntos de caracteres" . chinesemac.org . Archivado del original el 12 de agosto de 2017. Consultado el 31 de agosto de 2021 .
  3. 1 2 Apple, Inc (2005-04-04) [1996]. Mapa (versión externa) de la codificación tradicional china de Mac OS a Unicode 3.0 y posterior . Consorcio Unicode . Archivado del original el 14-05-2021 . Recuperado el 24-02-2021 .
  4. "Archivo de mapeo Unicode CP950" . Unicode . Consorcio Unicode . Archivado del original el 27 de junio de 2023. Consultado el 11 de mayo de 2023 .
  5. "Archivo de mapeo Unicode Big5" . Unicode . Consorcio Unicode . Archivado del original el 27 de junio de 2023. Consultado el 11 de mayo de 2023 .
  6. ^ "Mozilla 系列與 Big5 中文字碼 (Big5-2003)" . Mozilla 台湾社群(en chino (Taiwán)). Archivado desde el original el 27 de junio de 2023 . Consultado el 1 de julio de 2020 .
  7. ^ El archivo de mapeo ETEN proporcionado por la comunidad Mozilla Taiwán asigna los tres caracteres tanto al símbolo como al punto de código del ideograma. "Mozilla 系列與 Big5 中文字碼 (ETEN)" . Mozilla 台湾社群(en chino (Taiwán)). Archivado desde el original el 27 de junio de 2023 . Consultado el 1 de julio de 2020 .
  8. "狗爺語錄" Blog Archive » ¿Qué es la página de códigos 951 (CP951)? . Archivado del original el 22/02/2007 . Recuperado el 27/09/2006 .  
  9. "Documento informativo CCSID 950" . Archivado del original el 2 de diciembre de 2014.
  10. "Documento informativo CCSID 1114" . Archivado del original el 27 de marzo de 2016.
  11. "Documento informativo CCSID 947" . Archivado del original el 1 de diciembre de 2014.
  12. "Byte principal A3: ibm-950_P110-1999" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode .
  13. 1 2 3 Zhu, HF.; Hu, DY.; Wang, ZG.; Kao, TC.; Chang, WCH.; Crispin, M. (1996). "Codificación de caracteres chinos para mensajes de Internet" . Solicitudes de comentarios . IETF . doi : 10.17487/rfc1922 . RFC 1922. Archivado del original el 29 de abril de 2021. Recuperado el 1 de enero de 2022 .
  14. "Byte principal C6: ibm-950_P110-1999" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode .
  15. "Byte principal C7: ibm-950_P110-1999" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode .
  16. "Byte principal C8: ibm-950_P110-1999" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode .
  17. "Byte principal F9: ibm-950_P110-1999" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode .
  18. "Conjunto de caracteres gráficos chinos tradicionales de IBM para el código IBM BIG-5" (PDF) . IBM . 1999. CH 3-3220-131 1999-04. Archivado (PDF) del original el 22-11-2021 . Consultado el 01-01-2022 .
  19. 1 2 "Documento informativo CCSID 1370" . Archivado del original el 27 de marzo de 2016.
  20. "Documento informativo CCSID 5210" . Archivado del original el 29/11/2014.
  21. "Documento informativo CCSID 21427" . Archivado del original el 27 de marzo de 2016.
  22. "CPGID 01372: MS T-Chinese Big-5 (Especial para DB2)" . Globalización de IBM - Identificadores de página de códigos . Archivado del original el 17 de marzo de 2016.
  23. "ibm-1373_P100-2002" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode . Archivado del original el 26/05/2021 . Consultado el 01/01/2022 .
  24. "CCSID 5471: Extensión mixta Big-5 para HKSCS-2001" . Globalización de IBM: identificadores de conjuntos de caracteres codificados . IBM . Archivado del original el 29/11/2014.
  25. Componentes internacionales para Unicode (ICU), ibm-5471_P100-2006.ucm , 9 de mayo de 2007, archivado del original el 13 de agosto de 2023 , recuperado el 1 de enero de 2022
  26. "CCSID 9567: Extensión mixta Big-5 para HKSCS-2004" . Globalización de IBM - Identificadores de conjuntos de caracteres codificados . IBM . Archivado del original el 29/11/2014.
  27. "CCSID 13663: Extensión mixta Big-5 para HKSCS-2008" . Globalización de IBM - Identificadores de conjuntos de caracteres codificados . IBM . Archivado del original el 29/11/2014.
  28. "CCSID 1375: Extensión mixta Big-5 para HKSCS" . Globalización de IBM - Identificadores de conjuntos de caracteres codificados . IBM . Archivado del original el 29/11/2014.
  29. 黃國書. "Chinasea 1.0 中國海字集" . FTP de la ISU. Archivado desde el original el 19 de marzo de 2005 . Consultado el 5 de diciembre de 2016 .
  30. 1 2 Gobierno de la Región Administrativa Especial de Macao (11 de junio de 2020). "Presentación de la extensión vertical (caracteres UNC), extensión horizontal y registro IVSes de Macao para MSCS" (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 IRGN 2430. Archivado (PDF) del original el 23 de junio de 2020. Recuperado el 2 de julio de 2020 .
  31. Grupo de trabajo sobre codificación de caracteres chinos para computadoras (12 de junio de 2009). «Presentación de caracteres del conjunto de caracteres de los sistemas de información de Macao» (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 IRGN 1580. Archivado del original (PDF) el 4 de enero de 2015.
  32. Lunde, Ken (1996-07-12). "2.3.1: BIG FIVE". CJK.INF Versión 2.1 . Archivado del original el 2021-05-15 . Recuperado el 2020-03-15 .
  33. "Big5HKSCS-2004" . Mozilla Taiwán. Archivado del original el 24 de septiembre de 2020. Consultado el 1 de julio de 2020 .
  34. van Kesteren, Anne . "big5" . Estándar de codificación . WHATWG . Archivado del original el 4 de mayo de 2020. Consultado el 15 de marzo de 2020 .
  35. "UAO 2.41 b2u" . Mozilla Taiwán. Archivado del original el 24 de octubre de 2020. Consultado el 1 de julio de 2020 .
  36. "Byte principal C6: ibm-950_P110-1999" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode .
  37. "Byte principal C7: ibm-950_P110-1999" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode .
  38. "Byte principal C8: ibm-950_P110-1999" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode .
  39. "Big5-2003 b2u" . Mozilla Taiwán. Archivado del original el 27 de junio de 2023. Consultado el 1 de julio de 2020 .
  40. IBM ; Consorcio Unicode (3 de diciembre de 2002). "windows-950-2000" . Componentes internacionales para Unicode . Archivado del original el 2 de julio de 2020. Consultado el 1 de julio de 2020 .
  41. "Script showing output of cp950 codec for lead bytes 0xC6 and 0xC7". Archived from the original on 2022-10-18. Retrieved 2022-10-18.
  42. Unicode Consortium (2015-12-02) [1994-02-11]. BIG5 to Unicode table (complete). Archived from the original on 2023-06-27. Retrieved 2020-03-15.
  43. "Big5-ETen vs Unicode mapping table". Mozilla Taiwan. 2002-02-24. Archived from the original on 2023-06-27. Retrieved 2020-07-01.
  • Lunde, Ken (1999). CJKV Information Processing (First ed.). O'Reilly and Associates, Inc. ISBN 978-1-56592-224-2.
  • A scan of the Big5 specification provided by the Ideographic Research Group
  • Mozilla and the Big5 Family of Encodings: an overview of Big5 encodings with code charts for each extension and relevant Firefox bugs (Traditional Chinese)
  • Big5 character code tableArchived 2002-05-04 at the Wayback Machine
  • Chinese character codes: an update by Christian Wittern
  • CNS 11643 official web site has information about the Big5e character set (an extended version of Big5) in the "Chinese Information Code" section.
  • Big5 introduction Contains differences between extensions.
  • Graphical View of Big5 in ICU's Converter Explorer
  • 教育部標準字體 Download page of the Taiwan Ministry of Education fonts
  • 文獻處理實驗室 Download pages of the CDP font
  • Hong Kong Supplementary Character Set Info Downloadable HKSCS documents & font
  • 香港參考宋體 Download page of Dynalab(華康科技有限公司)'s HKSCS font.
  • Microsoft's Windows Codepage 950 (Traditional Chinese Big5)
  • on.cc Download page of the OPG font
  • 中國海字集視窗版(v3.0)下載網頁 Download page of the ChinaSea font
  • Big5 Codeset Overview