
Los alfabetos chino, japonés y coreano (también conocidos como CJK ) comparten un origen común, denominados colectivamente caracteres CJK . Durante el proceso de unificación Han , se identificaron los caracteres comunes (compartidos) y se les denominó ideogramas unificados CJK . A partir de Unicode 17.0 , Unicode define un total de 101.996 caracteres. [ 1 ]
El término ideogramas es un nombre inapropiado, ya que la escritura china no es ideográfica sino logográfica , pero se eligió por ser más común en inglés. [ 2 ]
Hasta principios del siglo XX, Vietnam también utilizaba caracteres chinos ( Chữ Nôm ), por lo que a veces se utiliza la abreviatura CJKV .
Fuentes
El Grupo de Investigación Ideográfica (IRG) es responsable del desarrollo de extensiones a los repertorios codificados de ideogramas unificados CJK. El IRG procesa las propuestas de nuevos ideogramas unificados CJK presentadas por sus organismos miembros y, tras varias rondas de revisión por expertos, presenta un conjunto consolidado de caracteres al Grupo de Trabajo 2 (GT2) del Comité Técnico Conjunto 1/Comité 2 de la ISO/IEC (ISO/IEC JTC 1/SC 2 ) y al Comité Técnico de Unicode (UTC) para su posible inclusión en las normas ISO/IEC 10646 y Unicode . Los siguientes organismos miembros del IRG han participado en la estandarización de los ideogramas unificados CJK:
- Porcelana
- Hong Kong
- Japón
- Corea del Norte
- Corea del Sur
- Macao
- Taiwán , miembro de enlace representado por la Asociación de Informática de Taipéi (TCA).
- Vietnam
- Comité Técnico de Unicode (miembro de enlace, que también representa a los Estados Unidos ) [ 3 ] [ 4 ]
- Reino Unido
- Comité de la base de datos de textos SAT Daizōkyō (miembro de enlace)
Los ideogramas presentados por la UTC y el Reino Unido no son específicos de ninguna región en particular, sino que son caracteres cuya codificación ha sido sugerida por expertos individuales. Los ideogramas presentados por SAT son necesarios para la base de datos de textos SAT Daizōkyō .
La tabla a continuación muestra la cantidad de ideogramas unificados CJK codificados para cada fuente IRG para Unicode 17.0. [ 5 ] La cantidad total de caracteres (267.742) supera con creces la cantidad de ideogramas unificados CJK codificados (101.996) ya que muchos caracteres tienen más de una fuente.
Fuentes UTC
La mayoría de los caracteres presentados por el UTC al IRG se derivan de documentos del Comité Técnico Unicode (UTC). [ 6 ] Otras fuentes incluyen:
- Diccionario chino-inglés ABC de John DeFrancis
- La colección de glifos Adobe-CNS1
- La colección de glifos Adobe-Japan1
- Una lista completa de especies y subespecies de aves chinas (中国鸟类系统检索)
- El gran diccionario Nom ( Đại Tự Điển Chữ Nôm )
- Anotaciones a Shuowen Jiezi (anotadas por Duan Yucai )
- GB18030-2000
- Lista de personajes requeridos proporcionada por La Iglesia de Jesucristo de los Santos de los Últimos Días (Hong Kong)
- Nuevo diccionario de prensa comercial (商務新詞典), Hong Kong
- Diccionario chino moderno (现代汉语词典), de la Academia China de Ciencias Sociales , Instituto de Investigación Lingüística, Oficina Editorial del Diccionario
- Documentos del Grupo de Trabajo (GT2)
Pedidos
El orden de los ideogramas unificados CJK dentro de los bloques Unicode (sin contar los añadidos posteriormente) se determinó inicialmente consultando los siguientes cuatro diccionarios. Principalmente, se ordenaron según el Diccionario Kangxi , y los demás diccionarios se consultaron, en orden, para los caracteres que no se encontraban en el Diccionario Kangxi, para determinar qué carácter del Diccionario Kangxi debían seguir en el orden. [ 7 ]
- Diccionario Kangxi
- Dai Kan-Wa Jiten
- Hanyu Da Zidian
- Dae Jaweon
Este sistema no se utiliza para los bloques Unicode añadidos más recientemente. El Grupo de Investigación Ideográfica ya no utiliza el Dae Jaweon, [ 8 ] ni el Dai Kan-Wa Jiten, [ 9 ] en su trabajo. El Diccionario Kangxi y el Hanyu Da Zidian todavía se utilizan [ 8 ] tanto en las referencias de fuentes de caracteres existentes, [ 10 ] como posibles reemplazos para las referencias de fuentes existentes que se descubrieron erróneas. [ 11 ] Del mismo modo, aunque anteriormente se proporcionaba un índice del Diccionario Kangxi (real o virtual) como parte de los datos de envío para los caracteres de origen UTC, esto ya no es así. [ 12 ] En su lugar, el tipo de trazo del primer trazo residual (primer trazo que no forma parte del radical ) se proporciona con todos los caracteres enviados y se utiliza para ordenar los caracteres con el mismo radical y número de trazos dentro del nuevo bloque Unicode. [ 13 ]
Bloques de ideogramas unificados CJK
Ideogramas unificados CJK
El bloque básico denominado Ideogramas Unificados CJK (4E00–9FFF) contiene 20.992 caracteres chinos básicos en el rango U+4E00 a U+9FFF. Este bloque incluye no solo caracteres del sistema de escritura chino , sino también kanji del sistema de escritura japonés , hanja coreano y caracteres chữ Nôm vietnamitas. Muchos caracteres de este bloque se utilizan en los tres sistemas de escritura , mientras que otros se utilizan solo en uno o dos de ellos.
Este bloque también se conoce como Repertorio y Ordenación Unificados ( URO ), especialmente cuando es necesario diferenciarlo de los otros bloques de Ideogramas Unificados CJK. [ 14 ]
Los primeros 20.902 caracteres del bloque están ordenados según el orden de radicales del Diccionario Kangxi . En este sistema, los caracteres que se escriben con menos trazos aparecen primero. Los caracteres restantes se añadieron posteriormente, por lo que no siguen el orden de radicales.
El bloque es el resultado de la unificación Han , [ 15 ] que fue algo controvertida dentro de Asia Oriental. [ 16 ] Dado que los caracteres individuales utilizados en más de uno de los idiomas chino, japonés y coreano se codificaron en la misma ubicación, y las convenciones tipográficas modernas y los planes de estudio de escritura a mano difieren ligeramente entre regiones (no necesariamente a lo largo de las fronteras lingüísticas; por ejemplo, Hong Kong y Taiwán , que utilizan el chino tradicional , tienen convenciones locales ligeramente diferentes), [ 17 ] la apariencia de un glifo seleccionado podría depender de la fuente particular que se esté utilizando. Sin embargo, el URO aplica la regla de separación de fuentes , lo que significa que los pares de caracteres tratados como distintos en un conjunto de caracteres utilizado como fuente para el URO (por ejemplo, JIS X 0208 como se usa en, por ejemplo, Shift JIS ) seguirían siendo pares de caracteres separados en la nueva codificación Unicode. [ 18 ]
Mediante selectores de variación , es posible especificar ciertos ideogramas CJK variantes dentro de Unicode. [ 19 ] El conjunto de caracteres Adobe-Japan1 , que tiene 14.684 secuencias de variación ideográfica , [ 20 ] es un ejemplo extremo del uso de selectores de variación. [ 21 ]
Gráficos
Fuentes
Nota: La mayoría de los caracteres aparecen en múltiples fuentes, por lo que la suma de los recuentos de caracteres individuales (108.493) es mucho mayor que el número de caracteres codificados (20.992). [ 22 ]
En Unicode 4.1, se asignaron 14 caracteres HKSCS-2004 y 8 caracteres GB 18030 entre los puntos de código U+9FA6 y U+9FBB. Desde entonces, se han añadido otros caracteres a este bloque por diversos motivos, todos ellos resumidos en la sección de historial de versiones que aparece a continuación.
Extensión A de los ideogramas unificados CJK
El bloque denominado Extensión A de Ideogramas Unificados CJK (3400–4DBF) contiene 6.592 caracteres adicionales en el rango U+3400 a U+4DBF.
Gráficos
Fuentes
Nota: La mayoría de los caracteres aparecen en más de una fuente, por lo que la suma de los recuentos de caracteres individuales (23.997) es mucho mayor que el número de caracteres codificados (6.592). [ 22 ]
Extensión B de los ideogramas unificados CJK
El bloque denominado Extensión B de Ideogramas Unificados CJK (20000–2A6DF) contiene 42.720 caracteres en el rango U+20000 a U+2A6DF. Estos incluyen la mayoría de los caracteres utilizados en el Diccionario Kangxi que no están en el bloque básico de Ideogramas Unificados CJK, así como muchos caracteres Hán-Nôm que se usaban anteriormente para escribir vietnamita.
Gráficos
20000–215FF , 21600–230FF , 23100–245FF , 24600–260FF , 26100–275FF , 27600–290FF , 29100–2A6DF .
Fuentes
Nota: Muchos caracteres aparecen en más de una fuente, por lo que la suma de los recuentos de caracteres individuales (100.887) es mucho mayor que el número de caracteres codificados (42.720). [ 22 ]
Extensión C de ideogramas unificados CJK
El bloque denominado Extensión C de Ideogramas Unificados CJK (2A700–2B73F) contiene 4160 caracteres en el rango U+2A700 a U+2B73F. Se añadió inicialmente en Unicode 5.2 (2009).
Gráficos
Fuentes
Nota: Algunos caracteres aparecen en más de una fuente, por lo que la suma de los recuentos de caracteres individuales (4967) es mayor que el número de caracteres codificados (4160). [ 22 ]
Extensión D de los ideogramas unificados CJK
El bloque denominado Extensión D de Ideogramas Unificados CJK (2B740–2B81F) contiene 222 caracteres en el rango U+2B740 a U+2B81D que se agregaron en Unicode 6.0 (2010).
Gráficos
Fuentes
Nota: Algunos caracteres aparecen en más de una fuente, por lo que la suma de los recuentos de caracteres individuales (260) es mayor que el número de caracteres codificados (222). [ 22 ]
Extensión E de los ideogramas unificados CJK
El bloque denominado Extensión E de Ideogramas Unificados CJK (2B820–2CEAF) contiene 5774 caracteres en el rango U+2B820 a U+2CEAD. Fue añadido originalmente en Unicode 8.0 (2015).
Gráficos
Fuentes
Nota: Algunos caracteres aparecen en más de una fuente, por lo que la suma de los recuentos de caracteres individuales (6272) es mayor que el número de caracteres codificados (5774). [ 22 ]
Extensión F de los ideogramas unificados CJK
El bloque denominado Extensión F de Ideogramas Unificados CJK (2CEB0–2EBEF) contiene 7473 caracteres en el rango U+2CEB0 a 2EBE0 que se agregaron en Unicode 10.0 (2017). Incluye más de 1000 caracteres Sawndip para Zhuang .
Gráficos
Fuentes
Nota: Algunos caracteres aparecen en más de una fuente, por lo que la suma de los recuentos de caracteres individuales (8.015) es mayor que el número de caracteres codificados (7.473). [ 22 ]
Extensión G de los ideogramas unificados CJK
Se añadió un bloque llamado Extensión G de Ideogramas Unificados CJK como parte de Unicode 13.0 al Plano Ideográfico Terciario en el rango U+30000 a U+3134F, que contiene 4939 caracteres. [ 25 ]
Gráficos
Fuentes
Nota: Algunos caracteres aparecen en más de una fuente, por lo que la suma de los recuentos de caracteres individuales (5239) es mayor que el número de caracteres codificados (4939). [ 22 ]
Extensión H de los ideogramas unificados CJK
Se añadió un bloque llamado Extensión H de Ideogramas Unificados CJK como parte de Unicode 15.0 al Plano Ideográfico Terciario en el rango U+31350 a U+323AF, que contiene 4192 caracteres. [ 26 ]
Gráficos
Fuentes
Nota: Algunos caracteres aparecen en más de una fuente, por lo que la suma de los recuentos de caracteres individuales (4541) es mayor que el número de caracteres codificados (4192). [ 22 ]
Extensión I de los ideogramas unificados CJK
Se añadió un bloque llamado CJK Unified Ideographs Extension I como parte de Unicode 15.1 al plano ideográfico suplementario en el rango U+2EBF0 a U+2EE5F, que contiene 622 caracteres. [ 27 ]
Gráficos
Fuentes
Nota: Algunos caracteres aparecen en más de una fuente, lo que hace que la suma de los recuentos de caracteres individuales (625) sea mayor que el número de caracteres codificados (622). [ 22 ]
Extensión J de los ideogramas unificados CJK
Como parte de Unicode 17.0, se añadió un bloque denominado CJK Unified Ideographs Extension J al plano ideográfico terciario en el rango U+323B0-U+33479, que contiene 4298 caracteres.
Gráficos
Fuentes
Nota: Algunos caracteres aparecen en más de una fuente, lo que hace que la suma de los recuentos de caracteres individuales (4406) sea mayor que el número de caracteres codificados (4298). [ 22 ]
Ideogramas de compatibilidad CJK
El bloque denominado Ideogramas de compatibilidad CJK (F900–FAFF) se creó para mantener la compatibilidad bidireccional con otros estándares.
Sin embargo, doce caracteres en este bloque en realidad tienen la propiedad de "ideograma unificado": U+FA0E 﨎, U+FA0F 﨏, U+FA11 﨑, U+FA13 﨓, U+FA14 﨔, U+FA1F 﨟, U+FA21 﨡, U+FA23 﨣, U+FA24 﨤, U+FA27 﨧, U+FA28 﨨 y U+FA29 﨩. [ 1 ] Ninguno de los otros caracteres en este y otros bloques de "compatibilidad" se relaciona con la unificación CJK.
Si bien 龜 y 亀 no se consideran unificables, U+FA20蘒CJK COMPATIBILITY IDEOGRAPH-FA20 se considera un duplicado de U+8612蘒CJK UNIFIED IDEOGRAPH-8612 .
Gráficos
Fuentes
Nota: Todos los caracteres aparecen en más de una fuente, por lo que la suma de los recuentos de caracteres individuales (40) es mayor que el número de caracteres codificados (12). [ 22 ]
Problemas conocidos
Desunificación
U+4039
El carácter U+4039 (䀹) era una unificación de dos caracteres diferentes (uno con la fonética jiā夾 y otro con la fonética shǎn㚒) hasta Unicode 5.0. Sin embargo, eran caracteres léxicamente diferentes que no deberían haberse unificado; tienen pronunciaciones y significados diferentes.
La propuesta de desunificación de U+4039 [ 28 ] fue aceptada para Unicode 5.1, codificando un nuevo carácter en U+9FC3 (鿃) para representar shǎn.
Otros 3 glifos en la extensión B
En la extensión B de los ideogramas unificados CJK, algunos caracteres se unificaron incorrectamente con otros. Estos caracteres incluyen U+2017B (𠅻), U+204AF (𠒯) y U+24CB2 (𤲲). Los dos primeros caracteres contenían una unificación errónea de la fuente china y vietnamita de su glifo, mientras que el último unifica las fuentes china y taiwanesa. [ 29 ]
Los glifos para U+2017B ( ��) y U+204AF ( ��) se corrigieron en la versión 10.0, y el glifo fuente erróneo UCS2003 U+24CB2 ( �) se eliminó en la versión 13.0.
Variantes unificables y duplicados exactos
También en CJK Unified Ideographs Extension B, cientos de variantes de glifos fueron codificadas por error. [ 30 ] Además, un informe de ISO/IEC JTC 1/SC 2 ha encontrado que seis duplicados exactos (donde el mismo carácter ha sido codificado inadvertidamente dos veces) y dos semiduplicados (donde el carácter CJK-B representa una desunificación de facto de dos formas de glifos unificadas en el carácter BMP correspondiente) fueron codificados por error: [ 31 ]
- U+34A8 㒨 = U+20457 𠑗 : U+20457 es el mismo que el glifo de origen chino para U+34A8, pero es significativamente diferente del glifo de origen taiwanés para U+34A8.
- U+3DB7 㶷 = U+2420E 𤈎 : mismas formas de glifos
- U+8641 虁 = U+27144 𧅄 : U+27144 es el mismo que el glifo de origen coreano para U+8641, pero es significativamente diferente de los glifos de origen de China continental, Taiwán y Japón para U+8641.
- U+204F2 𠓲 = U+23515 𣔕 : mismas formas de glifos, pero ordenadas bajo radicales diferentes
- U+249BC 𤦼 = U+249E9 𤧩 : mismas formas de glifos
- U+24BD2 𤯒 = U+2A415 𪐕 : mismas formas de glifos, pero ordenadas bajo radicales diferentes
- U+26842 𦡂 = U+26866 𦡦 : mismas formas de glifos
- U+FA23 﨣 = U+27EAF 𧺯 : mismas formas de glifos (U+FA23 﨣 es un ideograma CJK unificado, a pesar de su nombre "IDEOGRAMA DE COMPATIBILIDAD CJK-FA23").
Otros ideogramas CJK en Unicode, no en Unified.
Además de los once bloques de "Ideogramas Unificados", Unicode cuenta con aproximadamente una docena de bloques más con caracteres CJK no unificados. Estos son principalmente radicales, trazos, signos de puntuación, marcas, símbolos y caracteres de compatibilidad CJK. Si bien algunos caracteres tienen sus contrapartes (descomponibles) en otros bloques, sus usos pueden variar. Un ejemplo de carácter CJK no unificado es U+3007 〇 NÚMERO IDEOGRÁFICO CERO en el bloque de Símbolos y Puntuación CJK . Aunque no está incluido en los "Ideogramas Unificados CJK", se trata como un carácter CJK a todos los demás efectos. [ 32 ]
Se incluyen cuatro bloques de caracteres de compatibilidad para garantizar la compatibilidad con sistemas de procesamiento de texto heredados y conjuntos de caracteres antiguos:
- Compatibilidad con caracteres CJK (3300–33FF)
- Formularios de compatibilidad CJK (FE30–FE4F)
- Ideogramas de compatibilidad CJK (F900–FAFF)
- Suplemento de ideogramas de compatibilidad CJK (2F800–2FA1F)
Incluyen caracteres para la disposición vertical del texto y caracteres de texto enriquecido que Unicode recomienda manejar por otros medios. Por lo tanto, se desaconseja su uso.
Base de datos de Unihan
La base de datos Unihan, mantenida por el Consorcio Unicode, proporciona información sobre todos los caracteres Han unificados codificados en el Estándar Unicode, incluyendo correspondencias con diversos estándares nacionales e industriales, índices en diccionarios estándar, variantes codificadas, pronunciaciones en varios idiomas y una definición en inglés. La base de datos está disponible al público como archivos de texto [ 33 ] y a través de un sitio web interactivo. [ 34 ] [ 35 ] Este último también incluye glifos representativos y definiciones de palabras compuestas extraídas de los proyectos de diccionarios gratuitos EDICT (japonés) y CEDICT (chino) (que se proporcionan para mayor comodidad y no forman parte formal del Estándar Unicode).
Compatibilidad con fuentes
Los bloques Ideogramas Unificados CJK y Extensión A de Ideogramas Unificados CJK, que forman parte del Plano Multilingüe Básico , son compatibles con la mayoría de las fuentes CJK . Sin embargo, las fuentes japonesas y coreanas suelen tener menos caracteres (alrededor de 13 000 y 8 000, respectivamente) que las chinas. Las extensiones B, C y D son compatibles con las fuentes adicionales MingLiU-ExtB, MingLiU_HKSCS-ExtB, PMingLiU-ExtB y SimSun-ExtB incluidas en Microsoft Windows desde Vista. [ 36 ]
Historial de versiones de Unicode
Véase también
Notas
- ↑ Caracteres presumiblemente destinados a caracteres chinos de Singapur , pero aparentemente una colección ad hoc en lugar de unestándar nacional de Singapur . [ 24 ]
Referencias
- 1 2 "Unicode PropList.txt" . 30-06-2025 . Consultado el 11-09-2025 .
- ↑ "Preguntas frecuentes - Chino y japonés" . Preguntas frecuentes de Unicode . Archivado del original el 30 de diciembre de 2025. Consultado el 20 de enero de 2026 .
- ↑ Coordinador del IRG (10/12/2024). "Lista de expertos del IRG" . ISO/IEC JTC1 / SC2 /WG2/ IRG N2769.
- ↑ Lunde, Ken (13 de septiembre de 2024). "Informe de actividad de US/Unicode para la reunión IRG n.° 63" (PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N2700.
- ↑ "Unihan_IRGSources.txt" . 24/07/2025 . Consultado el 12/09/2025 .
- ↑ "UAX #45: Ideogramas de origen U" . Consorcio Unicode. 24 de julio de 2025.
- ↑ "18.1.7. Disposición de ideogramas Han" . El estándar Unicode: especificación principal . Versión 16.0.0. Consorcio Unicode .
- 1 2 "3.3. Índices del diccionario" . Base de datos Unicode Han (Unihan) . UAX #38.
Tres de las propiedades del diccionario representan índices oficiales del IRG para los diccionarios utilizados en el algoritmo de ordenación de cuatro diccionarios. Dos (
y
) todavía son utilizados por el IRG, pero el otro (
) no lo es.
kIRGHanyuDaZidiankIRGKangXikIRGDaeJaweon - ↑ Lunde, Ken (1 de septiembre de 2022). «Propuesta para eliminar/mejorar las propiedades provisionales de la base de datos Unihan» (PDF) . pág. 6. UTC L2/22-188.
Además, el IRG ya no utiliza este diccionario para su trabajo en curso.
- ↑ «kIRG_GFuente» . Base de datos Unicode Han (Unihan) . UAX#38.
GKX: Ideógrafos del Diccionario Kangxi (康熙字典) novena edición (1958), incluido el apéndice (康熙字典)補遺. GHZ: Ideografías de Hanyu Dazidian (漢語大字典).
- ^ Lunde, Ken (22 de febrero de 2018). "Cambios y correcciones propuestos en kIRG_GSource" (PDF) . UTCL2 /18-065; ISO/IEC JTC1 / SC2 /WG2/ IRG N2297.
- ↑ "2. Datos de archivo de texto" . Ideogramas de origen U. Consorcio Unicode . UAX n.° 45.
Un índice del diccionario KangXi para el ideograma, tal como se describe en el Anexo n.° 38 del estándar Unicode, "Base de datos Unicode Han (Unihan)" [UAX38]. Este campo ya no se utiliza y no contiene datos.
- ↑ Lunde, Ken (30-09-2024). "Propuesta para eliminar el valor FS (primer trazo residual) de las presentaciones" (PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N2713.
Este documento propone que se elimine la inclusión de los valores del primer trazo residual (también conocido como FS) de los requisitos de presentación para los nuevos ideogramas unificados CJK […] El editor de proyectos ISO/IEC 10646, al compilar un conjunto de trabajo IRG en un nuevo bloque de extensión de ideogramas unificados CJK, utiliza los valores FS para ordenar los ideogramas que comparten el mismo valor Radical-Trazo (Radical + SC).
- ^ Lunde, Ken (16 de septiembre de 2012). "URÓ" . Blog tipo CJK . Adobe Inc.
- ↑ El estándar Unicode 4.0, Apéndice A - Historia de la unificación Han
- ↑ Suzanne Topping, "La vida secreta de Unicode" . Archivado del original el 14 de noviembre de 2007. Consultado el 12 de mayo de 2010 .
{{cite web}}: CS1 maint: bot: estado de la URL original desconocido ( enlace ) - ↑ Lu, Qin (2015-06-08). "El conjunto de caracteres propuesto para Hong Kong" (PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N2074.
- ↑ " Capítulo 11 - Escrituras de Asia Oriental ", El estándar Unicode, 4.0 .
- ↑ "Base de datos de variación ideográfica" . 13 de septiembre de 2022. Consultado el 20 de septiembre de 2022 .
- ↑ "Estadísticas de IVD" . 14 de julio de 2025. Consultado el 12 de septiembre de 2025 .
- ↑ PRI 108: Registro combinado de la colección Adobe Japan1 y de las secuencias de dicha colección.
- 1 2 3 4 5 6 7 8 9 10 11 12 "Unihan_IRGSources.txt (de Unihan.zip)" . 2025-07-24 . Recuperado el 2025-09-12 .
- 1 2 3 4 5 6 7 8 9 10 11 12 "UAX #38: Base de datos Unicode Han (Unihan)" . Consorcio Unicode.
- ↑ Lunde, Ken (2009). «Capítulo 3: Estándares de conjuntos de caracteres § Estándares de conjuntos de caracteres chinos—Singapur». Procesamiento de información CJKV (2.ª ed.). Sebastopol, California: O'Reilly Media, Inc. pág. 130. ISBN 978-0-596-15611-4OCLC 317878469. Se desconoce , al menos para mí,
hasta qué punto estos 226 caracteres son
ad hoc
o están codificados según una norma nacional de Singapur. Sospecho que son
ad hoc
simplemente por la aparente falta de una norma nacional en Singapur
. - ↑ "Unicode 13.0.0" . 10 de marzo de 2020. Consultado el 10 de marzo de 2020 .
- ↑ "Unicode 15.0.0" . 13 de septiembre de 2022. Consultado el 14 de septiembre de 2022 .
- ↑ "Unicode 15.1.0" . 12 de septiembre de 2023. Consultado el 12 de septiembre de 2023 .
- ↑ Andrew West y John Jenkins, propuesta de desunificación de U+4039
- ↑ Eiso Chan (陈永聪), Comentarios sobre cuatro glifos erróneos en los Ideogramas Unificados CJK Ext B y E.
- ↑ Taichi Kawabata. "IRGN1155 Posibles duplicados" (.zip) . Consultado el 22 de junio de 2019 .
- ↑ Cook, Richard (6 de octubre de 2003). "Informe de defectos sobre formas CJK codificadas duplicadas" (PDF) . ISO/IEC JTC1/SC2/WG2 . Recuperado el 21 de agosto de 2025 .
- ^ GB/T 15835-2011《出版物上数字用法》. China Guojia Biaozhun. https://journals.usst.edu.cn/uploadfile/file/GBT%2015835-2011%E3%80%8A%E5%87% BA%E7%89%88%E7%89%A9%E4%B8%8A%E6%95%B0%E5%AD%97%E7%94%A8%E6%B3%95%E3%80%8B.pdf
- ↑ "Unihan.zip" . El estándar Unicode . Consorcio Unicode.
- ↑ "Búsqueda en la base de datos Unihan" . El estándar Unicode . Consorcio Unicode.
- ↑ "Búsqueda en la base de datos Unihan: Ejemplo de búsqueda para 中" . El estándar Unicode . Consorcio Unicode.
- ^ Lunde, Ken (2009). Procesamiento de Información CJKV . O'Reilly. págs. 633–634 . ISBN 978-0-596-51447-1.
Enlaces externos
- Ideogramas de origen británico (Documentos IRG N2107R2 e IRG N2232R)
- Unicode
- Codificaciones de caracteres chinos