Articulo de referencia

Ideogramas de compatibilidad CJK

El bloque de ideogramas de compatibilidad CJK es un bloque Unicode creado para contener principalmente caracteres Han que fueron codificados en múltiples ubicaciones en otras co...

El bloque de ideogramas de compatibilidad CJK es un bloque Unicode creado para contener principalmente caracteres Han que fueron codificados en múltiples ubicaciones en otras codificaciones de caracteres establecidas, además de sus asignaciones de ideogramas unificados CJK , con el fin de mantener la compatibilidad bidireccional entre Unicode y esas codificaciones. Sin embargo, también contiene 12 ideogramas unificados provenientes de conjuntos de caracteres japoneses de IBM .

El bloque tiene docenas de secuencias de variación ideográfica registradas en la base de datos de variación ideográfica de Unicode (IVD). [ 4 ] [ 5 ] Estas secuencias especifican la variante de glifo deseada para un carácter Unicode dado.

Fuentes de los personajes

Las fuentes para la colección original de ideogramas de compatibilidad CJK incluyen:

  • Código KS X 1001 de Corea del Sur (U+F900 U+FA0B, 268 caracteres; consulte esa página para obtener la explicación).
  • Las cinco grandes empresas taiwanesas (U+FA0C U+FA0D, 2 caracteres)
  • "IBM 32": 32 caracteres japoneses de IBM (U+FA0E U+FA2D; véase más abajo)

En versiones posteriores del estándar, se han añadido más caracteres al bloque, desde:

  • Código KS X 1001 de Corea del Sur (U+FA2E U+FA2F, 2 caracteres)
  • JIS X 0213 japonés (U+FA30 U+FA6A, 59 caracteres)
  • Estándar japonés ARIB STD-B24 (U+FA6B U+FA6D, 3 caracteres)
  • Código postal norcoreano KPS 10721-2000 (U+FA70 U+FAD9, 106 caracteres)

Los caracteres "IBM 32"

El EBCDIC japonés de doble byte de IBM incluye varios kanji que no existen en JIS X 0208 o que no se traducen desde él . Estos se incluyeron como gaiji en extensiones de Shift JIS y EUC-JP de IBM (p. ej. , página de códigos 942 ), NEC , la Open Software Foundation y Microsoft (p. ej., página de códigos 932 de Windows ). Sin embargo, no se utilizaron como fuente para el Repertorio y Ordenamiento Unificado (URO) original. En cambio, 32 de los kanji de extensión de IBM, aquellos que no se habían incluido en el URO de otras fuentes, se incluyeron en el bloque de Ideogramas de Compatibilidad CJK en el rango U+FA0E U+FA2D.

De estos 32 caracteres:

  • 19 son unificables con caracteres en el URO y, por lo tanto, son ideogramas de compatibilidad en sentido estricto.
  • 12 son caracteres kokuji que en realidad son ideogramas unificados (con la Unified_Ideographpropiedad y que no cambian al normalizarse). A pesar de su inclusión en el bloque de Ideogramas de Compatibilidad CJK y sus nombres de caracteres generados algorítmicamente que comienzan con " CJK COMPATIBILITY IDEOGRAPH", no son duplicados de caracteres en el bloque original de Ideogramas Unificados CJK en ningún aspecto; [ 6 ] [ 7 ] 11 de estos 12 no son duplicados en absoluto, mientras que U+FA23CJK COMPATIBILITY IDEOGRAPH-FA23 fue posteriormente duplicado involuntariamente en CJK Unified Ideographs Extension B como U+27EAF 𧺯 CJK UNIFIED IDEOGRAPH-27EAF . Se colocan allí porque no tienen una codificación URO, sin embargo, IBM 32 es una de las codificaciones donde las codificaciones duplicadas son motivo de preocupación. Todos ellos se usan raramente o son variantes de kanji comunes. Son los siguientes:
  • IDEOGRAMA DE COMPATIBILIDAD U+FA0ECJK-FA0E
  • IDEOGRAMA DE COMPATIBILIDAD U+FA0FCJK-FA0F
  • IDEOGRAMA DE COMPATIBILIDAD U+FA11CJK-FA11
  • IDEOGRAMA DE COMPATIBILIDAD U+FA13CJK-FA13
  • IDEOGRAMA DE COMPATIBILIDAD U+FA14CJK-FA14
  • IDEOGRAMA DE COMPATIBILIDAD U+FA1FCJK-FA1F
  • IDEOGRAMA DE COMPATIBILIDAD U+FA21CJK-FA21
  • IDEOGRAMA DE COMPATIBILIDAD U+FA23CJK-FA23
  • IDEOGRAMA DE COMPATIBILIDAD U+FA24CJK-FA24
  • IDEOGRAMA DE COMPATIBILIDAD U+FA27CJK-FA27
  • IDEOGRAMA DE COMPATIBILIDAD U+FA28CJK-FA28
  • IDEOGRAMA DE COMPATIBILIDAD U+FA29CJK-FA29
  • De manera singular, ( U+FA20CJK COMPATIBILITY IDEOGRAPH-FA20 ) está destinado a ser codificado como la forma kyūjitai de un kokuji que recibió una codificación separada para una variante que es directamente la forma shinjitai (extendida) U+8612CJK UNIFIED IDEOGRAPH-8612 . El URO solo codificó la forma shinjitai y utiliza su número de trazos para colocarla en esta posición. Es además una variante de las muchas variantes del kanji jinmeiyō U+8429CJK UNIFIED IDEOGRAPH-8429 (es decir, Kummerowia ). A U+FA20 se le asignó una normalización a U+8612, aunque los componentes 龜 y 亀, si bien ambas son formas del radical 213 , no suelen considerarse unificables. [ 8 ]

Bloquear

Historia

Los siguientes documentos relacionados con Unicode recogen el propósito y el proceso de definición de caracteres específicos en el bloque de ideogramas de compatibilidad CJK:

Véase también

Referencias

  1. "Base de datos de caracteres Unicode" . El estándar Unicode . Consultado el 26 de julio de 2023 .
  2. "Versiones enumeradas del estándar Unicode" . El estándar Unicode . Consultado el 26 de julio de 2023 .
  3. "3.5: Área de uso privado" (PDF) . El estándar Unicode, versión 1.0, volumen 1. Consorcio Unicode . 1991. págs. 118–119 . ISBN  0-201-56788-1.
  4. "Base de datos de variación ideográfica" . Consorcio Unicode.
  5. "UTS #37, Base de datos de variación ideográfica Unicode" . Consorcio Unicode.
  6. "PropList.txt" . Consorcio Unicode.
  7. Freytag, Asmus; McGowan, Rick; Whistler, Ken (14 de junio de 2021). "Anomalías conocidas en los nombres de caracteres Unicode" . Consorcio Unicode . Nota técnica Unicode n.° 27. Estos 12 caracteres son ideogramas CJK unificados, no ideogramas de compatibilidad, a pesar de sus nombres.
  8. Grupo de Investigación Ideográfica (19/11/2024). "Lista resumida de variaciones de componentes no unificables del ideograma UCS (NUCV)". Listas UCV y NUCV (PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N2746.