KPS 9566 (" Conjunto de caracteres gráficos coreanos estándar de la RPDC para el intercambio de información ") [ 2 ] es un estándar norcoreano que especifica una codificación de caracteres para el sistema de escritura Chosŏn'gŭl (Hangul) utilizado para el idioma coreano . La edición de 1997 especificó un conjunto de caracteres codificados de dos bytes de 94×94 conforme a la norma ISO 2022. Las ediciones posteriores han añadido caracteres codificados adicionales fuera del plano de 94×94, de manera comparable a UHC o GBK . [ 3 ]
KPS 9566 difiere en su enfoque de KS X 1001 , su contraparte surcoreana , al usar un orden diferente de Chosŏn'gŭl, [ 4 ] al codificar formas explícitas de presentación vertical de la puntuación, al no codificar Hanja duplicado para lecturas múltiples, y al incluir varios caracteres específicos del sistema político norcoreano, incluyendo codificaciones especiales para los nombres de los líderes pasados y presentes del país ( Kim Il Sung , Kim Jong Il y Kim Jong Un ). [ 1 ] [ 2 ] [ 3 ] [ 5 ]
Aunque KPS 9566 fue la fuente original de varios caracteres añadidos a Unicode , [ 6 ] no todos los caracteres de KPS 9566 tienen equivalentes Unicode. Aquellos que no los tienen se asignan a caracteres Unicode similares o al Área de Uso Privado . [ 7 ]
Antecedentes y otros estándares
El conjunto de caracteres ASCII se originó en los Estados Unidos en 1963 y fue revisado en 1967 a la forma que tiene hoy. [ 8 ] ASCII también fue aceptado como estándar internacional en 1967, convirtiéndose en ECMA-6, [ 8 ] designado ISO/IEC 646 por la Organización Internacional de Normalización . [ 9 ] Actualmente se designa como ANSI X3.4-1986 e ISO 646:1991. [ 10 ] ASCII era una codificación de 7 bits, de un solo byte, que incluía 94 caracteres gráficos, el espacio y 33 códigos de control , que proporcionaba soporte básico para representar texto en inglés americano como una serie de bytes. [ 8 ] [ 10 ]
La siguiente edición de ISO 646, publicada en 1972, revisó el estándar para introducir el concepto de versiones nacionales del código, lo que permitió a los países reemplazar algunos códigos menos comunes con sus propios caracteres requeridos. Al mismo tiempo, se estaba trabajando en la definición de mecanismos de extensión para ASCII, con la intención de que fueran aplicables tanto a entornos de 7 bits como de 8 bits. Esto se completó en 1973 y se publicó como JIS X 0202 , ECMA-35 e ISO 2022. [ 11 ] ISO 2022 especifica mecanismos para usar conjuntos de caracteres de un byte y de varios bytes con una estructura determinada tanto en entornos de 7 bits como de 8 bits, y para declararlos y alternar entre ellos de forma estándar usando códigos de desplazamiento y secuencias de escape . [ 12 ]
Los países del este de Asia , debido al uso de amplios repertorios de caracteres chinos , introdujeron codificaciones estandarizadas de doble byte (DBCS) para sus sistemas de escritura, ya que la cantidad de caracteres representables en un código de un solo byte no era suficiente. En una DBCS compatible con ISO 2022, cada carácter puede representarse con dos bytes de caracteres de impresión ASCII; La ubicación de un carácter puede referenciarse mediante estos valores de byte, o mediante dos números del 1 al 94 (un kuten ), iguales a los bytes respectivos menos 32. [ 13 ] El primer DBCS registrado conforme a ISO 2022, y el primer DBCS de Asia Oriental en establecerse como estándar nacional, fue la primera edición de JIS X 0208 (Japón), publicada en 1978. [ 14 ] [ 15 ] A este le siguió GB 2312 (China continental) en 1980, y por el código Wansung (Corea del Sur; designado por primera vez KS C 5601-1987) en 1987. [ 16 ] [ 15 ] Big5 (Taiwán), definido en 1984, no siguió la estructura ISO 2022. [ 16 ] Cuando se utilizaban en un entorno de 8 bits (en lugar de 7 bits), los códigos GB 2312 y Wansung se utilizaban normalmente con el octavo bit activado, mientras que ASCII o un SBCS similar se utilizaban con el octavo bit desactivado; estos esquemas de codificación se conocen como EUC-CN y EUC-KR , respectivamente. [ 17 ]
Aunque el sistema de escritura coreano incluye símbolos individuales ( jamo ) para consonantes y vocales, que funcionan como un alfabeto , el texto coreano se compone correctamente con estos símbolos organizados en bloques para cada sílaba. El código Wansung incluía bloques de sílabas coreanas individuales por separado, tratándolos como un gran conjunto de caracteres de forma similar al Hanja , [ 18 ] y fue definido por primera vez por la tercera edición del estándar surcoreano KS C 5601. La primera edición había definido una codificación de jamo individuales que permitía codificar los bloques de sílabas como secuencias, que se denominó Hangul de N bytes , y no se adoptó tan ampliamente como se pretendía. [ 19 ] [ 20 ]
El código Wansung no codificaba todas las sílabas coreanas modernas posibles, solo una selección de las 2350 más comunes, [ 2 ] aunque permitía especificarlas usando secuencias combinatorias, que a menudo no eran compatibles. [ 18 ] Una codificación alternativa, también surcoreana, llamada Johab sí lo hacía, y sirvió como competidora de Wansung durante algún tiempo. [ 19 ] El Código Unificado de Hangul (UHC), introducido por Microsoft con Windows 95 , extendió EUC-KR, permitiendo el uso de códigos de doble byte EUC no válidos para representar todas las demás sílabas disponibles en Johab. [ 18 ] Un enfoque similar fue adoptado por la codificación GBK de China continental , extendiendo GB 2312 con soporte para chino tradicional y para caracteres chinos menos comunes codificándolos en códigos de doble byte no válidos en EUC-CN . [ 16 ]
Corea del Sur no fue el único país que desarrolló un sistema de codificación de base de datos ISO 2022 para el coreano: el GB 12052 de China continental se publicó en 1989. Este no guardaba una estrecha relación con el código Wansung, aunque también incluía sílabas compuestas. En cambio, correspondía al GB 2312 con sílabas coreanas (y 94 caracteres Hanja ) que reemplazaban los caracteres chinos, excepto por la inclusión de un signo de dólar en lugar de un signo de yuan. Fue desarrollado para su uso por la minoría coreana en el noreste de China. [ 2 ]
Asimismo, Corea del Norte desarrolló el KPS 9566. Aunque tanto Corea del Norte como Corea del Sur utilizan el coreano Chosŏn'gŭl (Hangul) como su sistema de escritura principal, emplean diferentes órdenes lexicográficos . [ 21 ] Por lo tanto, el orden de los caracteres difiere entre el código Wansung y el KPS 9566. [ 4 ]
KPS 9566 ha sufrido varias revisiones, incluidas las ediciones de 1997 y 2003, [ 22 ] principalmente para mejorar la compatibilidad con Unicode . Estas se suelen indicar especificando el año (por ejemplo, KPS 9566-97, 9566-2003). La edición actual, a la fecha de lanzamiento de Red Star OS 3.0, parece ser KPS 9566-2011, que añade a Kim Jong Un a la lista de líderes. [ 3 ] La tabla de códigos disponible públicamente para la edición de 1997 de KPS 9566 muestra un plano ISO 2022 de 94×94. [ 23 ] Las ediciones más recientes, según las fuentes de información disponibles fuera de Corea del Norte, parecen definir asignaciones adicionales fuera del plano EUC (de forma similar a GBK o UHC). [ 3 ]
Debido a los problemas de interoperabilidad derivados del uso de múltiples estándares nacionales y codificaciones de caracteres propietarias específicas de plataformas o fuentes, se desarrolló el estándar Unicode con la intención de permitir el intercambio de todo texto representable en un único formato universal. La primera edición de Unicode se publicó en 1991 y 1992, [ 24 ] y la norma ISO/IEC 10646 se estableció en sincronía con Unicode en 1993. [ 25 ] Los formatos Unicode son los preferidos para el uso internacional en la World Wide Web , donde las codificaciones de caracteres heredadas se tratan como codificaciones parciales de Unicode mediante archivos de mapeo. [ 26 ] [ 27 ]
Diseño
En principio, KPS 9566 es similar al conjunto de caracteres Wansung definido por el estándar surcoreano KS X 1001 , aunque no son compatibles. Ambos codifican una sección de puntuación, símbolos, jamo , kana y caracteres alfabéticos, seguidos de un subconjunto de las posibles sílabas modernas de Chosŏn'gŭl, seguido de una sección de Hanja . [ 2 ] Sin embargo, KPS 9566 utiliza un orden diferente de jamo y sílabas para ajustarse a los estándares de ordenación lexicográfica de Corea del Norte . [ 4 ] KPS 9566 también incluye 28 caracteres de puntuación rotados explícitamente para tipografía vertical, que KS X 1001 no incluye, y codifica cada Hanja solo una vez, mientras que KS X 1001 codifica varios Hanja con múltiples lecturas varias veces. [ 2 ]
KPS 9566-97 codifica un total de 2679 sílabas Chosŏn'gŭl y 4653 Hanja. Esto proporciona una mejor cobertura que las 2350 sílabas codificadas por el código Wansung: por ejemplo, el carácter 똠 utilizado en el nombre de 똠방각하 , una destacada obra literaria coreana, no tiene un punto de código Wansung asignado, pero sí uno (38-02) en KPS 9566. [ 2 ] La sección Hanja incluye 4652 caracteres del Repertorio y Ordenación Unificados y uno de la Extensión A de Ideogramas Unificados CJK . La totalidad de la fila 15, la segunda mitad de la fila 44 (después del bloque de sílabas) y la segunda mitad de la fila 94 (después del bloque Hanja) pueden utilizarse para fines definidos por el usuario. [ 23 ] [ 2 ]
KPS 9566 se distingue especialmente por la inclusión de varios caracteres especiales de la vida política norcoreana. Específicamente, incluye el emblema del Partido de los Trabajadores de Corea , el martillo, la hoz y el pincel, tanto sin círculo como con círculo [ 7 ] (puntos de código 12-01 y 12-02), [ 23 ] y dos grupos de tres caracteres especiales que deletrean los nombres de los líderes norcoreanos Kim Il Sung ( 김일성 ) y Kim Jong Il ( 김정일 ) en una fuente decorativa especial (puntos de código 04-72 a 04-74 y 04-75 a 04-77, respectivamente). [ 28 ] Las sílabas de Kim e Il, que son idénticas en la ortografía de ambos nombres, están codificadas dos veces. KPS 9566-2011 incluye además el nombre de Kim Jong Un ( 김정은 ) como puntos de código 04-78 a 04-80. [ 3 ] [ 5 ]
Debido a estos caracteres especiales, actualmente no existe una compatibilidad bidireccional completa entre KPS 9566 y Unicode, a menos que los caracteres no admitidos se asignen al Área de uso privado . [ 1 ]
KPS 10721
Corea del Norte también desarrolló un segundo conjunto de caracteres, KPS 10721 " Código del conjunto suplementario de Hanja coreano para el intercambio de información ", [ 29 ] que se publicó en 2000. KPS 10721 codifica un conjunto de al menos 19469 Hanja [ 2 ] adicionales a los incluidos en KPS 9566. A partir de 2009, estos no tenían todos mapeos a Unicode, pero incluían 10358 del Repertorio y Ordenación Unificados , 3187 de la Extensión A de Ideogramas Unificados CJK y 107 de Ideogramas de Compatibilidad CJK (todos en el Plano Multilingüe Básico ), así como 5767 de la Extensión B de Ideogramas Unificados CJK y 50 del Suplemento de Ideogramas de Compatibilidad CJK (en el Plano Ideográfico Suplementario ). [ 2 ] Todos los Hanja KPS 9566 también están incluidos en KPS 10721, [ 30 ] que utiliza una estructura de codificación diferente, no relacionada con ISO 2022.
Además del mapeo de estos Hanja (excluyendo aquellos también en KPS 9566) [ 30 ] a Unicode, se sabía poco sobre el estándar KPS 10721 fuera de Corea del Norte [ 2 ] [ 5 ] antes de 2022. Los glifos de referencia norcoreanos se proporcionaron solo para un subconjunto de estos Hanja en las tablas de códigos Unicode, debido a la falta de datos de fuente adecuados disponibles para el Consorcio Unicode. [ 31 ] [ 30 ] Los caracteres Hanja Unicode con fuentes KPS 9566 o KPS 10721 se referencian cruzadamente a sus códigos KPS en la base de datos Unihan con la clave kIRG_KPSource; los códigos fuente Unihan usan "KP0" para referirse a KPS 9566 y "KP1" para KPS 10721. [ 32 ]
En 2022, se aisló una fuente Hanja de la aplicación norcoreana Okpyon para Android , que se utilizó para corregir algunos errores en los datos de mapeo de KPS-10721 a Unicode y para proporcionar nuevos glifos de referencia norcoreanos para las tablas de códigos Unicode; mientras se hacía, también se dedujeron los mapeos de KPS 9566 Hanja a KPS 10721. [ 30 ] [ 33 ] [ 34 ] Los glifos de referencia existentes se actualizaron en abril de 2022, [ 33 ] listos para la publicación de Unicode 15 en septiembre de 2022, [ 35 ] mientras que el Grupo CJK y Unihan del Consorcio Unicode recomendó en noviembre de 2022 que el Comité Técnico de Unicode incluyera los glifos de referencia adicionales en la siguiente versión de Unicode, [ 36 ] para ser incluidos en Unicode 15.1 en septiembre de 2023. [ 37 ]
Documentación y relación con Unicode
La cobertura inicial de sílabas coreanas de Unicode , añadida en la versión 1.0, se basó en el código Wansung. En la versión 2.0 de Unicode, se añadió un nuevo bloque de sílabas coreanas (el actual bloque de sílabas Hangul ), basado en el repertorio de sílabas disponible en Johab, y se eliminó el bloque anterior (ahora está ocupado por la Extensión A de Ideogramas Unificados CJK ). Esto se hizo bajo el supuesto de que aún no existían datos coreanos codificados en Unicode, pero se conoció como el "caos coreano", y los comités responsables se comprometieron a no realizar un cambio tan incompatible en el futuro, [ 38 ] un compromiso codificado por la Política de Estabilidad de Unicode. [ 39 ]
La tabla de códigos para KPS 9566-97, publicada en abril de 1997, [ 2 ] se presentó al Registro Internacional de Conjuntos de Caracteres Codificados de la ISO para su registro y uso con ISO/IEC 2022. Se registró en junio de 1998 con el número ISO-IR-202 . Esta tabla de códigos está disponible públicamente en la Sociedad de Procesamiento de la Información de Japón . [ 23 ]
En agosto de 1999, el organismo nacional norcoreano presentó un documento al WG2 ( ISO/IEC JTC 1/SC 2 Grupo de Trabajo 2), el organismo ISO responsable de la norma ISO/IEC 10646 , el estándar internacional equivalente a Unicode . Este documento solicitaba la adición de los códigos KPS 9566 a las referencias cruzadas existentes de las tablas de ideogramas unificados CJK , la adición de 80 caracteres de símbolos de KPS 9566 que no tenían asignaciones Unicode existentes, una solución a la diferencia en el orden de intercalación entre KPS 9566 y Unicode (debido a que el orden de los caracteres en Unicode sigue las codificaciones surcoreanas) y la adición de 8 jamo combinatorios. También solicitó al WG2 que editara los nombres de caracteres y bloques Unicode existentes para usar el término "carácter coreano" en lugar de "Hangul". [ 40 ] Una versión ampliada de esta propuesta, dividida en varios documentos, se presentó como un elemento de trabajo en diciembre de 1999. [ 41 ]
En marzo de 2000, el representante sueco presentó una respuesta detallada en la que se oponía a varios puntos y explicaba el voto de Suecia en contra de la propuesta. En dicha respuesta, afirmaba que modificar nuevamente la codificación de los caracteres coreanos causaría graves trastornos, incluso mayores que la primera vez, cuando existían relativamente pocas implementaciones, pero que, en retrospectiva, no debería haberse hecho. Explicaba que pocos idiomas, o ninguno, pueden cotejarse correctamente mediante el valor del punto de código, y que para ello debería utilizarse una adaptación del algoritmo de cotejo Unicode o de la norma ISO/IEC 14651 (que entonces se estaba elaborando). Asimismo, señalaba que, debido a la política de estabilidad, no se podían cambiar los nombres normativos de los caracteres ya asignados, aunque sí podían emplearse traducciones no normativas a otros idiomas. Sugería que el organismo norcoreano podría proporcionar un archivo de correspondencia legible por máquina entre Unicode y KPS 9566, lo que resultaría más útil que una tabla de referencias cruzadas impresa en el documento estándar. Respecto a los caracteres adicionales propuestos, la respuesta indicó que no se deberían agregar caracteres que presentaran descomposiciones de compatibilidad en Unicode y que no se deberían agregar logotipos, incluidos los de partidos políticos, ni caracteres especiales para nombres de personas particulares. [ 42 ]
En mayo de 2000, el organismo norcoreano presentó una propuesta al Grupo de Relatores Ideográficos (IRG), que opera bajo el Grupo de Trabajo 2 (WG2), para incluir las correspondencias KPS 9566 y KPS 10721 para los caracteres del Repertorio y Ordenación Unificados , Ideogramas Unificados CJK Extensión A , Extensión B y Extensión C. [ 43 ] Esto acompañó una tabla de correspondencias entre KPS 10721 y CJK Extensión C para 339 hanja, [ 44 ] y una copia de la lista bibliográfica combinada de KPS 9566 y KPS 10721. [ 29 ]
En julio de 2000, el organismo norcoreano escribió al Grupo de Trabajo 2 (GT2) acusándolos de haber desarrollado ambas versiones de la codificación Unicode para el coreano basándose únicamente en propuestas surcoreanas, sin consultar a Corea del Norte. Los acusaron de anteponer los intereses comerciales de las empresas y el temor a la confusión internacional al respeto a la soberanía de Corea del Norte, y afirmaron que Corea del Norte consideraría una nueva negativa a cambiar el nombre y el orden de los caracteres coreanos en Unicode como un insulto a su dignidad soberana y como una violación de la imparcialidad de la ISO . Reiteraron su exigencia de que el GT2 y Unicode "corrigieran" el orden de los caracteres coreanos y "corrigieran" los nombres "Hangul Jamo" y "Hangul Syllable" a "Korean Alphabet" y "Korean Syllable". [ 4 ]
En agosto de 2000, el organismo nacional norcoreano presentó una versión más detallada de sus solicitudes en una serie de cinco propuestas consecutivas. Estas solicitaban la adición de 14 caracteres jamo adicionales, [ 45 ] la adición de 82 caracteres de símbolos, [ 46 ] y el uso del término "alfabeto coreano" en lugar de "Hangul", [ 47 ] proporcionaron evidencia de apoyo para el orden de cotejo norcoreano, [ 21 ] y solicitaron la adición del repertorio Hanja norcoreano. [ 48 ] Estas propuestas fueron discutidas en dos reuniones entre representantes de Corea del Norte, Corea del Sur , Suecia y otros WG2 en septiembre de 2000, en las que se solicitó al organismo norcoreano que proporcionara evidencia manuscrita para los caracteres jamo adicionales, que volviera a presentar su propuesta de símbolos eliminando los símbolos que ya habían sido aceptados en Unicode, y que considerara el uso de ISO/IEC 14651 , entonces en etapa de borrador final, para fines de cotejo. [ 49 ]
En septiembre de 2001, el organismo nacional norcoreano presentó una serie revisada de propuestas solicitando la adición de varios caracteres KPS 9566 y KPS 10721, incluidos 70 caracteres de símbolos, a Unicode. [ 50 ] [ 51 ] En esta versión de la propuesta, se incluyó una sección de extractos de documentos que demostraban el uso de varios caracteres y breves explicaciones de su propósito. El símbolo del Partido de los Trabajadores de Corea se denominó "Martillo, hoz y pincel", [ 50 ] renombrado de "Marca del Partido de los Trabajadores de Corea" en versiones anteriores de la propuesta, [ 46 ] y justificado como utilizado como símbolo de identificación en mapas. [ 50 ] Como justificación para los caracteres propuestos para los nombres de los líderes, explicaron que los nombres de los líderes a menudo aparecen con un tamaño y grosor de fuente diferentes en las publicaciones norcoreanas con el propósito de enfatizarlos. [ 50 ] Un seguimiento realizado por representantes surcoreanos del GMT2 solicitó pruebas, nombres en coreano y justificaciones para agregar algunos de estos caracteres, y señaló que ya existían versiones sin énfasis de los caracteres para los nombres de los líderes. [ 52 ]
En octubre de 2001 se convocó una reunión de representantes de Corea del Norte y Corea del Sur del Grupo de Trabajo 2 (GT2), que recomendó 47 caracteres simbólicos para su incorporación a Unicode y sugirió que los nombres de los líderes y los símbolos del Grupo de Trabajo de Corea (GTK) se plantearan para su posterior debate en el GT2. [ 53 ] Más tarde ese mismo mes, el organismo norcoreano presentó al IRG un conjunto de tablas de correspondencias entre Unicode y KPS 9566 y 10721, que abarcaban únicamente los caracteres hanja. [ 54 ] [ 55 ] [ 56 ] [ 57 ] En noviembre de 2001, el Consorcio Unicode y el organismo nacional de Estados Unidos solicitaron a los representantes de Corea del Norte y Corea del Sur que prepararan una tabla de correspondencias adicional entre KS X 1001 y KPS 9566 y 10721. [ 58 ]
Un documento de retroalimentación posterior de febrero de 2002 sobre las adiciones propuestas por Corea del Norte solicitó que el símbolo de "té" para una casa de té se aceptara como un símbolo más general de "bebida caliente", equiparándolo con los símbolos utilizados en las guías para denotar bebidas calientes o no alcohólicas. También recomendó que el glifo de referencia para el punto de código existente para un paraguas sin lluvia se modificara para armonizar con el glifo de referencia propuesto para el paraguas con lluvia, equiparándolos con los símbolos de "mantener seco" utilizados en los envases, y planteó la cuestión de qué símbolos de rayo y advertencia de alto voltaje en las colecciones de símbolos existentes podrían unificarse con el carácter propuesto de "alto voltaje". [ 59 ] Los tres caracteres fueron aceptados en Unicode en la versión 4.0. [ 60 ] También recomendó que las fracciones con barra horizontal y las tijeras que apuntan hacia arriba a la izquierda se codificaran utilizando un selector de variación , ya que las tijeras no acompañaban a un par de tijeras con una orientación diferente, y ya que los puntos de código de fracción Unicode existentes unificaban las formas sesgadas y horizontales. [ 59 ]
En noviembre de 2002, el organismo surcoreano publicó un conjunto completo de tablas de tres vías que relacionaban los caracteres entre las normas KPS 9566, KS X 1001 (como EUC-KR) e ISO/IEC 10646, tal como existían en el año 2000. Estas tablas se habían preparado sin la participación de Corea del Norte. [ 61 ]
En agosto de 2004, un individuo con el nombre "ooprojlover" envió al proyecto OpenOffice.org un par de tablas de correspondencia entre KPS 9566-2003 y Unicode , afirmando que representaban la versión actualizada del estándar KPS 9566 y solicitando que se añadiera compatibilidad. [ 22 ] Estos archivos asignaban los caracteres no disponibles en Unicode al Área de Uso Privado e incluían formas codificadas adicionales para otros bloques de sílabas fuera del plano principal ISO-IR-202. Posteriormente, en 2011, el Consorcio Unicode publicó una tabla de correspondencia basada en estos datos, pero con los errores corregidos con referencia al gráfico ISO-IR. [ 1 ]
Las copias de Red Star OS 3.0 incluyen fuentes para una edición más reciente de KPS 9566, que parece ser KPS 9566-2011. La tabla de correspondencia utilizada internamente por Red Star OS se ha extraído con éxito. Además de añadir a Kim Jong Un a la lista de líderes, KPS 9566-2011 modifica las correspondencias de ciertas formas verticales en comparación con las correspondencias de 2003 (aprovechando el bloque de Formas Verticales añadido en Unicode 4.1), y también incluye varios caracteres Hanja y símbolos adicionales codificados fuera del plano ISO-IR-202. Varios de estos símbolos adicionales también están asignados al Área de Uso Privado; sin embargo, se desconoce su identidad, ya que no se conocen nombres ni glifos de referencia para esos caracteres fuera de Corea del Norte. [ 3 ]
Impacto en Unicode hoy
Varios caracteres Unicode actuales se añadieron a Unicode 4.0 como resultado de las propuestas norcoreanas, aunque no siempre en los puntos de código propuestos originalmente. Estos incluyen BEBIDA CALIENTE (☕, propuesto como SÍMBOLO DE TÉ), que se propuso como símbolo de mapa para marcar una casa de té , y los símbolos de bandera BANDERA BLANCA (⚐) y BANDERA NEGRA (⚑), que se propusieron como símbolos de mapa para lugares de batallas y victorias militares. [ 6 ] Estos caracteres se propusieron para los puntos de código provisionales U+270A, U+268E y U+268F respectivamente, [ 53 ] pero se codificaron en los puntos de código finales U+2615, U+2690 y U+2691 respectivamente. [ 62 ] También incluyen una serie de flechas direccionales en negrita en el rango U+2B05 a U+2B0D, [ 53 ] excluyendo una flecha hacia la derecha, que se asignó a un carácter existente en el bloque Dingbats , [ 63 ] que se agregaron en los mismos puntos de código para los que se propusieron, además de que las flechas noreste y noroeste se intercambiaron en comparación con la propuesta. [ 64 ]
Otros caracteres pictográficos que se incluyeron en la propuesta norcoreana incluyen el paraguas con gotas de lluvia (☔), el rayo para alto voltaje (⚡) y el triángulo de advertencia (⚠). [ 53 ] Después de algunas discusiones sobre qué otros glifos de símbolos de alto voltaje en uso representaban el mismo carácter que el de la propuesta norcoreana, [ 59 ] y qué glifo sería mejor incluir para él en la tabla de códigos Unicode, [ 65 ] y después de la modificación del glifo de la tabla de códigos del carácter existente del paraguas sin lluvia (U+2602, ☂) para armonizar con el nuevo paraguas con gotas de lluvia de la propuesta norcoreana, [ 59 ] [ 67 ] estos caracteres también se agregaron en Unicode 4.0, al mismo tiempo que las banderas y el símbolo de bebida. [ 60 ] [ 62 ] [ 65 ] Aunque se propusieron para los puntos de código provisionales U+2618, U+267F y U+267E, [ 53 ] se les dieron los puntos de código finales U+2614, U+26A1 y U+26A0 respectivamente. [ 62 ]
De estos caracteres, la bebida caliente, el paraguas con gotas de lluvia, el rayo y el triángulo de advertencia, y las flechas hacia arriba, hacia abajo y hacia la izquierda fueron seleccionados posteriormente como asignaciones de los conjuntos de emojis celulares japoneses , [ 68 ] lo que da un total de siete emojis Unicode actuales que fueron agregados originalmente a Unicode a petición de Corea del Norte. El paraguas con gotas de lluvia y las flechas hacia arriba, hacia abajo y hacia la izquierda también se unificaron con caracteres de las extensiones ARIB utilizadas en la radiodifusión japonesa, [ 69 ] que incluyen varios caracteres ahora clasificados como emoji, [ 70 ] y se asignaron a Unicode en Unicode 5.2. [ 71 ] Sin embargo, el par de banderas blancas y negras utilizadas como emoji o en secuencias de banderas regionales y de identidad de emoji es un conjunto diferente, "ondeando" agregado en Unicode 7.0 (U+1F3F3 🏳 y U+1F3F4 🏴), [ 72 ] [ 73 ] no el par norcoreano.
A partir de 2018, varios caracteres KPS 9566 permanecían sin asignar a Unicode. Estos incluyen el símbolo WPK, cuatro marcas triangulares, un par de tijeras que apuntan hacia la izquierda (excluidas con el argumento de que no se había demostrado su uso contrastivo con las tijeras que apuntan hacia la derecha en el bloque Dingbats ), una manícula que apunta hacia arriba dentro de un círculo, formas de presentación vertical de signos de puntuación, variantes de corchetes de cierre que incorporan puntos , variantes con barra horizontal de fracciones vulgares codificadas por separado de sus versiones inclinadas, y los nombres de los líderes. [ 74 ]
Una marca postal japonesa con un triángulo apuntando hacia abajo se incluyó en KPS 9566-97 pero se eliminó en KPS 9566-2003 [ 1 ] después de que el organismo norcoreano la retirara de su propuesta Unicode para revisión [ 75 ] en respuesta a las solicitudes del organismo surcoreano de evidencia del uso del símbolo en Corea del Norte. [ 52 ] Esta marca se volvió a proponer en 2018 sobre la base de la compatibilidad con KPS 9566, y se identificó como una marca de conformidad eléctrica utilizada en Japón antes de su reemplazo por el diamante PSE . [ 76 ] Se agregó a Unicode en la versión 13.0, publicada en 2020.
Formularios codificados
La edición de 1997 de KPS 9566 se registró en el Registro Internacional de Conjuntos de Caracteres Codificados para su Uso con Secuencias de Escape como ISO-IR-202, [ 23 ] y, por lo tanto, puede codificarse utilizando ISO/IEC 2022. Es un conjunto G de 94 n bytes múltiples, es decir, si se utiliza en un código ISO 2022 de 7 bits (análogo a ISO-2022-JP o ISO-2022-KR ), los caracteres se codificarán con pares de bytes entre 0x21 y 0x7E cuando esté en el modo apropiado.
Las asignaciones documentadas entre KPS 9566 y Unicode para las ediciones de 2003 [ 22 ] [ 1 ] y 2011 [ 3 ] de KPS 9566 utilizan una codificación que se asemeja a una adaptación del Código Unificado Hangul (UHC) para codificar KPS 9566 en lugar del código Wansung, con sus versiones actualizadas del plano ISO-IR-202 codificadas usando pares de bytes entre 0xA1 y 0xFE, y con otros códigos de dos bytes utilizados para sílabas no presentes en ISO-IR-202. El orden de las sílabas extendidas sigue el orden habitual de KPS 9566. De forma similar a UHC, utilizan bytes iniciales 0x81 y superiores, y bytes finales de los rangos 0x41 – 0x5A, 0x61 – 0x7A y 0x81 – 0xFE, excluyendo el rango 0xA1 – 0xFE si el byte inicial es 0xA1 o superior. [ 3 ]
La edición de 2011 también incluye varios caracteres Hanja adicionales y símbolos codificados fuera del plano ISO-IR-202, después del rango utilizado para los bloques de sílabas extendidas. [ 3 ] Este enfoque es similar al adoptado por GBK , pero con los bytes de cola permaneciendo en los rangos de estilo UHC: al igual que las sílabas extendidas con bytes de inicio 0xA1 y superiores, todos estos utilizan los rangos de bytes de cola 0x41 – 0x5A, 0x61 – 0x7A y 0x81 – 0xA0. Los caracteres Hanja extendidos se codifican con bytes de inicio entre 0xC8 y 0xDC, los símbolos extendidos se codifican utilizando bytes de inicio entre 0xE0 y 0xEA, y los códigos extendidos con bytes de inicio entre 0xEC y 0xFE se asignan, sin espacios, al Área de Uso Privado [ 3 ] (compárese con los rangos definidos por el usuario en GBK). Varios de los caracteres de la sección de símbolos extendidos y tres de la sección Hanja también se asignan al Área de Uso Privado de Unicode; a diferencia de los símbolos asignados al PUA en el plano principal ISO-IR-202, se desconoce la identidad de estos caracteres. [ 3 ]
byte principal
Este cuadro detalla la disposición general del plano principal del conjunto de caracteres KPS 9566 por byte inicial. [ 23 ] Para los bytes iniciales utilizados para caracteres distintos de las sílabas compuestas de Chosŏn'gŭl o Hanja, se proporcionan enlaces a los cuadros de esta página que enumeran los caracteres codificados bajo ese byte inicial. Para los bytes iniciales utilizados para Hanja, se proporcionan enlaces a la sección correspondiente del índice de Hanja de Wikcionario .
Cuando se proporcionan dos números hexadecimales, el valor inferior a 0x7F se utiliza en una codificación de 7 bits, [ a ] y el valor mayor (entre 0xA1 y 0xFE) se utiliza en una codificación de estilo EUC de 8 bits. [ 17 ] Las codificaciones extendidas de estilo UHC de 8 bits definidas a partir de la edición de 2003 también utilizan los valores de byte mayores, entre 0xA1 y 0xFE inclusive, para el plano principal basado en ISO-IR-202. [ 1 ] [ 3 ]
Conjuntos no Hanja, no compuestos en el plano principal
Conjunto de caracteres 0x21/0xA1 (número de fila 1, puntuación y formas verticales)
Este conjunto contiene signos de puntuación comunes para oraciones, como corchetes, comillas, comas, etc., así como formas de presentación para su uso en escritura vertical. La puntuación ASCII (resaltada) se muestra a continuación asignada a puntos de código latinos básicos (de forma coherente con los artículos sobre otros conjuntos de caracteres CJK, como KS X 1001 o JIS X 0208 ), pero se asigna al bloque de formas de ancho medio y ancho completo cuando se utiliza en una codificación que combina KPS 9566 con ASCII (como se define, por ejemplo, en la edición de 2003). [ 1 ]
En comparación con la asignación de 2003, la asignación de 2011 cambia las asignaciones Unicode de tres formas de presentación vertical para aprovechar el bloque de Formas Verticales introducido con Unicode 4.1. [ 3 ]
Conjunto de caracteres 0x22/0xA2 (fila número 2, símbolos y operadores)
Este conjunto incluye operadores matemáticos y otros símbolos como el signo de ampersand , el signo de pila , la nota musical , etc. La puntuación ASCII (resaltada) se muestra a continuación asignada a los puntos de código del latín básico (de forma coherente con los artículos sobre otros conjuntos de caracteres CJK), pero se asigna al bloque de formas de ancho medio y ancho completo cuando se utiliza en una codificación que combina KPS 9566 con ASCII . [ 1 ]
En esta fila se incluyen varios símbolos triangulares de "marcas viales" que indican la presencia de montañas o pendientes al frente o a un lado, pero que actualmente no están incluidos en Unicode. Se encuentran asignados al Área de Uso Privado. [ 50 ]
Conjunto de caracteres 0x23/0xA3 (fila número 3, dígitos y caracteres romanos)
Este conjunto incluye un subconjunto de ASCII , sin signos de puntuación ni símbolos, que comprende los números arábigos occidentales y ambos casos del alfabeto latino básico . Compárese con la fila 3 de JIS X 0208 , que coincide exactamente con esta fila. Compárese con la fila 3 de KS X 1001 y GB 2312 , que incluyen sus variantes nacionales completas de ISO 646 en esta fila, en lugar de solo el subconjunto alfanumérico.
Los caracteres de esta fila se muestran a continuación asignados a puntos de código latinos básicos (de forma coherente con los artículos sobre los demás conjuntos de caracteres), pero se asignan al bloque de formas de ancho medio y ancho completo cuando se utilizan en una codificación que combina KPS 9566 con ASCII . [ 1 ]
Conjunto de caracteres 0x24/0xA4 (número de fila 4, nombres de Chosŏn'gŭl jamo y líderes)
Este conjunto contiene Chosŏn'gŭl jamo , así como codificaciones especiales para los nombres de (a partir de 2003) los líderes norcoreanos Kim Il Sung y Kim Jong Il . El nombre de Kim Jong Un también se incluye a partir de la edición de 2011. [ 3 ] Hay tres caracteres asignados para cada nombre, aunque algunos de ellos son idénticos entre nombres. Compárese con la fila 4 de KS X 1001 .
Los jamo de esta fila que existen en el bloque Jamo de compatibilidad con Hangul de Unicode (que contiene los caracteres independientes de la posición mapeados desde KS X 1001) se mapean a ese bloque. Los jamo obsoletos que distinguen las sibilantes palatalizadas se mapean a los caracteres específicos de la posición en el bloque Jamo de Hangul . [ 1 ] Por el contrario, no todos los jamo obsoletos codificados por KS X 1001 están codificados en el plano principal de KPS 9566. En la edición de 2011 de KPS 9566, algunos de los otros jamo históricos de KS X 1001 se incluyen fuera del plano principal, con el byte inicial 0xEA . [ 3 ]
Las codificaciones especiales de los nombres de los líderes no están presentes en Unicode y se asignan al Área de Uso Privado. Se muestran a continuación simuladas con formato.
Conjunto de caracteres 0x25/0xA5 (fila número 5, cirílico)
Este conjunto incluye ambos casos de 33 letras del alfabeto cirílico , suficientes para escribir el alfabeto ruso moderno y el alfabeto búlgaro , aunque otras formas del cirílico requieren letras adicionales. [ 80 ]
Compare la fila 12 de KS X 1001 y la fila 7 de JIS X 0208 , que utilizan el mismo diseño (pero en una fila diferente).
Conjunto de caracteres 0x26/0xA6 (fila número 6, letras griegas y números romanos)
Este conjunto contiene números romanos y soporte básico para el alfabeto griego , sin diacríticos ni la sigma final .
Compare y contraste la fila 5 de KS X 1001 (que utiliza los mismos caracteres pero en una disposición diferente y en una fila diferente) y la fila 6 de JIS X 0208 (que utiliza la misma disposición para las letras griegas, pero sin los números romanos).
Conjunto de caracteres 0x27/0xA7 (número de fila 7, encerrado en un círculo, superíndice, subíndice, fracciones)
Varios números encerrados en un círculo en esta fila se asignaron incorrectamente a Unicode en la edición de 2003, debido al uso de puntos de código propuestos no definitivos. [ 1 ] Se corrigieron en la edición de 2011. [ 3 ]
Conjunto de caracteres 0x28/0xA8 (número de fila 8, unidad, cantidad y símbolos de moneda)
Este conjunto contiene símbolos para unidades de medida y moneda. Los presentes en ASCII (resaltados) se muestran a continuación asignados a puntos de código latinos básicos (de forma coherente con los artículos sobre otros conjuntos de caracteres CJK), pero se asignan al bloque de formas de ancho medio y ancho completo cuando se utilizan en una codificación que combina KPS 9566 con ASCII . [ 1 ]
El símbolo Kelvin fue reemplazado por el símbolo del euro en la edición de 2003. [ 1 ] La edición de 2011 incluye una codificación alternativa del símbolo Kelvin en 0xE988 . [ 3 ]
Comparar y contrastar con el repertorio de símbolos de unidades incluidos en la fila 7 de KS X 1001 .
Conjunto de caracteres 0x29/0xA9 (número de fila 9, dibujo de caja)
Conjunto de caracteres 0x2A/0xAA (número de fila 10, Hiragana)
Esta fila contiene caracteres Hiragana para su uso en el idioma japonés .
Compare la fila 10 de KS X 1001 , que utiliza el mismo diseño. Compare y contraste la fila 4 de JIS X 0208 , que también utiliza el mismo diseño, pero en una fila diferente.
Conjunto de caracteres 0x2B/0xAB (fila número 11, Katakana)
Esta fila contiene caracteres katakana para su uso en el idioma japonés . Sin embargo, la marca de vocal larga japonesa , que se utiliza en texto katakana y se incluye en la fila 1 de JIS X 0208 , no está incluida (de forma similar a GB 2312 y KS X 1001), [ 81 ] aunque KPS 9566-2011 la incluye fuera del plano principal, en 0xEA48 . [ 3 ]
Compare la fila 11 de KS X 1001 , que utiliza el mismo diseño. Compare y contraste la fila 5 de JIS X 0208 , que también utiliza el mismo diseño, pero en una fila diferente.
Conjunto de caracteres 0x2C/0xAC (fila número 12, símbolos y flechas varios)
Para el propósito de mapear esta fila a Unicode, la flecha hacia la derecha en negrita se unificó con la flecha hacia la derecha en negrita de Zapf Dingbats (U+27A1), [ 63 ] aunque tablas anteriores (que carecían de mapeos para las otras flechas en negrita) la habían unificado con U+279E, un carácter Zapf Dingbats ligeramente diferente. [ 61 ] Dado que las flechas correspondientes en otras direcciones no estaban incluidas en el bloque Dingbats , se codificaron flechas adicionales entre U+2B05 y U+2B0D para compatibilidad con KPS 9566. Estas se incorporaron a las tablas de códigos Unicode utilizando los glifos de referencia propuestos por el organismo nacional norcoreano, mientras que U+27A1 conservó su glifo de referencia basado en Zapf Dingbats. [ 63 ] Estas flechas (U+2B05 a U+2B07, más U+27A1) fueron elegidas en Unicode 6.0 como los mapeos para algunos de los caracteres de flecha en conjuntos de emojis celulares . [ 68 ] Posteriormente, durante la adición del repertorio Wingdings 3 en Unicode 7.0, se revisó la cobertura Unicode de los caracteres de flecha, lo que resultó en la adición de una flecha hacia la derecha en U+2B95 con la intención de armonizar con los caracteres U+2B05 a U+2B0D (en la presentación de texto), ya que no se consideró apropiado cambiar el glifo de referencia para el carácter Zapf Dingbats. [ 63 ]
En ediciones anteriores de KPS 9566, como la edición de 1997, esta fila incluía tanto la marca postal simple de estilo japonés (〒) como una versión en un triángulo que apunta hacia abajo, [ 50 ] [ 23 ] que fue propuesta por el organismo nacional norcoreano para su adición a Unicode junto con los otros caracteres faltantes de KPS 9566. [ 50 ] Una respuesta de un representante surcoreano , entre otras solicitudes, solicitó evidencia del uso del símbolo en Corea del Norte, señalando que la marca postal de estilo japonés no se usa en Corea del Sur, que usa un círculo 우 (es decir, ㉾) para un propósito similar, y preguntando si una marca postal de estilo japonés estaba en uso en Corea del Norte. [ 52 ] Posteriormente se celebró una reunión para discutir esta propuesta, a la que asistieron representantes del WG2 de Corea del Norte y Corea del Sur; el informe de la reunión señala que el organismo norcoreano había decidido revisar el carácter antes de discutirlo más a fondo, y por lo tanto no recomendó que el WG2 lo considerara en su conjunto. [ 75 ] El triángulo de la marca postal fue posteriormente eliminado de KPS 9566 en 2003, quedando solo la marca postal sin encerrar. [ 1 ]
El triángulo de marca postal se añadió finalmente a Unicode en la versión 13.0, tanto por compatibilidad con el carácter KPS 9566-97 anterior, como después de que la marca se identificara como un símbolo que se había utilizado para la certificación de aparatos eléctricos en Japón (como predecesor del diamante PSE ). [ 76 ]
Ciertos caracteres KPS 9566 en esta fila, a saber, dos formas del emblema del Partido de los Trabajadores de Corea , un par de tijeras que apuntan en una dirección diferente a las del bloque Dingbats , y una manícula circular que apunta hacia arriba , permanecen asignados al Área de Uso Privado . [ 1 ]
Las flechas blancas noreste y noroeste utilizaban asignaciones Unicode intercambiadas incorrectas en la edición de 2003. [ 1 ] Esto se corrigió en las asignaciones de la edición de 2011. [ 3 ]
Conjunto de caracteres 0x2E/0xAE (número de fila 14, subconjunto Latin-1)
Los caracteres de este conjunto no estaban presentes en la versión de 1997 del conjunto de caracteres, pero se añadieron en la versión de 2003. [ 1 ] Constituyen un subconjunto del bloque Suplemento Latino-1 de Unicode (equivalente a la mitad superior del conjunto de caracteres ISO 8859-1 (Latino-1)). Esto incluye letras y símbolos romanos acentuados. Algunos de los símbolos que ya estaban incluidos se omiten, mientras que otros se duplican como contrapartes de ancho medio de las formas anteriores de ancho completo : por ejemplo, el signo de negación (¬, U+00AC) se representa como 0xAEAC, mientras que su forma de ancho completo (¬, U+FFE2) se representa como 0xA2D1 (en la fila 2 ). [ 1 ]
Esta fila se omite en la asignación para la edición de 2011 del estándar, [ 3 ] lo que indica que pudo haber sido eliminada en algún momento posterior a la edición de 2003. En cambio, el símbolo del yen de ancho reducido se codifica en 0xE98E en la edición de 2011. [ 3 ]
El espacio requerido quedaría fuera del rango de 94 caracteres, entrando en conflicto con el área utilizada para las sílabas extendidas de Chosŏn'gŭl cuando se utiliza una codificación de estilo UHC (específicamente, con la sílaba 쁲), [ 1 ] y se omite. Aunque la y con trémolo también queda fuera del rango de 94 caracteres, y el byte de cola 0xFF no se utiliza de otra manera, el código 0xAEFF se asigna a él en KPS 9566-2003. [ 1 ]
Conjunto precompuesto de Chosŏn'gŭl (filas 16 a 44)
Los grupos de sílabas precompuestos de Chosŏn'gŭl se asignan puntos de código en un bloque ordenado continuo entre los puntos de código 16-01 y 44-47 inclusive. No todos los grupos posibles se asignan puntos de código. [ 82 ] Compárese el ordenamiento y la disponibilidad diferentes en KS X 1001 .
La forma codificada documentada para KPS 9566-2003 codifica el plano KPS 9566 en GR (0xA1-0xFE) y adicionalmente codifica los grupos de sílabas restantes usando bytes de inicio en el rango 0x80-0xC2 y bytes de fin en los rangos 0x41-0x5A, 0x61-0x7A y 0x81-0xFE (donde como máximo un byte está en el rango 0xA1-0xFE), [ 1 ] de manera similar al Código Hangul Unificado pero con los grupos omitidos y el orden de clasificación de KPS 9566, no KS X 1001 .
Estadísticas de jamo
Conjunto de caracteres Hanja (filas 45 a 94)
El Hanja en 69-09 (0xE5A9) se asigna a U+676E杮en todas las tablas documentadas; sin embargo, los caracteres se ordenan según sus lecturas, de donde parece que se pretende que sea U+67FF柿. [ 83 ]
Conjuntos extendidos no silábicos, no Hanja en KPS 9566-2011
A continuación se muestran los gráficos de la sección no silábica y no Hanja de KPS 9566-2011 fuera del plano principal. [ 3 ]
Conjunto de extensiones 0xE0 (símbolos y pictogramas)
Conjuntos de extensión 0xE1, 0xE2, 0xE3 (desconocido)
Todos los caracteres de estos conjuntos de extensión se corresponden con el Área de Uso Privado. Se desconoce su propósito. [ 3 ]
Conjunto de extensiones 0xE4 (flechas)
Este conjunto incluye varias flechas, en su mayoría hacia la derecha, que se corresponden con el bloque Unicode Dingbats y otros lugares. [ 3 ]
Conjunto de extensiones 0xE5 (superíndices y subíndices romanos)
Esta fila incluye varios superíndices romanos en minúscula con bytes de cola que corresponden a sus equivalentes ASCII en mayúscula, y subíndices romanos en minúscula con bytes de cola que corresponden a sus equivalentes ASCII en minúscula. [ 3 ]
Conjunto de extensiones 0xE6 (superíndices y subíndices griegos y de símbolos)
Conjunto de extensión 0xE7 (marcadores de lista adicionales)
Conjunto de extensión 0xE8
Todos los caracteres de este conjunto de extensión se asignan al Área de uso privado, excepto 0xE884 que se asigna a U+FE30 ︰ FORMATO DE PRESENTACIÓN PARA LÍDER DE DOS PUNTOS VERTICALES . [ 3 ]
Conjunto de extensiones 0xE9 (símbolos y puntuación adicionales)
Este conjunto contiene símbolos de palos de cartas de juego, varios símbolos misceláneos y contrapartes de ancho reducido para algunos de los símbolos de moneda en la fila 8. También se incluye el símbolo Kelvin , [ 3 ] habiendo sido reemplazado en la fila 8 por el símbolo del euro . [ 1 ]
Conjunto de extensión 0xEA (puntuación japonesa y jamo adicional)
Este conjunto contiene varios signos de puntuación utilizados en Japón y algunos caracteres del bloque Unicode Jamo de compatibilidad con Hangul que no están incluidos en la fila 4. [ 3 ] Esto comprende algunos de los caracteres jamo presentes en KS X 1001 , pero que anteriormente no estaban presentes en KPS 9566.
Conjuntos de extensión 0xEC–0xFE (desconocido)
Todos los caracteres de estos conjuntos de extensión se corresponden con el Área de Uso Privado. Se desconoce su propósito. [ 3 ]
Notas a pie de página
- ↑ Por ejemplo, los encabezados de la tabla ISO-IR-202 muestran códigos binarios de 7 bits, así como códigos kuten/hang-yol, para los caracteres). [ 23 ]
- 1 2 Como unconjunto de caracteres94 n compatible con ISO 2022 , el espacio simple y el carácter de borrar siempre están disponibles como códigos de un solo byte en 0x20 y 0x7F (no en 0xA0 y 0xFF) respectivamente.
- ↑ O U+223C ∼ OPERADOR DE TILDE . [ 61 ]
- ↑ Otras asignaciones usan U+00AD SOFT HYPHEN , para coincidir con KS X 1001 01-09 . [ 61 ]
- 1 2 3 4 5 En la fila 14 hay un carácter de ancho medio de este tipo; se trata específicamente de un carácter de ancho completo.
- ↑ Una forma vertical de la tilde guion. El archivo de mapeo proporcionado por el Consorcio Unicode reconoce el mapeo por nombre a U+2E2F, [ 1 ] que es utilizado por Red Star OS , [ 7 ] pero señala que el carácter Unicode está destinado a un carácter significativamente diferente (un diacrítico alto de tilde vertical de espaciado) y también enumera el mapeo U+F104 (en el Área de uso privado), [ 1 ] basado en datos de mapeo que se habían enviado al proyecto OpenOffice.org en 2004. [ 22 ] Se muestra aquí usando una imagen.
- 1 2 Un carácter que combina un punto con un corchete de cierre, asignado a Área de uso privado, se muestra aquí sustituido.
- ↑ O U+25E6 ◦ BALA BLANCA . [ 61 ]
- ↑ O U+2022 • BULLET . [ 61 ]
- 1 2 3 Mapeado a Área de Uso Privado, que se muestra aquí mediante una imagen.
- ↑ El coreano de Mac OS (HangulTalk), una codificación del código Wansung más conjuntos de extensión, codifica un carácter visualmente similar en 0xA79B, [ 77 ] que Apple asigna a la secuencia Unicode U+25B4+20E4 (▴⃤). [ 78 ] Sin embargo, no hay ningún uso documentado de esta asignación para el carácter KPS 9566.
- ↑ Aceptado para su inclusión en Unicode 16.0. [ 79 ]
- 1 2 3 4 5 6 7 8 9 Un carácter en negrita/enfatizado del nombre de un líder norcoreano, asignado a Área de uso privado, que se muestra aquí simulado con marcado.
- 1 2 3 4 5 Forma de una fracción con una barra horizontal y disposición vertical, asignada a Área de Uso Privado, mostrada aquí simulada.
- ↑ Grados Kelvin en la versión de 1997 (algunas versiones de la tabla de códigos incluyen un signo de grado en el símbolo de la unidad). Euro a partir de la versión de 2003.
- 1 2 Emblema del Partido de los Trabajadores de Corea , asignado a Área de Uso Privado, mostrado aquí mediante una imagen.
- ↑ O U+279E ➞ FLECHA PESADA CON CABEZA TRIANGULAR HACIA LA DERECHA o U+2B95 ⮕ FLECHA NEGRA HACIA LA DERECHA : ver texto.
- ↑ Aparece en las tablas de la versión de 1997 y en la propuesta Unicode N2374 de 2001. Se eliminó en la versión de 2003.
- ↑ Mapeado a U+261E (☞) en la edición de 2003. [ 1 ] La edición de 2011 lo mapea al carácter de Área de Uso Privado U+F13B. [ 3 ] El glifo de referencia es una manícula invertida, [ 23 ] [ 3 ] es decir, coincide con U+1F449 (👉︎). Compárese con 0xE04D en KPS 9566-2011.
- ↑ Manícula circular que apunta hacia arriba, asignada a Área de Uso Privado, [ 1 ] mostrada aquí mediante una imagen. Una posible asignación no perteneciente a PUA sería a la secuencia U+1F446+20DD (👆︎⃝). [ 7 ]
- ↑ Tijeras apuntando hacia arriba a la izquierda, asignadas al Área de Uso Privado, mostradas aquí mediante una imagen.
Referencias
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 " KPS 9566-2003 a Unicode" . Consorcio Unicode.Error de cita: Parámetro desconocido " (consulte la página de ayuda ).
- 1 2 3 4 5 6 7 8 9 10 11 12 Lunde, Ken (2009). Procesamiento de información CJKV: Informática china, japonesa, coreana y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . págs. 148–151 . ISBN 978-0-596-51447-1.
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 Chung, Jaemin (2018-01-05). "Información sobre la versión más reciente de KPS 9566 (KPS 9566-2011?)" (PDF) . UTC L2/18-011.
- 1 2 3 4 Cho, Chun-Hui (2000-07-05). "Carta de la RPDC sobre nombres de caracteres y ordenación en 10646-1: 2000" (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2231.
- 1 2 3 Lunde, Ken (2019-03-25). "Cuatro iguales: KS X 1001 y KPS 9566" . Blog de tipografía CJK . Adobe Inc.
- 1 2 Ewell, Doug (2002-08-15). "Re: Scripts en Unicode 4.0" . Archivo de la lista de correo de Unicode .
- 1 2 3 4 West, Andrew (2015-05-29). "Asignaciones KPS 9566 (antes Re: Símbolos de flecha)" . Archivo de la lista de correo Unicode .
- 1 2 3 Jennings, Thomas Daniel (17-03-2020) [1999]. "Una historia anotada de algunos códigos de caracteres o ASCII: Código Estándar Americano para la Infiltración de Información" . Investigación sensible (SR-IX) . Archivado del original el 22-05-2016 . Recuperado el 17-03-2020 .
- ↑ "Estándar ECMA-6: Conjunto de caracteres codificados de 7 bits" . Ecma International .
- 1 2 Lunde, Ken (2009). Procesamiento de la información CJKV: Informática china, japonesa, coreana y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . pág. 89. ISBN 978-0-596-51447-1.
- ↑ ECMA/TC 1 (1973). "Breve historia". Conjunto de caracteres codificados de entrada/salida de 7 bits (PDF) (4.ª ed.). ECMA . ECMA-6:1973.
{{citation}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ ECMA (1994). Estructura del código de caracteres y técnicas de extensión (PDF) (6.ª ed.). ECMA-35:1994.
- ↑ Lunde, Ken (2009). Procesamiento de la información en chino, japonés, coreano y vietnamita: informática (2.ª ed.). Sebastopol, CA : O'Reilly . págs. 19-20 , 581-582 . ISBN 978-0-596-51447-1.
- ↑ Lunde, Ken (2009). Procesamiento de la información CJKV: Informática china, japonesa, coreana y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . págs. 84–85 . ISBN 978-0-596-51447-1.
- 1 2 "2.4: Conjuntos de caracteres gráficos de múltiples bytes". Registro internacional de conjuntos de caracteres codificados para ser utilizados con secuencias de escape (ISO-IR) (PDF) . ITSCJ/ IPSJ . pág. 14. Archivado del original (PDF) el 12 de mayo de 2023. Recuperado el 13 de mayo de 2023 .
- 1 2 3 Lunde, Ken (2009). Procesamiento de la información CJKV: Informática china, japonesa, coreana y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . págs. 94–147 . ISBN 978-0-596-51447-1.
- 1 2 Lunde, Ken (2009). Procesamiento de la información CJKV: Informática china, japonesa, coreana y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . págs. 242–255 . ISBN 978-0-596-51447-1.
- 1 2 3 Shin, Jungshik. "¿Qué son KS X 1001 (KS C 5601) y otros códigos Hangul?" . Preguntas frecuentes sobre Hangul e Internet en Corea .
- 1 2 Hwang, Jinsang (2005). La configuración social de los estándares de las TIC: un caso de controversia sobre los estándares nacionales de conjuntos de caracteres codificados en Corea (PDF) . Universidad de Edimburgo.
- ^ Lunde, Ken (18 de diciembre de 1995). "3.3.6: Hangul de N bytes". CJK.INF Versión 1.9 .
- 1 2 Comité de Normalización de la RPD de Corea (CSK) (10 de agosto de 2000). "Evidencia para la disposición de caracteres coreanos propuesta por CSK" (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2246.
- 1 2 3 4 "Tablas de conversión entre KPS 9566-2003 (coreano del norte) y Unicode" . Apache OpenOffice (AOO) Bugzilla . 27 de agosto de 2004. Archivado del original el 2 de agosto de 2020. Recuperado el 28 de abril de 2020 .
- 1 2 3 4 5 6 7 8 9 Comité de Normalización de la RPD de Corea (22-06-1998). Conjunto de caracteres gráficos coreanos estándar de la RPD para el intercambio de información (PDF) . ITSCJ/ IPSJ . ISO-IR -202.
- ↑ Consorcio Unicode . "Historial de lanzamientos y fechas de publicación de Unicode" .
- ↑ West, Andrew (17-06-2019) [05-06-2007]. "Unicode e ISO/IEC 10646" .
- ↑ Murata, Makoto (14 de abril de 2000). "Perfil japonés XML" . Notas del W3C . W3C .
- ^ van Kesteren, Ana. Estándar de codificación . QUÉ WG .
- ↑ Lunde, Ken (1999). Procesamiento de información CJKV: Informática china, japonesa, coreana y vietnamita . Sebastopol, CA : O'Reilly . pág. 116. ISBN 1-56592-224-7.
- 1 2 El Comité de Normalización de la RPD de Corea (CSK) (2000-05-25). "Anexo: Fuentes KP-Hanja" (PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N0732.
- 1 2 3 4 Bai, Yi; Sim, CheonHyeong (2022-10-16). "Propuesta para considerar agregar soporte de CodeCharts para los glifos representativos kIRG_KPSource en Unicode" (PDF) . UTC L2/22-238.
- ↑ Cook, Richard. «P: ¿Por qué faltan los glifos de la RPDC (Corea del Norte == kIRG_KPSource) en algunas tablas de códigos CJK?» . Preguntas frecuentes - Chino y japonés . Consorcio Unicode . Archivado del original el 4 de octubre de 2022.
- ^ Jenkins, John H.; Cocinero, Richard; Lunde, Ken (5 de marzo de 2020). "Base de datos Unicode Han (Unihan)" . kIRG_KPFuente. Anexo #38 del estándar Unicode.
- 1 2 Lunde, Ken (2022-04-16). "23) Compatibilidad con la tabla de códigos para los glifos representativos de kIRG_KPSource" (PDF) . Recomendaciones del Grupo CJK y Unihan para la reunión UTC n .° 171. págs. 37–38 . UTC L2/22-067.
- ^ Sim, CheonHyeong (19 de junio de 2022). "KPS 10721:2000 (Unicode KP1源) 文件重构 (修订版)" (PDF) (en chino simplificado).
- ↑ Por ejemplo: "Ideogramas de compatibilidad CJK (§ DPRK compatibility ideographs" (PDF) . Tablas de versiones Unicode 15.0 (tablas delta) . Consorcio Unicode . 2022.
- ↑ Lunde, Ken (01/11/2022). "35) L2/22-238: Propuesta para considerar agregar soporte de CodeCharts para glifos representativos de kIRG_KPSource" (PDF) . Recomendaciones del Grupo CJK y Unihan para la reunión UTC n . ° 173. UTC L2/22-247.
- ^ Lunde, Ken (7 de febrero de 2023). "Informe de actividad de EE. UU./Unicode para el IRG n.º 60" (PDF) . UTC L2/23-058, ISO/IEC JTC1/SC2 /WG2/ IRG N2599.
- ↑ Yergeau, F. (1998). UTF-8, un formato de transformación de ISO 10646. IETF . doi : 10.17487 /rfc2279 . RFC 2279.
- ↑ "Políticas de estabilidad de la codificación de caracteres Unicode" . Consorcio Unicode. 23 de junio de 2017.
- ↑ Jo, Chun-Hui (1999-08-10). "Enmienda de la parte que contiene los caracteres coreanos en la enmienda 5 de ISO/IEC 10646-1:1998" (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2056.
- ↑ "Propuesta de nuevo elemento de trabajo (NP) para una enmienda de la parte coreana de ISO/IEC 10646-1:1993" . 7 de diciembre de 1999. L2 /99-380, ISO/IEC JTC 1 N5999.
- ↑ Karlsson, Kent (2000-03-02). "Comentarios sobre la propuesta de la RPDC de un nuevo elemento de trabajo sobre caracteres coreanos" . ISO/IEC JTC 1/SC 2 /WG 2 N2167.
- ↑ El Comité de Normalización de la RPD de Corea (CSK) (25 de mayo de 2000). "Propuesta para agregar ideogramas de la RPD de Corea a los Ideogramas Unificados CJK, extensión A, B y C de los Ideogramas Unificados CJK en la norma ISO/IEC 10646" (PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N0727.
- ↑ El Comité de Normalización de la RPD de Corea (CSK) (25 de mayo de 2000). "Propuesta para agregar 339 caracteres de la RPD de Corea a la extensión C de los ideogramas unificados CJK" (PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N0731.
- ↑ Comité de Normalización de la RPD de Corea (CSK) (10 de agosto de 2000). "Propuesta para la adición de 14 alfabetos coreanos a la norma ISO/IEC 10646-1" (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2243.
- 1 2 Comité de Normalización de la RPD de Corea (CSK) (10 de agosto de 2000). "Propuesta para la adición de 82 símbolos a ISO/IEC 10646-1" (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2244.
- ↑ Comité de Normalización de la RPD de Corea (CSK) (10 de agosto de 2000). "Propuesta para cambiar el nombre existente de los caracteres coreanos en ISO/IEC 10646-1" (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2245.
- ^ Comité de Normalización de la RPD de Corea (CSK) (10 de agosto de 2000). "Propuesta para agregar la columna Hanja de la RPD de Corea en ISO/IEC 10646-1 (14938 ideogramas a CJK Unified Ideographs y 3181 ideogramas a su Extensión [ sic ] A)" (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2247.
- ↑ Grupo ad hoc de escritura coreana (21/09/2000). "Informe de la reunión del grupo ad hoc de escritura coreana" . ISO/IEC JTC 1/SC 2 /WG 2 N2282.
- 1 2 3 4 5 6 7 Comité de Normalización de la RPD de Corea (CSK) (03-09-2001). Propuesta para añadir 70 símbolos a ISO/IEC 10646-1:2000 (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2374.Error de cita: Parámetro desconocido " (consulte la página de ayuda ).
- ↑ Comité de Normalización de la RPD de Corea (CSK) (3 de septiembre de 2001). Propuesta para añadir la tabla de códigos Hanja de compatibilidad de 160 caracteres de la RPD de Corea a los ideogramas de compatibilidad CJK (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2375.
- 1 2 3 Gim, Gyeongseog (2001-10-13). Comentarios de la República de Corea sobre la propuesta de la RPDC, WG2 N 2374, para agregar 70 símbolos a ISO/IEC 10646-1:2000 (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2390.
- 1 2 3 4 5 Grupo ad hoc de escritura coreana (16-10-2001). Informe de la reunión del grupo ad hoc de escritura coreana del 15 de octubre de 2001 (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2392, UTC L2/01-388. Archivado del original (PDF) el 3-08-2020 . Recuperado el 29-04-2020 .
- ↑ Comité de Normalización de la RPD de Corea (CSK) (23-10-2001). "Propuesta para incorporar las fuentes KP para los ideogramas unificados CJK y su extensión A en ISO/IEC 10646-1:2000" (PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N0872.
- ↑ Comité de Normalización de la RPD de Corea (CSK) (23-10-2001). "Propuesta para la inclusión de fuentes actualizadas del KP para ideogramas unificados CJK Extensión B en ISO/IEC 10646-2:2000" (PDF) . ISO/IEC JTC1 / SC2 /WG2/ IRG N0873.
- ↑ Comité de Normalización de la RPD de Corea (CSK) (25-10-2001). "Tabla de mapeo de fuentes KP: BMP" . ISO/IEC JTC1 / SC2 /WG2/ IRG N0882.
- ↑ Comité de Normalización de la RPD de Corea (CSK) (25-10-2001). "Tabla de mapeo de fuentes KP: Plano 2" . ISO/IEC JTC1 / SC2 /WG2/ IRG N0884.
- ↑ Umamaheswaran, VS (16 de noviembre de 2001). "Solicitud al grupo ad hoc coreano para generar tablas de correspondencia entre las normas nacionales de la República de Corea y la República Popular Democrática de Corea" (PDF) . ISO/IEC JTC1 / SC2 /WG2 N2407 / IRG N840; UTC L2 /01-458.
- 1 2 3 4 Freytag, Asmus (13 de febrero de 2002). "Notas sobre los símbolos propuestos por la RPDC" (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2417, UTC L2/02-102.
- 1 2 Emojipedia . "Emoji Unicode 4.0" . Emojipedia .
- 1 2 3 4 5 6 Kim, Kyongsok (30-11-2002). "Posición del organismo nacional: tablas de referencias cruzadas de 3 vías: KS X 1001, KPS 9566 y UCS" (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2564.[Nota: enlaces actualizados para las tablas que acompañan al documento:Archivado el 3 de abril de 2021 en Wayback Machine .Archivado el 3 de abril de 2021 en Wayback Machine .
- 1 2 3 4 "Símbolos varios" (PDF) . Tablas de códigos delta Unicode 4.0.0 . Consorcio Unicode .
- 1 2 3 4 Whistler, Ken (2015-05-28). "Re: Símbolos de flecha" . Archivo de la lista de correo Unicode .
- ↑ "Símbolos y flechas varios" (PDF) . Tablas de códigos delta de Unicode 4.0.0 . Consorcio Unicode .
- 1 2 Overington, William (24-02-2003). "Caracteres beta Unicode 4.0" .
- ↑ "Símbolos varios" (PDF) . Tablas de códigos delta de Unicode 3.2.0 . Consorcio Unicode .
- ↑ La tabla de códigos Unicode 4.0 muestra el glifo modificado, [ 62 ] mientras que la tabla de códigos Unicode 3.2 muestra el glifo anterior. [ 66 ]
- ^ Scherer , Markus; Davis, Marcos; Momoi, Kat; Tong, Darick; Kida, Yasuo; Edberg, Peter. "Símbolos emoji: datos básicos: datos básicos para la propuesta de codificación de símbolos emoji" (PDF) . UTCL2/10-132.
- ↑ Suignard, Michel (18 de septiembre de 2007). "Símbolos de la televisión japonesa" (PDF) . UTC L2/07-391, ISO/IEC JTC 1/SC 2 /WG 2 N3341.
- ↑ Consorcio Unicode (2020). "Versiones y fuentes de emojis, v13.0" .
- ↑ Emojipedia . "Lista de emojis Unicode 5.2" . Emojipedia .
- ↑ Emojipedia . "Emoji de bandera blanca ondeando" . Emojipedia .
- ↑ Emojipedia . "Emoji de bandera negra ondeando" . Emojipedia .
- ↑ Marin Silva, Eduardo (2018). Propuesta para reconsiderar los símbolos de compatibilidad y la puntuación utilizados en la RPDC (PDF) . UTC L2/18-004.
- 1 2 Grupo ad hoc de escritura coreana (16 de octubre de 2001). Informe de la reunión del grupo ad hoc de escritura coreana del 15 de octubre de 2001 (PDF) . ISO/IEC JTC 1/SC 2 /WG 2 N2392, UTC L2/01-388. Archivado del original (PDF) el 3 de agosto de 2020. Recuperado el 29 de abril de 2020. La
RPD de Corea sugirió que revisarían este carácter con más cuidado antes de que se vuelva a discutir en el grupo ad hoc de escritura coreana o en el WG2.
- 1 2 Marín Silva, Eduardo (2018). Propuesta de codificación: SÍMBOLO PARA ELECTRÓNICA TIPO A (PDF) . UTC L2/18-184R.
- ↑ Lunde, Ken (2009). "Apéndice E: Estándares de conjuntos de caracteres del proveedor" (PDF) . Procesamiento de información CJKV: Informática en chino, japonés, coreano y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . ISBN 978-0-596-51447-1.
- ↑ Apple (5 de abril de 2005). "Mapa (versión externa) de la codificación coreana de Mac OS a Unicode 3.2 y posterior" . Consorcio Unicode .
- ↑ "Símbolos para el suplemento de computación heredada" (PDF) . BORRADOR El estándar Unicode, versión 16.0 REVISIÓN BETA . Consorcio Unicode . Recuperado el 27 de mayo de 2024 .
- ↑ Czyborra, Roman (30-11-1998) [25-05-1998]. "La sopa de caracteres cirílicos" . Archivado del original el 03-12-2016 . Recuperado el 03-12-2016 .
- ↑ Lunde, Ken (2009). «Caracteres aparentemente faltantes». Procesamiento de información CJKV: Informática china, japonesa, coreana y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . pág. 180. ISBN 978-0-596-51447-1.
- ↑ Esta tabla se genera a partir de KPS9566.TXT. [ 1 ]
- ↑ Chung, Jaemin (17 de marzo de 2021). "KP0-E5A9 debería asignarse a U+67FF en lugar de U+676E" (PDF) . UTC L2/21-059.
Enlaces externos
- Tabla de códigos KPS 9566-97 del registro ISO-IR
- Mapeos de tres vías entre EUC-KP (KPS 9566), EUC-KR y Unicode a partir del año 2000. Archivado el 3 de abril de 2021 en Wayback Machine (archivo en EUC-KR; tenga en cuenta el error al mapear 0xB8F0 a U+BCD2 볒 HANGUL SYLLABLE BYEOJ en lugar de U+BCD3 볓 HANGUL SYLLABLE BYEOC ).
- Mapeo de KPS 9566-2003 a Unicode
- Tabla de códigos y mapeo KPS 9566-2011 obtenidos mediante ingeniería inversa a partir de Red Star OS.
- Codificaciones de lenguas asiáticas
- Informática en idioma coreano
- Hangul