Articulo de referencia

Unificación Han

Diferencias para el mismo punto de código Unicode (U+8FD4) en versiones regionales de Source Han Sans La unificación de caracteres Han es un esfuerzo de los autores de Unicode y...

Diferencias para el mismo punto de código Unicode (U+8FD4) en versiones regionales de Source Han Sans

La unificación de caracteres Han es un esfuerzo de los autores de Unicode y del Conjunto Universal de Caracteres para mapear los múltiples conjuntos de caracteres Han de las llamadas lenguas CJK en un único conjunto de caracteres unificados . Los caracteres Han son una característica común del chino escrito ( hanzi ), el japonés ( kanji ), el coreano ( hanja ) y el vietnamita ( chữ Hán ).

Las tipografías modernas chinas, japonesas y coreanas suelen utilizar variantes regionales o históricas de un carácter Han determinado . En la formulación de Unicode, se intentó unificar estas variantes considerándolas como alógrafos —glifos diferentes que representan el mismo grafema o unidad ortográfica— , de ahí la «unificación Han», cuyo repertorio de caracteres resultante a veces se abrevia como Unihan . [ 1 ]  

Sin embargo, muchos caracteres tienen variantes regionales asignadas a diferentes puntos de código , como Traditional(U+500B) frente a Simplified(U+4E2A).

Fundamentación y controversia

El estándar Unicode detalla los principios de la unificación Han. [ 2 ] [ 3 ] El Grupo de Investigación Ideográfica (IRG), integrado por expertos de los países de habla china, Corea del Norte y del Sur, Japón, Vietnam y otros países, es responsable del proceso. [ 4 ]

Una de las razones fue el deseo de limitar el tamaño del conjunto completo de caracteres Unicode, donde los caracteres CJK, representados por ideogramas discretos , pueden alcanzar o superar los 100 000 caracteres [ a ] . La versión 1 de Unicode se diseñó para caber en 16 bits y solo 20 940 caracteres (32 %) de los 65 536 posibles se reservaron para estos ideogramas unificados CJK . Posteriormente, Unicode se amplió a 21 bits, lo que permitió muchos más caracteres CJK (se asignaron 101 996, con espacio para más).

Un artículo publicado por IBM intenta ilustrar parte de la motivación para la unificación Han: [ 5 ]

El problema radica en que Unicode codifica caracteres en lugar de glifos, que son las representaciones visuales de los caracteres. Existen cuatro tradiciones básicas para las formas de los caracteres de Asia Oriental: chino tradicional, chino simplificado, japonés y coreano. Si bien el carácter raíz Han puede ser el mismo para las lenguas CJK, los glifos de uso común para los mismos caracteres pueden no serlo. Por ejemplo, el glifo chino tradicional para "hierba" utiliza cuatro trazos para el radical [ ⺿ ], mientras que los glifos en chino simplificado, japonés y coreano [ ] utilizan tres. Sin embargo, solo existe un punto Unicode para el carácter de hierba (U+8349) [], independientemente del sistema de escritura. Otro ejemplo es el ideograma para "uno", que es diferente en chino, japonés y coreano. Muchos opinan que las tres versiones deberían codificarse de forma diferente.

De hecho, los tres ideogramas para "uno" (,o) están codificados por separado en Unicode, ya que no se consideran variantes nacionales. El primero es la forma común en los tres países, mientras que el segundo y el tercero se utilizan en instrumentos financieros para evitar su manipulación (estos sí pueden considerarse variantes).

La unificación de los caracteres Han también ha generado considerable controversia, especialmente entre el público japonés, que, junto con los intelectuales del país, tiene un historial de protestas contra la eliminación de variantes históricamente y culturalmente significativas. [ 6 ] [ 7 ] (Véase Kanji §  Reforma ortográfica y listas de kanji . Actualmente, la lista de caracteres reconocidos oficialmente para su uso en nombres propios continúa expandiéndose a un ritmo moderado).

En 1993, la Asociación de Desarrollo de Industrias Electrónicas de Japón (JEIDA) publicó un folleto titulado "未来の文字コード体系に私達は不安をもっています。 " (Estamos preocupados por el futuro sistema de codificación de caracteres JPNO 20985671 ), que resume las principales críticas contra el enfoque de unificación Han adoptado por Unicode. 

Grafemas versus glifos

La letra latina minúscula " a " tiene glifos distintos que representan instancias del mismo grafema abstracto. Si bien un hablante nativo de la escritura latina reconoce estos dos glifos como el mismo grafema, para otros podrían parecer no tener relación.

Un grafema es la unidad abstracta de significado más pequeña en un sistema de escritura. Cualquier grafema tiene muchas expresiones de glifos posibles, pero todas son reconocidas como el mismo grafema por quienes tienen conocimientos de lectura y escritura de un sistema de escritura en particular. Si bien Unicode generalmente asigna caracteres a puntos de código para expresar los grafemas dentro de un sistema de escritura, el Estándar Unicode ( sección 3.4 D7 ) advierte:

Un carácter abstracto no necesariamente se corresponde con lo que un usuario considera un "carácter" y no debe confundirse con un grafema .

— El estándar Unicode® versión 16.0 – Especificación principal §3.4 Caracteres y codificación

Sin embargo, esta cita se refiere al hecho de que algunos grafemas están compuestos de varios elementos gráficos o "caracteres". Así, por ejemplo, el carácter U+0061 una LETRA MINÚSCULA LATINA A combinada con U+030A ̊ ANILLO DE COMBINACIÓN SUPERIOR (generando la combinación "å") podría ser entendido por un usuario como un solo grafema, aunque esté compuesto de múltiples caracteres abstractos Unicode. Además, Unicode también asigna algunos puntos de código a un pequeño número (aparte de por razones de compatibilidad) de caracteres de formato, caracteres de espacio en blanco y otros caracteres abstractos que no son grafemas, sino que se utilizan para controlar los saltos entre líneas, palabras, grafemas y grupos de grafemas. Con los ideogramas Han unificados, el estándar Unicode se aparta de las prácticas anteriores al asignar caracteres abstractos no como grafemas, sino según el significado subyacente del grafema: lo que los lingüistas a veces llaman sememas . Esta diferencia, por lo tanto, no se explica simplemente por la distinción, a menudo citada, entre un carácter abstracto y un glifo, sino que radica más bien en la diferencia entre un carácter abstracto asignado como grafema y un carácter abstracto asignado como semema. En contraste, considérese la unificación de la puntuación y los diacríticos en ASCII , donde grafemas con significados muy diferentes (por ejemplo, un apóstrofo y una comilla simple) se unifican porque los glifos son los mismos. Para Unihan, los caracteres no se unifican por su apariencia, sino por su definición o significado.

Que un grafema esté representado por varios glifos significa que tiene variaciones de glifos que generalmente se determinan seleccionando una fuente u otra o utilizando funciones de sustitución de glifos cuando se incluyen varios glifos en una sola fuente. Unicode considera estas variaciones de glifos una característica de los protocolos de texto enriquecido y no las maneja adecuadamente según los objetivos de texto plano de Unicode. Sin embargo, cuando el cambio de un glifo a otro constituye un cambio de un grafema a otro —donde un glifo ya no puede significar, por ejemplo, el mismo grafema entendido como la letra minúscula "a"— Unicode los separa en puntos de código distintos. Para Unihan, se hace lo mismo cuando cambia el significado abstracto; sin embargo, en lugar de hablar del significado abstracto de un grafema (la letra "a"), la unificación de los ideogramas Han asigna un nuevo punto de código para cada significado diferente, incluso si ese significado se expresa mediante grafemas distintos en diferentes idiomas. Aunque un grafema como "ö" pueda significar algo diferente en inglés (como se usa en la palabra "coördinated") que en alemán (como se usa en la palabra "schön"), sigue siendo el mismo grafema y puede unificarse fácilmente para que el inglés y el alemán puedan compartir un sistema de escritura latino abstracto común (junto con el latín mismo). Este ejemplo también señala otra razón por la que "carácter abstracto" y grafema como unidad abstracta en un lenguaje escrito no necesariamente se corresponden uno a uno. En inglés, la diéresis combinatoria , ◌̈ , y la "o" que modifica pueden verse como dos grafemas separados, mientras que en lenguas como el sueco, la letra "ö" puede verse como un solo grafema. De manera similar, en inglés el punto sobre una "i" se entiende como parte del grafema "i", mientras que en otras lenguas, como el turco, el punto puede verse como un grafema separado añadido a la "ı" sin punto .

Para abordar el uso de diferentes grafemas para el mismo semema Unihan, Unicode ha recurrido a varios mecanismos, especialmente en lo que respecta a la representación de texto. Uno de ellos ha sido tratarlo simplemente como un problema de fuentes, de modo que se pueden usar diferentes fuentes para representar chino, japonés o coreano. Además, formatos de fuente como OpenType permiten la asignación de glifos alternativos según el idioma, de manera que un sistema de representación de texto puede consultar la configuración del entorno del usuario para determinar qué glifo usar. El problema con estos enfoques es que no cumplen con los objetivos de Unicode de definir una forma coherente de codificar texto multilingüe. [ 8 ]

En lugar de tratar el problema como un problema de texto enriquecido de alternativas de glifos, Unicode añadió el concepto de selectores de variación , introducido por primera vez en la versión 3.2 y complementado en la versión 4.0. [ 9 ] Si bien los selectores de variación se tratan como caracteres combinables, no tienen diacríticos ni marcas asociadas. En cambio, al combinarse con un carácter base, indican que la secuencia de dos caracteres selecciona una variación (típicamente en términos de grafema, pero también en términos de significado subyacente, como en el caso de un nombre de lugar u otro nombre propio) del carácter base. Esto no es una selección de un glifo alternativo, sino la selección de una variación de grafema o una variación del carácter abstracto base. Sin embargo, dicha secuencia de dos caracteres se puede asignar fácilmente a un solo glifo separado en las fuentes modernas. Dado que Unicode ha asignado 256 selectores de variación separados, es capaz de asignar 256 variaciones para cualquier ideograma Han. Dichas variaciones pueden ser específicas de un idioma u otro y permiten la codificación de texto plano que incluye dichas variaciones de grafema.

Personajes abstractos de Unihan

Dado que el estándar Unihan codifica "caracteres abstractos", no "glifos", los artefactos gráficos producidos por Unicode se han considerado obstáculos técnicos temporales y, como mucho, meramente estéticos. Sin embargo, sobre todo en Japón, debido en parte a la forma en que los caracteres chinos se incorporaron históricamente a los sistemas de escritura japoneses, la imposibilidad de especificar una variante concreta se consideró un obstáculo importante para el uso de Unicode en trabajos académicos. Por ejemplo, la unificación de "hierba" (explicada anteriormente) implica que un texto histórico no puede codificarse de manera que conserve su ortografía particular. En su lugar, por ejemplo, el investigador tendría que localizar el glifo deseado en una tipografía específica para transmitir el texto tal como está escrito, lo que anula el propósito de un conjunto de caracteres unificado. Unicode ha respondido a estas necesidades asignando selectores de variación para que los autores puedan seleccionar variaciones grafema-ideograma de caracteres específicos (o incluso de otros caracteres). [ 9 ]

Las pequeñas diferencias en la representación gráfica también resultan problemáticas cuando afectan la legibilidad o pertenecen a una tradición cultural errónea. Además de hacer que algunas fuentes Unicode sean inutilizables para textos que involucran múltiples "idiomas Unihan", los nombres u otra terminología sensible a la ortografía podrían mostrarse incorrectamente. (Los nombres propios tienden a ser especialmente conservadores ortográficamente; compárese esto con cambiar la ortografía del nombre propio para adaptarlo a una reforma lingüística en EE. UU. o el Reino Unido). Si bien esto puede considerarse principalmente un problema de representación gráfica o renderizado que se puede solucionar con fuentes más artísticas, el uso generalizado de Unicode dificultaría la preservación de tales distinciones. El problema de que un mismo carácter represente conceptos semánticamente diferentes también está presente en la parte latina de Unicode. El carácter Unicode para el apóstrofo curvo es el mismo que el de la comilla simple derecha ('). Por otro lado, la letra mayúscula latina A no está unificada con la letra griega Α ni con la letra cirílica ΐ . Esto es, por supuesto, deseable por razones de compatibilidad y se maneja con un conjunto de caracteres alfabéticos mucho más pequeño.

Si bien el aspecto de unificación de Unicode es controvertido en algunos sectores por las razones expuestas anteriormente, Unicode codifica actualmente una gran cantidad de caracteres poco utilizados y de carácter más o menos antiguo.

Parte de la controversia se debe a que la decisión de unificar los caracteres chinos fue tomada por el Consorcio Unicode original, que en aquel entonces era un consorcio de empresas y organizaciones norteamericanas (la mayoría en California) [ 10 ] , pero no incluía representantes de gobiernos de Asia Oriental. El objetivo inicial del diseño era crear un estándar de 16 bits [ 11 ] , por lo que la unificación de los caracteres chinos era un paso fundamental para evitar decenas de miles de caracteres duplicados. Este requisito de 16 bits se abandonó posteriormente, lo que hace que el tamaño del conjunto de caracteres sea un problema menor en la actualidad.

La controversia se extendió posteriormente a la ISO, organismo internacionalmente representativo: el Grupo Conjunto de Investigación CJK (CJK-JRG) inicial favoreció una propuesta (DIS 10646) para un conjunto de caracteres no unificado, "que fue rechazada en favor de la unificación con el conjunto de caracteres unificado del Consorcio Unicode por los votos de los miembros estadounidenses y europeos de la ISO" (aunque la posición japonesa no estaba clara). [ 12 ] Respaldar la unificación de Unicode Han fue un paso necesario para la acalorada fusión ISO 10646/Unicode.

Gran parte de la controversia en torno a la unificación del Han se basa en la distinción entre glifos , tal como se definen en Unicode, y el concepto relacionado pero distinto de grafemas. Unicode asigna caracteres abstractos (grafemas), a diferencia de los glifos, que son representaciones visuales particulares de un carácter en una tipografía específica . Un mismo carácter puede estar representado por muchos glifos distintos; por ejemplo, una "g" o una "a", ambas con un bucle ( ɑ , ɡ ) o dos ( a , g ). Sin embargo, para un lector de lenguas basadas en el alfabeto latino, las dos variantes del carácter "a" se reconocen como el mismo grafema. Los grafemas presentes en los códigos de caracteres nacionales se han incorporado a Unicode, según lo exige la regla de separación de fuentes de Unicode, incluso cuando pueden estar compuestos por caracteres ya disponibles. Los códigos de caracteres nacionales existentes en las lenguas CJK son considerablemente más complejos, dadas las limitaciones tecnológicas bajo las cuales evolucionaron, por lo que los participantes oficiales de CJK en la unificación del Han bien podrían haber estado dispuestos a la reforma.

A diferencia de las versiones europeas, las fuentes Unicode CJK, debido a la unificación Han, presentan patrones de superposición amplios pero irregulares, lo que requiere fuentes específicas para cada idioma. Desafortunadamente, estas fuentes también dificultan el acceso a una variante que, como en el ejemplo de "hierba", aparece con mayor frecuencia en otro estilo de escritura. (Es decir, sería difícil acceder a "hierba" con el radical de cuatro trazos, más típico del chino tradicional, en un entorno japonés, donde las fuentes suelen representar el radical de tres trazos). Los defensores de Unihan tienden a favorecer los lenguajes de marcado para definir cadenas de caracteres, pero esto no garantiza el uso de una variante específica en el caso dado, sino solo la fuente específica del idioma que tenga más probabilidades de representar un carácter con esa variante. (En este punto, entran en juego las meras diferencias estilísticas, ya que es poco probable que una selección de fuentes japonesas y chinas sea visualmente compatible).

Los usuarios chinos parecen tener menos objeciones a la unificación Han, principalmente porque Unicode no intentó unificar los caracteres chinos simplificados con los caracteres chinos tradicionales . (Los caracteres chinos simplificados se utilizan entre los hablantes de chino en la República Popular China , Singapur y Malasia . Los caracteres chinos tradicionales se utilizan en Hong Kong y Taiwán ( Big5 ) y, con algunas diferencias, son más familiares para los usuarios coreanos y japoneses). Unicode se considera neutral con respecto a este tema políticamente sensible y ha codificado los glifos chinos simplificados y tradicionales por separado (por ejemplo, el ideograma para "descartar" esU+4E1F para el chino tradicional Big5 #A5E1 yU+4E22 para el chino simplificado GB #2210). También se señala que los caracteres tradicionales y simplificados deberían codificarse por separado según las reglas de unificación Han de Unicode, porque se distinguen en los conjuntos de caracteres preexistentes de la República Popular China. Además, al igual que con otras variantes, la relación entre caracteres tradicionales y simplificados no es uno a uno.

Alternativas

Existen varios conjuntos de caracteres alternativos que no se codifican según el principio de la Unificación Han y, por lo tanto, están libres de sus restricciones:

Estos conjuntos de caracteres dependientes de la región también se consideran no afectados por la Unificación Han debido a su naturaleza específica de la región:

Sin embargo, ninguno de estos estándares alternativos ha sido tan ampliamente adoptado como Unicode , que ahora es el conjunto de caracteres base para muchos estándares y protocolos nuevos, adoptado internacionalmente y está integrado en la arquitectura de sistemas operativos ( Microsoft Windows , Apple macOS y muchos sistemas tipo Unix ), lenguajes de programación ( Perl , Python , C# , Java , Common Lisp , APL , C , C++ ) y bibliotecas (IBM International Components for Unicode (ICU) junto con los motores de renderizado Pango , Graphite , Scribe , Uniscribe y ATSUI ), formatos de fuente ( TrueType y OpenType ), etc.

En marzo de 1989, el Centro de Computación Educativa, una organización gubernamental japonesa, adoptó un sistema basado en (B)TRON como sistema preferido para la educación escolar, incluida la educación obligatoria . [ 13 ] Sin embargo, en abril, un informe titulado "Informe Nacional de Estimación Comercial de 1989 sobre Barreras al Comercio Exterior" de la Oficina del Representante Comercial de los Estados Unidos ( USTR) incluyó específicamente el sistema como una barrera comercial en Japón. El informe afirmaba que la adopción del sistema basado en TRON por parte del gobierno japonés era ventajosa para los fabricantes japoneses, excluyendo así a los sistemas operativos estadounidenses del enorme mercado nuevo; específicamente, el informe menciona MS-DOS, OS/2 y UNIX como ejemplos. Supuestamente, la Oficina del USTR estaba bajo la influencia de Microsoft, ya que su exfuncionario Tom Robertson recibió entonces una lucrativa oferta de trabajo por parte de Microsoft. [ 14 ] Si bien el sistema TRON fue posteriormente retirado de la lista de sanciones por la Sección 301 de la Ley de Comercio de 1974 después de las protestas de la organización en mayo de 1989, la disputa comercial provocó que el Ministerio de Comercio Internacional e Industria aceptara una solicitud de Masayoshi Son para cancelar la selección del sistema basado en TRON por parte del Centro de Computación Educativa para el uso de computadoras educativas. [ 15 ] El incidente se considera un evento simbólico de la pérdida de impulso y la eventual desaparición del sistema BTRON, lo que llevó a la adopción generalizada de MS-DOS en Japón y la eventual adopción de Unicode con su sucesor Windows.

Fusión de todos los caracteres equivalentes

No se ha impulsado la unificación semántica completa de todos los caracteres semánticamente vinculados, aunque la idea trataría por igual a los usuarios de lenguas de Asia Oriental, independientemente de si escriben en coreano, chino simplificado, chino tradicional, japonés Kyūjitai , japonés Shinjitai o vietnamita. En lugar de que algunas variantes tengan puntos de código distintos, mientras que otros grupos de variantes compartan puntos de código únicos, todas las variantes podrían expresarse de forma fiable solo con etiquetas de metadatos (por ejemplo, formato CSS en páginas web). La responsabilidad recaería sobre todos aquellos que utilicen versiones diferentes de,,,, ya sea que esa diferencia se deba a la simplificación, a la variación internacional o a la variación intranacional. Sin embargo, en algunas plataformas (por ejemplo, teléfonos inteligentes), un dispositivo puede venir con una sola fuente preinstalada. La fuente del sistema debe decidir el glifo predeterminado para cada punto de código, y estos glifos pueden diferir enormemente, lo que indica diferentes grafemas subyacentes.

Por consiguiente, basarse en el marcado de lenguaje de forma generalizada presenta dos problemas principales. En primer lugar, existen contextos donde el marcado de lenguaje no está disponible (confirmaciones de código, texto plano). En segundo lugar, cualquier solución requeriría que cada sistema operativo viniera preinstalado con numerosos glifos para caracteres semánticamente idénticos que poseen múltiples variantes. Además de los conjuntos de caracteres estándar del chino simplificado, el chino tradicional, el coreano, el vietnamita, el japonés Kyūjitai y el japonés Shinjitai, también existen formas «antiguas» de caracteres que resultan de interés para historiadores, lingüistas y filólogos.

La base de datos Unihan de Unicode ya ha establecido conexiones entre muchos caracteres. La base de datos Unicode cataloga las conexiones entre caracteres variantes con puntos de código distintos. Sin embargo, para caracteres con un punto de código compartido, la imagen del glifo de referencia suele estar sesgada hacia la versión del chino tradicional. Además, la decisión de clasificar pares como variantes semánticas o variantes z no siempre es coherente ni clara, a pesar de las justificaciones del manual. [ 16 ]

Las llamadas variantes semánticas de(U+4E1F) y(U+4E22) son ejemplos que Unicode da como diferentes de manera significativa en sus formas abstractas, mientras que Unicode enumeraycomo variantes z, que difieren solo en el estilo de fuente. Paradójicamente, Unicode considera queyson variantes z casi idénticas, mientras que al mismo tiempo las clasifica como variantes semánticas significativamente diferentes. También hay casos de algunos pares de caracteres que son simultáneamente variantes semánticas y variantes semánticas especializadas y variantes simplificadas:(U+500B) y(U+4E2A). Hay casos de no equivalencia mutua. Por ejemplo, la entrada de la base de datos Unihan para(U+4E80) considera a 龜(U+9F9C) como su variante z, pero la entrada parano enumera a 亀como una variante z, aunqueobviamente ya estaba en la base de datos en el momento en que se escribió la entrada para亀.

Algunos errores administrativos provocaron la duplicación de caracteres completamente idénticos, como(U+FA23) y 𧺯 (U+27EAF). Si una fuente tiene glifos codificados para ambos puntos, de modo que se utiliza una sola fuente para ambos, deberían aparecer idénticos. Estos casos se clasifican como variantes z, a pesar de no presentar ninguna variación. Se añadieron caracteres duplicados intencionadamente para facilitar la conversión bit a bit de ida y vuelta . Dado que la conversión de ida y vuelta fue una de las principales ventajas de Unicode en sus inicios, esto significaba que si un estándar nacional en uso duplicaba innecesariamente un carácter, Unicode debía hacer lo mismo. Unicode denomina a estas duplicaciones intencionadas " variantes de compatibilidad ", como 漢 (U+FA9A), que denomina a(U+6F22) su variante de compatibilidad. Siempre que una aplicación utilice la misma fuente para ambos, deberían aparecer idénticos. A veces, como en el caso dewith U+8ECA y U+F902, el carácter de compatibilidad añadido enumera la versión ya presente decomo su variante de compatibilidad y su variante z. El campo de variante de compatibilidad anula el campo de variante z, forzando la normalización en todas las formas, incluida la equivalencia canónica. A pesar del nombre, las variantes de compatibilidad son en realidad canónicamente equivalentes y están unificadas en cualquier esquema de normalización Unicode y no solo bajo la normalización de compatibilidad. Esto es similar a cómo U+212B Å ANGSTROM SIGN es canónicamente equivalente a una U+00C5 Å LATIN CAPITAL LETTER A WITH RING ABOVE precompuesta . Muchos programas (como el software MediaWiki que aloja Wikipedia) reemplazarán todos los caracteres canónicamente equivalentes que se desaconsejan (por ejemplo, el símbolo de angstrom) con el equivalente recomendado. A pesar del nombre, las "variantes de compatibilidad" CJK son caracteres canónicamente equivalentes y no caracteres de compatibilidad.

El carácter 漢 (U+FA9A) se añadió a la base de datos posteriormente que(U+6F22), y su entrada informa al usuario sobre la compatibilidad. Por otro lado,(U+6F22) no incluye esta equivalencia en su entrada. Unicode exige que, una vez admitidas, todas las entradas no puedan modificar su compatibilidad o equivalencia para que las reglas de normalización de los caracteres ya existentes no se vean afectadas.

Algunos pares de caracteres tradicionales y simplificados también se consideran variantes semánticas. Según las definiciones de Unicode, es lógico que todas las simplificaciones (que no resulten en la fusión de caracteres totalmente diferentes por su homofonía) sean una forma de variante semántica. Unicode clasificaycomo sus respectivas variantes tradicionales y simplificadas, y también como variantes semánticas. Sin embargo, si bien Unicode clasifica(U+5104) y亿(U+4EBF) como sus respectivas variantes tradicionales y simplificadas, no considera quey亿sean variantes semánticas entre sí.

Unicode afirma que «idealmente, no debería haber pares de variantes z en el estándar Unicode». [ 16 ] Esto daría a entender que el objetivo es, al menos, unificar todas las variantes menores, las redundancias de compatibilidad y las redundancias accidentales, dejando la diferenciación a las fuentes y a las etiquetas de idioma. Esto entra en conflicto con el objetivo declarado de Unicode de eliminar esa sobrecarga y permitir que cualquier número de escrituras del mundo aparezca en el mismo documento con un único sistema de codificación. El capítulo uno del manual afirma que «Con Unicode, la industria de la tecnología de la información ha sustituido la proliferación de conjuntos de caracteres por estabilidad de datos, interoperabilidad global e intercambio de datos, software simplificado y costes de desarrollo reducidos. Si bien toma como punto de partida el conjunto de caracteres ASCII, el estándar Unicode va mucho más allá de la capacidad limitada de ASCII para codificar únicamente las letras mayúsculas y minúsculas de la A a la Z. Proporciona la capacidad de codificar todos los caracteres utilizados en los idiomas escritos del mundo: se pueden codificar más de un millón de caracteres. No se requiere ninguna secuencia de escape ni código de control para especificar ningún carácter en ningún idioma. La codificación de caracteres Unicode trata los caracteres alfabéticos, ideográficos y los símbolos de forma equivalente, lo que significa que pueden utilizarse en cualquier combinación y con la misma facilidad». [ 8 ]

Esto deja abierta la opción de adoptar un grafema de referencia unificado para todas las variantes con z, lo cual es controvertido, ya que pocos fuera de Japón reconoceríanycomo equivalentes. Incluso dentro de Japón, las variantes se encuentran en lados opuestos de una importante simplificación llamada Shinjitai. Unicode haría que la simplificación de(U+4FA3) y(U+4FB6) de la República Popular China representara una diferencia monumental en comparación. Dicho plan también eliminaría las variaciones visualmente muy distintas de caracteres como(U+76F4) y(U+96C7).

Cabría esperar que todos los caracteres simplificados fueran simultáneamente variantes z o variantes semánticas con sus contrapartes tradicionales, pero muchos no son ninguna de las dos. Es más fácil explicar el extraño caso de que las variantes semánticas puedan ser simultáneamente variantes semánticas y variantes especializadas cuando la definición de Unicode establece que las variantes semánticas especializadas tienen el mismo significado solo en ciertos contextos. Los idiomas las utilizan de manera diferente. Un par de caracteres que son reemplazos directos al 100% entre sí en japonés puede no ser tan flexible en chino. Por lo tanto, cualquier fusión integral de puntos de código recomendados tendría que mantener algunas variantes que difieren solo ligeramente en apariencia, incluso si el significado es 100% el mismo para todos los contextos en un idioma, porque en otro idioma los dos caracteres pueden no ser reemplazos directos al 100%.

Ejemplos de glifos dependientes del idioma

En cada fila de la siguiente tabla, el mismo carácter se repite en las seis columnas. Cada columna está marcada con un idioma diferente: chino ( simplificado y dos variantes tradicionales ), japonés , coreano o vietnamita . El navegador debe seleccionar, para cada carácter, un glifo (de una fuente) adecuado para el idioma especificado. (Las fuentes pueden reflejar diferentes estilos tipográficos, como ocurre con los alfabetos con y sin serifa). Esto solo funciona para la selección de glifos alternativos si tiene fuentes CJK instaladas en su sistema y la fuente seleccionada para mostrar este artículo no incluye glifos para estos caracteres.

En el siglo XX, los países de Asia Oriental crearon sus propios estándares de codificación. Dentro de cada estándar, coexistían variantes con puntos de código distintos, de ahí los puntos de código distintos en Unicode para ciertos conjuntos de variantes. Tomando como ejemplo el chino simplificado, las dos variantes del carácter(U+5167) y(U+5185) difieren exactamente de la misma manera que las variantes coreanas y no coreanas de(U+5168). Cada variante respectiva del primer carácter tiene(U+5165) o(U+4EBA). Cada variante respectiva del segundo carácter tiene(U+5165) o(U+4EBA). Ambas variantes del primer carácter obtuvieron sus propios puntos de código distintos. Sin embargo, las dos variantes del segundo carácter tuvieron que compartir el mismo punto de código.

La justificación que ofrece Unicode es que el organismo nacional de normalización de la República Popular China creó puntos de código distintos para las dos variantes del primer carácter/, mientras que Corea nunca creó puntos de código separados para las diferentes variantes de. Existe una razón para esto que no tiene nada que ver con la interpretación que los organismos nacionales dan a los caracteres en sí. China pasó por un proceso en el siglo XX que cambió (si no simplificó) varios caracteres. Durante esta transición, surgió la necesidad de poder codificar ambas variantes en un mismo documento. El coreano siempre ha utilizado la variante decon el radical(U+5165) en la parte superior. Por lo tanto, no tenía razón para codificar ambas variantes. Los documentos en idioma coreano del siglo XX tenían pocos motivos para representar ambas versiones en un mismo documento.

Casi todas las variantes que la República Popular China desarrolló o estandarizó obtuvieron puntos de código distintos simplemente por la suerte de que la transición al chino simplificado se mantuviera vigente en la era de la informática. Sin embargo, este privilegio parece aplicarse de forma inconsistente, mientras que la mayoría de las simplificaciones realizadas en Japón y China continental con puntos de código en estándares nacionales, incluidos caracteres simplificados de manera diferente en cada país, sí se incorporaron a Unicode como puntos de código distintos.

Sesenta y dos caracteres Shinjitai "simplificados" con puntos de código distintos en Japón se fusionaron con sus equivalentes tradicionales Kyūjitai, como. Esto puede causar problemas en la estrategia de etiquetado de idiomas. No existe una etiqueta universal para las versiones tradicional y "simplificada" del japonés, como sí la hay para el chino. Por lo tanto, cualquier escritor japonés que desee mostrar la forma Kyūjitai depodría tener que etiquetar el carácter como "chino tradicional" o confiar en que la fuente japonesa del destinatario utilice solo los glifos Kyūjitai, pero podrían ser necesarias las etiquetas de chino tradicional y chino simplificado para mostrar ambas formas una al lado de la otra en un libro de texto japonés. Sin embargo, esto impediría usar la misma fuente para todo un documento. Existen dos puntos de código distintos paraen Unicode, pero solo por "razones de compatibilidad". Cualquier fuente compatible con Unicode debe mostrar los puntos de código equivalentes de las versiones Kyūjitai y Shinjitai en Unicode como iguales. Extraoficialmente, una fuente puede mostrarde manera diferente, siendo 海 (U+6D77) la versión Shinjitai y 海 (U+FA45) la versión Kyūjitai (que es idéntica a la versión tradicional en chino y coreano escritos).

El radical(U+7CF8) se utiliza en caracteres como/, con dos variantes, siendo la segunda simplemente la forma cursiva. Los componentes radicales de(U+7D05) y(U+7EA2) son semánticamente idénticos y los glifos difieren únicamente en que este último utiliza una versión cursiva del componente. Sin embargo, en China continental, los organismos de normalización querían estandarizar la forma cursiva cuando se utiliza en caracteres como. Debido a que este cambio ocurrió relativamente hace poco, hubo un período de transición. Tanto(U+7D05) como(U+7EA2) obtuvieron puntos de código separados en los organismos de normalización de codificación de texto de la República Popular China para que los documentos en chino pudieran utilizar ambas versiones. Las dos variantes también recibieron puntos de código distintos en Unicode.

El caso del radical(U+8278) demuestra lo arbitrario que es el estado de las cosas. Cuando se usa para componer caracteres como(U+8349), el radical se colocaba en la parte superior, pero tenía dos formas diferentes. El chino tradicional y el coreano usan una versión de cuatro trazos. En la parte superior dedebería haber algo que parezca dos signos de suma ( ⺿ ). El chino simplificado, el japonés Kyūjitai y el japonés Shinjitai usan una versión de tres trazos, como dos signos de suma que comparten sus trazos horizontales ( , es decir,). Los organismos de codificación de texto de la República Popular China no codificaron las dos variantes de manera diferente. El hecho de que casi todos los demás cambios introducidos por la República Popular China, por mínimos que fueran, justificaran su propio punto de código sugiere que esta excepción pudo haber sido involuntaria. Unicode copió los estándares existentes tal cual, conservando tales irregularidades.

El Consorcio Unicode ha reconocido errores en otros casos. Los numerosos bloques Unicode para los ideogramas CJK Han presentan redundancias en los estándares originales, redundancias derivadas de una importación defectuosa de dichos estándares, así como fusiones accidentales que posteriormente se corrigen, lo que sienta un precedente para la desunificación de caracteres.

Para los hablantes nativos, las variantes pueden resultar ininteligibles o inaceptables en contextos educativos. Los hablantes de inglés pueden entender una nota manuscrita que diga "4P5 kg" como "495 kg", pero escribir el nueve al revés (de modo que parezca una "P") puede resultar chocante y se consideraría incorrecto en cualquier escuela. Del mismo modo, para los usuarios de una lengua CJK que leen un documento con caracteres "extranjeros": las variantes depueden aparecer como imágenes especulares,puede carecer de un trazo o tener un trazo adicional, y(en lugar de) puede resultar ilegible para personas no japonesas. (En Japón, ambas variantes son aceptadas).

Ejemplos de algunos ideogramas Han no unificados

En algunos casos, sobre todo cuando los cambios son más notables, Unicode ha codificado caracteres variantes, lo que hace innecesario cambiar de fuente o langatributo. Sin embargo, algunas variantes con diferencias mínimas obtienen puntos de código distintos, y no todas las variantes con cambios sustanciales obtienen un punto de código único. Por ejemplo, consideremos el carácter(U+5165), cuya única forma de mostrar las variantes es cambiando la fuente (o langatributo) como se describe en la tabla anterior. Por otro lado, para(U+5167), la variante(U+5185) obtiene un punto de código único. Para algunos caracteres, como/(U+514C/U+5151), se puede usar cualquiera de los dos métodos para mostrar los diferentes glifos. En la siguiente tabla, cada fila compara las variantes a las que se les han asignado diferentes puntos de código. Para mayor brevedad, tenga en cuenta que las variantes de shinjitai con diferentes componentes generalmente (y como era de esperar) tomarán puntos de código únicos (p. ej.,氣/気). No aparecerán aquí, ni tampoco los caracteres chinos simplificados que toman componentes radicales simplificados de forma consistente (p. ej.,/,/). [ 17 ] Esta lista no es exhaustiva.

Base de datos de variación ideográfica (IVD)

Para resolver los problemas derivados de la unificación Han, se creó un estándar técnico Unicode conocido como Base de Datos de Variación Ideográfica Unicode para resolver el problema de especificar glifos específicos en un entorno de texto plano. [ 18 ] Al registrar colecciones de glifos en la Base de Datos de Variación Ideográfica (IVD), es posible utilizar Selectores de Variación Ideográfica para formar Secuencias de Variación Ideográfica (IVS) y así especificar o restringir el glifo apropiado en el procesamiento de texto en un entorno Unicode.

Rangos Unicode

Los caracteres ideográficos asignados por Unicode aparecen en los siguientes bloques:

Unicode incluye soporte para radicales, trazos, signos de puntuación, marcas y símbolos CJKV en los siguientes bloques:

En estos bloques aparecen caracteres adicionales de compatibilidad (de uso desaconsejado):

Estos caracteres de compatibilidad (excluyendo los doce ideogramas unificados del bloque de ideogramas de compatibilidad CJK) se incluyen para garantizar la compatibilidad con sistemas de procesamiento de texto heredados y otros conjuntos de caracteres heredados. Incluyen formas de caracteres para el diseño de texto vertical y caracteres de texto enriquecido que Unicode recomienda procesar por otros medios.

Núcleo de Ideógrafos Internacionales

El Núcleo Internacional de Ideogramas (IICore) es un subconjunto de 9810 ideogramas derivados de las tablas de Ideogramas Unificados CJK, diseñado para implementarse en dispositivos con memoria limitada, capacidad de entrada/salida y/o aplicaciones donde no es factible el uso del repertorio completo de ideogramas ISO 10646. El estándar actual contiene 9810 caracteres. [ 20 ]

Véase también

Notas

  1. La mayoría de estos son caracteres heredados y obsoletos; sin embargo, según el objetivo de Unicode de codificar todos los sistemas de escritura que se utilizan o se han utilizado alguna vez, solo se necesitan entre 2000 y 3000 caracteres para ser considerado alfabetizado.

Referencias

  1. "Anexo estándar Unicode® n.º 38 | BASE DE DATOS UNICODE HAN (UNIHAN)" . Consorcio Unicode . 1 de septiembre de 2023.
  2. "Capítulo 18: Asia Oriental, Principios de la Unificación Han" . El estándar Unicode . Consorcio Unicode.
  3. Whistler, Ken (25 de octubre de 2010). "Nota técnica Unicode 26: Sobre la codificación del latín, el griego, el cirílico y el han" .
  4. "Historia de la unificación Han" . El estándar Unicode . Consorcio Unicode.
  5. "La vida secreta de Unicode" . IBM . 16 de diciembre de 2013. Archivado del original el 16 de diciembre de 2013. Consultado el 30 de septiembre de 2023 .
  6. Unicode revisado Steven J. Searle; Webmaster, TRON Web
  7. ^ "IVD/IVS とは - 文字情報基盤整備事業" . mojikiban.ipa.go.jp .
  8. 1 2 "Capítulo 1: Introducción" . El estándar Unicode . Consorcio Unicode.
  9. 1 2 "Base de datos de variación ideográfica" . Consorcio Unicode.
  10. "Los primeros años de Unicode" . Consorcio Unicode.
  11. Becker, Joseph D. (1998-08-29). "Unicode 88" (PDF) .
  12. "Unicode en Japón: Guía para una lucha técnica y psicológica" . Archivado del original el 27 de junio de 2009.
  13. 小林紀興『松下電器の果し状』1章
  14. Krikke, Jan (15 de octubre de 2003). "El sistema operativo más popular del mundo" . LinuxInsider.com .
  15. 大下英治 『孫正義 起業の若き獅子』( ISBN 4-06-208718-9págs. 285-294
  16. ^ "UAX n . ° 38: base de datos Unicode Han (Unihan)" . www.unicode.org .
  17. "Búsqueda en la base de datos Unihan" . El estándar Unicode . Consorcio Unicode.
  18. "UTS #37: Base de datos de variación ideográfica de Unicode" . www.unicode.org .
  19. «URÓ» . ccjktype.fonts.adobe.com .
  20. "OGCIO : Área de descarga : Utilidad de comparación del núcleo de ideogramas internacionales (IICORE)" . www.ogcio.gov.hk .