Un carácter precompuesto (o carácter compuesto o carácter descomponible ) es una entidad multiglifo representada en Unicode por un único punto de código . Un carácter precompuesto puede representar una letra con un signo diacrítico , como ⟨é⟩ ( U+00E9é LETRA MINÚSCULA LATINA E CON AGUDO ).
El mismo carácter también puede crearse utilizando una secuencia de puntos de código, uno para cada uno de los glifos que componen el carácter. Por ejemplo, en términos Unicode, la letra ⟨é⟩ es un carácter que puede representarse directamente utilizando U+00E9o alternativamente puede descomponerse en una cadena equivalente de la letra base ⟨e⟩ ( U +0065 e LETRA MINÚSCULA LATINA E ) junto con la forma combinatoria del acento agudo ( U+0301 ◌́ ACENTO AGUDO COMBINADO ). De manera similar, las ligaduras precompuestas son precomposiciones de sus letras o grafemas constituyentes ; por ejemplo, la U+0133 ij LIGATURA MINÚSCULA LATINA IJ , utilizada en neerlandés .
Los caracteres precompuestos son la solución tradicional para representar muchas letras especiales en diversos conjuntos de caracteres . En Unicode, se incluyeron para garantizar la compatibilidad con sistemas de codificación antiguos, como los distintos componentes de ISO 8859 y otros tipos de " ASCII extendido ". La política más reciente de Unicode ha sido la de evitar la creación de nuevos caracteres precompuestos si el carácter puede generarse mediante formas combinadas.
Comparación de caracteres precompuestos y descompuestos
En el siguiente ejemplo, hay un apellido sueco común , Åström, escrito en los dos métodos alternativos, el primero con una Å (U+00C5) y una ö (U+00F6) precompuestas, y el segundo usando una letra base A descompuesta (U+0041) con un anillo combinado arriba (U+030A) y una o (U+006F) con una diéresis combinadora (U+0308).
- Å str ö m (U+00C5U+0073 U+0074 U+0072U+00F6U+006D)
- A ̊ stro ̈ m (U+0041 U+030A U+0073 U+0074 U+0072 U+006F U+0308 U+006D)
Salvo por los colores, ambas soluciones son equivalentes y deberían mostrarse de forma idéntica. Sin embargo, en la práctica, algunas implementaciones de Unicode aún presentan dificultades con los caracteres descompuestos. En el peor de los casos, los diacríticos combinados pueden ignorarse o mostrarse como caracteres no reconocidos después de sus letras base, ya que no están incluidos en todas las fuentes de ordenador . Para solucionar estos problemas, algunas aplicaciones pueden simplemente intentar reemplazar los caracteres descompuestos con los caracteres precompuestos equivalentes.
Sin embargo, con una fuente incompleta, los caracteres precompuestos también pueden resultar problemáticos, especialmente si son más exóticos, como en el siguiente ejemplo (que muestra la palabra protoindoeuropea reconstruida para "perro"):
- ḱṷṓ n (U+1E31 U+1E77 U+1E53U+006E)
- k ́ u ̭ o ̄ ́ n (U+006B U+0301 U+0075 U+032D U+006F U+0304 U+0301 U+006E)
En algunos casos, las letras precompuestas verdes k , u y o con diacríticos pueden aparecer como caracteres no reconocidos , o su apariencia tipográfica puede ser muy diferente a la de la letra final n sin diacrítico. En la segunda línea, las letras base deberían mostrarse correctamente, incluso si los diacríticos que las combinan no se reconocen.
OpenType dispone de la etiqueta de característica ccmp para definir grafemas que son composiciones o descomposiciones que implican la combinación de caracteres.
caracteres chinos
En teoría, la mayoría de los caracteres chinos, tal como se codifican mediante la unificación Han y esquemas similares, podrían tratarse como caracteres precompuestos, ya que pueden reducirse (descomponerse) a sus componentes radicales y fonéticos constituyentes con lenguajes de descripción de caracteres chinos . Este enfoque podría reducir el número de caracteres en el conjunto de caracteres de decenas de miles a solo unos pocos miles. Por otro lado, un conjunto de caracteres descompuestos presentaría desafíos para el software de búsqueda y edición, y requeriría más bytes de codificación por documento. Un desafío particular serían las proyecciones múltiples entre el conjunto de caracteres descompuestos y el carácter precompuesto: un carácter precompuesto puede descomponerse en múltiples conjuntos diferentes de caracteres descompuestos, mientras que un conjunto de caracteres descompuestos podría contraerse en múltiples caracteres precompuestos diferentes. No existe ningún requisito o restricción estricta con respecto a la posición relativa entre los componentes dentro de un carácter, la forma de variante y transformación (estrechar, ensanchar, estirar, rotar, etc.) aplicada a los componentes, ni el número de cada componente.
Véase también
- Formatos de presentación alfabéticos : bloque de caracteres Unicode
- Formularios de presentación en árabe - A - Bloque de caracteres Unicode
- Formularios de presentación en árabe-B – Bloque de caracteres Unicode
- Diseño de texto complejo : posicionamiento de grafemas dependiente del vecino
- Tecla de composición : tecla del ordenador para iniciar la fusión de glifos.
- Tecla muerta : un tipo especial de tecla modificadora del teclado.
- Lista de caracteres latinos precompuestos en Unicode
- Caracteres de compatibilidad Unicode : caracteres codificados únicamente para mantener la convertibilidad bidireccional con otros estándares.
- Equivalencia Unicode : un aspecto del estándar Unicode.
Fuentes
- El estándar Unicode, versión 5.2: Conformidad (véase la sección 3.7 para la descomposición). El Consorcio Unicode, diciembre de 2009.
- MSDN: Definición de un conjunto de caracteres . 8 de abril de 2010.
- Formularios de normalización Unicode (Anexo estándar Unicode® n.º 15): http://unicode.org/reports/tr15/
Enlaces externos
- Free Idg Serif , una variante de la fuente FreeSerif con declaraciones añadidas de caracteres precompuestos.
- Unicode