El estándar Unicode asigna varias propiedades a cada carácter y punto de código Unicode . [ 1 ] [ 2 ]
Las propiedades se pueden usar para manejar caracteres (puntos de código) en procesos, como en el salto de línea, la dirección de escritura de derecha a izquierda o la aplicación de controles. También se definen algunas "propiedades de caracteres" para puntos de código que no tienen un carácter asignado y para puntos de código etiquetados como " < no es un carácter > ". Las propiedades de caracteres se describen en el Anexo Estándar n.° 44. [ 2 ]
Las propiedades tienen niveles de fuerza: normativa, informativa, contributiva o provisional. Para simplificar la especificación, una propiedad de carácter puede asignarse especificando un rango continuo de puntos de código que tengan la misma propiedad. [ 3 ]
Elementos semánticos
Las propiedades se muestran en el siguiente orden: [ 4 ]
[código];[nombre];[gc];[cc];[bc];[descomposición];[nv-dec];[nv-dig];[nv-num];[bm];[alias];;[mayúsculas];[minúsculas];[mayúsculas iniciales]
alias= nombre corregido. Obsoleto. Ahora se gestiona con una base de datos independiente, pero se mantiene para nombres Unicode 1.0.bc= categoría bidireccional [I, D, etc.]bm= bidi reflejado [N o Y]cc= clase de combinación [posición del diacrítico]decompositiontipo o <mapeo> = letra + diacrítico, ligadura XY, superíndice X, fuente X, X inicial, X medial, X final, X aislada, X vertical, etc.gc= categoría general [letra, símbolo, dígito, puntuación, comportamiento de mayúsculas y minúsculas, etc.]nv= tipo numérico y valor [de un dígito]. Si el tipo numérico es 'decimal', se llenan las 3 casillas. Si es 'digit', la primera será nula. (Esta función se ha descontinuado). Si es 'numeric', las dos primeras serán nulas y solo se utilizará la última.
La propiedad entre aliasy upper caseestá obsoleta y ahora es nula para todos los caracteres Unicode.
Nombre y alias
A un carácter Unicode se le asigna un nombre único (na). [ 1 ] El nombre se compone de letras mayúsculas A–Z, dígitos 0–9, guion-menos y espacio . Algunas secuencias están excluidas: no se permiten nombres que comiencen con un espacio o un guion, nombres que terminen con un espacio o un guion, espacios o guiones repetidos y espacios después de un guion. Se garantiza que el nombre sea único dentro de Unicode y se puede utilizar para identificar un punto de código y su carácter. Los caracteres ideográficos, de los cuales hay decenas de miles, se nombran en el patrón " cjk ideograma unificado - hhhh ". Por ejemplo, U+4E00一CJK IDEÓGRAFO UNIFICADO-4E00 . Los caracteres de formato también tienen nombres: U+00A0 ESPACIO SIN SALTO .
Las siguientes categorías Unicode no tienen un valor de Nombre asignado: Controles (Categoría general: Cc), Uso privado (Co), Sustituto (Cs), No caracteres (Cn) y Reservado (Cn). Se puede hacer referencia a ellas, informalmente, mediante un meta-nombre genérico o específico, llamado "Etiquetas de punto de código": <control>, <control-0088>, <reservado>, <no carácter- hhhh >, <uso privado- hhhh > o <sustituto> . Dado que estas etiquetas contienen "<" y ">", nunca pueden aparecer en un Nombre, lo que evita confusiones.
Nombres Unicode 1.0
En la versión 2.0 de Unicode, se modificaron muchos nombres. A partir de entonces, entró en vigor la regla de que "un nombre nunca cambia", que incluye el uso estricto (normativo) de alias. Los nombres de Unicode 1.0 en desuso se trasladaron a la propiedad Alias para garantizar la compatibilidad con versiones anteriores.
Por ejemplo, U+0264 ɤ LATIN SMALL LETTER RAMS HORN tiene el nombre Unicode 1.0 "LATIN SMALL LETTER BABY GAMMA".
Alias del nombre del personaje
A partir de Unicode 2.0, el nombre publicado para un punto de código nunca cambiará. Por lo tanto, en caso de que un nombre de carácter esté mal escrito o si el nombre del carácter es completamente incorrecto o seriamente engañoso, se puede asignar un alias de nombre de carácter formal al carácter, y este alias puede ser utilizado por las aplicaciones en lugar del nombre de carácter defectuoso real. [ 1 ] Por ejemplo, U+FE18 ︘ FORMULARIO DE PRESENTACIÓN PARA CORCHETE LENTICULAR BLANCO VERTICAL DERECHO tiene el alias de nombre de carácter " FORMULARIO DE PRESENTACIÓN PARA CORCHETE LENTICULAR BLANCO VERTICAL DERECHO " para mitigar la mala ortografía de "corchete" como "brakcet" [ sic ] en el nombre de carácter real; U+A015 ꀕ SÍLABA YI WU tiene el alias de nombre de carácter "MARCA DE ITERACIÓN DE SÍLABA YI" porque, a diferencia del nombre del carácter, no tiene un valor silábico fijo.
Además de los alias de nombres de caracteres, que son correcciones a nombres de caracteres defectuosos, a algunos caracteres se les asignan alias que son nombres alternativos o abreviaturas. En el estándar Unicode se definen cinco tipos de alias de nombres de caracteres:
- Corrección: correcciones para nombres de personajes mal escritos o gravemente incorrectos;
- Control: Nombres ISO 6429 para las funciones de control C0 y C1 (a las que no se les asignan nombres de caracteres en el estándar Unicode);
- Alternativa: nombres alternativos para algunos caracteres de formato (solo U+FEFF ESPACIO SIN SALTO DE ANCHO CERO que tiene el alias "MARCA DE ORDEN DE BYTE" );
- Figment: Etiquetas documentadas para algunas funciones del código de control C1 que no son nombres reales en ningún estándar;
- Abreviaturas: Abreviaturas o acrónimos de códigos de control, caracteres de formato, espacios y selectores de variación.
Todos los alias de nombres de caracteres formales siguen las reglas para nombres de caracteres permitidos y se garantiza que son únicos tanto dentro del alias de nombre de carácter como en los espacios de nombres de nombres de caracteres (por esta razón, el nombre ISO 6429 "BELL" no está definido como un alias para U+0007 <control-0007>porque U+1F514 se llama "BELL"; U+0007 en cambio tiene el alias "ALERT"). [ 1 ]
A partir de Unicode 17.0, se definen 39 alias de nombres de caracteres formales como correcciones para nombres de caracteres defectuosos. [ 5 ]
Además de estos nombres normativos, en las tablas de códigos Unicode pueden aparecer nombres informales . Estos son otros nombres de uso común para un carácter y no tienen la misma restricción de caracteres. No se garantiza la unicidad de estos nombres informales, y podrían modificarse o eliminarse en versiones posteriores del estándar.
Categoría general
A cada punto de código se le asigna un valor para la categoría general. Esta es una de las propiedades de carácter que también se definen para los puntos de código no asignados y los puntos de código que se definen como "no un carácter".
Puntuación
Los caracteres tienen propiedades independientes que indican si son signos de puntuación . Todas las propiedades tienen valores Sí/No : Dash , Quotation_Mark , Sentence_Terminal y Terminal_Punctuation . La propiedad Punctuation se refiere a los caracteres que se utilizan para dividir o estructurar el texto, y estos se clasifican en diferentes tipos según su función. Unicode asigna categorías específicas a estos signos de puntuación.
Espacio en blanco
El espacio en blanco es un concepto comúnmente utilizado para un efecto tipográfico. Básicamente, abarca caracteres invisibles que producen un efecto de espaciado en el texto renderizado. Incluye espacios , tabulaciones y controles de formato de nueva línea. En Unicode, dicho carácter tiene la propiedad establecida WSpace=yes. En la versión 17.0 , existen 25 caracteres de espacio en blanco.
Caja
El valor de mayúsculas y minúsculas es normativo en Unicode. Se refiere a los sistemas de escritura que utilizan mayúsculas y minúsculas. La diferencia de mayúsculas y minúsculas se presenta en los sistemas de escritura Adlam, armenio, Beria Erfe, Cherokee, copto, cirílico, Deseret, Garay, glagolítico, griego, georgiano Khutsuri y Mkhedruli, latín, Medefaidrin, húngaro antiguo, Osage, Vithkuqi y Warang Citi.
Los distintos idiomas tienen diferentes reglas de asignación de mayúsculas y minúsculas.
En turco, U+0069 i LETRA MINÚSCULA LATINA I corresponde a U+0130 İ LETRA MAYÚSCULA LATINA I CON PUNTO ENCIMA en lugar de U+0049 I LETRA MAYÚSCULA LATINA I. De manera similar, U+0049 I LETRA MAYÚSCULA LATINA I cuando corresponde a U+0131 ı LETRA MINÚSCULA LATINA I SIN PUNTO en lugar de U+0069 i LETRA MINÚSCULA LATINA I.
En Nawdm , la letra Ĥ corresponde a ɦ en minúscula en lugar de las correspondencias habituales de Ĥĥ y Ɦɦ.
En griego, la letra sigma tiene diferentes formas minúsculas dependiendo de su posición en la palabra. U+03A3 Σ SIGMA MAYÚSCULA GRIEGA se convierte en U+03C3 σ SIGMA MINÚSCULA GRIEGA si está al principio o en medio de una palabra, y se convierte en U+03C2 ς SIGMA MINÚSCULA FINAL GRIEGA si está al final de una palabra.
En lituano, el punto en las letras minúsculas i y j se conserva cuando va seguido de acentos. Por ejemplo: Í en minúscula es i̇́. [ 19 ]
A pesar de la existencia de U+1E9E ẞ LETRA MAYÚSCULA LATINA SHARP S , U+00DF ß LETRA MINÚSCULA LATINA SHARP S corresponde a "SS".
Unicode codifica 31 caracteres en mayúscula inicial.
- U+01C5 Dž LETRA MAYÚSCULA LATINA D CON LETRA PEQUEÑA Z CON CARON
- U+01C8 Lj LETRA MAYÚSCULA LATINA L CON LETRA J MINÚSCULA
- U+01CB Nj LETRA MAYÚSCULA LATINA N CON LETRA J MINÚSCULA
- U+01F2 Dz LETRA MAYÚSCULA LATINA D CON LETRA MINÚSCULA Z
- U+1F88 ᾈ LETRA MAYÚSCULA GRIEGA ALFA CON PSILI Y PROSGEGRAMMENI
- U+1F89 ᾉ LETRA MAYÚSCULA GRIEGA ALFA CON DASIA Y PROSGEGRAMMENI
- U+1F8A ᾊ LETRA MAYÚSCULA GRIEGA ALFA CON PSILI Y VARIA Y PROSGEGRAMMENI
- U+1F8B ᾋ LETRA MAYÚSCULA GRIEGA ALFA CON DASIA Y VARIA Y PROSGEGRAMMENI
- U+1F8C ᾌ LETRA MAYÚSCULA GRIEGA ALFA CON PSILI Y OXIA Y PROSGEGRAMMENI
- U+1F8D ᾍ LETRA MAYÚSCULA GRIEGA ALFA CON DASIA Y OXIA Y PROSGEGRAMMENI
- U+1F8E ᾎ LETRA ALFA MAYÚSCULA GRIEGA CON PSILI Y PERISPOMENI Y PROSGEGRAMMENI
- U+1F8F ᾏ LETRA MAYÚSCULA GRIEGA ALFA CON DASIA, PERISPOMENI Y PROSGEGRAMMENI
- U+1F98 ᾘ LETRA MAYÚSCULA GRIEGA ETA CON PSILI Y PROSGEGRAMMENI
- U+1F99 ᾙ LETRA MAYÚSCULA GRIEGA ETA CON DASIA Y PROSGEGRAMMENI
- U+1F9A ᾚ LETRA MAYÚSCULA GRIEGA ETA CON PSILI Y VARIA Y PROSGEGRAMMENI
- U+1F9B ᾛ LETRA MAYÚSCULA GRIEGA ETA CON DASIA Y VARIA Y PROSGEGRAMMENI
- U+1F9C ᾜ LETRA MAYÚSCULA GRIEGA ETA CON PSILI Y OXIA Y PROSGEGRAMMENI
- U+1F9D ᾝ LETRA MAYÚSCULA GRIEGA ETA CON DASIA Y OXIA Y PROSGEGRAMMENI
- U+1F9E ᾞ LETRA MAYÚSCULA GRIEGA ETA CON PSILI Y PERISPOMENI Y PROSGEGRAMMENI
- U+1F9F ᾟ LETRA MAYÚSCULA GRIEGA ETA CON DASIA Y PERISPOMENI Y PROSGEGRAMMENI
- U+1FA8 ᾨ LETRA MAYÚSCULA GRIEGA OMEGA CON PSILI Y PROSGEGRAMMENI
- U+1FA9 ᾩ LETRA MAYÚSCULA GRIEGA OMEGA CON DASIA Y PROSGEGRAMMENI
- U+1FAA ᾪ LETRA MAYÚSCULA GRIEGA OMEGA CON PSILI Y VARIA Y PROSGEGRAMMENI
- U+1FAB ᾫ LETRA MAYÚSCULA GRIEGA OMEGA CON DASIA Y VARIA Y PROSGEGRAMMENI
- U+1FAC ᾬ LETRA MAYÚSCULA GRIEGA OMEGA CON PSILI Y OXIA Y PROSGEGRAMMENI
- U+1FAD ᾭ LETRA MAYÚSCULA GRIEGA OMEGA CON DASIA Y OXIA Y PROSGEGRAMMENI
- U+1FAE ᾮ LETRA MAYÚSCULA GRIEGA OMEGA CON PSILI Y PERISPOMENI Y PROSGEGRAMMENI
- U+1FAF ᾯ LETRA MAYÚSCULA GRIEGA OMEGA CON DASIA Y PERISPOMENI Y PROSGEGRAMMENI
- U+1FBC ᾼ LETRA ALFA MAYÚSCULA GRIEGA CON PROSGEGRAMMENI
- U+1FCC ῌ LETRA MAYÚSCULA GRIEGA ETA CON PROSGEGRAMMENI
- U+1FFC ῼ LETRA MAYÚSCULA GRIEGA OMEGA CON PROSGEGRAMMENI
Otras características generales
Unicode define varias propiedades generales de los caracteres en la base de datos de caracteres Unicode (UAX #44). Algunas de las más importantes incluyen:
- Ideográficos : caracteres que representan ideas o conceptos en lugar de sonidos específicos. Estos incluyen la mayoría de los caracteres Han (CJK) utilizados en los sistemas de escritura chino, japonés y coreano. [ 20 ]
- Alfabético : caracteres que se consideran letras en un sistema de escritura alfabético o silábico. Esto incluye letras latinas, griegas y cirílicas, así como caracteres de silabarios como el hiragana. [ 21 ]
- No carácter : Puntos de código reservados permanentemente para uso interno y que no se asignan a ningún carácter abstracto. Estos incluyen U+FDD0 a U+FDEF, y cualquier código que termine en FFFE o FFFF (como U+1FFFE, U+10FFFF). [ 22 ]
Clase de combinación
Algunos códigos comunes:
- 0 = letra, símbolo o modificador de espaciado (por ejemplo , a , ( , ʰ )
- 1 = superposición
- 6 = Lectura Han (marcas diacríticas de lectura CJK)
- 7 = nukta ( nukta diacrítico en escrituras bráhmicas )
- 8 = marcas de sonoridad kana
- 9 = virama
10 – 199 = diversas clases de posición fija
Marcas que se adhieren a la letra base:
- 200 = adjunto en la parte inferior izquierda
- 202 = adjunto directamente debajo (por ejemplo, cedilla en ç)
- 204 = adjunto en la parte inferior derecha
- 208 = adjunto a la izquierda
- 210 = adjunto a la derecha
- 212 = adjunto en la parte superior izquierda
- 214 = adjunto directamente arriba
- 216 = adjunto en la parte superior derecha
Marcas que no se adhieren a la letra base:
- 218 = esquina inferior izquierda
- 220 = directamente debajo (por ejemplo, anillo en n̥)
- 222 = abajo a la derecha
- 224 = izquierda
- 226 = derecha
- 228 = arriba a la izquierda
- 230 = arriba (por ejemplo, acento agudo en á)
- 232 = arriba a la derecha
- 233 = doble de abajo (subtiende dos bases)
- 234 = doble arriba (extiende dos bases)
- 240 = subíndice iota (solo ese diacrítico griego)
escritura bidireccional
Seis propiedades de caracteres se refieren a la escritura bidireccional: Bidi_Class , Bidi_Control , Bidi_Mirrored , Bidi_Mirroring_Glyph , Bidi_Paired_Bracket y Bidi_Paired_Bracket_Type .
Una de las características principales de Unicode es la compatibilidad con la visualización de texto bidireccional ( Bidi ) de derecha a izquierda (D-a-I) y de izquierda a derecha (I-a-D). El algoritmo bidireccional de Unicode UAX9 [ 23 ] describe el proceso de presentación de texto con direcciones de escritura variables. Por ejemplo, permite insertar una cita en hebreo en un texto en inglés. El tipo de carácter Bidi_Character_Type indica el comportamiento de un carácter en la escritura direccional. Para anular una dirección, Unicode ha definido caracteres de control de formato especiales ( caracteres de control Bidi ). Estos caracteres pueden imponer una dirección y, por definición, solo afectan a la escritura bidireccional.
Cada punto de código tiene una propiedad llamada Bidi_Class . Esta define su comportamiento en un texto bidireccional tal como lo interpreta el algoritmo:
En situaciones normales, el algoritmo puede determinar la dirección de un texto mediante esta propiedad de carácter. Para controlar situaciones bidireccionales más complejas, por ejemplo, cuando un texto en inglés tiene una cita en hebreo, se agregan opciones adicionales a Unicode. Doce caracteres tienen la propiedad Bidi_Control=Yes: ALM, FSI, LRE, LRI, LRM, LRO, PDF, PDI, RLE, RLI, RLM y RLO como se nombran en la tabla. Estos son caracteres de control de formato invisibles, solo utilizados por el algoritmo y sin efecto fuera del formato bidireccional. [ 23 ] A pesar del nombre, son caracteres de formato, no caracteres de control, y tienen la categoría general Otros, formato (Cf) en la definición Unicode.
Básicamente, el algoritmo determina una secuencia de caracteres con el mismo tipo de dirección fuerte (de derecha a izquierda o de izquierda a derecha), teniendo en cuenta la anulación por parte de los controles bidireccionales especiales. A las cadenas numéricas (tipos débiles) se les asigna una dirección según su entorno fuerte, al igual que a los caracteres neutros. Finalmente, los caracteres se muestran según la dirección de cada cadena.
Dos propiedades de los caracteres son relevantes para determinar la imagen especular de un glifo en texto bidireccional: Bidi_Mirrored=Yesindica que el glifo debe reflejarse al escribirse de derecha a izquierda. La propiedad Bidi_Mirroring_Glyph=U+hhhhpuede entonces apuntar al carácter reflejado. Por ejemplo, los paréntesis ( , ) se reflejan de esta manera. El algoritmo no se encarga de dar forma a las escrituras cursivas, como el árabe, ni de reflejar los glifos que tienen una dirección.
Valores y tipos numéricos
Decimal
Los caracteres se clasifican con un tipo numérico . [ 1 ] Caracteres como fracciones, subíndices, superíndices, números romanos, numeradores de moneda, números encerrados en un círculo y dígitos específicos de cada escritura son de tipo numérico. Tienen un valor numérico que puede ser decimal, incluyendo cero y negativos, o una fracción común. Si no existe tal valor, como ocurre con la mayoría de los caracteres, el tipo numérico es "Ninguno".
Los caracteres que tienen un valor numérico se separan en tres grupos: Decimal (De), Dígito (Di) y Numérico (Nu, es decir, todos los demás). "Decimal" significa que el carácter es un dígito decimal simple. Solo los caracteres que forman parte de un rango codificado contiguo de 0 a 9 tienen el tipo numérico Decimal. Otros dígitos, como los superíndices, tienen el tipo numérico Dígito. Todos los caracteres numéricos, como fracciones y números romanos, terminan con el tipo "Numeric". El efecto previsto es que un analizador simple pueda usar estos valores numéricos decimales, sin distraerse, por ejemplo, con un superíndice numérico o una fracción. Ochenta y tres ideogramas CJK que representan un número, incluidos los utilizados para contabilidad, son de tipo Numérico.
Por otro lado, los caracteres que podrían tener un valor numérico como segundo significado siguen marcados como "Numérico de tipo Ninguno " y no tienen valor numérico. Por ejemplo, las letras latinas se pueden usar en la numeración de párrafos como "II.A.1.b", pero las letras "I", "A" y "b" no son numéricas (tipo Ninguno ) y no tienen valor numérico.
dígitos hexadecimales
Los caracteres hexadecimales son aquellos que pertenecen a la serie con valores hexadecimales 0123456789ABCDEF (dieciséis caracteres, valor decimal 0–15). La propiedad de carácter Hex_Digit se establece en Sí cuando un carácter pertenece a dicha serie:
Cuarenta y cuatro caracteres están marcados como Hex_Digit . Los que están en el bloque de Latín Básico también están marcados como ASCII_Hex_Digit .
Unicode no tiene caracteres separados para valores hexadecimales. En consecuencia, al usar caracteres regulares, no es posible determinar si se pretende representar un valor hexadecimal, ni siquiera si se pretende representar un valor en absoluto. Esto debe determinarse a un nivel superior, por ejemplo, anteponiendo 0x a un número hexadecimal o mediante el contexto. La única característica es que Unicode puede indicar si una secuencia puede o no ser un valor hexadecimal.
Bloquear
Un bloque es un rango contiguo de puntos de código con un nombre único. Se identifica por su primer y último punto de código. Los bloques no se superponen ni se extienden a través de planos. El número de puntos de código en cada bloque debe ser un múltiplo de 16. Un bloque puede contener puntos de código reservados, no asignados, etc. Cada carácter asignado tiene un único valor de "nombre de bloque" de los 346 nombres asignados a partir de la versión 17.0 de Unicode . Los puntos de código no asignados fuera de un bloque existente tienen el valor predeterminado "No_block".
Guion
Cada carácter asignado puede tener un único valor para su propiedad "Script", que indica a qué escritura pertenece. [ 24 ] El valor es un código de cuatro letras en el rango Aaaa-Zzzz, según lo disponible en ISO 15924, que se corresponde con un sistema de escritura . Excepto al describir el origen y el uso de una escritura, Unicode no utiliza una conexión entre una escritura y los idiomas que la utilizan. Por lo tanto, "hebreo" se refiere a la escritura hebrea, no al idioma hebreo.
El código especial Zyyy para "Común" permite un único valor para un carácter que se usa en varios alfabetos. El código Zinh "Alfabeto heredado", usado para combinar caracteres y otros puntos de código especiales, indica que un carácter "hereda" su identidad de alfabeto del carácter con el que se combina. (Unicode usaba anteriormente el código privado Qaai para este propósito). El código Zzzz "Desconocido" se usa para todos los caracteres que no pertenecen a un alfabeto (es decir, el valor predeterminado), como símbolos y caracteres de formato. En general, los caracteres de un solo alfabeto pueden estar dispersos en varios bloques, como los caracteres latinos . Y viceversa: varios alfabetos pueden estar presentes en un solo bloque, por ejemplo, el bloque Símbolos tipo letra contiene caracteres de los alfabetos latino, griego y común.
Cuando el campo "Script" está vacío, según Unicode, el carácter no pertenece a ningún alfabeto. Esto se aplica a los símbolos, ya que los códigos de alfabeto ISO existentes "Zmth" (notación matemática), "Zsym" (símbolo) y "Zsye" (símbolo, variante emoji) no se utilizan en Unicode. La propiedad "Script" también está vacía para los puntos de código que no son caracteres tipográficos, como controles, sustitutos y puntos de código de uso privado.
Si existe un nombre de alias de escritura específico en ISO 15924, se utiliza en el nombre del carácter: U+0041 A LETRA MAYÚSCULA LATINA A , y U+05D0 א LETRA HEBREA ALEF .
Propiedades de normalización
Descomposiciones, tipo de descomposición, clase de combinación canónica, exclusiones de composición y más.
Edad
La edad es la versión del estándar en la que se designó por primera vez el punto de código. El número de versión se abrevia a la numeración mayor.menor' , aunque se utilizan números de versión más detallados: las versiones 4.0.0 y 4.0.1 se denominan 4.0 como Edad. Según las versiones, la Edad puede estar dentro del rango: 1.1, 2.0, 2.1, 3.0, 3.1, 3.2, 4.0, 4.1, 5.0, 5.1, 5.2, 6.0, 6.1, 6.2, 6.3, 7.0, 8.0, 9.0, 10.0, 11.0, 12.0, 12.1, 13.0, 14.0, 15.0, 15.1, 16.0 y 17.0. [ 25 ] Los valores largos para Edad comienzan en una V y usan un guion bajo en lugar de un punto: V1_1, por ejemplo. [ 2 ] Los puntos de código sin un valor de edad asignado específicamente tienen el valor "NA", con la forma larga "Sin asignar".
Obsoleto
Una vez que se ha definido un carácter, no se eliminará ni se reasignará. [ 26 ] Sin embargo, un carácter puede estar obsoleto , lo que significa que su "uso está fuertemente desaconsejado". [ 27 ] A partir de la versión 17.0 de Unicode , los siguientes quince caracteres están obsoletos: [ 28 ]
Límites
El estándar Unicode especifica las siguientes propiedades relacionadas con los límites:
- grupo de grafemas
- Palabra
- Línea
- Oración
Nombre de alias
Unicode puede asignar alias a los puntos de código. Estos nombres son únicos entre todos los nombres (incluidos los regulares), por lo que pueden usarse como identificadores. Hay cinco posibles razones para agregar un alias:
- 1. Abreviatura
- Abreviaturas o acrónimos comunes para códigos de control, caracteres de formato, espacios y selectores de variación.
- Por ejemplo, U+00A0 NO-BREAK SPACE tiene el alias NBSP . A veces se presenta en un recuadro: NBSP.
- 2. Control
- Los nombres ISO 6429 para las funciones de control C0 y C1, así como otros nombres similares de uso común, se añaden como alias al carácter.
- Por ejemplo, U+0008 <control-0008>tiene el alias RETROCESO .
- 3. Corrección
- Se trata de una corrección para un "problema grave" en el nombre del personaje principal, normalmente un error.
- Por ejemplo, U+2118 ℘ SCRIPT CAPITAL P es en realidad una p minúscula , y por eso se le da el nombre de alias WEIERSTRASS ELLIPTIC FUNCTION : "en realidad tiene la forma de una p minúscula caligráfica, a pesar de su nombre, y a través del alias se agrega la ortografía correcta". En las descripciones, con el símbolo precedente ※ .
- 4. Alternativa
- Un nombre alternativo muy utilizado para un personaje.
- Ejemplo: U+FEFF ESPACIO SIN SALTO DE ANCHO CERO tiene el alias alternativo MARCA DE ORDEN DE BYTES .
- 5. Figment
- Varias etiquetas documentadas para puntos de código de control C1 que nunca fueron aprobadas en ninguna norma ( figment significa "fingido, ficticio").
- Por ejemplo, U+0099 <control-0099>Tiene el alias ficticio SINGLE GRAPHIC CHARACTER INTRODUCER . Este nombre es un concepto arquitectónico de los primeros borradores de la norma ISO/IEC 10646-1, pero nunca fue aprobado ni estandarizado.
Enlaces externos
- Base de datos de caracteres Unicode , anexo n.º 44, que explica las diferentes propiedades.
- UnicodeData.txt : una lista de todos los caracteres Unicode, con sus propiedades.
Referencias
- 1 2 3 4 5 "El estándar Unicode, capítulo 4: propiedades de los caracteres" . El Consorcio Unicode. Septiembre de 2025. Recuperado el 21 de septiembre de 2025 .
- 1 2 3 "Anexo estándar Unicode n.º 44: Base de datos de caracteres Unicode" . Unicode . 27 de agosto de 2024.
- ↑ "Anexo estándar Unicode n.º 44: Base de datos de caracteres Unicode, 4.2.3 Rangos de puntos de código" . Unicode . 27 de agosto de 2024.
- ↑ UnicodeData.txt
- ↑ "UCD: Alias de nombres" . Base de datos de caracteres Unicode . Consorcio Unicode. 24 de abril de 2024.
- ↑ "Estándares de diseño de caracteres: caracteres espaciales" . Estándares de diseño de caracteres . Microsoft . 1998-1999. Archivado del original el 14 de marzo de 2010. Consultado el 18 de mayo de 2009 .
- ↑ El estándar Unicode 5.0, edición impresa, pág. 205; también disponible en "Capítulo 6: Sistemas de escritura y puntuación" (PDF) . El estándar Unicode 5.0, edición electrónica . Consorcio Unicode . 14 de julio de 2006, pág. 11 (205) . Consultado el 22 de diciembre de 2022 .
- ↑ "Puntuación general" (PDF) . El estándar Unicode 5.1 . Unicode Inc. 1991–2008 . Consultado el 13 de mayo de 2009 .
- ↑ Sargent, Murray III (29 de agosto de 2006). "Codificación de texto casi plano Unicode para matemáticas (versión 2)" . Nota técnica Unicode n . ° 28. Unicode Inc. págs. 19-20 . Consultado el 19 de mayo de 2009 .
- ↑ Gillam, Richard (2002). Unicode Demystified: A Practical Programmer's Guide to the Encoding Standard . Addison-Wesley. ISBN 0-201-70052-2.
- 1 2 Hickson, Ian . "12.5 Referencias de caracteres con nombre" . Estándar HTML . WHATWG .
- ↑ Wolfram . "\ [ NegativeThickSpace ] " . Documentación del lenguaje Wolfram .
- ↑ Wolfram . "\ [ NegativeMediumSpace ] " . Documentación del lenguaje Wolfram .
- ↑ Wolfram . "\ [ NegativeThinSpace ] " . Documentación del lenguaje Wolfram .
- ↑ Wolfram . "\ [ NegativeVeryThinSpace ] " . Documentación del lenguaje Wolfram .
- ↑ Faltstrom, P., ed. (agosto de 2010). "Zero Width Non-Joiner" . The Unicode Code Points and Internationalized Domain Names for Applications (IDNA) . IETF . sec. A.1. doi : 10.17487/RFC5892 . RFC 5892. Consultado el 4 de septiembre de 2019 .
- ↑ Faltstrom, P., ed. (agosto de 2010). "Zero Width Joiner" . Los puntos de código Unicode y los nombres de dominio internacionalizados para aplicaciones (IDNA) . IETF . sec. A.2. doi : 10.17487/RFC5892 . RFC 5892. Consultado el 4 de septiembre de 2019 .
- "Anexo estándar Unicode n.º 44, base de datos de caracteres Unicode" .
- ↑ "Base de datos de caracteres Unicode: datos de mayúsculas y minúsculas especiales" . 10 de mayo de 2024.
- ↑ "Ideograma" . Glosario Unicode . Consultado el 19 de septiembre de 2025 .
- ↑ "Propiedad alfabética" . Base de datos de caracteres Unicode . Consultado el 19 de septiembre de 2025 .
- ↑ "Punto de código no carácter" . Glosario Unicode . Consultado el 19 de septiembre de 2025 .
- 1 2 "Anexo n.º 9 del estándar Unicode: Algoritmo bidireccional Unicode" . El estándar Unicode . 2024-09-02.
- ↑ "Anexo n.º 24 del estándar Unicode: Propiedad de escritura Unicode" . El estándar Unicode . 31 de julio de 2024.
- ↑ "UCD: Edad derivada" . Base de datos de caracteres Unicode . Consorcio Unicode. 30 de julio de 2025.
- ↑ " Políticas de estabilidad de la codificación de caracteres Unicode" . Unicode . Consorcio Unicode . 9 de enero de 2024. Consultado el 13 de enero de 2024.
Una vez codificado un carácter, no se moverá ni se eliminará.
- ↑ "El estándar Unicode, carácter D13 obsoleto" . 2025. Consultado el 21 de septiembre de 2025 .
- ↑ "PropList.txt" . Unicode . Consorcio Unicode . 30/06/2025 . Consultado el 21/09/2025 .
- ↑ "Capítulo 23.3: Caracteres de formato obsoletos" . 2025. Consultado el 11 de septiembre de 2025 .
- ↑ "23.9: Caracteres de etiqueta, uso obsoleto para el etiquetado de idiomas" . 2025. Consultado el 11 de septiembre de 2025 .
- Unicode