Articulo de referencia

ISO 639

ISO 639 es una norma de la Organización Internacional de Normalización (ISO) relativa a la representación de lenguas y grupos lingüísticos . Actualmente consta de cuatro conjunt...

ISO 639 es una norma de la Organización Internacional de Normalización (ISO) relativa a la representación de lenguas y grupos lingüísticos . Actualmente consta de cuatro conjuntos (1-3, 5) de código, nombrados según cada parte que anteriormente describía el conjunto respectivo (la parte 4 eran directrices sin su propio sistema de codificación); se publicó una parte 6, pero se retiró. Fue aprobada por primera vez en 1967 como una recomendación ISO de una sola parte , ISO/R 639 , [ 1 ] sustituida en 2002 por la parte 1 de la nueva serie, ISO 639-1 , [ 2 ] seguida de partes adicionales. Todas las partes existentes de la serie se consolidaron en una única norma en 2023, [ 3 ] basada en gran medida en el texto de ISO 639-4.

Uso de códigos ISO 639

Los códigos de idioma definidos en las distintas secciones de la norma ISO 639 se utilizan con fines bibliográficos y, en entornos informáticos y de internet, como elemento clave de los datos de localización . Estos códigos también se emplean en diversas aplicaciones, como las URL de Wikipedia para sus diferentes ediciones en distintos idiomas.

Historia

La forma inicial del sistema de codificación de idiomas de la ISO se manifestó en la norma ISO/R 639:1967, titulada Símbolos para idiomas, países y autoridades , cuyo objetivo principal era regular los vocabularios que designaban los idiomas, los países y los organismos de normalización de los organismos miembros de la ISO. Sus "símbolos de idioma" consistían en identificadores de longitud variable de una o dos letras en alfabetos latinos en mayúsculas, por ejemplo, Eo Enpara inglés; S, Sp, o Espara español; y para indonesio. También se permitía el uso de auxiliares numéricos UDCIn (anteriores a 1993) para indicar idiomas.

Tras la separación del código de país en la norma ISO 3166 en 1974, se publicó la primera edición de la norma ISO 639:1988, Código para la representación de nombres de idiomas, con un marco de identificadores uniformes de dos letras en alfabetos latinos minúsculos, prácticamente idénticos en formato y vocabulario a los de la actual ISO 639 Conjunto 1.

Desde entonces, el estándar se ha adoptado como una tecnología fundamental de la industria informática en rápida expansión ( RFC 1766 ), lo que ha llevado al desarrollo de un marco de tres letras más expresivo, publicado como ISO 639-2:1998, basado en gran medida en los códigos MARC para lenguajes. El sistema original de dos letras se redefinió como ISO 639-1 en 2001.

Con el objetivo de brindar un soporte más amplio a los idiomas para ampliar sus aplicaciones, se establecieron superconjuntos separados del espacio de nombres ISO 639-2 que cubren idiomas y grupos individuales como ISO 639-3 e ISO 639-5, respectivamente. También se intentó codificar variantes de idioma más precisas utilizando identificadores de cuatro letras como ISO 639-6, que posteriormente se retiró y se reorganizó bajo otro marco, ISO 21636 .

Las actualizaciones relativamente constantes de partes de la norma ISO 639 habían sido gestionadas por cada autoridad competente hasta la publicación de la ISO 639:2023, que armonizó y reunificó el texto de las normas anteriores e impulsó un cambio organizativo con una agencia de mantenimiento conjunta que supervisa todos los conjuntos y publica boletines informativos. La agencia de mantenimiento tiene su sede en Noruega. [ 4 ]

Conjuntos actuales y partes históricas del estándar

Cada conjunto de la norma es mantenido por una agencia de codificación de lenguaje, que agrega códigos y cambia el estado de los códigos cuando es necesario. ISO 639-6 fue retirada en 2014, [ 9 ] y no se incluyó en ISO 639:2023.

Características de los códigos individuales

Alcances:

  • Idiomas individuales
  • Macrolenguajes (Conjunto 3)
  • Colecciones de idiomas (Conjuntos 2 y 5). Algunas colecciones ya estaban en el Conjunto 2, y otras se añadieron solo en el Conjunto 5:
    • Grupos restantes: 36 colecciones tanto en el Conjunto 2 como en el Conjunto 5 son de este tipo; para garantizar la compatibilidad con el Conjunto 2 cuando el Conjunto 5 aún no se había publicado, los grupos restantes no contienen ningún idioma ni colección que ya estuviera codificado en el Conjunto 2 (sin embargo, las nuevas aplicaciones compatibles con el Conjunto 5 pueden tratar estos grupos de forma inclusiva, siempre que respeten la jerarquía de contención publicada en el Conjunto 5 y utilicen la colección más específica al agrupar idiomas);
      • La única colección que anteriormente tenía asignado un código de dos letras era Bihari (bh) durante la era de la Parte 1, que quedó obsoleta en junio de 2021. [ 10 ]
    • Grupos regulares: 29 colecciones en los conjuntos 2 y 5 son de este tipo; para garantizar la compatibilidad con el conjunto 2, no pueden contener otros grupos;
    • Familias: 50 nuevas colecciones codificadas solo en el Conjunto 5 (incluida una que contiene un grupo regular ya codificado en el Conjunto 2); para garantizar la compatibilidad con el Conjunto 2, pueden contener otras colecciones, excepto grupos restantes.
  • Dialectos : estaban previstos para ser cubiertos por la antigua norma ISO 639-6 (propuesta pero ahora retirada).
  • Situaciones especiales (Conjuntos 2, 3).
  • Reservado para uso local (conjuntos 2 y 3). También se utiliza a veces en aplicaciones que requieren un código de dos letras, como los códigos estándar de los conjuntos 1 y 2 (donde el código especial misno es adecuado), o un código de tres letras para colecciones, como los códigos estándar del conjunto 5.

Tipos (para idiomas individuales):

  • Lenguas vivas (Conjuntos 2, 3) (excepto el sánscrito, todas las demás macrolenguas son lenguas vivas) [ 11 ]
  • Lenguas extintas (Conjuntos 2, 3) (599, [ 12 ] 5 de ellas están en el Conjunto 2: chb, chg, cop, lui, sam; ninguna está en el Conjunto 1)
  • Lenguas históricas (Conjuntos 1, 2, 3) (213, [ 13 ] 35 de ellas están en el Conjunto 2; y 5 de ellas, a saber ave, , chu, lat, pliy san, también tienen un código en el Conjunto 1: ae, cu, la, pi, sa)
    • 124 de ellas fueron categorizadas como lenguas antiguas , [ 14 ] este tipo se ha fusionado con el de lenguas históricas desde aproximadamente 2024.
  • Lenguajes construidos (Conjuntos 1, 2, 3) (23, [ 15 ] 9 de ellos en el Conjunto 2: afh, epo, ido, ile, ina, jbo, tlh, vol, zbl; 5 de ellos en el Conjunto 1: eo, ia, ie, io, vo)

Lenguajes individuales y macrolenguajes con dos códigos distintos de tres letras en el Conjunto 2:

  • Bibliográfico (algunos de ellos fueron descontinuados, ninguno fue definido en el Conjunto 3): estos son códigos heredados (basados ​​en nombres de idiomas en inglés).
  • Terminológica (también definida en el Conjunto 3): estos son los códigos preferidos (basados ​​en los nombres en el idioma nativo, romanizados si es necesario).
  • Todos los demás (incluidas las colecciones de idiomas y los códigos especiales/reservados) solo tienen un único código de tres letras para ambos usos.

Relaciones entre los conjuntos

Los distintos conjuntos de la norma ISO 639 están diseñados para funcionar conjuntamente, de forma que ningún código tenga un significado diferente en cada conjunto. Sin embargo, no todos los idiomas están incluidos en todos los conjuntos, y el tratamiento de idiomas y otros elementos varía considerablemente entre ellos. Esto depende, por ejemplo, de si un idioma figura en el Conjunto 1 o en el Conjunto 2, si tiene códigos B/T independientes en el Conjunto 2 o si se clasifica como macrolenguaje en el Conjunto 3, etc.

Estos diversos tratamientos se detallan en el siguiente cuadro. En cada grupo de filas (una para cada ámbito del Conjunto 3), las últimas cuatro columnas contienen códigos para un idioma representativo que ejemplifica un tipo específico de relación entre los conjuntos de ISO 639, la segunda columna proporciona una explicación de la relación y la primera columna indica el número de elementos que tienen ese tipo de relación. Por ejemplo, hay cuatro elementos que tienen un código en el Conjunto 1, tienen un código B/T y están clasificados como macrolenguajes en el Conjunto 3. Un representante de estos cuatro elementos es "Persa" fa/ per/ fas.

Estas diferencias se deben a los siguientes factores.

En la norma ISO 639, conjunto 2 , se asignaron dos códigos distintos a 22 idiomas individuales: un código bibliográfico y un código terminológico (códigos B/T). [ 16 ] Los códigos B se incluyeron por razones históricas, ya que los sistemas bibliográficos anteriores, ampliamente utilizados, empleaban códigos de idioma basados ​​en el nombre en inglés del idioma. En contraste, los códigos del conjunto 1 se basaban en el nombre nativo del idioma, y ​​también existía un fuerte deseo de contar con códigos del conjunto 2 (códigos T) para estos idiomas, similares al código de dos caracteres correspondiente del conjunto 1.

  • Por ejemplo, el idioma alemán (Conjunto 1: de) tiene dos códigos en el Conjunto 2: ger(código B) y deu(código T), mientras que solo hay un código en el Conjunto 2, eng, para el idioma inglés .
  • Se retiraron dos códigos B anteriores, por lo que hoy solo quedan 20 pares de códigos B/T.

Los idiomas individuales del Conjunto 2 siempre tienen un código en el Conjunto 3 (solo se reutiliza allí el código de terminología del Conjunto 2), pero pueden o no tener un código en el Conjunto 1, como ilustran los siguientes ejemplos:

  • El conjunto 3 engcorresponde al conjunto 2 engy al conjunto 1.en
  • El conjunto 3 astse corresponde con el conjunto 2 ast, pero carece de un código en el conjunto 1.

Algunos códigos (62) del conjunto 3 son macrolenguajes. Se trata de grupos que contienen varios idiomas individuales con buena comprensión mutua, que suelen mezclarse o confundirse. Algunos macrolenguajes desarrollaron una forma estándar predeterminada para uno de sus idiomas individuales (por ejemplo, el mandarín se utiliza por defecto para el macrolenguaje chino; otros idiomas individuales pueden distinguirse si es necesario, pero el código específico cmnpara el mandarín rara vez se usa).

  • 1 macrolenguaje tiene un código del Conjunto 2 y un código del Conjunto 1, mientras que sus lenguajes individuales miembros también tienen códigos en el Conjunto 1 y el Conjunto 2: nor/ nocontiene nno/ nn, nob/ nb; o
  • 4 lenguajes de macros tienen dos códigos del conjunto 2 (B/T) y un código del conjunto 1: per/ fas/ fa, may/ msa/ ms​​, alb/ sqi/ sq​​, y chi/ zho/ zh;
  • 28 lenguajes de macros tienen un código de conjunto 2 pero no un código de conjunto 1;
  • Otros 29 lenguajes de macros solo tienen códigos en el Conjunto 3.

Los códigos colectivos del Conjunto 2 tienen un código en el Conjunto 5: por ejemplo, ausen los Conjuntos 2 y 5, que representa las lenguas australianas .

  • Algunos códigos se agregaron en el Conjunto 5 pero no tenían código en el Conjunto 2: por ejemplosqj

Los conjuntos 2 y 3 también tienen un rango reservado y cuatro códigos especiales:

  • Los códigos qaaindicados qtzestán reservados para uso local.
  • Existen cuatro códigos especiales: mispara idiomas que aún no tienen un código asignado, mulpara "varios idiomas", undpara "indefinido" y zxxpara "sin contenido lingüístico, no aplicable".

Espacio de código

Espacio de código de dos letras

En el Conjunto 1 se utilizan identificadores de dos letras (anteriormente "Alpha-2") (para códigos compuestos por dos letras del alfabeto latino básico ISO ) . Cuando se requirieron códigos para una gama más amplia de idiomas, que podían abarcar más de dos combinaciones de letras (un máximo de 2⁶² = 676), se desarrolló el Conjunto 2 utilizando códigos de tres letras. (Sin embargo, este último se publicó formalmente primero. [ 17 ] [ 18 ] )

Espacio de código de tres letras

Los identificadores de tres letras (anteriormente "Alpha-3") (para códigos compuestos por 3 letras del alfabeto latino básico ISO ) se utilizan en los conjuntos 2 , 3 y 5. El número de idiomas y grupos lingüísticos que pueden representarse de esta manera es 26 × 3 = 17 576.

El uso común de códigos de tres letras por parte de tres conjuntos de la norma ISO 639 requiere cierta coordinación dentro de un sistema más amplio.

El conjunto 2 define cuatro códigos especiales mis, mul, und, zxx, un rango reservado qaa-qtz(20 × 26 = 520 códigos) y tiene 20 entradas dobles (los códigos B/T), más 2 entradas con códigos B obsoletos. Esto suma 520 + 22 + 4 = 546 códigos que no se pueden usar en el conjunto 3 para representar idiomas ni en el conjunto 5 para representar familias o grupos lingüísticos. El resto es 17 576 – 546 = 17 030.

Actualmente existen alrededor de seis a siete mil idiomas en la Tierra. [ 19 ] Por lo tanto, esos 17.030 códigos son suficientes para asignar un código único a cada idioma, aunque algunos idiomas pueden terminar con códigos arbitrarios que no se parecen en nada al nombre o nombres tradicionales de ese idioma.

Espacio de código Alpha-4 (retirado)

Los códigos "Alpha-4" (compuestos por 4 letras del alfabeto latino básico ISO ) se propusieron en la norma ISO 639-6 , que posteriormente fue retirada. El límite superior para el número de idiomas y dialectos que se pueden representar es 2⁶⁴ = 456 976.

Véase también

Notas y referencias

  1. "ISO/R 639:1967" . Organización Internacional de Normalización. 1 de marzo de 1988. Consultado el 5 de agosto de 2012 .
  2. "ISO 639:1988" . Organización Internacional de Normalización . Consultado el 5 de agosto de 2012 .
  3. "ISO 639:2023" . Organización Internacional de Normalización . Consultado el 15 de noviembre de 2023 .
  4. "Organismos de mantenimiento y autoridades de registro" . ISO.org . Consultado el 15 de enero de 2025 .
  5. "Códigos ordenados alfabéticamente por código alfa-3/ISO 639-2" . Biblioteca del Congreso. 25 de julio de 2013. Consultado el 10 de enero de 2019 .
  6. "Códigos ISO-639-2" . Biblioteca del Congreso . Consultado el 10 de enero de 2019 .
  7. "Conjunto de códigos ISO 639-3 (UTF-8)" . SIL International . Consultado el 12 de julio de 2023 .
  8. "Códigos ISO 639-5 ordenados por identificador" . Oficina de Desarrollo de Redes y Estándares MARC . Biblioteca del Congreso . Consultado el 12 de diciembre de 2018 .
  9. ISO 639-6:2009 , ISO .
  10. 1 2 SIL International (14-06-2021). "Cambio en el código de idioma de la Parte 1" . ISO 639-3 .
  11. "Tablas de códigos ISO 639: macrolenguajes" . Sil.org . Consultado el 5 de agosto de 2012 .
  12. "Tablas de códigos ISO 639: extintas" . Sil.org . Consultado el 5 de agosto de 2012 .
  13. "Tablas de códigos ISO 639: históricas" . Sil.org . Consultado el 5 de agosto de 2012 .
  14. "Tablas de códigos ISO 639: antiguas" . Sil.org . Consultado el 10 de enero de 2019 .
  15. "Tablas de códigos ISO 639: construcción" . Sil.org . Consultado el 7 de febrero de 2022 .
  16. "ISO 639-2 Preguntas frecuentes" . Biblioteca del Congreso. 5 de mayo de 2014. Consultado el 12 de diciembre de 2014 .
  17. "Códigos para la representación de nombres de idiomas - Parte 2: Código alfa-3" . Organización Internacional de Normalización (ISO) . Consultado el 10 de enero de 2019. Fecha de publicación : 1998-10 . 
  18. "Códigos para la representación de nombres de idiomas - Parte 1: Código alfa-2" . Organización Internacional de Normalización (ISO) . Consultado el 15 de febrero de 2018. Fecha de publicación : julio de 2002 . 
  19. "Resúmenes estadísticos" . Ethnologue . Consultado el 5 de agosto de 2012 .
  • ISO 639 en el sitio web oficial de ISO.
  • Sitios web de agencias de codificación de idiomas:
    • El código de idioma ISO 639 en Infoterm, LCA para el conjunto 1 (lista de códigos proporcionada por el LCA del conjunto 2 a continuación)
    • ISO 639-2 en la Biblioteca del Congreso, LCA para el conjunto 2
    • ISO 639-3 en SIL International, ACV para el conjunto 3
    • ISO 693-5 en la Biblioteca del Congreso, LCA para el conjunto 5
  • Informes de la agencia de mantenimiento ISO 639
  • El Repositorio de Datos de Localización Común (CLDR) contiene traducciones de códigos ISO 639 a otros idiomas en formato XML. La herramienta de encuestas CLDR también incluye un formato de datos más legible.