Articulo de referencia

etiqueta de idioma IETF

Una etiqueta de idioma IETF BCP 47 es un código estandarizado que se utiliza para identificar idiomas humanos en Internet. [ 1 ] La estructura de la etiqueta ha sido estandariza...

Una etiqueta de idioma IETF BCP 47 es un código estandarizado que se utiliza para identificar idiomas humanos en Internet. [ 1 ] La estructura de la etiqueta ha sido estandarizada por el Grupo de Trabajo de Ingeniería de Internet (IETF) [ 1 ] en la Práctica Actual (BCP) 47 ; [ 1 ] las subetiquetas son mantenidas por el Registro de Subetiquetas de Idioma de IANA . [ 2 ] [ 3 ] [ 4 ]

Para distinguir variantes lingüísticas para países, regiones o sistemas de escritura (alfabetos), las etiquetas lingüísticas del IETF combinan subetiquetas de otros estándares como ISO 639, ISO 15924, ISO 3166-1 y UN M.49 . Por ejemplo, la etiqueta enrepresenta para inglés; es-419para español latinoamericano; rm-sursilvpara romanche sursilvano; sr-Cyrlpara serbio escrito en alfabeto cirílico ; nan-Hant-TWpara chino min nan usando caracteres han tradicionales , como se habla en Taiwán; yue-Hant-HKpara cantonés usando caracteres han tradicionales , como se habla en Hong Kong ; y gsw-u-sd-chzhpara alemán de Zúrich .

Es utilizado por estándares informáticos como HTTP, [ 5 ] : §8.5.1 HTML, [ 6 ] XML [ 7 ] y PNG. [ 8 ]

Historia

Las etiquetas de idioma IETF se definieron por primera vez en la Solicitud de comentarios 1766, editada por Harald Tveit Alvestrand , publicada en marzo de 1995. [ 9 ] Las etiquetas utilizaban códigos de idioma de dos letras ISO 639 y códigos de país de dos letras ISO 3166, y permitían el registro de etiquetas completas que incluían subetiquetas de variantes o escrituras de tres a ocho letras.

En enero de 2001, esto se actualizó mediante RFC 3066, [ 10 ] que agregó el uso de códigos de tres letras ISO 639-2 , permitió subetiquetas con dígitos y adoptó el concepto de rangos de idioma de HTTP/1.1 para ayudar con la coincidencia de etiquetas de idioma.

La siguiente revisión de la especificación llegó en septiembre de 2006 con la publicación de RFC 4646 —la parte principal de la especificación— editada por Addison Philips y Mark Davis , [ 11 ] y RFC 4647—que trata sobre el comportamiento de coincidencia. [ 12 ] RFC 4646 introdujo un formato más estructurado para las etiquetas de idioma, agregó el uso de códigos de escritura de cuatro letras ISO 15924 y códigos de región geográfica de tres dígitos UN M.49, y reemplazó el antiguo registro de etiquetas con un nuevo registro de subetiquetas. El pequeño número de etiquetas definidas previamente que no se ajustaban a la nueva estructura se mantuvieron para mantener la compatibilidad con RFC 3066.

La versión actual de la especificación, RFC 5646, se publicó en septiembre de 2009. [ 13 ] El objetivo principal de esta revisión fue incorporar códigos de tres letras de ISO 639-3 y 639-5 en el Registro de subetiquetas de idioma, con el fin de aumentar la interoperabilidad entre ISO 639 y BCP 47. [ 14 ]

Sintaxis de las etiquetas de idioma

Cada etiqueta de idioma se compone de una o más "subetiquetas" separadas por guiones (-). Cada subetiqueta se compone únicamente de letras o dígitos latinos básicos.

Con la excepción de las etiquetas de idioma de uso privado que comienzan con el prefijo x- y las etiquetas de idioma heredadas (incluidas las que comienzan con el prefijo i- y las que se registraron previamente en el antiguo Registro de Etiquetas de Idioma), las subetiquetas aparecen en el siguiente orden:

  • Una única subetiqueta de idioma principal basada en un código de idioma de dos letras de ISO 639-1 (2002) o un código de tres letras de ISO 639-2 (1998), ISO 639-3 (2007) o ISO 639-5 (2008), o registrada a través del proceso BCP 47 y compuesta de cinco a ocho letras;
  • Hasta tres subetiquetas de idioma extendidas opcionales , compuestas por tres letras cada una, separadas por guiones; (Actualmente no hay ninguna subetiqueta de idioma extendida registrada en el Registro de Subetiquetas de Idioma sin una subetiqueta de idioma principal equivalente y preferida. Este componente de las etiquetas de idioma se conserva para garantizar la compatibilidad con versiones anteriores y para permitir futuras partes de la norma ISO 639).
  • Una subetiqueta de script opcional , basada en un código de script de cuatro letras de ISO 15924 (generalmente escrito en mayúsculas iniciales );
  • Una subetiqueta de región opcional basada en un código de país de dos letras de la norma ISO 3166-1 alfa-2 (generalmente escrito en mayúsculas), o un código de tres dígitos de la norma UN M.49 para regiones geográficas;
  • Subetiquetas variantes opcionales , separadas por guiones, cada una compuesta de cinco a ocho letras, o de cuatro caracteres que comienzan con un dígito; (Las subetiquetas variantes están registradas en IANA y no están asociadas con ningún estándar externo).
  • Subetiquetas de extensión opcionales , separadas por guiones, cada una compuesta por un solo carácter, con la excepción de la letra x , y un guion seguido de una o más subetiquetas de dos a ocho caracteres cada una, separadas por guiones;
  • Una subetiqueta opcional de uso privado , compuesta por la letra x y un guion, seguida de subetiquetas de uno a ocho caracteres cada una, separadas por guiones.

Las subetiquetas no distinguen entre mayúsculas y minúsculas , pero la especificación recomienda usar el mismo formato que en el Registro de Subetiquetas de Idioma, donde las subetiquetas de región están en MAYÚSCULAS , las subetiquetas de escritura están en formato de título y todas las demás subetiquetas están en minúsculas . Este uso de mayúsculas sigue las recomendaciones de las normas ISO subyacentes.

Se prefiere omitir las subetiquetas opcionales de escritura y región cuando no aportan información distintiva a una etiqueta de idioma. Por ejemplo, se prefiere es sobre es-Latn , ya que se espera que el español se escriba con el alfabeto latino; se prefiere ja sobre ja-JP , ya que el japonés hablado en Japón no difiere notablemente del japonés hablado en otros lugares.

No todas las regiones lingüísticas pueden representarse con una subetiqueta de región válida: los dialectos regionales subnacionales de una lengua primaria se registran como subetiquetas de variante. Por ejemplo, la subetiqueta de variante valencia para la variante valenciana del catalán está registrada en el Registro de Subetiquetas Lingüísticas con el prefijo ca. Dado que este dialecto se habla casi exclusivamente en España, normalmente se puede omitir la subetiqueta de región ES .

Además, existen etiquetas de escritura que no hacen referencia a escrituras tradicionales como el latín, ni siquiera a escrituras en absoluto, y estas suelen empezar con una Z. Por ejemplo, Zsye se refiere a emojis , Zmth a notación matemática , Zxxx a documentos no escritos y Zyyy a escrituras indeterminadas.

Las etiquetas de idioma IETF se han utilizado como identificadores de configuración regional en muchas aplicaciones. Si la estrategia descrita en la RFC 4647 no es adecuada, es posible que estas aplicaciones deban establecer su propia estrategia para definir, codificar y hacer coincidir las configuraciones regionales.

El uso, la interpretación y la correspondencia de las etiquetas de lenguaje IETF se definen actualmente en los RFC 5646 y 4647. El Registro de Subetiquetas de Lenguaje enumera todas las subetiquetas públicas válidas. Las subetiquetas de uso privado no se incluyen en el Registro, ya que dependen de la implementación y están sujetas a acuerdos privados entre terceros que las utilizan. Estos acuerdos privados quedan fuera del alcance de BCP 47.

Lista de subetiquetas comunes del idioma principal

A continuación se presenta una lista de algunas de las subetiquetas de idioma principal más utilizadas. Esta lista representa solo un pequeño subconjunto (menos del 2 %) de las subetiquetas de idioma principal; para obtener información completa, consulte directamente el Registro de Subetiquetas de Idioma.

Relación con otras normas

Si bien algunos tipos de subetiquetas se derivan de las normas básicas de ISO o de la ONU , no las siguen al pie de la letra, ya que esto podría provocar que su significado cambie con el tiempo. En particular, una subetiqueta derivada de un código asignado por ISO 639 , ISO 15924 , ISO 3166 o UN M49 sigue siendo válida (aunque obsoleta) incluso si el código se retira de la norma básica correspondiente. Si posteriormente la norma asigna un nuevo significado al código retirado, la subetiqueta correspondiente conservará su significado anterior.

Esta estabilidad se introdujo en el RFC 4646.

ISO 639-3 e ISO 639-1

RFC 4646 definió el concepto de "subetiqueta de lenguaje extendido" (a veces denominada extlang ), aunque en ese momento no se registraron tales subetiquetas. [ 16 ] [ 17 ]

RFC 5645 y RFC 5646 añadieron subetiquetas de idioma principal correspondientes a los códigos ISO 639-3 para todos los idiomas que no estaban ya registrados. Además, los códigos de los idiomas incluidos en ciertos macrolenguajes se registraron como subetiquetas de idioma extendidas. Los lenguajes de señas también se registraron como extlangs, con el prefijo sgn . Estos idiomas pueden representarse con la subetiqueta del idioma incluido únicamente ( cmn para el mandarín) o con una combinación de idioma y extlang ( zh-cmn ). La primera opción es la preferida para la mayoría de los casos. La segunda opción se denomina "formato extlang" y es nueva en RFC 5646.

Las etiquetas completas que se registraron antes de RFC 4646 y que ahora se clasifican como "obsoletas" o "redundantes" (dependiendo de si se ajustan a la nueva sintaxis) se descontinúan en favor de la subetiqueta de idioma correspondiente basada en ISO 639-3, si existe. Por mencionar algunos ejemplos, se prefiere nan sobre zh-min-nan para el chino min nan ; hak sobre i-hak y zh-hakka para el chino hakka ; y ase sobre sgn-US para el lenguaje de señas americano .

Windows Vista y versiones posteriores de Microsoft Windows tienen soporte para RFC 4646. [ 18 ]

ISO 639-5 e ISO 639-1/2

La norma ISO 639-5 define las colecciones de idiomas con códigos alfa-3 de forma distinta a como se codificaron inicialmente en la norma ISO 639-2 (incluido un código ya presente en la ISO 639-1, el bihari, codificado de forma inclusiva como bh en la ISO 639-1 y como bih en la ISO 639-2). En concreto, en la ISO 639-5 todas las colecciones de idiomas se definen ahora de forma inclusiva, en lugar de que algunas se definan de forma exclusiva. Esto significa que las colecciones de idiomas tienen un alcance más amplio que antes, pudiendo abarcar en algunos casos idiomas que ya estaban codificados por separado en la ISO 639-2.

Por ejemplo, el código afa de la norma ISO 639-2 estaba asociado anteriormente con el nombre "Afroasiático (Otros)", excluyendo lenguas como el árabe, que ya tenían su propio código. En la norma ISO 639-5, esta colección se denomina "Lenguas afroasiáticas" e incluye todas estas lenguas. La norma ISO 639-2 modificó los nombres exclusivos en 2009 para que coincidieran con los nombres inclusivos de la norma ISO 639-5. [ 19 ]

Para evitar que se rompan las implementaciones que aún puedan depender de la definición anterior (exclusiva) de estas colecciones, la norma ISO 639-5 define un atributo de tipo de agrupación para todas las colecciones que ya estaban codificadas en la norma ISO 639-2 (dicho tipo de agrupación no está definido para las nuevas colecciones añadidas solo en la norma ISO 639-5).

BCP 47 define una propiedad "Ámbito" para identificar subetiquetas en colecciones de idiomas. Sin embargo, no define ninguna colección como inclusiva o exclusiva, ni utiliza el atributo de tipo de agrupación ISO 639-5, aunque los campos de descripción en el Registro de Subetiquetas de Idioma para estas subetiquetas coinciden con los nombres ISO 639-5 (inclusivos). En consecuencia, las etiquetas de idioma de BCP 47 que incluyen una subetiqueta de idioma principal para una colección pueden ser ambiguas en cuanto a si la colección pretende ser inclusiva o exclusiva.

La norma ISO 639-5 no define con precisión qué idiomas pertenecen a estas colecciones; solo define la clasificación jerárquica de las mismas, utilizando la definición inclusiva de estas colecciones. Por este motivo, la RFC 5646 no recomienda el uso de subetiquetas para colecciones de idiomas en la mayoría de las aplicaciones, aunque siguen siendo preferibles a subetiquetas cuyo significado es aún menos específico, como "Varios idiomas" e "Indeterminado".

En cambio, la clasificación de los idiomas individuales dentro de su macrolenguaje está estandarizada, tanto en la norma ISO 639-3 como en el Registro de Subetiquetas de Idioma.

ISO 15924, ISO/IEC 10646 y Unicode

Las subetiquetas de escritura se añadieron por primera vez al Registro de Subetiquetas de Idioma cuando se publicó el RFC 4646, a partir de la lista de códigos definidos en la norma ISO 15924. Se codifican en la etiqueta de idioma después de las subetiquetas de idioma primarias y extendidas, pero antes de otros tipos de subetiquetas, incluidas las subetiquetas de región y variante.

Algunas subetiquetas de idioma principal se definen con una propiedad llamada "Suppress-Script", que indica los casos en los que se suele asumir un único alfabeto por defecto para el idioma, incluso si se puede escribir con otro. En estos casos, es preferible omitir la subetiqueta del alfabeto para aumentar la probabilidad de una coincidencia correcta. Aun así, se puede añadir una subetiqueta de alfabeto diferente para hacer la distinción cuando sea necesario. Por ejemplo, se prefiere "yi" a "yi-Hebr" en la mayoría de los contextos, porque se asume el alfabeto hebreo para el idioma yiddish .

Como otro ejemplo, zh-Hans-SG puede considerarse equivalente a zh-Hans , ya que el código de región probablemente no sea relevante; la forma escrita del chino que se usa en Singapur utiliza los mismos caracteres chinos simplificados que en otros países donde se escribe chino. Sin embargo, se mantiene la subetiqueta de escritura porque sí es relevante.

La norma ISO 15924 incluye algunos códigos para variantes de escritura (por ejemplo, Hans y Hant para las formas simplificadas y tradicionales de los caracteres chinos) que están unificados en Unicode e ISO/IEC 10646. Estas variantes de escritura se codifican con mayor frecuencia con fines bibliográficos, pero no siempre son significativas desde un punto de vista lingüístico (por ejemplo, los códigos de escritura Latf y Latg para las variantes Fraktur y Gaélica del alfabeto latino, que en Unicode e ISO/IEC 10646 se codifican principalmente con letras latinas regulares). En ocasiones, pueden ser útiles en etiquetas de idioma para exponer diferencias ortográficas o semánticas, con distintos análisis de letras, diacríticos y dígrafos/trígrafos como grupos de grafemas predeterminados, o diferencias en las reglas de mayúsculas y minúsculas.

ISO 3166-1 y UN M.49

Las subetiquetas regionales de dos letras se basan en códigos asignados, o «reservados excepcionalmente», en la norma ISO 3166-1 . Si la Agencia de Mantenimiento de la ISO 3166 reasignara un código previamente asignado a un país diferente, la subetiqueta BCP 47 existente correspondiente a dicho código conservaría su significado, y se registraría una nueva subetiqueta regional basada en la norma UN M.49 para el nuevo país. La norma UN M.49 también sirve como fuente para las subetiquetas regionales numéricas de regiones geográficas, como 005la de Sudamérica. No se permiten los códigos UN M.49 para regiones económicas.

Las subetiquetas de región se utilizan para especificar la variedad de un idioma "tal como se usa" en una región en particular. Son apropiadas cuando la variedad es de naturaleza regional y se puede capturar adecuadamente identificando los países involucrados, como cuando se distingue el inglés británico ( en-GB ) del inglés americano ( en-US ). Cuando la diferencia es de escritura o variedad de escritura, como entre los caracteres chinos simplificados y tradicionales , debe expresarse con una subetiqueta de escritura en lugar de una subetiqueta de región; en este ejemplo, se deben usar zh-Hans y zh-Hant en lugar de zh-CN/zh-SG/zh-MY y zh-TW/zh-HK/zh-MO .

Cuando existe una subetiqueta lingüística específica para una lengua que podría considerarse una variedad regional, suele ser preferible utilizar la subetiqueta más específica en lugar de una combinación de lengua y región. Por ejemplo, ar-DZ ( árabe hablado en Argelia ) podría expresarse mejor como arq para árabe argelino hablado .

Adherencia a los estándares básicos

Los desacuerdos sobre la identificación de idiomas pueden extenderse al BCP 47 y a las normas básicas que lo sustentan. Por ejemplo, algunos hablantes de punjabi creen que la distinción de la norma ISO 639-3 entre [pan] "panjabi" y [pnb] "panjabi occidental" es espuria (es decir, consideran que son el mismo idioma ); que las subvariedades de la escritura árabe deberían codificarse por separado en la norma ISO 15924 (como, por ejemplo, los estilos Fraktur y gaélico de la escritura latina); y que el BCP 47 debería reflejar estas opiniones o anular las normas básicas al respecto.

BCP 47 delega este tipo de juicio a las normas básicas y no intenta anularlas ni reemplazarlas. Las subetiquetas variantes y (teóricamente) las subetiquetas de idioma principal pueden registrarse individualmente, pero no de una manera que contradiga las normas básicas. [ 20 ]

Extensiones

Las subetiquetas de extensión (que no deben confundirse con las subetiquetas de idioma extendidas ) permiten adjuntar información adicional a una etiqueta de idioma que no necesariamente sirve para identificar un idioma. Una utilidad de las extensiones es codificar información regional, como el calendario y la moneda.

Las subetiquetas de extensión se componen de varias cadenas de caracteres separadas por guiones, que comienzan con un solo carácter (distinto de la x ), denominado singleton . Cada extensión se describe en su propio RFC de la IETF , que identifica una Autoridad de Registro encargada de gestionar los datos de dicha extensión. La IANA es responsable de la asignación de singletons.

Se han asignado dos prórrogas a partir de enero de 2014.

Extensión T (Contenido transformado)

La extensión T permite que una etiqueta de idioma incluya información sobre cómo se transcribieron, transcribieron o transformaron los datos etiquetados. Por ejemplo, la etiqueta en-t-jp podría usarse para contenido en inglés traducido del japonés original. Subcadenas adicionales podrían indicar si la traducción se realizó de forma automática o de acuerdo con un estándar publicado.

La extensión T se describe en el RFC 6497 informativo, publicado en febrero de 2012. La autoridad de registro es el Consorcio Unicode . [ 21 ]

Extensión U (Configuración regional Unicode)

La extensión U permite que una amplia variedad de atributos de configuración regional que se encuentran en el Repositorio Común de Datos de Configuración Regional (CLDR) se incrusten en las etiquetas de idioma. Estos atributos utilizan palabras clave que consisten en una clave obligatoria de dos letras , que incluyen subdivisiones de países ( sd, rg ), datos de calendario ( ca, fw, hc ) y zona horaria ( tz ), orden de intercalación ( co ), tipo de moneda ( cu ) y formato ( cf ), unidad de medida ( ms, mu ) y sistema numérico ( nu ), salto de línea ( lb, lw, ss, dx ) y presentación de emojis ( em ), seguidos opcionalmente de tipos aplicables con guion .

Algunos ejemplos incluyen:

La extensión U se describe en el RFC 6067 informativo, publicado en diciembre de 2010. La autoridad de registro es el Consorcio Unicode . Su especificación LDML , publicada como UTS 35, sirve como documentación de los atributos y palabras clave registrados. [ 22 ]

Véase también

Referencias

  1. 1 2 3 Phillips, Addison; Davis, Mark (septiembre de 2009). "Información sobre BCP 47  » Editor de RFC" .
  2. "Registro de subetiquetas de idioma" . iana.org . Autoridad de números asignados por Internet . Consultado el 5 de diciembre de 2018 .
  3. "Registro de extensiones de etiquetas de idioma" . iana.org . Autoridad de números asignados por Internet . Consultado el 6 de diciembre de 2018 .
  4. "IANA — Registros de protocolo" . iana.org . Consultado el 28 de julio de 2015 .
  5. R. Fielding ; M. Nottingham; J. Reschke, eds. (junio de 2022). HTTP Semantics . Internet Engineering Task Force . doi : 10.17487/RFC9110 . ISSN 2070-1721 . STD 97. RFC 9110 . Estándar de Internet 97. Deja obsoletos los RFC 2818 , 7230 , 7231 , 7232 , 7233 , 7235 , 7538 , 7615 y 7694. Actualiza el RFC 3864 .  
  6. "Información lingüística y orientación del texto" . w3.org . Consultado el 28 de julio de 2015 .
  7. "Lenguaje de marcado extensible (XML) 1.0 (Quinta edición)" . w3.org . Consultado el 28 de julio de 2015 .
  8. "Especificación de Portable Network Graphics (PNG) (Segunda edición)" . w3.org . Consultado el 28 de julio de 2015 .
  9. H. Alvestrand (marzo de 1995). Etiquetas para la identificación de idiomas . Grupo de trabajo de la red. doi : 10.17487/RFC1766 . RFC 1766 .Obsoleto. Obsoleto según los RFC 3066 y 3282 . 
  10. H. Alvestrand (enero de 2001). Etiquetas para la identificación de idiomas . Grupo de trabajo de la red. doi : 10.17487/RFC3066 . BCP 47. RFC 3066 .Obsoleto, era BCP 47. Obsoleto por RFC 4646 y 4647 . 
  11. A. Phillips; M. Davis , eds. (septiembre de 2006). Tags for Identifying Languages . Network Working Group. doi : 10.17487/RFC4646 . BCP 47. RFC 4646 .Obsoleto, era BCP 47. Obsoleto por RFC 5646. Obsoleto RFC 3066 .  
  12. A. Phillips; M. Davis , eds. (septiembre de 2006). Coincidencia de etiquetas de idioma . Grupo de trabajo de la red. doi : 10.17487/RFC4647 . BCP 47. RFC 4647 .Mejor práctica actual 47. Deja obsoleto el RFC 3066 . 
  13. Phillips, A.; Davis, M. , eds. (septiembre de 2009). Tags for Identifying Languages ​​. IETF Network Working Group. doi : 10.17487/RFC5646 . BCP 47. RFC 5646 .Mejor práctica actual 47. Deja obsoleto el RFC 4646 . 
  14. Grupo de trabajo para la actualización del registro de etiquetas de idioma. "Actualización del registro de etiquetas de idioma (ltru)" . IETF Datatracker . Grupo de trabajo de ingeniería de Internet . Consultado el 18 de marzo de 2026 .
  15. "Códigos de letras de las culturas - Lista" . Archivado del original el 7 de agosto de 2022. Consultado el 8 de enero de 2022 . 
  16. Addison Phillips, Mark Davis (2008). "Etiquetas para identificar lenguajes (borrador antiguo para la revisión de RFC 4646, ahora obsoleto y que podría desaparecer pronto)" . IETF WG LTRU . Consultado el 23 de junio de 2008 .
  17. Doug Ewell (2008). "Actualización del Registro de Subetiquetas de Idioma (borrador antiguo para la revisión de RFC 4645, ahora obsoleto y que podría desaparecer pronto)" (1 MB) . IETF WG LTRU . Consultado el 23 de junio de 2008 .
  18. "Función GetGeoInfoA (winnls.h) Aplicaciones Win32" . 
  19. "Lista de códigos de idioma ISO 639-2 : códigos para la representación de nombres de idiomas (Biblioteca del Congreso)" . loc.gov . Consultado el 28 de julio de 2015 . 
  20. Ewell, Doug (12 de agosto de 2022). "Re: [ Ietf-languages ] Recomendaciones para la corrección del código del idioma punjabi" . Recuperado el 12 de agosto de 2022 .
  21. "Extensión Unicode BCP 47 T" . Norma técnica Unicode n.º 35 (UTS35): Lenguaje de marcado de datos de configuración regional Unicode (LDML) . Consorcio Unicode.
  22. "Extensión Unicode BCP 47 U" . Norma técnica Unicode n.º 35 (UTS35): Lenguaje de marcado de datos de localización Unicode (LDML) . Consorcio Unicode.
  • BCP 47 Etiquetas de idioma – especificación actual
    • Contiene dos RFC publicados por separado en fechas diferentes, pero concatenados en un único documento:
      • RFC 4647 " Coincidencia de etiquetas de idioma, "  
      • RFC 5646 " Etiquetas para identificar idiomas, "  
    • También hace referencia al RFC 5645 informativo relacionado, que complementa el RFC 4645 informativo anterior, así como a otros formularios de registro individuales publicados por separado por otros para cada idioma agregado o modificado en el Registro entre estas revisiones del BCP 47.
  • RFC 4645 " Registro inicial de subetiquetas de idioma " , Informativo. 
  • RFC 5645 " Actualización del Registro de Subetiquetas de Idioma " , Informativo. 
  • RFC 6067 " BCP 47 Extensión U, " Informativo. 
  • RFC 6497 " BCP 47 Extensión T - Contenido transformado, " Informativo. 
  • Registro de subetiquetas de idioma – mantenido por IANA
  • Búsqueda en el Registro de Subetiquetas de Idioma : encuentre subetiquetas y vea las entradas en el Registro.
  • " Etiquetas de lenguaje en HTML y XML " – del W3C
  • " Etiquetas de idioma " – del grupo de trabajo de actualización del registro de etiquetas de idioma de la IETF