Articulo de referencia

robots.txt

Comprobado El Protocolo de Exclusión de Robots (a menudo conocido por el nombre del archivo utilizado para implementarlo, robots.txt ) es un estándar utilizado por los sitios we...

Comprobado
Página protegida con cambios pendientes

El Protocolo de Exclusión de Robots (a menudo conocido por el nombre del archivo utilizado para implementarlo, robots.txt ) es un estándar utilizado por los sitios web para indicar a los rastreadores web y otros robots web que los visitan qué partes del sitio web tienen permitido visitar.

El estándar, desarrollado en 1994, se basa en el cumplimiento voluntario . Los bots maliciosos pueden usar el archivo como directorio de las páginas que deben visitar, aunque los organismos de normalización desaconsejan contrarrestar esto con seguridad por ocultación . Algunos sitios de archivo ignoran robots.txt. El estándar se utilizó en la década de 1990 para mitigar la sobrecarga de los servidores . En la década de 2020, los sitios web comenzaron a rechazar los bots que recopilan información para inteligencia artificial generativa .

El archivo "robots.txt" se puede utilizar junto con los mapas del sitio , otro estándar de inclusión de robots para sitios web.

Historia

El estándar fue propuesto por Martijn Koster , [ 1 ] [ 2 ] mientras trabajaba para Nexor [ 3 ] en febrero de 1994 [ 4 ] en la lista de correo www-talk , el principal canal de comunicación para las actividades relacionadas con la WWW en ese momento. Charles Stross afirma haber provocado que Koster sugiriera robots.txt, después de que escribiera un rastreador web con mal comportamiento que causó inadvertidamente un ataque de denegación de servicio en el servidor de Koster. [ 5 ]

El estándar, inicialmente RobotsNotWanted.txt, permitía a los desarrolladores web especificar qué bots no debían acceder a su sitio web o a qué páginas no debían acceder. En 1994, internet era lo suficientemente pequeño como para mantener una lista completa de todos los bots; la sobrecarga del servidor era una preocupación primordial. En junio de 1994 se había convertido en un estándar de facto ; [ 6 ] la mayoría lo cumplía, incluidos los operados por motores de búsqueda como WebCrawler , Lycos y AltaVista . [ 7 ]

El 1 de julio de 2019, Google anunció la propuesta del Protocolo de Exclusión de Robots como estándar oficial bajo el Grupo de Trabajo de Ingeniería de Internet . [ 8 ] Un estándar propuesto [ 9 ] se publicó en septiembre de 2022 como RFC 9309.

Estándar

El propietario de un sitio web que desee dar instrucciones a los robots de rastreo coloca un archivo de texto llamado robots.txt en la raíz de la jerarquía del sitio (por ejemplo, https://www.example.com/robots.txt ). Este archivo contiene las instrucciones en un formato específico (véanse los ejemplos a continuación). Los robots que decidan seguir las instrucciones intentan descargar este archivo y leer las instrucciones antes de descargar cualquier otro archivo del sitio web . Si este archivo no existe, los robots de rastreo asumen que el propietario del sitio no desea imponer ninguna limitación al rastreo de todo el sitio.

Un archivo robots.txt contiene instrucciones para los bots, indicando a qué páginas web pueden acceder y a cuáles no. Los archivos robots.txt son especialmente importantes para los rastreadores web de motores de búsqueda como Google.

Un archivo robots.txt en un sitio web funciona como una solicitud para que los robots especificados ignoren ciertos archivos o directorios al rastrear el sitio. Esto puede deberse, por ejemplo, a la preferencia por la privacidad en los resultados de los motores de búsqueda, a la creencia de que el contenido de los directorios seleccionados podría ser engañoso o irrelevante para la categorización del sitio en su conjunto, o al deseo de que una aplicación solo opere con ciertos datos. Los enlaces a páginas incluidas en robots.txt aún pueden aparecer en los resultados de búsqueda si se enlazan desde una página rastreada. [ 10 ]

Un archivo robots.txt cubre un único origen . Para sitios web con varios subdominios , cada subdominio debe tener su propio archivo robots.txt. Si example.com tuviera un archivo robots.txt pero foo.example.com no, las reglas que se aplicarían a example.com no se aplicarían a foo.example.com . Además, cada esquema URI y puerto necesita su propio archivo robots.txt; http://example.com/robots.txt no se aplica a las páginas bajo http://example.com:8080/ o https://example.com/ .

Cumplimiento

El protocolo robots.txt es ampliamente cumplido por los operadores de bots. [ 6 ]

El archivo robots.txt desempeñó un papel en el caso legal de 1999 de eBay contra Bidder's Edge , [ 11 ] donde eBay intentó bloquear un bot que no cumplía con robots.txt, y en mayo de 2000 un tribunal ordenó a la empresa que operaba el bot que dejara de rastrear los servidores de eBay utilizando cualquier medio automático, mediante una orden judicial basada en la violación de la propiedad . [ 12 ] [ 13 ] [ 11 ] Bidder's Edge apeló el fallo, pero acordó en marzo de 2001 retirar la apelación, pagar una cantidad no revelada a eBay y dejar de acceder a la información de subastas de eBay. [ 14 ] [ 15 ]

En 2007, en el caso Healthcare Advocates v. Harding , una empresa fue demandada por acceder a páginas web protegidas archivadas mediante The Wayback Machine , a pesar de las reglas del archivo robots.txt que impedían su archivado. Un tribunal de Pensilvania dictaminó que, en esta situación, el archivo robots.txt constituye una medida tecnológica según la DMCA . Debido a un fallo en Internet Archive, Harding pudo acceder temporalmente a estas páginas desde el archivo, por lo que el tribunal determinó que la empresa Harding no eludió la medida de protección. [ 16 ] [ 17 ] [ 18 ]

En 2013, Associated Press v. Meltwater US Holdings, Inc. Associated Press demandó a Meltwater por infracción de derechos de autor y apropiación indebida por la copia de noticias de AP. Meltwater alegó que no necesitaba una licencia y que se trataba de un uso legítimo , ya que el contenido estaba disponible gratuitamente y no estaba protegido por robots.txt. El tribunal dictaminó en marzo de 2013 que "la copia de Meltwater no está protegida por la doctrina del uso legítimo", mencionando, entre otros factores, que "el hecho de no emplear el protocolo robots.txt no le otorgaba a Meltwater licencia para copiar y publicar contenido de AP". [ 19 ]

motores de búsqueda

Algunos de los principales motores de búsqueda que siguen este estándar incluyen Google , [ 20 ] Bing , [ 21 ] Yahoo !, [ 22 ] Yandex , [ 23 ] DuckDuckGo , [ 24 ] Baidu , [ 25 ] AOL , [ 26 ] Ask , [ 27 ] y Kagi , [ 28 ]

Sitios de archivo

Algunos proyectos de archivado web ignoran robots.txt. Archive Team utiliza el archivo para descubrir más enlaces, como mapas del sitio . [ 29 ] El cofundador Jason Scott dijo que "sin revisar y dejar en paz, el archivo robots.txt garantiza que no haya duplicación ni referencia para elementos que puedan tener un uso y significado general más allá del contexto del sitio web". [ 30 ] En 2017, Internet Archive anunció que dejaría de cumplir con las directivas de robots.txt. [ 31 ] [ 6 ] Según Digital Trends , esto siguió al uso generalizado de robots.txt para eliminar sitios históricos de los resultados de los motores de búsqueda, y contrastó con el objetivo de la organización sin fines de lucro de archivar "instantáneas" de Internet tal como existía anteriormente. [ 32 ]

Inteligencia artificial

A partir de la década de 2020, los operadores web comenzaron a usar robots.txt para denegar el acceso a los bots que recopilaban datos de entrenamiento para la IA generativa . En 2023, Originality.AI descubrió que 306 de los mil sitios web más visitados bloqueaban GPTBot de OpenAI en su archivo robots.txt y 85 bloqueaban Google-Extended de Google . Muchos archivos robots.txt nombraban a GPTBot como el único bot explícitamente prohibido en todas las páginas. Denegar el acceso a GPTBot era común entre sitios web de noticias como la BBC y The New York Times . En 2023, el alojamiento de blogs Medium anunció que denegaría el acceso a todos los rastreadores web de inteligencia artificial porque "las empresas de IA han extraído valor de los escritores para enviar spam a los lectores de Internet". [ 6 ]

GPTBot cumple con el estándar robots.txt y asesora a los operadores web sobre cómo deshabilitarlo, pero David Pierce de The Verge dijo que esto solo comenzó después de "entrenar los modelos subyacentes que lo hicieron tan poderoso". Además, algunos bots se utilizan tanto para motores de búsqueda como para inteligencia artificial, y puede ser imposible bloquear solo una de estas opciones. [ 6 ] 404 Media informó que empresas como Anthropic y Perplexity.ai eludieron robots.txt renombrando o creando nuevos raspadores para reemplazar los que aparecían en listas de bloqueo populares . [ 33 ]

En 2025, la organización sin fines de lucro RSL Collective anunció el lanzamiento del estándar de licencias de contenido abierto Really Simple Licensing (RSL), que permite a los editores web establecer términos para los bots de IA en sus archivos robots.txt. Entre las empresas participantes en el lanzamiento se encontraban Medium , Reddit y Yahoo . [ 34 ] [ 35 ] [ 36 ]

Seguridad

A pesar del uso de los términos permitir y no permitir , el protocolo es puramente consultivo y depende del cumplimiento del robot web ; no puede hacer cumplir nada de lo que se indica en el archivo. [ 37 ] Es improbable que los robots web maliciosos respeten robots.txt; algunos incluso pueden usar robots.txt como guía para encontrar enlaces no permitidos y acceder directamente a ellos. Si bien a veces se afirma que esto es un riesgo de seguridad, [ 38 ] este tipo de seguridad por ocultación es desaconsejada por los organismos de normalización. El Instituto Nacional de Estándares y Tecnología (NIST) de Estados Unidos recomienda específicamente no esta práctica: "La seguridad del sistema no debe depender del secreto de la implementación o sus componentes". [ 39 ] En el contexto de los archivos robots.txt, la seguridad por ocultación no se recomienda como técnica de seguridad. [ 40 ]

Alternativas

Muchos robots también pasan un agente de usuario especial al servidor web al obtener contenido. [ 41 ] Un administrador web también podría configurar el servidor para que devuelva automáticamente un error (o pase contenido alternativo ) cuando detecte una conexión que utilice uno de los robots. [ 42 ] [ 43 ]

Algunos sitios, como Google , alojan un humans.txtarchivo que muestra información destinada a ser leída por humanos. [ 44 ] Algunos sitios, como GitHub, redirigen humans.txt a una página Acerca de . [ 45 ]

Anteriormente, Google tenía un archivo de broma alojado en que /killer-robots.txtle indicaba al Terminator que no matara a los fundadores de la compañía, Larry Page y Sergey Brin . [ 46 ] [ 47 ]

Ejemplos

Este ejemplo indica a todos los robots que pueden visitar todos los archivos porque el comodín *representa a todos los robots y la Disallowdirectiva no tiene valor, lo que significa que no se prohíbe el acceso a ninguna página.

Agente de usuario: * Rechazar: 

Este ejemplo tiene el mismo efecto, permitiendo todos los archivos en lugar de no prohibir ninguno.

Agente de usuario: * Permitir: / 

Se puede obtener el mismo resultado con un archivo robots.txt vacío o inexistente.

Este ejemplo indica a todos los robots que se mantengan alejados de un sitio web:

Agente de usuario: * No permitir: / 

Este ejemplo indica a todos los robots que no deben entrar en tres directorios:

Agente de usuario: * No permitir: /cgi-bin/ No permitir: /tmp/ No permitir: /basura/ 

Este ejemplo indica a todos los robots que se mantengan alejados de un archivo específico:

Agente de usuario: * No permitir: /directorio/archivo.html 

Todos los demás archivos del directorio especificado serán procesados.

Ejemplo que demuestra cómo se pueden utilizar los comentarios:

# Los comentarios aparecen después del símbolo "#" al comienzo de una línea o después de una directiva. User-agent: * # coincide con todos los bots Prohibido: / # mantenerlos fuera 

Este ejemplo le indica a un robot específico que se mantenga alejado de un sitio web:

User-agent: BadBot # Reemplaza 'BadBot' con el user-agent real del bot No permitir: / 

Este ejemplo indica a dos robots específicos que no entren en un directorio específico:

User-agent: BadBot # Reemplaza 'BadBot' con el user-agent real del bot Agente de usuario: Googlebot No permitir: /privado/ 

También es posible listar varios robots con sus propias reglas. La cadena del robot en sí la define el rastreador. Algunos operadores de robots, como Google , admiten varias cadenas de agente de usuario que permiten al operador denegar el acceso a un subconjunto de sus servicios mediante el uso de cadenas de agente de usuario específicas. [ 20 ]

Ejemplo que demuestra el uso de múltiples agentes de usuario:

User-agent: googlebot # todos los servicios de Google No permitir: /private/ # no permitir este directorio User-agent: googlebot-news # solo el servicio de noticias No permitir: / # no permitir todo Agente de usuario: * # cualquier robot No permitir: /algo/ # no permitir este directorio 

El uso del comodín * en las reglas

La directiva Disallow: /something/bloquea todos los archivos y subdirectorios que comienzan con /something/.

Por el contrario, el uso de un comodín (si el rastreador lo admite) permite patrones más complejos para especificar rutas y archivos que se deben permitir o no rastrear, por ejemplo, Disallow: /something/*/otherbloquea URL como:

/algo/foo/otro /algo/bar/otro 

No impediría el desplazamiento de /something/foo/else, ya que eso no coincidiría con el patrón.

El comodín *permite una mayor flexibilidad, pero puede que no sea reconocido por todos los rastreadores, aunque forma parte del Protocolo de Exclusión de Robots (RFC). [ 48 ]

Un comodín al final de una regla, en la práctica, no hace nada, ya que ese es el comportamiento estándar.

Extensiones no estándar

Directiva de retardo de arrastre

Algunos rastreadores admiten el valor crawl-delay para limitar sus visitas al host. Dado que este valor no forma parte del estándar, su interpretación depende del rastreador que lo lea. Se utiliza cuando las múltiples ráfagas de visitas de bots ralentizan el host. Yandex interpreta el valor como el número de segundos que se deben esperar entre visitas consecutivas. [ 23 ] Bing define crawl-delay como el tamaño de una ventana de tiempo (de 1 a 30 segundos) durante la cual BingBot accederá a un sitio web solo una vez. [ 49 ] Google ignora esta directiva, [ 50 ] pero proporciona una interfaz en su consola de búsqueda para webmasters, para controlar las visitas posteriores de Googlebot . [ 51 ]

Agente de usuario: bingbot Permitir: / Retraso de rastreo: 10 segundos 

Mapa del sitio

Algunos rastreadores admiten una Sitemapdirectiva que permite múltiples mapas del sitio en el mismo lugar.robots.txten la forma : [ 52 ] [ 53 ]Sitemap: full-url

Mapa del sitio: http://www.example.com/sitemap.xml

Coincidencia universal "*"

El estándar de exclusión de robots no menciona el carácter "*" en la Disallow:declaración. [ 54 ]

Señal de contenido

Cloudflare introdujo Content-Signal[ 55 ] [ 56 ] como una directiva para sugerir un comportamiento aceptable del rastreador por tipo, ai-train, ai-input, y searchcon valores de yeso nopara cada uno. [ 57 ]

Content-Signal: ai-train=no, search=yes, ai-input=no

Metaetiquetas y encabezados

Además de los archivos robots.txt de nivel raíz, las directivas de exclusión de robots se pueden aplicar a un nivel más granular mediante el uso de metaetiquetas Robots y encabezados HTTP X-Robots-Tag. La metaetiqueta robots no se puede usar para archivos que no sean HTML, como imágenes, archivos de texto o documentos PDF. Por otro lado, la etiqueta X-Robots-Tag se puede agregar a archivos que no sean HTML mediante los archivos .htaccess y httpd.conf . [ 58 ]

Una etiqueta meta "noindex"

< meta name = "robots" content = "noindex" />

Un encabezado de respuesta HTTP "noindex"

X-Robots-Tag: noindex 

La etiqueta X-Robots-Tag solo es efectiva después de que se haya solicitado la página y el servidor haya respondido, y la etiqueta meta robots solo es efectiva después de que la página se haya cargado, mientras que robots.txt es efectivo antes de que se solicite la página. Por lo tanto, si una página está excluida por un archivo robots.txt, cualquier etiqueta meta robots o encabezado X-Robots-Tag se ignora efectivamente porque el robot no los verá en primer lugar. [ 58 ]

Tamaño máximo de un archivo robots.txt

El Protocolo de Exclusión de Robots requiere que los rastreadores analicen al menos 500 kibibytes (512000 bytes) de archivos robots.txt, [ 59 ] que Google mantiene como una restricción de tamaño de archivo de 500 kibibytes para los archivos robots.txt. [ 60 ]

Véase también

Referencias

  1. "Histórico" . Greenhills.co.uk . Archivado del original el 3 de abril de 2017. Consultado el 3 de marzo de 2017 .
  2. Fielding, Roy (1994). "Mantenimiento de infoestructuras hipertextuales distribuidas: Bienvenido a la web de MOMspider" (PostScript) . Primera Conferencia Internacional sobre la World Wide Web . Ginebra. Archivado del original el 27 de septiembre de 2013. Recuperado el 25 de septiembre de 2013 .
  3. "Las páginas de robots web" . Robotstxt.org. 30 de junio de 1994. Archivado del original el 12 de enero de 2014. Consultado el 29 de diciembre de 2013 .
  4. Koster, Martijn (25 de febrero de 1994). "Importante: Arañas, robots y vagabundos de la web" . Lista de correo www-talk . Archivado del original ( mensaje archivado de Hypermail ) el 29 de octubre de 2013.
  5. "Cómo llegué hasta aquí al final, quinta parte: ¡las cosas solo pueden mejorar!"" . El diario de Charlie . 19 de junio de 2006. Archivado del original el 25 de noviembre de 2013. Consultado el 19 de abril de 2014 .
  6. 1 2 3 4 5 Pierce, David (14 de febrero de 2024). "El archivo de texto que hace funcionar Internet" . The Verge . Recuperado el 16 de marzo de 2024 .
  7. Barry Schwartz (30 de junio de 2014). "Robots.txt celebra 20 años bloqueando motores de búsqueda" . Search Engine Land . Archivado del original el 7 de septiembre de 2015. Consultado el 19 de noviembre de 2015 .
  8. "Formalización de la especificación del protocolo de exclusión de robots" . Blog oficial de Google Webmaster Central . Archivado del original el 10 de julio de 2019. Consultado el 10 de julio de 2019 .
  9. Koster, M.; Illyes, G.; Zeller, H.; Sassman, L. (septiembre de 2022). Protocolo de exclusión de robots . Grupo de trabajo de ingeniería de Internet . doi : 10.17487/RFC9309 . RFC 9309 .Norma propuesta.
  10. "URLs no indexadas en los resultados de búsqueda" . YouTube. 5 de octubre de 2009. Archivado del original el 6 de enero de 2014. Consultado el 29 de diciembre de 2013 .
  11. 1 2 "EBay lucha contra las arañas en la web" . Wired . 31 de julio de 2000. ISSN 1059-1028 . Consultado el 2 de agosto de 2024 . 
  12. eBay v. Bidder's Edge , 100 F. Supp. 2d 1058 ( ND Cal. 2000), archivado del original .
  13. Hoffmann, Jay (15 de septiembre de 2020). "Capítulo 4: Búsqueda" . La historia de la web . Recuperado el 2 de agosto de 2024 .
  14. Berry, Jahna (24 de julio de 2001). "Robots en el gallinero" . law.com . Archivado del original el 8 de junio de 2011. Consultado el 20 de junio de 2015 .
  15. "EBay y Bidder's Edge llegan a un acuerdo en demandas por acceso web" . latimes . Consultado el 20 de junio de 2015 .
  16. "El uso del archivo web no fue piratería informática, dice un tribunal estadounidense" . The Register . 2 de agosto de 2007. Consultado el 22 de octubre de 2025 .
  17. "Memorándum - Healthcare Advocates v Harding at all" (PDF) . govinfo.gov . 20 de julio de 2007. Consultado el 22 de octubre de 2025 .
  18. "Healthcare Advocates, Inc. v. Harding, Earley, Follmer & Frailey" . www.courtlistener.com . 20 de julio de 2007. Consultado el 23 de octubre de 2025 .
  19. "Associated Press v. Meltwater US Holdings, Inc." . www.courtlistener.com . 21 de marzo de 2013 . Consultado el 23 de octubre de 2025 .
  20. 1 2 "Webmasters: Especificaciones de Robots.txt" . Google Developers . Archivado del original el 15 de enero de 2013. Consultado el 16 de febrero de 2013 .
  21. "Protocolo de exclusión de robots: uniendo esfuerzos para brindar mejor documentación" . Blogs.bing.com . 3 de junio de 2008. Archivado del original el 18 de agosto de 2014. Consultado el 16 de febrero de 2013 .
  22. "Enviar tu sitio web a Yahoo! Search" . Archivado del original el 21 de enero de 2013. Consultado el 16 de febrero de 2013 .
  23. 1 2 "Uso de robots.txt" . Help.yandex.com . Archivado del original el 25 de enero de 2013. Consultado el 16 de febrero de 2013 .
  24. "Bot de DuckDuckGo" . DuckDuckGo.com . Archivado del original el 16 de febrero de 2017. Consultado el 25 de abril de 2017 .
  25. "Baiduspider" . Baidu.com . Archivado del original el 6 de agosto de 2013. Consultado el 16 de febrero de 2013 .
  26. "Acerca de AOL Search" . Search.aol.com . Archivado del original el 13 de diciembre de 2012. Consultado el 16 de febrero de 2013 .
  27. "Acerca de Ask.com: Webmasters" . About.ask.com . Archivado del original el 27 de enero de 2013. Consultado el 16 de febrero de 2013 .
  28. "Kagi Search KagiBot" . Kagi Search . Archivado del original el 12 de abril de 2024. Consultado el 20 de noviembre de 2024 .
  29. "ArchiveBot: Comportamiento incorrecto" . wiki.archiveteam.org . Equipo de Archivo. Archivado del original el 10 de octubre de 2022. Consultado el 10 de octubre de 2022 .
  30. Jason Scott . "Robots.txt es una nota de suicidio" . Equipo de Archivo. Archivado del original el 18 de febrero de 2017. Consultado el 18 de febrero de 2017 .
  31. "Los archivos Robots.txt, pensados ​​para motores de búsqueda, no funcionan bien en archivos web | Blogs de Internet Archive" . blog.archive.org . 17 de abril de 2017. Archivado del original el 4 de diciembre de 2018. Consultado el 1 de diciembre de 2018 .
  32. Jones, Brad (24 de abril de 2017). "Internet Archive ignorará los archivos robots.txt para mantener la precisión" . Digital Trends . Archivado del original el 16 de mayo de 2017. Recuperado el 8 de mayo de 2017 .
  33. Koebler, Jason (29 de julio de 2024). "Los sitios web están bloqueando los rastreadores de IA incorrectos (porque las empresas de IA siguen creando nuevos)" . 404 Media . Recuperado el 29 de julio de 2024 .
  34. Brandom, Russell (10 de septiembre de 2025). "El cocreador de RSS lanza un nuevo protocolo para la concesión de licencias de datos de IA" . TechCrunch . Consultado el 10 de septiembre de 2025 .
  35. Roth, Emma (10 de septiembre de 2025). "La web tiene un nuevo sistema para hacer que las empresas de IA paguen" . The Verge . Recuperado el 10 de septiembre de 2025 .
  36. Shanklin, Will (10 de septiembre de 2025). "Reddit, Yahoo, Medium y más están adoptando un nuevo estándar de licencia para obtener compensación por el web scraping con IA" . Engadget . Consultado el 10 de septiembre de 2025 .
  37. "Bloquear URL con robots.txt: Aprenda sobre los archivos robots.txt" . Archivado del original el 14 de agosto de 2015. Consultado el 10 de agosto de 2015 .
  38. "Robots.txt les dice a los hackers los lugares donde no quieres que busquen" . The Register . Archivado del original el 21 de agosto de 2015. Consultado el 12 de agosto de 2015 .
  39. Scarfone, KA; Jansen, W.; Tracy, M. (julio de 2008). "Guía para la seguridad general de servidores" (PDF) . Instituto Nacional de Estándares y Tecnología . doi : 10.6028/NIST.SP.800-123 . Archivado (PDF) del original el 8 de octubre de 2011. Recuperado el 12 de agosto de 2015 .
  40. Sverre H. Huseby (2004). Código inocente: Una llamada de atención sobre seguridad para programadores web . John Wiley & Sons. págs. 91–92 . ISBN  9780470857472Archivado del original el 1 de abril de 2016. Consultado el 12 de agosto de 2015 .
  41. "Lista de agentes de usuario (arañas, robots, navegadores)" . User-agents.org. Archivado del original el 7 de enero de 2014. Consultado el 29 de diciembre de 2013 .
  42. "Control de acceso - Servidor HTTP Apache" . Httpd.apache.org. Archivado del original el 29/12/2013 . Consultado el 29/12/2013 .
  43. "Cadenas de denegación para reglas de filtrado : El sitio oficial de Microsoft IIS" . Iis.net. 6 de noviembre de 2013. Archivado del original el 1 de enero de 2014. Consultado el 29 de diciembre de 2013 . 
  44. "Google humans.txt" . Archivado del original el 24 de enero de 2017. Consultado el 3 de octubre de 2019 .
  45. "Github humans.txt" . GitHub . Archivado del original el 30 de mayo de 2016. Consultado el 3 de octubre de 2019 .
  46. Newman, Lily Hay (3 de julio de 2014). "¿Es esto un huevo de Pascua de Google o una prueba de que Skynet está tramando la dominación mundial?" . Revista Slate . Archivado del original el 18 de noviembre de 2018. Consultado el 3 de octubre de 2019 .
  47. "/killer-robots.txt" . 10 de enero de 2018. Archivado del original el 10 de enero de 2018. Consultado el 25 de mayo de 2018 .
  48. ^ Koster, Martijn; Illyes, Gary; Zeller, Henner; Sassman, Lizzi (septiembre de 2022). Protocolo de exclusión de robots (Reporte). Grupo de trabajo de ingeniería de Internet.
  49. "Rastrear o no arrastrar, esa es la pregunta de BingBot" . 3 de mayo de 2012. Archivado del original el 3 de febrero de 2016. Consultado el 9 de febrero de 2016 .
  50. "Cómo interpreta Google la especificación robots.txt" . Google Search Central . 23 de mayo de 2024. Consultado el 6 de octubre de 2024 .
  51. "Cambiar la frecuencia de rastreo de Googlebot - Ayuda de Search Console" . support.google.com . Archivado del original el 18 de noviembre de 2018. Consultado el 22 de octubre de 2018 .
  52. "Blog de búsqueda de Yahoo!: los webmasters ahora pueden descubrir automáticamente con los mapas del sitio" . Archivado del original el 5 de marzo de 2009. Consultado el 23 de marzo de 2009 .
  53. "Preguntas frecuentes - Common Crawl" . Consultado el 26/05/2025 . ¿Cómo puedo asegurarme de que Common Crawl CCBot pueda rastrear mi sitio de manera efectiva? El rastreador admite el protocolo Sitemap y utiliza cualquier Sitemap anunciado en el archivo robots.txt.
  54. "Especificaciones de Robots.txt" . Google Developers . Archivado del original el 2 de noviembre de 2019. Consultado el 15 de febrero de 2020 .
  55. "Sitio web de ContentSignals" . Archivado del original el 29/09/2025 . Consultado el 30/09/2025 .
  56. "Cloudflare ofrece una forma de bloquear las reseñas de IA: ¿acatará Google?" . Archivado del original el 26 de septiembre de 2025. Consultado el 30 de septiembre de 2025 .
  57. "Ofreciendo opciones a los usuarios con la nueva Política de Señales de Contenido de Cloudflare" . Archivado del original el 30/09/2025 . Consultado el 30/09/2025 .
  58. 1 2 "Especificaciones de la etiqueta meta Robots y del encabezado HTTP X-Robots-Tag - Webmasters — Google Developers" . Archivado del original el 8 de agosto de 2013. Consultado el 17 de agosto de 2013 .
  59. Koster, M.; Illyes, G.; Zeller, H.; Sassman, L. (septiembre de 2022). Protocolo de exclusión de robots . Grupo de trabajo de ingeniería de Internet . doi : 10.17487/RFC9309 . RFC 9309 .Norma propuesta. sec. 2.5: Límites.
  60. "Cómo interpreta Google la especificación robots.txt | Documentación" . Google Developers . Archivado del original el 17 de octubre de 2022. Consultado el 17 de octubre de 2022 .

Lecturas adicionales

  • Allyn, Bobby (5 de julio de 2024). "Los rastreadores web de inteligencia artificial están causando estragos" . All Things Considered . NPR . Archivado del original el 6 de julio de 2024. Recuperado el 6 de julio de 2024 .
  • Sitio web oficial