El web scraping , web harvesting o web data extraction es un proceso de extracción de datos que se utiliza para obtener información de sitios web . [ 1 ] El software de web scraping puede acceder directamente a la World Wide Web mediante el Protocolo de Transferencia de Hipertexto o un navegador web. Si bien el web scraping puede realizarse manualmente por un usuario de software, el término generalmente se refiere a procesos automatizados implementados mediante un bot o un rastreador web . Es una forma de copia en la que se recopilan y copian datos específicos de la web, generalmente en una base de datos local central o una hoja de cálculo , para su posterior recuperación o análisis .
El web scraping consiste en obtener la página y extraer sus datos. La obtención de datos es la descarga de una página (que realiza un navegador cuando un usuario la visualiza). Por lo tanto, el rastreo web es un componente fundamental del web scraping, ya que permite obtener páginas para su posterior procesamiento. Una vez obtenida la información, se procede a la extracción. El contenido de una página puede analizarse , buscarse y reformatearse, y sus datos pueden copiarse en una hoja de cálculo o cargarse en una base de datos. Los web scrapers suelen extraer información de una página para utilizarla con otro fin. Un ejemplo sería encontrar y copiar nombres y números de teléfono, empresas y sus URL, o direcciones de correo electrónico en una lista (contact scraping). Otro ejemplo es recopilar los precios de los productos de la competencia con fines de marketing, lo que puede implicar la recopilación de grandes conjuntos de datos de precios de sitios web de comercio electrónico y su análisis mediante técnicas de ciencia de datos como el análisis de tendencias, el modelado predictivo y la evaluación comparativa de la competencia.
El web scraping es un tipo de web scraping que se utiliza como componente de aplicaciones para indexación web , minería web y de datos , monitoreo de cambios de precios en línea y comparación de precios , scraping de reseñas de productos (para observar a la competencia), recopilación de listados inmobiliarios, monitoreo de datos meteorológicos, detección de cambios en sitios web , investigación, seguimiento de la presencia y reputación en línea, web mashup e integración de datos web .
Las páginas web se construyen utilizando lenguajes de marcado basados en texto ( HTML y XHTML ) y, con frecuencia, contienen gran cantidad de datos en formato de texto. Sin embargo, la mayoría de las páginas web están diseñadas para usuarios humanos y no para facilitar su uso automatizado. Por ello, se han desarrollado herramientas y software especializados para facilitar la extracción de datos de páginas web. Las aplicaciones de extracción de datos web incluyen investigación de mercado , comparación de precios, monitorización de contenido e inteligencia artificial . Las empresas confían en los servicios de extracción de datos web para recopilar y utilizar estos datos de forma eficiente.
Algunos sitios web emplean métodos para evitar el web scraping, como la detección y el bloqueo de bots que intentan rastrear (visualizar) sus páginas. En respuesta, los sistemas de web scraping utilizan técnicas que incluyen el análisis del DOM , la visión artificial y el procesamiento del lenguaje natural para simular la navegación humana y así recopilar el contenido de las páginas web para su análisis sin conexión.
Historia
Después del nacimiento de la World Wide Web en 1989, el primer robot web, [ 2 ] World Wide Web Wanderer , fue creado en junio de 1993, que estaba destinado únicamente a medir el tamaño de la web.
En diciembre de 1993, se lanzó JumpStation , el primer motor de búsqueda web basado en rastreadores . Dado que en aquel entonces había menos sitios web disponibles en la red, los motores de búsqueda dependían de administradores humanos para recopilar y formatear los enlaces. En comparación, JumpStation fue el primer motor de búsqueda web en utilizar un robot web.
En el año 2000, se crearon la primera API web y el primer rastreador de API . Ese mismo año, Salesforce y eBay lanzaron sus propias API, que permitían a los programadores acceder y descargar algunos de los datos disponibles públicamente. [ 3 ] Desde entonces, muchos sitios web ofrecen API web para que los usuarios accedan a sus bases de datos públicas.
Técnicas
Las técnicas de extracción de datos abarcan desde la recopilación manual hasta sofisticados sistemas automatizados. Las herramientas de web scraping pueden basarse en código o no. Las herramientas comerciales sin código, como Octoparse, Import.io, ParseHub y WebHarvy, utilizan interfaces visuales para configurar la recopilación de datos. [ 4 ] Los métodos avanzados analizan la estructura subyacente de las páginas web para transformar el contenido no estructurado en un formato legible por máquina . Estas técnicas utilizan procesamiento de texto o inteligencia artificial , en consonancia con los objetivos técnicos de la Web Semántica .
Copiar y pegar humano
La forma más sencilla de extracción de datos web consiste en copiar y pegar manualmente la información de una página web en un archivo de texto o una hoja de cálculo. Este método no requiere herramientas técnicas y puede utilizarse cuando la extracción automatizada está bloqueada por restricciones del sitio web o cuando se requiere criterio humano para interpretar contenido complejo. Sin embargo, la extracción manual es muy ineficiente para grandes conjuntos de datos, ya que consume mucho tiempo, es propensa a errores humanos y mentalmente agotadora. Por este motivo, generalmente se considera poco práctica en comparación con los métodos automatizados, excepto en los casos en que la automatización no sea factible.
Coincidencia de patrones de texto
Una forma sencilla de extraer información de las páginas web es utilizar el comando grep de UNIX o las funciones de coincidencia de expresiones regulares de los lenguajes de programación (por ejemplo, Perl o Python ), para encontrar texto que coincida con un patrón específico.
Programación HTTP
Las páginas web estáticas y dinámicas se pueden recuperar enviando solicitudes HTTP al servidor web remoto mediante programación de sockets .
Análisis de HTML
Muchos sitios web tienen grandes colecciones de páginas generadas dinámicamente a partir de una fuente estructurada subyacente, como una base de datos. Los datos de la misma categoría suelen codificarse en páginas similares mediante un script o plantilla común. En minería de datos, un programa que detecta dichas plantillas en una fuente de información particular, extrae su contenido y lo traduce a un formato relacional, se denomina envoltorio . Los algoritmos de generación de envoltorios asumen que las páginas de entrada de un sistema de inducción de envoltorios se ajustan a una plantilla común y que pueden identificarse fácilmente en términos de un esquema común de URL. [ 5 ] Además, algunos lenguajes de consulta de datos semiestructurados , como XQuery y HTQL, pueden utilizarse para analizar páginas HTML y para recuperar y transformar el contenido de las páginas.
Análisis del DOM
Mediante programas como Selenium o Playwright , los desarrolladores pueden controlar navegadores web como Chrome o Firefox para cargar, navegar y recuperar datos de sitios web. Este método resulta especialmente útil para extraer datos de sitios dinámicos, ya que el navegador carga completamente cada página. Una vez cargada la página, los desarrolladores pueden acceder al DOM y analizarlo mediante un lenguaje de expresiones como XPath .
Agregación vertical
Varias empresas han desarrollado plataformas de recolección de contenido específicas para cada sector. Estas plataformas crean y supervisan multitud de "bots" para sectores concretos sin intervención humana directa ni trabajo relacionado con un sitio web objetivo específico. La preparación consiste en establecer la base de conocimientos para todo el sector, tras lo cual la plataforma crea los bots automáticamente. La robustez de la plataforma se mide por la calidad de la información que recupera (normalmente el número de campos) y su escalabilidad (la rapidez con la que puede escalar a cientos o miles de sitios). Esta escalabilidad se utiliza principalmente para acceder a la cola larga de sitios que los agregadores comunes consideran complicados o demasiado laboriosos para la recolección de contenido.
Reconocimiento de anotaciones semánticas
Las páginas que se extraen pueden contener metadatos o marcados y anotaciones semánticas, que permiten localizar fragmentos de datos específicos. Si las anotaciones están integradas en las páginas, como hace Microformat , esta técnica puede considerarse un caso especial de análisis del DOM. En otro caso, las anotaciones, organizadas en una capa semántica, [ 6 ] se almacenan y gestionan por separado de las páginas web, de modo que los programas de extracción pueden recuperar el esquema de datos y las instrucciones de esta capa antes de extraer la información de las páginas.
Análisis de páginas web mediante visión artificial
Existen iniciativas que utilizan aprendizaje automático y visión artificial para intentar identificar y extraer información de páginas web interpretándolas visualmente como lo haría un ser humano. [ 7 ]
Cuestiones legales
La legalidad del web scraping varía en todo el mundo. En general, el web scraping puede contravenir los términos de servicio de algunos sitios web, pero la aplicabilidad de estos términos no está clara. [ 8 ]
Estados Unidos
En Estados Unidos, los propietarios de sitios web pueden utilizar tres demandas legales principales para prevenir el web scraping no deseado: (1) infracción de derechos de autor (compilación), (2) violación de la Ley de Fraude y Abuso Informático ("CFAA") y (3) intrusión en bienes muebles . [ 9 ] Sin embargo, la efectividad de estas demandas depende del cumplimiento de varios criterios, y la jurisprudencia aún está en evolución. Por ejemplo, con respecto a los derechos de autor, si bien la duplicación directa de la expresión original será ilegal en muchos casos, en Estados Unidos los tribunales dictaminaron en Feist Publications v. Rural Telephone Service que la duplicación de hechos es permisible.
Los tribunales estadounidenses han reconocido que los usuarios de "rascadores" o "robots" pueden ser considerados responsables de cometer allanamiento de propiedad , [ 10 ] [ 11 ] lo que implica que el propio sistema informático se considera propiedad personal sobre la cual el usuario de un raspador está invadiendo. El caso más conocido, eBay v. Bidder's Edge , resultó en una orden judicial que obligaba a Bidder's Edge a dejar de acceder, recopilar e indexar subastas del sitio web de eBay. Este caso involucró la colocación automática de ofertas, conocida como subasta sniping . Sin embargo, para que prospere una demanda por allanamiento de propiedad , el demandante debe demostrar que el demandado interfirió intencionalmente y sin autorización con el interés posesorio del demandante en el sistema informático y que el uso no autorizado del demandado causó daños al demandante. No todos los casos de rastreo web presentados ante los tribunales se han considerado allanamiento de propiedad. [ 12 ]
Una de las primeras pruebas importantes de extracción de datos de pantalla involucró a American Airlines (AA) y a una empresa llamada FareChase. [ 13 ] AA obtuvo con éxito una orden judicial de un tribunal de primera instancia de Texas, impidiendo que FareChase vendiera software que permitía a los usuarios comparar tarifas en línea si el software también buscaba en el sitio web de AA. La aerolínea argumentó que el software de búsqueda web de FareChase invadía los servidores de AA al recopilar datos disponibles públicamente. FareChase presentó una apelación en marzo de 2003. En junio, FareChase y AA llegaron a un acuerdo y se retiró la apelación. [ 14 ]
Southwest Airlines también impugnó las prácticas de extracción de datos de pantalla y demandó a FareChase y a otra empresa, Outtask. Southwest Airlines alegó que la extracción de datos de pantalla es ilegal, ya que constituye un ejemplo de "fraude y abuso informático" y ha provocado "daños y pérdidas" y "acceso no autorizado" al sitio web de Southwest. También constituyó "interferencia con las relaciones comerciales", "allanamiento" y "acceso dañino por computadora". Además, afirmó que la extracción de datos de pantalla constituye lo que legalmente se conoce como "apropiación indebida y enriquecimiento ilícito", así como una violación del acuerdo de usuario del sitio web. Outtask negó todas estas alegaciones, argumentando que la ley aplicable en este caso debería ser la ley de derechos de autor de EE. UU. y que, bajo esta última, la información extraída no estaría sujeta a protección de derechos de autor. Aunque los casos nunca se resolvieron en la Corte Suprema de los Estados Unidos , FareChase fue finalmente clausurada por su empresa matriz, Yahoo! y Outtask fue comprada por la empresa de gastos de viaje Concur. [ 15 ] En 2012, una startup llamada 3Taps extrajo anuncios clasificados de vivienda de Craigslist. Craigslist envió a 3Taps una carta de cese y desistimiento y bloqueó sus direcciones IP y luego los demandó, en Craigslist v. 3Taps . El tribunal sostuvo que la carta de cese y desistimiento y el bloqueo de IP fueron suficientes para que Craigslist alegara correctamente que 3Taps había violado la Ley de Fraude y Abuso Informático (CFAA).
Aunque se trata de decisiones iniciales sobre el rastreo web y las teorías de responsabilidad no son uniformes, resulta difícil ignorar un patrón emergente: los tribunales están dispuestos a proteger el contenido propietario de sitios comerciales frente a usos indeseables para sus propietarios. Sin embargo, el grado de protección de dicho contenido no está definido y dependerá del tipo de acceso realizado por quien realiza el rastreo, la cantidad de información a la que se accede y que se copia, el grado en que dicho acceso afecta negativamente al sistema del propietario del sitio y los tipos y la forma de prohibir dicha conducta. [ 16 ]
Mientras la ley en esta área se establece más, las entidades que contemplan usar programas de raspado para acceder a un sitio web público también deben considerar si dicha acción está autorizada revisando los términos de uso y otros términos o avisos publicados o disponibles a través del sitio. En Cvent Inc. v. Eventbrite Inc. (2010), el tribunal de distrito de los Estados Unidos para el distrito este de Virginia , dictaminó que los términos de uso deben ponerse en conocimiento de los usuarios para que un contrato o licencia de browsewrap sea exigible. [ 17 ] En un caso de 2014, presentado en el Tribunal de Distrito de los Estados Unidos para el Distrito Este de Pensilvania , [ 18 ] el sitio de comercio electrónico QVC se opuso al agregador de compras similar a Pinterest Resultly 'scraping del sitio de QVC para obtener datos de precios en tiempo real. QVC alega que Resultly "rastreó excesivamente" el sitio web de venta minorista de QVC (supuestamente enviando entre 200 y 300 solicitudes de búsqueda al sitio web de QVC por minuto, a veces hasta 36 000 solicitudes por minuto), lo que provocó que el sitio de QVC se cayera durante dos días, resultando en pérdidas de ventas para QVC. [ 19 ] La demanda de QVC alega que el demandado disfrazó su rastreador web para ocultar su dirección IP de origen y, por lo tanto, impidió que QVC reparara rápidamente el problema. Este es un caso de extracción de datos particularmente interesante porque QVC busca una indemnización por los daños y perjuicios causados por la indisponibilidad de su sitio web, que QVC afirma que fue provocada por Resultly.
En el sitio web del demandante, durante el período de este juicio, el enlace a los términos de uso se muestra entre todos los enlaces del sitio, en la parte inferior de la página, como en la mayoría de los sitios de internet. Esta resolución contradice la resolución irlandesa que se describe a continuación. El tribunal también rechazó el argumento del demandante de que las restricciones de navegación eran exigibles en vista de la adopción por parte de Virginia de la Ley Uniforme de Transacciones de Información Informática (UCITA), una ley uniforme que muchos consideraban favorable a las prácticas comunes de contratación mediante navegación. [ 20 ]
En Facebook, Inc. v. Power Ventures, Inc. , un tribunal de distrito dictaminó en 2012 que Power Ventures no podía extraer páginas de Facebook en nombre de un usuario de Facebook. El caso está en apelación, y la Electronic Frontier Foundation presentó un escrito en 2015 solicitando que se revoque. [ 21 ] [ 22 ] En Associated Press v. Meltwater US Holdings, Inc. , un tribunal en los EE. UU. declaró a Meltwater responsable de extraer y republicar información de noticias de Associated Press, pero un tribunal en el Reino Unido falló a favor de Meltwater.
En 2019, el Noveno Circuito dictaminó que el web scraping no violaba la CFAA en el caso hiQ Labs v. LinkedIn . El caso fue apelado ante la Corte Suprema de los Estados Unidos , que lo devolvió al Noveno Circuito para que lo reconsiderara a la luz de la decisión de la Corte Suprema de 2021 en el caso Van Buren v. Estados Unidos , que restringió la aplicabilidad de la CFAA. [ 23 ] En esta revisión, el Noveno Circuito confirmó su decisión anterior. [ 24 ]
Internet Archive recopila y distribuye una cantidad significativa de páginas web disponibles públicamente sin que ello se considere una violación de las leyes de derechos de autor.
unión Europea
En febrero de 2006, el Tribunal Marítimo y Comercial danés (Copenhague) dictaminó que el rastreo sistemático, la indexación y el enlace profundo del sitio web ofir.dk al sitio web inmobiliario Home.dk no contravienen la legislación danesa ni la directiva de bases de datos de la Unión Europea. [ 25 ]
El raspado ético de datos respalda el abastecimiento fuera del mercado en los negocios, pero debe cumplir con el RGPD para evitar violaciones de la privacidad en la recopilación automatizada de datos. [ 26 ]
En un caso de febrero de 2010, complicado por cuestiones de jurisdicción, el Tribunal Superior de Irlanda emitió un veredicto que ilustra el estado incipiente de la jurisprudencia en desarrollo. En el caso Ryanair Ltd v Billigfluege.de GmbH , el Tribunal Superior de Irlanda dictaminó que el acuerdo de aceptación mediante clic de Ryanair era jurídicamente vinculante. A diferencia de las conclusiones del Tribunal de Distrito de los Estados Unidos para el Distrito Este de Virginia y del Tribunal Marítimo y Comercial de Dinamarca, el juez Michael Hanna dictaminó que el hipervínculo a los términos y condiciones de Ryanair era claramente visible y que imponer al usuario la obligación de aceptar dichos términos y condiciones para acceder a los servicios en línea es suficiente para constituir una relación contractual. [ 27 ] La decisión está siendo apelada ante el Tribunal Supremo de Irlanda. [ 28 ]
El 30 de abril de 2020, la Autoridad Francesa de Protección de Datos (CNIL) publicó nuevas directrices sobre el web scraping. [ 29 ] Las directrices de la CNIL dejaron claro que los datos disponibles públicamente siguen siendo datos personales y no pueden reutilizarse sin el conocimiento de la persona a la que pertenecen. [ 30 ]
Australia
En Australia, la Ley contra el Spam de 2003 prohíbe algunas formas de recolección web, aunque esto solo se aplica a las direcciones de correo electrónico. [ 31 ] [ 32 ]
India
Salvo algunos casos relacionados con la infracción de la propiedad intelectual, los tribunales indios no se han pronunciado expresamente sobre la legalidad del web scraping. Sin embargo, dado que todos los contratos electrónicos comunes son ejecutables en la India, infringir los términos de uso que prohíben el web scraping constituiría una violación del derecho contractual. También infringiría la Ley de Tecnologías de la Información de 2000 , que penaliza el acceso no autorizado a un recurso informático o la extracción de datos del mismo.
Métodos para prevenir el web scraping
El administrador de un sitio web puede utilizar diversas medidas para detener o ralentizar un bot. Algunas técnicas incluyen:
- Bloquear una dirección IP, ya sea manualmente o según criterios como la geolocalización y la lista negra de DNS (DNSRBL) , también impedirá el acceso a internet desde esa dirección.
- Deshabilitar cualquier API de servicio web que el sistema del sitio web pueda exponer.
- En ocasiones, los bots se identifican (mediante cadenas de agente de usuario ) y pueden bloquearse por ello utilizando el archivo robots.txt ; ' googlebot ' es un ejemplo. Otros bots no distinguen entre ellos y un usuario humano que navega por internet.
- Los bots pueden bloquearse monitorizando el tráfico excesivo.
- En ocasiones, los bots pueden bloquearse con herramientas que verifican que quien accede al sitio sea una persona real, como un CAPTCHA . Algunos bots están programados para romper explícitamente patrones CAPTCHA específicos o pueden emplear servicios de terceros que utilizan mano de obra humana para leer y responder en tiempo real a los desafíos CAPTCHA. Pueden activarse porque el bot: 1) realiza demasiadas solicitudes en poco tiempo, 2) utiliza proxies de baja calidad o 3) no oculta correctamente la huella digital del web scraper. [ 33 ]
- Servicios comerciales antibot: Las empresas ofrecen servicios antibot y antiscraping para sitios web. Algunos firewalls de aplicaciones web también tienen capacidades limitadas de detección de bots. Sin embargo, muchas de estas soluciones no son muy efectivas. [ 34 ]
- Localización de bots mediante un honeypot u otro método para identificar las direcciones IP de los rastreadores automatizados.
- La ofuscación mediante sprites CSS permite mostrar datos como números de teléfono o direcciones de correo electrónico, a costa de la accesibilidad para los usuarios de lectores de pantalla .
- Dado que los bots dependen de la coherencia en el código de la interfaz de un sitio web objetivo, agregar pequeñas variaciones al HTML/CSS que rodean los datos importantes y los elementos de navegación requeriría una mayor intervención humana en la configuración inicial de un bot y, si se hace de manera efectiva, podría hacer que el sitio web objetivo sea demasiado difícil de extraer debido a la menor capacidad de automatizar el proceso de extracción. [ 35 ]
- Los sitios web pueden declarar en el archivo robots.txt si se permite o no el rastreo , y permitir el acceso parcial, limitar la velocidad de rastreo, especificar el momento óptimo para rastrear y mucho más.
- Atrapar a los bots en un pozo de alquitrán , alimentándolos con datos sin sentido para envenenar su conjunto de datos . Este método es particularmente efectivo contra los bots que ignoran los archivos robots.txt. [ 36 ]
- Huella digital TLS: Los sistemas de seguridad modernos analizan el protocolo de enlace TLS ( Transport Layer Security ) para identificar la aplicación cliente. Los diferentes clientes (por ejemplo, Google Chrome frente a un script de Python ) envían cifrados criptográficos y extensiones en un orden único. Esto crea una "huella digital" única (como una firma JA3) que permite a los servidores detectar y bloquear scripts automatizados independientemente de su dirección IP . [ 37 ] [ 38 ]
Véase también
- Archivo.hoy
- Fundación Common Crawl
- Comparación de agregadores de piensos
- Extracción de datos
- Manipulación de datos
- Importador
- Embalaje de trabajo
- Extracción de conocimiento
- OpenSocial
- Sitio web de extracción de datos
- Sitio web de noticias falsas
- Spamdexing
- Lista de nombres de dominio
- Corpus de textos
- Archivo web
- Rastreador web
- Lector sin conexión
- Granja de enlaces (red de blogs)
- Extracción de datos de motores de búsqueda
- Rastreadores web
Referencias
- ^ Thapelo, Tsaone Swaabow; Namoshe, Molaletsa; Matsebe, Oduetse; Motshegwa, Tshiamo; Bopape, Mary-Jane Morongwa (28 de julio de 2021). "SASSCAL WebSAPI: una interfaz de programación de aplicaciones de raspado web para admitir el acceso a los datos meteorológicos de SASSCAL" . Revista de ciencia de datos . 20 24. doi : 10.5334/dsj-2021-024 . ISSN 1683-1470 . S2CID 237719804 .
- ↑ "Historial de motores de búsqueda.com" . Historial de motores de búsqueda . Consultado el 26 de noviembre de 2019 .
- ↑ "eBay, las API y la web conectada" . LA HISTORIA DE LA WEB . 3 de septiembre de 1995. Consultado el 23 de junio de 2025 .
- ↑ Baier, Daniel; Decker, Reinhold; Asenova, Yana (12 de marzo de 2025). "Recopilación y análisis de contenido generado por el usuario para el apoyo a la toma de decisiones en la gestión de marketing: una visión general de los métodos y los casos de uso" . Schmalenbach Journal of Business Research . 77 : 419–455 . doi : 10.1007/s41471-025-00208-7 .
- ↑ Song, Ruihua; Microsoft Research (14 de septiembre de 2007). "Optimización conjunta de la generación de envoltorios y la detección de plantillas" (PDF) . Actas de la 13.ª conferencia internacional ACM SIGKDD sobre descubrimiento de conocimiento y minería de datos . pág. 894. doi : 10.1145/1281192.1281287 . ISBN 9781595936097. S2CID 833565 . Archivado del original (PDF) el 11 de octubre de 2016.
- ↑ Extracción de datos web basada en anotaciones semánticas
- ↑ Roush, Wade (25 de julio de 2012). "Diffbot utiliza la visión artificial para reinventar la web semántica" . Xconomy . www.xconomy.com . Consultado el 15 de marzo de 2013 .
- ↑ "Preguntas frecuentes sobre enlaces : ¿Son los términos de uso de un sitio web contratos vinculantes?" . www.chillingeffects.org. 2007-08-20. Archivado del original el 2002-03-08 . Recuperado el 2007-08-20 .
- ↑ Kenneth, Hirschey, Jeffrey (2014-01-01). "Relaciones simbióticas: aceptación pragmática del raspado de datos" . Berkeley Technology Law Journal . 29 (4). doi : 10.15779/Z38B39B . ISSN 1086-3818 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ "Derecho de Internet, Cap. 06: Allanamiento de bienes muebles" . www.tomwbell.com. 2007-08-20 . Consultado el 2007-08-20 .
- ↑ "¿Cuáles son las demandas por "allanamiento de propiedad" que han presentado algunas empresas o propietarios de sitios web?" . www.chillingeffects.org. 2007-08-20. Archivado del original el 2002-03-08 . Recuperado el 2007-08-20 .
- ↑ "Ticketmaster Corp. v. Tickets.com, Inc." . 2007-08-20 . Consultado el 2007-08-20 .
- ↑ "American Airlines v. FareChase" (PDF) . 2007-08-20. Archivado del original (PDF) el 23-07-2011 . Consultado el 20-08-2007 .
- ↑ "American Airlines y FareChase llegan a un acuerdo en una demanda" . The Free Library. 13 de junio de 2003. Archivado del original el 5 de marzo de 2016. Consultado el 26 de febrero de 2012 .
- ↑ Imperva (2011). Detección y bloqueo de ataques de web scraping . Libro blanco de Imperva.
- ↑ Adler, Kenneth A. (29 de julio de 2003). "Controversia en torno a los 'extractores de pantalla': el software ayuda a los usuarios a acceder a sitios web, pero la actividad de la competencia está bajo escrutinio" . Archivado del original el 11 de febrero de 2011. Recuperado el 27 de octubre de 2010 .
- ↑ "CVENT, Inc. v. Eventbrite, Inc., et al" (PDF) . 24-11-2014. Archivado del original (PDF) el 21-09-2013 . Consultado el 05-11-2015 .
- ↑ "QVC Inc. v. Resultly LLC, No. 14-06714 (ED Pa. presentado el 24 de noviembre de 2014)" . Tribunal de Distrito de los Estados Unidos para el Distrito Este de Pensilvania . Consultado el 5 de noviembre de 2015 .
- ↑ Neuburger, Jeffrey D (5 de diciembre de 2014). "QVC demanda a una aplicación de compras por extracción de datos web que supuestamente provocó la caída del sitio" . The National Law Review . Proskauer Rose LLP . Recuperado el 5 de noviembre de 2015 .
- ↑ "¿Iqbal/Twombly elevaron el listón para las reclamaciones Browsewrap?" (PDF) . 17 de septiembre de 2010. Archivado del original (PDF) el 23 de julio de 2011. Consultado el 27 de octubre de 2010 .
- ↑ "¿Puede la extracción de contenido que no infringe derechos de autor convertirse en una infracción de derechos de autor... debido a cómo funcionan los programas de extracción? | Techdirt" . Techdirt . 10 de junio de 2009. Consultado el 24 de mayo de 2016 .
- ↑ "Facebook contra Power Ventures" . Electronic Frontier Foundation . Julio de 2011. Consultado el 24 de mayo de 2016 .
- ↑ Chung, Andrew (14 de junio de 2021). "La Corte Suprema de EE. UU. reactiva la demanda de LinkedIn para proteger los datos personales" . Reuters . Consultado el 14 de junio de 2021 .
- ↑ Whittaker, Zack (18 de abril de 2022). "El web scraping es legal, reafirma un tribunal de apelaciones de EE. UU." . TechCrunch .
- ^ "UDSKRIFT AF SØ- & HANDELSRETTENS DOMBOG" (PDF) (en danés). bvhd.dk. 2006-02-24. Archivado desde el original (PDF) el 12 de octubre de 2007 . Consultado el 30 de mayo de 2007 .
- ↑ "Ley de IA | Dando forma al futuro digital de Europa" . digital-strategy.ec.europa.eu . 16 de septiembre de 2025. Consultado el 28 de septiembre de 2025 .
- ↑ "Decisiones del Tribunal Superior de Irlanda >> Ryanair Ltd -v- Billigfluege.de GMBH 2010 IEHC 47 (26 de febrero de 2010)" . Instituto Británico e Irlandés de Información Jurídica. 26 de febrero de 2010. Consultado el 19 de abril de 2012 .
- ↑ Matthews, Áine (junio de 2010). "Propiedad intelectual: condiciones de uso del sitio web" . Número 26: junio de 2010. LK Shields Solicitors Update. pág. 03. Archivado del original el 24 de junio de 2012. Consultado el 19 de abril de 2012 .
- ^ "La réutilisation des données publiquement accesss en ligne à des fins de démarchage comercial | CNIL" . www.cnil.fr (en francés) . Consultado el 5 de julio de 2020 .
- ↑ FindDataLab.com (09/06/2020). "¿Todavía se puede realizar web scraping con las nuevas directrices de la CNIL?" . Medium . Consultado el 05/07/2020 .
- ↑ Oficina Nacional para la Economía de la Información (febrero de 2004). «Ley contra el spam de 2003: una visión general para las empresas» . Autoridad Australiana de Comunicaciones. pág. 6. Archivado del original el 3 de diciembre de 2019. Consultado el 7 de diciembre de 2017 .
- ↑ Oficina Nacional para la Economía de la Información (febrero de 2004). "Ley contra el spam de 2003: una guía práctica para las empresas" (PDF) . Autoridad Australiana de Comunicaciones. pág. 20. Consultado el 7 de diciembre de 2017 .
- ↑ "Web Scraping para principiantes: una guía 2024" . Proxyway . 31 de agosto de 2023. Consultado el 15 de marzo de 2024 .
- ↑ Mayank Dhiman, Soluciones innovadoras para la detección de fraudes y bots, OWASP AppSec Cali' 2018. Consultado el 10 de febrero de 2018.
- ↑ "¿Qué es el web scraping?" . DataDome . 2022-03-06 . Consultado el 2025-12-16 .
- ↑ Belanger, Ashley (28 de enero de 2025). "Los detractores de la IA construyen trampas para engañar a los rastreadores de IA que ignoran robots.txt" . Ars Technica .
- ↑ "JA3 - Un método para perfilar clientes SSL/TLS" . Ingeniería de Salesforce . Consultado el 27 de enero de 2026 .
- ↑ Ermakovich, Sergey. "¿Qué es el web scraping?" . HasData . Consultado el 27 de enero de 2026 .
- Extracción de datos web