Un sitio web de extracción de datos es aquel que copia contenido de otros sitios web mediante la técnica de web scraping . El contenido se replica con el objetivo de generar ingresos, generalmente a través de publicidad y, en ocasiones, mediante la venta de datos de los usuarios.
Los sitios web de extracción de datos se presentan en diversas formas: algunos ofrecen poca o ninguna información y están diseñados para obtener datos de los usuarios, como direcciones de correo electrónico, para enviarles correo basura. Los sitios de agregación de precios y de compras acceden a múltiples listados de un producto y permiten al usuario comparar rápidamente los precios.
Ejemplos de sitios web de extracción de datos

Los motores de búsqueda como Google podrían considerarse un tipo de sitio web que extrae contenido de otros sitios. Estos motores recopilan contenido de otros sitios web, lo almacenan en sus propias bases de datos, lo indexan y lo presentan a sus usuarios. La mayor parte del contenido extraído por los motores de búsqueda está protegido por derechos de autor. [ 1 ]
La técnica de raspado también se ha utilizado en varios sitios web de citas. Estos sitios a menudo combinan sus actividades de raspado con el reconocimiento facial . [ 2 ] [ 3 ] [ 4 ] [ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ] [ 11 ]
El scraping también se utiliza en sitios web de análisis (reconocimiento) de imágenes en general , así como en sitios web específicamente diseñados para identificar imágenes de cultivos con plagas y enfermedades. [ 12 ] [ 13 ]
Hecho para publicidad
Algunos sitios web de extracción de datos se crean para ganar dinero mediante programas publicitarios. En estos casos, se les denomina sitios web creados para AdSense , o MFA. Este término despectivo se refiere a sitios web que no tienen ningún valor práctico, salvo el de atraer visitantes con el único propósito de que hagan clic en los anuncios. [ 14 ]
Los sitios creados para AdSense se consideran spam para los motores de búsqueda, ya que diluyen los resultados con información poco satisfactoria. El contenido extraído es redundante en comparación con el contenido que muestra el motor de búsqueda en circunstancias normales, si no se hubiera encontrado ningún sitio web de autenticación multifactor en los resultados.
Algunos sitios web de extracción de datos enlazan con otros sitios para mejorar su posicionamiento en los motores de búsqueda a través de una red privada de blogs . Antes de la actualización del algoritmo de búsqueda de Google, conocida como Panda , un tipo de sitio web de extracción de datos, conocido como autoblog, era bastante común entre los vendedores de dudosa reputación que utilizaban un método conocido como spamdexing .
Legalidad
Los sitios web que extraen contenido de otros sitios pueden infringir la ley de derechos de autor . Incluso tomar contenido de un sitio de contenido abierto puede constituir una infracción de derechos de autor si se hace de una manera que no respete la licencia. Por ejemplo, las licencias GNU Free Documentation License (GFDL) [ 15 ] y Creative Commons ShareAlike (CC-BY-SA) [ 16 ] utilizadas en Wikipedia [ 17 ] exigen que quien republique Wikipedia informe a sus lectores sobre las condiciones de estas licencias y dé crédito al autor original.
Técnicas
Según el objetivo de un programa de extracción de datos, los métodos para seleccionar sitios web varían. Por ejemplo, sitios con gran cantidad de contenido, como aerolíneas, tiendas de electrónica de consumo, grandes almacenes, etc., podrían ser objetivo habitual de su competencia para mantenerse al día con la información de precios.
Otro tipo de programa de extracción de datos recopila fragmentos de texto de sitios web con un alto posicionamiento para las palabras clave que han seleccionado. De esta forma, buscan posicionarse bien en las páginas de resultados de los motores de búsqueda (SERP), aprovechando el PageRank de la página original . Los feeds RSS son vulnerables a estos programas.
Otros sitios web de extracción de datos consisten en anuncios y párrafos con palabras seleccionadas aleatoriamente de un diccionario. A menudo, un visitante hace clic en un anuncio de pago por clic en estos sitios porque es el único texto comprensible de la página. Los operadores de estos sitios obtienen beneficios económicos de estos clics. Las redes publicitarias afirman trabajar constantemente para eliminar estos sitios de sus programas, aunque se benefician directamente de los clics generados en este tipo de sitios. Desde el punto de vista de los anunciantes, las redes no parecen estar haciendo lo suficiente para solucionar este problema.
Los programas de extracción de datos suelen asociarse con granjas de enlaces y, en ocasiones, se perciben como lo mismo cuando varios de estos programas enlazan al mismo sitio web objetivo. Un sitio web que suele ser víctima de este tipo de ataques podría ser acusado de participar en una granja de enlaces, debido al patrón artificial de enlaces entrantes desde múltiples sitios web que utilizan programas de extracción de datos.
secuestro de dominio
Algunos programadores que crean sitios web de extracción de datos pueden comprar un nombre de dominio recientemente caducado para reutilizar su posicionamiento SEO en Google. Empresas enteras se centran en comprender todos los dominios caducados y utilizarlos por su historial de posicionamiento. Esto permite a los expertos en SEO aprovechar los backlinks ya establecidos para el nombre de dominio. Algunos spammers pueden intentar replicar la temática del sitio caducado o copiar el contenido existente del Archivo de Internet para mantener la autenticidad del sitio y evitar la pérdida de backlinks. Por ejemplo, un sitio web caducado sobre un fotógrafo puede volver a registrarse para crear un sitio sobre consejos de fotografía o utilizar el nombre de dominio en su red de blogs privados para impulsar su propio sitio web de fotografía.
Algunos servicios de registro de dominios caducados ofrecen la posibilidad de encontrar estos dominios caducados y de recopilar el código HTML que el dominio solía tener en su sitio web.
Véase también
- Raspado
- Raspado de contacto
- Estacionamiento de dominio
- Extracción de datos web
- Extracción de datos de blogs
- Mensajería multiprotocolo : puede conectarse a varias redes, pero requiere tener una cuenta en todas ellas, por lo que no debe infringir los términos de las redes.
- Granja de contenido
- Optimización para motores de búsqueda (SEO)
Referencias
- ↑ Un informe revela que Google "tomó ilegalmente contenido de Amazon, Yelp y TripAdvisor".
- ↑ "Esta aplicación te permite encontrar en Tinder personas que se parecen a famosos" . BuzzFeed News . 20 de junio de 2017. Archivado del original el 8 de mayo de 2023.
- ↑ "El jefe de una aplicación de citas no ve 'ningún problema' en la comparación facial sin consentimiento" . Archivado del original el 24 de julio de 2018. Consultado el 24 de julio de 2018 .
- ↑ La aplicación Dating.ai te conecta con personas parecidas a famosos.
- ↑ La aplicación de reconocimiento facial relaciona a desconocidos con perfiles en línea.
- ↑ NameTag: La aplicación de reconocimiento facial es criticada por ser inquietante e invasiva.
- ↑ Deslizar Rompedor
- ↑ "La aplicación NameTag, que facilita el acoso, utiliza el reconocimiento facial para buscarte en línea" . Archivado del original el 24 de julio de 2018. Consultado el 24 de julio de 2018 .
- ↑ Esta aplicación inteligente (pero inquietante) te permite apuntar tu teléfono a las personas para descubrir quiénes son.
- ↑ Truly.am utiliza el reconocimiento facial para ayudarte a verificar tus citas online.
- ↑ 3 fascinantes motores de búsqueda que buscan rostros
- ↑ "Wolfram ha creado un sitio web que identifica cualquier imagen que le pongas" . The Verge . 14 de mayo de 2015. Archivado del original el 3 de junio de 2023.
- ↑ El aprendizaje automático ayuda a los pequeños agricultores a identificar plagas y enfermedades de las plantas.
- ↑ "Hecho para AdSense" . Archivado del original el 25/02/2014 . Consultado el 19/02/2014 .
- ↑ "Texto de la Licencia de Documentación Libre de GNU" .
- ↑ "Licencia Creative Commons Atribución-CompartirIgual 3.0 No adaptada" .
- ↑ "Wikipedia:Reutilización del contenido de Wikipedia" .
- Spam
- Extracción de datos web