Hacer web scraping significa leer datos públicos de páginas web, guardarlos y reunirlos en conjuntos de datos. Por lo general es lícito, pero hay límites, y no pasan por donde mucha gente cree.
Qué es el web scraping
Una página web llega en HTML. Al hacer scraping, un programa lee ese HTML, extrae los campos que interesan y los guarda en un formato aprovechable: JSON, CSV o una base de datos. Técnicamente no ocurre nada más; la cuestión jurídica no está en la lectura, sino en los datos mismos y en el uso posterior.
La línea que de verdad separa
Recoger datos públicamente accesibles es, en principio, lícito. Cuatro cosas cambian eso:
- Datos tras un inicio de sesión. Lo que solo se ve después de entrar en una cuenta no es público, por fácil que sea crear esa cuenta.
- Datos personales. Tienen sus propias reglas; ver más abajo.
- Contenidos protegidos por derechos de autor. Textos, imágenes, logotipos y piezas editoriales no se pueden tomar y redifundir sin más.
- Las condiciones de uso del sitio. Muchos portales y marketplaces grandes prohíben expresamente el acceso automatizado. Mirar las condiciones y el
robots.txtva al principio del proyecto, no al final.
Se resume así: que recoger sea lícito no dice todavía nada sobre lo que puedes hacer después con los datos.
La situación por jurisdicciones
Estados Unidos
Los tribunales estadounidenses han resuelto en varias ocasiones que los datos públicamente accesibles pueden recogerse libremente. Los límites los ponen la Computer Fraud and Abuse Act (CFAA), la ley de derechos de autor y normas de privacidad como la California Consumer Privacy Act (CCPA). Lo que está tras un inicio de sesión no cuenta como «público».
Unión Europea
Algo parecido: los datos públicamente accesibles pueden recogerse siempre que no se vulneren el Reglamento General de Protección de Datos (RGPD), la Directiva sobre bases de datos o la Directiva sobre derechos de autor en el mercado único digital.
Reino Unido
También rige el mismo principio. Hay que tener presentes la Data Protection Act, la Copyright, Designs and Patents Act y la Computer Misuse Act, y de nuevo: nada tras un inicio de sesión, ningún dato personal sin base legítima, ningún material protegido.
Türkiye
No existe una ley específica de scraping; el principio coincide con el de la UE, EE. UU. y el Reino Unido. Allí hay dos puntos especialmente importantes: las condiciones de uso del sitio de destino obligan —varios portales turcos grandes prohíben expresamente el acceso automatizado— y la carga que generas puede convertirse por sí sola en un problema. Quien somete un sitio a tantas peticiones que su funcionamiento se resiente entra, al margen de los datos, en terreno penalmente relevante.
Datos personales
Durante mucho tiempo casi nadie se preocupó por los datos personales. Hoy ocurre lo contrario en la UE, en California y en muchas otras jurisdicciones. Si recoges ese tipo de datos, no hay forma de esquivar el RGPD ni la CCPA.
El RGPD define los datos personales como «toda información sobre una persona física identificada o identificable». La definición es deliberadamente amplia. Algunos ejemplos:
- Datos de la persona: nombre y apellidos, fecha de nacimiento, domicilio, números de documento y de seguridad social, datos laborales
- Datos de contacto: teléfono, correo electrónico, dirección IP, cuentas en redes sociales
- Datos recogidos por aplicaciones: ubicación por dirección o GPS, hábitos de compra, datos de comportamiento
- Grabaciones y datos biométricos
- Categorías especiales: sexo y orientación sexual, origen étnico, convicciones religiosas, opiniones políticas, datos de salud
Prácticamente cualquier dato atribuible a una persona concreta entra ahí. En caso de duda, da por hecho que son datos personales.
Qué han decidido los tribunales
Las grandes plataformas han actuado varias veces contra servicios de scraping. Un caso muy comentado: Meta demandó a Bright Data por recoger datos de Facebook e Instagram, y perdió.
El tribunal consideró que Meta no pudo acreditar que se hubieran recogido datos no públicos, es decir, datos tras un inicio de sesión o protegidos por contraseña. Para la recogida de datos de usuario visibles públicamente no dio por suficientemente demostrado ni un acceso no autorizado ni un incumplimiento de las condiciones de uso.

La línea queda bastante clara: recoger datos visibles públicamente cuenta con el respaldo de los tribunales estadounidenses. Crear cuentas para acceder a contenidos que solo se muestran a usuarios registrados, no.
Conclusión
¿Es legal el web scraping? Por regla general sí, con los límites anteriores. Respeta tres cosas y la mayoría de los problemas no llegan a aparecer:
- Quédate en lo que se ve sin iniciar sesión.
- Lee las condiciones de uso y el
robots.txtantes de empezar. - No sobrecargues el sitio de destino: reparte las peticiones y baja el ritmo.
El tercer punto tiene una parte técnica: con un proxy, las peticiones se reparten entre varias direcciones en lugar de saturar un sitio desde una sola IP. No es solo cuestión de tasa de éxito, también de respeto por el funcionamiento de la otra parte.




