Web scraping · Blog de Proxynet

Publicado
¿Por qué los sitios bloquean a los agentes de compra con IA?
Los agentes de compra con IA chocan con la protección de bots porque el sitio no distingue un agente autorizado. Explicamos por qué y las nuevas soluciones.
Autor:
Acar Diveroli
Publicado
Concurrencia y paralelismo en web scraping
La concurrencia aprovecha el tiempo de espera y el paralelismo, la potencia de CPU. Explicamos cuál acelera el scraping, con ejemplos en Python y Node.js.
Autor:
Acar Diveroli
Publicado
Selector CSS o XPath: ¿cuál usar en web scraping?
Los selectores CSS son cortos y legibles; XPath también selecciona por texto y por elemento padre. Comparamos sintaxis, velocidad y ejemplos en Python.
Autor:
Acar Diveroli
Publicado
Qué son las trampas honeypot y cómo afectan al scraping
Los honeypots son enlaces ocultos que los visitantes no ven pero en los que caen los bots. Explicamos cómo funcionan, sin enseñar a esquivarlos.
Autor:
Acar Diveroli
Publicado
Códigos de estado HTTP en web scraping: 403, 407, 429, 503
Las respuestas 403, 407, 429 y 503 indican problemas distintos en el scraping. Explicamos cada código, sus causas y cómo reintentar con Retry-After.
Autor:
Acar Diveroli
Publicado
HTTPX, Requests y AIOHTTP: comparativa
Requests es simple y síncrono, AIOHTTP es asíncrono y HTTPX ofrece los dos modos. Uso de proxy, rendimiento y cuál elegir en cada proyecto, con código.
Autor:
Acar Diveroli
Publicado
Puppeteer y CAPTCHA: por qué aparece y cómo reducirlo
En Puppeteer el CAPTCHA suele activarse por la reputación de la IP, la velocidad y las huellas del modo headless. Causas y soluciones legítimas.
Autor:
Acar Diveroli
Publicado
Qué es robots.txt y cómo leerlo
robots.txt es el archivo donde un sitio indica a los bots qué rutas no rastrear. Explicamos Disallow, Allow, Crawl-delay y cómo leerlo con Python.
Autor:
Acar Diveroli
Publicado
Cómo automatizar el seguimiento de posiciones SEO
Revisar posiciones a mano no escala. Explicamos el seguimiento automático de rankings con la API de Search Console, datos SERP y consultas por ubicación.
Autor:
Acar Diveroli
Publicado
Páginas estáticas y dinámicas en web scraping
Las páginas dinámicas cargan el contenido con JavaScript, así que una petición simple vuelve vacía. Explicamos cuándo hace falta un navegador headless.
Autor:
Acar Diveroli
Publicado
Cómo hacer web scraping sin que te bloqueen
Los scrapers se bloquean sobre todo por límites de velocidad, cabeceras y una sola IP. Explicamos cómo recoger datos según las reglas sin saturar el sitio.
Autor:
Acar Diveroli
¿Por qué los sitios bloquean a los agentes de compra con IA?
Autor: Acar Diveroli
Web scrapingPublicado
Concurrencia y paralelismo en web scraping
Autor: Acar Diveroli
Web scrapingPublicado
Selector CSS o XPath: ¿cuál usar en web scraping?
Autor: Acar Diveroli
Web scrapingPublicado
Qué son las trampas honeypot y cómo afectan al scraping
Autor: Acar Diveroli
Web scrapingPublicado
Códigos de estado HTTP en web scraping: 403, 407, 429, 503
Autor: Acar Diveroli
Web scrapingPublicado
HTTPX, Requests y AIOHTTP: comparativa
Autor: Acar Diveroli
TutorialesPublicado
Puppeteer y CAPTCHA: por qué aparece y cómo reducirlo
Autor: Acar Diveroli
TutorialesPublicado
Qué es robots.txt y cómo leerlo
Autor: Acar Diveroli
Web scrapingPublicado
Cómo automatizar el seguimiento de posiciones SEO
Autor: Acar Diveroli
Web scrapingPublicado
Páginas estáticas y dinámicas en web scraping
Autor: Acar Diveroli
Web scrapingPublicado
Cómo hacer web scraping sin que te bloqueen
Autor: Acar Diveroli
Web scrapingPublicado
Ningún artículo coincide
Publicado
Publicado

