Web scraping · Blog de Proxynet

  1. Publicado

    ¿Por qué los sitios bloquean a los agentes de compra con IA?

    Los agentes de compra con IA chocan con la protección de bots porque el sitio no distingue un agente autorizado. Explicamos por qué y las nuevas soluciones.

    Autor: Acar Diveroli
  2. Publicado

    Concurrencia y paralelismo en web scraping

    La concurrencia aprovecha el tiempo de espera y el paralelismo, la potencia de CPU. Explicamos cuál acelera el scraping, con ejemplos en Python y Node.js.

    Autor: Acar Diveroli
  3. Publicado

    Selector CSS o XPath: ¿cuál usar en web scraping?

    Los selectores CSS son cortos y legibles; XPath también selecciona por texto y por elemento padre. Comparamos sintaxis, velocidad y ejemplos en Python.

    Autor: Acar Diveroli
  4. Publicado

    Qué son las trampas honeypot y cómo afectan al scraping

    Los honeypots son enlaces ocultos que los visitantes no ven pero en los que caen los bots. Explicamos cómo funcionan, sin enseñar a esquivarlos.

    Autor: Acar Diveroli
  5. Publicado

    Códigos de estado HTTP en web scraping: 403, 407, 429, 503

    Las respuestas 403, 407, 429 y 503 indican problemas distintos en el scraping. Explicamos cada código, sus causas y cómo reintentar con Retry-After.

    Autor: Acar Diveroli
  6. Publicado

    HTTPX, Requests y AIOHTTP: comparativa

    Requests es simple y síncrono, AIOHTTP es asíncrono y HTTPX ofrece los dos modos. Uso de proxy, rendimiento y cuál elegir en cada proyecto, con código.

    Autor: Acar Diveroli
  7. Publicado

    Puppeteer y CAPTCHA: por qué aparece y cómo reducirlo

    En Puppeteer el CAPTCHA suele activarse por la reputación de la IP, la velocidad y las huellas del modo headless. Causas y soluciones legítimas.

    Autor: Acar Diveroli
  8. Publicado

    Qué es robots.txt y cómo leerlo

    robots.txt es el archivo donde un sitio indica a los bots qué rutas no rastrear. Explicamos Disallow, Allow, Crawl-delay y cómo leerlo con Python.

    Autor: Acar Diveroli
  9. Publicado

    Cómo automatizar el seguimiento de posiciones SEO

    Revisar posiciones a mano no escala. Explicamos el seguimiento automático de rankings con la API de Search Console, datos SERP y consultas por ubicación.

    Autor: Acar Diveroli
  10. Publicado

    Páginas estáticas y dinámicas en web scraping

    Las páginas dinámicas cargan el contenido con JavaScript, así que una petición simple vuelve vacía. Explicamos cuándo hace falta un navegador headless.

    Autor: Acar Diveroli
  11. Publicado

    Cómo hacer web scraping sin que te bloqueen

    Los scrapers se bloquean sobre todo por límites de velocidad, cabeceras y una sola IP. Explicamos cómo recoger datos según las reglas sin saturar el sitio.

    Autor: Acar Diveroli
  1. ¿Por qué los sitios bloquean a los agentes de compra con IA?

    Web scraping

    Publicado

  2. Concurrencia y paralelismo en web scraping

    Web scraping

    Publicado

  3. Selector CSS o XPath: ¿cuál usar en web scraping?

    Web scraping

    Publicado

  4. Qué son las trampas honeypot y cómo afectan al scraping

    Web scraping

    Publicado

  5. Códigos de estado HTTP en web scraping: 403, 407, 429, 503

    Web scraping

    Publicado

  6. HTTPX, Requests y AIOHTTP: comparativa

    Tutoriales

    Publicado

  7. Puppeteer y CAPTCHA: por qué aparece y cómo reducirlo

    Tutoriales

    Publicado

  8. Qué es robots.txt y cómo leerlo

    Web scraping

    Publicado

  9. Cómo automatizar el seguimiento de posiciones SEO

    Web scraping

    Publicado

  10. Páginas estáticas y dinámicas en web scraping

    Web scraping

    Publicado

  11. Cómo hacer web scraping sin que te bloqueen

    Web scraping

    Publicado