Web scraping · Blog da Proxynet

  1. Publicado

    Por que os sites bloqueiam agentes de compras com IA?

    Agentes de compras com IA esbarram na proteção de bots porque o site não distingue um agente autorizado. Explicamos o motivo e as novas soluções.

    Autor: Acar Diveroli
  2. Publicado

    Concorrência e paralelismo no web scraping

    A concorrência aproveita o tempo de espera e o paralelismo, a potência da CPU. Explicamos qual acelera o scraping, com exemplos em Python e Node.js.

    Autor: Acar Diveroli
  3. Publicado

    Seletor CSS ou XPath: qual usar no web scraping?

    Seletores CSS são curtos e legíveis; o XPath também seleciona por texto e por elemento pai. Comparamos sintaxe, velocidade e exemplos em Python.

    Autor: Acar Diveroli
  4. Publicado

    O que são armadilhas honeypot e como afetam o scraping?

    Honeypots são links escondidos que os visitantes não veem, mas nos quais os bots caem. Explicamos como funcionam, sem ensinar a burlá-los.

    Autor: Acar Diveroli
  5. Publicado

    Códigos de status HTTP no web scraping: 403, 407, 429, 503

    As respostas 403, 407, 429 e 503 indicam problemas diferentes no scraping. Explicamos cada código, as causas e como tentar de novo com Retry-After.

    Autor: Acar Diveroli
  6. Publicado

    O que é robots.txt e como ler o arquivo?

    O robots.txt é o arquivo em que o site diz aos bots quais caminhos não rastrear. Explicamos Disallow, Allow, Crawl-delay e como ler o arquivo com Python.

    Autor: Acar Diveroli
  7. Publicado

    Como automatizar o acompanhamento de posições no SEO

    Conferir posições à mão não escala. Mostramos o acompanhamento automático com a API do Search Console, dados de SERP e consultas por localização.

    Autor: Acar Diveroli
  8. Publicado

    Páginas estáticas e dinâmicas no web scraping

    Páginas dinâmicas carregam o conteúdo depois com JavaScript, então uma requisição simples volta vazia. Explicamos quando um navegador headless é necessário.

    Autor: Acar Diveroli
  9. Publicado

    Como fazer web scraping sem ser bloqueado

    Scrapers são bloqueados sobretudo por limites de taxa, cabeçalhos e um único IP. Explicamos como coletar dados dentro das regras sem sobrecarregar o site.

    Autor: Acar Diveroli
  1. Por que os sites bloqueiam agentes de compras com IA?

    Web scraping

    Publicado

  2. Concorrência e paralelismo no web scraping

    Web scraping

    Publicado

  3. Seletor CSS ou XPath: qual usar no web scraping?

    Web scraping

    Publicado

  4. O que são armadilhas honeypot e como afetam o scraping?

    Web scraping

    Publicado

  5. Códigos de status HTTP no web scraping: 403, 407, 429, 503

    Web scraping

    Publicado

  6. O que é robots.txt e como ler o arquivo?

    Web scraping

    Publicado

  7. Como automatizar o acompanhamento de posições no SEO

    Web scraping

    Publicado

  8. Páginas estáticas e dinâmicas no web scraping

    Web scraping

    Publicado

  9. Como fazer web scraping sem ser bloqueado

    Web scraping

    Publicado