A extração de dados geralmente busca páginas de uma lista conhecida, uma vez ou em um cronograma fixo. O trabalho de um crawler é diferente: seguir um sitemap.xml de ponta a ponta para descobrir centenas de milhares de páginas, ou encontrar e enfileirar automaticamente as páginas de produto novas que um site de e-commerce adiciona todos os dias — um fluxo de trabalho contínuo e agendado.
Nessa escala, um único IP nunca é suficiente — um crawler que tenta atualizar um sitemap de 500.000 páginas uma vez por dia envia dezenas de milhares de requisições por hora, e o servidor alvo vê isso como tráfego anormal vindo de uma única origem. A indexação dos mecanismos de busca é construída exatamente sobre esse princípio: pools amplos de IPs e requisições distribuídas no tempo.
O mesmo princípio vale ao construir seu próprio crawler: use um proxy rotativo durante a descoberta, para que cada requisição saia de um IP diferente, e mude para um proxy de sessão fixa quando precisar acompanhar uma subseção específica com identidade estável — assim você continua em conformidade com o robots.txt e mantém seu rastreamento agendado rodando sem interrupções.