Web scraping · Blog da Proxynet

Publicado
Por que os sites bloqueiam agentes de compras com IA?
Agentes de compras com IA esbarram na proteção de bots porque o site não distingue um agente autorizado. Explicamos o motivo e as novas soluções.
Autor:
Acar Diveroli
Publicado
Concorrência e paralelismo no web scraping
A concorrência aproveita o tempo de espera e o paralelismo, a potência da CPU. Explicamos qual acelera o scraping, com exemplos em Python e Node.js.
Autor:
Acar Diveroli
Publicado
Seletor CSS ou XPath: qual usar no web scraping?
Seletores CSS são curtos e legíveis; o XPath também seleciona por texto e por elemento pai. Comparamos sintaxe, velocidade e exemplos em Python.
Autor:
Acar Diveroli
Publicado
O que são armadilhas honeypot e como afetam o scraping?
Honeypots são links escondidos que os visitantes não veem, mas nos quais os bots caem. Explicamos como funcionam, sem ensinar a burlá-los.
Autor:
Acar Diveroli
Publicado
Códigos de status HTTP no web scraping: 403, 407, 429, 503
As respostas 403, 407, 429 e 503 indicam problemas diferentes no scraping. Explicamos cada código, as causas e como tentar de novo com Retry-After.
Autor:
Acar Diveroli
Publicado
O que é robots.txt e como ler o arquivo?
O robots.txt é o arquivo em que o site diz aos bots quais caminhos não rastrear. Explicamos Disallow, Allow, Crawl-delay e como ler o arquivo com Python.
Autor:
Acar Diveroli
Publicado
Como automatizar o acompanhamento de posições no SEO
Conferir posições à mão não escala. Mostramos o acompanhamento automático com a API do Search Console, dados de SERP e consultas por localização.
Autor:
Acar Diveroli
Publicado
Páginas estáticas e dinâmicas no web scraping
Páginas dinâmicas carregam o conteúdo depois com JavaScript, então uma requisição simples volta vazia. Explicamos quando um navegador headless é necessário.
Autor:
Acar Diveroli
Publicado
Como fazer web scraping sem ser bloqueado
Scrapers são bloqueados sobretudo por limites de taxa, cabeçalhos e um único IP. Explicamos como coletar dados dentro das regras sem sobrecarregar o site.
Autor:
Acar Diveroli
Por que os sites bloqueiam agentes de compras com IA?
Autor: Acar Diveroli
Web scrapingPublicado
Concorrência e paralelismo no web scraping
Autor: Acar Diveroli
Web scrapingPublicado
Seletor CSS ou XPath: qual usar no web scraping?
Autor: Acar Diveroli
Web scrapingPublicado
O que são armadilhas honeypot e como afetam o scraping?
Autor: Acar Diveroli
Web scrapingPublicado
Códigos de status HTTP no web scraping: 403, 407, 429, 503
Autor: Acar Diveroli
Web scrapingPublicado
O que é robots.txt e como ler o arquivo?
Autor: Acar Diveroli
Web scrapingPublicado
Como automatizar o acompanhamento de posições no SEO
Autor: Acar Diveroli
Web scrapingPublicado
Páginas estáticas e dinâmicas no web scraping
Autor: Acar Diveroli
Web scrapingPublicado
Como fazer web scraping sem ser bloqueado
Autor: Acar Diveroli
Web scrapingPublicado
Nenhum artigo encontrado
Publicado
Publicado

