Web scraping · Blog da Proxynet

  1. Publicado

    O que é reputação de IP e por que proxies são bloqueados

    Reputação de IP é uma pontuação feita com o histórico e o tipo de rede de um endereço. Veja o que ela mede, por que proxies são bloqueados e como se recupera.

    Autor: Acar Diveroli
  2. Publicado

    Proxies para rank tracking no Google: a localização importa

    O Google monta uma página de resultados diferente por país, cidade, idioma e dispositivo: uma verificação de posição é tão exata quanto o lugar de onde é feita.

    Autor: Acar Diveroli
  3. Publicado

    Web scraping em Python com proxies rotativos

    Aponte requests ou httpx para um gateway rotativo, repita os 429 com backoff, limite a concorrência e verifique o IP de saída. Código Python testado.

    Autor: Acar Diveroli
  4. Publicado

    Web scraping vs. API: qual você deve usar?

    Uma API entrega os dados que o provedor decide compartilhar, em formato fixo; o web scraping lê a própria página. Comparamos e testamos os dois caminhos.

    Autor: Acar Diveroli
  5. Publicado

    O que é web scraping e como funciona?

    Web scraping é a coleta automática de dados de páginas web: um programa baixa o HTML, extrai campos e os salva. Veja como funciona e para que serve.

    Autor: Acar Diveroli
  6. Publicado

    Web scraping com Cheerio no Node.js: tutorial passo a passo

    O Cheerio analisa HTML no Node.js com seletores no estilo jQuery. Crie um scraper testado com fetch, paginação, limite de concorrência, retentativas e proxy.

    Autor: Acar Diveroli
  7. Publicado

    Como limpar dados de scraping com pandas em Python

    Limpe dados de scraping com pandas: primeiro o texto, depois tipos, duplicatas, valores ausentes e outliers, e valide antes de salvar. Com script testado.

    Autor: Acar Diveroli
  8. Publicado

    Como extrair dados de PDF: tabelas, texto e OCR

    Verifique primeiro se o PDF tem camada de texto. Se tiver, o Excel ou o pdfplumber leem as tabelas; páginas digitalizadas precisam de OCR. Com código testado.

    Autor: Acar Diveroli
  9. Publicado

    Como tratar dados pessoais (PII) em dados de scraping

    Dados de scraping costumam trazer dados pessoais: nomes, perfis, e-mails e telefones. Como encontrá-los, reduzi-los, mascará-los e armazená-los com segurança.

    Autor: Acar Diveroli
  10. Publicado

    Como salvar dados de scraping em CSV, JSON e SQLite

    Salve os dados coletados em CSV para planilhas, JSON Lines para logs que só crescem e SQLite para execuções sem duplicatas. Com código Python testado.

    Autor: Acar Diveroli
  11. Publicado

    O que é parsing de dados? Tipos, erros e exemplos

    O parsing de dados transforma HTML, JSON, CSV ou logs em registros estruturados para o seu código. Como um parser funciona, os tipos e os erros mais comuns.

    Autor: Acar Diveroli
  12. Publicado

    O que é ETL? Extração, transformação e carga com Python

    ETL é extrair dados de uma fonte, limpá-los em um formato fixo e carregá-los em um banco de dados. Como funciona, ETL vs. ELT e um job em Python testado.

    Autor: Acar Diveroli
  1. O que é reputação de IP e por que proxies são bloqueados

    Proxy 101

    Publicado

  2. Proxies para rank tracking no Google: a localização importa

    Casos de uso

    Publicado

  3. Web scraping em Python com proxies rotativos

    Web scraping

    Publicado

  4. Web scraping vs. API: qual você deve usar?

    Comparativos

    Publicado

  5. O que é web scraping e como funciona?

    Web scraping

    Publicado

  6. Web scraping com Cheerio no Node.js: tutorial passo a passo

    Tutoriais

    Publicado

  7. Como limpar dados de scraping com pandas em Python

    Tutoriais

    Publicado

  8. Como extrair dados de PDF: tabelas, texto e OCR

    Tutoriais

    Publicado

  9. Como tratar dados pessoais (PII) em dados de scraping

    Web scraping

    Publicado

  10. Como salvar dados de scraping em CSV, JSON e SQLite

    Tutoriais

    Publicado

  11. O que é parsing de dados? Tipos, erros e exemplos

    Web scraping

    Publicado

  12. O que é ETL? Extração, transformação e carga com Python

    Web scraping

    Publicado