Web crawler (crawler bot), bir veya birkaç başlangıç adresinden (seed URL) yola çıkıp sayfa içindeki bağlantıları takip ederek siteler arasında sistematik biçimde dolaşan bir programdır. Akış her zaman aynıdır: crawler seed URL'den başlar, sayfayı çeker (crawl), HTML'i ayrıştırıp yeni bağlantıları ve veriyi çıkarır (parse), sonucu bir veritabanına veya dosyaya kaydeder (store) ve bulduğu yeni bağlantıları kuyruğa ekleyip döngüyü sürdürür.
Proxy Neden Gerekli? Hedef sunucular, tek bir IP'den gelen sürekli ve yoğun crawl trafiğini tanır; rate limit uygular, IP'yi geçici ya da kalıcı olarak banlar. Politeness delay'i (istekler arası bekleme) düşük tutup hızlı taramak istediğinizde bu risk daha da artar. Proxy havuzu, isteklerinizi çok sayıda farklı IP'ye dağıtarak yüksek eşzamanlılıkta, kesintisiz bir tarama yapmanızı sağlar.