Web Crawler Proxy

Binlerce sayfayı otomatik olarak dolaşan crawler'ınız tek bir IP'den giderse hızla engellenir. Residential, rotating ve datacenter proxy havuzlarımız isteklerinizi geniş bir IP havuzuna dağıtarak, robots.txt kurallarınızı korurken kesintisiz bir tarama sağlar.

  • IP Ban ve Rate Limit Koruması
  • 194 Ülke Coğrafi Hedefleme
  • Residential, Rotating & Datacenter Havuz
  • İstekler Arası Bekleme (Politeness Delay) Ayarı
  • HTTPS & SOCKS5 Protokol Desteği
  • Self-Servis Panel & Anında Teslimat
Neden Proxy Kullanılır?

Web crawler'da proxy neden gerekir?

IP ban ve engellenmeden taramaya devam edin

Bir crawler'ın tek IP'den gönderdiği yüzlerce ardışık istek, hedef sunucunun güvenlik sistemleri tarafından hızla tespit edilip engellenir. İstekleri geniş bir IP havuzuna dağıtarak tek noktadan gelen anormal trafik izlenimini ortadan kaldırırsınız.

Rate limitleri aşın

Çoğu sunucu, aynı IP'den dakikada belirli sayıda isteğe izin verir. Farklı IP'ler üzerinden dağıtılan crawl trafiği, bu sınırı IP başına değil toplamda çok daha yükseğe taşır.

Politeness delay'i düşürüp hızdan ödün vermeyin

Sunucuyu yormamak için istekler arasına eklenen bekleme süresi (politeness delay) tek IP'de taramayı ciddi şekilde yavaşlatır. Trafiği çok sayıda IP'ye paylaştırdığınızda her IP'nin kendi bekleme süresini korurken toplam tarama hızınız artar.

robots.txt kurallarına uyumlu kalın

robots.txt'e uygun, düşük yoğunluklu bir crawler bile paylaşılan bir IP üzerinden giderse başka bir sürecin agresif trafiğinden dolayı engellenebilir. Kendi IP havuzunuz, uyumluluğunuzun sonucunu başkasının davranışına bağlı olmaktan çıkarır.

Eşzamanlı istek sayısını güvenle artırın

Concurrent request ayarını yükseltmek tek IP'de anında ban riski doğurur. Geniş bir proxy havuzuyla eşzamanlılığı IP başına düşük, toplamda yüksek tutarak binlerce sayfayı paralel tarayabilirsiniz.

Her ülkenin gerçek sayfa içeriğini toplayın

Birçok site dil, fiyat ve içeriği ülkeye hatta şehre göre değiştirir. Hedef lokasyondan gerçek bir IP kullanmadan crawler'ınızın topladığı sayfa içeriği, gerçek bir ziyaretçinin gördüğünden farklı olabilir.

Kendi altyapınızı gizli tutun

Crawl trafiğiniz kendi sunucunuzun IP'si üzerinden değil, proxy havuzundaki adresler üzerinden gider. Gerçek altyapınız taradığınız sitelerin loglarında hiç görünmez.

Hacimde maliyet avantajı sağlayın

Geniş, az korumalı site kümelerini tararken datacenter proxy GB veya IP başına çok daha ucuzdur. Sıkı korumalı hedeflerde residential'a geçip bütçeyi hedefin hassasiyetine göre yönetirsiniz.

Mevcut crawler'ınıza kod değiştirmeden bağlanın

Scrapy, Apache Nutch, Puppeteer ve kendi HTTP istemciniz backconnect endpoint formatını yerel olarak destekler. Tek bir host:port ve kimlik bilgisi girip mevcut crawl mantığınızı değiştirmeden proxy havuzuna geçersiniz.

Web Crawler & Proxy Altyapısı

Web Crawler Nedir?

Web crawler (crawler bot), bir veya birkaç başlangıç adresinden (seed URL) yola çıkıp sayfa içindeki bağlantıları takip ederek siteler arasında sistematik biçimde dolaşan bir programdır. Akış her zaman aynıdır: crawler seed URL'den başlar, sayfayı çeker (crawl), HTML'i ayrıştırıp yeni bağlantıları ve veriyi çıkarır (parse), sonucu bir veritabanına veya dosyaya kaydeder (store) ve bulduğu yeni bağlantıları kuyruğa ekleyip döngüyü sürdürür.

Proxy Neden Gerekli? Hedef sunucular, tek bir IP'den gelen sürekli ve yoğun crawl trafiğini tanır; rate limit uygular, IP'yi geçici ya da kalıcı olarak banlar. Politeness delay'i (istekler arası bekleme) düşük tutup hızlı taramak istediğinizde bu risk daha da artar. Proxy havuzu, isteklerinizi çok sayıda farklı IP'ye dağıtarak yüksek eşzamanlılıkta, kesintisiz bir tarama yapmanızı sağlar.

Web crawler işine göre hangi proxy kullanılır
İş TürüOturum ModuIP KaynağıÜcretlendirme
Yüksek hacimli, az korumalı hedefler (geniş site haritası)Rotating ProxyDatacenter ProxyIP başına aylık
Zor korumalı, yoğun bot tespitli hedeflerRotating ProxyResidential ProxyGB bazlı
En sıkı korumalı, en yüksek güven gerektiren hedeflerRotating ProxyMobil ProxyGB bazlı
Oturum açma veya oturum takibi gereken akışlarSticky ProxyResidential ProxyGB bazlı

Crawler'ı tek seferlik kazımadan ayıran şey nedir?

Veri kazıma genelde belirli bir listedeki sayfaları bir kere veya belirli aralıklarla çeker. Crawler'ın işi farklı: bir sitemap.xml'i baştan sona takip edip yüz binlerce sayfayı keşfetmek, ya da bir e-ticaret sitesinin her gün eklenen yeni ürün sayfalarını otomatik bulup kuyruğa eklemek gibi sürekli, zamanlanmış bir iş akışıdır.

Bu ölçekte tek bir IP hiçbir zaman yetmez — 500 bin sayfalık bir sitemap'i günde bir kez tazelemek isteyen bir crawler, saatte on binlerce istek gönderir ve hedef sunucu bunu tek kaynaktan gelen anormal trafik olarak görür. Arama motorlarının indeksleme mantığı da tam olarak bu nedenle geniş IP havuzları ve dağıtık istek zamanlaması üzerine kurulur.

Kendi crawler'ınızı kurarken de aynı prensip geçerli: keşif aşamasında her isteği farklı bir IP'den göndermek için Rotating Proxy kullanın, belirli bir alt siteyi derinlemesine takip ederken kimliği sabit tutmak isterseniz Sticky Proxy tercih edin — böylece hem robots.txt'e uyumlu kalır hem de zamanlanmış taramanızı kesintisiz sürdürürsünüz.

Veri Scraper ve Web Crawler karşılaştırması
Veri ScraperWeb Crawler
Hedef listesiSabit, önceden bilinen sayfalarBağlantı takibiyle kendiliğinden genişler
OdakBelirli alanları çıkarmak (fiyat, stok, başlık)Sistematik keşif; genelde veri çıkarmayla birlikte
ÖrnekTek bir ürünün fiyatını takip etmekArama motoru indeksleme, site haritası taraması
Kurulum Adımları & Sınırlar

Web Crawler Nasıl Çalışır?

Sıfırdan bir crawl iş akışı kurarken izlenen seed URL → crawl → parse → store döngüsü:

  1. Seed URL ve Kapsamın Belirlenmesi: Crawler'ın başlayacağı bir veya birkaç seed URL ile hangi domain ve alt yolların kapsam dahilinde olduğunu tanımlayın. Bu aşamada hedef sitenin robots.txt dosyasını okuyup hangi yolların taranmasına izin verilmediğini (Disallow) belirleyin.
  2. Crawl — Sayfayı Çekme ve Bağlantı Kuyruğu: Crawler seed URL'i HTTP isteğiyle çeker, bulduğu iç bağlantıları bir kuyruğa ekler ve kuyruktaki her adres için işlemi tekrarlar. Politeness delay (istekler arası bekleme) ve concurrent request (eşzamanlı istek) sayısı burada ayarlanır — çok agresif ayar tek IP'de hızlı ban getirir, bu yüzden bir proxy havuzu üzerinden dağıtılması gerekir.
  3. Parse — HTML'i Ayrıştırma: İndirilen HTML ayrıştırılır: yeni bağlantılar kuyruğa eklenmek üzere çıkarılır, ilgileniyorsanız başlık, meta etiket veya içerik gibi alanlar da bu adımda çekilir. JavaScript ile render edilen sayfalarda bu adım öncesinde headless bir tarayıcı gerekir.
  4. Store — Kaydetme ve Tekrarlanan URL Kontrolü: Ayrıştırılan veri bir veritabanına veya dosyaya yazılır; ziyaret edilen URL'ler işaretlenerek aynı sayfanın tekrar taranması önlenir. 429/403 yanıtlarında backoff ve retry mantığı, kapsam ve derinlik (crawl depth) sınırları da bu aşamada devreye girer.
settings.pyScrapy — taramayı Proxynet ağ geçidine yönlendirme
DOWNLOADER_MIDDLEWARES = {"myproject.middlewares.ProxynetProxy": 100}
CONCURRENT_REQUESTS_PER_DOMAIN = 50
DOWNLOAD_DELAY = 0.5  # seconds

Ne Değildir

  • Kişisel verileri (KVKK/GDPR kapsamındaki bilgileri) toplamak için bir araç değildir.
  • Oturum açma gerektiren yetkisiz veya özel alanlara erişim yöntemi değildir.
  • robots.txt'te açıkça yasaklanan yolları taramak için bir yöntem değildir; kapsam bu kurallara uygun tutulmalıdır.

Proxy Tek Başına Yetmez

  • Politeness delay ve crawl derinliği ayarları kendi crawler mantığınızda kalır; proxy yalnızca IP kaynağını çözer.
  • Tarayıcı parmak izi (canvas, WebGL, user-agent tutarlılığı) ayrıca yönetilmelidir.
  • JavaScript render gerektiren sitelerde headless tarayıcı şarttır; proxy yalnızca ağ katmanını çözer.
Kullanım Alanları

Web Crawler Sektörel Kullanım Alanları

SEO denetiminden e-ticaret katalog taramasına, finans verisi takibinden marka korumasına kadar web crawler'ın güç verdiği alanlar.

Bir sitenin tüm sayfalarını sistematik olarak dolaşıp kırık bağlantı, eksik meta etiket ve indekslenebilirlik sorunlarını arama motoru botlarının gördüğü gibi tespit edin.

Bir mağazanın kategori sayfalarından başlayıp her ürün sayfasına bağlantı takibiyle ulaşarak binlerce SKU'yu tek bir crawl döngüsünde keşfedin.

Katalog sayfalarını düzenli aralıklarla yeniden tarayarak fiyat, stok ve kampanya değişimini gerçek lokasyon IP'leriyle takip edin.

Rakip sitelerin tüm sayfa yapısını, ürün asortmanını ve bölgesel içerik farklarını crawler ile sistematik olarak çıkarın.

Web genelinde marka adınızı, logonuzu veya ürün fotoğraflarınızı kullanan sahte satıcı ve dolandırıcılık sitelerini geniş ölçekte tarayarak tespit edin.

Halka açık borsa ve haber sitelerini düzenli aralıklarla tarayarak fiyat, duyuru ve şirket verisini gerçek zamanlı toplayın.

Müşterilerimiz ne diyor

Trustpilot'ta 5 üzerinden 4,4 — "Mükemmel".

Trustpilot

Destek ve proxy kalitesi

Sattıkları proxy'lerin kalitesi ile satış öncesi ve satış sonrası desteği birlikte düşününce piyasadaki en iyilerden olduklarını söyleyebilirim. Uzun süre birlikte çalışmak isterim, teşekkürler.
Ç

Çağlar

Trustpilot · 5.0/5 · Ağu 2022

Trustpilot

Görebileceğiniz en iyi müşteri desteklerinden biri

Başka bir firmadan proxy kullanıyordum ve hizmetimle ilgili destek alamıyordum. Henüz satın almadan proxynet.io'ya kayıtlıydım; Cumartesi günü müşteri hizmetlerinden bir e-posta gelince denemeye karar verdim. Şu ana kadar söyleyebileceğim, hızlı yanıt ve sorun çözme yaklaşımları beni gerçekten etkiledi.
Trustpilot'ta okuyun
K

Kemal

Trustpilot · 5.0/5 · Eyl 2023

Trustpilot

Teknik destek hızlı, ISP proxy'ler başarılı

Teknik destek hızlı. ISP proxy'lerden çok memnun kaldım; fiyatları biraz daha uygun yapabilirsiniz, mobil maalesef pahalı ama ISP hızları ve subnet kalitesi başarılı.
Trustpilot'ta okuyun
A

Andre James

Trustpilot · 5.0/5 · Ara 2023

Sıkça Sorulan Sorular.
Web Crawler hakkında tüm merak ettikleriniz.

Aklınıza takılan farklı bir soru veya yüksek hacimli crawl altyapı talepleriniz için uzman ekibimiz 7/24 yanınızda.

Web crawler, bir veya birkaç seed URL'den başlayıp sayfa içindeki bağlantıları takip ederek siteler arasında sistematik biçimde dolaşan bir bottur. Akış seed URL → crawl (sayfayı çekme) → parse (HTML'i ayrıştırıp yeni bağlantı ve veriyi çıkarma) → store (sonucu kaydetme) şeklinde döner; bulunan her yeni bağlantı kuyruğa eklenip aynı döngü tekrar eder.