ProxynetProxynet

پروکسی‌های خزنده وب

خزنده‌ای که هزاران صفحه را می‌پیماید وقتی هر درخواست از یک IP بیرون برود به‌سرعت مسدود می‌شود. استخرهای پروکسی مسکونی، چرخشی و دیتاسنتر ما آن درخواست‌ها را در یک استخر IP گسترده پخش می‌کنند تا خزش شما بی‌وقفه ادامه یابد، در حالی که رعایت robots.txt بر عهده شماست.

  • محافظت در برابر مسدودسازی IP و محدودیت نرخ
  • هدف‌گیری جغرافیایی در 194 کشور
  • استخرهای مسکونی، چرخشی و دیتاسنتر
  • مکث قابل تنظیم میان درخواست‌ها (تأخیر ادب)
  • پشتیبانی از پروتکل‌های HTTPS و SOCKS5
  • پنل خودخدمت و تحویل آنی
چرا از پروکسی استفاده کنیم؟

چرا خزنده وب به پروکسی نیاز دارد؟

بدون مسدودسازی IP به خزش ادامه دهید

صدها درخواست پشت‌سرهم از یک IP دقیقاً همان چیزی است که سامانه‌های امنیتی سرور هدف برای گرفتنش ساخته شده‌اند. پخش آن درخواست‌ها در یک استخر IP گسترده الگوی آشکار ترافیک غیرعادی از یک نقطه را از میان می‌برد.

عبور از محدودیت نرخ

بیشتر سرورها فقط تعداد مشخصی درخواست در دقیقه از یک IP را مجاز می‌دانند. ترافیک خزش توزیع‌شده میان IPهای مختلف هر آدرس را زیر آن سقف نگه می‌دارد در حالی که توان عملیاتی مجموع شما بسیار بالاتر می‌رود.

تأخیر ادب را بدون از دست دادن سرعت نگه دارید

مکثی که میان درخواست‌ها برای فشار نیاوردن به سرور افزوده می‌شود (تأخیر ادب) خزش تک‌IP را تا حد توقف کند می‌کند. ترافیک را میان IPهای بسیار تقسیم کنید تا هر کدام تأخیر خودش را نگه دارد و نرخ کل خزش شما بالا برود.

با robots.txt منطبق بمانید

حتی یک خزنده مؤدب و کم‌شدت که robots.txt را رعایت می‌کند، اگر از IP اشتراکی بیرون برود می‌تواند به خاطر ترافیک تهاجمی فرایندی دیگر مسدود شود. استخر IP خودتان یعنی انطباق شما بر اساس رفتار خودتان قضاوت می‌شود، نه رفتار کس دیگری.

درخواست‌های همزمان را با خیال راحت بالا ببرید

بالا بردن تنظیم درخواست همزمان روی یک IP مسدودسازی فوری را دعوت می‌کند. با استخر پروکسی بزرگ، همزمانی را برای هر IP پایین و در مجموع بالا نگه می‌دارید و هزاران صفحه را به‌موازات می‌خزید.

محتوای واقعی صفحه را برای هر کشور جمع‌آوری کنید

بسیاری از سایت‌ها زبان، قیمت و محتوا را بر اساس کشور و حتی شهر تغییر می‌دهند. بدون یک IP واقعی در موقعیت هدف، محتوای صفحه‌ای که خزنده شما ذخیره می‌کند می‌تواند با آنچه یک بازدیدکننده واقعی می‌بیند متفاوت باشد.

زیرساخت خودتان را پنهان نگه دارید

ترافیک خزش شما به‌جای IP سرور خودتان از آدرس‌های استخر پروکسی بیرون می‌رود. زیرساخت واقعی شما هرگز در لاگ‌های سایت‌هایی که می‌خزید ظاهر نمی‌شود.

هزینه به‌ازای حجم را کم کنید

برای مجموعه‌های گسترده و کم‌محافظت از سایت‌ها، پروکسی‌های دیتاسنتر به‌ازای هر گیگابایت یا هر IP بسیار ارزان‌ترند. فقط روی اهداف سخت‌محافظت به مسکونی بروید تا بودجه شما از حساسیت واقعی هر هدف پیروی کند.

خزنده فعلی خود را بدون تغییر کد وصل کنید

Scrapy، Apache Nutch، Puppeteer و کلاینت HTTP خودتان همه به‌طور بومی از قالب نقطه اتصال بک‌کانکت پشتیبانی می‌کنند. یک host:port به‌علاوه اطلاعات ورود خود را وارد کنید تا بدون دست زدن به منطق خزش فعلی روی استخر پروکسی باشید.

خزنده وب و زیرساخت پروکسی

خزنده وب چیست؟

خزنده وب (بات عنکبوتی) برنامه‌ای است که از یک یا چند آدرس آغازین راه می‌افتد و با دنبال کردن لینک‌هایی که در هر صفحه می‌یابد به‌طور نظام‌مند در سایت‌ها حرکت می‌کند. جریان همیشه یکسان است: خزنده از آدرس آغازین شروع می‌کند، صفحه را دریافت می‌کند (خزش)، HTML را برای بیرون کشیدن لینک‌ها و داده‌های جدید تجزیه می‌کند (تجزیه)، نتیجه را در پایگاه داده یا فایل می‌نویسد (ذخیره)، سپس لینک‌های جدیدی را که یافته به صف می‌افزاید و حلقه را ادامه می‌دهد.

چرا به پروکسی نیاز دارید؟ سرورهای هدف ترافیک خزش پیوسته و سنگین از یک IP را می‌شناسند؛ محدودیت نرخ اعمال می‌کنند و آن IP را موقت یا دائم مسدود می‌کنند. وقتی بخواهید با پایین نگه داشتن تأخیر ادب (مکث میان درخواست‌ها) سریع بخزید، خطر باز هم بالا می‌رود. استخر پروکسی درخواست‌های شما را میان IPهای مختلف بسیار پخش می‌کند، پس خزش شما می‌تواند بدون توقف با همزمانی بالا اجرا شود.

برای هر کار خزش از کدام پروکسی استفاده کنیم
نوع کارحالت نشستمنبع IPصورتحساب
اهداف پرحجم و کم‌محافظت (نقشه‌سایت‌های بزرگ)پروکسی چرخشیپروکسی دیتاسنترماهانه به‌ازای هر IP
اهداف سخت‌محافظت با شناسایی سنگین باتپروکسی چرخشیپروکسی مسکونیبه‌ازای گیگابایت
سخت‌محافظت‌ترین اهداف با بیشترین نیاز به اعتمادپروکسی چرخشیپروکسی موبایلبه‌ازای گیگابایت
جریان‌هایی که به ورود یا رصد نشست نیاز دارندپروکسی با نشست ثابتپروکسی مسکونیبه‌ازای گیگابایت

خزنده واقعاً چه فرقی با اسکرپینگ یک‌باره دارد؟

استخراج داده معمولاً صفحات را از فهرستی شناخته می‌گیرد، یک بار یا طبق برنامه‌ای ثابت. کار خزنده متفاوت است: دنبال کردن یک sitemap.xml از ابتدا تا انتها برای کشف صدها هزار صفحه، یا یافتن و صف کردن خودکار صفحات محصول جدیدی که یک سایت تجارت الکترونیک هر روز می‌افزاید؛ جریانی پیوسته و زمان‌بندی‌شده.

در آن مقیاس یک IP هرگز کافی نیست؛ خزنده‌ای که می‌کوشد نقشه سایتی با 500,000 صفحه را روزی یک بار تازه کند ده‌ها هزار درخواست در ساعت می‌فرستد و سرور هدف آن را ترافیک غیرعادی از یک منبع می‌بیند. فهرست‌سازی موتورهای جستجو دقیقاً بر همین اصل بنا شده است: استخرهای IP گسترده و زمان‌بندی توزیع‌شده درخواست‌ها.

هنگام ساخت خزنده خودتان همین اصل برقرار است: در مرحله کشف از پروکسی چرخشی استفاده کنید تا هر درخواست از IP متفاوتی خارج شود، و وقتی باید یک زیربخش مشخص را با هویتی پایدار دنبال کنید به پروکسی با نشست ثابت بروید؛ به این ترتیب با robots.txt منطبق می‌مانید و خزش زمان‌بندی‌شده شما بی‌وقفه ادامه می‌یابد.

مقایسه اسکرپر داده و خزنده وب
اسکرپر دادهخزنده وب
فهرست هدفثابت و از پیش شناختهبا دنبال کردن لینک‌ها خودش گسترش می‌یابد
تمرکزاستخراج فیلدهای مشخص (قیمت، موجودی، عنوان)کشف نظام‌مند؛ معمولاً همراه با استخراج داده
نمونهپیگیری قیمت یک محصولفهرست‌سازی موتور جستجو، کشف نقشه سایت
مراحل راه‌اندازی و مرزها

خزنده وب چگونه کار می‌کند؟

حلقه آدرس آغازین ← خزش ← تجزیه ← ذخیره که هنگام ساخت یک جریان خزش از صفر دنبال می‌کنید:

  1. تعریف آدرس‌های آغازین و دامنه: یک یا چند آدرس آغازینی را که خزنده از آن‌ها شروع می‌کند تعریف کنید، همراه با اینکه کدام دامنه‌ها و زیرمسیرها در دامنه کار شما قرار می‌گیرند. در همین مرحله فایل robots.txt سایت هدف را بخوانید و مسیرهایی را که خزش آن‌ها مجاز نیست (Disallow) مشخص کنید.
  2. خزش: دریافت صفحات و صف کردن لینک‌ها: خزنده آدرس آغازین را با یک درخواست HTTP دریافت می‌کند، لینک‌های داخلی‌ای را که می‌یابد به صف می‌افزاید و فرایند را برای هر آدرس آن صف تکرار می‌کند. تأخیر ادب (مکث میان درخواست‌ها) و تعداد درخواست همزمان اینجا تنظیم می‌شوند؛ تنظیمات بیش از حد تهاجمی روی یک IP مسدودسازی سریع به همراه دارد، و به همین دلیل ترافیک باید در استخر پروکسی توزیع شود.
  3. تجزیه: شکستن HTML: HTML دانلودشده تجزیه می‌شود: لینک‌های جدید برای پیوستن به صف استخراج می‌شوند و اگر نیاز دارید، فیلدهایی مانند عنوان، متاتگ‌ها یا محتوای بدنه در همین مرحله بیرون کشیده می‌شوند. صفحات رندرشده با JavaScript پیش از این مرحله به مرورگر بدون رابط نیاز دارند.
  4. ذخیره: نگهداری نتایج و حذف آدرس‌های تکراری: داده تجزیه‌شده در پایگاه داده یا فایل نوشته می‌شود و آدرس‌های بازدیدشده علامت می‌خورند تا یک صفحه هرگز دو بار خزیده نشود. منطق عقب‌نشینی و تلاش مجدد برای پاسخ‌های 429 و 403، همراه با محدودیت‌های دامنه و عمق خزش، در همین مرحله وارد کار می‌شوند.
settings.pyScrapy — هدایت خزش به دروازه Proxynet
DOWNLOADER_MIDDLEWARES = {"myproject.middlewares.ProxynetProxy": 100}
CONCURRENT_REQUESTS_PER_DOMAIN = 50
DOWNLOAD_DELAY = 0.5  # seconds

چه چیزی نیست

  • ابزاری برای جمع‌آوری داده‌های شخصی مشمول GDPR، KVKK یا مقررات مشابه نیست.
  • روشی برای دسترسی بدون مجوز به بخش‌های نیازمند ورود یا خصوصی نیست.
  • راهی برای خزیدن مسیرهایی که robots.txt صراحتاً ممنوع کرده نیست؛ دامنه کار باید با آن قواعد همخوان بماند.

پروکسی به‌تنهایی کافی نیست

  • تنظیمات تأخیر ادب و عمق خزش در منطق خزنده خودتان می‌ماند؛ پروکسی فقط منبع IP را حل می‌کند.
  • اثر انگشت مرورگر (canvas، WebGL، سازگاری user-agent) باید جداگانه مدیریت شود.
  • سایت‌هایی که به رندر JavaScript نیاز دارند مرورگر بدون رابط می‌خواهند؛ پروکسی فقط لایه شبکه را حل می‌کند.
موارد استفاده

موارد استفاده خزنده وب در صنایع

از ممیزی‌های سئو و پیمایش کاتالوگ تجارت الکترونیک تا پیگیری داده‌های مالی و حفاظت از برند؛ حوزه‌هایی که خزنده‌های وب پیش می‌برند.

هر صفحه یک سایت را به‌طور نظام‌مند بپیمایید و لینک‌های شکسته، متاتگ‌های گمشده و مشکلات فهرست‌پذیری را دقیقاً همان‌طور که بات‌های موتور جستجو می‌بینند آشکار کنید.

از صفحات دسته‌بندی یک فروشگاه شروع کنید و لینک‌ها را تا هر صفحه محصول دنبال کنید و هزاران SKU را در یک چرخه خزش کشف کنید.

صفحات کاتالوگ را در فواصل منظم دوباره بخزید تا تغییرات قیمت، موجودی و کمپین را از IPهای موقعیت واقعی رصد کنید.

ساختار کامل صفحات یک رقیب، تنوع محصولات و تفاوت‌های محتوای منطقه‌ای را با خزنده به‌طور نظام‌مند نقشه‌برداری کنید.

وب را در مقیاس بزرگ بخزید تا فروشندگان کالای تقلبی و سایت‌های کلاهبرداری را که از نام برند، لوگو یا عکس محصولات شما سوءاستفاده می‌کنند بیابید.

سایت‌های عمومی بازار و خبری را در فواصل منظم بخزید تا داده قیمت، اطلاعیه و شرکت‌ها را بی‌درنگ جمع‌آوری کنید.

مشتریان چه می‌گویند

امتیاز 4.4 از 5 — «عالی» در Trustpilot.

Trustpilot

پشتیبانی و کیفیت پروکسی

وقتی کیفیت پروکسی‌هایی که می‌فروشند را همراه با پشتیبانی پیش و پس از فروش در نظر بگیرید، می‌توانم بگویم جزو بهترین‌های بازار هستند. می‌خواهم مدت‌ها با آن‌ها کار کنم؛ سپاسگزارم.
Ç

Çağlar

Trustpilot · 5.0 از 5 · اوت 2022

Trustpilot

یکی از بهترین تیم‌های پشتیبانی که خواهید دید

از پروکسی شرکت دیگری استفاده می‌کردم و نمی‌توانستم پشتیبانی بگیرم. پیش از خرید در proxynet.io ثبت‌نام کرده بودم؛ وقتی روز شنبه ایمیلی از خدمات مشتریان رسید، تصمیم گرفتم امتحان کنم. تا اینجا می‌توانم بگویم پاسخ‌های سریع و رویکرد حل مسئله‌شان واقعاً مرا تحت تأثیر قرار داد.
خواندن در Trustpilot
K

Kemal

Trustpilot · 5.0 از 5 · سپتامبر 2023

Trustpilot

پشتیبانی فنی سریع است، پروکسی‌های ISP کار می‌کنند

پشتیبانی فنی سریع است. از پروکسی‌های ISP خیلی راضی بودم؛ می‌توانید قیمت‌ها را کمی مناسب‌تر کنید، موبایل متأسفانه گران است، اما سرعت ISP و کیفیت زیرشبکه‌ها قوی است.
خواندن در Trustpilot
A

Andre James

Trustpilot · 5.0 از 5 · دسامبر 2023

سؤالات متداول.
هر آنچه باید درباره خزنده‌های وب بدانید.

پرسش دیگری دارید یا به زیرساخت خزش با حجم بالا نیاز دارید؟ تیم متخصص ما 24/7 در دسترس است.

خزنده وب باتی است که از یک یا چند آدرس آغازین شروع می‌کند و با دنبال کردن لینک‌هایی که در هر صفحه می‌یابد به‌طور نظام‌مند در سایت‌ها حرکت می‌کند. حلقه همیشه یکسان است: آدرس آغازین ← خزش (دریافت صفحه) ← تجزیه (شکستن HTML و بیرون کشیدن لینک‌ها و داده‌های جدید) ← ذخیره (نگهداری نتیجه)؛ هر لینک جدیدی که کشف می‌کند به صف افزوده می‌شود و همان چرخه تکرار می‌شود.