وب اسکرپینگ · وبلاگ Proxynet – صفحه 4

  1. تاریخ انتشار

    نشست و کوکی در Python: ورود با requests

    requests.Session کوکی‌ها را میان درخواست‌ها می‌برد و نشست را باز نگه می‌دارد. خواندن توکن CSRF از فرم، تأیید ورود و ذخیره نشست را نشان می‌دهیم.

    نویسنده: Acar Diveroli
  2. تاریخ انتشار

    Scrapy چیست و چگونه با پروکسی استفاده می‌شود؟

    در Scrapy پروکسی با فیلد meta درخواست یا با یک میان‌افزار تعریف می‌شود. نصب، احراز هویت، تنظیم AutoThrottle و چرخش IP را همراه با کد توضیح می‌دهیم.

    نویسنده: Acar Diveroli
  3. تاریخ انتشار

    اثر انگشت TLS و ⁦JA3⁩ چیست و چگونه کار می‌کند؟

    اثر انگشت TLS شناسه‌ای است که از فهرست رمزها و افزونه‌های پیام ClientHello ساخته می‌شود؛ محاسبه ⁦JA3⁩ و ⁦JA4⁩ و نقش پروکسی را توضیح می‌دهیم.

    نویسنده: Acar Diveroli
  4. تاریخ انتشار

    چرا سایت‌ها عامل‌های خرید هوش مصنوعی را مسدود می‌کنند؟

    عامل‌های خرید به محافظت ربات برمی‌خورند چون سایت نمی‌تواند انسان را از عامل مجاز تشخیص دهد. علت و راه‌حل‌های تازه مانند عامل امضاشده را توضیح می‌دهیم.

    نویسنده: Acar Diveroli
  5. تاریخ انتشار

    همروندی و موازی‌سازی در وب اسکرپینگ

    همروندی از زمان انتظار و موازی‌سازی از توان پردازنده بهره می‌گیرد. توضیح می‌دهیم کدام سرعت اسکرپینگ را بالا می‌برد، با نمونه‌هایی در پایتون و Node.js.

    نویسنده: Acar Diveroli
  6. تاریخ انتشار

    انتخابگر CSS یا XPath: کدام برای اسکرپینگ؟

    انتخابگر CSS کوتاه و خواناست و XPath می‌تواند بر اساس متن و عنصر والد هم انتخاب کند. نحو، سرعت و نمونه‌های پایتون هر دو روش را مقایسه می‌کنیم.

    نویسنده: Acar Diveroli
  7. تاریخ انتشار

    اسکرپینگ وب با ⁦GPT-6 Astra⁩: چه چیزی تغییر کرد؟

    ⁦GPT-6 Astra⁩ خواندن صفحه و مدیریت مرورگر را قوی‌تر می‌کند، اما مسدودسازی، CAPTCHA و محدودیت درخواست را حل نمی‌کند؛ جای واقعی مدل را نشان می‌دهیم.

    نویسنده: Acar Diveroli
  8. تاریخ انتشار

    تله‌های هانی‌پات چیست و چه اثری بر اسکرپینگ دارد؟

    هانی‌پات پیوند پنهانی است که بازدیدکنندگان نمی‌بینند اما ربات‌ها در آن گیر می‌افتند. سازوکار آن را بدون آموزش دور زدن توضیح می‌دهیم.

    نویسنده: Acar Diveroli
  9. تاریخ انتشار

    کدهای وضعیت HTTP در وب اسکرپینگ: 403، 407، 429، 503

    پاسخ‌های 403، 407، 429 و 503 در اسکرپینگ به مشکلات متفاوتی اشاره دارند. معنا و علت هر کد و شیوه درست تلاش دوباره با Retry-After را توضیح می‌دهیم.

    نویسنده: Acar Diveroli
  10. تاریخ انتشار

    مقایسه HTTPX، Requests و AIOHTTP

    Requests ساده و همگام است، AIOHTTP ناهمگام است و HTTPX هر دو حالت را دارد. استفاده از پروکسی، کارایی و انتخاب مناسب برای هر پروژه را با کد نشان می‌دهیم.

    نویسنده: Acar Diveroli
  11. تاریخ انتشار

    Puppeteer و CAPTCHA: چرا ظاهر می‌شود و چگونه کم می‌شود؟

    در Puppeteer کپچا اغلب به دلیل اعتبار IP، سرعت درخواست‌ها و ردپای مرورگر بدون رابط فعال می‌شود. علت‌ها و راه‌های مشروع کاهش آن را توضیح می‌دهیم.

    نویسنده: Acar Diveroli
  12. تاریخ انتشار

    فایل robots.txt چیست و چگونه آن را بخوانیم؟

    robots.txt فایلی است که سایت در آن به ربات‌ها می‌گوید کدام مسیرها را نخزند. قواعد Disallow، Allow و Crawl-delay و خواندن آن با پایتون را توضیح می‌دهیم.

    نویسنده: Acar Diveroli
  1. نشست و کوکی در Python: ورود با requests

    آموزش‌ها

    تاریخ انتشار

  2. Scrapy چیست و چگونه با پروکسی استفاده می‌شود؟

    وب اسکرپینگ

    تاریخ انتشار

  3. اثر انگشت TLS و ⁦JA3⁩ چیست و چگونه کار می‌کند؟

    وب اسکرپینگ

    تاریخ انتشار

  4. چرا سایت‌ها عامل‌های خرید هوش مصنوعی را مسدود می‌کنند؟

    هوش مصنوعی

    تاریخ انتشار

  5. همروندی و موازی‌سازی در وب اسکرپینگ

    مقایسه

    تاریخ انتشار

  6. انتخابگر CSS یا XPath: کدام برای اسکرپینگ؟

    مقایسه

    تاریخ انتشار

  7. اسکرپینگ وب با ⁦GPT-6 Astra⁩: چه چیزی تغییر کرد؟

    هوش مصنوعی

    تاریخ انتشار

  8. تله‌های هانی‌پات چیست و چه اثری بر اسکرپینگ دارد؟

    وب اسکرپینگ

    تاریخ انتشار

  9. کدهای وضعیت HTTP در وب اسکرپینگ: 403، 407، 429، 503

    وب اسکرپینگ

    تاریخ انتشار

  10. مقایسه HTTPX، Requests و AIOHTTP

    مقایسه

    تاریخ انتشار

  11. Puppeteer و CAPTCHA: چرا ظاهر می‌شود و چگونه کم می‌شود؟

    آموزش‌ها

    تاریخ انتشار

  12. فایل robots.txt چیست و چگونه آن را بخوانیم؟

    وب اسکرپینگ

    تاریخ انتشار