ProxynetProxynet

آیا اسکرپینگ وب قانونی است؟ یک نمای کلی

تاریخ انتشار:

5 دقیقه مطالعه

Acar Diveroli
نویسنده: Acar Diveroli
آیا اسکرپینگ وب قانونی است؟

اسکرپینگ وب یعنی خواندن داده‌های عمومی از صفحه‌های وب، ذخیره آن‌ها و ساختن مجموعه داده. این کار معمولاً مجاز است، اما مرزهایی دارد و آن مرزها جایی نیستند که بسیاری گمان می‌کنند.

اسکرپینگ وب چیست؟

صفحه وب به شکل HTML می‌رسد. در اسکرپینگ، برنامه‌ای این HTML را می‌خواند، فیلدهای مورد نظر را بیرون می‌کشد و آن‌ها را در قالبی قابل استفاده ذخیره می‌کند: JSON یا CSV یا یک پایگاه داده. از نظر فنی چیز دیگری رخ نمی‌دهد؛ پرسش حقوقی به خواندن مربوط نیست، به خود داده و استفاده بعدی از آن مربوط است.

مرز اصلی کجاست؟

گردآوری داده‌هایی که عموم به آن دسترسی دارند، در اصل مجاز است. چهار چیز این وضع را عوض می‌کند:

  • داده پشت ورود به حساب. آنچه تنها پس از ورود دیده می‌شود عمومی نیست، هر قدر هم ساختن حساب آسان باشد.
  • داده‌های شخصی. قواعد خودشان را دارند؛ پایین‌تر می‌بینید.
  • محتوای دارای حق نشر. متن، تصویر، نشان تجاری و مطالب تحریریه را نمی‌توان همین‌طور برداشت و بازنشر کرد.
  • شرایط استفاده سایت. بسیاری از پورتال‌ها و بازارگاه‌های بزرگ، دسترسی خودکار را صریحاً ممنوع کرده‌اند. خواندن شرایط و فایل robots.txt در آغاز پروژه جای دارد، نه در پایان آن.

خلاصه‌اش این است: مجاز بودن گردآوری هنوز چیزی درباره اینکه بعد از آن چه می‌توانید با داده بکنید نمی‌گوید.

وضع در حوزه‌های قضایی مختلف

ایالات متحده

دادگاه‌های آمریکا بارها رأی داده‌اند که داده‌های در دسترس عموم را می‌توان آزادانه گردآوری کرد. مرزها را قانون تقلب و سوءاستفاده رایانه‌ای (CFAA)، قانون حق نشر و مقررات حریم خصوصی مانند قانون حریم خصوصی مصرف‌کننده کالیفرنیا (CCPA) تعیین می‌کنند. آنچه پشت ورود به حساب است «عمومی» شمرده نمی‌شود.

اتحادیه اروپا

مشابه است: داده‌های در دسترس عموم را می‌توان گردآوری کرد، مشروط به اینکه مقررات عمومی حفاظت از داده (GDPR)، دستورالعمل پایگاه داده و دستورالعمل حق نشر در بازار واحد دیجیتال نقض نشوند.

بریتانیا

همان اصل برقرار است. باید قانون حفاظت از داده، قانون حق نشر و طرح‌ها و اختراعات و قانون سوءاستفاده رایانه‌ای را در نظر داشت و باز هم: نه داده پشت ورود، نه داده شخصی بدون مبنای موجه، نه محتوای محافظت‌شده.

ترکیه

قانون ویژه‌ای درباره اسکرپینگ وجود ندارد و اصل کلی با اتحادیه اروپا و آمریکا و بریتانیا یکی است. آنجا دو نکته اهمیت ویژه دارد: شرایط استفاده سایت مقصد الزام‌آور است — چند پورتال بزرگ ترکیه‌ای دسترسی خودکار را صریحاً ممنوع کرده‌اند — و باری که ایجاد می‌کنید می‌تواند خودش مشکل‌ساز شود. کسی که سایتی را چنان زیر فشار درخواست بگذارد که کارکردش آسیب ببیند، فارغ از داده، وارد قلمرو کیفری می‌شود.

داده‌های شخصی

مدت‌ها تقریباً هیچ‌کس به داده‌های شخصی اهمیت نمی‌داد. امروز در اتحادیه اروپا و کالیفرنیا و بسیاری از حوزه‌های دیگر عکس این است. اگر چنین داده‌هایی گردآوری می‌کنید، راه فراری از GDPR و CCPA ندارید.

GDPR داده شخصی را چنین تعریف می‌کند: «هر اطلاعاتی که به یک شخص حقیقیِ شناسایی‌شده یا قابل شناسایی مربوط باشد». این تعریف عمداً گسترده است. چند نمونه:

  • مشخصات فرد: نام و نام خانوادگی، تاریخ تولد، نشانی، شماره شناسایی و بیمه، اطلاعات شغلی
  • اطلاعات تماس: شماره تلفن، نشانی ایمیل، آدرس IP، حساب‌های شبکه‌های اجتماعی
  • داده‌هایی که برنامه‌ها جمع می‌کنند: موقعیت از راه نشانی یا GPS، عادت‌های خرید، داده‌های رفتاری
  • ضبط صدا و تصویر و داده‌های زیست‌سنجی
  • دسته‌های ویژه: جنسیت و گرایش جنسی، خاستگاه قومی، باورهای دینی، دیدگاه‌های سیاسی، داده‌های سلامت

عملاً هر داده‌ای که بتوان به فردی مشخص نسبت داد در همین دسته می‌گنجد. در صورت تردید، فرض را بر شخصی بودن داده بگذارید.

دادگاه‌ها چه گفته‌اند؟

پلتفرم‌های بزرگ بارها علیه سرویس‌های اسکرپینگ اقدام کرده‌اند. یک پرونده پرسر‌وصدا: Meta از Bright Data به دلیل گردآوری داده از Facebook و Instagram شکایت کرد و بازنده شد.

دادگاه چنین یافت که Meta نتوانسته است ثابت کند داده غیرعمومی گردآوری شده باشد، یعنی داده‌ای که پشت ورود به حساب یا محافظت‌شده با رمز است. برای گردآوری داده‌های کاربری که به‌صورت عمومی دیده می‌شوند، نه دسترسی غیرمجاز و نه نقض شرایط استفاده را به‌قدر کافی اثبات‌شده ندانست.

دعاوی حقوقی درباره اسکرپینگ وب

خط جداکننده روشن است: گردآوری داده‌هایی که عموم می‌بینند، پشتوانه رأی دادگاه‌های آمریکا را دارد. ساختن حساب برای رسیدن به محتوایی که فقط به کاربران واردشده نشان داده می‌شود، ندارد.

جمع‌بندی

آیا اسکرپینگ وب قانونی است؟ به‌طور کلی بله، با همان مرزهایی که گفته شد. سه چیز را رعایت کنید تا بیشتر مشکل‌ها اصلاً پیش نیایند:

  1. به آنچه بدون ورود به حساب دیده می‌شود بسنده کنید.
  2. پیش از شروع، شرایط استفاده و فایل robots.txt را بخوانید.
  3. سایت مقصد را بیش از اندازه زیر بار نبرید؛ درخواست‌ها را پخش کنید و سرعت را پایین نگه دارید.

بند سوم بخشی فنی هم دارد: با پروکسی درخواست‌ها میان چند آدرس پخش می‌شوند، به‌جای اینکه یک سایت از یک IP زیر فشار برود. این فقط مسئله نرخ موفقیت نیست، رعایت حال طرف مقابل هم هست.

پرسش از ChatGPTپرسش از Claude