اسکرپینگ وب یعنی خواندن دادههای عمومی از صفحههای وب، ذخیره آنها و ساختن مجموعه داده. این کار معمولاً مجاز است، اما مرزهایی دارد و آن مرزها جایی نیستند که بسیاری گمان میکنند.
اسکرپینگ وب چیست؟
صفحه وب به شکل HTML میرسد. در اسکرپینگ، برنامهای این HTML را میخواند، فیلدهای مورد نظر را بیرون میکشد و آنها را در قالبی قابل استفاده ذخیره میکند: JSON یا CSV یا یک پایگاه داده. از نظر فنی چیز دیگری رخ نمیدهد؛ پرسش حقوقی به خواندن مربوط نیست، به خود داده و استفاده بعدی از آن مربوط است.
مرز اصلی کجاست؟
گردآوری دادههایی که عموم به آن دسترسی دارند، در اصل مجاز است. چهار چیز این وضع را عوض میکند:
- داده پشت ورود به حساب. آنچه تنها پس از ورود دیده میشود عمومی نیست، هر قدر هم ساختن حساب آسان باشد.
- دادههای شخصی. قواعد خودشان را دارند؛ پایینتر میبینید.
- محتوای دارای حق نشر. متن، تصویر، نشان تجاری و مطالب تحریریه را نمیتوان همینطور برداشت و بازنشر کرد.
- شرایط استفاده سایت. بسیاری از پورتالها و بازارگاههای بزرگ، دسترسی خودکار را صریحاً ممنوع کردهاند. خواندن شرایط و فایل
robots.txtدر آغاز پروژه جای دارد، نه در پایان آن.
خلاصهاش این است: مجاز بودن گردآوری هنوز چیزی درباره اینکه بعد از آن چه میتوانید با داده بکنید نمیگوید.
وضع در حوزههای قضایی مختلف
ایالات متحده
دادگاههای آمریکا بارها رأی دادهاند که دادههای در دسترس عموم را میتوان آزادانه گردآوری کرد. مرزها را قانون تقلب و سوءاستفاده رایانهای (CFAA)، قانون حق نشر و مقررات حریم خصوصی مانند قانون حریم خصوصی مصرفکننده کالیفرنیا (CCPA) تعیین میکنند. آنچه پشت ورود به حساب است «عمومی» شمرده نمیشود.
اتحادیه اروپا
مشابه است: دادههای در دسترس عموم را میتوان گردآوری کرد، مشروط به اینکه مقررات عمومی حفاظت از داده (GDPR)، دستورالعمل پایگاه داده و دستورالعمل حق نشر در بازار واحد دیجیتال نقض نشوند.
بریتانیا
همان اصل برقرار است. باید قانون حفاظت از داده، قانون حق نشر و طرحها و اختراعات و قانون سوءاستفاده رایانهای را در نظر داشت و باز هم: نه داده پشت ورود، نه داده شخصی بدون مبنای موجه، نه محتوای محافظتشده.
ترکیه
قانون ویژهای درباره اسکرپینگ وجود ندارد و اصل کلی با اتحادیه اروپا و آمریکا و بریتانیا یکی است. آنجا دو نکته اهمیت ویژه دارد: شرایط استفاده سایت مقصد الزامآور است — چند پورتال بزرگ ترکیهای دسترسی خودکار را صریحاً ممنوع کردهاند — و باری که ایجاد میکنید میتواند خودش مشکلساز شود. کسی که سایتی را چنان زیر فشار درخواست بگذارد که کارکردش آسیب ببیند، فارغ از داده، وارد قلمرو کیفری میشود.
دادههای شخصی
مدتها تقریباً هیچکس به دادههای شخصی اهمیت نمیداد. امروز در اتحادیه اروپا و کالیفرنیا و بسیاری از حوزههای دیگر عکس این است. اگر چنین دادههایی گردآوری میکنید، راه فراری از GDPR و CCPA ندارید.
GDPR داده شخصی را چنین تعریف میکند: «هر اطلاعاتی که به یک شخص حقیقیِ شناساییشده یا قابل شناسایی مربوط باشد». این تعریف عمداً گسترده است. چند نمونه:
- مشخصات فرد: نام و نام خانوادگی، تاریخ تولد، نشانی، شماره شناسایی و بیمه، اطلاعات شغلی
- اطلاعات تماس: شماره تلفن، نشانی ایمیل، آدرس IP، حسابهای شبکههای اجتماعی
- دادههایی که برنامهها جمع میکنند: موقعیت از راه نشانی یا GPS، عادتهای خرید، دادههای رفتاری
- ضبط صدا و تصویر و دادههای زیستسنجی
- دستههای ویژه: جنسیت و گرایش جنسی، خاستگاه قومی، باورهای دینی، دیدگاههای سیاسی، دادههای سلامت
عملاً هر دادهای که بتوان به فردی مشخص نسبت داد در همین دسته میگنجد. در صورت تردید، فرض را بر شخصی بودن داده بگذارید.
دادگاهها چه گفتهاند؟
پلتفرمهای بزرگ بارها علیه سرویسهای اسکرپینگ اقدام کردهاند. یک پرونده پرسروصدا: Meta از Bright Data به دلیل گردآوری داده از Facebook و Instagram شکایت کرد و بازنده شد.
دادگاه چنین یافت که Meta نتوانسته است ثابت کند داده غیرعمومی گردآوری شده باشد، یعنی دادهای که پشت ورود به حساب یا محافظتشده با رمز است. برای گردآوری دادههای کاربری که بهصورت عمومی دیده میشوند، نه دسترسی غیرمجاز و نه نقض شرایط استفاده را بهقدر کافی اثباتشده ندانست.

خط جداکننده روشن است: گردآوری دادههایی که عموم میبینند، پشتوانه رأی دادگاههای آمریکا را دارد. ساختن حساب برای رسیدن به محتوایی که فقط به کاربران واردشده نشان داده میشود، ندارد.
جمعبندی
آیا اسکرپینگ وب قانونی است؟ بهطور کلی بله، با همان مرزهایی که گفته شد. سه چیز را رعایت کنید تا بیشتر مشکلها اصلاً پیش نیایند:
- به آنچه بدون ورود به حساب دیده میشود بسنده کنید.
- پیش از شروع، شرایط استفاده و فایل
robots.txtرا بخوانید. - سایت مقصد را بیش از اندازه زیر بار نبرید؛ درخواستها را پخش کنید و سرعت را پایین نگه دارید.
بند سوم بخشی فنی هم دارد: با پروکسی درخواستها میان چند آدرس پخش میشوند، بهجای اینکه یک سایت از یک IP زیر فشار برود. این فقط مسئله نرخ موفقیت نیست، رعایت حال طرف مقابل هم هست.




