ProxynetProxynet

داده‌های جایگزین چیست؟ منابع، کاربردها و ریسک‌ها

تاریخ انتشار:

15 دقیقه مطالعه

Acar Diveroli
نویسنده: Acar Diveroli
پنج منبع داده از ماهواره تا تلفن همراه، هر یک کنار یک کارت نمودار؛ مرورگر قیمت‌های وب با رنگ آبی می‌درخشد

یک خرده‌فروش شش هفته دیگر فروش فصلی خود را اعلام می‌کند. پیش از آن، یک تحلیلگر می‌تواند بشمارد چند محصول در سایت این شرکت ناموجود شده‌اند، چند مدیر فروشگاه استخدام می‌کند و آیا نظرهای مشتریان درباره خط محصول تازه‌اش بدتر می‌شود یا نه. هیچ‌یک از این اعداد از گزارش‌های رسمی خود شرکت نمی‌آید، اما کنار هم چیزی درباره آن فصل می‌گویند. دنیای مالی به چنین اطلاعاتی داده‌های جایگزین می‌گوید.

این نوشته توضیح می‌دهد داده‌های جایگزین چیست و از کجا می‌آید: داده‌های وب، پنل‌های تراکنش کارت، تصاویر ماهواره‌ای، میزان استفاده از اپلیکیشن‌ها و احساسات کاربران (sentiment). سپس یک مجموعه داده را از گردآوری تا تصمیم دنبال می‌کند، به انطباق با مقررات و کیفیت داده می‌پردازد، جایگاه وب اسکرپینگ را نشان می‌دهد و ساختن را با خریدن مقایسه می‌کند. هیچ بخشی از این نوشته توصیه سرمایه‌گذاری نیست؛ موضوع داده است، نه اینکه چه معامله‌ای انجام دهید.

داده‌های جایگزین چیست؟

داده‌های جایگزین هر مجموعه داده‌ای است که به توضیح یک شرکت، یک صنعت یا اقتصاد کمک می‌کند اما بیرون از مجموعه سنتی ورودی‌ها قرار دارد. مجموعه سنتی شامل صورت‌های مالی حسابرسی‌شده، گزارش‌های الزامی به نهاد ناظر، جلسه‌های اعلام نتایج مالی، اطلاعیه‌های مطبوعاتی، آمار رسمی و قیمت‌های بازار است؛ هر چیز دیگری که سیگنال مفیدی داشته باشد «جایگزین» به شمار می‌آید.

کمیسیون بورس و اوراق بهادار ایالات متحده (SEC) در یک هشدار ریسک در سال 2022 درباره انطباق با مقررات MNPI تعریفی کاربردی ارائه می‌دهد. نمونه‌های آن شامل تصاویر ماهواره‌ای و پهپادی از مزارع و پارکینگ‌ها، تراکنش‌های تجمیعی کارت اعتباری، داده‌های شبکه‌های اجتماعی و جست‌وجو، موقعیت مکانی تلفن‌های همراه و داده‌های ایمیل از اپلیکیشن‌های مصرف‌کننده است. همان پانویس می‌افزاید که داده‌های جایگزین «لزوماً MNPI در بر ندارد»؛ نکته‌ای که در ادامه همین نوشته به آن برمی‌گردیم.

این اصطلاح از دنیای سرمایه‌گذاری آمده است، جایی که صندوق‌های پوشش ریسک نخستین خریداران بزرگ بودند؛ امروز وام‌دهندگان، خرده‌فروشان، شرکت‌های مشاوره و اقتصاددانان نیز از همین مجموعه داده‌ها استفاده می‌کنند.

انواع اصلی داده‌های جایگزین کدام‌اند؟

دسته‌ها با هم هم‌پوشانی دارند، اما بیشتر مجموعه داده‌ها در یکی از این گروه‌ها جای می‌گیرند:

  • داده‌های وب. قیمت و موجودی در فروشگاه‌های اینترنتی، کاتالوگ محصولات، آگهی‌های شغلی، صفحه‌های معرفی کارکنان شرکت‌ها، صفحه‌های یافتن شعبه، رتبه‌بندی فروشگاه‌های اپلیکیشن، آگهی‌های املاک و نظرها. این داده‌ها عمومی و تازه‌اند و گردآوری‌شان از انواع دیگر ارزان‌تر است.
  • داده‌های تراکنش. خریدهای تجمیعی و بی‌نام‌شده از صادرکنندگان کارت، پردازشگرهای پرداخت یا اپلیکیشن‌های رسید. این داده‌ها هزینه‌کرد را به تفکیک فروشگاه یا برند نشان می‌دهند، معمولاً از طریق پنلی از مصرف‌کنندگان و نه کل بازار.
  • داده‌های مکانی. تصاویر ماهواره‌ای و هوایی (پارکینگ‌ها، مخازن نفت، مزارع، کشتیرانی) و شمار مراجعه حضوری (foot traffic) که از سیگنال‌های موقعیت تلفن همراه به دست می‌آید.
  • استفاده از اپلیکیشن و وب. برآورد دانلود و کاربران فعال اپلیکیشن‌های موبایل، برآورد ترافیک وب‌سایت‌ها و روند حجم جست‌وجو.
  • داده‌های احساسات و متن. پست‌های شبکه‌های اجتماعی، اخبار، نظرهای محصول، رشته‌بحث‌های انجمن‌ها و متن جلسه‌های اعلام نتایج مالی که به امتیاز یا موضوع تبدیل می‌شوند. ⁨CFA Institute⁩ در مقاله خود درباره کاربرد NLP روی داده‌های جایگزین یادآوری می‌کند که بخش بزرگی از این مواد متن بدون ساختار است و پیش از استفاده باید پردازش شود.

داده‌های جایگزین چگونه به سیگنالی قابل‌استفاده تبدیل می‌شود؟

مسیر از منبع تا تصمیم معمولاً شش گام دارد:

  1. پرسش را تعریف کنید. «آیا فروش خرده‌فروش X سریع‌تر از سال گذشته رشد می‌کند؟» یک پرسش است؛ «گردآوری همه چیز درباره خرده‌فروش X» پرسش نیست.
  2. منبع را پیدا و ارزیابی کنید. بررسی کنید مالک داده کیست، داده چگونه و با چه شرایطی گردآوری شده و آیا اجازه دارید آن را برای این هدف به کار ببرید. برای داده‌های اسکرپ‌شده این یعنی شرایط استفاده سایت و robots.txt؛ برای فروشنده داده یعنی پرسش‌نامه بررسی دقیق (due diligence).
  3. گردآوری کنید. صفحه‌های عمومی را اسکرپ کنید، یک API رسمی را فراخوانی کنید، فایل‌ها را از فروشنده بگیرید یا فید یک شریک را دریافت کنید. گردآوری طبق زمان‌بندی اجرا می‌شود، چون یک تصویر لحظه‌ای هیچ چیزی درباره تغییر نشان نمی‌دهد.
  4. پاک‌سازی و ادغام کنید. موارد تکراری را حذف کنید، نوع داده‌ها و واحدهای پول را اصلاح کنید و نام محصولات و نشانی فروشگاه‌ها را به شرکت و نماد معاملاتی درست نسبت دهید.
  5. شاخص را بسازید و بیازمایید. ردیف‌ها را به یک سری تبدیل کنید، مثلاً شمار هفتگی کالاهای تخفیف‌خورده، و آن را با ارقام گزارش‌شده گذشته مقایسه کنید. سری‌ای که هیچ‌گاه با اعداد گزارش‌شده همراه نبوده، نویز است.
  6. پایش کنید. منابع تغییر می‌کنند: سایتی صفحه‌هایش را از نو طراحی می‌کند، پنل یک فروشنده اعضایش را از دست می‌دهد، اپلیکیشنی صفحه خود را در فروشگاه عوض می‌کند.

گام‌های 3 و 4 در عمل همان کار ETL است: استخراج، تبدیل، بارگذاری. نوشته ETL چیست؟ چنین خط لوله‌ای را با داده‌های اسکرپ‌شده گام‌به‌گام شرح می‌دهد.

مقایسه انواع داده‌های جایگزین

نوعچه چیزی را می‌سنجدروش رایج گردآوریتازگیریسک اصلی
قیمت و موجودی در وبقیمت‌گذاری، تخفیف، موجود بودناسکرپینگ صفحه‌های عمومی محصولچند ساعت تا چند روزتغییر صفحه اسکرپر را از کار می‌اندازد
آگهی‌های شغلیبرنامه استخدام به تفکیک سمت و مکاناسکرپینگ صفحه‌های فرصت شغلی و سایت‌های کاریابیچند روزآگهی‌های تکراری و کهنه
نظرها و پست‌های اجتماعیاحساسات، مشکلات محصولاسکرپینگ، APIهای رسمیچند ساعتربات‌ها، طعنه، نمونه‌های کوچک
پنل‌های تراکنش کارتهزینه‌کرد مصرف‌کننده به تفکیک فروشگاهخرید مجوز از فروشندگانچند روز تا چند هفتهسوگیری پنل، داده شخصی
تصاویر ماهواره‌ایفعالیت فیزیکی (خودرو، مخزن، مزرعه)تصاویر دارای مجوز به‌همراه تحلیل تصویرچند روزابر، هزینه، تفسیر
مراجعه حضوری (foot traffic)بازدید از فروشگاه‌ها و اماکنپنل‌های موقعیت تلفن همراه از طریق فروشندگانچند روزرضایت کاربر و حریم خصوصی
برآورد استفاده از اپلیکیشندانلود، کاربران فعالمدل‌های فروشندگان، داده فروشگاه‌های اپلیکیشنچند روزمدل‌های مبهم، کیفیت منبع

داده‌های وب تنها نوعی است که یک تیم می‌تواند خودش گردآوری کند؛ داده‌های کارت، موقعیت و اپلیکیشن تقریباً همیشه از فروشنده می‌آید و همین هم هزینه و هم کار انطباق با مقررات را شکل می‌دهد.

آیا استفاده از داده‌های جایگزین قانونی است؟

استفاده از داده‌های جایگزین به‌طور کلی قانونی است؛ آنچه اهمیت دارد این است که مجموعه داده چگونه به دست آمده و آیا اطلاعاتی در بر دارد که نباید بر پایه آن معامله کرد.

اطلاعات مهم غیرعمومی (MNPI). MNPI کوتاه‌شده عبارت انگلیسی material nonpublic information است: اطلاعاتی مهم که هنوز عمومی نشده و می‌تواند بر قیمت یک اوراق بهادار اثر بگذارد. در ایالات متحده، مشاوران سرمایه‌گذاری باید سیاست‌های مکتوبی برای جلوگیری از سوءاستفاده از این اطلاعات داشته باشند (⁨Section 204A⁩ از قانون ⁨Investment Advisers Act⁩). در هشدار ریسک سال 2022 که بالاتر به آن اشاره شد، بازرسان SEC گزارش دادند که برخی مشاوران بدون سیاستی که ریسک دریافت MNPI از این راه را پوشش دهد از داده‌های جایگزین استفاده می‌کردند. کارشناسان SEC به این موارد اشاره کردند: بررسی دقیق موردی و بی‌قاعده فروشندگان داده، ارزیابی‌نکردن شرایط و تعهدات حقوقی گردآوری (حتی پس از دیده‌شدن نشانه‌های هشدار)، اعمال‌نشدن بررسی دقیق بر همه منابع و نبود فرایندی برای تکرار آن هنگام تغییر شیوه‌های گردآوری.

گزارش نادرست درباره منشأ داده. در سپتامبر 2021، SEC شرکت ⁨App Annie⁩ و هم‌بنیان‌گذار آن را به تقلب در اوراق بهادار متهم کرد. به گفته SEC، این شرکت به سازندگان اپلیکیشن گفته بود داده‌هایشان پیش از استفاده در مدل آماری تجمیع و بی‌نام می‌شود، اما از داده‌های تجمیع‌نشده برای تنظیم برآوردهایی استفاده می‌کرد که به شرکت‌های معاملاتی می‌فروخت. شرکت پرداخت جریمه‌ای ده میلیون دلاری را پذیرفت و SEC این پرونده را نخستین اقدام اجرایی خود علیه یک ارائه‌دهنده داده‌های جایگزین خواند.

اسکرپینگ و داده‌های شخصی. برای داده‌های وب، پرسش‌ها همان پرسش‌های هر پروژه اسکرپینگ است: آیا صفحه‌ها عمومی‌اند؟ آیا شرایط استفاده سایت دسترسی خودکار را مجاز می‌داند؟ آیا robots.txt از شما می‌خواهد وارد نشوید؟ آیا داده‌ها اطلاعات شخصی مشمول قوانینی مانند GDPR یا KVKK را در بر دارند؟ نوشته آیا وب اسکرپینگ قانونی است؟ تصویر کلی را می‌دهد و داده‌های شخصی در مجموعه‌داده‌های اسکرپ‌شده توضیح می‌دهد چگونه فیلدهای شخصی را کم و از آن‌ها محافظت کنید.

چرا قضاوت درباره کیفیت داده‌های جایگزین دشوار است؟

گزارش‌های رسمی با حسابرسی و استاندارد همراه‌اند؛ داده‌های جایگزین نه، پس خریدار باید خودش آن را بسنجد:

  • پوشش. پنل کارت کسانی را پوشش می‌دهد که از کارت‌های یک صادرکننده یا یک اپلیکیشن رسید استفاده می‌کنند، نه کل جمعیت را. اسکرپر صفحه‌هایی را پوشش می‌دهد که به آن‌ها دسترسی دارد، نه کل کاتالوگ را.
  • سابقه. یک سیگنال برای آزموده‌شدن در برابر نتایج گزارش‌شده به چند سال سابقه نیاز دارد.
  • بقا و تغییرات. فروشگاه‌ها بسته می‌شوند، سایت‌ها کد محصولاتشان را عوض می‌کنند و فروشندگان داده‌های قدیمی را بازنگری می‌کنند.
  • نگاشت. برندها، شرکت‌های تابعه و نام فروشگاه‌ها باید به شرکت درست پیوند داده شوند.
  • فرسایش. وقتی شرکت‌های زیادی یک مجموعه داده را می‌خرند، مزیتی که می‌دهد کم می‌شود. مقاله ⁨CFA Institute⁩ که بالاتر آمد همین نکته را می‌گوید.

وب اسکرپینگ کجای کار است؟

وب اسکرپینگ، یعنی گردآوری خودکار صفحه‌های عمومی وب، راهی است که بیشتر تیم‌ها داده‌های جایگزین خود را با آن می‌سازند. این روش برای پاسخ‌هایی مناسب است که در اینترنت منتشر شده‌اند اما در هزاران صفحه پراکنده‌اند:

دو نکته اینجا اهمیت دارد. نخست، بسیاری از سایت‌ها قیمت، موجودی و آگهی‌های متفاوتی را بسته به کشور نشان می‌دهند؛ پس اسکرپر باید صفحه‌ها را از مکان درست درخواست کند، وگرنه سری داده مناطق را با هم قاطی می‌کند. نشانی‌های پروکسی مسکونی به شما امکان می‌دهند کشور و شهر هدف را برای هر درخواست انتخاب کنید. دوم، اسکرپری که سال‌ها هر روز اجرا می‌شود باید مؤدب باشد: robots.txt را رعایت کنید، نرخ درخواست را پایین نگه دارید، هر جا API رسمی هست از آن استفاده کنید و درخواست‌ها را با تنظیمات پروکسی چرخشی در طول زمان پخش کنید، نه اینکه یک سایت را با رگبار درخواست بزنید. پروکسی‌ها تغییر نمی‌دهند که چه داده‌ای را مجازید گردآوری کنید؛ فقط تعیین می‌کنند درخواست از کدام نشانی شبکه فرستاده شود.

داده‌های جایگزین را بسازید یا بخرید؟

عاملساختن (گردآوری توسط خودتان)خریدن (مجوز از فروشنده)
کنترل بر روشکامل؛ همه گام‌ها را می‌شناسیدمحدود به آنچه فروشنده افشا می‌کند
زمان رسیدن به نخستین دادهچند هفته برای یک اسکرپر کارآمدچند روز پس از قرارداد
سابقهاز روزی که شروع می‌کنیداغلب چند سال داده گذشته
کار مستمرنگهداری هنگام تغییر سایت‌هابررسی دقیق فروشنده، تمدید قرارداد
کار انطباق با مقرراتبررسی منابع و شرایط توسط خودتانبررسی منابع و شرایط فروشنده
انواع داده مناسبداده‌های عمومی وبداده‌های کارت، موقعیت، اپلیکیشن و ماهواره

بیشتر تیم‌ها در نهایت هر دو را دارند: داده فروشندگان برای انواعی که خودشان نمی‌توانند گردآوری کنند و اسکرپرهای خودشان برای داده‌های وبی که در قالب یا کشوری مشخص لازم دارند.

داده‌های جایگزین کجا به کار می‌رود؟

  • پژوهش سرمایه‌گذاری. تحلیلگران از داده‌های وب، کارت و اپلیکیشن برای برآورد فروش پیش از انتشار نتایج استفاده می‌کنند؛ صفحه پروکسی برای امور مالی گردآوری داده برای شرکت‌های مالی را توضیح می‌دهد.
  • تحقیقات بازار. شرکت‌های مشاوره و برندها اندازه دسته‌های کالا را برآورد و سبد محصولات رقبا را دنبال می‌کنند؛ پروکسی برای تحقیقات بازار را ببینید.
  • قیمت‌گذاری خرده‌فروشی. خرده‌فروشان هر روز قیمت‌های خود را با رقبا مقایسه می‌کنند، همان‌طور که در صفحه پایش قیمت آمده است.
  • پژوهش اقتصادی. قیمت‌های آنلاین و آگهی‌های شغلی، تصویری از تورم و تقاضای نیروی کار را زودتر از آمار ماهانه به دست می‌دهند.
  • محصولات داده‌ای. شرکت‌هایی که برای دیگران مجموعه داده می‌سازند به گردآوری در مقیاس بزرگ متکی‌اند؛ کاربردی که پشت پروکسی برای اسکرپینگ داده قرار دارد.

اشتباهات رایج در کار با داده‌های جایگزین

  • شروع از مجموعه داده به‌جای پرسش. مجموعه داده بزرگی که فرضیه‌ای پشتش نیست نمودار تولید می‌کند، نه پاسخ.
  • نادیده‌گرفتن بررسی منبع. ندانستن اینکه فروشنده داده‌اش را چگونه گردآوری کرده، دقیقاً همان خلأیی است که هشدار SEC توصیف می‌کند.
  • قاطی‌کردن مکان‌ها. اسکرپ‌کردن یک سایت جهانی از یک کشور و فرض اینکه قیمت‌ها همه جا یکسان است.
  • اعتماد به بک‌تست (backtest) کوتاه. سیگنالی که روی یک سال آزموده شده ممکن است تصادفی جواب داده باشد.
  • نگه‌داشتن داده شخصی غیرضروری. نام، ایمیل و شناسه کاربر به‌ندرت سیگنالی اضافه می‌کند و همیشه ریسک اضافه می‌کند؛ آن‌ها را همان هنگام گردآوری کنار بگذارید.
  • خرابی بی‌صدای اسکرپرها. تغییر چیدمانی که صفحه‌های خالی برمی‌گرداند، اگر تعداد ردیف‌ها را پایش نکنید، شبیه «فروش به صفر رسید» به نظر می‌رسد.
  • دائمی دانستن سیگنال. منابع تغییر می‌کنند و مزیت‌ها کم‌رنگ می‌شوند؛ هر مجموعه داده را طبق برنامه بازبینی کنید.

راهنمای انتخاب

نیازپیشنهاد
قیمت یا موجودی روزانه از فروشگاه‌های عمومیاسکرپر بسازید؛ از کشور هدف درخواست بفرستید
هزینه‌کرد مصرف‌کننده به تفکیک برندمجوز یک پنل تراکنش را بخرید و منشأ داده‌اش را بررسی کنید
فعالیت فیزیکی در مکان‌هامجوز داده ماهواره‌ای یا مراجعه حضوری را بخرید
روند استخدام به تفکیک شرکتصفحه‌های فرصت شغلی و سایت‌های کاریابی را در چارچوب شرایطشان اسکرپ کنید
احساسات نسبت به برند در طول زماننظرها یا پست‌ها را از طریق API گردآوری و با NLP امتیازدهی کنید
چند سال سابقه، همین حالابخرید؛ اسکرپر نمی‌تواند گذشته را پر کند
سیگنالی که هیچ‌کس دیگر نداردبسازید و روش را برای انطباق با مقررات مستند کنید

پرسش‌های متداول

تفاوت داده‌های جایگزین و داده‌های سنتی چیست؟

داده‌های سنتی چیزهایی است که شرکت‌ها و دولت‌ها به‌صورت رسمی منتشر می‌کنند: صورت‌های مالی، گزارش‌های الزامی، جلسه‌های اعلام نتایج و آمار رسمی. داده‌های جایگزین هر چیز دیگری است که همان کسب‌وکار را توضیح می‌دهد، مانند قیمت‌های وب یا پنل‌های کارت. مرز را منبع تعیین می‌کند، نه قالب.

آیا وب اسکرپینگ منبع داده‌های جایگزین است؟

بله. داده‌های وبِ اسکرپ‌شده (قیمت‌ها، صفحه‌های محصول، آگهی‌های شغلی، نظرها) یکی از رایج‌ترین انواع است و نوعی که تیم‌ها بیش از همه خودشان گردآوری می‌کنند. این داده‌ها باید فقط از صفحه‌های عمومی باشند، از شرایط سایت و robots.txt پیروی کنند و نرخ درخواست پایین بماند.

چه کسانی از داده‌های جایگزین استفاده می‌کنند؟

صندوق‌های پوشش ریسک و شرکت‌های مدیریت دارایی پیشگام بودند. اکنون شرکت‌های سرمایه‌گذاری خصوصی، وام‌دهندگان، خرده‌فروشان، شرکت‌های مشاوره و اقتصاددانان نیز از آن استفاده می‌کنند.

آیا داده‌های جایگزین ممکن است اطلاعات نهانی (insider) در بر داشته باشد؟

ممکن است. SEC یادآوری می‌کند که داده‌های جایگزین لزوماً اطلاعات مهم غیرعمومی در بر ندارد، اما مجموعه داده‌ای که با نقض توافق‌نامه محرمانگی یا شرایط یک سایت گردآوری شده باشد می‌تواند اطلاعاتی داشته باشد که نباید بر پایه آن معامله کرد. به همین دلیل نهادهای ناظر از شرکت‌ها انتظار دارند پیش از استفاده از هر منبع، بررسی کنند چگونه گردآوری شده است.

آیا داده‌های جایگزین همان کلان‌داده است؟

خیر. کلان‌داده (big data) حجم و روش‌های پردازش را توصیف می‌کند؛ داده‌های جایگزین توصیف می‌کند اطلاعات از کجا می‌آید. برخی مجموعه‌های داده جایگزین بسیار بزرگ‌اند، مانند چند سال قیمت روزانه، و برخی کوچک‌اند، مانند شمار هفتگی فروشگاه‌های تازه‌افتتاح‌شده.

چگونه کار با داده‌های جایگزین را شروع کنم؟

یک پرسش محدود انتخاب کنید، یک منبع پیدا کنید که بتواند به آن پاسخ دهد و به اندازه کافی سابقه گردآوری کنید تا پاسخ را با نتایج شناخته‌شده بیازمایید. برای داده‌های وب، یک اسکرپر کوچک با ذخیره‌سازی مرتب و پایش برای شروع کافی است؛ فقط وقتی سراغ فروشندگان بروید که به داده‌ای نیاز دارید که خودتان نمی‌توانید گردآوری کنید.

خلاصه

داده‌های جایگزین اطلاعاتی بیرون از مجموعه سنتی گزارش‌های رسمی، صورت‌های مالی و آمار رسمی است: قیمت‌های وب، آگهی‌های شغلی، نظرها، پنل‌های کارت، تصاویر ماهواره‌ای و استفاده از اپلیکیشن‌ها. این داده‌ها وقتی مفیدند که پس از پاک‌سازی و آزمون در برابر سابقه، به یک پرسش مشخص زودتر از منابع سنتی پاسخ دهند. آنچه یک مجموعه داده قابل‌استفاده را از یک مجموعه پرریسک جدا می‌کند، بررسی منبع است: چه کسی داده را گردآوری کرده، چگونه و با چه شرایطی. برای داده‌های وبی که خودتان گردآوری می‌کنید، صفحه‌های عمومی، نرخ درخواست معقول و درخواست از کشور درست بیشترین اهمیت را دارد؛ شبکه پروکسی Proxynet نشانی‌های مسکونی و چرخشی لازم برای این گردآوری را فراهم می‌کند.

پرسش از ChatGPTپرسش از Claude