یک خردهفروش شش هفته دیگر فروش فصلی خود را اعلام میکند. پیش از آن، یک تحلیلگر میتواند بشمارد چند محصول در سایت این شرکت ناموجود شدهاند، چند مدیر فروشگاه استخدام میکند و آیا نظرهای مشتریان درباره خط محصول تازهاش بدتر میشود یا نه. هیچیک از این اعداد از گزارشهای رسمی خود شرکت نمیآید، اما کنار هم چیزی درباره آن فصل میگویند. دنیای مالی به چنین اطلاعاتی دادههای جایگزین میگوید.
این نوشته توضیح میدهد دادههای جایگزین چیست و از کجا میآید: دادههای وب، پنلهای تراکنش کارت، تصاویر ماهوارهای، میزان استفاده از اپلیکیشنها و احساسات کاربران (sentiment). سپس یک مجموعه داده را از گردآوری تا تصمیم دنبال میکند، به انطباق با مقررات و کیفیت داده میپردازد، جایگاه وب اسکرپینگ را نشان میدهد و ساختن را با خریدن مقایسه میکند. هیچ بخشی از این نوشته توصیه سرمایهگذاری نیست؛ موضوع داده است، نه اینکه چه معاملهای انجام دهید.
دادههای جایگزین چیست؟
دادههای جایگزین هر مجموعه دادهای است که به توضیح یک شرکت، یک صنعت یا اقتصاد کمک میکند اما بیرون از مجموعه سنتی ورودیها قرار دارد. مجموعه سنتی شامل صورتهای مالی حسابرسیشده، گزارشهای الزامی به نهاد ناظر، جلسههای اعلام نتایج مالی، اطلاعیههای مطبوعاتی، آمار رسمی و قیمتهای بازار است؛ هر چیز دیگری که سیگنال مفیدی داشته باشد «جایگزین» به شمار میآید.
کمیسیون بورس و اوراق بهادار ایالات متحده (SEC) در یک هشدار ریسک در سال 2022 درباره انطباق با مقررات MNPI تعریفی کاربردی ارائه میدهد. نمونههای آن شامل تصاویر ماهوارهای و پهپادی از مزارع و پارکینگها، تراکنشهای تجمیعی کارت اعتباری، دادههای شبکههای اجتماعی و جستوجو، موقعیت مکانی تلفنهای همراه و دادههای ایمیل از اپلیکیشنهای مصرفکننده است. همان پانویس میافزاید که دادههای جایگزین «لزوماً MNPI در بر ندارد»؛ نکتهای که در ادامه همین نوشته به آن برمیگردیم.
این اصطلاح از دنیای سرمایهگذاری آمده است، جایی که صندوقهای پوشش ریسک نخستین خریداران بزرگ بودند؛ امروز وامدهندگان، خردهفروشان، شرکتهای مشاوره و اقتصاددانان نیز از همین مجموعه دادهها استفاده میکنند.
انواع اصلی دادههای جایگزین کداماند؟
دستهها با هم همپوشانی دارند، اما بیشتر مجموعه دادهها در یکی از این گروهها جای میگیرند:
- دادههای وب. قیمت و موجودی در فروشگاههای اینترنتی، کاتالوگ محصولات، آگهیهای شغلی، صفحههای معرفی کارکنان شرکتها، صفحههای یافتن شعبه، رتبهبندی فروشگاههای اپلیکیشن، آگهیهای املاک و نظرها. این دادهها عمومی و تازهاند و گردآوریشان از انواع دیگر ارزانتر است.
- دادههای تراکنش. خریدهای تجمیعی و بینامشده از صادرکنندگان کارت، پردازشگرهای پرداخت یا اپلیکیشنهای رسید. این دادهها هزینهکرد را به تفکیک فروشگاه یا برند نشان میدهند، معمولاً از طریق پنلی از مصرفکنندگان و نه کل بازار.
- دادههای مکانی. تصاویر ماهوارهای و هوایی (پارکینگها، مخازن نفت، مزارع، کشتیرانی) و شمار مراجعه حضوری (foot traffic) که از سیگنالهای موقعیت تلفن همراه به دست میآید.
- استفاده از اپلیکیشن و وب. برآورد دانلود و کاربران فعال اپلیکیشنهای موبایل، برآورد ترافیک وبسایتها و روند حجم جستوجو.
- دادههای احساسات و متن. پستهای شبکههای اجتماعی، اخبار، نظرهای محصول، رشتهبحثهای انجمنها و متن جلسههای اعلام نتایج مالی که به امتیاز یا موضوع تبدیل میشوند. CFA Institute در مقاله خود درباره کاربرد NLP روی دادههای جایگزین یادآوری میکند که بخش بزرگی از این مواد متن بدون ساختار است و پیش از استفاده باید پردازش شود.
دادههای جایگزین چگونه به سیگنالی قابلاستفاده تبدیل میشود؟
مسیر از منبع تا تصمیم معمولاً شش گام دارد:
- پرسش را تعریف کنید. «آیا فروش خردهفروش X سریعتر از سال گذشته رشد میکند؟» یک پرسش است؛ «گردآوری همه چیز درباره خردهفروش X» پرسش نیست.
- منبع را پیدا و ارزیابی کنید. بررسی کنید مالک داده کیست، داده چگونه و با چه شرایطی گردآوری شده و آیا اجازه دارید آن را برای این هدف به کار ببرید. برای دادههای اسکرپشده این یعنی شرایط استفاده سایت و robots.txt؛ برای فروشنده داده یعنی پرسشنامه بررسی دقیق (due diligence).
- گردآوری کنید. صفحههای عمومی را اسکرپ کنید، یک API رسمی را فراخوانی کنید، فایلها را از فروشنده بگیرید یا فید یک شریک را دریافت کنید. گردآوری طبق زمانبندی اجرا میشود، چون یک تصویر لحظهای هیچ چیزی درباره تغییر نشان نمیدهد.
- پاکسازی و ادغام کنید. موارد تکراری را حذف کنید، نوع دادهها و واحدهای پول را اصلاح کنید و نام محصولات و نشانی فروشگاهها را به شرکت و نماد معاملاتی درست نسبت دهید.
- شاخص را بسازید و بیازمایید. ردیفها را به یک سری تبدیل کنید، مثلاً شمار هفتگی کالاهای تخفیفخورده، و آن را با ارقام گزارششده گذشته مقایسه کنید. سریای که هیچگاه با اعداد گزارششده همراه نبوده، نویز است.
- پایش کنید. منابع تغییر میکنند: سایتی صفحههایش را از نو طراحی میکند، پنل یک فروشنده اعضایش را از دست میدهد، اپلیکیشنی صفحه خود را در فروشگاه عوض میکند.
گامهای 3 و 4 در عمل همان کار ETL است: استخراج، تبدیل، بارگذاری. نوشته ETL چیست؟ چنین خط لولهای را با دادههای اسکرپشده گامبهگام شرح میدهد.
مقایسه انواع دادههای جایگزین
| نوع | چه چیزی را میسنجد | روش رایج گردآوری | تازگی | ریسک اصلی |
|---|---|---|---|---|
| قیمت و موجودی در وب | قیمتگذاری، تخفیف، موجود بودن | اسکرپینگ صفحههای عمومی محصول | چند ساعت تا چند روز | تغییر صفحه اسکرپر را از کار میاندازد |
| آگهیهای شغلی | برنامه استخدام به تفکیک سمت و مکان | اسکرپینگ صفحههای فرصت شغلی و سایتهای کاریابی | چند روز | آگهیهای تکراری و کهنه |
| نظرها و پستهای اجتماعی | احساسات، مشکلات محصول | اسکرپینگ، APIهای رسمی | چند ساعت | رباتها، طعنه، نمونههای کوچک |
| پنلهای تراکنش کارت | هزینهکرد مصرفکننده به تفکیک فروشگاه | خرید مجوز از فروشندگان | چند روز تا چند هفته | سوگیری پنل، داده شخصی |
| تصاویر ماهوارهای | فعالیت فیزیکی (خودرو، مخزن، مزرعه) | تصاویر دارای مجوز بههمراه تحلیل تصویر | چند روز | ابر، هزینه، تفسیر |
| مراجعه حضوری (foot traffic) | بازدید از فروشگاهها و اماکن | پنلهای موقعیت تلفن همراه از طریق فروشندگان | چند روز | رضایت کاربر و حریم خصوصی |
| برآورد استفاده از اپلیکیشن | دانلود، کاربران فعال | مدلهای فروشندگان، داده فروشگاههای اپلیکیشن | چند روز | مدلهای مبهم، کیفیت منبع |
دادههای وب تنها نوعی است که یک تیم میتواند خودش گردآوری کند؛ دادههای کارت، موقعیت و اپلیکیشن تقریباً همیشه از فروشنده میآید و همین هم هزینه و هم کار انطباق با مقررات را شکل میدهد.
آیا استفاده از دادههای جایگزین قانونی است؟
استفاده از دادههای جایگزین بهطور کلی قانونی است؛ آنچه اهمیت دارد این است که مجموعه داده چگونه به دست آمده و آیا اطلاعاتی در بر دارد که نباید بر پایه آن معامله کرد.
اطلاعات مهم غیرعمومی (MNPI). MNPI کوتاهشده عبارت انگلیسی material nonpublic information است: اطلاعاتی مهم که هنوز عمومی نشده و میتواند بر قیمت یک اوراق بهادار اثر بگذارد. در ایالات متحده، مشاوران سرمایهگذاری باید سیاستهای مکتوبی برای جلوگیری از سوءاستفاده از این اطلاعات داشته باشند (Section 204A از قانون Investment Advisers Act). در هشدار ریسک سال 2022 که بالاتر به آن اشاره شد، بازرسان SEC گزارش دادند که برخی مشاوران بدون سیاستی که ریسک دریافت MNPI از این راه را پوشش دهد از دادههای جایگزین استفاده میکردند. کارشناسان SEC به این موارد اشاره کردند: بررسی دقیق موردی و بیقاعده فروشندگان داده، ارزیابینکردن شرایط و تعهدات حقوقی گردآوری (حتی پس از دیدهشدن نشانههای هشدار)، اعمالنشدن بررسی دقیق بر همه منابع و نبود فرایندی برای تکرار آن هنگام تغییر شیوههای گردآوری.
گزارش نادرست درباره منشأ داده. در سپتامبر 2021، SEC شرکت App Annie و همبنیانگذار آن را به تقلب در اوراق بهادار متهم کرد. به گفته SEC، این شرکت به سازندگان اپلیکیشن گفته بود دادههایشان پیش از استفاده در مدل آماری تجمیع و بینام میشود، اما از دادههای تجمیعنشده برای تنظیم برآوردهایی استفاده میکرد که به شرکتهای معاملاتی میفروخت. شرکت پرداخت جریمهای ده میلیون دلاری را پذیرفت و SEC این پرونده را نخستین اقدام اجرایی خود علیه یک ارائهدهنده دادههای جایگزین خواند.
اسکرپینگ و دادههای شخصی. برای دادههای وب، پرسشها همان پرسشهای هر پروژه اسکرپینگ است: آیا صفحهها عمومیاند؟ آیا شرایط استفاده سایت دسترسی خودکار را مجاز میداند؟ آیا robots.txt از شما میخواهد وارد نشوید؟ آیا دادهها اطلاعات شخصی مشمول قوانینی مانند GDPR یا KVKK را در بر دارند؟ نوشته آیا وب اسکرپینگ قانونی است؟ تصویر کلی را میدهد و دادههای شخصی در مجموعهدادههای اسکرپشده توضیح میدهد چگونه فیلدهای شخصی را کم و از آنها محافظت کنید.
چرا قضاوت درباره کیفیت دادههای جایگزین دشوار است؟
گزارشهای رسمی با حسابرسی و استاندارد همراهاند؛ دادههای جایگزین نه، پس خریدار باید خودش آن را بسنجد:
- پوشش. پنل کارت کسانی را پوشش میدهد که از کارتهای یک صادرکننده یا یک اپلیکیشن رسید استفاده میکنند، نه کل جمعیت را. اسکرپر صفحههایی را پوشش میدهد که به آنها دسترسی دارد، نه کل کاتالوگ را.
- سابقه. یک سیگنال برای آزمودهشدن در برابر نتایج گزارششده به چند سال سابقه نیاز دارد.
- بقا و تغییرات. فروشگاهها بسته میشوند، سایتها کد محصولاتشان را عوض میکنند و فروشندگان دادههای قدیمی را بازنگری میکنند.
- نگاشت. برندها، شرکتهای تابعه و نام فروشگاهها باید به شرکت درست پیوند داده شوند.
- فرسایش. وقتی شرکتهای زیادی یک مجموعه داده را میخرند، مزیتی که میدهد کم میشود. مقاله CFA Institute که بالاتر آمد همین نکته را میگوید.
وب اسکرپینگ کجای کار است؟
وب اسکرپینگ، یعنی گردآوری خودکار صفحههای عمومی وب، راهی است که بیشتر تیمها دادههای جایگزین خود را با آن میسازند. این روش برای پاسخهایی مناسب است که در اینترنت منتشر شدهاند اما در هزاران صفحه پراکندهاند:
- قیمتها و تخفیفها. قیمتهای روزانه در چند خردهفروش عمق تخفیف و تورم یک دسته کالا را نشان میدهد؛ همان روشی که در رصد قیمت رقبا آمده است.
- استخدام. آگهیهای شغلی به تفکیک سمت و شهر؛ نوشته آگهیهای شغلی لینکدین به تفکیک کشور نشان میدهد آگهیها در مکانهای مختلف چه تفاوتی دارند.
- نظرها. تعداد نظرها و امتیازها در طول زمان، که با روشهایی مانند آنچه در تحلیل احساسات با پایتون: VADER در برابر Hugging Face آمده امتیازدهی میشوند.
- تغییرات صفحه. بهروزرسانی صفحههای یافتن شعبه، صفحههای شرایط استفاده یا صفحههای قیمت، که مانند پایش تغییرات وبسایت دنبال میشوند.
دو نکته اینجا اهمیت دارد. نخست، بسیاری از سایتها قیمت، موجودی و آگهیهای متفاوتی را بسته به کشور نشان میدهند؛ پس اسکرپر باید صفحهها را از مکان درست درخواست کند، وگرنه سری داده مناطق را با هم قاطی میکند. نشانیهای پروکسی مسکونی به شما امکان میدهند کشور و شهر هدف را برای هر درخواست انتخاب کنید. دوم، اسکرپری که سالها هر روز اجرا میشود باید مؤدب باشد: robots.txt را رعایت کنید، نرخ درخواست را پایین نگه دارید، هر جا API رسمی هست از آن استفاده کنید و درخواستها را با تنظیمات پروکسی چرخشی در طول زمان پخش کنید، نه اینکه یک سایت را با رگبار درخواست بزنید. پروکسیها تغییر نمیدهند که چه دادهای را مجازید گردآوری کنید؛ فقط تعیین میکنند درخواست از کدام نشانی شبکه فرستاده شود.
دادههای جایگزین را بسازید یا بخرید؟
| عامل | ساختن (گردآوری توسط خودتان) | خریدن (مجوز از فروشنده) |
|---|---|---|
| کنترل بر روش | کامل؛ همه گامها را میشناسید | محدود به آنچه فروشنده افشا میکند |
| زمان رسیدن به نخستین داده | چند هفته برای یک اسکرپر کارآمد | چند روز پس از قرارداد |
| سابقه | از روزی که شروع میکنید | اغلب چند سال داده گذشته |
| کار مستمر | نگهداری هنگام تغییر سایتها | بررسی دقیق فروشنده، تمدید قرارداد |
| کار انطباق با مقررات | بررسی منابع و شرایط توسط خودتان | بررسی منابع و شرایط فروشنده |
| انواع داده مناسب | دادههای عمومی وب | دادههای کارت، موقعیت، اپلیکیشن و ماهواره |
بیشتر تیمها در نهایت هر دو را دارند: داده فروشندگان برای انواعی که خودشان نمیتوانند گردآوری کنند و اسکرپرهای خودشان برای دادههای وبی که در قالب یا کشوری مشخص لازم دارند.
دادههای جایگزین کجا به کار میرود؟
- پژوهش سرمایهگذاری. تحلیلگران از دادههای وب، کارت و اپلیکیشن برای برآورد فروش پیش از انتشار نتایج استفاده میکنند؛ صفحه پروکسی برای امور مالی گردآوری داده برای شرکتهای مالی را توضیح میدهد.
- تحقیقات بازار. شرکتهای مشاوره و برندها اندازه دستههای کالا را برآورد و سبد محصولات رقبا را دنبال میکنند؛ پروکسی برای تحقیقات بازار را ببینید.
- قیمتگذاری خردهفروشی. خردهفروشان هر روز قیمتهای خود را با رقبا مقایسه میکنند، همانطور که در صفحه پایش قیمت آمده است.
- پژوهش اقتصادی. قیمتهای آنلاین و آگهیهای شغلی، تصویری از تورم و تقاضای نیروی کار را زودتر از آمار ماهانه به دست میدهند.
- محصولات دادهای. شرکتهایی که برای دیگران مجموعه داده میسازند به گردآوری در مقیاس بزرگ متکیاند؛ کاربردی که پشت پروکسی برای اسکرپینگ داده قرار دارد.
اشتباهات رایج در کار با دادههای جایگزین
- شروع از مجموعه داده بهجای پرسش. مجموعه داده بزرگی که فرضیهای پشتش نیست نمودار تولید میکند، نه پاسخ.
- نادیدهگرفتن بررسی منبع. ندانستن اینکه فروشنده دادهاش را چگونه گردآوری کرده، دقیقاً همان خلأیی است که هشدار SEC توصیف میکند.
- قاطیکردن مکانها. اسکرپکردن یک سایت جهانی از یک کشور و فرض اینکه قیمتها همه جا یکسان است.
- اعتماد به بکتست (backtest) کوتاه. سیگنالی که روی یک سال آزموده شده ممکن است تصادفی جواب داده باشد.
- نگهداشتن داده شخصی غیرضروری. نام، ایمیل و شناسه کاربر بهندرت سیگنالی اضافه میکند و همیشه ریسک اضافه میکند؛ آنها را همان هنگام گردآوری کنار بگذارید.
- خرابی بیصدای اسکرپرها. تغییر چیدمانی که صفحههای خالی برمیگرداند، اگر تعداد ردیفها را پایش نکنید، شبیه «فروش به صفر رسید» به نظر میرسد.
- دائمی دانستن سیگنال. منابع تغییر میکنند و مزیتها کمرنگ میشوند؛ هر مجموعه داده را طبق برنامه بازبینی کنید.
راهنمای انتخاب
| نیاز | پیشنهاد |
|---|---|
| قیمت یا موجودی روزانه از فروشگاههای عمومی | اسکرپر بسازید؛ از کشور هدف درخواست بفرستید |
| هزینهکرد مصرفکننده به تفکیک برند | مجوز یک پنل تراکنش را بخرید و منشأ دادهاش را بررسی کنید |
| فعالیت فیزیکی در مکانها | مجوز داده ماهوارهای یا مراجعه حضوری را بخرید |
| روند استخدام به تفکیک شرکت | صفحههای فرصت شغلی و سایتهای کاریابی را در چارچوب شرایطشان اسکرپ کنید |
| احساسات نسبت به برند در طول زمان | نظرها یا پستها را از طریق API گردآوری و با NLP امتیازدهی کنید |
| چند سال سابقه، همین حالا | بخرید؛ اسکرپر نمیتواند گذشته را پر کند |
| سیگنالی که هیچکس دیگر ندارد | بسازید و روش را برای انطباق با مقررات مستند کنید |
پرسشهای متداول
تفاوت دادههای جایگزین و دادههای سنتی چیست؟
دادههای سنتی چیزهایی است که شرکتها و دولتها بهصورت رسمی منتشر میکنند: صورتهای مالی، گزارشهای الزامی، جلسههای اعلام نتایج و آمار رسمی. دادههای جایگزین هر چیز دیگری است که همان کسبوکار را توضیح میدهد، مانند قیمتهای وب یا پنلهای کارت. مرز را منبع تعیین میکند، نه قالب.
آیا وب اسکرپینگ منبع دادههای جایگزین است؟
بله. دادههای وبِ اسکرپشده (قیمتها، صفحههای محصول، آگهیهای شغلی، نظرها) یکی از رایجترین انواع است و نوعی که تیمها بیش از همه خودشان گردآوری میکنند. این دادهها باید فقط از صفحههای عمومی باشند، از شرایط سایت و robots.txt پیروی کنند و نرخ درخواست پایین بماند.
چه کسانی از دادههای جایگزین استفاده میکنند؟
صندوقهای پوشش ریسک و شرکتهای مدیریت دارایی پیشگام بودند. اکنون شرکتهای سرمایهگذاری خصوصی، وامدهندگان، خردهفروشان، شرکتهای مشاوره و اقتصاددانان نیز از آن استفاده میکنند.
آیا دادههای جایگزین ممکن است اطلاعات نهانی (insider) در بر داشته باشد؟
ممکن است. SEC یادآوری میکند که دادههای جایگزین لزوماً اطلاعات مهم غیرعمومی در بر ندارد، اما مجموعه دادهای که با نقض توافقنامه محرمانگی یا شرایط یک سایت گردآوری شده باشد میتواند اطلاعاتی داشته باشد که نباید بر پایه آن معامله کرد. به همین دلیل نهادهای ناظر از شرکتها انتظار دارند پیش از استفاده از هر منبع، بررسی کنند چگونه گردآوری شده است.
آیا دادههای جایگزین همان کلانداده است؟
خیر. کلانداده (big data) حجم و روشهای پردازش را توصیف میکند؛ دادههای جایگزین توصیف میکند اطلاعات از کجا میآید. برخی مجموعههای داده جایگزین بسیار بزرگاند، مانند چند سال قیمت روزانه، و برخی کوچکاند، مانند شمار هفتگی فروشگاههای تازهافتتاحشده.
چگونه کار با دادههای جایگزین را شروع کنم؟
یک پرسش محدود انتخاب کنید، یک منبع پیدا کنید که بتواند به آن پاسخ دهد و به اندازه کافی سابقه گردآوری کنید تا پاسخ را با نتایج شناختهشده بیازمایید. برای دادههای وب، یک اسکرپر کوچک با ذخیرهسازی مرتب و پایش برای شروع کافی است؛ فقط وقتی سراغ فروشندگان بروید که به دادهای نیاز دارید که خودتان نمیتوانید گردآوری کنید.
خلاصه
دادههای جایگزین اطلاعاتی بیرون از مجموعه سنتی گزارشهای رسمی، صورتهای مالی و آمار رسمی است: قیمتهای وب، آگهیهای شغلی، نظرها، پنلهای کارت، تصاویر ماهوارهای و استفاده از اپلیکیشنها. این دادهها وقتی مفیدند که پس از پاکسازی و آزمون در برابر سابقه، به یک پرسش مشخص زودتر از منابع سنتی پاسخ دهند. آنچه یک مجموعه داده قابلاستفاده را از یک مجموعه پرریسک جدا میکند، بررسی منبع است: چه کسی داده را گردآوری کرده، چگونه و با چه شرایطی. برای دادههای وبی که خودتان گردآوری میکنید، صفحههای عمومی، نرخ درخواست معقول و درخواست از کشور درست بیشترین اهمیت را دارد؛ شبکه پروکسی Proxynet نشانیهای مسکونی و چرخشی لازم برای این گردآوری را فراهم میکند.




