---
title: "داده‌های جایگزین چیست؟ منابع، کاربردها و ریسک‌ها"
description: "داده‌های جایگزین اطلاعاتی بیرون از گزارش‌های رسمی شرکت‌اند، مانند قیمت‌های وب، آگهی‌های شغلی، پنل‌های کارت و تصاویر ماهواره‌ای. منابع، کاربردها و الزامات."
url: https://proxynet.io/fa/blog/what-is-alternative-data
date: 2026-09-28
author: "Acar Diveroli"
category: "کاربردها, مبانی پروکسی"
lang: fa
---

# داده‌های جایگزین چیست؟ منابع، کاربردها و ریسک‌ها

یک خرده‌فروش شش هفته دیگر فروش فصلی خود را اعلام می‌کند. پیش از آن، یک تحلیلگر می‌تواند بشمارد چند محصول در سایت این شرکت ناموجود شده‌اند، چند مدیر فروشگاه استخدام می‌کند و آیا نظرهای مشتریان درباره خط محصول تازه‌اش بدتر می‌شود یا نه. هیچ‌یک از این اعداد از گزارش‌های رسمی خود شرکت نمی‌آید، اما کنار هم چیزی درباره آن فصل می‌گویند. دنیای مالی به چنین اطلاعاتی داده‌های جایگزین می‌گوید.

این نوشته توضیح می‌دهد داده‌های جایگزین چیست و از کجا می‌آید: داده‌های وب، پنل‌های تراکنش کارت، تصاویر ماهواره‌ای، میزان استفاده از اپلیکیشن‌ها و احساسات کاربران (sentiment). سپس یک مجموعه داده را از گردآوری تا تصمیم دنبال می‌کند، به انطباق با مقررات و کیفیت داده می‌پردازد، جایگاه وب اسکرپینگ را نشان می‌دهد و ساختن را با خریدن مقایسه می‌کند. هیچ بخشی از این نوشته توصیه سرمایه‌گذاری نیست؛ موضوع داده است، نه اینکه چه معامله‌ای انجام دهید.

> **نکته: پاسخ کوتاه**
>
> داده‌های جایگزین اطلاعاتی است که برای تحلیل شرکت‌ها، بازارها یا اقتصاد به کار می‌رود و از منابع سنتی مانند صورت‌های مالی، گزارش‌های رسمی شرکت و اطلاعیه‌های مطبوعاتی نمی‌آید. رایج‌ترین انواع آن داده‌های وب (قیمت‌ها، صفحه‌های محصول، آگهی‌های شغلی، نظرها)، پنل‌های تجمیعی تراکنش کارت، داده‌های ماهواره‌ای و موقعیت مکانی، برآورد استفاده از اپلیکیشن‌ها و احساسات شبکه‌های اجتماعی است. این داده‌ها با اسکرپینگ سایت‌های عمومی گردآوری یا از فروشندگان داده خریداری می‌شوند. ریسک‌های اصلی کیفیت و انطباق با مقررات است: در ایالات متحده، SEC از مشاوران سرمایه‌گذاری خواسته است بررسی کنند فروشندگان داده‌شان اطلاعات را چگونه گردآوری می‌کنند تا اطلاعات مهم غیرعمومی دریافت نکنند.

## داده‌های جایگزین چیست؟

داده‌های جایگزین هر مجموعه داده‌ای است که به توضیح یک شرکت، یک صنعت یا اقتصاد کمک می‌کند اما بیرون از مجموعه سنتی ورودی‌ها قرار دارد. مجموعه سنتی شامل صورت‌های مالی حسابرسی‌شده، گزارش‌های الزامی به نهاد ناظر، جلسه‌های اعلام نتایج مالی، اطلاعیه‌های مطبوعاتی، آمار رسمی و قیمت‌های بازار است؛ هر چیز دیگری که سیگنال مفیدی داشته باشد «جایگزین» به شمار می‌آید.

کمیسیون بورس و اوراق بهادار ایالات متحده (SEC) در یک [هشدار ریسک در سال 2022 درباره انطباق با مقررات MNPI](https://www.sec.gov/files/code-ethics-risk-alert.pdf) تعریفی کاربردی ارائه می‌دهد. نمونه‌های آن شامل تصاویر ماهواره‌ای و پهپادی از مزارع و پارکینگ‌ها، تراکنش‌های تجمیعی کارت اعتباری، داده‌های شبکه‌های اجتماعی و جست‌وجو، موقعیت مکانی تلفن‌های همراه و داده‌های ایمیل از اپلیکیشن‌های مصرف‌کننده است. همان پانویس می‌افزاید که داده‌های جایگزین «لزوماً MNPI در بر ندارد»؛ نکته‌ای که در ادامه همین نوشته به آن برمی‌گردیم.

این اصطلاح از دنیای سرمایه‌گذاری آمده است، جایی که صندوق‌های پوشش ریسک نخستین خریداران بزرگ بودند؛ امروز وام‌دهندگان، خرده‌فروشان، شرکت‌های مشاوره و اقتصاددانان نیز از همین مجموعه داده‌ها استفاده می‌کنند.

## انواع اصلی داده‌های جایگزین کدام‌اند؟

دسته‌ها با هم هم‌پوشانی دارند، اما بیشتر مجموعه داده‌ها در یکی از این گروه‌ها جای می‌گیرند:

- **داده‌های وب.** قیمت و موجودی در فروشگاه‌های اینترنتی، کاتالوگ محصولات، آگهی‌های شغلی، صفحه‌های معرفی کارکنان شرکت‌ها، صفحه‌های یافتن شعبه، رتبه‌بندی فروشگاه‌های اپلیکیشن، آگهی‌های املاک و نظرها. این داده‌ها عمومی و تازه‌اند و گردآوری‌شان از انواع دیگر ارزان‌تر است.
- **داده‌های تراکنش.** خریدهای تجمیعی و بی‌نام‌شده از صادرکنندگان کارت، پردازشگرهای پرداخت یا اپلیکیشن‌های رسید. این داده‌ها هزینه‌کرد را به تفکیک فروشگاه یا برند نشان می‌دهند، معمولاً از طریق پنلی از مصرف‌کنندگان و نه کل بازار.
- **داده‌های مکانی.** تصاویر ماهواره‌ای و هوایی (پارکینگ‌ها، مخازن نفت، مزارع، کشتیرانی) و شمار مراجعه حضوری (foot traffic) که از سیگنال‌های موقعیت تلفن همراه به دست می‌آید.
- **استفاده از اپلیکیشن و وب.** برآورد دانلود و کاربران فعال اپلیکیشن‌های موبایل، برآورد ترافیک وب‌سایت‌ها و روند حجم جست‌وجو.
- **داده‌های احساسات و متن.** پست‌های شبکه‌های اجتماعی، اخبار، نظرهای محصول، رشته‌بحث‌های انجمن‌ها و متن جلسه‌های اعلام نتایج مالی که به امتیاز یا موضوع تبدیل می‌شوند. ⁨CFA Institute⁩ در مقاله خود درباره [کاربرد NLP روی داده‌های جایگزین](https://www.cfainstitute.org/insights/articles/using-nlp-to-unlock-treasure-trove-of-alternative-data) یادآوری می‌کند که بخش بزرگی از این مواد متن بدون ساختار است و پیش از استفاده باید پردازش شود.

## داده‌های جایگزین چگونه به سیگنالی قابل‌استفاده تبدیل می‌شود؟

مسیر از منبع تا تصمیم معمولاً شش گام دارد:

1. **پرسش را تعریف کنید.** «آیا فروش خرده‌فروش X سریع‌تر از سال گذشته رشد می‌کند؟» یک پرسش است؛ «گردآوری همه چیز درباره خرده‌فروش X» پرسش نیست.
1. **منبع را پیدا و ارزیابی کنید.** بررسی کنید مالک داده کیست، داده چگونه و با چه شرایطی گردآوری شده و آیا اجازه دارید آن را برای این هدف به کار ببرید. برای داده‌های اسکرپ‌شده این یعنی شرایط استفاده سایت و robots.txt؛ برای فروشنده داده یعنی پرسش‌نامه بررسی دقیق (due diligence).
1. **گردآوری کنید.** صفحه‌های عمومی را اسکرپ کنید، یک API رسمی را فراخوانی کنید، فایل‌ها را از فروشنده بگیرید یا فید یک شریک را دریافت کنید. گردآوری طبق زمان‌بندی اجرا می‌شود، چون یک تصویر لحظه‌ای هیچ چیزی درباره تغییر نشان نمی‌دهد.
1. **پاک‌سازی و ادغام کنید.** موارد تکراری را حذف کنید، نوع داده‌ها و واحدهای پول را اصلاح کنید و نام محصولات و نشانی فروشگاه‌ها را به شرکت و نماد معاملاتی درست نسبت دهید.
1. **شاخص را بسازید و بیازمایید.** ردیف‌ها را به یک سری تبدیل کنید، مثلاً شمار هفتگی کالاهای تخفیف‌خورده، و آن را با ارقام گزارش‌شده گذشته مقایسه کنید. سری‌ای که هیچ‌گاه با اعداد گزارش‌شده همراه نبوده، نویز است.
1. **پایش کنید.** منابع تغییر می‌کنند: سایتی صفحه‌هایش را از نو طراحی می‌کند، پنل یک فروشنده اعضایش را از دست می‌دهد، اپلیکیشنی صفحه خود را در فروشگاه عوض می‌کند.

گام‌های 3 و 4 در عمل همان کار ETL است: استخراج، تبدیل، بارگذاری. نوشته [ETL چیست؟](/fa/blog/what-is-etl) چنین خط لوله‌ای را با داده‌های اسکرپ‌شده گام‌به‌گام شرح می‌دهد.

## مقایسه انواع داده‌های جایگزین

| نوع | چه چیزی را می‌سنجد | روش رایج گردآوری | تازگی | ریسک اصلی |
|---|---|---|---|---|
| قیمت و موجودی در وب | قیمت‌گذاری، تخفیف، موجود بودن | اسکرپینگ صفحه‌های عمومی محصول | چند ساعت تا چند روز | تغییر صفحه اسکرپر را از کار می‌اندازد |
| آگهی‌های شغلی | برنامه استخدام به تفکیک سمت و مکان | اسکرپینگ صفحه‌های فرصت شغلی و سایت‌های کاریابی | چند روز | آگهی‌های تکراری و کهنه |
| نظرها و پست‌های اجتماعی | احساسات، مشکلات محصول | اسکرپینگ، APIهای رسمی | چند ساعت | ربات‌ها، طعنه، نمونه‌های کوچک |
| پنل‌های تراکنش کارت | هزینه‌کرد مصرف‌کننده به تفکیک فروشگاه | خرید مجوز از فروشندگان | چند روز تا چند هفته | سوگیری پنل، داده شخصی |
| تصاویر ماهواره‌ای | فعالیت فیزیکی (خودرو، مخزن، مزرعه) | تصاویر دارای مجوز به‌همراه تحلیل تصویر | چند روز | ابر، هزینه، تفسیر |
| مراجعه حضوری (foot traffic) | بازدید از فروشگاه‌ها و اماکن | پنل‌های موقعیت تلفن همراه از طریق فروشندگان | چند روز | رضایت کاربر و حریم خصوصی |
| برآورد استفاده از اپلیکیشن | دانلود، کاربران فعال | مدل‌های فروشندگان، داده فروشگاه‌های اپلیکیشن | چند روز | مدل‌های مبهم، کیفیت منبع |

داده‌های وب تنها نوعی است که یک تیم می‌تواند خودش گردآوری کند؛ داده‌های کارت، موقعیت و اپلیکیشن تقریباً همیشه از فروشنده می‌آید و همین هم هزینه و هم کار انطباق با مقررات را شکل می‌دهد.

## آیا استفاده از داده‌های جایگزین قانونی است؟

استفاده از داده‌های جایگزین به‌طور کلی قانونی است؛ آنچه اهمیت دارد این است که مجموعه داده چگونه به دست آمده و آیا اطلاعاتی در بر دارد که نباید بر پایه آن معامله کرد.

**اطلاعات مهم غیرعمومی (MNPI).** MNPI کوتاه‌شده عبارت انگلیسی material nonpublic information است: اطلاعاتی مهم که هنوز عمومی نشده و می‌تواند بر قیمت یک اوراق بهادار اثر بگذارد. در ایالات متحده، مشاوران سرمایه‌گذاری باید سیاست‌های مکتوبی برای جلوگیری از سوءاستفاده از این اطلاعات داشته باشند (⁨Section 204A⁩ از قانون ⁨Investment Advisers Act⁩). در هشدار ریسک سال 2022 که بالاتر به آن اشاره شد، بازرسان SEC گزارش دادند که برخی مشاوران بدون سیاستی که ریسک دریافت MNPI از این راه را پوشش دهد از داده‌های جایگزین استفاده می‌کردند. کارشناسان SEC به این موارد اشاره کردند: بررسی دقیق موردی و بی‌قاعده فروشندگان داده، ارزیابی‌نکردن شرایط و تعهدات حقوقی گردآوری (حتی پس از دیده‌شدن نشانه‌های هشدار)، اعمال‌نشدن بررسی دقیق بر همه منابع و نبود فرایندی برای تکرار آن هنگام تغییر شیوه‌های گردآوری.

**گزارش نادرست درباره منشأ داده.** در سپتامبر 2021، SEC [شرکت ⁨App Annie⁩ و هم‌بنیان‌گذار آن را](https://www.sec.gov/newsroom/press-releases/2021-176) به تقلب در اوراق بهادار متهم کرد. به گفته SEC، این شرکت به سازندگان اپلیکیشن گفته بود داده‌هایشان پیش از استفاده در مدل آماری تجمیع و بی‌نام می‌شود، اما از داده‌های تجمیع‌نشده برای تنظیم برآوردهایی استفاده می‌کرد که به شرکت‌های معاملاتی می‌فروخت. شرکت پرداخت جریمه‌ای ده میلیون دلاری را پذیرفت و SEC این پرونده را نخستین اقدام اجرایی خود علیه یک ارائه‌دهنده داده‌های جایگزین خواند.

**اسکرپینگ و داده‌های شخصی.** برای داده‌های وب، پرسش‌ها همان پرسش‌های هر پروژه اسکرپینگ است: آیا صفحه‌ها عمومی‌اند؟ آیا شرایط استفاده سایت دسترسی خودکار را مجاز می‌داند؟ آیا robots.txt از شما می‌خواهد وارد نشوید؟ آیا داده‌ها اطلاعات شخصی مشمول قوانینی مانند GDPR یا KVKK را در بر دارند؟ نوشته [آیا وب اسکرپینگ قانونی است؟](/fa/blog/is-data-web-scraping-legal) تصویر کلی را می‌دهد و [داده‌های شخصی در مجموعه‌داده‌های اسکرپ‌شده](/fa/blog/personal-data-in-scraped-datasets) توضیح می‌دهد چگونه فیلدهای شخصی را کم و از آن‌ها محافظت کنید.

> **هشدار: توصیه حقوقی یا سرمایه‌گذاری نیست**
>
> این بخش راهنمایی‌های عمومی SEC را تا سپتامبر 2026 خلاصه می‌کند. قواعد در کشورهای مختلف و برای انواع مختلف شرکت‌ها متفاوت است. اگر سرمایه دیگران را مدیریت می‌کنید یا به چنین کسانی داده می‌فروشید، از یک مسئول انطباق یا وکیل بخواهید منابع و سیاست‌های شما را بررسی کند.

## چرا قضاوت درباره کیفیت داده‌های جایگزین دشوار است؟

گزارش‌های رسمی با حسابرسی و استاندارد همراه‌اند؛ داده‌های جایگزین نه، پس خریدار باید خودش آن را بسنجد:

- **پوشش.** پنل کارت کسانی را پوشش می‌دهد که از کارت‌های یک صادرکننده یا یک اپلیکیشن رسید استفاده می‌کنند، نه کل جمعیت را. اسکرپر صفحه‌هایی را پوشش می‌دهد که به آن‌ها دسترسی دارد، نه کل کاتالوگ را.
- **سابقه.** یک سیگنال برای آزموده‌شدن در برابر نتایج گزارش‌شده به چند سال سابقه نیاز دارد.
- **بقا و تغییرات.** فروشگاه‌ها بسته می‌شوند، سایت‌ها کد محصولاتشان را عوض می‌کنند و فروشندگان داده‌های قدیمی را بازنگری می‌کنند.
- **نگاشت.** برندها، شرکت‌های تابعه و نام فروشگاه‌ها باید به شرکت درست پیوند داده شوند.
- **فرسایش.** وقتی شرکت‌های زیادی یک مجموعه داده را می‌خرند، مزیتی که می‌دهد کم می‌شود. مقاله ⁨CFA Institute⁩ که بالاتر آمد همین نکته را می‌گوید.

## وب اسکرپینگ کجای کار است؟

وب اسکرپینگ، یعنی گردآوری خودکار صفحه‌های عمومی وب، راهی است که بیشتر تیم‌ها داده‌های جایگزین خود را با آن می‌سازند. این روش برای پاسخ‌هایی مناسب است که در اینترنت منتشر شده‌اند اما در هزاران صفحه پراکنده‌اند:

- **قیمت‌ها و تخفیف‌ها.** قیمت‌های روزانه در چند خرده‌فروش عمق تخفیف و تورم یک دسته کالا را نشان می‌دهد؛ همان روشی که در [رصد قیمت رقبا](/fa/blog/competitor-price-tracking) آمده است.
- **استخدام.** آگهی‌های شغلی به تفکیک سمت و شهر؛ نوشته [آگهی‌های شغلی لینکدین به تفکیک کشور](/fa/blog/linkedin-jobs-by-country) نشان می‌دهد آگهی‌ها در مکان‌های مختلف چه تفاوتی دارند.
- **نظرها.** تعداد نظرها و امتیازها در طول زمان، که با روش‌هایی مانند آنچه در [تحلیل احساسات با پایتون: VADER در برابر Hugging Face](/fa/blog/sentiment-analysis-python) آمده امتیازدهی می‌شوند.
- **تغییرات صفحه.** به‌روزرسانی صفحه‌های یافتن شعبه، صفحه‌های شرایط استفاده یا صفحه‌های قیمت، که مانند [پایش تغییرات وب‌سایت](/fa/blog/website-change-monitoring) دنبال می‌شوند.

دو نکته اینجا اهمیت دارد. نخست، بسیاری از سایت‌ها قیمت، موجودی و آگهی‌های متفاوتی را بسته به کشور نشان می‌دهند؛ پس اسکرپر باید صفحه‌ها را از مکان درست درخواست کند، وگرنه سری داده مناطق را با هم قاطی می‌کند. نشانی‌های [پروکسی مسکونی](https://proxynet.io/fa/residential-proxy) به شما امکان می‌دهند کشور و شهر هدف را برای هر درخواست انتخاب کنید. دوم، اسکرپری که سال‌ها هر روز اجرا می‌شود باید مؤدب باشد: robots.txt را رعایت کنید، نرخ درخواست را پایین نگه دارید، هر جا API رسمی هست از آن استفاده کنید و درخواست‌ها را با تنظیمات [پروکسی چرخشی](https://proxynet.io/fa/rotating-proxy) در طول زمان پخش کنید، نه اینکه یک سایت را با رگبار درخواست بزنید. پروکسی‌ها تغییر نمی‌دهند که چه داده‌ای را مجازید گردآوری کنید؛ فقط تعیین می‌کنند درخواست از کدام نشانی شبکه فرستاده شود.

## داده‌های جایگزین را بسازید یا بخرید؟

| عامل | ساختن (گردآوری توسط خودتان) | خریدن (مجوز از فروشنده) |
|---|---|---|
| کنترل بر روش | کامل؛ همه گام‌ها را می‌شناسید | محدود به آنچه فروشنده افشا می‌کند |
| زمان رسیدن به نخستین داده | چند هفته برای یک اسکرپر کارآمد | چند روز پس از قرارداد |
| سابقه | از روزی که شروع می‌کنید | اغلب چند سال داده گذشته |
| کار مستمر | نگهداری هنگام تغییر سایت‌ها | بررسی دقیق فروشنده، تمدید قرارداد |
| کار انطباق با مقررات | بررسی منابع و شرایط توسط خودتان | بررسی منابع و شرایط فروشنده |
| انواع داده مناسب | داده‌های عمومی وب | داده‌های کارت، موقعیت، اپلیکیشن و ماهواره |

بیشتر تیم‌ها در نهایت هر دو را دارند: داده فروشندگان برای انواعی که خودشان نمی‌توانند گردآوری کنند و اسکرپرهای خودشان برای داده‌های وبی که در قالب یا کشوری مشخص لازم دارند.

## داده‌های جایگزین کجا به کار می‌رود؟

- **پژوهش سرمایه‌گذاری.** تحلیلگران از داده‌های وب، کارت و اپلیکیشن برای برآورد فروش پیش از انتشار نتایج استفاده می‌کنند؛ [صفحه پروکسی برای امور مالی](/fa/finance) گردآوری داده برای شرکت‌های مالی را توضیح می‌دهد.
- **تحقیقات بازار.** شرکت‌های مشاوره و برندها اندازه دسته‌های کالا را برآورد و سبد محصولات رقبا را دنبال می‌کنند؛ [پروکسی برای تحقیقات بازار](/fa/market-research) را ببینید.
- **قیمت‌گذاری خرده‌فروشی.** خرده‌فروشان هر روز قیمت‌های خود را با رقبا مقایسه می‌کنند، همان‌طور که در صفحه [پایش قیمت](/fa/price-monitoring) آمده است.
- **پژوهش اقتصادی.** قیمت‌های آنلاین و آگهی‌های شغلی، تصویری از تورم و تقاضای نیروی کار را زودتر از آمار ماهانه به دست می‌دهند.
- **محصولات داده‌ای.** شرکت‌هایی که برای دیگران مجموعه داده می‌سازند به گردآوری در مقیاس بزرگ متکی‌اند؛ کاربردی که پشت [پروکسی برای اسکرپینگ داده](/fa/data-scraping) قرار دارد.

## اشتباهات رایج در کار با داده‌های جایگزین

- **شروع از مجموعه داده به‌جای پرسش.** مجموعه داده بزرگی که فرضیه‌ای پشتش نیست نمودار تولید می‌کند، نه پاسخ.
- **نادیده‌گرفتن بررسی منبع.** ندانستن اینکه فروشنده داده‌اش را چگونه گردآوری کرده، دقیقاً همان خلأیی است که هشدار SEC توصیف می‌کند.
- **قاطی‌کردن مکان‌ها.** اسکرپ‌کردن یک سایت جهانی از یک کشور و فرض اینکه قیمت‌ها همه جا یکسان است.
- **اعتماد به بک‌تست (backtest) کوتاه.** سیگنالی که روی یک سال آزموده شده ممکن است تصادفی جواب داده باشد.
- **نگه‌داشتن داده شخصی غیرضروری.** نام، ایمیل و شناسه کاربر به‌ندرت سیگنالی اضافه می‌کند و همیشه ریسک اضافه می‌کند؛ آن‌ها را همان هنگام گردآوری کنار بگذارید.
- **خرابی بی‌صدای اسکرپرها.** تغییر چیدمانی که صفحه‌های خالی برمی‌گرداند، اگر تعداد ردیف‌ها را پایش نکنید، شبیه «فروش به صفر رسید» به نظر می‌رسد.
- **دائمی دانستن سیگنال.** منابع تغییر می‌کنند و مزیت‌ها کم‌رنگ می‌شوند؛ هر مجموعه داده را طبق برنامه بازبینی کنید.

## راهنمای انتخاب

| نیاز | پیشنهاد |
|---|---|
| قیمت یا موجودی روزانه از فروشگاه‌های عمومی | اسکرپر بسازید؛ از کشور هدف درخواست بفرستید |
| هزینه‌کرد مصرف‌کننده به تفکیک برند | مجوز یک پنل تراکنش را بخرید و منشأ داده‌اش را بررسی کنید |
| فعالیت فیزیکی در مکان‌ها | مجوز داده ماهواره‌ای یا مراجعه حضوری را بخرید |
| روند استخدام به تفکیک شرکت | صفحه‌های فرصت شغلی و سایت‌های کاریابی را در چارچوب شرایطشان اسکرپ کنید |
| احساسات نسبت به برند در طول زمان | نظرها یا پست‌ها را از طریق API گردآوری و با NLP امتیازدهی کنید |
| چند سال سابقه، همین حالا | بخرید؛ اسکرپر نمی‌تواند گذشته را پر کند |
| سیگنالی که هیچ‌کس دیگر ندارد | بسازید و روش را برای انطباق با مقررات مستند کنید |

## پرسش‌های متداول

### تفاوت داده‌های جایگزین و داده‌های سنتی چیست؟

داده‌های سنتی چیزهایی است که شرکت‌ها و دولت‌ها به‌صورت رسمی منتشر می‌کنند: صورت‌های مالی، گزارش‌های الزامی، جلسه‌های اعلام نتایج و آمار رسمی. داده‌های جایگزین هر چیز دیگری است که همان کسب‌وکار را توضیح می‌دهد، مانند قیمت‌های وب یا پنل‌های کارت. مرز را منبع تعیین می‌کند، نه قالب.

### آیا وب اسکرپینگ منبع داده‌های جایگزین است؟

بله. داده‌های وبِ اسکرپ‌شده (قیمت‌ها، صفحه‌های محصول، آگهی‌های شغلی، نظرها) یکی از رایج‌ترین انواع است و نوعی که تیم‌ها بیش از همه خودشان گردآوری می‌کنند. این داده‌ها باید فقط از صفحه‌های عمومی باشند، از شرایط سایت و robots.txt پیروی کنند و نرخ درخواست پایین بماند.

### چه کسانی از داده‌های جایگزین استفاده می‌کنند؟

صندوق‌های پوشش ریسک و شرکت‌های مدیریت دارایی پیشگام بودند. اکنون شرکت‌های سرمایه‌گذاری خصوصی، وام‌دهندگان، خرده‌فروشان، شرکت‌های مشاوره و اقتصاددانان نیز از آن استفاده می‌کنند.

### آیا داده‌های جایگزین ممکن است اطلاعات نهانی (insider) در بر داشته باشد؟

ممکن است. SEC یادآوری می‌کند که داده‌های جایگزین لزوماً اطلاعات مهم غیرعمومی در بر ندارد، اما مجموعه داده‌ای که با نقض توافق‌نامه محرمانگی یا شرایط یک سایت گردآوری شده باشد می‌تواند اطلاعاتی داشته باشد که نباید بر پایه آن معامله کرد. به همین دلیل نهادهای ناظر از شرکت‌ها انتظار دارند پیش از استفاده از هر منبع، بررسی کنند چگونه گردآوری شده است.

### آیا داده‌های جایگزین همان کلان‌داده است؟

خیر. کلان‌داده (big data) حجم و روش‌های پردازش را توصیف می‌کند؛ داده‌های جایگزین توصیف می‌کند اطلاعات از کجا می‌آید. برخی مجموعه‌های داده جایگزین بسیار بزرگ‌اند، مانند چند سال قیمت روزانه، و برخی کوچک‌اند، مانند شمار هفتگی فروشگاه‌های تازه‌افتتاح‌شده.

### چگونه کار با داده‌های جایگزین را شروع کنم؟

یک پرسش محدود انتخاب کنید، یک منبع پیدا کنید که بتواند به آن پاسخ دهد و به اندازه کافی سابقه گردآوری کنید تا پاسخ را با نتایج شناخته‌شده بیازمایید. برای داده‌های وب، یک اسکرپر کوچک با ذخیره‌سازی مرتب و پایش برای شروع کافی است؛ فقط وقتی سراغ فروشندگان بروید که به داده‌ای نیاز دارید که خودتان نمی‌توانید گردآوری کنید.

## خلاصه

داده‌های جایگزین اطلاعاتی بیرون از مجموعه سنتی گزارش‌های رسمی، صورت‌های مالی و آمار رسمی است: قیمت‌های وب، آگهی‌های شغلی، نظرها، پنل‌های کارت، تصاویر ماهواره‌ای و استفاده از اپلیکیشن‌ها. این داده‌ها وقتی مفیدند که پس از پاک‌سازی و آزمون در برابر سابقه، به یک پرسش مشخص زودتر از منابع سنتی پاسخ دهند. آنچه یک مجموعه داده قابل‌استفاده را از یک مجموعه پرریسک جدا می‌کند، بررسی منبع است: چه کسی داده را گردآوری کرده، چگونه و با چه شرایطی. برای داده‌های وبی که خودتان گردآوری می‌کنید، صفحه‌های عمومی، نرخ درخواست معقول و درخواست از کشور درست بیشترین اهمیت را دارد؛ [شبکه پروکسی](/fa/proxy) Proxynet نشانی‌های مسکونی و چرخشی لازم برای این گردآوری را فراهم می‌کند.
