این منبع سیگنالهایی را ارائه می دهد که ترکیبی از منابع دیگر است که توسط دلفی محاسبه یا تشکیل شده است. این یک منبع اصلی داده نیست.
فهرست مطالب
سیگنال های ترکیبی آماری
- اولین مسئله موجود: 20 مه 2020
- تعداد بازنگری های داده از 19 مه 2020: 1
- تاریخ آخرین تغییر: 3 ژوئن 2020
- موجود برای: County ، MSA ، ایالت (به اسناد کدگذاری جغرافیا مراجعه کنید)
- نوع زمان: روز (به اسناد قالب تاریخ مراجعه کنید)
- مجوز: CC توسط
این سیگنال ها شاخص های دلفی را شامل می شوند - شامل موارد و مرگ و میر ، بلکه از جمله سیگنال های دیگر انتظار می رود مربوط به میزان اساسی عفونت کروناویروس باشد - برای تولید یک شاخص واحد. هدف این است که هر روز یک نقشه واحد از فعالیت COVID-19 را در هر سطح جغرافیایی ارائه دهیم که شاخص های دیگر را خلاصه می کند تا کاربران بتوانند نوسانات آن را در فضا و زمان مطالعه کنند و با لزوماً نظارت بر بسیاری از سنسورهای فردی ، غرق نشوند.
این سیگنال ها روزانه تا 17 مارس 2021 به روز می شدند.
- NMF_DAY_DOC_FBC_FBS_GHT: این سیگنال از یک تقریب درجه 1 استفاده می کند ، از یک رویکرد فاکتورسازی ماتریس غیر منفی ، برای شناسایی یک سیگنال اساسی که به بهترین وجه بازسازی می کند ، کانتینر ، سلامت) (Smoothed_cli) ، علائم فیس بوک در Surveys_hhhly_cmny_cmn (Smooded_cli))شاخص های جستجو (Smoothed_search). این شامل گزارش های رسمی (پرونده ها و کشته شدن از منبع JHU-CSSE) نیست. مقادیر بالاتر سیگنال ترکیبی با مقادیر بالاتر شاخص های دیگر مطابقت دارد ، اما مقیاس (واحدها) ترکیب دلخواه است. توجه داشته باشید که منبع روند جستجو در سطح شهرستان در دسترس نیست ، بنابراین مقادیر شهرستان این سیگنال از آن استفاده نمی کنند. این سیگنال مستهلک می شود و از 17 مارس 2021 دیگر به روز نمی شود.
- NMF_DAY_DOC_FBS_GHT: این سیگنال به همان روش NMF_DAY_DOC_FBC_FBS_GHT محاسبه می شود ، اما علائم موجود در سیگنال بررسی جامعه را شامل نمی شود ، که در زمان معرفی این سیگنال در دسترس نبود. همچنین به جای Smoothed_Adj_cli از منبع Doctor-Visits استفاده می کند. این سیگنال مستهلک می شود و از 28 مه 2020 دیگر به روز نمی شود.
برآورد کردن
بگذارید (x_ (t) ) مقدار سنسور (s ) را در روز (t ) در منطقه (r ) نشان دهد (لزوماً میانگین محور نیست). هدف ما این است که هر روز یک متغیر پنهان مقیاس واحد را برای هر منطقه (r ) بسازیم ، که توسط (z_ (t) ) مشخص شده است ، که می تواند به طور همزمان تمام سنسورهای گزارش شده دیگر را بازسازی کند. ما این خلاصه مقیاس را سیگنال نشانگر ترکیبی می نامیم. در زیر روش مورد استفاده برای محاسبه سیگنال ترکیبی را شرح می دهیم. برای کوتاه بودن توجه ، ما یک زمان (t ) را برطرف می کنیم و شاخص مربوطه را رها می کنیم.
هدف بهینه سازی
در هر زمان (t ) (که در مورد ما یک روز وضوح یک روز دارد) ، با توجه به یک مجموعه ( mathcal ) سنسورها (با سنسورهای کل (s )) و یک مجموعه ( mathcal )از مناطق (با مناطق کل (r )) ، ما هدف ما این است که یک نشانگر ترکیبی را پیدا کنیم که بهترین مشاهدات سنسور را پس از عبور از یک تحول خاص سنسور آموخته شده (g _ ( cdot) ) بازسازی کند. یعنی برای هر بار (t ) ، ما مجموع خطای بازسازی مربع را به حداقل می رسانیم:
بیش از مقادیر نشانگر ترکیبی (z = z_ ) و تحولات نامزد (g = g_ ). برای حل مسئله بهینه سازی ، ما (z ) و (g ) را به روش های خاصی محدود می کنیم که در آینده توضیح داده شد.
محدودیت های بهینه سازی
ما تحول خاص سنسور (G_ ) را محدود می کنیم تا یک تابع خطی باشد به گونه ای که (g_ (x) = a_ x ). سپس ، تحولات (g ) به سادگی نجات های مختلف (a = a_ ) هستند ، و هدف می تواند به طور دقیق تر به صورتی نوشته شود
جایی که (x ) ماتریس (r times s ) مقادیر سنسور (x_ ) است (هر سطر با یک منطقه و هر ستون با یک مقدار سنسور مطابقت دارد). علاوه بر این ، برای شناسایی پارامترها ، ما هنجار (A ) را محدود می کنیم.
اگر (u_1 ، v_1 ، sigma_1 ) اولین بردار مفرد سمت چپ ، بردار مفرد راست و مقدار مفرد (x ) را نشان می دهد ، پس راه حل شناخته شده این هدف توسط (z = sigma_1 داده می شود. u_1 ) و (a = v_1 ) ، که شبیه به تجزیه و تحلیل مؤلفه اصلی (PCA) است. با این حال ، بر خلاف PCA ، ما سیگنال میانگین را از هر ستون (x ) حذف نمی کنیم. تا آنجا که میانگین سیگنال ها برای بازسازی مهم هستند ، آنها در (z ) منعکس می شوند.
علاوه بر این ، از آنجا که تمام سنسورها باید در مقدار شاخص ترکیبی افزایش یابد ، ما بیشتر ورودی های (a ) را محدود می کنیم تا غیر منفی باشند. به طور مشابه ، از آنجا که همه سنسورها غیر منفی هستند ، ما همچنین ورودی های (z ) را غیر منفی محدود می کنیم. این به طور مؤثر مشکل بهینه سازی را به یک مشکل فاکتورسازی ماتریس غیر منفی تبدیل می کند به شرح زیر:
[min_^: z ge 0, ainmathbb^S : a ge 0> | x - z a^ top | _f^2. ]
پیش پردازش داده ها
مقیاس بندی داده ها
از آنجا که مقادیر مختلف سنسور در مقیاس های مختلف قرار دارند ، ما مقیاس بندی ستون جهانی را انجام می دهیم. قبل از تقریب ماتریس (x ) ، ما هر ستون را با میانگین مربع ریشه مشاهده شده از آن سنسور در طول زمان مقیاس می کنیم (به طوری که هر روز همان مقیاس بندی اعمال می شود).
توجه داشته باشید که ممکن است قبل از تقریب ماتریس (x ) ، مقیاس بندی ستون محلی را در نظر بگیرد ، جایی که ما هر ستون را با میانگین مربع ریشه خود مشاهده می کنیم تا هر سنسور لحظه دوم برابر با 1 (هر روز) باشد. اما این مسئله از این مسئله رنج می برد که سری زمانی محلی برای یک سنسور و منطقه خاص می تواند کاملاً متفاوت از سری های زمانی ناشناخته باشد. به طور خاص ، روند فزاینده را می توان با کاهش روند جایگزین کرد و در نتیجه ، شاخص ترکیبی مشتق شده ممکن است کاملاً از هر سنسور بدون محاصره متمایز به نظر برسد. از این امر می توان با مقیاس بندی ستون جهانی جلوگیری کرد.
تأخیر و مفقود شدن پراکنده
ماتریس (x ) لزوماً کامل نیست و ممکن است مدخل ها را از دست ندهیم. چندین شکل از دست رفته در داده های ما بوجود می آید. در روزهای معینی ، تمام مشاهدات یک سنسور معین به دلیل تاخیر در آزادی وجود ندارد. به عنوان مثال ، مراجعه به پزشک چند روز با تأخیر منتشر می شود. همچنین ، برای هر منطقه و سنسور معین ، یک سنسور ممکن است در بعضی از روزها در دسترس باشد اما به دلیل قطع اندازه نمونه دیگر نیست. علاوه بر این ، در هر روز معین ، سنسورهای مختلف در مناطق مختلف مشاهده می شوند.
برای اطمینان از این که مقدار شاخص ترکیبی ما دارای مقیاس بندی قابل مقایسه با گذشت زمان است و از پرش های نامنظم که فقط به دلیل مفقود شدن است ، ما از استراتژی های زیر استفاده می کنیم:
- تاخیر ، جایی که اگر یک سنسور در یک روز معین برای همه مناطق وجود ندارد ، ما تمام مشاهدات را از آخرین روز کپی می کنیم که در آن هرگونه مشاهده ای برای آن سنسور در دسترس بود.
- تغییر اخیر ، در صورتی که اگر یک سنسور در صورت از دست دادن در یک روز معین از دست رفته باشد اما حداقل یکی از مقادیر گذشته (t ) مشاهده شود ، ما آن را با جدیدترین مقدار تحمیل می کنیم. ما (t ) را به 7 روز محدود می کنیم.
گم شدن مداوم
حتی با وجود استراتژی های فوق العاده ، ما هنوز مشکلی داریم که برخی از سنسورها در یک منطقه معین هرگز در دسترس نیستند. نتیجه این است که مقادیر شاخص ترکیبی برای آن منطقه که ممکن است در مقیاس کاملاً متفاوت از مقادیر موجود در مناطق دیگر با سنسورهای مشاهده شده اضافی باشد. این تنها با تنظیم یا جمع آوری اطلاعات در فضا قابل غلبه است. توجه داشته باشید که یک مشکل بسیار مشابه هنگامی رخ می دهد که یک سنسور برای مدت زمان بسیار طولانی در دسترس نباشد (آنقدر طولانی که دچار عدم تحقق اخیر است و با تنظیم روز (t = 7 ) از آن اجتناب می شود.
ما با این مشکل جغرافیایی با این مشکل سر و کار داریم ، جایی که ما از مناطقی که سطح بالاتری از تجمع مشترک دارند (به عنوان مثال ، میانگین نمره مشاهده شده در یک MSA یا ایالت) یا با تحمیل مقادیر از megacounties (از آنجا که مناطق مورد نظر وجود ندارد ، از بین می روند (به عنوان مثال ، امتیاز متوسط مشاهده شده در یک MSA یا ایالت). و از این رو باید در بقیه برآورد دولت منعکس شود). نظمی که در آن به دنبال انجام نقض جغرافیایی هستیم ، مقادیر از megacounties مشاهده می شود و به دنبال آن مقادیر مشاهده شده متوسط در سلسله مراتب جغرافیایی (شهرستان ، MSA ، ایالت یا کشور) مشاهده می شود. ما با ارزیابی اثربخشی آنها برای تقلید از مقادیر سنسور مشاهده شده واقعی در آزمایش های اعتبار سنجی ، این دنباله Imputate را در بین گزینه های مختلف انتخاب کردیم.
خطاهای استاندارد
ما خطاهای استاندارد را برای نشانگر ترکیبی با استفاده از bootstrap محاسبه می کنیم. منابع داده ورودی به صورت جداگانه مجدداً بازسازی می شوند و نشانگر ترکیبی برای ورودی مجدداً مجدداً بازسازی می شود. سپس با در نظر گرفتن انحراف استاندارد شاخص های ترکیبی مجدداً خطای استاندارد داده می شود. ما (b = 100 ) را تکرار می کنیم و از jackknife استفاده می کنیم تا تأیید کنیم که برای این تعداد تکرار ، واریانس تخمین زده شده نسبت به واریانس واریانس ها اندک است.
روش بازسازی برای هر منبع ورودی به شرح زیر است:
- مراجعه به پزشک: ما یک مشاهده اضافی واحد را با مقدار 0. 5 به محاسبه نسبت تزریق می کنیم و سپس با استفاده از نسبت "Jeffreysized" و اندازه نمونه (N+1 ) از توزیع دوتایی نمونه می گیریم.
- بررسی علائم: ما ابتدا یک مشاهده اضافی را با مقدار 0. 35 به محاسبه نسبت (P ) تزریق می کنیم. سپس ، ما به طور متوسط از متغیرهای (n+1 ) مستقل ( متن (p ، m)/m ) نمونه می گیریم ، جایی که ما (m ) را انتخاب می کنیم تا واریانس خانگی (p (1-p)/ m = n text^2 ) ، که معادل نمونه گیری ( متن (p ، mn) / mn ) است. نسبت قبلی 0. 35 برای مطابقت با توزیع مجدد با توزیع اصلی انتخاب شد.
- بررسی جامعه فیس بوک: ما از توزیع دوتایی ، با نسبت و اندازه نمونه گزارش می کنیم.
- Google Health Trends: از آنجا که ما به توزیع نمونه برداری دسترسی نداریم ، این سیگنال را دوباره نمونه برداری نمی کنیم.
سیگنال های ترکیبی: موارد تأیید شده و مرگ و میر
- اولین مسئله موجود: 7 ژوئیه 2020
- تعداد بازنگری های داده از 19 مه 2020: 1
- تاریخ آخرین تغییر: 12 اکتبر 2020
- موجود برای: County ، MSA ، HRR ، ایالت (به اسناد کدگذاری جغرافیا مراجعه کنید)
- نوع زمان: روز (به اسناد قالب تاریخ مراجعه کنید)
این سیگنال ها داده ها و داده های مرگ را از حقایق JHU و ایالات متحده آمریکا ترکیب می کنند. این یک ترکیب مستقیم است: سیگنال های زیر از داده های سیگنال JHU برای پورتوریکو و داده های ایالات متحده آمریکا در هر جای دیگر استفاده می کنند. برای کسب اطلاعات در مورد گزارش جغرافیایی ، بازگرداندن و سایر محدودیت ها ، با مستندات هر سیگنال مشورت کنید.< SPAN> بررسی جامعه فیس بوک: ما از توزیع دوتایی ، با نسبت و اندازه نمونه گزارش می کنیم.
گزینه های باینری چیست...
ما را در سایت گزینه های باینری چیست دنبال می کنید
برچسب :
نویسنده : مهدی امینیخواه
بازدید : <-PostHit->
تاريخ : سه
شنبه
1 فروردين
1402 ساعت: 22:00