دامنه: این اندازه گیری شده از چگونگی جدا کردن مقادیر در یک مجموعه داده است. آن به عنوان = (بالاترین مقدار - کمترین مقدار) متغیر اندازه گیری می شود.
2. واریانس
واریانس با در نظر گرفتن تفاوت بین هر عدد در مجموعه داده ها و میانگین محاسبه می شود ، سپس تفاوت ها را برای مثبت کردن آنها و در نهایت تقسیم تعداد مربعات بر تعداد مقادیر موجود در مجموعه داده ها محاسبه می شود.
برای هر نمونه ، همیشه مجموع انحرافات از میانگین یا میانگین برابر با 0 است. این یکی از محدودیت هایی است که ما در هر نمونه نمونه داریم.
واریانس اندازه گیری درجه پراکندگی هر مشاهده از میانگین مقادیر است.
مزایا و مضرات واریانس
مزایای :
آ. آمارشناسان به جای استفاده از تکنیک های ریاضی گسترده تر مانند تنظیم اعداد در کوارتل ها ، از واریانس استفاده می کنند تا ببینند که چگونه تعداد فردی با یکدیگر در یک مجموعه داده ارتباط دارند.
ب. مزیت واریانس این است که بدون توجه به جهت آنها ، تمام انحرافات را از میانگین یکسان رفتار می کند. انحرافات مربع نمی توانند صفر جمع شوند و به هیچ وجه در داده ها هیچ تنوع نداشته باشند.
مضرات:
آ. یکی از اشکالات واریانس این است که وزن اضافه شده به Outliers ، اعدادی که از میانگین دور هستند. مربع کردن این اعداد می تواند داده ها را کاهش دهد.
اشکال واریانس این است که به راحتی تفسیر نمی شود. کاربران واریانس غالباً آن را در درجه اول به منظور گرفتن ریشه مربع از مقدار آن ، که نشان دهنده انحراف استاندارد مجموعه داده ها است ، استفاده می کنند.
میزان آزادی
درجه درجه آزادی یک برآورد ، تعداد اطلاعات مستقل از اطلاعات است که در محاسبه تخمین قرار گرفته است. این کاملاً مشابه تعداد موارد موجود در نمونه نیست. برای به دست آوردن DF برای تخمین ، باید 1 از تعداد موارد را کم کنید. بیایید بگوییم که شما میانگین کاهش وزن را برای رژیم کم کربوهیدرات پیدا کرده اید. شما می توانید از 4 نفر استفاده کنید ، 3 درجه آزادی (4-1 = 3) می دهید ، یا می توانید از صد نفر با DF = 99 استفاده کنید.
n = نه. موارد موجود در مجموعه شما
درجه آزادی = n-1
درجه آزادی برای جمعیت
جمعیتی با اندازه را در نظر بگیرید. هیچ محدودیتی در مورد جمعیت وجود ندارد. بنابراین میزان جمعیت فقط "N" باقی مانده است.
درجه آزادی برای نمونه
نمونه ای از اندازه را در نظر بگیرید ، و همیشه در هر نمونه محدودیت یعنی مبلغ انحراف = 0. وجود دارد. بنابراین حداکثر درجه آزادی برای هر نمونه (N-1) است.
واریانس جمعیت:
واریانس جمعیت (σ2) به ما می گوید که چگونه داده ها در یک جمعیت خاص گسترش می یابد. این میانگین مسافت از هر نقطه داده در جمعیت تا میانگین ، مربع است.
تغییر برای نمونه
واریانس از نظر ریاضی به عنوان میانگین اختلاف مربعات از میانگین تعریف می شود. برای درک آنچه شما با واریانس محاسبه می کنید ، آن را به مراحل تقسیم کنید: مرحله 1: میانگین (وزن متوسط) را محاسبه کنید. مرحله 2: میانگین را کم کنید و نتیجه را مربع کنید.
انحراف معیار :
انحراف استاندارد آماری است که پراکندگی یک مجموعه داده را نسبت به میانگین آن اندازه گیری می کند و به عنوان ریشه مربع واریانس محاسبه می شود. انحراف استاندارد به عنوان ریشه مربع واریانس با تعیین انحراف هر نقطه داده نسبت به میانگین محاسبه می شود. اگر نقاط داده از میانگین بیشتر باشد ، انحراف بالاتری در مجموعه داده ها وجود دارد. بنابراین ، هرچه داده ها بیشتر پخش شود ، انحراف استاندارد بیشتر می شود.
در اینجا مراحل محاسبه انحراف استاندارد آورده شده است: 1. میانگین را محاسبه کنید. 2. برای هر مقدار داده ، انحراف آن را از میانگین محاسبه کنید. انحراف از میانگین با کم کردن میانگین از مقدار داده تعیین می شود. توجه داشته باشید که اگر همه این انحرافات را از میانگین برای یک مجموعه داده اضافه کنیم ، بسته به خطای دور ، مبلغ 0 (یا نزدیک) خواهد بود. 3. مربع هر انحراف از میانگین. 4- مربع های انحراف را جمع کنید. 5. مبلغ را در شماره 4 توسط (n - 1) تقسیم کنید. توجه داشته باشید که متن می گوید: "دلایل مهم آماری وجود دارد که ما با تعداد کمتر از تعداد مقادیر داده تقسیم می کنیم."6. ریشه مربع مقدار را در شماره 5 بگیرید ، که به انحراف استاندارد می دهد.
حال ، به نمونه ای بپردازیم که در آن انحراف استاندارد به توضیح داده ها کمک می کند.
سه مجموعه داده زیر را در نظر بگیرید: (1) 5 ، 25 ، 25 ، 25 ، 25 ، 25 ، 45 (2) 5 ، 15 ، 20 ، 25 ، 30 ، 35 ، 45 (3) 5 ، 5 ، 5 ، 25 ، 45، 45 ، 45
میانگین ، متوسط و دامنه همه برای این مجموعه داده ها یکسان هستند ، اما تغییرپذیری هر مجموعه داده کاملاً متفاوت است.
در فرآیند انتخاب متغیر ، می توانیم به متغیری که انحراف معیار آن برابر با 0 است نگاه کنیم و می توانیم چنین متغیرهای مستقل را نادیده بگیریم.
توجه: هنگامی که مشتری اصرار دارد تمام متغیری را که فکر می کند مهم است ، داشته باشد ، ما نمی توانیم به طور مستقیم چنین متغیرهایی را نادیده بگیریم ، حتی اگر انحراف استاندارد آنها برابر با 0 باشد. در چنین مواردی ممکن است مجبور شویم سر و صدای سیستماتیک را به چنین متغیرهایی اضافه کنیم که انحراف استاندارد آنها= 0.
IQR (محدوده کوارتیل)
دامنه interquartile (IQR) اندازه گیری تنوع است که بر اساس تقسیم یک داده به کوارتیل ها تقسیم می شود. مقادیری که هر قسمت را تقسیم می کند ، کوارتل های اول ، دوم و سوم نامیده می شوند. و آنها به ترتیب توسط Q1 ، Q2 و Q3 مشخص شده اند.
- Q1 مقدار "میانی" در نیمه اول مجموعه داده های مرتبه ای است.
- کوارتیل 1: 25 صدک
- Q2 مقدار متوسط در مجموعه است.
- کوارتیل 2: صدک 50
- Q3 مقدار "میانی" در نیمه دوم مجموعه داده های مرتبه ای است.
- کوارتیل 3: 75 صدک
توطئه جعبه
نمای بصری داده هایی هستند که می توانند در یافتن Q1 ، Q2 و Q3 به ما کمک کنند.
توطئه های جعبه (همچنین به نام توطئه های جعبه و whisker یا توطئه های Whisker Box) تصویر گرافیکی خوبی از غلظت داده ها را نشان می دهد. آنها همچنین نشان می دهند که مقادیر شدید از بیشتر داده ها تا چه حد است. یک طرح جعبه از پنج مقدار ساخته شده است: حداقل مقدار ، اولین کوارتیل ، میانه ، کوارتیل سوم و حداکثر مقدار. ما از این مقادیر برای مقایسه مقادیر داده های دیگر به آنها استفاده می کنیم.
Outlier مقداری است که در یک سری داده در افراط و تفریط آن قرار دارد ، که بسیار کوچک یا بزرگ است و بنابراین می تواند بر مشاهده کلی ساخته شده از سری داده ها تأثیر بگذارد.
n = تعداد مشاهدات
p = صدک مربوطه
مثال IQR
سوالداده های زیر را در نظر بگیرید و دریابید که آیا هرگونه مسافتی وجود دارد یا خیر.
پاسخ:
مرحله 1: ما این مشاهدات را به ترتیب صعودی ترتیب می دهیم
برای همه مشاهدات
ما باید Q1 ، Q2 و Q3 را محاسبه کنیم
Q1 = صدک 25
Q2 = صدک 50
Q3 = صدک 75
مرحله 3
محاسبه iqr = q3- q1
IQR = 32996- 653. 75
مرحله 4
مرز پایین و بالایی را محاسبه کنید
برای مرز پایین
مرز پایین = q1 1. 5 *(IQR)
برای مرز بالایی
UB = 32996 + 1. 5 (32342. 25)
مرحله 5
بیایید اکنون آن را در یک نمودار نمایندگی کنیم. در حالی که 99000 در خارج از مرز بالایی قرار می گیرد. بنابراین این یک دور از ذهن است.
چولگی
این درجه اعوجاج از منحنی زنگ متقارن یا توزیع عادی است. این عدم تقارن در توزیع داده ها را اندازه گیری می کند. یک توزیع متقارن از 0 استفاده می شود. هنگامی که skewness 0 است ، یعنی وقتی توزیع به هم ریخته نمی شود ، اندازه گیری مرکزیت مورد استفاده متوسط است. معمولاً در این حالت میانگین و میانگین برابر است.
پوستی مثبت: به معنای زمانی است که دم در سمت راست توزیع طولانی تر یا چاق تر باشد. در این حالت میانگین بزرگتر از میانه است.
مثال: توزیع درآمد- اگر توزیع درآمد خانوار یک منطقه مورد مطالعه قرار گیرد ، از ارزشهای بین 5000 تا 250،000 دلار ، بیشتر شهروندان در گروه بین 5000 تا 100000 دلار قرار می گیرند که این بخش عمده توزیع به سمت چپ است. طرف توزیع ، که طرف پایین است. با این حال ، یک زن و شوهر ممکن است در میلیون ها نفر درآمد بسیار بالایی داشته باشند. این باعث می شود دم ارزشهای شدید (درآمد بالا) به سمت مثبت یا سمت راست گسترش یابد. بنابراین ، این یک توزیع مثبت است.
کمبود منفی:
کمبود منفی زمانی است که دم سمت چپ توزیع طولانی تر یا چاق تر از دم در سمت راست است. در این حالت میانگین کوچکتر از میانه است. در هر دو مورد مثبت و منفی ، میانه نسبت به میانگین ترجیح می شود.
مثال: سن بازنشستگی-هنگامی که سن بازنشستگی کارمندان مقایسه می شود ، مشخص می شود که بیشتر در اواسط دهه شصت یا بالاتر بازنشسته می شوند. بنابراین ، توزیع بیشتر افراد در نزدیکی بالاتر یا سمت راست قرار خواهد گرفت. با این حال ، یک روند جدید به طور فزاینده ای وجود دارد که در آن افراد بسیار کمی در حال بازنشستگی هستند و در سنین بسیار جوانی نیز وجود دارد. این باعث می شود دم توزیع طولانی تر به سمت سمت چپ یا سمت پایین باشد و مقادیر کمتری (سن پایین) میانگین را به سمت چپ تغییر می دهد و آن را به یک توزیع منفی تبدیل می کند.
● اگر پوستی بی ن-0. 5 و 0. 5 باشد ، داده ها نسبتاً متقارن هستند.
● اگر پوستی بی ن-1 و-0. 5 (به طور منفی) یا بین 0. 5 تا 1 (مثبت و مثبت) باشد ، داده ها نسبتاً کم رنگ هستند.
● اگر پوستی کمتر ا ز-1 (منفی منفی) یا بیشتر از 1 (به طور مثبت چرب) باشد ، داده ها بسیار کم رنگ هستند.
ورم
این وضوح اوج منحنی توزیع فرکانس است. در واقع اندازه گیری مسافت های موجود در توزیع است.
کورتوز بالا در یک مجموعه داده نشانگر این است که داده ها دارای فضای باز است.
کمتوز کم در یک مجموعه داده نشانگر این است که داده ها کمبود فضای باز دارند.
Mesokurttic: این توزیع دارای آمار کورتوز شبیه به توزیع طبیعی است.
Leptokurtic (Kurtosis >3): اوج بالاتر و واضح تر از Mesokurtic است ، به این معنی که داده ها دارای فضای سنگین هستند.
خبرهای فارکس...
ما را در سایت خبرهای فارکس دنبال می کنید
برچسب :
نویسنده : عفت السادات شجاعی
بازدید : <-PostHit->
تاريخ : پنجشنبه
25 اسفند
1401 ساعت: 20:28