متغیر شاخص یک متغیر طبقه بندی شده است که دقیقاً دو سطح دارد. متغیرهای منطقی نمونه ای از متغیر شاخص هستند.
اینها یک کلاس مهم از متغیرها برای بسیاری از تجزیه و تحلیل ها هستند که متغیر فاکتور باید به مجموعه ای از متغیرهای شاخص تبدیل شود. متغیرهای شاخص ها اغلب از مقادیر 0 و 1 برای دو سطح استفاده می کنند ، اما نه همیشه.
5. 4. 1. 2 متغیرهای عاملی از متغیرهای عددی
متغیرهای عددی را می توان با فروپاشی مقادیری که در مجموعه ای از فواصل زمانی قرار می گیرند ، به یک متغیر فاکتور تبدیل کنند. این نوعی کاهش داده است. کاهش داده ها به طور معمول تجزیه و تحلیل را بهبود نمی بخشد. از طرف دیگر تبدیل یک متغیر عددی به یک عامل گاهی اوقات می تواند دیدن الگوهای موجود در داده ها در هنگام اکتشاف را بسیار ساده تر کند. به عنوان مثال ، تبدیل یک متغیر عددی به فواصل زیاد ، متوسط و کم این امکان را می دهد تا از متغیر در جنبه ها استفاده شود تا ببیند اختلافات بصری در یک طرح وجود دارد یا خیر.
5. 4. 2 مثال - R
این نمونه ها از مجموعه داده های Forbes2000. csv استفاده می کنند.
- ما با بارگیری مرتب سازی ، وارد کردن پرونده CSV و نامگذاری متغیرها شروع می کنیم.
کتابخانه(Tidyverse)
forbes_pathمسیر فایل("..", "مجموعه داده ها", "forbes2000. csv") forbes_inread_csv(forbes_path ،col_types = کلوچه())
هشدار: نام ستون های گمشده پر شده: 'x1' [1]
forbes_inنام بردن(forbes_in ،Market_value =MarketValue) forbes forbes_in%>% انتخاب کنید(-x1)نظر اجمالی(فوربس)
مشاهدات: 2،000 متغیر: 8 $ رتبه 1 ، 2 ، 3 ، 4 ، 5 ، 6 ، 7 ، 8 ، 9 ، 10 ، 11 ، 12 ، 13 ، 14 ، 15. نام $ "citigroup" ، "جنرال الکتریک" ، "American Intl G. $ Country "ایالات متحده" ، "ایالات متحده" ، "ایالات متحده". دسته $ "بانکداری" ، "کنگلومرها" ، "بیمه" ، "نفت و g. فروش $ 94. 71 ، 134. 19 ، 76. 66 ، 222. 88 ، 232. 57 ، 49. 01 ، 44. 3. سود $ 17. 85 ، 15. 59 ، 6. 46 ، 20. 96 ، 10. 27 ، 10. 81 ، 6. 66 ، 7. دارایی $ 1264. 03 ، 626. 93 ، 647. 66 ، 166. 99 ، 177. 57 ، 736. 45 ،.$ market_value 255. 30 ، 328. 54 ، 194. 87 ، 277. 02 ، 173. 54 ، 117. 55 ، 1.
فوربس فوربس%>% جهش دادن( رده = عامل(دسته بندی) )نظر اجمالی(فوربس)
مشاهدات: 2،000 متغیر: 8 $ رتبه 1 ، 2 ، 3 ، 4 ، 5 ، 6 ، 7 ، 8 ، 9 ، 10 ، 11 ، 12 ، 13 ، 14 ، 15. نام $ "citigroup" ، "جنرال الکتریک" ، "American Intl G. $ Country "ایالات متحده" ، "ایالات متحده" ، "ایالات متحده". $ رده بانکی ، کنگلومرها ، بیمه ، نفت و گاز فروش 94. 71 ، 134. 19 ، 76. 66 ، 222. 88 ، 232. 57 ، 49. 01 ، 44. 3.
فوربسجهش دادن(فوربس ،رده = AS. Character(دسته)) رده_لول Forbes%>% انتخاب کنید(دسته بندی)%>% متمایز(دسته بندی)%>% ترتیب دادن(دسته بندی)%>% کشیدن() سر(رده_ل)
[1] "هوافضا و دفاع" "بانکداری" [3] "خدمات تجاری و تأمین" "کالاهای سرمایه" [5] "مواد شیمیایی" "" کنگلومرها "
اکنون از سطوح برای ایجاد متغیر فاکتور استفاده می شود.
فوربس فوربس%>% جهش دادن( رده = parse_factor(دسته بندی،سطح =رده_ل)))نظر اجمالی(فوربس)
مشاهدات: 2،000 متغیر: 8 $ رتبه 1 ، 2 ، 3 ، 4 ، 5 ، 6 ، 7 ، 8 ، 9 ، 10 ، 11 ، 12 ، 13 ، 14 ، 15. نام $ "citigroup" ، "جنرال الکتریک" ، "American Intl G. $ Country "ایالات متحده" ، "ایالات متحده" ، "ایالات متحده". $ رده بانکی ، کنگلومرها ، بیمه ، نفت و گاز فروش 94. 71 ، 134. 19 ، 76. 66 ، 222. 88 ، 232. 57 ، 49. 01 ، 44. 3.
فوربس فوربس%>% جهش دادن( POFFER_LEV = برش(سود ،شکست = c(-Inf, . 08, . 44, 10, Inf), برچسب ها = c("کم", "اواسط", "بالا", "بسیار بالا") ) ) نظر اجمالی(فوربس)
مشاهدات: 2،000 متغیر: 9 $ رتبه 1 ، 2 ، 3 ، 4 ، 5 ، 6 ، 7 ، 8 ، 9 ، 10 ، 11 ، 12 ، 13 ، 14 ، 15. نام $ "citigroup" ، "جنرال الکتریک" ، "American Intl G. $ Country "ایالات متحده" ، "ایالات متحده" ، "ایالات متحده". $ رده بانکی ، کنگلومرها ، بیمه ، نفت و گاز فروش 94. 71 ، 134. 19 ، 76. 66 ، 222. 88 ، 232. 57 ، 49. 01 ، 44. 3. PROFE_LEV بسیار بالا ، بسیار بالا ، بالا ، بسیار بالا ، بسیار بالا.
فوربس فوربس%>% جهش دادن( nafta =کشور٪که در٪ c("ایالات متحده", "کانادا", "مکزیک") ) نظر اجمالی(فوربس)
مشاهدات: 2،000 متغیر: 10 $ رتبه 1 ، 2 ، 3 ، 4 ، 5 ، 6 ، 7 ، 8 ، 9 ، 10 ، 11 ، 12 ، 13 ، 14 ، 15. نام $ "citigroup" ، "جنرال الکتریک" ، "American Intl G. $ Country "ایالات متحده" ، "ایالات متحده" ، "ایالات متحده". $ رده بانکی ، کنگلومرها ، بیمه ، نفت و گاز فروش 94. 71 ، 134. 19 ، 76. 66 ، 222. 88 ، 232. 57 ، 49. 01 ، 44. 3. Proffect_Lev بسیار بالا ، بسیار بالا ، بالا ، بسیار بالا ، بسیار بالا.
5. 4. 3 مثال - پایتون
این نمونه ها از مجموعه داده های Forbes2000. csv استفاده می کنند.
- ما با بارگذاری بسته ها ، وارد کردن پرونده CSV و نامگذاری متغیرها شروع می کنیم.
از جانبمسیروارد كردنمسیروارد كردنپانداasPDوارد كردناعماقasNP
forbes_path=مسیر('..') / "مجموعه داده ها" / 'forbes2000. csv'forbes_in=pd. read_csv (forbes_path) forbes_in=(forbes_in . rename (ستون ها='MarketValue': 'Market_value'>)) فوربس=forbes_in. copy (عمیق=درست است، واقعی) چاپ(forbes. dtypes)
نامشخص: 0 int64 رتبه int64 نام شیء کشور شیء دسته شیء شی فروش FLOAT64 سود float64 دارایی های float64 market_value float64 dtype: شیء
فوربس=forbes. assign (دسته بندی= لامبداDF: DF ['دسته بندی'] . astype ('دسته بندی')) چاپ(فوربس ['دسته بندی']. سر())
0 بانکی 1 کنگلومرا 2 بیمه 3 عملیات نفت و گاز 4 عملیات نفت و گاز نام: دسته ، dtype: دسته بندی دسته (27 ، شی): [هوافضا و دفاع ، بانکی ، خدمات و منابع تجاری ، کالاهای سرمایه ،. خدمات ارتباطی ، شرکت های بازرگانی ، حمل و نقل ، آب و برق]
فوربس=forbes_in رده_ل=PD. Series (Forbes ['دسته بندی'] . unique ()). sort_values ()چاپ(رده_ lev. head ())
19 هوافضا و دفاعی 0 بانکی 22 خدمات و منابع تجاری 21 کالای سرمایه 18 مواد شیمیایی dtype: شیء
اکنون از سطوح برای ایجاد متغیر فاکتور استفاده می شود.
فوربس=(Forbes . Assign (دسته بندی= لامبداDF: Pd. Categorical (DF ['دسته بندی']، دسته بندی ها=رده_ل)))چاپ(فوربس ['دسته بندی']. سر())
0 بانکی 1 کنگلومرا 2 بیمه 3 عملیات نفت و گاز 4 عملیات نفت و گاز نام: دسته ، dtype: دسته بندی دسته (27 ، شی): [هوافضا و دفاع ، بانکی ، خدمات و منابع تجاری ، کالاهای سرمایه ،. خدمات ارتباطی ، شرکت های بازرگانی ، حمل و نقل ، آب و برق]
فوربس=(Forbes . Assign (Proffect_Lev= لامبداDF: PD. Cut (DF ["سود"] ، سطل=[-np. inf ،. 08, . 44, 10، np. inf] ، برچسب ها=['کم', "اواسط", "بالا", "بسیار بالا"]))) چاپ(فوربس ['Proffect_Lev']. سر())
0 بسیار بالا 1 بسیار بالا 2 بالا 3 بسیار بالا 4 نام بسیار بالا: Proffect_Lev ، dtype: دسته بندی دسته (4 ، شی): [کم
فوربس=(Forbes . Assign (NAFTA= لامبداDF: DF ['کشور'] . هست در(['ایالات متحده', "کانادا", "مکزیک"]))) چاپ(فوربس ['nafta']. سر())
0 True 1 True 2 True 3 True 4 نام کاذب: NAFTA ، DTYPE: BOOL
forbes_dum=pd. get_dummies (فوربس ، ستون ها=['دسته بندی']) چاپ(forbes_dum. dtypes)
Biotechnology uint8 kate_food نوشیدنی و دخانیات uint8 ketory_food markets uint8 uint8 تجهیزات و خدمات مراقبت از سلامت uint8 kate_hotels رستوران ها و اوقات فراغت uint8 uint1 و محصولات شخصی Uint8 رده بندی uint8 uint8 uintorials uint8 uint8 uint8 uint8 uint8 uint8 uint8 uint8 uint8 uint8 uint8 uint8 uint8 uint8 uint8 ors uint8 رده_ Software & Services UINT8 رده_ سخت افزار و تجهیزات uint8دسته بندی_تل ارتباطات خدمات UINT8 رده_ شرکت های شرکت UINT8 رده_ transportation uint8 رده_تایی uint8 dtype: شیء
5. 4. 4 تمرینات
این تمرینات از مجموعه داده های mtcars. csv استفاده می کنند.
مجموعه داده های mtcars. csv را وارد کنید. متغیرهای سیل ، دنده و کربوهیدرات را عامل کنید. متغیری را ایجاد کنید که مشاهدات را در 25 درصد برتر مایل در هر گالن مشخص کند. چند مورد از این وسایل نقلیه را نمایش دهید. نکته ، برای شناسایی درصد نقاط یک متغیر ، باید عملکردی پیدا کنید. متغیرهایی ایجاد کنید که مقادیر HP را با استفاده از مقادیر زیر HP: 100 ، 170 ، 240 و 300 سطل دهید.
سیگنال های تجاری...
ما را در سایت سیگنال های تجاری دنبال می کنید
برچسب :
نویسنده : عبدالله بوتیمار
بازدید : <-PostHit->
تاريخ : پنجشنبه
26 مرداد
1402 ساعت: 19:21