پیش بینی بازار سهام به دلیل مزایای بالقوه پولی ، توجه قابل توجهی را به خود جلب کرده است. پیش بینی این بازارها یک کار چالش برانگیز به دلیل عوامل مختلف مرتبط است و برای شناسایی آموزنده ترین عوامل نیاز به یک فرآیند انتخاب کامل و کارآمد دارد. به عنوان یک مشکل سری زمانی ، حرکات قیمت سهام نیز در روزهای معاملاتی قبلی خود به حرکات وابسته است. تکنیک های انتخاب ویژگی به طور گسترده ای در پیش بینی سهام کاربردی شده است ، اما رویکردهای موجود معمولاً از یک تکنیک انتخاب ویژگی واحد استفاده می کنند ، که ممکن است برخی از فرضیات مهم در مورد عملکرد رگرسیون اساسی را که متغیرهای ورودی و خروجی را پیوند می دهد ، غافل کند. در این مطالعه ، ما ویژگی های انتخاب شده توسط تکنیک های انتخاب ویژگی های مختلف را برای تولید یک زیر مجموعه ویژگی بهینه ترکیب می کنیم و سپس از یک مدل تولیدی عمیق برای پیش بینی حرکات قیمت آینده استفاده می کنیم. ابتدا ، ما مجموعه ای گسترده از چهل و چهار شاخص فنی را از داده های سهام روزانه سهام هشتاد و هشت محاسبه می کنیم و سپس اهمیت آنها را با آموزش مدل رگرسیون لجستیک به طور مستقل ، دستگاه بردار پشتیبانی و جنگل های تصادفی محاسبه می کنیم. بر اساس یک آستانه از پیش تعیین شده ، کمترین ویژگی های رتبه بندی شده کاهش می یابد و بقیه در خوشه ها قرار می گیرند. اندازه گیری اهمیت متغیر برای انتخاب مهمترین ویژگی از هر خوشه برای تولید زیر مجموعه نهایی استفاده می شود. ورودی سپس به یک مدل تولیدی عمیق متشکل از استخراج کننده سیگنال بازار و مکانیسم توجه تغذیه می شود. استخراج کننده سیگنال بازار به طور مکرر حرکت بازار را از متغیرهای نهفته برای مقابله با ماهیت تصادفی داده های سهام رمزگشایی می کند و مکانیسم توجه بین وابستگی های پیش بینی کننده خروجی های کمکی زمانی مختلف تبعیض قائل می شود. نتایج نشان می دهد که ترکیب ویژگی های انتخاب شده توسط رویکردهای انتخاب ویژگی های مختلف و استفاده از آنها به عنوان ورودی به یک مدل تولیدی عمیق از رویکردهای پیشرفته برتر است.
معرفی
بازارهای سهام نقش مهمی در سازماندهی سیستم های اقتصادی مدرن دارند و پیش بینی این بازارها برای سرمایه گذاران بسیار مهم است ، زیرا پیش بینی های دقیق به آنها امکان می دهد خطرات را کاهش داده و تصمیمات آگاهانه ای در مورد سرمایه گذاری بگیرند. بازار سهام تحت تأثیر عوامل مختلفی از جمله وضعیت اقتصادی ، متغیرهای خاص صنعت ، چشم انداز شرکت ، تأثیر روانی سرمایه گذاران و سیاست های دولت است و به پیچیدگی تجزیه و تحلیل و پیش بینی این بازارها می افزاید (Zhong & Enke ، 2017). علاوه بر این ، فرضیه کارآمد بازار (EMH) توسط ملکیل و فاما (1970) اظهار داشت که بازارهای سهام تمام اطلاعات موجود را منعکس می کنند و مسیرهای تصادفی را دنبال می کنند ، و آنها را بسیار دشوار اعلام می کنند. با این حال ، بسیاری از مطالعات تجربی نشان می دهد که بازارهای مالی بلافاصله با اطلاعات تازه منتشر شده تنظیم نمی شوند ، و تأثیر روانشناختی شرکت کنندگان در بازار ، بازارهای مالی را تا حدی قابل پیش بینی می کند (سرولول رویو و گایجرو ، 2020 ، گارسیا و همکاران ، 2018 ، هنریک و هنریکal. ، 2019) ، به سرمایه گذاران این امکان را می دهد تا با تجزیه و تحلیل اطلاعات در دسترس عموم ، سود بالاتر از میانگین بازار را کسب کنند. Cervelló Royo و Guijarro (2020) از پنج مدل مختلف یادگیری ماشین استفاده کردند و نشان دادند که همه مدل ها به دقت پیش بینی بالاتر از حد متوسط دست می یابند. اخیراً ، رویکردهای یادگیری عمیق با نتایج ظاهر شده اند که از همتایان یادگیری ماشین سنتی آنها بهتر است (Sezer et al. ، 2020).
به طور کلی ، رویکردهای پیش بینی سهام بر اساس نوع اطلاعاتی که هر رویکرد به آن متکی است ، به تجزیه و تحلیل اساسی و تجزیه و تحلیل فنی طبقه بندی می شوند. در تجزیه و تحلیل اساسی ، سرمایه گذاران با بررسی فروش ، سود ، بدهی ها و سود سهام یک شرکت ، ارزش ذاتی سهام را تخمین می زنند. اطلاعات مورد استفاده برای تجزیه و تحلیل بنیادی به صورت دوره ای توسط شرکت ها منتشر می شود و هنگام توضیح لحظات قیمت با فرکانس بالا ، از کاربرد کمی استفاده می شود. مدل های مبتنی بر تجزیه و تحلیل بنیادی معمولاً در ادبیات کمتر یافت می شوند زیرا ساخت مدلهایی که حرکات قیمت را با استفاده از شاخص های اساسی درک می کند سخت تر است (Bustos & Pomares-Quimbaya ، 2020). در حالی که ، تجزیه و تحلیل فنی سهام را با تجزیه و تحلیل روندهای آماری حاصل از فعالیت بازار مانند قیمت های تاریخی و حجم ارزیابی می کند. تجزیه و تحلیل فنی معمولاً برای پیش بینی کوتاه مدت مورد استفاده قرار می گیرد زیرا اطلاعات مورد نیاز به طور مرتب منتشر می شود.
در تحلیل تکنیکال، اطلاعات معنی داری درباره سهام با محاسبه شاخص های فنی از قیمت ها و حجم های گذشته استخراج می شود که سپس به عنوان ورودی به یک مدل پیش بینی داده می شود. افزودن این شاخص ها ممکن است منجر به اطلاعات نامربوط یا اضافی شود که نه تنها هزینه محاسباتی را افزایش می دهد، بلکه ممکن است منجر به عملکرد پیش بینی پایین تر شود. شناسایی شاخص های مالی با ارزش اطلاعاتی بالا مستلزم دانش عمیق این حوزه است که ممکن است همیشه در دسترس نباشد. علاوه بر این، عملکرد یک مدل یادگیری به شدت به روش نمایش داده بستگی دارد. بنابراین، تبدیل داده های خام قبل از وارد کردن آنها به یک مدل، اغلب عملکرد یک مدل یادگیری را بهبود می بخشد.
مانند سایر مشکلات یادگیری ماشین، پیش بینی سهام نیز شامل انتخاب ویژگی های مناسب از یک مجموعه داده شده و سپس استفاده از آنها برای آموزش یک مدل پیش بینی است. هدف پیش بینی سهام موفق دستیابی به بالاترین دقت پیش بینی با حداقل ورودی و کمترین مدل یادگیری است (Atsalakis & Valavanis, 2009). انتخاب ویژگی، تحلیلگران را قادر می سازد تا ویژگی های نامربوط و/یا زائد را از مجموعه داده حذف کنند تا ابعاد را کاهش داده و عملکرد پیش بینی را بهبود بخشند. در پیش بینی سهام (Zhong & Enke، 2017) از PCA، PCA مقاوم فازی و PCA مبتنی بر هسته برای انتخاب ویژگی استفاده کردند و دریافتند که ترکیب ANN با PCA به دقت طبقه بندی کمی بالاتر از سایر رویکردهای ارزیابی شده دست می یابد. گوندوز و همکاران(2017) از نسبت سود و Relief برای انتخاب ویژگی برای پیش بینی جهت قیمت سهام با استفاده از رگرسیون لجستیک و دستگاه تقویت گرادیان استفاده کرد. Tsai و Hsiao (2010) با الهام از عملکرد برتر رویکردهای یادگیری گروهی، ویژگی های انتخاب شده توسط PCA، GA و CART را برای پیش بینی سهام ترکیب کردند و به این نتیجه رسیدند که ویژگی های انتخاب شده توسط تقاطع بین PCA و GA دارای دقت پیش بینی کمی بهتر و خطای کمتری هستند.
اکثر مطالعات موجود معمولاً از یک تکنیک انتخاب ویژگی واحد استفاده می کنند و تمایل به پیش بینی شاخص سهام واحد یا قیمت سهام دارند. با این حال ، برخی از مطالعات همچنین در مورد بازده پیش بینی یا حرکت قیمت برای سهام های متعدد انجام شده است (سرولولی رویو و گایجرو ، 2020 ، پیکاسو و همکاران ، 2019 ، زو و کوهن ، 2018). رویکردهای موجود همچنین در نوع و تعداد متغیرهای ورودی مورد استفاده در هر مطالعه متفاوت است ، که شاخص های فنی متداول ترین آنها است (Atsalakis & Valavanis ، 2009). اخیراً ، روند فزاینده ای در استفاده از اطلاعات مربوط به مقالات خبری ، وبلاگ ها و رسانه های اجتماعی برای پیش بینی متغیرهای مالی وجود دارد. TSLDA (نگوین و شیرای ، 2015) از قیمت ها و اطلاعات تاریخی از هیئت پیام یاهو برای پیش بینی حرکت سهام استفاده کرد. در هان (هو و همکاران ، 2018) ، نویسندگان استفاده از مکانیسم توجه سلسله مراتبی را به دنباله خبری که مستقیماً از متن استخراج می شود ، پیشنهاد کردند. در Stocknet (Xu & Cohen ، 2018) ، نویسندگان قیمت های تاریخی را با توییت برای پیش بینی حرکت قیمت روز بعد ترکیب کردند.
برای پیش بینی ، هر دو مدل محاسبات آماری و نرم برای تجزیه و تحلیل بازارهای سهام مورد بررسی قرار گرفته است. مدلهای آماری مانند ARIMA (میانگین متحرک مستقل خودگردان) (براون ، 2004) ، گارچ (ناهمگونی مشروط به خودی تعمیم یافته) (بولرزلف ، 1986) و SV (نوسانات تصادفی) هنوز هم برای پیش بینی سری زمانی در اقتصاد استفاده می شوند ، عمدتا به دلیل خوب بودن آنهاخصوصیات ریاضی را درک کرده است. با این حال ، روشهای آماری فرض می کنند که بازارهای سهام خطی ، ثابت و طبیعی هستند که عملکرد و کاربرد عملی آنها را محدود می کند.
مدل های یادگیری ماشین مانند SVM ، شبکه های عصبی مصنوعی (ANN) ، سیستم های فازی و الگوریتم های ژنتیکی در پیش بینی مالی رایج شده اند ، زیرا آنها توسط داده های چند متغیره و بدون هیچ گونه فرض از پیش تعیین شده هدایت می شوند (Zhong & Enke ، 2017). در میان این روش ها ، SVM به طور گسترده ای برای پیش بینی حرکات سهام و قیمت سهام مورد استفاده قرار گرفته است (هوانگ و همکاران ، 2007 ، لین و همکاران ، 2013 ، ترافالیس و اینس ، 2000). استفاده از SVM برای پیش بینی تغییر قیمت روزانه در شاخص قیمت سهام کامپوزیت کره (KOSPI) (کیم ، 2003) هنوز یکی از استناد ترین کار در این زمینه است. ترکیب چندین روش برای توسعه راه حل های جدید نیز رواج دارد ، همانطور که (Cai et al. ، 2013 ، Ye et al. ، 2016) نویسندگان به ترتیب از تجزیه و تحلیل فنی در ترکیب با الگوریتم ژنتیکی و سیستم های فازی استفاده کردند.
توانایی ANN در معدن اطلاعات از مجموعه داده های تاریخی و استفاده مؤثر از آن برای پیش بینی آینده نیز آن را به یک انتخاب محبوب تبدیل کرده است (ژانگ و همکاران ، 2007). در یک مطالعه جدید (هنریک و همکاران ، 2019) ، نویسندگان 547 مقاله را مورد بررسی قرار دادند و دریافتند که نزدیک به 74 ٪ از مطالعات مورد بررسی حداقل از نوعی ANN برای پیش بینی سهام استفاده شده است ، و پس از آن SVM توسط 37 ٪ استفاده شده است. در یک مطالعه تطبیقی (Guresen و همکاران ، 2011) ، نویسندگان نشان دادند که ANN کلاسیک از ANN پویا بهتر است (Ghiassi et al. ، 2005) و یک مدل ترکیبی (Garch-A) (ROH ، 2007). Adebiyi و همکاران.(2014) نشان داد که تفاوت بین مقادیر پیش بینی شده ANN و ARIMA ناچیز است. اگرچه ، به نظر می رسد ANN در پیش بینی مالی عملکرد خوبی دارد ، عملکرد آنها به شدت به انتخاب بهینه از ویژگی های ورودی و ترکیبی از پارامترهای شبکه بستگی دارد. اخیراً ، مدلهای تولیدی عمیق در طبقه بندی تصویر ، استخراج متن و ترجمه محبوب شده اند ، اما در پیش بینی مالی مورد استفاده قرار نگرفته اند ، تنها استثناء Stocknet است. Stocnet از تمام ویژگی های ورودی برای آموزش مدل استفاده می کند ، جایی که برخی ممکن است بی ربط یا زائد باشند. به منظور ارائه یک مجموعه ویژگی بهینه تر ، ما انتخاب ویژگی ها را با StockNet برای بهبود عملکرد پیش بینی آن ترکیب می کنیم. بر خلاف مطالعات موجود ، که از یک تکنیک انتخاب ویژگی واحد استفاده می کنند (Gündüz et al. ، 2017 ، Lin et al. ، 2013 ، Zhong and Enke ، 2019) ، ما ویژگی های انتخاب شده توسط سه رویکرد مختلف رتبه بندی ویژگی را با فرض جدا کردن در مورد رگرسیون ترکیب می کنیم. تابع پیوند متغیرهای ورودی و خروجی. به بهترین دانش ما ، این اولین تلاش برای بررسی تأثیر کاهش ابعاد بر مدل تولید عمیق برای پیش بینی روند سهام است.
در این مطالعه ، ما یک مجموعه گسترده از 44 شاخص فنی را محاسبه می کنیم و از یک روش انتخاب ویژگی چند فیلتر (HAQ و همکاران ، 2019) برای انتخاب یک مجموعه ویژگی بهینه استفاده می کنیم که می تواند به طور مؤثر مجموعه داده های اصلی را نشان دهد. رویکرد انتخاب ویژگی به طور مستقل L 1 رگرسیون لجستیک منظم (L 1-LR) ، دستگاه بردار پشتیبانی (SVM) و Forest Random (RF) را برای شناسایی و انتخاب یک زیر مجموعه ویژگی بهینه اعمال می کند. مجموعه ویژگی های تولید شده سپس برای طبقه بندی آنها در کلاس های بالا یا پایین به یک مدل تولیدی عمیق تغذیه می شود. مدل پیش بینی مبتنی بر StockNet (Xu & Cohen ، 2018) است و از Autoencoders های متنوع (VAE) (Kingma & Welling ، 2013) استفاده می کند تا به طور مکرر عوامل محرک و حرکات سهام را از داده های موجود در سهام استخراج و استخراج کند. این پیش بینی های کمکی میزان تأثیر متفاوتی در پیش بینی هدف اصلی دارند ، بنابراین مکانیسم توجه برای تمایز بین این پیش بینی های کمکی اضافه می شود. نتایج نشان می دهد که ترکیب ویژگی های انتخاب شده توسط رویکردهای انتخاب ویژگی های چندگانه جدا شده ، عملکرد پیش بینی StockNet را بهبود می بخشد.
قسمت باقیمانده کاغذ به شرح زیر است. در بخش 2 ، داده ها و مراحل پیش پردازش مورد استفاده برای محاسبه شاخص های فنی را شرح می دهیم. در بخش 3 ، تکنیک های انتخاب ویژگی شرح داده شده است ، و بخش 4 جزئیات مربوط به مدل پیش بینی را ارائه می دهد. در بخش 5 ، تنظیم آزمایشی ماژول انتخاب ویژگی و مدل پیش بینی مورد بحث قرار گرفته است. بخش 6 نتایج را با رویکردهای پایه و نتیجه گیری در بخش 7 مقایسه می کند.
قطعه قطعه
توضیحات داده و پیش پردازش
در این مطالعه ، ما از مجموعه داده های Xu و Cohen (2018) استفاده می کنیم ، که حاوی حرکات قیمت روزانه 88 سهام ذکر شده NASDAQ از 01/01/2014 تا 01/01/2016 است. مجموعه داده ها شامل 8 سهام از کنگلومرات ها و 10 سهام برتر با اندازه سرمایه از هر یک از 8 صنایع یعنی مواد اساسی ، خدمات ، مراقبت های بهداشتی ، خدمات ، کالاهای مصرفی ، امور مالی ، کالاهای صنعتی و فناوری است. هر سهام دارای یک روزانه باز ، کم ، زیاد ، نزدیک ، تنظیم شده و حجم است. تعداد کل مشاهدات روزانه
انتخاب ویژگی
شناسایی و انتخاب ویژگی های ورودی با توانایی های پیش بینی بالا مدتهاست که یک موضوع تحقیق در داده کاوی بوده است. انتخاب ویژگی ها با هدف فیلتر کردن متغیرهای ورودی بی ربط و اضافی برای کاهش پیچیدگی و بهبود دقت پیش بینی انجام می شود. فرض کنید ،مجموعه داده های خام را نشان می دهد ، جایی که x i یک بردار d بعدی است و y i برچسب کلاس مربوطه است. نمونه من از مجموعه داده ها توسط x i 1 ، x i 2 ،… ، x i d ، y i ، و فرض بر این است که ما چنین i. i. d را داریم. مشاهداتویژگی
توصیف مدل
از آنجا که پیش بینی سهام یک مشکل سری زمانی است ، فرض بر این است که پیش بینی حرکت سهام در یک روز معاملاتی خاص D از پیش بینی آن برای روزهای تاخیر خود بهره مند می شود (Xu & Cohen ، 2018). برای این منظور ، ما ابتدا D روزهای معاملاتی واجد شرایط را که در یک نمونه ذکر شده است ، به عبارت دیگر روزهای معاملاتی واجد شرایط در یک بازه زمانی شناسایی می کنیم [D - △ D ، D - 1]. سپس آن سوابق تاخیر را برای تولید ورودی رمزگذاری شده جدید از فرم x = گنجانید.و توالی مربوط از پیش بینی های هدف از
آزمایش
پس از محاسبه شاخص های فنی ، آنها با آموزش L 1-LR ، SVM و RF با استفاده از مجموعه آموزش خام رتبه بندی می شوند. ضریب رگرسیون به دست آمده برای هر متغیر ورودی اندازه گیری اهمیت مرتبط با آن ویژگی است. هر روش با استفاده از اعتبار سنجی متقاطع K ، که در آن مقدار K پنج است ، ارزیابی می شود. پارامترهای بیش از حد λ برای L 1-LR ، C برای SVM و NTREE برای RF با استفاده از GridSearch بهینه می شوند. از آنجا که برخی از ویژگی های ورودی بعداً در مرحله خوشه بندی کاهش می یابد ، ما نسبتاً تنظیم کرده ایم
نتایج و بحث
در این بخش ، ابتدا نتایج رویکرد انتخاب ویژگی و سپس نتایج مدل پیش بینی سهام را مورد بحث قرار می دهیم. در شکل 3 ، اقدامات اهمیت برای چهل و چهار شاخص فنی در مجموعه داده های خام ارائه شده است. شکل به وضوح تغییرات در اقدامات اهمیت را نشان می دهد زیرا هر روش فرض خود را در مورد رابطه اساسی بین متغیرهای ورودی و خروجی به کار می برد. مثلا. MacDH ، Trange و Co در حالی که CCI ، MACDH را در رتبه آموزنده ترین قرار داده اند
نتیجه
پیش بینی سهام یک موضوع مهم تحقیق است و به دلیل مزایای بالقوه پولی آن مورد توجه قابل توجهی قرار گرفته است. پیش بینی دقیق حرکات قیمت سهام به شدت به انتخاب ویژگی های نماینده و تهیه یک مدل پیش بینی مناسب بستگی دارد. مانند سایر کارهای یادگیری ماشین ، انتخاب ویژگی بخش مهمی از پیش بینی سهام است ، اما مطالعات موجود معمولاً از یک تکنیک انتخاب ویژگی های واحد استفاده می کند ، که ممکن است تمام فرضیات مربوط به آن را در نظر نگیرد
بیانیه مشارکت در نویسندگی اعتباری
Anwar ul HAQ: مفهوم سازی ، بررسی ، روش شناسی ، نوشتن - پیش نویس اصلی. Adnan Zeb: نوشتن - بررسی و ویرایش ، اعتبار سنجی. Zhenfeng Lei: منابع ، تجسم ، اعتبار سنجی. Defu Zhang: تجزیه و تحلیل رسمی ، نوشتن - بررسی و ویرایش ، نظارت.
اعلام علاقه رقیب
نویسندگان اعلام می كنند كه آنها هیچ منافع مالی رقیب یا روابط شخصی را كه به نظر می رسد بر اثر گزارش شده در این مقاله تأثیر می گذارد ، ندارند.
سیگنال های تجاری...
ما را در سایت سیگنال های تجاری دنبال می کنید
برچسب :
نویسنده : عبدالله بوتیمار
بازدید : <-PostHit->
تاريخ : دوشنبه
9 مرداد
1402 ساعت: 13:40