اختيار الميزة في التعلم الآلي

مرحبا هبر!

قمنا في Reksoft بترجمة مقالة Feature Selection in Machine Learning إلى اللغة الروسية . نأمل أن يكون مفيدًا لكل من لا يبالي بالموضوع.

في العالم الحقيقي ، لا تكون البيانات نظيفة دائمًا كما يعتقد عملاء الأعمال في بعض الأحيان. هذا هو سبب الطلب على التنقيب عن البيانات والجدل حول البيانات. يساعد في تحديد المعاني والأنماط المفقودة في البيانات المنظمة للاستعلام والتي لا يمكن للبشر التعرف عليها. يعد التعلم الآلي مفيدًا للعثور على هذه الأنماط واستخدامها للتنبؤ بالنتائج باستخدام اتصالات البيانات المكتشفة.

لفهم أي خوارزمية ، تحتاج إلى إلقاء نظرة على جميع المتغيرات في البيانات ومعرفة ما تمثله هذه المتغيرات. هذا أمر بالغ الأهمية لأن الأساس المنطقي للنتائج يعتمد على فهم البيانات. إذا كانت بياناتك تحتوي على 5 أو حتى 50 متغيرًا ، فيمكنك فحصها جميعًا. ماذا لو كان هناك 200 منهم؟ ثم لن يكون هناك وقت كافٍ لفحص كل متغير على حدة. علاوة على ذلك ، لا تعمل بعض الخوارزميات مع البيانات الفئوية ، ومن ثم يجب قياس جميع الأعمدة الفئوية (قد تبدو كمية ، لكن المقاييس ستظهر أنها قاطعة) لإضافتها إلى النموذج. وهكذا يزداد عدد المتغيرات ويوجد منها حوالي 500 متغير ماذا تفعل الآن؟ قد تعتقد أن تقليل الأبعاد هو الحل. تقلل خوارزميات تقليل الأبعاد من عدد المعلماتلكنها تؤثر سلبًا على التفسير. ماذا لو كانت هناك تقنيات أخرى تقضي على السمات بينما لا تزال تجعل البقية سهلة الفهم والتفسير؟

اعتمادًا على ما إذا كان التحليل يعتمد على الانحدار أو التصنيف ، قد تختلف خوارزميات اختيار الميزة ، ولكن تظل الفكرة الرئيسية لتطبيقها كما هي.

المتغيرات المترابطة بقوة

توفر المتغيرات التي ترتبط ارتباطًا وثيقًا ببعضها البعض النموذج بنفس المعلومات ، وبالتالي ، ليس من الضروري استخدامها جميعًا للتحليل. على سبيل المثال ، إذا كانت مجموعة البيانات تحتوي على السمتين "وقت عبر الإنترنت" و "حركة المرور المستخدمة" ، فيمكننا افتراض أنهما سيكونان مرتبطين إلى حد ما ، وسنرى ارتباطًا قويًا حتى إذا اخترنا عينة بيانات غير متحيزة. في هذه الحالة ، هناك حاجة إلى واحد فقط من هذه المتغيرات في النموذج. إذا تم استخدام كلاهما ، فسيكون النموذج أكثر من اللازم ومنحازًا لميزة واحدة معينة.

قيم ف

, , — . p-, . , p-, - , , , , (target).

— , . , , , . , , . . p-, . , , ( ).

, . . ( ), . p- . .

RFE / . , « » , ; ( 200-400), , - , . RFE . . . , RFE , ( , , , ).

, ( p-) ( , ). , , Random Forest, LightGBM XG Boost, , « ». , .

(bias) (variance). , (overfit) . , . , . ! :

L1 — : (.. ). , , , (.. , ).

L2 — Ridge: Ridge . Ridge , .

Ridge , , , Elastic-Net.

, : . — , , , .

! !




All Articles