الدليل النهائي لمهنة الذكاء الاصطناعي: كيفية اختيار التخصص ، ورفع المستوى ، والعثور على وظيفة رائعة





في 3 أغسطس ، تحدث سيرجي شيركين ، أخصائي التعلم الآلي والذكاء الاصطناعي ، على شبكاتنا الاجتماعية.



شارك سيرجي في أتمتة التقنيات المالية وقواعد البيانات في سبيربنك وروزبانك ، وبناء نماذج مالية قائمة على التعلم الآلي والعمل التحليلي في Equifax. تتنبأ بمشاهدة التلفزيون باستخدام أساليب الذكاء الاصطناعي في Dentsu Aegis Network Russia. محاضر زائر في المدرسة العليا للاقتصاد (برنامج الماجستير في الاتصال المستند إلى البيانات).



يستكشف سيرجي أيضًا الحوسبة الكمومية كما هي مطبقة على الذكاء الاصطناعي والتعلم الآلي. وهو في طليعة كليات الذكاء الاصطناعي وتحليلات البيانات الضخمة وهندسة البيانات في جامعة جيك ، حيث يعمل عميدًا ومحاضرًا.



نشارككم نص البث والتسجيل.



***



اسمي سيرجي شيركين ، اليوم سنتحدث عن الذكاء الاصطناعي. سنناقش المسارات الأولية - كيفية الدخول في الذكاء الاصطناعي ، وكيفية تعلم الموضوعات الضرورية ، وما هي الدورات التي يجب أخذها ، وما الأدب الذي يجب قراءته ، وكيفية بدء مهنة. أيضا حول اتجاهات مختلفة.



يمكن أن تكون موضوعات اليوم ممتعة ليس فقط للمبتدئين ، ولكن أيضًا للمبرمجين ذوي الخبرة - على سبيل المثال ، كيفية الانتقال من مجال البرمجة إلى مجال التعلم الآلي والذكاء الاصطناعي والشبكات العصبية. اعتمادًا على التكنولوجيا التي ينخرط فيها الشخص واللغات التي يتعلمها ، يمكن أن يحدث الانتقال العملي إلى هذا المجال بطرق مختلفة. هناك الكثير من التخصصات في الذكاء الاصطناعي.



هل توصي بمواد للانغماس في الذكاء الاصطناعي؟



إذا كنت مبتدئًا تمامًا ، فمن الأفضل أن تبدأ بتعلم Python. طريقة سريعة للقيام بذلك ، كما رأيت مع مبتدئين آخرين ، هي PythonTutor.ru. هناك تحتاج إلى دراسة النظرية وحل المشكلات - على الأقل 70 بالمائة قد تبدو المشكلات صعبة إذا لم تكن قد قمت بالبرمجة على الإطلاق من قبل.



الخطوة التالية هي لغة استعلام SQL ، وسيساعدك موقع SQL-EX.ru هنا: توجد تمارين على SQL. يتم تنظيمها على مراحل: مرحلة التدريب ، مرحلة الحصول على تصنيف - يمكنك أن تأخذ مكانًا معينًا في التصنيف. هنا سوف تتعلم كيفية العمل مع قواعد البيانات. في موازاة ذلك ، هناك مواد تعليمية من المؤلف Moiseenko ، وهي سهلة الدراسة للغاية.



إذن فأنت بحاجة إلى دراسة التعلم الآلي نفسه. خوارزميات مختلفة تتراوح بين الانحدار الخطي والانحدار اللوجستي وصولاً إلى تعزيز التدرج. هناك الكثير من المواد هنا. ثم يمكنك الذهاب إلى الشبكات العصبية - لرؤية الكمبيوتر ، من أجل البرمجة اللغوية العصبية ؛ سوف تتعلم الشبكات العصبية التلافيفية والمتكررة والأكثر تقدمًا - المحولات ، بيرت ، إلخ.



سأخبرك عن تطور الذكاء الاصطناعي. إذا نظرت إلى تاريخ هذا التطور حتى عام 2010 ، ستجد أنه هزيل نوعًا ما: بالطبع ، كانت هناك بعض الإنجازات العظيمة في الذكاء الاصطناعي والمجالات ذات الصلة - في البيانات الضخمة ، على سبيل المثال ، والعديد من الخوارزميات الرياضية كانت جاهزة. لكن لم تكن هناك قوة حوسبة وبيانات كافية للذكاء الاصطناعي. منذ عام 2010 - أو بالأحرى 2012 - انفجر الذكاء الاصطناعي. في عام 2012 ، في إحدى المسابقات ، هزمت الشبكة العصبية خوارزميات الرؤية الآلية الكلاسيكية وتعلمت التعرف على حوالي 1000 فئة من الصور.



بعد هذا الإنجاز ، ظهرت فجوة كبيرة بين المنافسين الذين استخدموا الرؤية الحاسوبية الكلاسيكية ، وبدأ تطوير الشبكات العصبية الاصطناعية. ظهرت العديد من هياكل الشبكات التلافيفية ، وحدث اختراق في رؤية الكمبيوتر. في السابق ، كان يُعتقد أن تمييز الشبكة العصبية بين صورة قطة وكلب أمر صعب للغاية ، ولكن في عام 2012 ، تعلمت الشبكات العصبية التعرف على الصور وتصنيفها بشكل أسرع وأكثر دقة من البشر.



في الوقت الحاضر ، قطعت رؤية الكمبيوتر خطوات كبيرة. في موازاة ذلك ، تتطور معالجة اللغة الطبيعية - NLP. مع ظهور نموذج GPT-3 ، الذي أنشأته OpenAI قبل شهرين ، تعلمت الشبكة العصبية إنشاء نص (بالإضافة إلى الموسيقى والتسلسلات الأخرى). هذه إحدى الخطوات الرئيسية في البرمجة اللغوية العصبية - على الأرجح ستزدهر في هذا العقد. ستظهر روبوتات الدردشة التي ستكون قادرة على الحفاظ بشكل كامل على حوار مع شخص ما.



SQL و Python قليلا. بعد دورات في علم البيانات ، بدون خبرة ، هل يمكنك الحصول على وظيفة على الفور كعالم بيانات ، أو هل تحتاج إلى العمل كمحلل قاعدة بيانات أولاً؟



أصبح الانخراط في علم البيانات أصعب مما كان عليه قبل 5 سنوات. ثم كان من الممكن المشاركة في بعض المسابقات في Kaggle والحصول على مكان - ليس بالضرورة الأول ، على سبيل المثال ، في أول 10٪ - في بعض المسابقات المثيرة للاهتمام ، وليس على مستوى التدريب. بعد ذلك ، كان من الممكن بالفعل الذهاب إلى الشركات ، والإجابة على أسئلة بسيطة حول التعلم الآلي ، ويمكن تعيين مثل هذا الشخص. كان هناك عدد قليل من المتخصصين.



الآن أصبح كل شيء أكثر تعقيدًا ، لذا في بعض الأحيان لا ينجح الأمر بعد أن تدرس التعلم الآلي والرياضيات للحصول على الوظيفة التي تحلم بها - متخصص في الذكاء الاصطناعي أو عالم بيانات.



طريقة جيدة للذهاب هي العمل مع محلل بيانات أو قاعدة بيانات أو محلل بيانات أولاً. الحقيقة هي أنه عليك أن تتعلم كيفية المعالجة المسبقة ، وتنظيف البيانات ، وتطبيق الإحصائيات. يمكن أن تكون هذه تقنيات قواعد البيانات ، بما في ذلك Python. عندما تكتسب خبرة ، يكون لديك خلفية ، ثم يمكنك ، باستخدام معرفتك بمكتبات علوم البيانات في Python - Pandas ، NumPy ، SKLearn ، التقدم لوظيفة متعلقة بالذكاء الاصطناعي أو علم البيانات.



ما الفرق بين متخصصي الذكاء الاصطناعي وعلماء البيانات؟



هل يحتاج الذكاء الاصطناعي إلى C ++؟ ما الذي تنصح به للدراسة لكي تصبح خبيرًا في رؤية الكمبيوتر؟



يوجد الآن قسم في الوظائف الشاغرة في الشركات الغربية: بالإضافة إلى عالم البيانات ، هناك وظائف شاغرة منفصلة لمتخصصي الذكاء الاصطناعي. في السابق ، كان من المفهوم أن عالم البيانات هو شخص يشارك في تحليل البيانات المجدولة ومهام رؤية الكمبيوتر ومهام البرمجة اللغوية العصبية. كان هناك أيضًا وظيفة شاغرة في محلل بيانات - فقد دفعت أقل ، على الرغم من أنها كانت أيضًا مرموقة ؛ كان على مثل هذا الشخص تحليل البيانات ، ولكن لا يتعمق في الذكاء الاصطناعي المتعلق بالكلام والنصوص والصور ، ويعمل بشكل أساسي مع البيانات المجدولة. ثم كان هناك مزيج من الوظائف الشاغرة: في الوادي ، تم استدعاء جميع محللي البيانات بعلماء البيانات ، بما في ذلك أولئك الذين يعملون فقط مع البيانات المجدولة ، وأولئك الذين يعملون مع البرمجة اللغوية العصبية ورؤية الكمبيوتر. وفي الوقت نفسه ، بعد ذلك بقليل ، بدأوا في تخصيص متخصص منفصل للذكاء الاصطناعي.في الشركات الروسية ، لا يوجد عادةً مثل هذا التقسيم ، على الرغم من وجود وظائف شاغرة متخصصة في بعض الأحيان - على سبيل المثال ، "NLP / مهندس رؤية الكمبيوتر". من المستحسن أن يكون عالم البيانات قادرًا على القيام بكل شيء شيئًا فشيئًا.



حول C ++: أبسطها هي Python. بمعنى ، إذا كنت متخصصًا في الذكاء الاصطناعي ، فيجب عليك استخدام TensorFLow أو Keras أو PyTorch - فهي تأتي أولاً الآن. ولكن إذا كتبت المزيد من البرامج منخفضة المستوى - على سبيل المثال ، إذا كانت الوظيفة مرتبطة بمركبات آلية ، فغالبًا ما ستحتاج إلى رمز C ++. بايثون ليست دائما سريعة. عادةً ما تتم كتابة مكتبات التعلم الآلي بلغة C ++ ، ولكن في بعض الأحيان تحتاج إلى كتابة البرنامج بأكمله بلغة C ++: بالإضافة إلى النماذج نفسها ، يمكن أن يعمل المنطق (if-else ، وما إلى ذلك) ، ويعمل بشكل أسرع في C ++. بالطبع ، من الصعب الوصول إلى مثل هذا المنصب الشاغر على الفور ، ومن الأفضل العمل أولاً في مكان يكون فيه ما يكفي من Python - على سبيل المثال ، حيث توجد تحليلات الوسائط الاجتماعية مع تحليل الصور ، دون الحاجة إلى معالجة سريعة.



لكي تصبح متخصصًا ، تحتاج إلى تعلم كيفية العمل مع مكتبات الشبكات العصبية ، ودراسة مكتبة OpenCV الخاصة ببايثون - وهي متاحة أيضًا لـ C ++. سيعطيك هذا صندوق الأدوات. من المستحسن أيضًا أن تكون قادرًا على العمل مع مكتبة NumPy ، لفهم الرياضيات ذاتها لتحليل الصور - أي لفهم الجبر الخطي وحساب التفاضل والتكامل ، وأيضًا معرفة بنية الشبكات العصبية. إلخ.



لماذا تطرح مقابلات ML أسئلة حول كيفية حل النزاعات في جدول التجزئة؟



لماذا تعتبر هذه علامة على التوظيف بينما يمكنك البحث عنها في Google على طول الطريق؟



ليس كل شاغر يطلب هذا. إذا ذهبت إلى تحليلات البيانات الجدولية ، فمن غير المرجح أن يُطلب منك ذلك. سيسألون بالتأكيد عما إذا كنت تتقدم للحصول على مكان مهندس ML: أي أنك لا تنشئ نماذج ML فحسب ، بل تقوم بتنفيذها أيضًا ، وتحتاج إلى معرفة الخوارزميات وهياكل البيانات. وإذا كنت تطور شيئًا مثل سيارة آلية ، فحينئذٍ أكثر من ذلك: عليك أن تكتب رمزًا بمستوى عالٍ ومنخفض ، وهذه المعرفة ضرورية. وأحيانًا تكون هذه المعرفة مطلوبة في تحليل البيانات الجدولية - لنفترض أنك تكتب وحدة نمطية لهذا في C ++.

إذا لم تكن مستعدًا بعد لمثل هذه الوظائف الشاغرة ، يمكنك إجراء المزيد من المقابلات. على سبيل المثال ، إذا ذهبت للحصول على وظيفة كعالم بيانات في أحد البنوك ، فسيكون هناك عدد أقل من هذه الأسئلة.



لقد كنت أكتب بلغة بايثون منذ 10 سنوات ، لكني لم أحصل على تعليم عالي. ما مدى صعوبة دخول عالم الذكاء الاصطناعي دون أن تكون ذكيًا؟



مطلوب رياضيات أعلى. سيتعين عليك أخذ دورات أو دراسة الأدب ، وستكون هذه عملية طويلة. ستحتاج إلى تدريب في الجبر الخطي وحساب التفاضل والتكامل ونظرية الاحتمالات والإحصاء الرياضي. من الواضح أن المنهج الدراسي المعتاد لا يكفي لدراسة الذكاء الاصطناعي ؛ بالطبع ، البرامج مختلفة - في بعض المدارس وفي الصف العاشر ، يتم تغطية موضوعات من الجامعات ، لكن هذا نادرًا ما يحدث.



أحداث تدريب Pandas و SKLearn و Catboost و Seaborn و Kaggle - 3٪ و 13٪. هل أحتاج إلى الغوص في DL ، أم يمكنني بالفعل البحث عن وظيفة؟



المكتبات تعمل بشكل جيد بالفعل. لديك بالفعل Pandas للعمل مع البيانات الجدولية ، و SKLearn لنماذج التعلم الآلي ، و Catboost لتعزيز التدرج ، و Seaborn للعرض. كانت النتائج 3٪ و 13٪ - وهذا يعني أنه إذا لم تكن هذه مسابقة تدريبية ، فعند هذه النتائج يجب أن يكون لديك بالفعل نوع من الميدالية.



التعلم العميق ليس مطلوبًا دائمًا. أعتقد أنك ربما تحاول بالفعل البحث عن وظيفة. ولكن ، إذا كنت بحاجة إلى العمل مع DL ، فلا تزال بحاجة إلى تعليم الشبكات العصبية.



ما هي مجموعة الكتب الأساسية للقراءة؟



سأقوم بعرض كتبي في نهاية البث. اخترت المجموعة الأساسية ، لا شيء متقدم بشكل خاص.



إلى أي مدى هذه المهن مطلوبة الآن؟ هل سيكون هناك العديد من الوظائف الشاغرة في عامين؟



إذا كنت تتذكر 2015-16 ، إذن ، على سبيل المثال ، لم يكن هناك أكثر من 5-10 وظائف شاغرة في عالم البيانات في Headhunter. وهذا يعني أنه كان هناك سوق شبه فارغ. بالطبع ، تمت إعادة تسمية المحللين إلى عالم بيانات ، لكن هذا أيضًا لم يكن كافيًا.



الآن يستغرق الأمر عدة مئات في وقت واحد ، إذا نظرت إلى نفس الموقع. يقولون أن هناك شواغر غير موجودة. على سبيل المثال ، في ODS - OpenDataScience - إذا نظرت ، هناك قسم منفصل للوظائف الشاغرة. بشكل عام ، في حين أن الوظائف الشاغرة لا تنتهي - أعتقد أنه في غضون عامين سيكون هناك المزيد منها فقط. لا يقتصر دور الشركات الكبيرة على هذا: فهناك شركات ناشئة وشركات صغيرة ؛ علماء البيانات مطلوبون الآن في الوكالات الحكومية - على سبيل المثال ، في مختلف الإدارات البلدية ، في خدمة الضرائب ، وما إلى ذلك.



ما هي الصناعة الأكثر طلبًا على الذكاء الاصطناعي؟



أبسط تطبيق للذكاء الاصطناعي ، حيث يمكن لاستخدامه الصريح أتمتة قدر كبير من العمل الذهني للمتخصصين ، هو في القطاع المالي. هناك عدد كبير من البنوك. يحتاج كل منهم ، على سبيل المثال ، إلى تقييم الجدارة الائتمانية للمقترضين - أي لتحديد ما إذا كان الأمر يستحق إصدار قرض بمعايير مختلفة ، وما إذا كان الشخص يبالغ في تقدير قوته وما إذا كان سيتمكن من سداد القرض. هذا هو الاستخدام الأكثر وضوحًا للذكاء الاصطناعي.



ثم التسويق ، وبناء الحملات الإعلانية: أي عندما تحتاج إلى توقع ما إذا كان الشخص سيشاهد إعلانًا (على الإنترنت ، على التلفزيون ، وما إلى ذلك). هذا أيضًا اتجاه متطور ، من المستحيل عدم أتمتة ذلك باستخدام الذكاء الاصطناعي. بالإضافة إلى ذلك ، فإن الروبوتات تتطور الآن: ليس هناك فقط روبوتات صناعية ، ولكن أيضًا روبوتات منزلية - المكانس الكهربائية الآلية وغيرها من الملحقات المنزلية ، والتي يتم تطويرها أيضًا بواسطة شخص ما. أو تطبيقات مختلفة لهاتف ذكي - بشكل عام ، هناك العديد من الصناعات ، بدءًا من الصناعة والطب وتجارة التجزئة والتمويل والتسويق وتنتهي بالترفيه. على سبيل المثال ، يمكن أيضًا استخدام الذكاء الاصطناعي في الألعاب.



مائة أكثر تقديرًا عند التقدم لوظيفة في علم البيانات: معرفة الرياضيات ، فهم خوارزميات محددة ، خبرة في العمل؟



حاصل على درجة الماجستير التقني وسنة من العمل كمحلل بيانات في الاستشارات.



لديك خلفية جيدة - جامعة تقنية ، سنة من العمل كمحلل بيانات. إذا كنت قد درست التكنولوجيا بالفعل وتعرف كيفية البرمجة ، فمن السهل الدخول في علم البيانات. إذا كنت قد عملت في تحليل قاعدة البيانات وتعرف على SQL ، فهذه ميزة كبيرة ، وإذا أضفت البرمجة والتعلم الآلي ، فهذه مجموعة جيدة جدًا.



سأتحدث عن كيفية بناء نماذج التعلم الآلي في العمل. الشركة التي أعمل بها هي شركة Dentsu Aegis ، وهي شركة مشهورة جدًا ، خاصة بين أولئك الذين يعملون في مجال التسويق. إنها أفضل 5 مجموعة اتصالات في العالم ؛ يقع مقرها الرئيسي في طوكيو ولها مكاتب في 145 دولة. الفرع الروسي - Dentsu Aegis Network Russia. يعمل في روسيا منذ 25 عامًا وهو رائد في مجال الابتكارات الإعلامية.



سأخبرك عن المنطقة التي أنا مسؤول عنها كعالم بيانات. هذا هو بالضبط التطبيق الذي تحدثت عنه باعتباره الأكثر وضوحًا في التطبيق العملي. يساعد الذكاء الاصطناعي في التسويق على أتمتة العديد من مهام المتخصصين ، ويتنبأ أحدهم بكيفية عرض أنواع مختلفة من المحتوى من قبل الجماهير المستهدفة المختلفة. سوف أخبركم أكثر عن إحدى مهامي الفورية - التنبؤ بمشاهدة التلفزيون.



يمكن أن يصل الجمهور إلى عدة مئات ، ومن أجل التنبؤ بهم يدويًا ، سيتطلب عمل عشرات المتخصصين. إنه أمر ساحق. كمية كبيرة جدًا من البيانات - تصل إلى مليارات الصفوف في الجداول. لا تحتاج فقط إلى الاهتمام ببناء نموذج التعلم الآلي ، ولكن أيضًا بجعله يعمل بسرعة. لمثل هذا العمل ، تحتاج إلى معرفة قواعد البيانات العلائقية وغير العلائقية جيدًا ، والعمل مع Linux ، ومهارات التطوير ، وفهم بنية التطبيق بشكل عام ، والبنية التحتية لتكنولوجيا المعلومات للشركة ، ومعرفة Python جيدًا ، وربما C ++.

عندما نبني توقعًا لمشاهدات التلفزيون ، نستخدم أساليب التعلم الآلي الحديثة. بالنسبة للبيانات المجدولة ، فهذه هي تعزيز التدرج والغابات العشوائية. إذا تم تحليل النص ، فإننا نستخدم الشبكات العصبية ؛ بجانبهم - نمذجة الموضوع ، TF-IDF وطرق البرمجة اللغوية العصبية الشائعة الأخرى.



نحن نستخدم تعزيز التدرج لأننا إذا توقعنا استخدام البيانات المجدولة ، فإن تعزيز التدرج يتقدم على جميع الخوارزميات المعروفة في العمل مع هذه البيانات. في Kaggle ، بدءًا من عام 2018 ، تم تحقيق جميع الإنجازات الرئيسية في المسابقات باستخدام البيانات المجدولة بدقة بمساعدة تعزيز التدرج. ثم تحول معظم kegglers إلى XGBoost - كانت أول مكتبة معروفة لتعزيز التدرج ، وبعد ذلك أتقن العديد من LightGBM من Microsoft أو CatBoost من Yandex. بالنسبة لمهمة التنبؤ بمشاهدة التلفزيون ، فإن استخدام السلاسل الزمنية مناسب أيضًا تمامًا ، ولكن هذه الأساليب لا تعمل دائمًا بشكل جيد - تظهر الأحداث غير المتوقعة بشكل دوري والتي تحتاج إلى الاستجابة أو توقعها في الوقت المناسب. في بعض الأحيان تكون هناك فترات غير طبيعية كبيرة - من عدة أيام إلى شهور: على سبيل المثال ،كان لكأس العالم 2018 FIFA تأثير كبير على المشاهدات. أصبح الحجر الصحي أيضًا فترة شاذة: بدأ الناس يقضون وقتًا أطول في المنزل ويشاهدون المزيد من التلفزيون. هذا ، أيضًا ، يجب أن يؤخذ في الاعتبار ، متوقعًا. بشكل عام ، تعد هذه الفترة نوعًا من التحدي للتعلم الآلي والذكاء الاصطناعي ، لأنك تحتاج إلى مراقبة النماذج باستمرار والتحكم فيها حتى تعمل بشكل صحيح. بالإضافة إلى الفترات غير الطبيعية ، تتأثر التوقعات بالعطلات والظروف الجوية والتغيرات في الاتجاهات في وجهات نظر برامج وقنوات محددة. نتيجة لذلك ، أصبحت النماذج معقدة للغاية ، لأنه من الضروري مراعاة جميع الخيارات الممكنة ، مع مراعاة أو توقع الانحرافات والانحرافات.هذا ، أيضًا ، يجب أن يؤخذ في الاعتبار ، متوقعًا. بشكل عام ، تعد هذه الفترة نوعًا من التحدي للتعلم الآلي والذكاء الاصطناعي ، لأنك تحتاج إلى مراقبة النماذج باستمرار والتحكم فيها حتى تعمل بشكل صحيح. بالإضافة إلى الفترات غير الطبيعية ، تتأثر التوقعات بالعطلات والظروف الجوية والتغيرات في الاتجاهات في وجهات نظر برامج وقنوات محددة. نتيجة لذلك ، أصبحت النماذج معقدة للغاية ، لأنه من الضروري مراعاة جميع الخيارات الممكنة ، مع مراعاة أو توقع الانحرافات والانحرافات.هذا ، أيضًا ، يجب أن يؤخذ في الاعتبار ، متوقعًا. بشكل عام ، تعد هذه الفترة نوعًا من التحدي للتعلم الآلي والذكاء الاصطناعي ، لأنك تحتاج إلى مراقبة النماذج باستمرار والتحكم فيها حتى تعمل بشكل صحيح. بالإضافة إلى الفترات غير الطبيعية ، تتأثر التوقعات بالعطلات والظروف الجوية والتغيرات في الاتجاهات في وجهات نظر برامج وقنوات محددة. نتيجة لذلك ، أصبحت النماذج معقدة للغاية ، لأنه من الضروري مراعاة جميع الخيارات الممكنة ، مع مراعاة أو توقع الانحرافات والانحرافات.التغييرات في الاتجاهات في وجهات نظر برامج وقنوات محددة. نتيجة لذلك ، أصبحت النماذج معقدة للغاية ، لأنه من الضروري مراعاة جميع الخيارات الممكنة ، مع مراعاة أو توقع الانحرافات والانحرافات.التغييرات في الاتجاهات في وجهات نظر برامج وقنوات محددة. نتيجة لذلك ، أصبحت النماذج معقدة للغاية ، لأنه من الضروري مراعاة جميع الخيارات الممكنة ، مع مراعاة أو توقع الانحرافات والانحرافات.



بطبيعة الحال ، لا تُترك النماذج لنفسها - فاختبارها وضبطها ومراقبتها جارية باستمرار. لكن ليست النماذج فقط هي المهمة: هناك خطوة مهمة أخرى وهي إنشاء الميزات. أولاً ، هذه علامات تتعلق بوقت العرض: الوقت من اليوم ، واليوم من الأسبوع ، والموسم ، إلخ. ثانيًا ، هناك سمات متعلقة بالمحتوى. في الوقت نفسه ، يجب على المرء أن يفهم أنه إذا تم بث البرنامج ليلاً ، فبغض النظر عن المحتوى المثير للاهتمام ، لن يكون هناك عدد مشاهدات أكثر من وقت الذروة. يمكن أن تختلف أهمية الميزات ، لكن الجماهير المختلفة ستختار محتوى مختلفًا. قد يعتمد على الجنس والعمر والوضع الاجتماعي.



تعد هندسة الميزات من أكثر المراحل التي تستغرق وقتًا طويلاً في العمل مع البيانات: معالجة الميزات أو إنشائها. يتطلب هذا الجزء من علم البيانات الكثير من الخبرة: إما أنه لا توجد وصفات معروفة مسبقًا ، أو أنها بسيطة للغاية ، وعليك التوصل إلى طرق لإعداد الميزات أثناء التنقل.



في بعض الأحيان ، توجد أمور غريبة في البيانات: لنفترض أن المشاهد يشغل التلفزيون في المساء ويغفو. اتضح أنه كان يشاهد البرامج طوال الليل. هذا أحد الأمثلة على الضوضاء في البيانات - تبدو البيانات دقيقة ، لكن يبدو أنها ليست كذلك ، وتحتاج إلى تعلم التخمين ، على الرغم من صعوبة ذلك. بالإضافة إلى ذلك ، عادة ما يتم عرض عدد قليل جدًا من الإعلانات في الليل.



عندما نبني نموذجًا ، لا نحتاج فقط إلى جعله يعمل ، ولكن أيضًا توفير الاختبار والمراقبة. لهذا نحن بحاجة إلى مقاييس. نظرًا لأن لدينا مشكلة انحدار ، فستختلف مجموعة المقاييس لدينا عن مجموعة التصنيف ، على سبيل المثال. هذه هي جذر متوسط ​​الخطأ التربيعي ومعامل التحديد - كلهم ​​مهمون جدًا. هناك أيضًا مقاييس يتعين عليك إنشاؤها بنفسك لحل مشكلة تجارية معينة - على سبيل المثال ، مشكلة تحسين تكاليف حملة إعلانية. في هذه الحالة ، نحتاج إلى التنبؤ ليس فقط بتصنيف التلفزيون ، ولكن أيضًا بتغطية الحملة الإعلانية ؛ نحن لا نعمل فقط مع التعلم الآلي ، ولكن أيضًا مع الأساليب الإحصائية والاقتصادية القياسية المعقدة. هذا هو الحال عندما لا تكون معرفة التعلم الآلي كافية: فهي تتطلب حساب التفاضل والتكامل والجبر الخطي وطرق التحسين الرياضي.على عكس مهام التعلم الآلي الشائعة - الانحدار ، والتصنيف ، والتكتل - هنا عليك أن تبتكر أساليبك الخاصة ، والبرمجة وحدها ليست كافية.



أود أن أذكر برنامج المدرسة العليا للاقتصاد - الاتصالات القائمة على البيانات. اضطررت لمساعدة الطلاب في هذا البرنامج على طول الطريق ، فهم يشاركون في التسويق والمواضيع المتعلقة بالتعلم الآلي. في الواقع ، ما هو التعلم الآلي وعلم البيانات للمسوقين؟ في السابق ، لم يكن من المتوقع أن يقوم متخصص في هذا المجال ببرمجة نماذج معقدة وصنعها ، ولكنها الآن مهارة تعطي مزايا في سوق العمل. إذا كان أحد المتخصصين ، بالإضافة إلى مهنته ، قد أتقن علم البيانات ، فإنه يحصل على فرصة إما لتغيير وظائفه ليصبح عالم بيانات ، أو الاستمرار في التطور في مجال تخصصه ، ولكن بمزايا تنافسية كبيرة. سيكون الخبير في التعلم الآلي قادرًا على تقديم تنبؤات أكثر دقة ، لكن الأمر سيستغرق الكثير من التعلم.



هل يستحق الانتباه إلى دورة MIPT / Yandex Data Science ، أو ربما التطلع إلى Udacity؟



كما أفهمها ، فأنت تقصد دورة تدريبية من MIPT / Yandex على Coursera. Udacity هي منصة تعليمية قائمة بذاتها ؛ لا يوجد علم بيانات فقط ، على الرغم من أن جزءًا كبيرًا من الدورات التدريبية مخصص للذكاء الاصطناعي وعلوم البيانات. أوصي بعدم الخوض في مورد واحد ، ولكن تجربة عدة دورات. لا تتطابق الدورات بنسبة 100٪ ، يمكنك دائمًا العثور على شيء جديد لم تكن تعرفه من قبل. كما يمكن استخدام الدورة الجديدة للتكرار. على سبيل المثال ، الدورات التدريبية على GeekBrains في أقسام الذكاء الاصطناعي وهندسة البيانات وتحليلات البيانات الضخمة لدينا. بما أنني عميدهم ومعلمهم ، يمكنني أن أخبركم المزيد عنهم.



يتم دمج الدورات في الكليات - على سبيل المثال ، تضم كلية الذكاء الاصطناعي 17 دورة ، بالإضافة إلى 8 دورات إضافية. تقريبًا لكل دورة عمل عملي كمشروع نهائي. وهكذا ، فإن المتخصص الذي يتعلم عنها يحصل على الممارسة. أوصي ليس فقط بدراسة النظرية ، ولكن القيام بالمشاريع: المهارات العملية الجيدة ستقربك من إجراء المقابلات وبدء حياتك المهنية.



لقد درست بنفسي منذ بعض الوقت في Udacity - أخذت دورة تدريبية حول المركبات الآلية ، طويلة جدًا ، وكان من المخطط أن تكون 9 أشهر ، لكن الدورة استمرت حوالي عام. لقد تعلمت الكثير حقًا ، الانطباعات من المنصة إيجابية. لكن ، بالطبع ، يتم تدريس جميع الدورات باللغة الإنجليزية.



كيف تأخذ في الاعتبار الحالات الشاذة في السلاسل الزمنية وهل يمكن استبعادها؟



عملية غير سارة. لا توجد وصفة جاهزة لهذا - فأنت بحاجة إلى عدد كبير من الاختبارات. بتعبير أدق ، هناك نماذج جاهزة ، لكنها مصممة فقط لاكتشاف الحالات الشاذة في الماضي ، ولا يلزم اكتشافها فحسب ، بل يجب توقعها أيضًا.



في مثل هذه الحالات ، هناك تطورات مختلفة ، لكن عليك أن تنشئها بنفسك. أهم شيء هو تحديد ما سيحدث في المستقبل: على سبيل المثال ، زيادة مشاهدة التلفزيون على قنوات وبرامج معينة. مع مرور الوقت ، تعود هذه البيانات إلى بيانات التدريب وتحتاج إلى معالجتها بالطريقة الصحيحة.



حتى إذا لم تكن هناك حالات شاذة في المستقبل ، فقد تؤثر الانحرافات السابقة على توقعاتك. هناك طرق عديدة هنا ؛ أبسطها هو حذف البيانات الشاذة ، ولكن إذا كان هناك الكثير منها ، فقد يؤدي ذلك إلى فقدان فترة كاملة من السلسلة الزمنية من الاعتبار ، لذا فإن هذه الطريقة ليست مناسبة دائمًا.



كيف تحصل على وظيفة بدون خبرة مثبتة؟



الخبرة الجيدة هي مشاريعك. هذا يعني أنك إذا لم تقم فقط بتدريس النظرية ، بل نفذت مشروعًا على الفور - ويفضل أن يكون ذلك بتوجيه من المرشد (شخص لديه خبرة في علم البيانات والذكاء الاصطناعي) - فأنت تعرف ما تفعله. أنت لا تعرف فقط كيفية تطبيق النظرية ، أو تطبيق نموذج على البيانات الموجودة على الإنترنت ، ولكن لحل المشكلات العملية. عند العمل في مثل هذه المشاريع ، تكتسب معرفة لا يمكن الحصول عليها من الكتب والدورات ، ومساعدة المرشد لا تقدر بثمن هنا.



لنتحدث عن الكتب - لقد أعددت كومة صغيرة.



إذا كنت تعمل في علم البيانات ، فعلى الأرجح ستضطر إلى العمل في بيئة Linux. في الوقت نفسه ، لن تكون مسؤولاً - أي أنك لن تحتاج إلى معرفة عميقة جدًا - ولكن ستكون هناك حاجة إلى معرفة واثقة بهذا النظام الأساسي للمهام الإدارية البسيطة (التخطيط لإطلاق البرامج النصية أو التخلص من موارد نظام التشغيل). هذا هو المكان الذي سيساعد فيه كتاب "LINUX - Pocket Guide" لسكوت جرانيمان. يمكن دراستها في غضون يومين.



فيما يتعلق بنظرية الاحتمالات ، أوصي بكتاب جي جي بيتنر "نظرية الاحتمالات" - فهو يحتوي على كل من النظرية والمشكلات. ستكون نظرية الاحتمالات مفيدة لكل من المقابلات والعمل.

يتطلب أي شخص يعمل في مجال تكنولوجيا المعلومات مجموعة دنيا من المعرفة والمهارات. وعليه ، فإن كتاب "الحد الأدنى النظري في علوم الكمبيوتر - كل ما يحتاج المبرمج والمطور إلى معرفته" (فيلو فلادستون فيريرا) هو برنامج تعليمي في علوم الكمبيوتر.



إذا كنت تغوص في البرمجة والتطوير منخفض المستوى ، فستحتاج إلى خوارزميات. في كتاب "الخوارزميات للمبتدئين - النظرية والتطبيق لمطور" من تأليف Panos Luridas ، يتم إعطاء الخوارزميات دون الرجوع إلى لغة معينة. يوجد كتاب أطول لـ C ++ - "الخوارزميات في C ++" لروبرت سيدجويك ؛ يكون مفيدًا عندما تريد التخلص من بعض العمليات عالية المستوى التي تمتلكها Python وإنشاء خوارزميات من البداية.



إذا كنت ترغب في الحصول على فكرة عامة عن عمل المستوى الأعلى لعالم البيانات ، فإن كتاب "العمل مع البيانات في أي مجال - كيفية الوصول إلى مستوى جديد باستخدام التحليلات" من تأليف كيريل إريمينكو هو لك. لا توجد برمجة هنا. ولكن ، إذا كنت خبيرًا بالفعل ، فسيكون ذلك مفيدًا لك فقط إذا لم تكن قد عملت مع البيانات بعد.

التالي: “Data Science. علم البيانات من سكراتش لجويل جراس هو أيضًا كتاب مفيد. من نفس المنشور - "إحصاءات عملية لمتخصصي علوم البيانات. 50 مفهوماً أساسياً "بقلم بيتر بروس وأندرو بروس. هنا يمكنك أيضًا دراسة الإحصائيات.



إذا كنت ستعمل على البيانات في Python وتستخدم مكتبة Pandas ، فأنت بالتأكيد بحاجة إلى "Python and Data Analysis" بواسطة Wes McKinney - مؤلف مكتبة Pandas نفسها.

عن التعلم الآلي ، أوصي بكتابين: التعلم الآلي من تأليف Peter Flach و Python و Machine Learning بواسطة Sebastian Raska.



للتعلم العميق ، يوجد كتاب التعلم العميق في بايثون من تأليف فرانسوا شوليت ، حيث يمكنك دراسة الشبكات العصبية لمشاكل البرمجة اللغوية العصبية ورؤية الكمبيوتر. على وجه التحديد في البرمجة اللغوية العصبية ، هناك "تحليل تطبيقي لبيانات النص في بايثون" - بنجامين بنجفورد ، وريبيكا بيلبرا ، وتوني أوجيدا.



إذا كنت ترغب في تعلم TensorFlow للتعلم العميق ، فهناك كتاب يحمل نفس الاسم من تأليف بهارات رامسوندار ورضا بوساج زاده.



هناك أيضًا كتاب يشرح ببساطة وبشكل واضح مبادئ الشبكات العصبية - كتاب أندرو تراسك "Grock Deep Learning". هناك أيضًا "خوارزميات Grock" - تشرح خوارزميات جيدة يمكن أن تكون مفيدة في المقابلات والممارسة.



ماذا تسأل في المقابلات؟



هناك مجموعة صغيرة من الأسئلة. هناك أسئلة حول التعلم الآلي الكلاسيكي - يجب على المتخصص الذي يحصل على وظيفة في مجال علوم البيانات والذكاء الاصطناعي أن يعرف كيف تعمل نماذج التعلم الآلي الكلاسيكية: الانحدار الخطي واللوجستي والنسب المتدرج وتنظيم L1-L2. من الضروري أن يتحدث الشخص عن مبدأ تشغيل أشجار القرار ، وعن معيار محتوى المعلومات لمشاكل التصنيف والانحدار ؛ حتى يعرف الشخص كيف يعمل التعزيز العشوائي للغابات والتدرج. من الجيد جدًا أن يعرف الاختلافات بين نماذج تعزيز التدرج - Catboost ، و LightGBM ، و XGBoost - أي ما هو الفرق بين هذه المكتبات ، وكيف يتم تنفيذ تعزيز التدرج فيها. أنت أيضًا بحاجة إلى شخص لامتلاك مكتبات تعلم الآلة - Pandas و NumPy و SKLearn. إذا احتاج أحد المتخصصين إلى العمل مع الشبكات العصبية ، برؤية الكمبيوتر ، مع البرمجة اللغوية العصبية ،ثم ستكون هناك أسئلة حول هذه المواضيع.

يمكن أن يكون هناك الكثير من الأسئلة. إذا أجاب شخص ما بشكل جيد ، فمن المثير للاهتمام سؤاله عن بعض مشاريعه - إذا قام شخص ما بشيء ما ، فسيكون لدى الشخص الذي تمت مقابلته على الفور العديد من الأسئلة المتعلقة بالمشاريع على وجه التحديد. إذا كانت لديك مشاريع شخصية على GitHub ، أو مشاريع تعليمية من الدورات التدريبية ، فسيكون من الجيد جدًا أن تتمكن من التحدث بالتفصيل عن التقنيات والخوارزميات التي استخدمتها.



بالإضافة إلى ذلك ، أثناء المقابلة ، يمكنك طرح أسئلة أساسية مختلفة. عادة ، إذا أجاب الشخص عنها جيدًا ، فمن المرجح أنه متخصص جيد. بالطبع ، من المهم أن يكون قادرًا على إكمال مهمة الاختبار. النظرية شيء واحد ، ولكن كيف يمكن لأي شخص حل مشكلة عملية ، وبرمجتها ، وما هو الرمز الذي سيكتبه هو أمر مهم أيضًا. إذا كان الشخص يعرف النظرية بأكملها ، لكنه أرسل رمزًا لا يتم فيه استخدام OP عند الحاجة ، فهو لا يعرف كيفية تطبيق النظرية بشكل صحيح. أيضًا ، بالطبع ، يجب أن يكون الرمز نفسه قابلاً للقراءة والتعليق عليه.



أردت أيضًا أن أتحدث عن الحوسبة الكمومية ، التعلم الآلي الكمي هو مجال آخر من اهتماماتي ، لكن اليوم لن يكون لدي الوقت.



ما الذي يجب كتابته في السيرة الذاتية لتلقي دعوة لإجراء مقابلة؟



السيرة الذاتية هي لحظة حاسمة. أولاً ، لا ينبغي أن تكون متضخمة في الحجم: يجب أن تحتوي فقط على الخبرة ذات الصلة. إذا كنت تعمل في تخصص لا يتعلق بتكنولوجيا المعلومات ، فهذا ليس ضروريًا. اذكر إنجازاتك باختصار ، المشاريع ، الدورات التي قمت بها ، ذات الصلة بالوظيفة الشاغرة. اكتب ما يظهر لك كمتخصص قادر على القيام بالمهمة. وبالطبع يجب أن يكون الملخص مقروءًا.




ماذا حدث من قبل



  1. إيلونا بابافا ، كبير مهندسي البرامج في Facebook - كيفية الحصول على تدريب داخلي والحصول على عرض وكل شيء عن العمل في شركة
  2. Boris Yangel ، Yandex ML-Engineer - كيف لا تنضم إلى صفوف المتخصصين الأغبياء إذا كنت عالم بيانات
  3. الكسندر كالوشين ، EO LastBackend - كيفية إطلاق شركة ناشئة ودخول السوق الصينية والحصول على 15 مليون استثمار.
  4. , Vue.js core team member, GoogleDevExpret — GitLab, Vue Staff-engineer.
  5. , DeviceLock — .
  6. , RUVDS — . 1. 2.
  7. , - . — .
  8. , Senior Digital Analyst McKinsey Digital Labs — Google, .
  9. «» , Duke Nukem 3D, SiN, Blood — , .
  10. , - 12- — ,
  11. , GameAcademy — .
  12. , PHP- Badoo — Highload PHP Badoo.
  13. , CTO Delivery Club — 50 43 ,
  14. , Doom, Quake Wolfenstein 3D — , DOOM
  15. , Flipper Zero —
  16. , - Google — Google-
  17. .
  18. Data Science ? Unity









All Articles