أصبح تحليل المشاعر أداة قوية لمعالجة الآراء على نطاق واسع في أي مصدر نصي. تم تطوير التطبيق العملي لهذه الأداة باللغة الإنجليزية تمامًا ، وهو أمر لا يمكن قوله عن اللغة الروسية. في هذه السلسلة من المقالات ، سننظر في كيف ولأي غرض تم استخدام مناهج تحليل المشاعر للنصوص باللغة الروسية ، وما هي النتائج التي تم تحقيقها ، وما هي المشكلات التي نشأت ، وكذلك نتحدث قليلاً عن الاتجاهات الواعدة. على عكس الأعمال السابقة ، ركزت على التطبيقات التطبيقية ، وليس على المناهج نفسها وجودة التصنيف. الجزء الأول تمهيدي. سننظر في ماهية "تحليل المشاعر" ، وما هو وكيف تم استخدامه على مدى السنوات الثماني الماضية لتحليل النصوص باللغة الروسية. في الجزء الثانيدعونا نلقي نظرة فاحصة على كل من الدراسات الرئيسية الـ 32 التي وجدتها. في الجزء الثالث والأخير (مرة أخرى الأسبوع المقبل) سنتحدث عن الصعوبات المشتركة التي يواجهها الباحثون ، وكذلك الاتجاهات الواعدة للمستقبل.
ملحوظة: المقال كتب لمجلة علمية ، لذلك سيكون هناك العديد من الروابط إلى المصادر.
1 المقدمة
تحليل المشاعر هو فئة من طرق تحليل المحتوى في اللغويات الحاسوبية ، وتتمثل مهمتها الرئيسية في تصنيف النص وفقًا لمزاجه. باستخدام تحليل المشاعر ، يمكن للباحثين تعميم مشاعر النصوص واستخلاص استنتاجات حول مواضيع مختلفة. على سبيل المثال ، يسمح هذا التحليل بالتنبؤ بسوق الأوراق المالية [1] ، وحساب مؤشر الرفاهية الذاتية [2] ، والتنبؤ بنتائج الانتخابات [3] ، وتقييم رد الفعل على بعض الأحداث أو الأخبار [4]. تم تطوير تحليل المشاعر للغة الإنجليزية بشكل جيد بالفعل [5] - [7] ، بينما تلقت اللغات الأخرى ، وخاصة الروسية ، اهتمامًا أقل بكثير حتى الآن. وفقًا لدراسة أجراها Omnibus GFK [9] ، يستخدم 75.4 روسيًا (90 مليون شخص) فوق سن 16 عامًا الإنترنت. هناك الشتات الناطق بالروسية في جميع القارات ، لكن الجزء الأكبر منهم يعيش في رابطة الدول المستقلة ،معظمها في روسيا وأوكرانيا. وفقًا لدراسة أجرتها W3Techs ، تعد اللغة الروسية واحدة من اللغات الرائدة من حيث الانتشار على الإنترنت. اعتبارًا من أبريل 2020 ، كان 8.6٪ من المواقع العشرة ملايين الأكثر شعبية في العالم باللغة الروسية. لذلك ، تعتبر النصوص باللغة الروسية مصدرًا مهمًا للبيانات للتحليل التلقائي ، وخاصة تحليل المشاعر.
تم تخصيص دراسة استقصائية واحدة فقط [10] أجراها Viksna و Jekabsons لتحليل المشاعر في النصوص باللغة الروسية. العديد من الآخرين [11] - [14] ذكروا ذلك في سياق مقارنة عامة مع الأساليب القائمة. بعض الدراسات الأخرى مكرسة لجوانب محددة من تحليل المشاعر من النصوص باللغة الروسية. على سبيل المثال ، تقييم أفضل الأساليب [15] - [18] ، مقارنة معماريات الشبكة العصبية لتحليل المشاعر [19] ، [20] ، ومقارنة مجموعات مفردات اللغة الروسية المفتوحة لتقييم المشاعر [21]. ومع ذلك ، فقد ركزت كل هذه الدراسات على المناهج نفسها وسرعة تصنيفها ، بدلاً من التطبيق العملي ونتائج التحليل. نظرت فقط في تلك الأعمال ، التي تم خلالها الحصول على نتائج التحليل بناءً على بيانات حقيقية. ولم أفكر في أولئك الذين يكرسون فقط لتدريب المصنفات.هذه المقالة هي ترجمة مكثفة لمقال منشور في IEEE Access. إذا كنت تريد المزيد من التفاصيل ، أو اقرأ فقط باللغة الإنجليزية - أنتهنا .
يصف القسم الثاني بإيجاز مهمة تحليل المشاعر والأساليب الحالية ، إذا كنت معتادًا على ذلك ، فلا تتردد في تخطيه. القسم الثالث هو أحد الأقسام الرئيسية ، فهو يبحث في استخدامات تحليل المشاعر للنصوص باللغة الروسية ، 32 دراسة رئيسية موصوفة هنا ، رؤى ونقاط ضعفهم. أما القسم الرابع فقد خصص للتحديات الحالية والخامس للمناطق الواعدة.
2. باختصار حول طرق تحليل المشاعر
تحليل المشاعر هو فئة من طرق تحليل المحتوى في اللغويات الحاسوبية ، وتتمثل مهمتها الرئيسية في تصنيف النص وفقًا لمزاجه. في الحالات البسيطة ، يتم تقليل مشكلة تحليل المشاعر إلى تصنيف ثنائي للنصوص إلى إيجابية وسلبية. في بعض الحالات ، أضف فئة أخرى من النصوص المحايدة. تحاول الأساليب الأكثر تقدمًا تحديد الحالات العاطفية المرتبطة بالنص ، مثل الخوف أو الغضب أو الحزن أو السعادة. في عدد من المناهج ، يتم تعيين قيم للنصوص بمقياس محدد مسبقًا: على سبيل المثال ، من -2 للسالب إلى 2 للإيجابي ؛ وبالتالي ، يتم اختزال التحليل إلى مشكلة الانحدار. تحليل المشاعر القائم على الجانب هو مجموعة فرعية من تحليل المشاعر ، وتتمثل مهمتها في تحديد الموقف تجاه جانب معين من موضوع المناقشة الرئيسي.يمكن تقسيم جميع مناهج تحليل المشاعر إلى ثلاث مجموعات.
الأول هو النهج المستندة إلى القواعد(على أساس القواعد). في أغلب الأحيان ، يستخدمون قواعد تصنيف محددة يدويًا ومفردات ذات علامات عاطفية. عادةً ما تحسب هذه القواعد فئة النص [22] - [24] بناءً على الكلمات الرئيسية العاطفية وتركيبها مع الكلمات الرئيسية الأخرى. على الرغم من كونها فعالة بشكل ممتاز في الموضوع ، إلا أن الأساليب القائمة على القواعد ضعيفة التعميم. كما أنها تستغرق وقتًا طويلاً في الإنشاء ، خاصةً عندما لا يكون هناك وصول إلى قاموس المشاعر المناسب. هذا الأخير هو سمة خاصة للغة الروسية ، لأنه لا يوجد بها العديد من المصادر كما في اللغة الإنجليزية ، خاصة في مجال تحليل المشاعر. أكبر قواميس المشاعر باللغة الروسية هي RuSentiLex [25] و LINIS Crowd [26]. لكنها تحتوي فقط على معلومات حول الدرجة اللونية من الإيجابية إلى السلبية ، بدون خصائص المشاعر. في هذا الطريق،لا توجد بدائل لمثل هذه المجموعات القوية باللغة الإنجليزية ذات الخصائص العاطفية الواسعة مثل SenticNet [27] و SentiWordNet [28] و SentiWords [29].
المجموعة الثانية - مناهج التعلم الآلي... يستخدمون الاستخراج التلقائي للميزات من النص ويطبقون خوارزميات التعلم الآلي. الخوارزميات الكلاسيكية لتصنيف القطبية هي مصنف بايز ساذج [30] ، شجرة القرار [31] ، الانحدار اللوجستي [32] ، وآلة ناقلات الدعم [33]. في السنوات الأخيرة ، اجتذب انتباه الباحثين أساليب التعلم العميق ، والتي تفوقت بشكل كبير على الأساليب التقليدية في تحليل المشاعر [34]. وهذا ما يؤكده التسلسل الزمني لمسابقة SemEval ، حيث استخدمت الحلول الرائدة بنجاح الشبكات العصبية التلافيفية (CNN) والشبكات العصبية المتكررة (RNN) [35] - [37] ، بالإضافة إلى طرق التعلم المنقولة [38].تتمثل إحدى الميزات الرئيسية للأنظمة القائمة على التعلم الآلي في الاستخراج التلقائي للميزات من النص. تستخدم الطرق البسيطة لتمثيل النص في مساحة متجه نموذجًا لحقيبة الكلمات. في الأنظمة الأكثر تعقيدًا ، تُستخدم نماذج دلالات التوزيع لتوليد تضمين كلمات ، على سبيل المثال ، Word2Vec [39] أو GloVe [40] أو FastText [41]. هناك أيضًا خوارزميات لإنشاء حفلات الزفاف على مستوى الجملة أو الفقرة ، وهي مصممة لنقل التعلم عبر مهام معالجة اللغة الطبيعية المختلفة. تتضمن هذه الخوارزميات ELMo [42] ، و Universal Sentence Encoder (USE) [27] ، وتمثيلات التشفير ثنائي الاتجاه من المحولات (BERT) [43] ، وتمثيل اللغة المحسّن مع الكيانات الإعلامية (ERNIE) [44] ، و XLNet [45].أحد عيوبها الرئيسية من حيث إنشاء حفلات الزفاف هو الحاجة إلى كميات كبيرة من النصوص للتدريب. ومع ذلك ، هذا صحيح بالنسبة لجميع أساليب التعلم الآلي ، لأن جميع خوارزميات التعلم الخاضع للإشراف تتطلب مجموعات بيانات مصنفة للتدريب.
المجموعة الثالثة - النهج الهجين... يجمعون بين نهج النوعين السابقين. على سبيل المثال ، طور كومار وزملاؤه إطارًا هجينًا لتحليل المشاعر باللغة الفارسية يجمع بين القواعد اللغوية والشبكات العصبية التلافيفية و LSTMs لتصنيف المشاعر [46]. اقترح Meskele و Frasincar نموذج تحليل جانبي هجين ALDONAr يجمع بين علم الوجود العاطفي لالتقاط معلومات المشاعر ، و BERT لتضمين الكلمات ، وطبقتين من CNN لتصنيف المشاعر الموسعة [47]. أظهر النموذج دقة قدرها 83.8٪ على مجموعة بيانات SenEval 2015 Task 12 [48] و 87.1٪ على مجموعة بيانات SemEval 2016 Task 5 [49]. غالبًا ما تُستخدم نماذج اللغة في الخوارزميات الهجينة ، مثل الحلول القائمة على القواعد [50] - [52]. جانب واحدعادةً ما ينتج عن مزيج من الأساليب المستندة إلى القواعد والتعلم الآلي نتائج أكثر دقة. من ناحية أخرى ، ترث المناهج الهجينة الصعوبات والقيود المفروضة على الخوارزميات المكونة لها.
3.
للعثور على المنشورات الرئيسية حول تحليل المشاعر التطبيقية للنصوص باللغة الروسية ، بحثت في قواعد البيانات العلمية التي تغطي المجلات والمؤتمرات الرائدة في علوم الكمبيوتر: IEEE Xplore ، ومكتبة ACM الرقمية ، و ScienceDirect ، و SAGE Journal Online ، و Springer Link . لتوسيع نطاق المصادر ، بالإضافة إلى المقالات باللغة الإنجليزية ، قمت أيضًا بدراسة المقالات باللغة الروسية من مؤشر الاقتباس العلمي الروسي (RSCI). تم إجراء البحث عن طريق الاستعلام (("المعنى" أو "الاستقطاب") و ("التحليل" أو "الكشف" أو "التصنيف" أو "التنقيب عن الرأي" أو "نمذجة الموضوعات" ") و (" روسي "أو" روسيا ")).تم العثور على معظم المقالات ذات الصلة في ScienceDirect و Springer Link و RSCI... كما قمت بمراجعة الإصدارات الأولية لأعمال كبار الباحثين حتى لا تفوتني التطورات الجديدة. نتيجة لذلك ، تم جمع عدة آلاف من المقالات التي يحتمل أن تكون ذات صلة ، دون احتساب المطبوعات الرمادية والمطبوعات المسبقة تم تفضيل الأعمال الأكثر حداثة والأكثر اقتباسًا. ثم قمت بتحليل العناوين والكلمات الرئيسية ومقدمات باقي المنشورات لتضييق نطاق اختياراتي للمصادر. تم البحث فقط في المقالات التي راجعها الأقران لتحسين جودة العينة. لقد استبعدت المصادر الرمادية (على سبيل المثال ، العمل الجاري ، والافتتاحيات ، وأي أطروحة) ، وكذلك المصادر غير المناسبة لبحثي (التي لا تطبق نماذج تصنيف المشاعر). بعد ذلك ، لمزيد من الوصف التفصيلي في هذه المقالة ، اخترت يدويًا 32 منشورًا رئيسيًا ،الذي وصف منهجًا عمليًا واحدًا على الأقل لتحليل المشاعر في النصوص باللغة الروسية.
4.
. 1. .
قررت تصنيف الأساليب حسب مصدر البيانات ، لأنه في هذه الحالة ، سيكون للنهج ضمن الفئات أهداف وتحديات وقيود مماثلة. على الرغم من أن بعض الفئات تحتوي على دراسة واحدة فقط ، فقد قررت إبرازها بسبب الاختلافات الجوهرية في الأساليب المستخدمة والنتائج والصعوبات. أيضًا ، لا تنسَ أن اللغة الروسية لم تُدرس كثيرًا من حيث تحليل المشاعر ، وبالتالي فإن عدد الأعمال محدود. في التين. 1 يقدم مجموعة من الفئات. اعتمدت معظم الأساليب على تحليل بيانات وسائل التواصل الاجتماعي لقياس مواقف المستخدم تجاه مواضيع مختلفة. على سبيل المثال ، المواقف والآراء حول الصراع في أوكرانيا والمشاكل المتعلقة بالمهاجرين. في العقد الماضي ، تحولت العديد من الشبكات الاجتماعية إلى أدوات حديثة للمشاركة الاجتماعية [53] ،لذلك ، يمكن اعتبارها مصادر مفتوحة ومتاحة على نطاق واسع للرأي العام ، أو على الأقل كنوع من الانعكاس له [54]. تم فحص UGCs من الشبكات الاجتماعية ، باعتبارها المصدر الأكثر شيوعًا للمعلومات ، وفقًا لثلاثة معايير: المواقف تجاه مواضيع مختلفة ؛ مؤشرات المزاج الاجتماعي ميزات تفاعل المستخدم مع البيانات التي تعبر عن حالات مزاجية مختلفة. تمت دراسة المواقف تجاه الموضوعات المختلفة من وجهات نظر مختلفة. على سبيل المثال ، المواقف تجاه المهاجرين والمجموعات العرقية (على سبيل المثال ، [55]) ، والتعبير عن المشاعر أثناء الأزمة الأوكرانية (على سبيل المثال ، [56]) ، وقياس مستوى التوتر الاجتماعي (على سبيل المثال ، [57]) ، أو التركيز على الخطاب على بعض الأسئلة (على سبيل المثال ، [58]). عادةً ما تستخدم هذه الأساليب مجموعة من نمذجة الموضوع وتحليل المشاعر ،لتسليط الضوء على الموضوعات والحالات المزاجية ذات الصلة. في كثير من الأبحاث (على سبيل المثال ، [59] - [67]) ، حيث يتم تطبيق نمذجة الموضوع دون مزيد من تصنيف القطبية (وبالتالي لم يتم تناولها في هذه المقالة) ، يشار إلى تحليل المشاعر على أنه مرحلة تطوير أخرى. في جزء آخر من البحث (على سبيل المثال ، [68]) ، يتم حساب مؤشرات المواقف الاجتماعية على أساس الآراء المعبر عنها في الشبكات الاجتماعية من أجل الحصول على بديل لمؤشر الرفاه الشخصي التقليدي. أخيرًا ، يفحص بحث آخر (على سبيل المثال ، [69]) أنماط تفاعل المستخدم مع المحتوى اعتمادًا على لونه العاطفي. تتمثل إحدى الصعوبات الرئيسية في مثل هذه الدراسات في استخراج عينات البيانات التمثيلية واختيار النصوص ذات الصلة لمزيد من التحليل.في كثير من الأبحاث (على سبيل المثال ، [59] - [67]) ، حيث يتم تطبيق نمذجة الموضوع دون مزيد من تصنيف القطبية (وبالتالي لم يتم تناولها في هذه المقالة) ، يشار إلى تحليل المشاعر على أنه مرحلة تطوير أخرى. في جزء آخر من البحث (على سبيل المثال ، [68]) ، يتم حساب مؤشرات المواقف الاجتماعية على أساس الآراء المعبر عنها في الشبكات الاجتماعية من أجل الحصول على بديل لمؤشر الرفاه الشخصي التقليدي. أخيرًا ، يفحص بحث آخر (على سبيل المثال ، [69]) أنماط تفاعل المستخدم مع المحتوى اعتمادًا على لونه العاطفي. تتمثل إحدى الصعوبات الرئيسية في مثل هذه الدراسات في استخراج عينات البيانات التمثيلية واختيار النصوص ذات الصلة لمزيد من التحليل.في كثير من الأبحاث (على سبيل المثال ، [59] - [67]) ، حيث يتم تطبيق نمذجة الموضوع دون مزيد من تصنيف القطبية (وبالتالي لم يتم تناولها في هذه المقالة) ، يشار إلى تحليل المشاعر على أنه مرحلة تطوير أخرى. في جزء آخر من البحث (على سبيل المثال ، [68]) يتم حساب مؤشرات المواقف الاجتماعية على أساس الآراء المعبر عنها في الشبكات الاجتماعية من أجل الحصول على بديل للمؤشر التقليدي للرفاهية الذاتية. أخيرًا ، يفحص بحث آخر (على سبيل المثال ، [69]) أنماط تفاعل المستخدم مع المحتوى اعتمادًا على لونه العاطفي. تتمثل إحدى الصعوبات الرئيسية في مثل هذه الدراسات في استخراج عينات البيانات التمثيلية واختيار النصوص ذات الصلة لمزيد من التحليل.حيث يتم تطبيق نمذجة الموضوع دون تصنيف إضافي للقطبية (وبالتالي لم يتم تناولها في هذه المقالة) ، يشار إلى تحليل المشاعر على أنه مرحلة تطوير أخرى. في جزء آخر من البحث (على سبيل المثال ، [68]) ، يتم حساب مؤشرات المواقف الاجتماعية على أساس الآراء المعبر عنها في الشبكات الاجتماعية من أجل الحصول على بديل لمؤشر الرفاه الشخصي التقليدي. أخيرًا ، يفحص بحث آخر (على سبيل المثال ، [69]) أنماط تفاعل المستخدم مع المحتوى اعتمادًا على لونه العاطفي. تتمثل إحدى الصعوبات الرئيسية في مثل هذه الدراسات في استخراج عينات البيانات التمثيلية واختيار النصوص ذات الصلة لمزيد من التحليل.حيث يتم تطبيق النمذجة الموضوعية دون تصنيف إضافي للقطبية (وبالتالي لم يتم تناولها في هذه المقالة) ، يشار إلى تحليل المشاعر على أنه مرحلة تطوير أخرى. في جزء آخر من البحث (على سبيل المثال ، [68]) يتم حساب مؤشرات المواقف الاجتماعية على أساس الآراء المعبر عنها في الشبكات الاجتماعية من أجل الحصول على بديل للمؤشر التقليدي للرفاهية الذاتية. أخيرًا ، يفحص بحث آخر (على سبيل المثال ، [69]) أنماط تفاعل المستخدم مع المحتوى اعتمادًا على لونه العاطفي. تتمثل إحدى الصعوبات الرئيسية في مثل هذه الدراسات في استخراج عينات البيانات التمثيلية واختيار النصوص ذات الصلة لمزيد من التحليل.
المصدر التالي الأكثر شيوعًا للمعلومات هو مراجعات المنتجات والخدمات. تم تحليلها من حيث خصائص المراجعين أنفسهم (على سبيل المثال ، [70]) ، وخصائص المنتجات والخدمات (على سبيل المثال ، [71]) ، وخصائص البائعين (على سبيل المثال ، [72]). على عكس تحليل البيانات التي ينشئها المستخدم من الشبكات الاجتماعية ، لا توجد صعوبة في الوصول إلى البيانات القديمة. غالبًا ما تسمح المواقع المخصصة للمراجعات للمستخدمين بتقييم التقييمات بالإضافة إلى نص المراجعة ، لذلك ليست هناك حاجة رسمية لإنشاء نموذج تصنيف الحالة المزاجية ، لأننا نعرف بالفعل فئات التصنيف. ومع ذلك ، في بعض الدراسات ، يتم استخدام نماذج تصنيف المشاعر فقط من أجل الاهتمام الأكاديمي. نظرًا لأن بيانات مستخدمي وسائل التواصل الاجتماعي ومراجعات المستخدمين تعكس غالبًا وجهات نظر ذاتية ،يختلف تحليل هذه البيانات عن تحليل الأخبار. عادة ، يحاول الصحفيون تجنب الأحكام والتحيز الصريح والشك والغموض ، لأن الموضوعية هي جوهر مهنتهم. أو على الأقل الحياد [73]. لذلك ، غالبًا ما لا يستخدم الصحفيون الكلمات المتعلقة بالمفردات الإيجابية أو السلبية ، بل يلجأون إلى طرق أخرى للتعبير عن آرائهم [74].
المصدر الرئيسي الثالث هو الأخبار الواردة من وسائل الإعلام ، والتي تم تحليلها وفقًا لمعيارين: المشاعر (على سبيل المثال ، [75]) وتشكيل التنبؤات الاقتصادية والتجارية بناءً على المشاعر الإخبارية (على سبيل المثال ، [76]). على عكس تحليل البيانات التي ينشئها المستخدم من الشبكات الاجتماعية ، لا توجد صعوبة في الوصول إلى البيانات القديمة ، لأن الوسائط عادة لا تقيد الوصول إليها. ومع ذلك ، فقد حاول مؤلفو بعض الدراسات تحديد موقف الجمهور تجاه مواضيع محددة ، والتي ، في رأيي ، تتطلب مزيدًا من التفصيل. بالطبع يمكن اعتبار وسائل الإعلام انعكاساً للرأي العام. لكن في بعض الحالات ، قد تكون السياسة التحريرية قد أثرت على التقديم ، لذلك لا تعكس الأخبار دائمًا الرأي العام. أولى الباحثون اهتمامًا أقل قليلاً بالاتجاه الأخير: تحليل المشاعر في الكتب المدرسية ،ظهرت هذه الدراسات فقط في عام 2019. تركز هذه الأعمال على مقارنة المشاعر المعبر عنها في الكتب المدرسية المختلفة (على سبيل المثال ، [77]) وتأثير هذه المشاعر على العملية التعليمية (على سبيل المثال ، [78]). يأتي التحدي الرئيسي من نقص المفردات الخاصة بالحالة المزاجية ومجموعات بيانات التعلم الموجهة نحو الكتب المدرسية. علاوة على ذلك ، في حالة النصوص التحليلية على مستوى المستند ، يصبح من الصعب ربط النصوص بفئة معينة من الحالات المزاجية ، لأن النصوص في الكتب المدرسية طويلة ويمكن أن تحتوي على العديد من المشاعر المختلفة في وقت واحد.موجه نحو الكتاب المدرسي. علاوة على ذلك ، في حالة النصوص التحليلية على مستوى المستند ، يصبح من الصعب ربط النصوص بفئة معينة من الحالات المزاجية ، لأن النصوص في الكتب المدرسية طويلة وقد تحتوي على العديد من المشاعر المختلفة في آنٍ واحد.موجه نحو الكتاب المدرسي. علاوة على ذلك ، في حالة النصوص التحليلية على مستوى المستند ، يصبح من الصعب ربط النصوص بفئة معينة من الحالات المزاجية ، لأن النصوص الموجودة في الكتب المدرسية طويلة ويمكن أن تحتوي على العديد من المشاعر المختلفة في وقت واحد.
للحصول على مجموعة واسعة من الآراء ، تعمل بعض الدراسات بمصادر بيانات مختلطة. في هذه المجموعة ، يدرس الباحثون عادة المواقف تجاه مواضيع مختلفة ، مثل الأزمة الأوكرانية (على سبيل المثال [79]) أو التغطية الإعلامية لأليكسي نافالني (على سبيل المثال [80]). نظرًا لأن المصادر مختلطة ، يمكن استخدام هذه البيانات في أي بحث محتمل. ومع ذلك ، بالإضافة إلى المجموعة الواسعة من الآراء التي تم التعبير عنها ، يواجه المؤلفون أيضًا تعقيدات وقيود متأصلة في المصدر.
يعرض الجدول 1 ملخصًا للطرق التي تم العثور عليها. إذا أخذنا في الاعتبار توزيع المقالات حسب السنة ، يمكننا أن نرى أن عدد الدراسات حول المشاعر في النص باللغة الروسية قد ازداد في 2014-2016 ووصل إلى ذروته في عام 2017. يختلف عدد المقالات المنشورة في نفس المجلات ووقائع المؤتمرات إلى حد ما. تم نشر أكثر من مقالة تم تحليلها في سبع مجلات ومجموعات فقط. تم نشر معظم المقالات المكتشفة في مجموعة مواد مؤتمر "التحول الرقمي والمجتمع العالمي".
الجدول 1. ملخص الدراسات المكتشفة. RB - النهج القائمة على القواعد ، ML - مناهج التعلم الآلي ، UNK - الأساليب غير المعروفة ، WL - تحليل مستوى الكلمات ، DL - تحليل مستوى المستند.
| الفئة | موعد | وصف | حلقة الوصل | ||
|---|---|---|---|---|---|
| UGC | . | [81] | ML (Logit) | DL | |
| [82] | ML (Logit) | DL | |||
| [83] | ML (Logit) | DL | |||
| [84] | RB (SentiStrength) | DL | |||
| [55] | ML (SVM) | DL | |||
| . | [85] | RB (custom) | DL | ||
| [86] | RB (POLYARNIK) | DL | |||
| [87] | RB (SentiMental) | DL | |||
| [88] | UNK (IQBuzz) | DL | |||
| [56] | RB (custom) | DL | |||
| . | [89] | ML (SVM) | DL | ||
| [57] | RB (SentiStrength) | DL | |||
| . | [58] | DL | |||
| 2014 . | [90] | RB (SentiStrength) | DL | ||
| 2011-2012. | [91] | RB (SentiStrength) | DL | ||
| -. | [92] | ML (NBC) | DL | ||
| . | [93] | RB (custom) | WL, DL | ||
| [68] | ML (GBM) | DL | |||
| . | [69] | ML (BiGRU) | DL | ||
| , . | [70] | DL | |||
| - . | [71] | ML (NB, SGD) | DL | ||
| , . | [72] | ML (RNTN) | DL | ||
| . | [94] | RB (custom) | DL | ||
| [95] | RB (custom) | DL | |||
| . | [96] | RB (custom) | DL | ||
| . | [75] | UNK (Medialogia) | DL | ||
| . | [76] | ML (SVM) | DL | ||
| . | [77] | RB (custom) | WL | ||
| , . | [78] | ML ( ) | DL | ||
| [97] | UNK (Crimson Hexagon) | DL | |||
| [79] | UNK (Crimson Hexagon) | DL | |||
| [80] | UNK (Medialogia) | DL |
كانت نسبة الأساليب القائمة على القواعد (40.63٪) والتعلم الآلي (37.5٪) متساوية تقريبًا. غالبًا ما تستخدم المجموعة الأولى إما النماذج المستندة إلى القواعد الفردية أو SentiSt Strength [22] ، والتي أصبحت الخوارزمية الأكثر شيوعًا بين حلول الأطراف الثالثة الجاهزة للاستخدام. وفي المجموعة الثانية ، تم استخدام الانحدار اللوجستي [32] وآلة ناقلات الدعم [33] ومصنف بايزي الساذج [30] غالبًا. الأكثر شيوعًا كانت طرق التعلم الآلي البسيطة ، وكان 16.7٪ فقط على الشبكات العصبية. ومع ذلك ، منذ عام 2019 ، تجاوزت حصة مناهج التعلم الآلي بشكل كبير حصة النهج القائمة على القواعد. وجدت 15.6٪ من الدراسات استخدام خدمات سحابية من جهات خارجية مثل Medialogia و IQBuzz و Crimson Hexagon لتحليل المشاعر.في هذه الحالات ، لم أتمكن من تحديد الأساليب المستخدمة بسبب نقص المعلومات الرسمية حول خوارزميات التصنيف المطبقة.
في العديد من الحالات ، تم العثور على عيوب منهجية ، بما في ذلك عدم وجود أوصاف للمعالجة المسبقة ، وترميز البيانات ، وعملية التعلم ، ومقاييس جودة التصنيف. في عدد من الحالات ، لم يتم التحقق من صحة نموذج التصنيف مقابل مجموعة بيانات متعلقة بمجال الموضوع. هذا ينطبق بشكل خاص على تحليل المشاعر باستخدام الأساليب القائمة على القواعد أو خدمات الطرف الثالث - لا يقوم الباحثون عادة بوضع علامات على مجموعات النصوص يدويًا وبالتالي لا يمكنهم تقييم جودة التصنيف.
5. التالي
سيصدر الجزء الثاني من المقالة الأسبوع المقبل ، حيث سنلقي نظرة فاحصة على كل دراسة من الدراسات الرئيسية الـ 32 التي وجدتها. في الجزء الثالث والأخير (مرة أخرى الأسبوع المقبل) سنتحدث عن الصعوبات المشتركة التي يواجهها الباحثون ، وكذلك عن الاتجاهات الواعدة للمستقبل. إذا كنت ترغب في قراءة المقال بأكمله مرة واحدة وباللغة الإنجليزية ، فانتقل هنا .
6. المصادر
يمكن العثور على قائمة كاملة بالمصادر هنا .