تحليل المشاعر في نصوص باللغة الروسية ، الجزء الثاني: بحث أساسي

صورة



طبق الباحثون تحليل المشاعر على نصوص مختلفة تمامًا باللغة الروسية: منشورات من الشبكات الاجتماعية ، ومراجعات ، ومقالات إخبارية وكتب. نتيجة لذلك ، كانت نتائج أبحاثهم مختلفة تمامًا ومثيرة للاهتمام للغاية. على سبيل المثال ، من كان يظن أن النصوص ذات اللهجة الإيجابية تجعل تعلم لغة أجنبية أكثر إثارة للاهتمام ، ولكن أقل فعالية؟ في هذه السلسلة من المقالات ، سننظر في كيف ولأي غرض تم تطبيق مناهج تحليل المشاعر للنصوص باللغة الروسية ، وما هي النتائج التي تم تحقيقها ، وما هي المشاكل التي نشأت ، وكذلك نتحدث قليلاً عن الاتجاهات الواعدة.



على عكس الأعمال السابقة ، ركزت على التطبيقات التطبيقية ، وليس على المناهج نفسها وجودة التصنيف. في المقال الأولناقشنا ماهية "تحليل المشاعر" ، وما هو وكيف تم استخدامه على مدى السنوات الثماني الماضية لتحليل النصوص باللغة الروسية. في هذا الجزء ، سوف نلقي نظرة فاحصة على كل من الدراسات الرئيسية الـ 32 التي وجدتها. في الجزء الثالث والأخير (الأسبوع المقبل) سنتحدث عن التحديات المشتركة التي يواجهها الباحثون ، بالإضافة إلى الاتجاهات الواعدة للمستقبل.



ملحوظة: المقال كتب لمجلة علمية ، لذلك سيكون هناك العديد من الروابط إلى المصادر.


استخدمت العديد من الدراسات بيانات من الشبكات الاجتماعية الروسية ومنصات التجميع. فيما يلي وصف موجز لأكثر الموارد الروسية والأجنبية شيوعًا وإحصاءات عن استخدامها.



  • 90 , . Deloitte [98], , 70 % . 16—24 , .
  • YouTube , 62 % . 16—24 , 58—64 %.
  • Twitter [98], 5 % . 25—65 , 55—64 .
  • LiveJournal , 3 % . 35—44 , .
  • Medialogia — , . 500 . 100 . 52 000 900 .
  • IQBuzz هي خدمة مراقبة تعالج المعلومات من أكثر من 10000 مصدر في الوسائط ، من Facebook و Twitter و VKontakte و My World و Instagram و 4sq و LiveJournal و LiveInternet و Google و YouTube و RuTube وغيرها. النظام قادر على التعرف تلقائيًا على الرسائل الإيجابية والسلبية ، وإلغاء المكررة وإجراء عمليات بحث معقدة في قاعدة البيانات المتراكمة.


فيما يلي سأصف الدراسات التي تم العثور عليها ، والنتائج التي تم الحصول عليها فيها والاستنتاجات التي توصل إليها المؤلفون ، والتي قد لا تتوافق مع موقفي.



1. UGC على وسائل التواصل الاجتماعي



صورة

أصبحت العديد من الشبكات الاجتماعية أدوات حديثة للمشاركة الاجتماعية [53]. تعتبر البيانات التي ينشئها المستخدمون مصدرًا مهمًا ويمكن الوصول إليه من مصادر الرأي العام ، أو على الأقل انعكاس له ، لذا يمكن أن تكمل أو تحل محل استطلاعات الرأي [54]. تم فحص البيانات التي ينشئها المستخدم وفقًا لثلاثة معايير:



  • الموقف من مواضيع مختلفة.
  • مؤشرات المزاج الاجتماعي.
  • تفاصيل تفاعل المستخدم مع البيانات التي تعبر عن مشاعر مختلفة.


1.1. الموقف من مواضيع مختلفة



كانت الموضوعات الأكثر شيوعًا في دراسة النصوص باللغة الروسية هي مشاكل العلاقات بين الأعراق والهجرة ، فضلاً عن الأزمة الأوكرانية. تم إيلاء اهتمام كبير لتحليل التوتر الاجتماعي ، فضلا عن مواضيع أخرى.



1.1.1 الجماعات العرقية والمهاجرون



تم استكشاف مشاكل العلاقات بين الأعراق والهجرة ، فضلاً عن الموضوعات ذات الصلة ، بعمق باستخدام أساليب اجتماعية متطورة. ومع ذلك ، فإن التطور السريع للإنترنت ومعالجة اللغة الطبيعية أتاح البحث عن نهج جديد نسبيًا. تسمح وسائل التواصل الاجتماعي للأفراد والجماعات بالمشاركة علانية في النزاع. على الإنترنت ، يمكن للأحكام المتعلقة بالهجرة وقضايا المجموعات العرقية أن تنتشر بشكل أسرع وتصل إلى جمهور أوسع بكثير مما كانت عليه قبل عصر الإنترنت [54]. أثبت المزيد من الأبحاث الأكاديمية أن المحتوى السلبي عبر الإنترنت يؤثر على النزاعات العرقية خارج الإنترنت [99] وجرائم الكراهية [100]. في هذا الطريق،مع تطور تقنيات الإنترنت ، تزداد أهمية تحليل مشاكل العلاقات بين الأعراق والهجرة على أساس المحتوى عبر الإنترنت.



ركزت دراسة أجرتها Bodrunova وزملاؤه على موقف مجتمع الإنترنت الناطق بالروسية تجاه المهاجرين في الخطاب العام [81]. جمع المؤلفون 363،579 مشاركة من كبار المدونين الروس من 4 فبراير إلى 19 مايو 2013. بتطبيق الإستراتيجية الموضحة في [59] ، [101] ، قام الباحثون باستخدام تخصيص ديريتشليت الكامن [102] بتحديد المناقشات ذات الصلة. ثم قمنا يدويًا برسم بعض النقاشات وفئات المشاعر. بعد ذلك ، قمنا بتدريب نموذج الانحدار اللوجستي ذي الحدين (الانحدار اللوجستي ذي الحدين [32]) لعدد من مشاكل تصنيف النص ، بما في ذلك تصنيف المشاعر. وبحسب النتائج ، كان يُنظر إلى جميع المهاجرين بشكل سلبي ، والأهم من ذلك كله أولئك الذين وصلوا من شمال القوقاز مقارنة بالمهاجرين من آسيا الوسطى والأمريكيين.لم يكن هناك موقف إيجابي تجاه الأوروبيين أو الأمريكيين. في الوقت نفسه ، كان ينظر إلى الأوروبيين والأمريكيين والقوقازيين على أنهم معتدون وليسوا ضحايا. وصف سكان وسط آسيا بأنهم أجانب ذوو دلالات سلبية. بشكل عام ، لم يُنظر إلى الأوروبيين على أنهم غرباء أو شركاء ، وكان يُنظر إلى الأمريكيين على أنهم خطرون ، واليهود غير مؤذيين تمامًا. يجادل مؤلفو الدراسة بأن التقسيم العقلي للسكان بعد انهيار الاتحاد السوفيتي لا يتطابق تمامًا مع الحدود الجغرافية الحالية ، نظرًا لأن المجموعات القريبة سابقًا يُنظر إليها بالفعل على أنها دول منفصلة لها أجنداتها السياسية الخاصة. أحد العوائق الرئيسية لهذا العمل هو الافتقار إلى تقييم جودة وصف البيانات ومواصفات مقاييس التصنيف.وصف سكان وسط آسيا بأنهم أجانب ذوو دلالات سلبية. بشكل عام ، لم يُنظر إلى الأوروبيين على أنهم غرباء أو شركاء ، وكان يُنظر إلى الأمريكيين على أنهم خطرون ، واليهود غير مؤذيين تمامًا. يجادل مؤلفو الدراسة بأن التقسيم العقلي للسكان في فترة ما بعد الاتحاد السوفيتي لا يتطابق تمامًا مع الحدود الجغرافية الحالية ، نظرًا لأنه يُنظر بالفعل إلى المجموعات القريبة سابقًا على أنها دول منفصلة لها أجنداتها السياسية الخاصة. أحد العوائق الرئيسية لهذا العمل هو الافتقار إلى تقييم جودة وصف البيانات ومواصفات مقاييس التصنيف.وُصف سكان وسط آسيا بأنهم أجانب ذوو دلالات سلبية. بشكل عام ، لم يُنظر إلى الأوروبيين على أنهم غرباء أو شركاء ، وكان يُنظر إلى الأمريكيين على أنهم خطرون ، واليهود غير مؤذيين تمامًا. يجادل مؤلفو الدراسة بأن التقسيم العقلي للسكان بعد انهيار الاتحاد السوفيتي لا يتطابق تمامًا مع الحدود الجغرافية الحالية ، نظرًا لأن المجموعات القريبة سابقًا يُنظر إليها بالفعل على أنها دول منفصلة لها أجنداتها السياسية الخاصة. أحد العوائق الرئيسية لهذا العمل هو الافتقار إلى تقييم جودة وصف البيانات ومواصفات مقاييس التصنيف.أن التقسيم العقلي للسكان في فترة ما بعد الاتحاد السوفيتي لا يتطابق تمامًا مع الحدود الجغرافية الحالية ، والتي بسببها يُنظر بالفعل إلى المجموعات القريبة سابقًا على أنها دول منفصلة لها أجنداتها السياسية الخاصة. أحد العوائق الرئيسية لهذا العمل هو الافتقار إلى تقييم جودة وصف البيانات ومواصفات مقاييس التصنيف.أن التقسيم العقلي للسكان في فترة ما بعد الاتحاد السوفيتي لا يتطابق تمامًا مع الحدود الجغرافية الحالية ، والتي بسببها يُنظر إلى المجموعات القريبة سابقًا على أنها دول منفصلة لها أجنداتها السياسية الخاصة. أحد العوائق الرئيسية لهذا العمل هو الافتقار إلى تقييم جودة وصف البيانات ومواصفات مقاييس التصنيف.



قام الفريق بقيادة Koltsova [82] ، باستخدام أساليب معدلة من الأعمال السابقة ([103] ، [104]) ، بتقدير الحجم الإجمالي للمناقشات المتعلقة بالعلاقات بين الأعراق على مواقع الشبكات الاجتماعية باللغة الروسية. لإنشاء مجموعة أساسية من 2660222 نصًا ، طور المؤلفون قائمة معقدة من التسميات العرقية والأعراف الكبيرة ، تغطي 97 مجموعة عرقية في إقليم ما بعد الاتحاد السوفيتي. بعد ذلك ، باستخدام الترميز اليدوي ، تم إنشاء مجموعة بيانات تدريبية من 7181 نصًا ، تم شرح كل منها من قبل ثلاثة خبراء على عدة معايير ، بما في ذلك وجود تعارض بين المجموعات ، واتصالات إيجابية بين المجموعات ، ونبرة سلبية أو إيجابية بشكل عام. لتصنيف المشاعر ، قام المؤلفون بتدريب نموذج الانحدار اللوجستي على مجموعة بيانات معنونة [32] وحققوا F 1 = 0.75 للمشاعر الإيجابية و F1 = 0.68 للسالب. وجد المؤلفون أن الاهتمام بالمجموعات العرقية يختلف اختلافًا كبيرًا بين المجموعات والمناطق المختلفة. بناءً على هذا البحث ، قام الفريق بقيادة Koltsova بتحسين جودة النتائج التي تم الحصول عليها وزيادة عدد الأحكام المسبقة ، والتي يمكن العثور عليها في العمل التالي [83]. بادئ ذي بدء ، زاد المؤلفون مجموعة البيانات للمعالجة اليدوية من 7181 إلى 14998 نصًا فريدًا. ثم تم ترميز النصوص من قبل ثلاثة خبراء مستقلين على الأقل. بعد ذلك ، قام المؤلفون بتدريس نموذج الانحدار اللوجستي لتقسيم النصوص إلى ثلاث فئات (الموقف الإيجابي والحيادي والسلبي) باستخدام أفضل المعلمات الفائقة المأخوذة من الدراسة السابقة. ساعد هذا بشكل كبير في تحسين مقاييس التصنيف. متوسط ​​قيم المشاعر كان: P = 0.67 ، R = 0.55 و F 1= 0.58.



حقق ناغورني في عمله [84] موضوع هيكل المناقشات العرقية في الشبكات الاجتماعية باللغة الروسية. استنادًا إلى قائمة تضم أكثر من 4000 كلمة تتعلق بالمناقشات العرقية ، جمع المؤلف 2659849 نصًا من VKontakte و IQBuzz للفترة من يناير 2014 إلى ديسمبر 2016. علاوة على ذلك ، استخدم المؤلف ISLDA [26] ، وهو تعديل لخوارزمية LDA التي تم تطويرها في HSE Internet Research Laboratory. لحساب فئة المشاعر ، استخدم Nagorny SentiSt Strength [22] مع قاموس اللغة الروسية للعواطف LINIS Crowd [26]. لكل موضوع ، تم حساب مؤشر القطبية كمجموع منتجات احتمالية هذا الموضوع في النص بقيمة المشاعر المقابلة ، مقسومة على الأهمية الإجمالية للموضوع. بعد تحليل الملف الشخصي الموضوعي للمناقشات العرقية التي تم الحصول عليها بمساعدة LDA ، حدد Nagorny أكثر الموضوعات سلبية وأهمية. كشفت ،أن الجزء الأكبر من المناقشات يتعلق بالعلاقات الروسية الأوكرانية فيما يتعلق بالصراع الأخير بين البلدين. ونتيجة لذلك ، كان من الصعب فصل الموضوعات بين الأعراق عن الموضوعات السياسية ، حيث أثر الصراع على قطبية المناقشات على الإنترنت. وتتعلق أكثر النقاشات سلبية بالجنسية الأوزبكية والعلاقات التركية الأرمنية في سياق الإبادة الجماعية للأرمن. ومع ذلك ، فإن هذه الدراسة لها عيوب. أولاً ، ليس من الواضح بالضبط كيف تم جمع البيانات. على الرغم من أن IQBuzz يدعي تتبع جميع الإشارات على الإنترنت ، إلا أنه من المستحيل التحقق من ذلك دون الوصول الكامل إلى رسائل VK. ثانيًا ، لم يتم قياس مقاييس التصنيف على مجموعات كبيرة من النصوص ، لذلك من الصعب اختبار جودة العواطف المصنفة.ونتيجة لذلك ، كان من الصعب فصل الموضوعات بين الأعراق عن الموضوعات السياسية ، حيث أثر الصراع على قطبية المناقشات على الإنترنت. وتتعلق أكثر النقاشات سلبية بالجنسية الأوزبكية والعلاقات التركية الأرمنية في سياق الإبادة الجماعية للأرمن. ومع ذلك ، فإن هذه الدراسة لها عيوب. أولاً ، ليس من الواضح بالضبط كيف تم جمع البيانات. على الرغم من أن IQBuzz يدعي تتبع جميع الإشارات على الإنترنت ، إلا أنه من المستحيل التحقق من ذلك دون الوصول الكامل إلى رسائل VK. ثانيًا ، لم يتم قياس مقاييس التصنيف على مجموعات كبيرة من النصوص ، لذلك من الصعب اختبار جودة المشاعر المصنفة.ونتيجة لذلك ، كان من الصعب فصل الموضوعات بين الأعراق عن الموضوعات السياسية ، حيث أثر الصراع على قطبية المناقشات على الإنترنت. وتتعلق أكثر المناقشات سلبية بالجنسية الأوزبكية والعلاقات التركية الأرمنية في سياق الإبادة الجماعية للأرمن. ومع ذلك ، فإن هذه الدراسة لها عيوب. أولاً ، ليس من الواضح بالضبط كيف تم جمع البيانات. على الرغم من أن IQBuzz يدعي تتبع جميع الإشارات على الإنترنت ، إلا أنه من المستحيل التحقق من ذلك دون الوصول الكامل إلى رسائل VK. ثانيًا ، لم يتم قياس مقاييس التصنيف على مجموعات كبيرة من النصوص ، لذلك من الصعب اختبار جودة العواطف المصنفة.وتتعلق المناقشات الأكثر سلبية بالجنسية الأوزبكية والعلاقات التركية الأرمنية في سياق الإبادة الجماعية للأرمن. ومع ذلك ، فإن هذه الدراسة لها عيوب. أولاً ، ليس من الواضح بالضبط كيف تم جمع البيانات. على الرغم من أن IQBuzz يدعي تتبع جميع الإشارات على الإنترنت ، إلا أنه من المستحيل التحقق من ذلك دون الوصول الكامل إلى رسائل VK. ثانيًا ، لم يتم قياس مقاييس التصنيف على مجموعات كبيرة من النصوص ، لذلك من الصعب اختبار جودة العواطف المصنفة.وتتعلق أكثر النقاشات سلبية بالجنسية الأوزبكية والعلاقات التركية الأرمنية في سياق الإبادة الجماعية للأرمن. ومع ذلك ، فإن هذه الدراسة لها عيوب. أولاً ، ليس من الواضح بالضبط كيف تم جمع البيانات. على الرغم من أن IQBuzz يدعي تتبع جميع الإشارات على الإنترنت ، إلا أنه من المستحيل التحقق من ذلك دون الوصول الكامل إلى رسائل VK. ثانيًا ، لم يتم قياس مقاييس التصنيف على مجموعات كبيرة من النصوص ، لذلك من الصعب اختبار جودة العواطف المصنفة.لذلك ، من الصعب اختبار جودة العواطف المصنفة.لذلك ، من الصعب اختبار جودة العواطف المصنفة.



قام الباحثان Borodkina و Sibirev من جامعة سانت بطرسبرغ بفحص المناقشات حول Twitter باللغة الروسية المتعلقة بمشاكل الهجرة الدولية ، بالإضافة إلى العديد من المشكلات المرتبطة بالهجرة [55]. استخدم المؤلفون 13200 منشورًا تم نشره بين نوفمبر 2017 وفبراير 2018. تم جمع هذه البيانات حول موضوع "الهجرة" والكلمات الرئيسية ذات الصلة. ثم قام المؤلفون ، باستخدام معامل أوهاي ، بقياس تشابه العلامات ، وباستخدام مبدأ باريتو ، أزالوا الروابط الضعيفة غير المهمة من الرسم البياني للشبكة. لتحليل المشاعر ، تم تدريب المصنف بناءً على نموذج ناقل الدعم [33]. ولتحديد الروابط بين الخصائص (مثل المشاعر وخصائص المحتوى) ، تم استخدام طرق التحليل المناسبة. اتضح أنه بين الروس الذين يعيشون في بلدان مختلفة ، هناك موقف مشابه جدًا تجاه المهاجرين.تعبر نسبة كبيرة من المستخدمين عن موقف سلبي تجاه المهاجرين من جنسيات أخرى. المواضيع الرئيسية التي نوقشت: المخاطر على الثقافة والأمن المرتبطة بالإرهاب والهجرة غير الشرعية ، حقوق الإنسان بشكل عام ، انتهاك حقوق المهاجرين في روسيا في المجالات الاجتماعية والاقتصادية. هذه الدراسة لها عدة عيوب صغيرة. يتم وصف نهج تحليل المشاعر بإيجاز ، دون تفاصيل مرحلة المعالجة المسبقة ، والمعلمات الفائقة للنموذج ، والجودة النهائية لتصنيف النموذج المدرب. بالإضافة إلى ذلك ، توفر واجهة برمجة تطبيقات Twitter الأساسية وصولاً جزئيًا فقط إلى جميع المنشورات ، وبالتالي فإن تمثيل البيانات التي تم تحليلها أمر مشكوك فيه.المتعلقة بالإرهاب والهجرة غير الشرعية ، وحقوق الإنسان بشكل عام ، وانتهاك حقوق المهاجرين في روسيا في المجالات الاجتماعية والاقتصادية. هذه الدراسة لها عدة عيوب صغيرة. يتم وصف نهج تحليل المشاعر بإيجاز ، دون تفاصيل مرحلة المعالجة المسبقة ، والمعلمات الفائقة للنموذج والجودة النهائية للتصنيف باستخدام النموذج المدرب. بالإضافة إلى ذلك ، توفر واجهة برمجة تطبيقات Twitter الأساسية وصولاً جزئيًا فقط إلى جميع المنشورات ، لذا فإن تمثيل البيانات التي تم تحليلها أمر مشكوك فيه.المتعلقة بالإرهاب والهجرة غير الشرعية ، وحقوق الإنسان بشكل عام ، وانتهاك حقوق المهاجرين في روسيا في المجالات الاجتماعية والاقتصادية. هذه الدراسة لها عدة عيوب صغيرة. يتم وصف نهج تحليل المشاعر بإيجاز ، دون تفاصيل مرحلة المعالجة المسبقة ، والمعلمات الفائقة للنموذج والجودة النهائية للتصنيف باستخدام النموذج المدرب. بالإضافة إلى ذلك ، توفر واجهة برمجة تطبيقات Twitter الأساسية وصولاً جزئيًا فقط إلى جميع المنشورات ، وبالتالي فإن تمثيل البيانات التي تم تحليلها أمر مشكوك فيه.النموذج الفائق والجودة النهائية للتصنيف باستخدام النموذج المدرب. بالإضافة إلى ذلك ، توفر واجهة برمجة تطبيقات Twitter الأساسية وصولاً جزئيًا فقط إلى جميع المنشورات ، لذا فإن تمثيل البيانات التي تم تحليلها أمر مشكوك فيه.النموذج الفائق والجودة النهائية للتصنيف باستخدام النموذج المدرب. بالإضافة إلى ذلك ، توفر واجهة برمجة تطبيقات Twitter الأساسية وصولاً جزئيًا فقط إلى جميع المنشورات ، لذا فإن تمثيل البيانات التي تم تحليلها أمر مشكوك فيه.



وهكذا ، في سياق دراسة الهجرة والعلاقات بين الأعراق ، درس الباحثون في الغالب البيانات التي ينشئها المستخدم من الشبكات الاجتماعية ، باستخدام مزيج من النمذجة المواضيعية وتحليل المشاعر. إن مفهوم الإثنية مدروس جيدًا في الأدبيات الأكاديمية ، ولكن من وجهة نظر اللسانيات الحاسوبية ، يتم اختزال تعريف الجنسية في نصوص المستخدم في مهمة تحديد العلامات العرقية التي يستخدمها مؤلفو هذه النصوص [54]. لذلك ، من أجل تحديد النصوص ذات الصلة ، غالبًا ما ينشئ الباحثون قوائم بعلامات الحالة العرقية ويبحثون عن النصوص التي تحتوي على هذه العلامات. ومع ذلك ، يعد استخراج البيانات التمثيلية أمرًا صعبًا نظرًا لعدم توفر جميع الأنظمة الأساسية وصولاً كاملاً إلى جميع معلوماتها.ثم يتم تحليل المشاعر عادة على مستوى المستند أو الجانب. نظرًا لأن اللغة السلبية قد تحتوي على معلومات تعريف شخصية ، بالإضافة إلى خطاب مسيء أو يحض على الكراهية ، فقد يخضع هذا المحتوى للرقابة وفقًا لإرشادات وسائل التواصل الاجتماعي والمتطلبات القانونية. يحتوي القانون الجنائي للاتحاد الروسي على إطار تنظيمي ينظم الدعوات العامة لاتخاذ إجراءات جذرية ، والتي ينبغي أن تؤثر على حجم البيانات السلبية القوية في كل من المناقشات عبر الإنترنت وخارجها. يجب وصف كل هذه الميزات بوضوح في القسم الخاص بالقيود.قد تخضع هذه البيانات للرقابة وفقًا لقواعد وسائل التواصل الاجتماعي والمتطلبات القانونية. يحتوي القانون الجنائي للاتحاد الروسي على إطار تنظيمي ينظم الدعوات العامة لاتخاذ إجراءات جذرية ، والتي ينبغي أن تؤثر على حجم البيانات السلبية القوية في كل من المناقشات عبر الإنترنت وخارجها. يجب وصف كل هذه الميزات بوضوح في القسم الخاص بالقيود.قد تخضع هذه البيانات للرقابة وفقًا لقواعد وسائل التواصل الاجتماعي والمتطلبات القانونية. يحتوي القانون الجنائي للاتحاد الروسي على إطار تنظيمي ينظم الدعوات العامة لاتخاذ إجراءات جذرية ، والتي ينبغي أن تؤثر على حجم البيانات السلبية القوية في كل من المناقشات عبر الإنترنت وخارجها. يجب وصف كل هذه الميزات بوضوح في القسم الخاص بالقيود.



1.1.2. الأزمة الأوكرانية



توترت العلاقات بين روسيا وأوكرانيا بعد الثورة في عام 2014 ، والدخول اللاحق لشبه جزيرة القرم إلى الاتحاد الروسي ، والصراع المسلح في منطقتي دونيتسك ولوهانسك. نظرًا لأن العديد من منصات الوسائط الاجتماعية قد تطورت إلى أدوات حديثة للمشاركة الاجتماعية [53] ، فقد تم إجراء عدد من الدراسات في اللغويات الحاسوبية ، والتي حاول مؤلفوها استكشاف إمكانية استخدام الخطاب عبر الإنترنت لتحليل آراء وخصائص المشاركين في الخطاب. وفقًا لتعداد عام 2001 في أوكرانيا ، يعتبر 67.5 ٪ من سكانها الأوكرانية لغتهم الأم ، و 29.6 ٪ - الروسية. لذلك ، بالإضافة إلى اللغة الأوكرانية أو بدلاً منها ، قام الباحثون عادةً بتحليل النصوص باللغة الروسية.



قامت مجموعة من الباحثين بقيادة دوفانوفا بدراسة تأثير النزاع المسلح الأوكراني على الروابط الاجتماعية عبر الإنترنت بين جميع المناطق الأوكرانية [85]. استخدم المؤلفون فكونتاكتي كمصدر ، حيث إنها الشبكة الاجتماعية الأكثر شعبية في أوكرانيا. أولاً ، بناءً على الكلمات الرئيسية ، حددوا قائمة بالمجتمعات ذات الصلة - 777 14. ثم ، بناءً على هذه القائمة ، تم جمع 445 430 19 منشورًا و 711 193 62 تعليقًا باستخدام برنامج لرصد الشبكات الاجتماعية المقدمة في أعمال سيميونوف وفيجيالاينين ​​[105] ، وكذلك سيميونوف والمؤلفون المشاركون [106]. لتصنيف النصوص إلى إيجابية وسلبية ، طبق المؤلفون نهجًا قائمًا على القواعد مع قاموس مكون من 8863 كلمة إيجابية و 24299 كلمة سلبية باللغتين الروسية والأوكرانية. اتضح أن المناقشات في أوكرانيا أصبحت أكثر استقطابًا بسبب الأعمال العسكرية ، على سبيل المثال ،في المناطق الشرقية من البلاد ، ازداد عدد التصريحات السلبية والإيجابية. ومع ذلك ، في أجزاء أخرى من أوكرانيا ، لم يكن للأعمال العدائية تأثير ملحوظ على شدة التعبير عن المشاعر. وهكذا ، ولّدت الأعمال العدائية رد فعل عاطفيًا قويًا في البلاد ، لكن لم تكن هناك زيادة حتمية في التماسك الاجتماعي في الاتصالات الداخلية بين المناطق. ومع ذلك ، لم يقدم المؤلفون تفاصيل حول المعالجة المسبقة وتدريب النموذج ، أو مقاييس التصنيف.لكن لم تكن هناك زيادة حتمية في التماسك الاجتماعي في الاتصالات الداخلية بين المناطق. ومع ذلك ، لم يقدم المؤلفون تفاصيل حول المعالجة المسبقة وتدريب النموذج ، ومقاييس التصنيف.لكن لم تكن هناك زيادة حتمية في التماسك الاجتماعي في الاتصالات الداخلية بين المناطق. ومع ذلك ، لم يقدم المؤلفون تفاصيل حول المعالجة المسبقة وتدريب النموذج ، أو مقاييس التصنيف.



درس عمل الفريق بقيادة فولكوفا [86] التعبيرات على فكونتاكتي عن الرأي العام أثناء الأزمة الروسية الأوكرانية. بناءً على قائمة الكلمات الرئيسية ، جمع المؤلفون من فكونتاكتي مجموعة من 5،970،247 منشورًا ظهرت في الفترة من سبتمبر 2014 إلى مارس 2015. من أجل التنبؤ الهادف للآراء ، استخدم الباحثون نظام تصنيف POLYARNIK [107] استنادًا إلى القواعد الصرفية والنحوية والمفردات العاطفية ونماذج التعلم تحت الإشراف [108]. لتصنيف المشاعر ، جمع المؤلفون مجموعة من مناقشات تويتر المستقلة المتعلقة بالأزمة. بمساعدة الطرق الموضحة في [109] و [110] ، نفذ المؤلفون وضع علامات تلقائية على النصوص وفقًا لستة مشاعر أساسية لإيكمان [111].ثم أعادوا التحقق يدويًا من التعليق التوضيحي التلقائي مع المتحدثين الأصليين للروسية والأوكرانية. وكانت النتيجة مجموعة من 5717 تدوينة على تويتر تعبر عن الغضب والسرور والخوف والحزن والاشمئزاز والمفاجأة ، بالإضافة إلى 3947 مشاركة غير عاطفية. تم التصنيف النهائي للعواطف الواردة في النصوص على مرحلتين. في البداية ، تم تصنيف النصوص على أنها عاطفية وغير عاطفية. بعد ذلك ، وباستخدام نموذج الانحدار اللوجستي [32] ، تم تقسيم النصوص العاطفية إلى ست فئات بناءً على الأسلوب والمفردات والأحرف الثنائية. مرجح Fتم تنفيذها على مرحلتين. في البداية ، تم تصنيف النصوص على أنها عاطفية وغير عاطفية. بعد ذلك ، وباستخدام نموذج الانحدار اللوجستي [32] ، تم تقسيم النصوص العاطفية إلى ست فئات بناءً على الأسلوب والمفردات والأحرف الثنائية. مرجح Fتم تنفيذها على مرحلتين. في البداية ، تم تصنيف النصوص على أنها عاطفية وغير عاطفية. بعد ذلك ، وباستخدام نموذج الانحدار اللوجستي [32] ، تم تقسيم النصوص العاطفية إلى ست فئات بناءً على الأسلوب والمفردات والأحرف الثنائية. مرجح F1- بلغ قياس نموذج التصنيف العاطفي 58٪. وفقًا للنتائج التي تم الحصول عليها ، كانت نسبة الآراء الإيجابية بشأن الميدان الأوروبي أعلى في أوكرانيا منها في روسيا. للمقارنة ، كانت نسبة التصريحات الإيجابية حول بوتين وشبه جزيرة القرم أعلى في روسيا منها في أوكرانيا. بالإضافة إلى ذلك ، فإن بعض النتائج تتعارض مع المفاهيم الخاطئة الشائعة في وسائل الإعلام. على سبيل المثال ، كانت هناك منشورات في روسيا تحدث مؤلفوها بشكل إيجابي لصالح الولايات المتحدة وضد بوتين ، بينما كانت هناك منشورات في أوكرانيا تعبر عن دعم بوتين ، وليس الميدان الأوروبي. العيب الرئيسي للدراسة هو أن المؤلفين استخدموا بوليارنيك لتحليل المشاعر دون تقييم جودة تصنيف النصوص على الموضوع المختار. علاوة على ذلك ، طبق المؤلفون نموذجًا تم تدريبه على رسائل Twitter للتعرف على المشاعر في الرسائل من فكونتاكتي ،التي لها خصائص لغوية مختلفة ، على الأقل متوسط ​​طول النص. أيضًا ، تُطرح العديد من الأسئلة حول جودة التعليقات التوضيحية بواسطة مقيِّم واحد ، حيث إنه من المستحيل قياس مقاييس اتفاقية بين الخبراء.



مع الأخذ في الاعتبار الصراع الروسي الأوكراني لعام 2014 كأساس ، حلل رومشيسكي وزملاؤه ديناميكيات انعكاس الصراع السياسي في الشبكات الاجتماعية [87]. على عكس الدراسة التي أجرتها فولكوفا [86] ، لم يعتمد الباحثون على بيانات صاخبة حول موقع المؤلفين عند إنشاء مجموعة البيانات لتحليلها. وبدلاً من ذلك ، ركزوا على التحديد الذاتي لمجموعات المستخدمين المرتبطة بالأزمة. بعد تحليل بيانات فكونتاكتي ، اختار الباحثون يدويًا 51 مجموعة مناهضة للخادمة تضم 1942.918 مستخدمًا فريدًا ، و 47 مجموعة تمت ترقيتها تضم ​​2445661 مستخدمًا. ثم اخترنا جميع المنشورات على جدران هذه المجموعات ، وأضفنا منشورات من جدران المستخدمين النشطين وأولئك الذين أحبوا هذه المنشورات. تمت إضافة تلك المنشورات فقط إلى المجموعةالتي تمت مصادفة كلمة رئيسية واحدة على الأقل من قائمة محددة مسبقًا. للتنبؤ بمشاعر النصوص باللغة الروسية ، استخدم الباحثون نسخة محسنة من مكتبة SentiMental ، وهي نظام لتحليل المشاعر قائم على القاموس. وأكدت نتائج البحث أن زيادة حدة الصراع مصحوبة بتصريحات سلبية. فحص التحليل العلاقة بين المشاعر السائدة ومقياس جدل المشي العشوائي. مع زيادة عدد الخلافات ، يزداد كذلك الانحراف المعياري للمشاعر العامة التي تعبر عنها المجموعات المعارضة ، وكذلك مقياس الشرود العشوائي للمناقشة. العيب الرئيسي للدراسة هو أن مؤلفيها لم يقدموا أي تفاصيل حول المعالجة المسبقة والتدريب.للتنبؤ بمشاعر النصوص باللغة الروسية ، استخدم الباحثون نسخة محسنة من مكتبة SentiMental ، وهي نظام لتحليل المشاعر قائم على القاموس. وأكدت نتائج البحث أن زيادة حدة الصراع مصحوبة بتصريحات سلبية. درس التحليل العلاقة بين المشاعر السائدة ومقياس جدل المشي العشوائي. مع زيادة عدد الخلافات ، يزداد كذلك الانحراف المعياري للمشاعر العامة التي تعبر عنها المجموعات المعارضة ، وكذلك مقياس الشرود العشوائي للمناقشة. العيب الرئيسي للدراسة هو أن مؤلفيها لم يقدموا أي تفاصيل حول المعالجة المسبقة والتدريب.للتنبؤ بمشاعر النصوص باللغة الروسية ، استخدم الباحثون نسخة محسنة من مكتبة SentiMental ، وهي نظام لتحليل المشاعر قائم على القاموس. وأكدت نتائج البحث أن زيادة حدة الصراع مصحوبة بتصريحات سلبية. فحص التحليل العلاقة بين المشاعر السائدة ومقياس جدل المشي العشوائي. مع زيادة عدد الخلافات ، يزداد كذلك الانحراف المعياري للمشاعر العامة التي تعبر عنها المجموعات المعارضة ، بالإضافة إلى مقياس التجوال العشوائي للمناقشة. العيب الرئيسي للدراسة هو أن مؤلفيها لم يقدموا أي تفاصيل حول المعالجة المسبقة والتدريب.



اقترح زايزيف دراسة عملية التعبئة السياسية من خلال تحليل محتوى الشبكات الاجتماعية [88]. تم أخذ الثورة الأوكرانية 2013-2014 كأساس. ركز المؤلف على المرحلة الأولى من الاحتجاجات ، من 21 فبراير 2013 إلى 22 فبراير 2014. وقام بتحليل المنشورات في أكثر الشبكات الاجتماعية شعبية في أوكرانيا: فكونتاكتي وفيسبوك. حدد Zaeziev مجموعة من الكلمات الرئيسية ذات الصلة بناءً على التوصيات العامة لـ Godbowl [112] ، ثم جمع أكثر من 124000 رسالة باستخدام IQBuzz. باستخدام خوارزميات التعرف على المشاعر IQBuzz ، صنف الباحث النصوص إلى فئات: سلبية ، ومحايدة ، وإيجابية ، ومختلطة. على افتراض أن مؤيدي الميدان الأوروبي سيعبرون عن موقف إيجابي تجاه هذا الحدث ، أزال المؤلفون جميع الرسائل غير الإيجابية من المجموعة.ثم قمنا بتصفية المجموعة من خلال قائمة محددة مسبقًا من الكلمات الرئيسية ، وترك 4255 منشورًا. كشف تحليل هذه البيانات أنه في الليلة الأولى للاحتجاجات ، تم استخدام الشبكات الاجتماعية في المقام الأول كأداة للتعبئة السياسية ، ولاحقًا كأداة للتغطية الإعلامية. العيب الرئيسي للدراسة هو أنها لا تصف مقاييس تصنيف المشاعر ، لذلك من الصعب التحقق من دقة النتائج.



درس الباحث توكاريف من معهد موسكو الحكومي للعلاقات الدولية الخطاب بين المدونين الأوكرانيين الرئيسيين بشأن إقليم وسكان دونباس في الفترة من 2009 إلى 2018 [56]. قام المؤلف بتحليل دلالات النقاشات وتكرارها وعاطفتها في الجزء الأوكراني من Facebook. يتكون البحث من عدة مراحل. أولاً ، تم تحديد قادة الرأي وتنزيل منشوراتهم من 1 يناير 2009 إلى 15 فبراير 2018. ثم ، بناءً على الكلمات الرئيسية المحددة مسبقًا من الخطاب ، حدد المؤلفون المنشورات المخصصة لدونباس. في المرحلة التالية ، تم إنشاء قاموس للعواطف ، والذي تم استخدامه لاحقًا للتمييز بين المناقشات وفقًا لدرجة عاطفتها. بمساعدة المتطوعين ، تم جمع مفردات من 566 كلمة محددة للمنطقة والسكان.تم تقديم كل كلمة باللغتين الروسية والأوكرانية. ثم قام فريق مكون من 69 مقيِّمًا بوضع تعليقات توضيحية على المفردات في خمس درجات: إيجابي ، محايد - إيجابي ، محايد - سلبي ، وسلبي. أخيرًا ، تم تقييم درجة التعبير عن المشاعر وديناميكيات المناقشات. تم تحليل مجموعة من 1069687 مطبوعة لـ 376 مدونًا رئيسيًا بسبع لغات. اتضح أن بداية المناقشات حول إقليم وسكان دونباس بدأت في مطلع 2013-2014. قبل ذلك ، كان تكرار ذكر هذه المنطقة يقارب الصفر. تم التعبير عن موقف سلبي كبير تجاه السكان ، ولم يكن هناك عمليا أي مناقشة سلبية حول الإقليم. سادت لهجة محايدة. كان عدد المناقشات الإيجابية والسلبية للإقليم أقل بكثير مقارنة بمناقشات السكان.يسمح لنا هذا باستنتاج أن هناك درجة عالية من عدم اليقين بين المدونين الرئيسيين فيما يتعلق بالمنطقة ، فضلاً عن احتمال ضئيل لانتقال الخطاب من النبرة المحايدة إلى الإيجابية. عيوب هذه الدراسة هي نفس عيوب عمل زايزيف [88] ، ولا يوجد وصف لمقاييس التصنيف.



وهكذا ، أثناء دراسة الأزمة الأوكرانية ، استخدم الباحثون المعلومات ليس فقط عن المشاعر ، ولكن أيضًا حول موقع مؤلفي المنشورات من أجل دراسة الاتصال الإقليمي للمستخدمين. لتحديد النصوص ذات الصلة ، تم جمع قائمة بكلمات علامات التضارب وتم البحث في النصوص التي تحتوي على هذه العلامات. عند تحليل المجموعات العرقية أو المشاكل المرتبطة بالهجرة ، من الصعب استخراج بيانات تمثيلية ووصف القيود المصاحبة بشكل شامل.



1.1.3. التوتر الاجتماعي



تشكل العمليات التي لوحظت في المجتمع الروسي الحديث الحاجة إلى وضع الصراعات الاجتماعية في إطار محدد [113]. بالنظر إلى الاستخدام الواسع النطاق لوسائل الإعلام الاجتماعية التي لها فوائد ومخاطر للمجتمع المدني ، [114] ينبغي إعطاء تحليل المحتوى عبر الإنترنت الاهتمام الواجب والمناسب ، بما في ذلك تحديد التوترات الاجتماعية. يمكنك قياس التوترات الاجتماعية على الإنترنت باستخدام المؤشرات والمقاييس ، ثم استخدام هذه المعلومات لتتبع اندلاع التوترات ، وهو شكل من أشكال "الحكم الاستباقي" [115].



قام الفريق بقيادة دونتشينكو بتحليل التعليقات على فكونتاكتي حول الموضوعات الحساسة اجتماعيًا للفترة من يناير إلى يونيو 2017 [89]. قام الباحثون بتجميع قائمة بالموضوعات الشائعة المتعلقة بقضايا التوتر الاجتماعي ، وجمعوا منشورات المستخدم ذات الصلة من خلال VKontakte API. ثم تمت معالجة النصوص مسبقًا: تم تحديد اشتقاق الكلمات (الاشتقاق) ، وإزالة علامات الترقيم ، واستبدال الاختصارات القياسية والكلمات العامية بالكلمات العادية المقابلة. للتصنيف حسب الموضوع ، قام المؤلفون بتدريب نموذج ناقل الدعم (SVM) [33] مع توجيه TF-IDF [116]. الموضوعات الاجتماعية الساخنة: البطالة والفساد وارتفاع أسعار السلع الاستهلاكية. أيضًا ، باستخدام نموذج SVM ، تم تصنيف قطبية الدرجة اللونية. اتضح أن الحالة المزاجية الاحتجاجية تتركز عادة في مراكز المناطق المكتظة بالسكان.تتمثل إحدى عيوب العمل الرئيسية في عدم وجود تقييم لجودة شرح البيانات وغياب مواصفات مقاييس تصنيف المشاعر. اكتشف كولتسوفا وناغورني الموضوعات التي تُصنف على أنها مشاكل اجتماعية من خلال تحليل تعليقات قراء وسائل الإعلام الروسية الإقليمية [57]. جمع المؤلفون مجموعة من 33887 خبرًا و 258107 تعليقًا من مواقع أومسك الإعلامية (Gorod55 و BK55 و NGS Omsk و Omsk-Inform) للفترة من سبتمبر 2013 إلى سبتمبر 2014. لتحديد الموضوعات التي تنتمي إليها النصوص الإخبارية ، استخدم المؤلفون Gensim- تنفيذ [117] من خوارزمية تخصيص Dirichlet الكامنة [102] بمقياس تم تطويره بواسطة Arun و Suresh و Madhavan و Murthy [118]. لتصنيف شعور التعليقات ، استخدم المؤلفون SentiSt Strength [22] مع مفردات PolSentiLex. وجدت Koltsova و Nagorny أن مثل هذه الموضوعات ،كيف أن الترفيه والثقافة والرياضة والعطلات غالبًا ما تثير المشاعر الإيجابية ، وترتبط معظم المشاعر السلبية بالجريمة والكوارث. قام الباحثون بحساب مؤشر الأهمية والقطبية لكل موضوع. تتمثل إحدى المشكلات الأساسية في استخدام SentiSt Strength في هذه الدراسة في أن المؤلفين لم يصفوا المقاييس الخاصة بتصنيف البيانات للموضوع المحدد ، لذلك من الصعب التحقق من دقة النتائج.



وهكذا ، استخدم المؤلفون طريقتين لتحديد الموضوعات الاجتماعية الحادة. في الحالة الأولى ، يتم تصفية البيانات بناءً على قائمة من الكلمات الرئيسية ، وفي الحالة الثانية ، يتم تطبيق التجميع غير الخاضع للإشراف لجميع البيانات ، متبوعًا بتحديد الموضوعات الاجتماعية الحادة. عند استخدام البيانات من الشبكات الاجتماعية ، واجه المؤلفون نفس الصعوبات في استخراج البيانات التمثيلية. ومع ذلك ، فإن هذا غير مناسب عند تحليل البيانات من المواقع الإخبارية ، لأنها عادة لا تفرض قيودًا على الوصول إلى المعلومات المنشورة. بما أن الخطاب حول مواضيع حساسة يمكن أن يكون مصحوبًا ببيانات قاسية ، فإن الأخيرة يمكن أن تخضع للرقابة وفقًا لاتفاقيات المستخدم والتشريعات.



1.1.4. موضوعات أخرى



ركز عدد من الدراسات على موضوعات من مجالات أخرى. درس الباحث Ruleva رد الفعل في مستخدمي Twitter و YouTube الناطقين بالروسية على انفجار نيزك فوق تشيليابينسك في فبراير 2013 [58]. على مدى المائة عام الماضية ، كان أكبر جرم سماوي دخل الغلاف الجوي للأرض. كما هو متوقع ، أثار الحدث جدلاً عاطفيًا في وسائل الإعلام التقليدية ومنصات الإنترنت. جمعت الباحثة 495 تدوينة على تويتر في الفترة من 15 إلى 20 فبراير 2013 م باستخدام هاشتاغ “نيزك” ، بالإضافة إلى عدد غير محدد من مقاطع فيديو يوتيوب. تم التركيز على التحليل المقارن للمحتوى من كلا الموقعين في سياق الاختلافات بين الأنواع المنطوقة الابتدائية والثانوية [119]. ومع ذلك ، أعطت النصوص أيضًا تفسيرًا معينًا للمشاعر والعواطف.



وجدت Ruleva أن محتوى YouTube يوفر بيانات أكثر فائدة لبحوث المشاعر من Twitter. اعتمد المؤلف على تحليل النوع ومزيج من التحليل اللغوي والسيميائي. أي أنها قامت بتحليل النص نفسه وكيفية تقديمه. يعتقد المؤلف أن مستخدمي YouTube و Twitter ينتمون غالبًا إلى مجموعات اجتماعية مختلفة ، لذلك قد يكون لديهم أنماط مختلفة من التعبير عن المشاعر. على الرغم من أن الدراسة ككل مرتبطة بشكل غير مباشر بالجوانب العاطفية للنص ، إلا أن روليفا كانت من أوائل من بحثوا في الاختلافات بين الأنواع المختلفة للمعلومات باللغة الروسية. ومع ذلك ، لا يوجد وصف تفصيلي لطريقة مقارنة المشاعر وإجراءات جمع البيانات في YouTube. للبحث عن البيانات على تويتر ، تم تطبيق التصفية الأساسية التي تجاهلت جزءًا كبيرًا من الرسائل ،التي تفتقر إلى هاشتاغ "نيزك". علاوة على ذلك ، بدون استخدام واجهة برمجة التطبيقات التاريخية ، لا تمنح أداة بحث Twitter سوى وصول جزئي إلى جميع الرسائل المتاحة للجمهور.



أجرى كيريلينكو وستيبتشينكوفا دراسة مقارنة لخطاب تويتر باللغتين الروسية والإنجليزية حول أولمبياد 2014 في سوتشي [90]. تم جمع أكثر من 400000 رسالة عبر Twitter API على مدى ستة أشهر تغطي الألعاب الأولمبية [120] ثم خضعت لتحليل الكتلة والمشاعر للمسابقة. قام المؤلفون بتقييم مناهج التحريك العميق [121] ، والنمط ، والقوة الحسية [22] على مجموعة مُصنفة يدويًا تتكون من 600 مشاركة باللغة الإنجليزية و 3000 مشاركة روسية على Twitter. على الرغم من زيادة التعبير عن الموقف الإيجابي تجاه الأولمبياد خلال اللعبة ، إلا أن هذا التحسن كان مهمًا فقط لرسائل الروس. ومع ذلك ، لم يقدم المؤلفون مقاييس تصنيف للنماذج التي تم تقييمها ، ولم يصفوا خطوة المعالجة المسبقة.



درس الفريق بقيادة سبايسر موجة الاحتجاجات الجماهيرية على خلفية انتخابات مجلس الدوما ورئاسة الاتحاد الروسي في الفترة 2011-2012 [91]. قام الباحثون بتحليل رسائل Twitter ذات الصلة باللغة الروسية من 17 مارس 2011 إلى 12 مارس 2012 ، والتي تم جمعها من خلال Twitter Streaming API. تم اختيار البيانات وفقًا لقائمة من الكلمات الرئيسية. تم جمع 690297 رسالة باللغة الروسية تتعلق بالسياسة. لتحديد مؤيدي ومعارضي بوتين ، استخدم المؤلفون مزيجًا من قائمة الكلمات الرئيسية وقوة SentiSt Strength [22] ، ثم صنفوا أفضل 1000 مستخدم حسب متوسط ​​درجة المشاعر والانتماء الحزبي. من خلال مقارنة التعليقات التوضيحية اليدوية لـ 100 مستخدم على كلا الجانبين مع التصنيف التلقائي ، وجد الباحثون أن حوالي 70 ٪ من المشاركين تم تصنيفهم بشكل صحيح.أخيرًا ، طبق المؤلفون طريقة بحث نوعي [122] وقاموا يدويًا بترميز المفتاح المستخرج n-grams. تتمثل إحدى النتائج الرئيسية في أن الخطاب على تويتر كان مدعومًا في البداية من قبل المعارضة ، ثم تراجعت تعبئة المعارضة بشكل كبير وزاد الدعم لبوتين. ومع ذلك ، فإن هذه الدراسة لها عيوب عديدة. أولاً ، إن تمثيل عينة البيانات غير واضح ، لأن Twitter Streaming API يوفر وصولاً جزئيًا فقط إلى جميع المنشورات. ثانيًا ، لم يتم قياس مقاييس التصنيف على مجموعة النص الهدف ، لذلك من الصعب التحقق من جودة تصنيف المشاعر.ولاحقًا ، تراجعت تعبئة المعارضة بشكل كبير وزاد الدعم لبوتين. ومع ذلك ، فإن هذه الدراسة لها عيوب عديدة. أولاً ، إن تمثيل عينة البيانات غير واضح ، لأن Twitter Streaming API يوفر وصولاً جزئيًا فقط إلى جميع المنشورات. ثانيًا ، لم يتم قياس مقاييس التصنيف على مجموعة النص الهدف ، لذلك من الصعب التحقق من جودة تصنيف المشاعر.ولاحقًا ، تراجعت تعبئة المعارضة بشكل كبير وزاد الدعم لبوتين. ومع ذلك ، فإن هذه الدراسة لها عيوب عديدة. أولاً ، إن تمثيل نموذج البيانات غير واضح ، لأن Twitter Streaming API يوفر وصولاً جزئيًا فقط إلى جميع المنشورات. ثانيًا ، لم يتم قياس مقاييس التصنيف على مجموعة النص الهدف ، لذلك من الصعب التحقق من جودة تصنيف المشاعر.



أجرى نينكو وبيتروفا تحليلًا مقارنًا لتوزيع المشاعر في سانت بطرسبرغ استنادًا إلى تعليقات المستخدمين حول الكائنات الحضرية في أماكن Google والبيانات من نظام المعلومات الجغرافية المفتوح عدم الدقة [92]. احتوت مجموعة البيانات على 1800 علامة عاطفة من عدم الدقة و 2450 تعليقًا من أماكن Google. قام اثنان من المقيّمين بتمييز التعليقات في ستة مشاعر ومعالجتها باستخدام مصنف بايزي ساذج [123]. استنادًا إلى تحليل المشاعر ومجموعة بيانات من غير لائق ، أنشأ المؤلفون خريطة حرارة للمشاعر السلبية والإيجابية في سانت بطرسبرغ. الاتجاه العام هو تركيز المشاعر الإيجابية والسلبية في المركز التاريخي في جنوب المدينة ، في الطرف الغربي لجزيرة فاسيليفسكي وفي وسط جزيرة بتروغرادسكي.ومع ذلك ، لم يصف المؤلفون منهجية المعالجة المسبقة ومقاييس التصنيف.



وبالتالي ، عند فحص المواقف تجاه الأحداث أو الأماكن المختلفة ، واجه الباحثون نفس الصعوبات في العثور على بيانات تمثيلية ووصف القيود بشكل شامل. بالإضافة إلى ذلك ، كان العيب الرئيسي لمعظم الدراسات هو عدم وجود تقييم لنموذج تحليل المشاعر في النصوص حول موضوعات مختارة ، لذلك من الصعب التحقق من جودة التصنيف.



1.2 مؤشر المشاعر الاجتماعية



عند قياس مستوى السعادة والرضا عن الحياة ، على سبيل المثال ، باستخدام مؤشر الرفاهية الذاتية (SWB) [124] ، تعتمد الأساليب النفسية الحديثة على مقاييس التقييم الذاتي. هذه الأساليب لها عيوب. على سبيل المثال ، العدد المحدود من المقابلات ، والتكلفة العالية لمقابلة المستجيبين ، والاعتماد على ذاكرة المشاركين يجعل من الصعب تقديم حالة المستجيبين في الوقت الحقيقي [125] - [127]. بدلاً من ذلك ، حاول الباحثون قياس مؤشرات مختلفة للمشاعر الاجتماعية باستخدام تحليل المشاعر لأنه يتم التعبير عن مجموعة واسعة من الآراء في البيانات التي ينشئها المستخدم على وسائل التواصل الاجتماعي [2] ، [127] - [133].



في عمله [93] ، حسب بانشينكو مؤشر المشاعر في Facebook باللغة الروسية على أنه متوسط ​​مستوى المشاعر في مجموعة من النصوص. قمنا بتحليل 573 مليون منشور وتعليق مجهول المصدر للفترة من 5 أغسطس 2006 إلى 13 نوفمبر 2013 ، قدمتها Digsolab LLC للبحث. قام المؤلفون بتصفية المجموعة الكاملة من النصوص باللغة الروسية باستخدام وحدة langid.py [134]. تم حساب مؤشر المشاعر الاجتماعية باستخدام نهج قائم على القاموس [135] ، [136] ، على غرار نهج دود [129]. طور المؤلف قاموسه الخاص للعواطف من 1511 مصطلحًا ، تميز به اثنان من المتخصصين في فئتين إيجابية وسلبية. لتقييم جودة التصنيف ، طبق بانشينكو نهج المفردات على مجموعة بيانات ROMIP 2012 [15]. يدعي المؤلف أنه في مجموعة من مراجعات الفيلم حقق قيمة متوسط ​​الماكرو F 1- نقطة تصل إلى 0.383 ودقة تصل إلى 0.465. لقياس المشاعر ، اقترح المؤلف أربعة مؤشرات: مؤشر المشاعر Word ، مؤشر العاطفة للكلمة ، مؤشر المشاعر النصية ، مؤشر العاطفة للنص. يعمل أول اثنان باستخدام نغمة الكلمات ، ويعمل الاثنان الآخران مع نغمة النص. وفقًا للتحليل ، يسود المحتوى الإيجابي على المحتوى السلبي. تتزامن القيم القصوى للمؤشرات مع أيام العطل الرسمية ، والحد الأدنى للقيم - مع أيام لا تنسى ومآسي وطنية. بشكل عام ، يعبر المستخدمون عن المشاعر الإيجابية 3.8 مرة أكثر من المشاعر السلبية. يستخدم الأشخاص كلمات عاطفية أقل في المشاركات والمزيد في التعليقات. القيد الأكثر أهمية هو أنأن المؤلف فحص جودة التصنيف في مراجعات الفيلم وطبقه على نصوص عامة ، لذلك يصعب التحقق من دقة النتيجة. بالإضافة إلى ذلك ، لم يتم وصف عملية جمع البيانات الداخلية في Digsolab ، وبالتالي يتم طرح أسئلة حول التمثيل.



اقترح الفريق بقيادة Shchekotin طريقة جديدة للتقييم الذاتي للرفاهية ، والتي تستند إلى بيانات فكونتاكتي حول نشاط المستخدم [68]. أخذ المؤلفون نموذج مؤشرات جودة الحياة الذي طورته جافريلوفا [137] ، واختاروا بعض المؤشرات للرصد في دراستهم. مع التركيز على التمثيل الجغرافي والاجتماعي والاقتصادي ، اختاروا 43 منطقة روسية من أصل 85. ثم ، في المناطق المختارة ، حددوا أكبر ثلاث مدن واختاروا 10 مجتمعات فكونتاكتي لكل منها ، وتوحيد سكان هذه المدن - المجتمعات الحضرية. بعد ذلك ، باستخدام مجموعة من البيانات من الشبكات الاجتماعية ومنصة تحليلية لاتحاد جامعات باحثي البيانات الضخمة ، التي تم تطويرها في جامعة تومسك الحكومية ،استخرج المؤلفون المعلومات التي نشرتها هذه المجتمعات للفترة من 1 كانون الثاني (يناير) إلى 31 كانون الأول (ديسمبر) 2018. وبعد ذلك ، أزالوا البيانات غير ذات الصلة - المنشورات والنصوص الإعلانية التي لا تتعلق بموضوع البحث (الشواغر ، الرياضة ، الأحداث الثقافية). تم إجراء تصفية البيانات غير ذات الصلة على مرحلتين: التحليل اليدوي لعدد 60 ألف رسالة والتنظيف التلقائي ، حيث تم تدريب الخوارزمية على الرسائل التي تم تنظيفها يدويًا. بعد ذلك ، بقي حوالي 1700000 منشور. أثناء التطهير ، تم وضع تعليقات توضيحية على المنشورات يدويًا حول 19 موضوعًا وثلاث فئات للمشاعر (إيجابية وسلبية ومحايدة). في سياق المعالجة المسبقة ، تمت إزالة الكلمات والرموز النادرة التي لا تنتمي إلى الأبجدية الروسية واللاتينية ، وتم اختزال جميع الكلمات الأخرى إلى قواعدها (الاشتقاق). ثم تم تدريب العديد من خوارزميات التعلم الآلي.تم عرض أفضل جودة في التصنيف من خلال خوارزمية تعزيز التدرج من LightGBM [138] - حتى 68٪ لتصنيف الفئة و 79٪ لتصنيف المشاعر. لحساب مؤشر الرفاه الشخصي [124] ، [139] لكل منطقة ، اقترح المؤلفون طريقة تعتمد على مؤشرات النشاط عبر الإنترنت. أظهرت نتائج الدراسة أنه في المناطق المختارة ، تتم مناقشة موضوعات تطوير البنية التحتية الإقليمية بشكل إيجابي. يرتبط أقل نشاط إيجابي بتقييم الحالة العاطفية العامة وحرية وسائل الإعلام. أكثر المواضيع التي نوقشت بشكل سلبي هي موضوع الأمن ، أي تقييم تصرفات قوات الأمن وغيرها من مؤسسات الدولة المتعلقة بضمان الأمن في المنطقة.إن أدنى المؤشرات السلبية للنشاط عبر الإنترنت هي أيضًا سمة للحالة العاطفية العامة وحرية وسائل الإعلام. بالإضافة إلى ذلك ، قام المؤلفون بتجميع قائمة شاملة بالقيود ، بما في ذلك تمثيل عينات البيانات ، وجمهور الشبكات الاجتماعية التي تم تحليلها ، والتأثير المحتمل للروبوتات.



ومع ذلك ، عند إعداد مجموعة بيانات التدريب ، لم يصف المؤلفون توزيع فئات المشاعر. إذا لم تكن مجموعات البيانات متوازنة ، فمن المستحسن قياس جودة التصنيف باستخدام مقاييس أكثر تعقيدًا ، مثل الدقة والاستدعاء والقياس F.



1.3 سلوك المستخدم



يمكن أن يكون محتوى الوسائط الاجتماعية مصدرًا قيمًا للمعلومات ، ليس فقط حول المواقف تجاه الموضوعات المختلفة ، ولكن أيضًا حول الأنماط السلوكية للمستخدمين عند التفاعل مع هذا المحتوى.



حدد سفيتلوف وبلاتونوف تأثير النغمة على تلقي التعليقات من الجمهور [69]. كان مصدر البيانات هو 46293 منشورًا و 2197.063 تعليقًا من أشهر حسابات السياسيين الروس على فكونتاكتي للفترة من يناير 2017 إلى أبريل 2019. قام الباحثون بتدريب BiGRU [140] على مجموعتي بيانات RuTweetCorp [141] و RuSentiment [142] ، واستلموا متوسط ​​الماكرو على التوالي F 1 = 0.91 و F 1= 0.77. بناءً على نتائج تحليل المشاعر ، حدد المؤلفون العديد من أنماط الاستجابة. تم تصنيف المشاركات على أنها إيجابية إذا كان لديها المزيد من المشاهدات والإعجابات من المستخدمين. تم تصنيف المشاركات التي تحتوي على عدد كبير من عمليات إعادة النشر والتعليقات على أنها سلبية. ومع ذلك ، فإن استخدام بيانات التدريب من منطقة ما واستخدام النماذج المدربة عليها في مجال آخر يثير العديد من الأسئلة. RuTweetCorp عبارة عن مجموعة من المشاركات القصيرة من Twitter ، و RuSentiment عبارة عن مجموعة من الموضوعات العامة من فكونتاكتي ، مع تركيز الدراسة قيد المناقشة على السياسة. تتمثل إحدى الطرق الجيدة للخروج في هذا الموقف في وضع تعليق توضيحي يدويًا على مجموعة صغيرة من النصوص حول الموضوع المستهدف واختبار النموذج المدرب عليه.



2. ردود الفعل على المنتجات والخدمات



صورة

في عصر الإنترنت ، أصبحت مراجعات المنتجات والخدمات أداة قوية للتعبير عن التحقق الاجتماعي الذي يشجع الناس على الشراء من متاجر مختلفة على الإنترنت [143]. يمكن أن تكون الشهادات مصدرًا قيمًا للمعلومات ليس فقط للمشترين والبائعين ، ولكن أيضًا للباحثين. في هذا الفصل ، يتم تقسيم مصادر الأدب وفقًا للمواضيع التي تم تحليلها: خصائص المشترين ، خصائص المنتجات والخدمات ، خصائص التجار.



2.1. خصائص المراجعين



قامت مجموعة بحثية من جامعة سانت بطرسبرغ بتحليل مواضيع وأسلوب المراجعات لـ 989 شركة توظيف تعمل في 12 صناعة روسية كثيفة المعرفة [70]. اتخذ الباحثون موقع Otrude ، أحد أكبر البوابات الروسية مع مراجعات أصحاب العمل ، كمصدر رئيسي للبيانات. بعد تصفية البيانات غير الضرورية وإزالتها ، حصلنا على مجموعة من 6145 مراجعة. تمت المعالجة المسبقة على عدة مراحل: إزالة اللماتة باستخدام MyStem ، وإزالة علامات الترقيم ووقف الكلمات. صنف المؤلفون النصوص تلقائيًا إلى فئتين بناءً على تصنيف المراجعات: أولئك الذين حصلوا على ثلاث نجوم على الأقل اعتبروا إيجابيين ، واعتبر الباقي سلبيًا. ثم قام الباحثون بتحليل المشاعر باستخدام وضع Dirichlet الكامن [102] - أو نمذجة الموضوع - ونموذج تصنيف غير محدد.اكتشف الفريق بقيادة سوكولوف أن ستة عوامل رئيسية تؤثر على الرضا الوظيفي: ترتيب وجدول العمل ، وظروف العمل ، وطبيعة العمل ، والراتب ، والتطوير الوظيفي ، والمناخ النفسي ، والعلاقات الشخصية مع الزملاء. غالبًا ما تتم مناقشة العاملين الأخيرين - البيئة العقلية والعلاقات الشخصية - من قبل الأشخاص عبر الإنترنت عند مناقشة الرضا الوظيفي. لذلك ، اقترح المؤلفون أنه عندما يقرر الشخص الإقلاع عن التدخين ، فإنه يميل إلى تحمل العوامل الاقتصادية (على سبيل المثال ، مع احتمالات التطور الوظيفي وزيادة الرواتب) ، وليس العوامل الاجتماعية والعاطفية (على سبيل المثال ، مع طبيعة العمل السيئة ، والعلاقات السيئة مع الزملاء). المشكلة الرئيسية للبحث هي صحة استخدام تحليل المشاعر. تحتوي جميع المراجعات على موقع Otrude على تقييم المؤلف ،لذلك ، من وجهة نظر رسمية ، ليس هناك حاجة لتصنيف المشاعر لتقييم هذه المراجعات. عيب آخر هو أن المؤلفين لم يصفوا نهجهم في التحليل ونتائج تصنيف المشاعر في مجموعة بيانات الاختبار.



2.2.



قام الفريق بقيادة Seliverstov ، بناءً على بيانات من بوابة Autostrada ، بتقييم الموقف من حالة الطرق في المنطقة الفيدرالية الشمالية الغربية من الاتحاد الروسي [71]. للتدريب ، استخدم المؤلفون RuTweetCorp [141] ، وهي أكبر مجموعة نصوص مشروحة تلقائيًا مع القليل من التصفية اليدوية ، تم جمعها على موقع تويتر باللغة الروسية. لأغراض التصنيف ، تم أخذ نموذج نزول عشوائي خطي منظم ونموذج كيس من الكلمات مع توجيه TF-IDF. بعد التدريب ، أظهر النموذج دقة تصنيف ثنائية بنسبة 72٪. بعد تحليل المراجعات للفترة من 1 مارس 2009 إلى 1 نوفمبر 2018 ، وجد المؤلفون أن طول جميع الطرق التي تم تقييمها إيجابياً كان 9874 كم (75٪ من الطول الإجمالي) ، وطول الطرق التي تم تقييمها سلبياً كان 3385 كم (25٪)ومع ذلك ، فإن هذه الدراسة لها العديد من العيوب. أولاً ، لا يصف المؤلفون عملية المعالجة المسبقة ، وهو أمر بالغ الأهمية عند التعلم على RuTweetCorp. الحقيقة هي أن هذه المجموعة صُممت في الأصل لإنشاء معجم للعواطف ، وليس لتصنيف المشاعر بشكل مباشر. تم تجميع المجموعة تلقائيًا وفقًا لإستراتيجية معينة [144] ، أي أن كل نص مرتبط بفئة معينة من المشاعر ، اعتمادًا على الرموز التي يحتويها. لذلك حتى النهج البسيط القائم على القواعد يمكن أن يحقق نتائج رائعة. على سبيل المثال ، إذا كان النموذج يصنف النص على أنه إيجابي بسبب وجود حرف فيه (أو سلبي بسبب عدم وجود هذه الشخصية ، فعندئذ في التصنيف الثنائي نحصل على Fوهو أمر بالغ الأهمية عند التعلم على RuTweetCorp. الحقيقة هي أن هذه المجموعة مصممة في الأصل لإنشاء معجم للعواطف ، وليس لتصنيف المشاعر بشكل مباشر. تم تجميع المجموعة تلقائيًا وفقًا لاستراتيجية معينة [144] ، أي أن كل نص مرتبط بفئة معينة من المشاعر ، اعتمادًا على الرموز التي يحتويها. لذلك حتى النهج البسيط القائم على القواعد يمكن أن يحقق نتائج رائعة. على سبيل المثال ، إذا كان النموذج يصنف النص على أنه إيجابي بسبب وجود حرف فيه (أو سلبي بسبب عدم وجود هذه الشخصية ، فعندئذ في التصنيف الثنائي نحصل على Fوهو أمر بالغ الأهمية عند التعلم على RuTweetCorp. الحقيقة هي أن هذه المجموعة صُممت في الأصل لإنشاء معجم للعواطف ، وليس لتصنيف المشاعر بشكل مباشر. تم تجميع المجموعة تلقائيًا وفقًا لإستراتيجية معينة [144] ، أي أن كل نص مرتبط بفئة معينة من المشاعر اعتمادًا على الرموز الموجودة فيه. لذلك حتى النهج البسيط القائم على القواعد يمكن أن يحقق نتائج رائعة على سبيل المثال ، إذا صنف النموذج النص على أنه إيجابي بسبب وجود حرف فيه (أو سلبي بسبب عدم وجود هذه الشخصية ، فعندئذ في التصنيف الثنائي نحصل على Fأي أن كل نص مرتبط بفئة معينة من المشاعر اعتمادًا على الرموز التي يحتوي عليها. لذلك حتى النهج البسيط القائم على القواعد يمكن أن يحقق نتائج رائعة على سبيل المثال ، إذا كان النموذج يصنف النص على أنه إيجابي بسبب وجود حرف فيه (أو سلبي بسبب عدم وجود هذه الشخصية ، فعندئذ في التصنيف الثنائي نحصل على Fأي أن كل نص مرتبط بفئة معينة من المشاعر ، اعتمادًا على الرموز التي يحتوي عليها. لذلك حتى النهج البسيط القائم على القواعد يمكن أن يحقق نتائج رائعة. على سبيل المثال ، إذا كان النموذج يصنف النص على أنه إيجابي بسبب وجود حرف فيه (أو سلبي بسبب عدم وجود هذه الشخصية ، فعندئذ في التصنيف الثنائي نحصل على F1 = 97.39٪. لحل مشاكل تحليل المشاعر التلقائي ، يوصي مؤلفو مجموعة البيانات بحذف الرموز أثناء المعالجة المسبقة. وفقًا لـ [145] ، في هذه الحالة ، باستخدام آلة ناقلات الدعم [33] ، درجة المتوسط ​​الكلي F 1= 75.95٪. لذلك بدون معرفة عملية المعالجة المسبقة ، من الصعب تقييم صحة الدراسة. ثانيًا ، هناك العديد من الأسئلة حول فعالية استخدام البيانات من منطقة ما للتعلم في منطقة أخرى. في هذه الحالة ، سيكون من الممكن إضافة تعليق توضيحي يدويًا على مجموعة بيانات صغيرة حول موضوع الاهتمام (مراجعات المستخدم من بوابة النقل) واختبار النموذج المدرب عليه. ثالثًا ، يتكون RuTweetCorp من ثلاث فئات ، لكن المؤلفين لم يأخذوا في الاعتبار الفئة المحايدة في دراستهم. تم نشر الرسائل الإيجابية والسلبية على الموقع الرسمي لـ RuTweetCorp ، وتم نشر الرسائل المحايدة على موقع ويب منفصل. أعتقد أن هذا هو سبب استخدام بعض الدراسات [146] - [150] فقط الرسائل الإيجابية والسلبية للتصنيف الثنائي. يمكن افتراض ذلكيمكن أن تغير هذه الفئة المحايدة التوزيع العام لمراجعات الطريق السلبية والإيجابية. أخيرًا ، تتمتع معظم المراجعات من الطريق السريع بتصنيفات حقوق الطبع والنشر ، لذا من وجهة نظر رسمية ، لا يلزم تصنيف المشاعر لتقييم هذه المراجعات. في هذه الحالة ، سيكون من المثير للاهتمام مقارنة النتائج بناءً على التقييمات من المراجعات وعلامات تصنيف المشاعر.



2.3



طور Lee and Chen من جامعة أريزونا إطارًا للتعلم الآلي لتحديد جودة المنتجات المباعة بناءً على ملاحظات العملاء [72]. يتكون إطار العمل هذا من ثلاث وحدات رئيسية: أخذ عينات من كرة الثلج باستخدام الكلمات الرئيسية والمستخدمين ذوي الصلة ، وتصنيف الموضوع على أساس أقصى إنتروبيا ، وتحليل المشاعر باستخدام التعلم العميق. تتمثل إحدى السمات المميزة للوحدة الأخيرة في أنها تستخدم أولاً ترجمة Google لترجمة النص الروسي إلى اللغة الإنجليزية ، وعندها فقط تصنف المشاعر باستخدام شبكة موتر عصبية متكررة مع الكلمات التي يتم تمثيلها كبنك لأشجار بناء الجملة [121]. تم اختبار الإطار المقترح في منتدى باللغة الروسية مخصص للاحتيال بالبطاقات المصرفية.ونتيجة لذلك ، تم تحديد البائعين الرئيسيين للبرامج الضارة ولصوص بيانات البطاقة المصرفية. من خلال تحليل أكثر تفصيلاً ، وجد المؤلفون أن تجار البطاقات يميلون إلى الحصول على تقييمات أقل من تجار البرمجيات. يعتقد المؤلفون أن السبب هو أن تحديد جودة البرنامج أسهل من تحديد جودة البيانات المسروقة. ذكر المؤلفون أن مصنف المشاعر قد تم تدريبه من خلال استطلاعات الرأي عبر الإنترنت ، وهو مناسب لموضوع اهتمامهم ، لكنهم لم يصفوا تفاصيل استخدام مجموعة البيانات ومقاييس جودة التصنيف. يمكن أن تغير الترجمة إلى لغة أخرى بشكل كبير معنى أو نغمة النص ، لذلك يكاد يكون من المستحيل تقييم جودة التحليل دون اختبار نصوص باللغة الروسية.عادةً ما يكون لتجار تلك البطاقات تصنيف أقل من تجار البرامج. يعتقد المؤلفون أن السبب هو أن تحديد جودة البرنامج أسهل من تحديد جودة البيانات المسروقة. ذكر المؤلفون أن مصنف المشاعر قد تم تدريبه من خلال استطلاعات الرأي عبر الإنترنت ، وهو ما يناسب موضوع اهتمامهم ، لكنهم لم يصفوا تفاصيل استخدام مجموعة البيانات ومقاييس جودة التصنيف. يمكن أن تغير الترجمة إلى لغة أخرى بشكل كبير معنى أو نغمة النص ، لذلك يكاد يكون من المستحيل تقييم جودة التحليل دون اختبار نصوص باللغة الروسية.عادةً ما يكون لتجار تلك البطاقات تصنيف أقل من تجار البرامج. يعتقد المؤلفون أن السبب هو أن تحديد جودة البرنامج أسهل من تحديد جودة البيانات المسروقة. ذكر المؤلفون أن مصنف المشاعر قد تم تدريبه من خلال استطلاعات الرأي عبر الإنترنت ، وهو مناسب لموضوع اهتمامهم ، لكنهم لم يصفوا تفاصيل استخدام مجموعة البيانات ومقاييس جودة التصنيف. يمكن أن تغير الترجمة إلى لغة أخرى بشكل كبير معنى أو نبرة النص ، لذلك يكاد يكون من المستحيل تقييم جودة التحليل دون اختبار نصوص باللغة الروسية.ومع ذلك ، لم يقدموا تفاصيل عن استخدام مجموعة البيانات ومقاييس جودة التصنيف. يمكن أن تؤدي الترجمة إلى لغة أخرى إلى تغيير معنى النص أو نغماته بشكل كبير ، لذلك ، بدون اختبار نصوص باللغة الروسية ، يكاد يكون من المستحيل تقييم جودة التحليل.ومع ذلك ، لم يقدموا تفاصيل حول استخدام مجموعة البيانات ومقاييس جودة التصنيف. يمكن أن تغير الترجمة إلى لغة أخرى بشكل كبير معنى أو نغمة النص ، لذلك يكاد يكون من المستحيل تقييم جودة التحليل دون اختبار نصوص باللغة الروسية.



3.



صورة

عادةً ما تكون المراجعات التي ينشئها المستخدم ومحتوى الوسائط الاجتماعية ذاتية لأن المؤلفين أحرار في التعبير عن آرائهم. ومع ذلك ، فإن الوضع يختلف مع تحليل الأخبار. تحاول وكالات الأنباء تجنب الحكم والتحيز الصريح ، محاولًا التخلص من الشكوك والغموض. فلسفتهم مبنية على الموضوعية ، أو على الأقل الحياد المقبول على نطاق واسع [73]. لذلك ، غالبًا ما يمتنع الصحفيون عن استخدام مفردات سلبية أو إيجابية ، لكنهم يلجأون إلى طرق أخرى للتعبير عن آرائهم [74]. على سبيل المثال ، يمكن للصحفيين التأكيد على بعض الحقائق وحذف أخرى ، وإدراج البيانات في البنية المعقدة للخطاب ، والإشارة إلى اقتباس يناسب وجهة نظرهم. لوحظ الاهتمام الواسع بالناس بالأخبار منذ قرون [151] ، [152].يتم استخدام الأخبار كمصدر بيانات لتحليل المشاعر في مختلف المجالات. على سبيل المثال ، لتقييم شعور الأخبار نفسها [153] ، [154] ، للتنبؤ بأسعار الأسهم [155] ، [156] ، نتائج الانتخابات [157] ، [158] ، أسعار البضائع في المتاجر عبر الإنترنت [159] وسلوك العملاء في المستقبل [154]. فيما يتعلق بالأخبار الروسية ، فقد حددت فئتين من الأبحاث: تقييم المشاعر الإخبارية والتنبؤ الاقتصادي والتجاري.تقييم المشاعر الإخبارية والتنبؤ الاقتصادي والتجاري.تقييم المشاعر الإخبارية والتنبؤ الاقتصادي والتجاري.



3.1. محتوى الأخبار



خصص بلياكوف عدة مقالات [94] ، [95] لتحليل مشاعر التقارير الإخبارية من موقع وزارة الخارجية الروسية. استخدم المؤلف مقالات من قسم "الأخبار" ، والتي نُشرت في الفترة من 1 إلى 28 فبراير 2015. تم تخصيص الوحدات النصية للفئات التالية:



  • سؤال اوكراني
  • التعاون بين روسيا والصين ؛
  • العلاقات بين روسيا وأوكرانيا ؛
  • الصراع في سوريا.
  • التعاون مع تركمانستان ؛
  • العلاقات بين روسيا واليونان ؛
  • عقوبات ضد روسيا ؛
  • الدبلوماسية اليوم.


أنشأ المؤلف مصنفًا أساسيًا قائمًا على القواعد يلخص قطبية الكلمات العاطفية في النص ويتنبأ بالفئة الثنائية النهائية. بالإضافة إلى ذلك ، تم تجميع قاموس مكون من 300 كلمة موجبة و 300 كلمة سلبية. وبحسب نتائج التحليل ، كان لفئات "التعاون بين روسيا والصين" ، و "التعاون مع تركمانستان" ، و "العلاقات بين روسيا واليونان" ، و "الدبلوماسية اليوم" لون إيجابي. كان لفئات "السؤال الأوكراني" و "العلاقات بين روسيا وأوكرانيا" و "العقوبات ضد روسيا" لون سلبي. من المهم أن تفحص الدراسة فقط محتوى المقالات التي كتبها الصحفيون ، أي أنها تعبير عن الموقف الرسمي لوزارة الخارجية من بعض المواضيع. في المستقبل ، يمكنك إضافة ردود فعل وتعليقات القراء على المقالات الإخبارية المنشورة على الموقع. من حيث تحليل المشاعر ،العيب الرئيسي في بحث بيلياكوف هو الافتقار إلى تقييم النموذج. بدون معرفة مقاييس الجودة في بيانات الاختبار ، لا يمكننا تقييم أداء النموذج ، وبالتالي جودة نتائج التحليل.



قامت مجموعة بحثية من الأكاديمية الروسية للعلوم بدراسة المواقف تجاه التقنيات والابتكارات المذكورة في وسائل الإعلام [96]. بمساعدة Exactus Expert [160] ، اختار المؤلفون من 16 مصدرًا أكثر من 240،000 مقالة حول الابتكارات والتقنيات المنشورة من 2005 إلى 2015. ثم ، بناءً على الكلمات الرئيسية المختارة يدويًا ، قاموا بتصنيف المقالات وفقًا لـ 11 اتجاهًا تكنولوجيًا من قائمة التقنيات الحرجة في الاتحاد الروسي. بعد ذلك ، اختار المؤلفون 120 مقالًا وقاموا بتعليق كل كائن عاطفي مذكور في المقالة يدويًا على أنه إيجابي أو سلبي. استنادًا إلى مجموعة تدريب مكونة من 346 زوجًا مشروحًا ، أنشأ الباحثون مفردات للعواطف وطوروا خوارزمية تصنيف قائمة على القواعد. وقد وجد أن وسائل الإعلام تميل بشكل عام إلى الكتابة عن التكنولوجيا بطريقة محايدة ، والتي قد تكون بسبب تناسق أسلوب التقارير الإخبارية.تشير النسبة المنخفضة نسبيًا من الإشارات السلبية إلى تكنولوجيا المعلومات والتكنولوجيا الحيوية وتغطيتها الإيجابية الشاملة في المقالات إلى أن المجتمع ليس قلقًا بشأن العواقب السلبية المحتملة لهذه التقنيات. في الوقت نفسه ، فإن حصة المراجعات السلبية حول التقنيات العسكرية أعلى منها في المناطق الأخرى. ومع ذلك ، لا يصف المؤلفون مقاييس التصنيف في الخوارزمية المطورة. علاوة على ذلك ، كما ذكرنا سابقًا ، فإن هذه المقالات كتبها صحفيون يمكنهم التعبير ليس فقط للجمهور ، ولكن أيضًا عن وجهة النظر الرسمية. من أجل تقييم المواقف العامة تجاه الموضوعات المختلفة ، من الضروري إجراء مزيد من التحقيق في ردود فعل الناس على المقالات الإخبارية.نسبة التعليقات السلبية حول التقنيات العسكرية أعلى من المناطق الأخرى. ومع ذلك ، لا يصف المؤلفون مقاييس التصنيف في الخوارزمية المطورة. علاوة على ذلك ، كما ذكرنا سابقًا ، فإن هذه المقالات كتبها صحفيون يمكنهم التعبير ليس فقط للجمهور ، ولكن أيضًا عن وجهة النظر الرسمية. من أجل تقييم المواقف العامة تجاه الموضوعات المختلفة ، من الضروري إجراء مزيد من التحقيق في ردود فعل الناس على المقالات الإخبارية.نسبة التعليقات السلبية حول التقنيات العسكرية أعلى من المناطق الأخرى. ومع ذلك ، لا يصف المؤلفون مقاييس التصنيف في الخوارزمية المطورة. علاوة على ذلك ، كما ذكرنا سابقًا ، فإن هذه المقالات كتبها صحفيون يمكنهم التعبير ليس فقط للجمهور ، ولكن أيضًا عن وجهة النظر الرسمية. من أجل تقييم المواقف العامة تجاه الموضوعات المختلفة ، من الضروري إجراء مزيد من التحقيق في ردود فعل الناس على المقالات الإخبارية.



قام كازون وكازون [75] بتحليل التغطية الإعلامية الروسية لأنشطة ترامب أثناء وبعد الانتخابات. استخدم المؤلفون قاعدة بيانات Integrum لتحليل الشبكة وقاعدة بيانات Medialogy لتحليل المشاعر. بالنسبة للدراسة ، تم أخذ ثلاث فترات زمنية: شهر واحد قبل الانتخابات ، وشهر بعده ، و 7 أشهر بعده. باستخدام نهج Medialogy ، تم تقسيم النصوص إلى ثلاث فئات: إيجابية وسلبية ومحايدة. اتضح أن التغطية الإعلامية لأنشطة ترامب قبل الانتخابات كانت سلبية أكثر منها إيجابية. لكن في بعض الأشهر ، كانت تغطية حملة كلينتون أكثر إيجابية من تغطية ترامب ، رغم أنه في الأشهر الأربعة التي سبقت الانتخابات ، كانت المقالات المتعلقة بكلينتون انتقادية إلى حد كبير. من عيوب الدراسةأن المؤلفين لم يصفوا جودة تصنيف البيانات الخاصة بالموضوع محل الاهتمام ، لذلك من الصعب التحقق من دقة النتائج.



تم تخصيص دراسات مماثلة لتحليل الأخبار المتعلقة بالسياسة والحكومة. على عكس المحتوى الموجود على مواقع التواصل الاجتماعي ، لم تكن هناك صعوبة في الوصول إلى البيانات القديمة ، لأن وسائل الإعلام عادة لا تمنع ذلك. ومع ذلك ، حاول بعض مؤلفي الأبحاث الإخبارية تحديد الرأي العام حول موضوعات محددة أعتقد أنها تتطلب مزيدًا من التفصيل. يمكن بالطبع اعتبار وسائل الإعلام انعكاسًا للرأي العام ، ومع ذلك ، في بعض الحالات ، يمكن لسياسات الناشرين أن تؤثر على التوصيل ، لذلك لا تعكس الأخبار دائمًا الرأي العام.



3.2 التوقعات الاقتصادية والتجارية



اقترح ياكوفليفا حساب مؤشر عالي التردد للنشاط الاقتصادي في روسيا بناءً على المقالات الإخبارية جنبًا إلى جنب مع تحليل المشاعر في النصوص [76]. أثناء الدراسة ، تم إنشاء عنصرين: الأول مصمم ليعكس عدد الموضوعات ، والثاني هو تحديد نغمة الأخبار. تتكون المعالجة المسبقة من عدة مراحل: الانطلاق من MyStem ، وإزالة علامات الترقيم ، وتوقف الكلمات ، والمسافات غير الضرورية. كنموذج لتصنيف المشاعر ، اتخذت ياكوفليفا خوارزمية متجهية للدعم [33] ودربتها على بيانات مشروحة يدويًا تحتوي على 3438 مقالة إخبارية إيجابية وسلبية. كانت الدقة في مجموعة الاختبار 64٪. ذكر المؤلف أنه إذا حدد النموذج الدرجة اللونية للنص باحتمالية أقل من 60٪ ، فإن الدرجة اللونية تعتبر محايدة وتم استبعاد النص من التحليل. كل المواضيع ،تم الحصول عليها مع المكون الأول مع معلومات المشاعر من النموذج الثاني. بناءً على هذه البيانات المجمعة ، تم تطوير نموذج انحدار للتنبؤ بمؤشرات مديري المشتريات (PMI). غطت بيانات الاختبار الفترة من فبراير 2017 إلى أغسطس 2018. أظهر النموذج إمكانات تنبؤية جيدة نسبيًا ، وتقريبًا دقيقًا للمؤشر الفعلي للفترة الجديدة. تظهر نتائج البحث أن النموذج يمكنه مراقبة الأداء الاقتصادي عن كثب ، مما يساعد على الاستجابة السريعة للوضع المالي الحالي واتخاذ القرارات بسرعة. ومع ذلك ، فإن هذه الدراسة لها عيوب عديدة. أولاً ، ليس من الواضح ما هي الاحتمالات المستخدمة ،لأن تنفيذ آلة متجه الدعم الأساسي لا يوفر تقديرات احتمالية مباشرة. علاوة على ذلك ، لم يتم وصف منهجية اختيار العتبات. ثانيًا ، تم شرح بيانات تدريب ياكوفليفا بواسطة متخصص واحد فقط ، وهو ما لا يتوافق مع الممارسة المقبولة عمومًا [142] ، [161] ، [162]. أخيرًا ، نشر المؤلف تمثيلًا رسوميًا للمقارنة المتوقعة وقيم مؤشر مديري المشتريات الفعلية ، لكنه لم يذكر أي مقاييس جودة الانحدار.لكنها لم تذكر أي مقاييس جودة الانحدار.لكنها لم تذكر أي مقاييس جودة الانحدار.



4. الكتب



صورة

على مدار الستين عامًا الماضية ، قطع تحليل الأدبيات العلمية شوطًا طويلاً ، بدءًا من عد الاقتباسات اليدوية وتحليل تكرار الكلمات إلى الأساليب الحديثة للتحليل التلقائي للنص العميق [163]. أحد الموضوعات الرئيسية في هذا المجال هو تحليل المشاعر من المواد التعليمية.



4.1 محتويات الكتب



قامت مجموعة سولوفييف البحثية بدراسة نغمة الكتب المدرسية حول الدراسات الاجتماعية والتاريخ المستخدمة في المدارس الابتدائية والثانوية الروسية [77]. في هذه الدراسة ، تم تجميع المجموعة الأكاديمية للغة الروسية على أساس 14 كتابًا مدرسيًا باللغة الروسية تم تحريرها بواسطة بوغوليوبوف ونيكيتين. تضمنت المعالجة المسبقة ترميز الجملة وترميز الكلمات وترميز جزء من الكلام باستخدام TreeTagger [164]. باستخدام قاموس اللغة الروسية RuSentiLex [25] ، قام المؤلفون بحساب تواتر الكلمات العاطفية في كل وثيقة وقياس عددها المحدد لكل 1000 كلمة في المستند. بعد تحليل الكتاب ، اكتشف المؤلفون أن الخطاب في كتب التاريخ المدرسية للمرحلة الثانوية ، وكذلك في كتب الدراسات الاجتماعية للمدرسة الثانوية المتوسطة ، التي كتبها نيكيتين ، يتم تمثيله بشكل أساسي بنبرة سلبية:يتم استخدام الكلمات ذات الاستقطاب السلبي ويتم تقديم أمثلة سلبية. والكتب المدرسية التي كتبها بوجوليوبوف لها نبرة إيجابية بشكل عام. ومع ذلك ، فإن أحد المصادر المهمة لعدم الموثوقية هو دقة وأهمية الكلمات العاطفية المستخرجة من المجموعة ، حيث تم إنشاء RuSentiLex في الأصل لمواضيع أخرى. بالإضافة إلى ذلك ، يوفر RuSentiLex تمثيلًا منفردًا مستقلًا عن السياق للقطبية العاطفية ، بغض النظر عن مكان ظهور الكلمة في الجملة وبغض النظر عن معانيها المحتملة. لذلك ، لا يسمح لك هذا النهج بفهم المعاني المختلفة للكلمات بناءً على سياق الجملة.مصدر مهم لعدم الموثوقية هو دقة وملاءمة الكلمات العاطفية المستخرجة من المجموعة ، حيث تم إنشاء RuSentiLex في الأصل لمواضيع أخرى. بالإضافة إلى ذلك ، يوفر RuSentiLex تمثيلًا واحدًا مستقلًا عن السياق للقطبية العاطفية ، بغض النظر عن مكان ظهور الكلمة في الجملة وبغض النظر عن معانيها المحتملة. لذلك ، لا يسمح لك هذا النهج بفهم المعاني المختلفة للكلمات بناءً على سياق الجملة.مصدر مهم لعدم الموثوقية هو دقة وأهمية الكلمات العاطفية المستخرجة من المجموعة ، حيث تم إنشاء RuSentiLex في الأصل لمواضيع أخرى. بالإضافة إلى ذلك ، يوفر RuSentiLex تمثيلًا واحدًا مستقلًا عن السياق للقطبية العاطفية ، بغض النظر عن مكان حدوث الكلمة في الجملة وبغض النظر عن معانيها المحتملة. لذلك ، لا يسمح لك هذا النهج بفهم المعاني المختلفة للكلمات بناءً على سياق الجملة.لذلك ، لا يسمح لك هذا النهج بفهم المعاني المختلفة للكلمات بناءً على سياق الجملة.لذلك ، لا يسمح لك هذا النهج بفهم المعاني المختلفة للكلمات بناءً على سياق الجملة.



4.2 العملية التعليمية



أجرت Kolmogorova تجربة حول تعليم اللغة الروسية للطلاب الصينيين [78]. وقامت بقياس العلاقة بين مشاعر النصوص التربوية ، والتقييم الذاتي من قبل الطلاب الأجانب لجاذبية وفعالية الدورة التدريبية ، وكذلك النجاح الفعلي للتدريس في مثل هذه النصوص. لتحليل المشاعر ، استخدم المؤلف مصنفًا للعاطفة قائم على التعلم الآلي تم تطويره في مختبر اللغويات التطبيقية والأبحاث المعرفية ، جامعة سيبيريا الفيدرالية. صنف نموذج تحليل المشاعر النصوص إلى 9 فئات بمتوسط ​​كلي F 1- نقطة 50٪. ثمانية درجات تتوافق مع المشاعر الأساسية لـ L¨ovheim [165] ، وآخرها نصوص محايدة عاطفياً. بالنسبة لمجموعة التدريب ، تم اختيار النصوص في مجموعة VKontakte المفتوحة `` Overheard ''. قام 231 من الناطقين باللغة الروسية بترميز النصوص ، وتقييمًا ذاتيًا لدرجة التعبير عن أي عاطفة ، بينما تم تخصيص عاطفة واحدة لكل نص فقط. تم ترميز جميع النصوص بواسطة ثلاثة مقيمين على الأقل. إذا قام اثنان أو ثلاثة مقيمين بتعيين نفس الفصل للنص ، فعندئذ يتم تخصيص هذه المشاعر للنص. خلاف ذلك ، تمت إزالة النص من مجموعة التدريب لهذا الفصل. استخدمت Kolmogorova نصوصًا كانت المشاعر الرئيسية لها هي المتعة / الفرح والحزن / الشوق. أجريت التجربة بمشاركة 30 طالبا من الصين ، تم تقسيمهم إلى ثلاث مجموعات متساوية.قامت كل مجموعة بدراسة وفحص موضوع "علامات الترقيم". المجموعة الأولى تعلمت من النصوص المبهجة ، والثانية من النصوص الحزينة ، والثالثة من النصوص المحايدة. بعد الانتهاء من الدراسة التجريبية والامتحانات ، قام الطلاب بملء استبيان لاحظوا فيه درجة الاهتمام العام بالمقرر وفاعليته ، وكذلك درجة رضاهم عن عملية التعلم. بعد تحليل الاستبيانات ونتائج الامتحانات ، وجدت Kolmogorova أن نغمة النص التعليمي تؤثر بشدة على التقييم الذاتي للعملية التعليمية وفعاليتها الموضوعية. في المتوسط ​​، يرتكب الطلاب أخطاء أقل في النصوص الحزينة مقارنة بالأخطاء المبهجة والحيادية ، لكن العمل معهم جلب أقل قدر من الرضا. تم إثارة الاهتمام الأكبر من خلال العمل بالنصوص المبهجة ، ولكن في نفس الوقت كانت فعالية التدريب أقل.مصدر مهم لعدم اليقين في هذه الدراسة هو الطريقة المستخدمة لتصنيف القطبية العاطفية للنصوص. تم تدريب النموذج على نصوص من منطقة ، وتم تطبيقه على نصوص من منطقة أخرى دون التحقق الإضافي من جودة التصنيف. لم تصف الكاتبة أي تفاصيل تتعلق بنموذج التصنيف ، ولم تقدم المزيد من المعلومات حول المعالجة المسبقة والتعلم.



وبالتالي ، فإن الصعوبة الرئيسية في تحليل الكتب المدرسية هي عدم وجود مفردات عاطفية ومجموعات تدريب حول هذا الموضوع. عندما قام الباحثون بتحليل النصوص على مستوى الكلمات باستخدام المفردات العاطفية ، عادة ما يتم أخذ تمثيل واحد مستقل عن السياق للقطبية العاطفية لكل كلمة ، بغض النظر عن موقع الكلمة في الجملة وبغض النظر عن معانيها المحتملة الأخرى. علاوة على ذلك ، من أجل تحليل النصوص على مستوى الوثيقة ، يصبح من الصعب ربط النصوص بفئات من المشاعر ، لأن النصوص في الكتب المدرسية طويلة ، ويمكن التعبير عن مشاعر مختلفة في نص واحد.



5. مصادر بيانات مختلطة



صورة

لتغطية نطاق أوسع من المواد ، تستخدم بعض الدراسات نصوصًا من مصادر مختلفة. على سبيل المثال ، إذا استخدم المؤلفون الأخبار ومحتوى الوسائط الاجتماعية ، فلا يمكنهم فقط قياس قطبية تغطية أحداث معينة من قبل وكالات الأنباء والوكالات الحكومية ، ولكن يمكنهم أيضًا قياس مواقف الناس تجاه الموضوعات المختلفة التي تمت مناقشتها.



في بحث نُشر في مركز بيركمان للإنترنت والمجتمع [97] ، قام إيتلينج بالتحقيق في لهجة مناقشة الاحتجاجات الأوكرانية خلال فترة الميدان الأوروبي في العديد من وسائل الإعلام التقليدية على الإنترنت واللغة الروسية والإنجليزية ، فضلاً عن الشبكات الاجتماعية. استخدمت الدراسة برنامج Crimson Hexagon [166] ، والذي يعتمد على أسلوب التحليل الذي طوره هوبكنز وكينج [167]. تم تصنيف النصوص إلى أربع فئات من حيث المواقف تجاه الاحتجاجات: إيجابية ، محايدة ، سلبية وغير ذات صلة. كان مصدر البيانات منشورات باللغتين الروسية والإنجليزية على Twitter و Facebook والمدونات والمنتديات والمواقع الإخبارية للفترة من 21 نوفمبر 2013 إلى 26 فبراير 2014. بسبب قيود Crimson Hexagon ، لم يتم النظر في النصوص باللغة الأوكرانية. كشفت ،أن المصادر والمستخدمين باللغة الروسية عبروا عن دعمهم للاحتجاجات أكثر مما كان متوقعًا. كانت النصوص المكتوبة باللغة الإنجليزية في الولايات المتحدة والمملكة المتحدة سلبية أكثر من المتوقع بناءً على الدعم الأيديولوجي للحكومات الغربية. في الوقت نفسه ، كان محتوى الشبكات الاجتماعية في المملكة المتحدة والولايات المتحدة الأمريكية وأوكرانيا أكثر إيجابية مقارنة بوسائل الإعلام التقليدية في هذه البلدان. يرتبط العيب الرئيسي للدراسة بنموذج تصنيف المشاعر. أولاً ، تدربت على الحد الأدنى من البيانات ، أي حوالي 120-140 منشورًا موسومًا. ثانيًا ، تم شرح بيانات التدريب من قبل مقيم واحد فقط ، وهو ما يتعارض مع أفضل الممارسات [142] ، [161] ، [162]. لم يتم اختبار موثوقية وجودة التصنيف ، وهو ما يتعارض مع المبادئ الأساسية لنماذج التعلم الآلي الخاضعة للإشراف [168]. علاوة على ذلك،لا يتم توفير قائمة كاملة بالمصادر التي تم تحليلها ، لذلك من الصعب التحقق من موثوقية اختيارهم. علاوة على ذلك ، لم يتم النظر في النصوص الأوكرانية ، وبالتالي استبعاد مجموعة واسعة من الآراء.



حلل كازون كثافة ونبرة التغطية في وسائل الإعلام والشبكات الاجتماعية لأنشطة Alexei Navalny بناءً على بيانات من 2014-2016 [80]. بمساعدة Medialogia ، تلقى المؤلف أكثر من 145000 مقال إخباري حول Navalny من الصحف والمواقع الإلكترونية الروسية وثلاث قنوات تلفزيونية فيدرالية. لتحليل المشاعر ، استخدم Kazun الخوارزميات المطورة في Medialogy (التصنيف إلى فئات إيجابية أو سلبية أو محايدة) ، بعد أن فحصها مسبقًا على مائتي مقالة تم تمييزها يدويًا. اتضح أن وسائل الإعلام التقليدية تميل إلى تجاهل نافالني باستثناء النشر العرضي للوثائق أو القصص الإخبارية من أجل تشويه سمعة المعارضة الروسية بشكل عام أو نافالني شخصيًا. على العموم ، حصل نافالني على تغطية إيجابية في المدونات أكثر من وسائل الإعلام الأخرى. ومع ذلك ، كانت المناقشات في هذه المقالات انتقادية في الغالب.وصف المؤلفون أيضًا تفاصيل كل نوع من أنواع الوسائط ، موضحين استراتيجيات النشر المميزة وأنماط النغمة. على الرغم من السلبية العامة ، فإن التغطية الإخبارية لأنشطة Navalny أصبحت أكثر إيجابية من عام إلى آخر. أسباب هذا الاتجاه هي انخفاض في عدد المقالات الحرجة وزيادة في عدد المقالات الإيجابية. كما هو الحال في جميع الأمثلة المكتشفة لاستخدام خوارزميات تحليل المشاعر الوسيطة ، لا يصف المؤلفون مقاييس التصنيف للموضوع المستهدف.كما هو الحال في جميع الأمثلة المكتشفة لاستخدام خوارزميات تحليل المشاعر الوسيطة ، لا يصف المؤلفون مقاييس التصنيف للموضوع المستهدف.كما هو الحال في جميع الأمثلة المكتشفة لاستخدام خوارزميات تحليل المشاعر الوسيطة ، لا يصف المؤلفون مقاييس التصنيف للموضوع المستهدف.



حلل برانتلي في بحثه [79] الثورة الأوكرانية 2013-2014 بناءً على محتوى Twitter و Facebook و YouTube والمدونات والمنتديات والمواقع الإخبارية. بمساعدة منصة Crimson Hexagon ، قام بتجميع مجموعة من 2،809،476 نصًا باللغات الروسية والأوكرانية والإنجليزية. نظرنا فقط في النصوص التي تم نشرها من أوكرانيا في الفترة من 21 تشرين الثاني (نوفمبر) 2013 إلى 1 آذار (مارس) 2014. قام اثنان من المقيمين ، يجيدون جميع اللغات الثلاث ، بوضع تعليقات توضيحية على مجموعة بيانات التدريب لخوارزمية BrightView ، والتي تعد جزءًا من Crimson Hexagon وهي خوارزمية لتحليل البيانات غير المعلمية. وصفها في [166]. تم تقسيم النصوص إلى ثلاث فئات: إيجابية ، ومحايدة ، وسلبية. أظهر الاختبار على Crimson Hexagon تطابق 92 ٪ مع التصنيف اليدوي.جنبًا إلى جنب مع البيانات التي تم جمعها ، استخدم المؤلف معلومات من مجموعة بيانات Tone Dataset Global Knowledge Graph and Events Dataset و Global Events Language (169]. اتضح أنه في أوكرانيا كان هناك تناقض واضح بين الجمعيات السياسية والتفضيلات المرتبطة بالخصائص اللغوية. تم تأكيد ذلك من خلال نتائج التصويت السابقة ، عندما أعرب المتحدثون الناطقون بالأوكرانية تقليديًا عن دعمهم للمعارضة. من خلال مقارنة المشاركة عبر الإنترنت وغير المتصلة بشكل مباشر ، خلص برانتلي إلى أن وسائل التواصل الاجتماعي أثرت بشكل كبير على التطور المادي للاحتجاجات ، أي أدى إلى زيادة عدد المتظاهرين في الشوارع.أنه في أوكرانيا كانت هناك اختلافات واضحة بين الجمعيات السياسية والتفضيلات المرتبطة بالخصائص اللغوية. تم تأكيد ذلك من خلال نتائج التصويت السابقة ، عندما أعرب المتحدثون الناطقون بالأوكرانية تقليديًا عن دعمهم للمعارضة. من خلال مقارنة المشاركة عبر الإنترنت وغير المتصلة بشكل مباشر ، خلص برانتلي إلى أن وسائل التواصل الاجتماعي أثرت بشكل كبير على التطور المادي للاحتجاجات ، أي أدت إلى زيادة عدد المتظاهرين في الشوارع.أنه في أوكرانيا كانت هناك اختلافات واضحة بين الجمعيات السياسية والتفضيلات المرتبطة بالخصائص اللغوية. وهذا ما تؤكده نتائج التصويت السابقة ، عندما أعرب المتحدثون الناطقون بالأوكرانية تقليديًا عن دعمهم للمعارضة. من خلال مقارنة المشاركة عبر الإنترنت وغير المتصلة بشكل مباشر ، خلص برانتلي إلى أن وسائل التواصل الاجتماعي كان لها تأثير كبير على التطور المادي للاحتجاجات ، أي أدى إلى زيادة عدد المتظاهرين في الشوارع.أن الشبكات الاجتماعية أثرت بشكل كبير على التطور المادي للاحتجاجات ، أي أنها أدت إلى زيادة عدد المتظاهرين في الشوارع.أن الشبكات الاجتماعية أثرت بشكل كبير على التطور المادي للاحتجاجات ، أي أنها أدت إلى زيادة عدد المتظاهرين في الشوارع.



يتمثل العيب الرئيسي لاستخدام مصادر من أنواع مختلفة في أنه بالإضافة إلى مجموعة كبيرة من الآراء المعبر عنها ، يواجه المؤلفون صعوبات وقيودًا تميز أنواعًا معينة من المصادر. يمكن أن تكون مرتبطة بالوصول إلى البيانات التمثيلية ، والوصف الشامل للقيود ، ونقص بيانات التدريب للموضوع المختار. في بعض الدراسات ، تم إجراء تحليل المشاعر وتجميع مؤشرات المشاعر على أساس مجموعة واسعة من النصوص دون تمييز حسب نوع المصدر. على سبيل المثال ، عند تجميع المشاعر ، اعتبر المؤلفون أن منشورات وسائل التواصل الاجتماعي والمقالات الإخبارية متساوية. ربما ، في مثل هذه الحالات ، يكون من المنطقي أكثر استخدام نماذج أكثر تعقيدًا تطبق الأوزان من أجل تحليل النصوص من أنواع مختلفة من المصادر بشكل أكثر دقة.



6. التالي



في غضون يومين ، سيتم إصدار الجزء الأخير ، والذي سنتحدث فيه عن الصعوبات المشتركة التي يواجهها الباحثون ، وكذلك الاتجاهات الواعدة للمستقبل. إذا كنت ترغب في قراءة المقال بأكمله مرة واحدة وباللغة الإنجليزية ، فانتقل هنا .



7. المصادر



يمكن العثور على قائمة كاملة بالمصادر هنا .



All Articles