أدت التطورات الأخيرة في نماذج لغة ما قبل التعلم إلى تطورات كبيرة في معالجة اللغة الطبيعية (NLP) ، مما أدى إلى ظهور نماذج عالية الكفاءة مثل BERT و RoBERTa و XLNet و ALBERT و T5 وغيرها الكثير. هذه الأساليب ، التي لها بنى مختلفة ، مع ذلك ، توحدها فكرة استخدام كميات كبيرة من بيانات النص غير المسماة لإنشاء نموذج عام لفهم اللغة الطبيعية ، والذي يتم بعد ذلك تدريبه بشكل أكبر ومُضبط بدقة لحل مشكلات تطبيقية محددة ، مثل تحليل المشاعر أو بناء أنظمة أسئلة وأجوبة.
تنقسم أساليب ما قبل التدريب الحالية بشكل أساسي إلى فئتين:
- نماذج اللغة (LM) مثل GPT ، التي تعالج النص في الإدخال من اليسار إلى اليمين ، وتتنبأ بالكلمة التالية في سياق محدد مسبقًا ؛
- نماذج اللغة المقنعة (MLM) ، مثل BERT و RoBERTa و ALBERT ، التي تحاول التنبؤ بالكلمات المقنعة للنص المصدر.
تتمثل ميزة الامتيازات والرهون البحرية في أنه يعمل بشكل ثنائي الاتجاه ، أي إنهم "يرون" النص على جانبي الرمز المتوقع ، على عكس LMs ، التي تواجه اتجاهًا واحدًا فقط. ومع ذلك ، فإن الامتيازات والرهون البحرية (ونماذج مثل XLNet) لها أيضًا عيوب ناتجة عن مهمة ما قبل التدريب: فبدلاً من توقع كل كلمة من تسلسل الإدخال ، فإنها تتوقع فقط جزء صغير مقنع - حوالي 15 ٪ فقط ، مما يقلل من كمية المعلومات الواردة من جملة واحدة.

. () . : (, GPT), . : (, BERT), , .
«ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators» , BERT’, . ELECTRA – , (Efficiently Learning an Encoder that Classifies Token Replacements Accurately) — , , . , ELECTRA , RoBERTa XLNet GLUE, , , ¼ , - SQuAD. ELECTRA , : 1 GPU , (accuracy), GPT, 30 . ELECTRA TensorFlow .
ELECTRA – (replaced token detection, RTD), ( MLM) ( LM). - (generative adversarial network, GAN), ELECTRA «» «» . , , «[MASK]» ( BERT’), RTD , . , , «cooked» «ate». , , . (.. ) , , . , , (15% BERT). RTD , MLM – ELECTRA «» , , .. . , RTD , .. , .

.
, . , , ELECTRA ( BERT- ), . , , , GAN, , , - GAN . . , ( ELECTRA) NLP . .

. MLM , ELECTRA.
ELECTRA c NLP , , , RoBERTa XLNet 25% , .

x , ( FLOPs), y – GLUE. ELECTRA , NLP . , GLUE, T5, , .. ( 10 , RoBERTa).
, ELECTRA-Small, , GPU 4 . , , TPU , ELECTRA-Small GPT, 1/30 .
, , ELECTRA , ELECTRA-Large ( RoBERTa 10% T5). - SQuAD 2.0 (. ) RoBERTa, XLNet ALBERT GLUE. T5-11b GLUE, ELECTRA 30 10% , T5.

ELECTRA-Large SQuAD 2.0 ( ).
ELECTRA
تم نشر رمز كل من التدريب المسبق والضبط الدقيق على مهام البرمجة اللغوية العصبية المطبقة ، مثل تصنيف النص ومهام الإجابة على الأسئلة وترميز التسلسل ، في الوصول المفتوح . يدعم الكود التدريب السريع لنموذج ELECTRA الصغير على وحدة معالجة رسومات واحدة. يتم أيضًا نشر أوزان النماذج المدربة مسبقًا مثل ELECTRA-Large و ELECTRA-Base و ELECTRA-Small. بينما يتوفر ELECTRA باللغة الإنجليزية فقط ، يخطط المطورون في المستقبل للتدريب المسبق على النموذج بلغات أخرى.
المؤلفون
- المؤلفون الأصليون - كيفن كلارك ، ثانج لونج
- ترجمة - إيكاترينا سميرنوفا
- التحرير والتخطيط - سيرجي شكارين