نماذج العالم - التعلم من الخيال

التعلم المعزز سيء ، أو بالأحرى ، لا يعمل على الإطلاق بأبعاد عالية. ويواجه أيضًا مشكلة أن المحاكيات الفيزيائية بطيئة جدًا. لذلك ، في الآونة الأخيرة ، أصبحت طريقة للتغلب على هذه القيود شائعة من خلال تدريب شبكة عصبية منفصلة تحاكي محركًا فيزيائيًا. اتضح أن شيئًا ما يشبه التناظرية للخيال ، حيث يتم التعلم الأساسي الإضافي.



دعونا نرى مقدار التقدم الذي تم إحرازه في هذا المجال ونلقي نظرة على البنى الرئيسية.



إن فكرة استخدام شبكة عصبية بدلاً من المحاكي المادي ليست جديدة ، لأن المحاكيات البسيطة مثل MuJoCo أو Bullet على وحدات المعالجة المركزية الحديثة قادرة على تقديم ما لا يقل عن 100-200 إطارًا في الثانية (وغالبًا عند 60) ، وتشغيل محاكي الشبكة العصبية على دفعات متوازية ينتج بسهولة 2000-10000 إطارًا في الثانية بسرعة جودة مماثلة. صحيح ، في آفاق صغيرة من 10-100 خطوة ، ولكن هذا يكفي في كثير من الأحيان للتعلم المعزز.



ولكن الأهم من ذلك ، أن عملية تدريب شبكة عصبية لتقليد محرك فيزيائي عادة ما تتضمن تقليل الأبعاد. نظرًا لأن أسهل طريقة لتدريب مثل هذه الشبكة العصبية هي استخدام المشفر التلقائي ، حيث يحدث تلقائيًا.





, , . , . - , , , , Z.



Z Reinforcement Learning. , , ( , , ). , .



, — , , . . , Z , model-based , , .



, Reinforcement Learning. "" : , , , .



World Models



( ), 2018 World Models.



: - "" , Z. ( ).



VAE:





, VAE ( MDN-RNN), . VAE , . , RNN Z . .



:





, : VAE(V) Z MDN-RNN(M) . Z, . MDN-RNN , Z , .



, "" ( - MDN-RNN), . ( ), .



, "" (. ) MDN-RNN (Controller — "", ). , , environment. , C , . VAE(V).



Controller ©, ? ! , -"", Controller. , . , CMA-ES. , Z , . . , , , .



, , .



PlaNet



PlaNet. (, , Controller reinforcement learning), PlaNet Model-Based .



, Model-Based RL — . . , . , , RL , .



Model-Based , , , . (CEM PDDM).



- , ! , .



, . , . .



, . . . (.. state, Reinforcement Learning) , , . Model-Based .



PlaNet, World Models , , Z ( S — state).





Z (, S) , , . , - .



S (, Z) . , , . , .



S , . Model-Based ( ""). .



, , .. -"", A. Model-Based — . , state S . R , state S , ( ). , , ! ( ). Model-Based , .. , , , S R. , World Models, .



Model-Based , PlaNet . 50 . , , , , Model-Free .





Model-Based , (-), . , . . , Model-Based, PlaNet . ( ), .



Dreamer



PlaNet Dreamer. .



PlaNet, Dreamer S, , . Dreamer Value , . Reinforcement Learning. . , . Model-Based ( PlaNet) .





, , Dreamer Actor , . Model-Free , actor-critic.



actor-critic Model-Free , actor , critic ( value, advantage), Dreamer actor . Model-Free .



Dreamer' , . Actor , (. ). Value , , value reward .





, Dreamer Model-Based . Model-Free. model-based ( , ) Actor . Dreamer . , PlaNet Model-Based .



, Dreamer 20 , , Model-Free . , Dreamer 20 , ( ) .





Dreamer Reinforcement Learning . MuJoCo, , .



Plan2Explore



. Reinforcement Learning , .



, - , . , - , , . , , ! Plan2Explore .



Reinforcement Learning , , . , .



, . . , -, . -, , - , .



, . , , Plan2Explore , . , .



Plan2Explore : , . , - , . . . zero-shot . ( , . World Models ), few-shot .





Plan2Explore , Dreamer Model-Free , , . , .



ومن المثير للاهتمام أن Plan2Explore يستخدم طريقة غير عادية لتقييم حداثة الأماكن الجديدة أثناء استكشاف العالم. لهذا ، يتم تدريب مجموعة من النماذج المدربة فقط على نموذج للعالم والتنبؤ بخطوة واحدة فقط للأمام. يُقال أن تنبؤاتهم تختلف بالنسبة لحالات الحداثة العالية ، ولكن كمجموعات بيانات (زيارات متكررة للموقع) ، تبدأ تنبؤاتهم بالاتفاق حتى في البيئات العشوائية العشوائية. نظرًا لأن التنبؤات من خطوة واحدة تتقارب في النهاية مع بعض القيم المتوسطة في هذه البيئة العشوائية. إذا لم تفهم شيئًا ، فأنت لست وحدك. هناك في المقال ليس من الواضح أنه موصوف. ولكن بطريقة ما يبدو أنها تعمل.






All Articles