كيف تهدف أنظمة الذكاء الاصطناعي إلى تبسيط هندسة الصوت

في نهاية هذا الأسبوع ، قررنا التحدث عن التطورات في جامعتين أمريكيتين ، مما يساعد على إنشاء مقياس صوت يمكن تصديقه بدرجة كافية لمقاطع الفيديو الصامتة.





صورة مجانية لاستخدام الأصوات / Unsplash



المهمة الصعبة للضوضاء



من الصعب جدًا تسجيل أصوات الأفلام والبرامج التلفزيونية - على سبيل المثال ، حفيف المطر - بالطريقة الصحيحة مباشرة على المجموعة في وقت تصوير جزء معين. سيكون هناك الكثير من الضوضاء الخارجية ، ومن الممكن حدوث تضارب مع أصوات الممثلين والمعدات الأخرى. لهذا السبب ، يتم تسجيل جميع الأصوات تقريبًا بشكل منفصل ومختلط أثناء التحرير. صانعو الضوضاء يفعلون ذلك .



إذا احتاج الفيلم إلى إعادة إنتاج صوت نافذة مكسورة ، فإن مصممي الصوت يذهبون إلى الاستوديو ويبدأون في كسر الزجاج في ظل ظروف صوتية محكومة. يتم التسجيل حتى يتطابق الصوت مع ما يحدث على الشاشة. في الحالات الصعبة بشكل خاص ، قد يتطلب ذلك عشرات التكرارات ، مما يعقد ويزيد من تكلفة صناعة الأفلام. اقترح



مهندسو جامعة تكساسالخيار البديل. لقد طوروا نظام ذكاء اصطناعي يكتشف ما يحدث في الإطار ويقترح مقياسًا تلقائيًا.



كيف تعمل



وصف المهندسون كيف يعمل النظام في عملهم لـ IEEE ( PDF ). قاموا بتصميم نموذجين للتعلم الآلي. الأول يستخرج ميزات الصور من اللقطات - على سبيل المثال ، اللون. يحلل النموذج الثاني حركة كائن في إطارات مختلفة ويحدد طبيعتها من أجل تحديد الصوت المناسب.



لتشكيل السلسلة الصوتية ، طور المهندسون برنامج AutoFoley. يولد صوتًا جديدًا يعتمد على آلاف العينات الصوتية القصيرة - بصوت المطر ، دقات الساعة ، الحصان الراكض. نتيجة العمل مقنعة تمامًا:





لسوء الحظ ، فإن النظام لديه عدد من القيود الخطيرة حتى الآن. وهي مناسبة لمعالجة التسجيلات التي لا يجب أن يتطابق فيها الصوت مع الفيديو تمامًا. خلاف ذلك ، يصبح إلغاء التزامن ملحوظًا - كما في هذا الفيديو . أيضًا ، يجب أن يكون الكائن موجودًا باستمرار في الإطار حتى يتمكن نموذج MO من التعرف عليه. الآن يشارك المطورون في تسجيل براءات الاختراع ، لكنهم يخططون بعد ذلك لإصلاح العيوب.



من يشارك في مثل هذه المشاريع



في عام 2016، وخبراء من معهد ماساتشوستس للتكنولوجيا وجامعة ستانفورد قدم آلة التعلم نموذج قادر على التعبير عن الفيديو الصامت. يتنبأ بالصوت بناءً على خاصية كائن في الإطار - على سبيل المثال ، مادته. كتجربة ، حمّل المهندسون مقطع فيديو على النظام الذي يضرب فيه شخص عصا طبلة على أسطح مختلفة: معدنية ، وأرضية ، وعشب وغيرها.





قام المطورون بتقييم فعالية الخوارزمية باستخدام استطلاع عبر الإنترنت. كانت الأصوات الأكثر واقعية هي أصوات الأوراق والأوساخ (أطلق عليها 62٪ من المستجيبين اسم حقيقي) ، وأقلها - الخشب والمعدن. بدا المعدن طبيعيًا بنسبة 18٪ فقط من الوقت.



يحتاج هذا النظام أيضًا إلى التحسين. يولد الأصوات التي تحدث عندما تصطدم الأشياء ، ولكن لا يمكن إعادة إنشاء المصفوفة الصوتية لضوضاء الرياح. أيضًا ، تفشل الخوارزمية إذا كانت الكائنات تتحرك بسرعة كبيرة. على الرغم من هذه الحقيقة ، فإن مثل هذه الحلول لديها الإمكانات - يمكنها تبسيط عمل صانعي الضوضاء وتحويل صناعة السينما.






« Hi-Fi»:



:

?

«, , »: ,

, :

«»:







All Articles