سنبدأ اختيارنا لشهر سبتمبر بدراسة حالة. هذه المرة هو واحد فقط ، لكن ما هو!
لا نتوقف أبدًا عن الإعجاب بإمكانيات GPT-3 والحديث عن مجالات تطبيقه ، لكن الكثيرين في نفس الوقت يرون في الخوارزمية تهديدًا لمهنتهم.
وقررت VMO ، التي تشارك في اختبار A / B ، إجراء مسابقة - مؤلفو نصوص محترفون ضد GPT-3 .
لقد قاموا بدمج الخوارزمية في المحرر المرئي الخاص بهم بحيث يمكن للمستخدمين الاختيار بين النصوص المنشأة والمؤلفة. حتى الآن ، تتيح لك الخدمة فقط إنشاء العناوين وأوصاف المنتجات والخدمات وأزرار الحث على اتخاذ إجراء.
لماذا هذا مثير جدا للاهتمام؟النقطة المهمة هي أنه في إدارة المنتجات والتسويق ، يتم إنفاق الكثير من الموارد على اختبار الفرضيات. ما العنوان الذي سيؤدي إلى زيادة المشاركة بشكل أفضل ، أو ما هو لون الزر وشكله الذي يجب أن يكون عليه العميل لاتخاذ الإجراء المستهدف. تمكّن الإجابات على هذه الأسئلة المنتجات من أن تصبح ناجحة.
لن تحل نتيجة هذه المواجهة بالذات أي شيء حتى الآن ، ولكن تخيل ما إذا كانت الخوارزمية لا يمكنها فقط إنشاء نصوص ، ولكن أيضًا تتبع سلوك المستخدم وتعديل الواجهة. الآن ، تذكر أن GPT-3 يمكنه الطباعة وإنشاء مكونات تفاعل. هذا هو السبب في أنه من المثير للاهتمام متابعة هذه التجربة. في وقت كتابة هذا التقرير ، كان GPT-3 في المقدمة بهامش صغير ، دعنا نرى كيف ينتهي كل شيء.
والآن إلى بقية اكتشافات الشهر الماضي:
Wav2Lip
يولد النموذج حركات الشفاه للكلام ، وبالتالي مزامنة تدفقات الصوت والفيديو. يمكن استخدامه للبث عبر الإنترنت ، والمؤتمرات الصحفية ، ودبلجة الأفلام. في العرض التوضيحي ، يمكنك أن ترى كيف تتكيف شفاه توني ستارك مع الدبلجة بلغات مختلفة. أيضًا ، إذا تدهور الاتصال أثناء مكالمات Skype ، فيمكن للنموذج إنشاء إطارات ضاعت بسبب فشل الإشارة ، ورسمها بناءً على دفق الصوت. يقترح المبدعون أيضًا تحريك شفاه شخصيات meme لمزيد من تخصيص المحتوى. مثل مكبرات الصوت الرقمية ، هذا النموذج قادر على ضبط حركة الشفاه على الكلام الناتج من النص.
من الجدير بالذكر أنه في مايو نشر المؤلفون نموذج Lip2Wavالذي على العكس من ذلك "يقرأ الشفاه" ويولد النص والصوت. تستخرج الشبكة العصبية التلافيفية الخصائص المرئية ، وبعد ذلك يقوم جهاز فك ترميز الكلام بإنشاء مخطط طيفي طباشيري بناءً عليها ، ويتم تصنيع الصوت باستخدام مشفر صوتي.
إكمال تدفق الفيديو الإرشادي
خوارزمية تكبير الفيديو الجديدة التي تزيل العلامات المائية والأجسام المتحركة بالكامل ، وتوسع أيضًا مجال رؤية الفيديو ، مع مراعاة حركة الإطار. مثل الخوارزميات المماثلة الأخرى ، فإنه يكتشف ويستعيد حواف الأجسام المتحركة أولاً. في هذه الحالة ، لا تبدو الحدود المرسومة طبيعية في المشهد. تكمن خصوصية الطريقة في أنها تتعقب خمسة أنواع من وحدات البكسل المتجاورة غير المحلية ، أي الموجودة على إطارات مختلفة ، ثم تحدد أي منها يمكن الوثوق به ، وتستخدم هذه البيانات لاستعادة المناطق المفقودة. والنتيجة هي فيديو أكثر سلاسة. يمكنك بالفعل التحقق من شفرة المصدر ، ستتم إضافة تعاون قريبًا.
X- الحقول
تم تدريب الشبكة العصبية على سلسلة من الصور لمشهد واحد مع إحداثيات محددة لزاوية الرؤية والطوابع الزمنية ومعلمات الإضاءة. لذلك تعلمت إقحام هذه المعلمات وعرض الصور الوسيطة. أي أنه بعد تلقي العديد من الصور مع مكعب ثلج يذوب تدريجيًا أو زجاج فارغ عند المدخل ، يمكن للنموذج إنشاء صور في الوقت الفعلي مع مراعاة جميع التوليفات الممكنة من المعلمات. لتسهيل فهم ما يدور حوله ، ننصحك بمشاهدة عرض الفيديو فقط . وعد أن يتم نشر شفرة المصدر قريبًا.
Generative Image Inpainting
أداة أخرى لإزالة الكائنات من الصور بناءً على الشبكة العصبية التوليدية. هذه المرة هو إطار كامل مفتوح المصدر وAPI العامة . إنه يعمل بكل بساطة - قم بتحميل الصورة وارسم قناع الكائن الذي تريد إزالته ، و- تم ، بدون معالجة إضافية لاحقة. يتم نشر المشروع على خادم ويب ، لذا يمكنك اختباره بسهولة في المتصفح. هناك قطع أثرية بالطبع ، لكنها تتواءم جيدًا مع الصور البسيطة.
معالجة الظل في
الصورة الشخصية غالبًا ما يعاني التصوير الفوتوغرافي للصورة من إضاءة غير مناسبة. يعد موضع الظلال ونعومتها وتوزيع الضوء من القيود البيئية التي تؤثر على الصفات الجمالية للصورة. لم يعد محرر الصور مطلوبًا لإزالة الظلال غير المرغوب فيها - كشف باحثو بيركلي النقاب عن خوارزمية مفتوحة المصدرالذي يزيل التظليل بشكل واقعي من الصورة ويسمح لك بالتحكم في الإضاءة.
PSFR-GAN
مهمة شائعة بنفس القدر عند العمل مع الصور هي ترميمها وتحسين جودتها. تقوم أداة المصدر المفتوح هذه بعمل جيد في رفع مستوى اللقطات الشخصية.
FrankMocap ظهرت
العديد من أدوات النمذجة ثلاثية الأبعاد المثيرة للاهتمام هذا الشهر. يعرف كل من عمل مع 3D أنه لإنشاء نماذج عالية الجودة ، فإنك تحتاج إلى العديد من معدات التصوير باهظة الثمن والقدرة على استخدام البرامج المعقدة. لكن يتم استخدام خوارزميات التعلم الآلي بنشاط لتسهيل الأمر على الفنانين في هذا المجال.
قدم Facebook AI نظامًا لإنشاء نماذج بالحجم الطبيعي ثلاثي الأبعاد لليدين والجسم بناءً على تحليل الفيديو الأحادي. يعمل التقاط الحركة في الوقت الفعلي تقريبًا (9.5 إطارات في الثانية) وينشئ صورًا ثلاثية الأبعاد للجسم واليدين في شكل نموذج حدودي موحد. على عكس الأساليب الأخرى الحالية ، يتيح لك هذا الأسلوب التقاط إيماءات اليد وحركات الجسم بالكامل في وقت واحد. كود المصدر متاح بالفعل.
3DDFA
أداة أخرى ، ظهرت أيضًا هذا الشهر ، قادرة على تمييز وجه الشخص من الفيديو لإنشاء قناع ثلاثي الأبعاد.
PSOHA
تقنية أخرى من Facebook AI ، والتي تم تصميمها أيضًا لتبسيط عملية النمذجة ثلاثية الأبعاد - تستخرج الشبكة العصبية العديد من الاتصالات بين الشخص الموجود في الصورة والكائنات الأخرى وتقوم بإنشاء نماذج بالحجم الطبيعي ثلاثية الأبعاد. وهكذا ، على أساس صورة واحدة فقط تصور شخصًا مع بعض الأشياء اليومية ، يتم إنشاء نموذج ثلاثي الأبعاد. تحدد الخوارزمية أشكال الأشخاص والأشياء ، وكذلك موقعهم المكاني في الظروف الطبيعية ، في بيئة غير خاضعة للرقابة. يعد منشئو المحتوى بإصدار الكود المصدري قريبًا ، لذلك يبقى أن نصدق حتى الآن الأمثلة من العرض التوضيحي ، والتي ، دعنا لا نكون مكررين ، مثيرة للإعجاب.
هريس الوحش
يتيح لك الإطار الجديد إنشاء كائنات ثلاثية الأبعاد وتحريكها باستخدام رسم تخطيطي واحد فقط. يعمل هذا على تبسيط عملية تحريك الكائنات إلى حد كبير ، نظرًا لأنك لا تحتاج إلى العمل مع الإطارات الرئيسية والشبكات متعددة الزوايا والرسوم المتحركة الهيكلية. ينشئ النموذج نموذجًا ثلاثي الأبعاد ، يكون جاهزًا على الفور لإنشاء رسوم متحركة بدون إعداد مسبق طويل لمعلمات مختلفة ، والتي ، على سبيل المثال ، لا تسمح للكائنات بالمرور عبر بعضها البعض.
تجميع الشكل
تخلق الخوارزمية نماذج ثلاثية الأبعاد للأثاث من متوازي السطوح المستطيلة. يستفيد نهج ShapeAssembly من نقاط القوة في النماذج التوليدية الإجرائية والعميقة: الأول يلتقط مجموعة فرعية من تقلبات الشكل التي يمكن تفسيرها وتحريرها ، بينما يلتقط الأخير التباين والارتباطات بين الأشكال التي يصعب التعبير عنها إجرائيًا. تقول الشبكة بالفعل مازحة أن الخطوة التالية هي تدريب عامل التضمين بناءً على تعليمات ايكيا.
هذا يختتم الموضوع بنمذجة ثلاثية الأبعاد - بالنسبة لهذه المنطقة ، كان الشهر مكثفًا بشكل خاص. شكرآ لك على أهتمامك!