منذ اختراع أول وحدة معالجة رسومات لها في عام 1999 ، كانت NVIDIA في طليعة الرسومات ثلاثية الأبعاد والحوسبة المسرَّعة بواسطة وحدة معالجة الرسومات. تم تصميم كل بنية NVIDIA بعناية لتقديم مستويات ثورية من الأداء والكفاءة.
تم إصدار A100 ، وهو أول GPU بهندسة NVIDIA Ampere ، في مايو 2020. يوفر تسريعًا هائلاً لتدريب الذكاء الاصطناعي ، و HPC ، وتحليلات البيانات. يعتمد A100 على شريحة GA100 ، وهي حسابية بحتة ، وعلى عكس GA102 ، لم يتم تشغيلها بعد.
تعتمد وحدات معالجة الرسومات GA10x على بنية NVIDIA Turing GPU. Turing هي أول بنية في العالم تقدم أداءً عاليًا لتتبع الأشعة في الوقت الفعلي ، ورسومات مُسرعة بتقنية الذكاء الاصطناعي وعرض رسومات احترافي ، كل ذلك في جهاز واحد.
في هذه المقالة ، سنقوم بتحليل التغييرات الرئيسية في بنية بطاقات الفيديو NVIDIA الجديدة مقارنة بسابقتها.
الشكل 1. هندسة Ampere GA10x
الميزات الرئيسية لـ GA102
تم تصنيع GA102 باستخدام تقنية 8nm الخاصة بشركة NVIDIA - 8N NVIDIA Custom. تحتوي الرقاقة على 28.3 مليار ترانزستور على قالب بحجم 628.4 مم 2. كما هو الحال مع جميع بطاقات GeForce RTX ، يعتمد GA102 على معالج يحتوي على ثلاثة أنواع مختلفة من موارد الحوسبة:
- نواة CUDA للتظليل القابل للبرمجة ؛
- RT-, (BVH) ;
- , .
Ampere
GPC, TPC SM
مثل أسلافه ، يتكون GA102 من مجموعات معالجة الرسومات (GPCs) ، ومجموعات معالجة النسيج (TPCs) ، والمعالجات المتعددة المتدفقة (SM) ، و Raster Operator ROPs (ROPs) ، ووحدات التحكم في الذاكرة. تحتوي الشريحة الكاملة على سبع وحدات GPC و 42 TPCs و 84 SMs.
GPC هي الكتلة عالية المستوى المهيمنة التي تحتوي على جميع الرسومات الرئيسية. كل GPC لديها محرك نقطي مخصص ولديها الآن أيضًا قسمان ROP من ثماني كتل لكل منهما ، وهو ابتكار في بنية Ampere. بالإضافة إلى ذلك ، تحتوي GPC على ستة TPCs ، يحتوي كل منها على معالجين متعددين ومحرك PolyMorph واحد.
الشكل 2. أكمل GPU GA102 مع 84 كتلة SM
في المقابل ، يحتوي كل SM في GA10x على 128 نواة CUDA ، وأربعة نوى موتر من الجيل الثالث ، وملف سجل 256 كيلوبايت ، وأربع وحدات نسيج ، وجيل ثاني لتتبع الشعاع وذاكرة 128 كيلوبايت L1 / مشتركة ، والتي يمكن تهيئتها لسعات مختلفة حسب احتياجات مهام الحوسبة أو الرسومات.
تحسين شرطة عمان السلطانية
في وحدات معالجة الرسومات NVIDIA السابقة ، تم ربط ROPs بوحدة تحكم الذاكرة وذاكرة التخزين المؤقت L2. بدءًا من GA10x ، فهي جزء من GPC ، مما يحسن أداء العمليات النقطية عن طريق زيادة العدد الإجمالي لـ ROPs.
في المجموع ، مع سبعة GPCs و 16 ROPs في كل GPC ، تتكون وحدة معالجة الرسومات GA102 من 112 ROP بدلاً من 96 ، على سبيل المثال ، في TU102. كل هذا له تأثير إيجابي على صقل العينات المتعددة ومعدل تعبئة البكسل والمزج.
NVLink الجيل الثالث
تدعم وحدات معالجة الرسومات GA102 الجيل الثالث من واجهة NVIDIA NVLink ، والتي تتضمن أربعة مسارات x4 ، توفر كل منها 14.0625 جيجا بايت / ثانية من عرض النطاق الترددي بين وحدتي GPU في أي اتجاه. توفر القنوات الأربع معًا 56.25 جيجا بايت / ثانية من عرض النطاق الترددي في كل اتجاه وإجمالي 112.5 جيجا بايت / ثانية بين وحدتي معالجة الرسومات. لذلك ، باستخدام NVLink ، يمكنك توصيل وحدتي GPU RTX 3090.
PCIe Gen 4
تم تجهيز GA10x GPUs بـ PCI Express 4.0 ، والذي يوفر ضعف عرض النطاق الترددي لـ PCIe 3.0 ، ومعدلات نقل تصل إلى 16GTransfers في الثانية ، وبفضل فتحة x16 PCIe 4.0 ، يصل عرض النطاق الترددي الذروة إلى 64 جيجابايت / ثانية.
بنية GA10x متعددة المعالجات
كانت بنية Turing متعددة المعالجات هي الأولى في NVIDIA التي تحتوي على نوى منفصلة لتسريع عمليات تتبع الأشعة. ثم قدم فولتا أول حبات تنسور ، وقدم تورينج حبات موتر محسنة من الجيل الثاني. ابتكار آخر في Turing و Volta هو القدرة على تنفيذ عمليات FP32 و INT32 في وقت واحد. يدعم المعالجات المتعددة في GA10x جميع الميزات المذكورة أعلاه ، ولديه أيضًا عدد من التحسينات الخاصة به.
على عكس TU102 ، الذي يحتوي على ثمانية نوى موتر من الجيل الثاني ، فإن المعالجات المتعددة GA10x بها أربعة نوى موتر من الجيل الثالث ، مع كل نواة موتر GA10x ضعف قوة Turing.
الشكل 3. GA10x المتدفق متعدد المعالجات
مضاعفة سرعة حوسبة FP32
معظم حسابات الرسومات عبارة عن عمليات فاصلة عائمة 32 بت (FP32). يوفر معالج Ampere GA10x المتدفق متعدد المعالجات ضعف سرعة عمليات FP32 على قناتي البيانات. نتيجة لذلك ، في سياق FP32 ، توفر GeForce RTX 3090 أكثر من 35 تيرافلوب ، وهو أكثر من ضعف قدرات تورينج.
يمكن لجهاز GA10X تنفيذ 128 عملية FP32 أو 64 عملية FP32 و 64 عملية INT32 لكل ساعة ، وهو ضعف سرعة حسابات Turing.
تتضمن مهام الألعاب الحديثة مجموعة كبيرة من احتياجات المعالجة. تتطلب العديد من العمليات الحسابية مجموعة من عمليات FP32 (مثل FFMA أو إضافة الفاصلة العائمة (FADD) أو مضاعفة النقطة العائمة (FMUL)) ، بالإضافة إلى العديد من حسابات الأعداد الصحيحة البسيطة.
تستمر معالجات GA10x في دعم عمليات FP16 (HFMA) مزدوجة السرعة ، والتي تم دعمها أيضًا في تورينج. ومثل وحدات معالجة الرسومات TU102 و TU104 و TU106 ، في GA10x ، تتم أيضًا معالجة عمليات FP16 القياسية بواسطة نوى الموتر.
الذاكرة المشتركة وذاكرة التخزين المؤقت لبيانات L1
يحتوي GA10x على بنية موحدة للذاكرة المشتركة وذاكرة التخزين المؤقت لبيانات L1 وذاكرة التخزين المؤقت للنسيج. يمكن تعديل هذا التصميم الموحد بناءً على عبء العمل والاحتياجات.
تحتوي شريحة GA102 على 10752 كيلو بايت من ذاكرة التخزين المؤقت L1 (مقارنة بـ 6912 كيلو بايت في TU102). بصرف النظر عن ذلك ، ضاعف GA10x عرض النطاق الترددي للذاكرة المشتركة مقارنةً بـ Turing (128 بايت / دورة مقابل 64 بايت / دورة). يبلغ إجمالي عرض النطاق الترددي L1 لـ GeForce RTX 3080 219 جيجابايت / ثانية مقابل 116 جيجابايت / ثانية لـ GeForce RTX 2080 Super.
أداء لكل واط
تم تصميم بنية NVIDIA Ampere بالكامل لتحقيق الكفاءة - من المنطق والذاكرة وإدارة الطاقة والحرارة إلى تصميم ثنائي الفينيل متعدد الكلور والبرمجيات والخوارزميات. على نفس مستوى الأداء ، تعد وحدات معالجة الرسومات Ampere أكثر كفاءة في استهلاك الطاقة تصل إلى 1.9 مرة مقارنة بأجهزة Turing المماثلة.
الشكل 4. كفاءة استهلاك الطاقة RTX 3080 مقابل بنية GeForce RTX 2080 Super
النوى RT من الجيل الثاني
تتميز نوى RT الجديدة بعدد من التحسينات التي ، جنبًا إلى جنب مع أنظمة التخزين المؤقت المحدثة ، تضاعف بشكل فعال أداء تتبع الشعاع لمعالجات Ampere على Turing. بالإضافة إلى ذلك ، يسمح GA10x بتشغيل العمليات الأخرى بالتزامن مع حوسبة RT ، وبالتالي تسريع العديد من المهام بشكل كبير.
الجيل الثاني من تتبع الأشعة في GA10x
كانت GeForce RTX المستندة إلى بنية Turing هي أولى وحدات معالجة الرسومات التي أصبح تتبع الأشعة السينمائية بواسطتها حقيقة واقعة في ألعاب الكمبيوتر. تم تجهيز GA10x بتقنية تتبع الأشعة من الجيل الثاني. مثل Turing ، تحتوي المعالجات المتعددة في GA10x على كتل أجهزة متخصصة للتحقق من تقاطعات الأشعة مع BVHs والمثلثات. في الوقت نفسه ، تمتلك نوى معالجات Ampere المتعددة سرعة ضعف سرعة اختبار تقاطع الأشعة والمثلثات مقارنةً بـ Turing.
الشكل 5. مقارنة أداء أنوية RT في GeForce RTX 3080 و GeForce RTX 2080 Super
يمكن للمعالج GA10x إجراء العمليات في وقت واحد ولا يقتصر على الحوسبة والرسومات ، كما كان الحال في الأجيال السابقة من وحدات معالجة الرسومات. لذلك ، على سبيل المثال ، في GA10x ، يمكن تنفيذ خوارزمية تقليل الضوضاء في وقت واحد مع تتبع الأشعة.
الشكل 6. الجيل الثاني من RT Core في GA10x GPU
لاحظ أن أحمال العمل كثيفة الاستخدام RT لا تزيد بشكل كبير من الحمل على النوى متعددة المعالجات ، مما يسمح باستخدام قوة المعالجة متعددة المعالجات في مهام أخرى. هذه ميزة كبيرة على البنى الأخرى المنافسة التي لا تحتوي على أنوية RT مخصصة وبالتالي يتعين عليها استخدام اللبنات الأساسية لكل من الرسوم البيانية وتتبع الأشعة.
معالجات Ampere RTX قيد التشغيل
تتبع الأشعة والتظليل مكثفان من الناحية الحسابية. ولكن سيكون تشغيل كل شيء باستخدام نوى CUDA وحدها أكثر تكلفة ، لذا فإن تضمين أنوية الموتر و RT يساعد في تسريع المعالجة بشكل كبير. يوضح الشكل 7 مثالاً على Wolfenstein: Youngblood مع تمكين تتبع الأشعة في سيناريوهات مختلفة.
الشكل 7. عرض إطار واحد من Wolfenstein: Youngblood على RTX 2080 Super GPU باستخدام أ) نوى تظليل (CUDA) ، ب) نوى تظليل ونوى RT ، ج) نوى تظليل ، نوى موتر و قلب RT. لاحظ أوقات الإطارات المتناقصة تدريجياً مع إضافة قوة نوى معالج RTX المختلفة.
في الحالة الأولى ، يستغرق الأمر 51 مللي ثانية (حوالي 20 إطارًا في الثانية) لبدء إطار واحد. عند تشغيل نوى RT ، يتم عرض الإطار بشكل أسرع - في 20 مللي ثانية (50 إطارًا في الثانية). يؤدي استخدام DLSS على نوى الموتر إلى تقليل وقت الإطار إلى 12 مللي ثانية (83 إطارًا في الثانية تقريبًا).
الشكل 8. تقديم إطار واحد من Wolfenstein: Youngblood على RTX 3080 باستخدام أ) نوى تظليل (CUDA) ، ب) نوى تظليل ونواة RT ، ج) نوى تظليل ، نوى موتر و RT.
لذلك ، تعد تقنية RTX مع بنية Ampere أكثر كفاءة في التعامل مع مهام التقديم: يعرض RTX 3080 إطارًا في 6.7 مللي ثانية (150 إطارًا في الثانية) ، وهو تحسن كبير مقارنة بـ RTX 2080.
جهاز تسريع تتبع الأشعة باستخدام ضبابية الحركة
تمويه الحركة هي خطوة تستخدم غالبًا في رسومات الكمبيوتر. لا يتم إنشاء الصورة الفوتوغرافية على الفور ، ولكن من خلال تعريض الفيلم للضوء لفترة زمنية محدودة. ستظهر الأهداف التي تتحرك بسرعة كافية مقارنة بوقت تعرض الكاميرا في الصورة على شكل خطوط أو نقاط. لكي تقوم وحدة معالجة الرسومات (GPU) بإنشاء ضبابية حركة ذات مظهر واقعي عندما تتحرك الكائنات في مشهد بسرعة أمام كاميرا ثابتة ، يجب أن تكون قادرة على محاكاة كيفية عمل الكاميرا والفيلم مع مثل هذه المشاهد. تعد ضبابية الحركة مهمة بشكل خاص في صناعة الأفلام لأنه يتم تشغيل الأفلام بمعدل 24 إطارًا في الثانية وسيظهر المشهد بدون ضبابية الحركة حادًا ومتقطعًا.
تقوم Turing GPU بعمل جيد لتسريع ضبابية الحركة بشكل عام. ومع ذلك ، في حالة الهندسة المتحركة ، يمكن أن تكون المهمة أكثر صعوبة ، لأن المعلومات حول BVH تتغير مع وضع الكائنات في الفضاء.
كما ترون في الشكل 9 ، يقوم نواة Turing RT باجتياز الأجهزة في التسلسل الهرمي BVH ، والتحقق من تقاطع الأشعة مع BBox والمثلثات. يمكن لـ GA10x أن يفعل نفس الشيء ، ولكن بالإضافة إلى ذلك ، فإنه يحتوي على كتلة Interpolate Triangle Position جديدة ، والتي تسرع ضبابية الحركة في تتبع الأشعة.
تنفذ كل من نوى Turing و GA10x RT بنية بيانات متعددة التعليمات (MIMD) ، والتي تسمح بمعالجة حزم متعددة في وقت واحد.
الشكل 9. مقارنة بين ضبابية الحركة المسرَّعة للأجهزة في حالة Turing و Ampere
المشكلة الرئيسية في ضبابية الحركة هي أن المثلثات في المشهد ليست ثابتة في الوقت المناسب. في تتبع الشعاع الأساسي ، يتم إجراء اختبارات التقاطع الثابت ، وعندما يصطدم شعاع بمثلث ، فإنه يعرض معلومات حول تلك الضربة. كما هو مبين في الشكل 10 ، مع ضبابية الحركة ، لا توجد إحداثيات ثابتة لأي من المثلثات. يتم تحديد طابع زمني لكل شعاع للإشارة إلى وقت التتبع الخاص به ، ويتم تحديد موضع المثلث وتقاطع الشعاع من معادلة BVH.
إذا لم يتم تسريع هذه العملية بواسطة الأجهزة ، فيمكن أن تسبب الكثير من المشكلات ، بما في ذلك بسبب عدم خطيتها.
رسم. 10. تتبع الشعاع الأساسي وتتبع الشعاع مع ضبابية الحركة
على الجانب الأيسر من الشكل 11 ، ضربت الأشعة المرسلة إلى مشهد ثابت نفس المثلث في نفس الوقت. تظهر النقاط البيضاء مكان التأثير ، ويتم إرجاع هذه النتيجة. في حالة ضبابية الحركة ، يوجد كل شعاع في لحظته الخاصة في الوقت المناسب. يتم تعيين طابع زمني مختلف بشكل عشوائي لكل حزمة. على سبيل المثال ، تحاول الأشعة البرتقالية عبور المثلثات البرتقالية في نفس الوقت ، ثم تفعل الأشعة الخضراء والأزرق نفس الشيء. في النهاية ، يتم مزج العينات ، مما ينتج عنه نتيجة ضبابية صحيحة رياضيًا.
الشكل 11. التقديم بدون ضبابية الحركة وبتمويه في GA10x
تقوم كتلة Interpolate Triangle Position بإقحام المثلثات في BVH بين المثلثات الموجودة بالفعل بناءً على حركة الكائن ، بحيث تتقاطع الأشعة بينها في المواقع المتوقعة في اللحظات المحددة بواسطة الطوابع الزمنية للأشعة. يسمح هذا الأسلوب بالعرض الدقيق لطمس حركة تتبع الأشعة حتى ثماني مرات أسرع من تورينج.
تم دعم طمس الحركة المعجل للأجهزة GA10x بواسطة Blender 2.90 و Chaos V-Ray 5.0 و Autodesk Arnold و Redshift Renderer 3.0.X باستخدام واجهة برمجة تطبيقات NVIDIA OptiX 7.0.
تصل سرعة عرض ضبابية الحركة إلى 5x أسرع في RTX 3080 مقارنة بـ RTX 2080 Super.
أنوية الموتر من الجيل الثالث في وحدات معالجة الرسومات GA10x
يتضمن GA10x الجيل الثالث الجديد من NVIDIA Tensor Cores ، والذي يتميز بدعم أنواع البيانات الجديدة والأداء المحسن والكفاءة ومرونة البرمجة. تضاعف ميزة التباين الجديدة أداء Tensor Cores مقارنة بالجيل السابق من Turing. وظائف AI مثل NVIDIA DLSS للدقة الفائقة للذكاء الاصطناعي (الآن مع دعم 8K) ، و NVIDIA Broadcast لمعالجة الصوت والفيديو ، و NVIDIA Canvas للرسم هي أيضًا أسرع.
نواة Tensor هي وحدات تنفيذ متخصصة مصممة لأداء عمليات الموتر / المصفوفة - الوظيفة الحسابية الرئيسية في التعلم العميق. إنها ضرورية لتحسين جودة الرسومات باستخدام DLSS (Deep Learning Super Sampling) ، وإلغاء الضوضاء المستند إلى AI ، وإزالة ضوضاء الخلفية داخل الدردشات الصوتية للعبة باستخدام RTX Voice ، والعديد من التطبيقات الأخرى.
أتاح إدخال Tensor Cores في وحدات معالجة الرسومات GeForce للألعاب التعلم العميق في الوقت الفعلي في تطبيقات الألعاب لأول مرة. يعمل تصميم نواة الموتر من الجيل الثالث في وحدات معالجة الرسومات GA10x على زيادة الأداء الخام والاستفادة من أوضاع الدقة الحسابية الجديدة مثل TF32 و BFloat16. يلعب هذا دورًا كبيرًا في تطبيقات NVIDIA NGX Neural Services المستندة إلى AI لتحسين الرسومات والعرض والميزات الأخرى.
مقارنة بين نوى تورينج وأمبير موتر
تم إعادة تنظيم نوى Ampere Tensor على Turing لتحسين الكفاءة وتقليل استهلاك الطاقة. تحتوي بنية قلب Ampere SM على عدد أقل من نوى التوتر ، ولكن كل منها أقوى.
الشكل 12. نوى موتر مع هندسة Turing و Ampere. تقدم GeForce RTX 3080 عرض نطاق ترددي FP16 Tensor Core أسرع 2.7 مرة من GeForce RTX 2080 Super
تناثر منظم دقيق الحبيبات
باستخدام وحدة معالجة الرسومات A100 ، قدمت NVIDIA تقنية Sparsity الهيكلية الدقيقة الحبيبات ، وهي طريقة جديدة لمضاعفة النطاق الترددي الحسابي للشبكات العصبية العميقة. هذه الميزة مدعومة أيضًا بواسطة وحدات معالجة الرسومات GA10x وتساعد في تسريع بعض عمليات عرض الرسومات القائمة على الذكاء الاصطناعي.
نظرًا لأن شبكات التعلم العميق يمكنها تكييف الأوزان من خلال تعلم التغذية الراجعة ، بشكل عام ، لا تؤثر القيود الهيكلية على دقة النماذج المدربة.
الشكل 13. تناثر منظم دقيق الحبيبات
طورت NVIDIA خوارزمية بسيطة ومتعددة الاستخدامات للشبكة العصبية العميقة باستخدام نمط متباين منظم 2: 4. يتم تدريب الشبكة أولاً بأوزان كثيفة ، ثم يحدث تقليم منظم دقيق الحبيبات ، وبعد ذلك يمكن التخلص من القيم الصفرية ، ويتم ضغط الرياضيات المتبقية لزيادة الإنتاجية. لا تؤثر الخوارزمية على دقة الشبكة المدربة للاستدلال ، بل تعمل فقط على تسريعها.
NVIDIA DLSS 8K
يعد تقديم صورة باستخدام تتبع الأشعة بمعدل إطارات مرتفع مكلفًا للغاية من الناحية الحسابية. قبل ظهور NVIDIA Turing ، كان يُعتقد أن تنفيذه سيستغرق سنوات. للمساعدة في حل هذه المشكلة ، قامت NVIDIA بإنشاء Deep Learning Supersampling (DLSS).
الشكل 14. Watch Dogs: Legion مع DLSS بدقة 1080 بكسل و 4 K و 8 K. لاحظ أن النص والتفاصيل الأكثر وضوحًا التي توفرها DLSS في 8K
DLSS تتحسن فقط على NVIDIA Ampere من خلال استخدام الجيل الثالث من Tensor Cores وعامل تحجيم فائق الدقة 9x ، والذي يتيح لأول مرة تشغيل لعبة تتبع الأشعة بسرعة 8K بمعدل 60 إطارًا في الثانية.
15. GeForce RTX 3090 60 fps 8K DLSS . , . Core i9-10900K
GDDR6X
تتطلب ألعاب الكمبيوتر الحديثة والتطبيقات الإبداعية مزيدًا من عرض النطاق الترددي للذاكرة للتعامل مع هندسة المشهد المعقدة بشكل متزايد ، ومواد أكثر تفصيلاً ، وتتبع الأشعة ، واستدلال الذكاء الاصطناعي ، والتظليل بالطبع والاختزال الفائق.
GDDR6X هي أول ذاكرة رسومات تتجاوز 900 جيجا بايت / ثانية. لتحقيق ذلك ، تم استخدام تقنية الإشارات المبتكرة وتعديل سعة النبضة بأربعة مستويات (PAM4) ، مما أحدث ثورة في طريقة نقل البيانات في الذاكرة. باستخدام خوارزمية PAM4 ، ينقل GDDR6X المزيد من البيانات بمعدل أسرع بكثير ، وينقل بتتين من البيانات في كل مرة ، مما يضاعف معدل بيانات الإدخال / الإخراج لنظام PAM2 / NRZ السابق.
يدعم GDDR6X حاليًا 19.5 جيجابت في الثانية لـ GeForce RTX 3090 و 19 جيجابت في الثانية لـ GeForce RTX 3080. وبفضل هذا ، توفر GeForce RTX 3080 أداء ذاكرة يبلغ 1.5 ضعف أداء الذاكرة السابقة ، RTX 2080 Super. ...
يوضح الشكل 16 مقارنة بين بنية GDDR6 (يسار) و GDDR6X (يمين). ينقل GDDR6X نفس البيانات بنصف تردد GDDR6. أو ، بدلاً من ذلك ، يمكن لـ GDDR6X مضاعفة عرض النطاق الترددي الفعال مع الحفاظ على نفس التردد.
الشكل 16. GDDR6X باستخدام إشارات PAM4 يظهر أداء وكفاءة أفضل من GDDR6
تم تطوير مخطط تشفير جديد MTA (الحد الأقصى لمنع الانتقال) لمعالجة مشاكل SNR المرتبطة بإشارات PAM4. يمنع MTA الإشارات عالية السرعة من الانتقال من الأعلى إلى الأدنى والعكس صحيح.
الشكل 17. ترميز جديد في GDDR6X
يدعم معدلات البيانات التي تصل إلى 19.5 جيجابت في الثانية على شرائح GA10x ، ويوفر GDDR6X أقصى عرض نطاق للذاكرة يصل إلى 936 جيجابايت / ثانية ، أي 52٪ أكثر من وحدة معالجة الرسومات TU102 المستخدمة في GeForce RTX 2080 تي. حقق GDDR6X أكبر قفزة في عرض النطاق الترددي منذ 10 سنوات بعد سلسلة وحدات معالجة الرسومات GeForce 200.
RTX IO
تحتوي الألعاب الحديثة على عوالم ضخمة. مع تطور تقنيات مثل القياس التصويري ، أصبحوا يقلدون الواقع بشكل متزايد ، ونتيجة لذلك ، يتم تضمينهم في ملفات ذات حجم متزايد. تشغل أكبر مشاريع الألعاب أكثر من 200 جيجا بايت ، أي أكثر بثلاث مرات من أربع سنوات مضت ، وسيزداد هذا العدد بمرور الوقت.
يتجه اللاعبون بشكل متزايد إلى محركات أقراص الحالة الصلبة (SSD) لتقليل أوقات تحميل الألعاب: بينما يقتصر عرض محركات الأقراص الثابتة على النطاق الترددي 50-100 ميجابايت / ثانية ، فإن أحدث محركات أقراص الحالة الصلبة M.2 PCIe Gen4 تقرأ البيانات بسرعة تصل إلى 7 جيجابايت / ثانية.
الشكل 18. ألعاب مقيدة بأنظمة الإدخال / الإخراج التقليدية
الشكل 19. باستخدام نموذج التخزين التقليدي ، يمكن أن يستغرق تفريغ اللعبة جميع نوى المعالج الأربعة والعشرين. لقد تجاوزت محركات الألعاب الحديثة قدرات واجهات برمجة تطبيقات التخزين التقليدية. هذا هو سبب الحاجة إلى جيل جديد من هندسة الإدخال / الإخراج. هنا ، تشير الأشرطة الرمادية إلى معدل نقل البيانات ، والكتل السوداء والزرقاء - أنوية وحدة المعالجة المركزية المطلوبة لهذا الغرض.
NVIDIA RTX IO عبارة عن مجموعة من التقنيات التي توفر تحميلًا سريعًا وتفريغًا للأصول المستندة إلى وحدة معالجة الرسومات وتقدم أداء إدخال / إخراج أسرع بما يصل إلى 100 مرة من محركات الأقراص الثابتة وواجهات برمجة تطبيقات التخزين التقليدية.
يتم تشغيل NVIDIA RTX IO بواسطة Microsoft DirectStorage API ، وهو الجيل التالي من وحدات التخزين المصممة خصيصًا لأجهزة الكمبيوتر NVMe SSD المخصصة للألعاب. توفر NVIDIA RTX IO فك ضغط بدون فقد ، مما يسمح بقراءة البيانات في شكل مضغوط عبر DirectStorage وتسليمها إلى وحدة معالجة الرسومات. يؤدي هذا إلى إلغاء تحميل وحدة المعالجة المركزية عن طريق نقل البيانات من التخزين إلى وحدة معالجة الرسومات في شكل مضغوط أكثر كفاءة ومضاعفة أداء الإدخال / الإخراج.
الشكل 20. يوفر RTX IO 100 ضعف عرض النطاق الترددي و 20 ضعف استخدام وحدة المعالجة المركزية. تشير الأشرطة الرمادية والخضراء إلى معدل الباود ، بينما يلزم وجود كتل سوداء وزرقاء لنواة وحدة المعالجة المركزية هذه.
محرك العرض والفيديو
منفذ DisplayPort 1.4a مزود بكاميرا DSC 1.2a
تستمر المسيرة نحو قرارات أعلى من أي وقت مضى ومعدلات إطارات أعلى ، وتسعى وحدات معالجة الرسومات NVIDIA Ampere جاهدة للبقاء في طليعة الصناعة لتقديم كليهما. يمكن للاعبين الآن اللعب على شاشات 4K (3820 × 2160) بسرعة 120 هرتز و 8 كيلو (7680 × 4320) عند 60 هرتز - أربعة أضعاف عدد البكسل الذي يبلغ 4K.
تم تصميم محرك معمارية Ampere لدعم العديد من التقنيات الجديدة المضمنة في أسرع واجهات العرض المتاحة اليوم. يتضمن ذلك منفذ DisplayPort 1.4a ، الذي يوفر 8K عند 60 هرتز مع ضغط تدفق عرض VESA (DSC) 1.2a. يمكن توصيل وحدات معالجة الرسومات Ampere الجديدة بشاشتين 8K 60Hz بكبل واحد فقط لكل شاشة.
HDMI 2.1 مع DSC 1.2a
تضيف بنية NVIDIA Ampere دعمًا لـ HDMI 2.1 ، وهو آخر تحديث لمواصفات HDMI ، لأول مرة لوحدات معالجة الرسومات المنفصلة. زاد HDMI الحد الأقصى لعرض النطاق الترددي إلى 48 جيجابت في الثانية ، مما يسمح أيضًا بتنسيقات HDR الديناميكية. يتطلب دعم 8K @ 60Hz مع HDR ضغط DSC 1.2a أو تنسيق 4: 2: 0 بكسل.
NVDEC من الجيل الخامس - تسريع فك تشفير الفيديو بالأجهزة
تتضمن وحدات معالجة الرسومات NVIDIA الجيل الخامس من فك تشفير الفيديو المسرع بالأجهزة (NVDEC) ، والذي يوفر فك تشفير فيديو كامل للأجهزة لمجموعة متنوعة من برامج الترميز الشائعة.
الشكل 21. تنسيقات تشفير وفك تشفير الفيديو التي تدعمها
وحدات معالجة الرسومات GA10x يدعم الجيل الخامس من مفكك تشفير NVIDIA في GA10x فك تشفير الأجهزة المعجل لبرامج ترميز الفيديو التالية على أنظمة تشغيل Windows و Linux: MPEG-2 و VC-1 و H.264 (AVCHD) و H.265 (HEVC) و VP8 و VP9 و AV1.
NVIDIA هي الشركة المصنعة الأولى لوحدة معالجة الرسومات (GPU) التي توفر دعم الأجهزة لفك تشفير AV1.
أجهزة AV1 فك
على الرغم من أن AV1 فعال للغاية في ضغط الفيديو ، إلا أن فك تشفيره يتطلب عمليات حسابية مكثفة. تتسبب أجهزة فك تشفير البرامج الحديثة في استخدام عالي لوحدة المعالجة المركزية وتجعل من الصعب تشغيل فيديو فائق الوضوح. في اختبارات NVIDIA ، بلغ متوسط معالج Intel i9 9900K 28 إطارًا في الثانية على YouTube بدقة 8K60 HDR ، مع استخدام وحدة المعالجة المركزية يتجاوز 85٪. يمكن لوحدات معالجة الرسومات GA10x تشغيل AV1 عن طريق تمرير فك التشفير إلى NVDEC ، وهو قادر على تشغيل محتوى يصل إلى 8K60 HDR مع استخدام منخفض جدًا لوحدة المعالجة المركزية (حوالي 4٪ على نفس وحدة المعالجة المركزية كما في الاختبار السابق).
NVENC من الجيل السابع - ترميز الفيديو المسرع بالأجهزة
يمكن أن يكون ترميز الفيديو مهمة حسابية معقدة ، ولكن إذا قمت بتحميله إلى NVENC ، فسيتم تحرير محرك الرسومات ووحدة المعالجة المركزية لعمليات أخرى. على سبيل المثال ، عند بث الألعاب إلى Twitch.tv باستخدام Open Broadcaster Software (OBS) ، فإن إلغاء تحميل ترميز الفيديو إلى NVENC سيسمح بتخصيص محرك GPU لعرض اللعبة ووحدة المعالجة المركزية لمهام المستخدم الأخرى.
يسمح NVENC بما يلي:
- ترميز عالي الجودة بزمن انتقال منخفض للغاية وبث الألعاب والتطبيقات دون استخدام وحدة المعالجة المركزية ؛
- ترميز عالي الجودة للأرشفة وتدفق OTT وفيديو الويب ؛
- ترميز طاقة منخفضة للغاية لكل دفق (W / تيار).
من خلال إعدادات البث المشتركة لـ Twitch و YouTube ، يتفوق ترميز الأجهزة المستندة إلى NVENC في وحدات معالجة الرسومات GA10x على برامج تشفير برامج x264 باستخدام الإعداد المسبق السريع ويتساوى مع x264 Medium ، وهو إعداد مسبق يتطلب عادةً طاقة جهازي كمبيوتر. هذا يزيل بشكل كبير استخدام وحدة المعالجة المركزية. يُعد ترميز 4K عبئًا كبيرًا جدًا بالنسبة لتكوين وحدة المعالجة المركزية النموذجي ، لكن مشفر GA10x NVENC يوفر تشفيرًا سلسًا عالي الدقة يصل إلى 4K في H.264 وحتى 8K في HEVC.
خاتمة
مع كل بنية معالج جديدة ، تسعى NVIDIA جاهدة لتقديم أداء ثوري للجيل التالي مع تقديم ميزات جديدة تعمل على تحسين جودة الصورة. كان تورينج أول معالج رسوميات يقدم تتبع الأشعة المعجل بالأجهزة ، وهي ميزة كانت تعتبر الكأس المقدسة لرسومات الكمبيوتر. اليوم ، يتم إضافة تأثيرات تتبع الأشعة الواقعية والدقيقة بشكل لا يصدق إلى العديد من ألعاب الكمبيوتر AAA الجديدة ، ويعتبر تتبع الأشعة المعجل بواسطة وحدة معالجة الرسومات أمرًا ضروريًا لمعظم لاعبي أجهزة الكمبيوتر. توفر وحدات معالجة الرسومات NVIDIA GA10x Ampere الجديدة الميزات والأداء الذي تحتاجه للاستمتاع بهذه الألعاب الجديدة التي تعمل بتقنية تتبع الأشعة مع معدلات إطارات تصل إلى 2x أسرع من المتوفرة حاليًا.ميزة أخرى لـ Turing - معالجة الذكاء الاصطناعي المسرَّعة بوحدة المعالجة المركزية والتي تعمل على تحسين إلغاء الضوضاء والعرض وتطبيقات الرسومات الأخرى - يتم نقلها أيضًا إلى المستوى التالي بفضل بنية Ampere.
أخيرًا ، رابط إلى المستند الكامل .