Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence
يُعدّ Nemotron 3 Nano Omni نموذجاً جديداً مفتوح المصدر متعدد الوسائط يدعم أصلياً مدخلات الصوت والنص والصورة والفيديو، ويقدم دقة محسنة وقدرات وكيلة واستدلالاً فعالاً من خلال هيكل أساسي مكون من 30 مليار معلمة و3 مليارات معلمة نشطة وتقنيات لتقليل الرموز، مع إصدار نقاط تفتيش وبرمجيات لدعم المزيد من الأبحاث.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل مساعداً فائق الذكاء، قضى حياته كلها في قراءة الكتب والنظر إلى الصور. إنه بارع جداً في النصوص والصور، ولكن إذا حاولت التحدث إليه أو عرض فيديو يحتوي على صوت، فسيشعر بالارتباك.
Nemotron 3 Nano Omni هو النسخة الجديدة من NVIDIA لهذا المساعد. إنه يشبه إعطاء ذلك المساعد زوجاً من الأذنين وكاميرا فيديو، مع تعليمه أيضاً كيفية معالجة المعلومات بشكل أسرع وأكثر كفاءة.
إليك تفصيل بسيط لما يجعل هذا النموذج الجديد مميزاً، باستخدام تشبيهات من الحياة اليومية:
1. الترقية "الكل في واحد"
قبل هذا، كان بإمكان المساعد (Nemotron Nano V2) قراءة النصوص والنظر إلى الصور الثابتة فقط. أما النموذج الجديد Nemotron 3 Nano Omni فهو "متعدد الوسائط" (omni-modal)، وهي طريقة تقنية لقول إنه يستطيع التعامل مع كل شيء في وقت واحد: النصوص، الصور، الفيديو، والصوت.
- التشبيه: فكر في النموذج القديم كموظف مكتبة يمكنه فقط قراءة الكتب. أما النموذج الجديد فهو موظف مكتبة يمكنه قراءة الكتب، ومشاهدة الأفلام، والاستماع إلى البودكاست، ثم إخبارك كيف ترتبط كل هذه الأشياء ببعضها البعض.
2. "الدماغ" و"الحواس"
بُني النموذج على دماغ عالي الكفاءة يسمى Nemotron 3 Nano 30B-A3B. هذا الدماغ يعتمد على تقنية "خليط الخبراء" (Mixture of Experts - MoE)، وهي تشبه فريقاً من المتخصصين حيث يستيقظ الخبراء المناسبون فقط لحل مشكلة محددة، مما يوفر الطاقة.
- الحواس: للتعامل مع المدخلات الجديدة، قاموا بإضافة "مجسات" جديدة:
- الرؤية: نظام كاميرا عالي التقنية (C-RADIOv4-H) ينظر إلى الصور ومقاطع الفيديو.
- السمع: أذن متطورة (Parakeet-TDT) تفهم الكلام، والموسيقى، والأصوات البيئية.
3. طرق أذكى للنظر والاستماع
يسلط البحث الضوء على ثلاث حيل ذكية يستخدمها النموذج لكي لا يشعر بالارتباك بسبب كثرة البيانات:
- الدقة الديناميكية (العدسة المرنة): بدلاً من ضغط كل صورة في مربع صغير وثابت (مما يؤدي لفقدان التفاصيل)، يقوم النموذج بتعديل رؤيته مثل الكاميرا التي تقرب أو تبعد لتناسب الشكل الطبيعي للصورة.
- ضغط الفيديو (الفاصل الزمني): عند مشاهدة فيديو، لا ينظر النموذج إلى كل إطار إذا كانت الإطارات متطابقة. إنه يستخدم خدعة "الالتفاف ثلاثي الأبعاد" (3D Convolution) لدمج أزواج من الإطارات، مما يقلل عدد "الإطارات" التي يحتاج لمعالجتها إلى النصف فعلياً.
- قطع الصوت (لقطات الصوت): بدلاً من الاستماع إلى بودكاست مدته ساعتان ككتلة واحدة ضخمة من الضجيج، يقوم بتقسيم الصوت إلى مقاطع مدة كل منها 30 ثانية، مما يسهل فهم تدفق المحادثة.
4. "المعسكر التدريبي" (كيف تعلم)
لا يمكنك مجرد توصيل كاميرا وتوقع أن يفهم النموذج الأفلام فوراً. استخدم الفريق وصفة تدريب مرحلية، مثل طالب يتدرج في المدرسة:
- المرحلة 0-1: أولاً، علموا النموذج فهم الصور والنصوص معاً.
- المرحلة 2-3: بعد ذلك، علموه الاستماع إلى الصوت والتحدث.
- المرحلة 4-6: أخيراً، جمعوا كل ذلك معاً. لقد غدّوه بكميات هائلة من البيانات (أكثر من 466 مليار "توكن" أو كلمة) تضمنت مستندات طويلة، وساعات من الفيديو، ومحادثات معقدة.
- مرحلة "التعلم التعزيزي": بعد التدريب الأولي، لعبوا معه لعبة "حاول، افشل، انجح". أعطوه مشكلات، وتحققوا مما إذا كان قد حصل على الإجابة الصحيحة، وكافأوه على التفكير المنطقي. هذا يشبه مدرباً يراجع لقطات المباراة مع رياضي لتحسين استراتيجيته.
5. السرعة والكفاءة
أحد أكبر الادعاءات في البحث هو أن هذا النموذج سريع للغاية.
- التشبيه: إذا كانت النماذج الأخرى من نفس الحجم تشبه سيارة رياضية عالقة في الازدحام، فإن Nemotron 3 Nano Omni يشبه قطاراً فائق السرعة. فهو يستخدم تقنيات خاصة لتخطي الخطوات غير الضرورية، مما يسم يسمح له بمعالجة الفيديوهات الطويلة والمستندات الضخمة بشكل أسرع بكثير من منافسيه.
- النتيجة: على شرائح NVIDIA الأحدث (B200)، يمكنه إنتاج مخرجات نصية أسرع بـ 3 إلى 9 مرات من النماذج المماثلة مع استخدام ذاكرة أقل.
6. ما يمكنه فعله حقاً (بناءً على البحث)
اختبر البحث هذا النموذج في تحديات محددة، وقد أدى أداءً جيداً جداً في:
- قراءة المستندات: يمكنه فهم المخططات المعقدة، والجداول، والتقارير الطويلة (مثل الأوراق المالية) بشكل أفضل من الإصدارات السابقة.
- فهم الفيديوهات: يمكنه مشاهدة فيديو طويل مع الصوت والإجابة على أسئلة حول ما حدث، ولماذا حدث، وترتيب الأحداث.
- التحكم في الكمبيوتر: يمكنه النظر إلى شاشة الكمبيوتر (GUI) ومعرفة الأزرار التي يجب النقر عليها لإكمال مهمة (مثل حجز رحلة طيران أو ملء نموذج).
- التفاعل الصوتي: يمكنه إجراء محادثة، وفهم اللهجات، والإجابة على الأسئلة بناءً على ما يسمعه.
7. متاح للجميع
أخيراً، يعلن البحث أن NVIDIA تشارك "المخططات" و"مواد التدريب". إنهم يطلقون النموذج بأحجام مختلفة (قياسي، مضغوط، ومضغوط للغاية) بل ويشاركون بعض البيانات والتعليمات البرمجية التي استخدموها لبنائه. هذا يشبه إعطاء الوصفة والمكونات للعالم أجمع حتى يتمكن العلماء الآخرون من بناء نسخهم الخاصة أو تحسينها.
باختصار: Nemotron 3 Nano Omni هو مساعد متعدد الحواس، أسرع وأذكى، يمكنه القراءة والمشاهدة والاستماع في وقت واحد، وهو مصمم للتعامل مع المهام الطويلة والمعقدة دون أن يتعثر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.