← أحدث الأبحاث
💬 NLP

Qwen3.5-Omni Technical Report

يُعد Qwen3.5-Omni نموذجاً متعدد الوسائط فائق القدرة، يتكون من مئات المليارات من المعلمات، ويتميز ببنية خلط الخبراء ذات الانتباه الهجين وآلية محاذاة ARIA، والتي تحقق أداءً متفوقاً في الفهم السمعي البصري متعدد اللغات، والاستدلال طويل السياق، وقدرات "برمجة الأجواء السمعية البصرية" الناشئة.

المؤلفون الأصليون: Qwen Team

نُشر 2026-04-20
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Qwen Team

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تعرف على Qwen3.5-Omni: الذكاء الاصطناعي "الأكثر استماعاً" على الإطلاق

تخيل ذكاءً اصطناعياً لا يكتفي فقط بقراءة نصوصك أو النظر إلى صورك، بل يمكنه سماعك، ومشاهدتك، وفهم سياق فيلم كامل، والتحدث إليك بالنبرة واللكنة والعاطفة المثالية. هذا هو Qwen3.5-Omni.

فكر في نماذج الذكاء الاصطناعي السابقة كأمين مكتبة ذكي جداً يمكنه قراءة الكتب (النصوص) والنظر إلى الصور، ولكن إذا همست له بسؤال، فلن يسمعك، وإذا طلبت منه وصف فيديو، فسيقوم بالتخمين بناءً على العنوان فقط.

Qwen3.5-Omni مختلف. إنه يشبه مساعداً بشرياً فائق الذكاء ومتعدد المواهب، يمكنه الجلوس معك في غرفة، ومشاهدة فيديو مدته 400 ثانية، والاستماع إلى بودكاست مدته 10 ساعات، وفهم النكات، والضوضاء في الخلفية، ومشاعر المتحدث، ثم الرد عليك فوراً — إما عن طريق الكتابة أو التحدث بصوت يبدو تماماً كشخص حقيقي.

إليك تفصيل لما يجعل هذا النموذج مميزاً، باستخدام بعض التشبيهات من الحياة اليومية:

1. فريق "العقل والفم" (المفكر والمتحدث)

بُني النموذج على نظام مكون من جزأين: المفكر (Thinker) والمتحدث (Talker).

  • المفكر هو العقل. يشاهد الفيديو، ويستمع إلى الصوت، ويقرأ النص، ويحدد ماذا يجب أن يقول. إنه مثل المخرج في استوديو الأفلام الذي يحلل السيناريو والمشهد.
  • المتحدث هو الممثل الصوتي. يأخذ تعليمات المخرج ويقوم بتوليد الكلام الفعلي فوراً.
  • السحر: في النماذج القديمة، كان المخرج يكتب ملاحظة، ثم يسلمها للممثل الصوتي، الذي يقوم بعد ذلك بالتحدث. كان هناك تأخير. في Qwen3.5-Omni، يتحدث المخرج والممثل الصوتي مع بعضهما البعض في الوقت الفعلي. بمجرد أن تتبلور فكرة لدى المخرج، يبدأ الممثل الصوتي في الكلام، مما يخلق محادثة سلسة ومنخفضة التأخير.

2. "الذاكرة فائقة الطول" (256k سياق)

تخيل أنك تحاول تذكر كل تفاصيل كتاب صوتي مدته 10 ساعات أو فيلم مدته 400 ثانية دون تدوين ملاحظات. معظم أنظمة الذكاء الاصطناعي ستنسى البداية بحلول الوقت الذي تصل فيه إلى المنتصف.

  • يمتلك Qwen3.5-Omni "نافذة سياق" تبلغ 256 ألف (256k). فكر في هذا كذاكرة يمكنها استيعاب النص الكامل لبودكاست مدته 10 ساعات أو فيلم طويل في رأسها دفعة واحدة.
  • لماذا هذا مهم؟ يمكنك أن تسأل: "ما اسم الشخصية التي ظهرت في أول 5 دقائق من هذا الفيديو؟" وسيتذكر ذلك بدقة، حتى لو كان الفيديو مدته ساعة كاملة.

3. تقنية "التزامن المثالي" (ARIA)

أحد أصعب الأمور على الذكاء الاصطناعي هو التحدث بشكل طبيعي. أحياناً يتحدثون بسرعة كبيرة، أو يتخطون كلمات، أو يبدون آليين لأن "عقل النص" و"فم الكلام" لديهم ليسوا على نفس الصفحة.

  • يقدم البحث تقنية جديدة تسمى ARIA (المحاذاة التكيفية للسرعة والتقاطع).
  • التشبيه: تخيل عازف طبول (النص) ومغني (الكلام) يحاولان العزف معاً. إذا سرّع عازف الطبول بينما ظل المغني بطيئاً، سيبدو الإيقاع فوضوياً. تعمل ARIA كقائد أوركسترا يضبط الإيقاع باستمرار، مما يضمن تطابق الكلمات والأصوات تماماً، بغض النظر عن مدى سرعة أو بطء المحادثة. وهذا يجعل الذكاء الاصطناعي يبدو طبيعياً للغاية، مع الفواصل الزمنية والعواطف الصحيحة.

4. "الصوت الحرباء" (استنساخ الصوت من محاولة واحدة)

لا تحتاج إلى تسجيل ساعات من صوتك لجعل الذكاء الاصطناعي يبدو مثلك.

  • السحر: يمكنك إعطاء الذكاء الاصطناعي مقطعاً مدته 10 ثوانٍ من صوتك (أو صوت صديقك)، ويمكنه فوراً تقليد ذلك الصوت بشكل مثالي.
  • التشبيه: إنه مثل ممثل بارع يمكنه الاستماع إلى تسجيل قصير لمشهور والبدء فوراً في أداء مونولوج بنفس ذلك الصوت والنبرة واللكنة. يعمل هذا في أكثر من 29 لغة وحتى لهجات مختلفة (مثل الانتقال من لغة ماندارين بكين إلى لهجة سيشوان).

5. "مبرمج الأجواء" (البرمجة عبر الرؤية والصوت)

هذه قوة خارقة جديدة أطلق عليها البحث اسم "البرمجة عبر الرؤية والصوت" (Audio-Visual Vibe Coding).

  • السيناريو: تخيل أنك تشاهد فيديو لغرفة فوضوية. تقول للذكاء الاصطناعي: "مهلاً، اكتب لي سكربت بايثون لتنظيم هذه الملفات بناءً على الفيديو الذي أعرضه لك".
  • النتيجة: يشاهد الذكاء الاصطناعي الفيديو، ويسمع تعليماتك، ويفهم الفوضى البصرية، ثم يكتب الكود لإصلاح الأمر. هو لا يتحدث عن الفيديو فحسب؛ بل يستخدم الفيديو للقيام بأشياء. إنه يشبه امتلاك روبوت يمكنه مراقبتك أثناء العمل ثم كتابة البرمجيات لأتمتة تلك المهمة.

6. "المترجم العالمي"

يفهم النموذج ويتحدث 113 لغة ولهجة للاستماع، ويمكنه التحدث بـ 36 لغة (بالإضافة إلى العديد من اللهجات) بطلاقة.

  • التشبيه: إنه مثل مترجم في الأمم المتحدة عاش في كل بلد على وجه الأرض. سواء كنت تتحدث الإنجليزية، أو الإسبانية، أو لهجة صينية محددة مثل "هوكن"، فإنه سيفهمك ويرد عليك بلغتك الأم مع مراعاة الفروق الثقافية الصحيحة.

لماذا يهم هذا؟

قبل هذا، إذا أردت من ذكاء اصطناعي أن يشاهد فيديو، ويستمع إلى أغنية، ويتحدث معك عنها، كنت بحاجة إلى ثلاث أدوات مختلفة ملتصقة ببعضها البعض. كانت تلك الأدوات بطيئة، وغير متناسقة، وغالباً ما يساء فهم بعضها البعض.

Qwen3.5-Omni هو أول نموذج يقوم بكل هذا بشكل أصيل (Natively) في عملية واحدة. إنه ليس مجرد روبوت دردشة؛ بل هو رفيق متعدد الحواس يعمل في الوقت الفعلي يمكنه:

  • مشاهدة فيلم وشرح الحبكة بينما تشاهده.
  • الاستماع إلى محاضرة مدتها 10 ساعات وتلخيص النقاط الرئيسية.
  • تغيير صوته ليبدو كآلة، أو طفل، أو جدتك.
  • كتابة الكود بناءً على ما يراه على شاشتك.

باختصار، Qwen3.5-Omni هو أقرب ما وصلنا إليه من ذكاء اصطناعي يتفاعل مع العالم كما يفعل البشر: بالرؤية، والسمع، والتفكير، والتحدث، كل ذلك في آن واحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →