← أحدث الأبحاث
💻 computer science

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

إن Granulon هو نموذج لغوي كبير متعدد الوسائط ومبتكر يستفيد من مشفر بصري قائم على DINOv3 معزز بمتحكم في الدقة مشروط بالنص وتجميع رموز تكيفي لتوحيد الإدراك على مستوى البكسل مع الدلالات خشنة الحبيبات ديناميكيًا، مما يحسن الدقة بشكل كبير ويقلل من الهلوسة مقارنة بالنهج الحالية.

المؤلفون الأصليون: Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

نُشر 2026-03-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول وصف لوحة معقدة لصديق عبر الهاتف.

  • الطريقة القديمة (CLIP): يمتلك صديقك كاميرا تلتقط فقط صورة واحدة ضخمة وضبابية للوحة بأكملها. يمكنه أن يخبرك، "إنها منظر طبيعي فيه منزل"، ولكن إذا سألته، "ما لون الباب؟" أو "كم عدد النوافذ الموجودة على السطح؟"، فسيتعين عليه التخمين لأن التفاصيل قد فُقدت في الضبابية.
  • الطريقة الأخرى (DINOv3): يمتلك صديقك مجهراً فائق الدقة. يمكنه رؤية كل ضربة فرشاة وملمس الخشب. ولكن إذا سألته، "هل هذا منزل أم حظيرة؟" فسيصاب بالارتباك لأنه كان مركزاً جداً على التفاصيل الصغيرة لدرجة أنه فاتته الصورة الكبيرة.

جرانولون (Granulon) هو مساعد ذكي جديد يحل هذه المشكلة. إنه يجمع بين أفضل ما في العالمين من خلال العمل كـ كاميرا حرباء يمكنها تغيير مستوى التكبير فوراً بناءً على ما تسأل عنه.

إليك تفصيل بسيط لكيفية عمله:

1. المشكلة: معضلة "التكبير" (Zoom)

النماذج الحالية عالقة في روتين واحد.

  • بعض النماذج بارعة في فهم الصورة الكبيرة (الدلالات الشاملة) لكنها سيئة جداً في رصد التفاصيل الصغيرة.
  • نماذج أخرى مذهلة في رؤية التفاصيل الدقيقة (على مستوى البيكسل) لكنها تكافح لفهم القصة العامة أو السياق.
  • محاولة استخدام كلا النوعين من الكاميرات في وقت واحد أمر بطيء ومكلف، مثل استئجار مصورين اثنين لالتقاط نفس الصورة.

2. الحل: كاميرا "جرانولون" (Granulon)

قام الباحثون ببناء ذكاء اصطناعي جديد يسمى جرانولون. بدلاً من إجبار الذكاء الاصطناعي على الاختيار بين "الرؤية من بعيد" أو "الرؤية عن قرب"، يمتلك جرانولون جهاز تحكم عن بعد ذكي يغير مستوى التكبير فوراً، اعتماداً على سؤالك.

الجزءان السحريان:

أ. "محقق الأسئلة" (المتحكم - The Controller)
فكر في هذا كمساعد ذكي يستمع إلى سؤالك أولاً.

  • إذا سألت، "ما نوع الحيوان الموجود في الصورة؟" (سؤال عن الصورة الكبيرة)، يخبر المحقق الكاميرا بأن تتراجع للخلف (Zoom out) لرؤية المشهد بأكمله.
  • إذا سألت، "ما لون أذن الكلب؟" (سؤال عن تفصيل دقيق)، يخبر المحقق الكاميرا أن تتكبر (Zoom in) بدقة لرؤية ملمس الفراء.
  • إنه يقرر "مستوى التفاصيل" المثالي قبل أن يبدأ الذكاء الاصطناعي في النظر حتى.

ب. "الملخص الذكي" (AdaTA)
بمجرد أن تقوم الكاميرا بالتكبير إلى المستوى الصحيح، يقوم هذا الجزء بتنقية المعلومات.

  • تخيل أنك تنظر إلى غابة. إذا ابتعدت، فأنت لا تحتاج لرؤية كل ورقة شجر؛ تحتاج فقط لرؤية "الشجرة". إذا اقتربت، فأنت بحاجة لرؤية "الورقة".
  • يقوم الملخص الذكي بتجميع البيكسلات المتشابهة في "رموز" (Tokens) مرتبة ومدمجة (قطع صغيرة من المعلومات). إنه يتخلص من الضجيج ويحتفظ فقط بالتفاصيل الأكثر أهمية، مما يضمن عدم شعور الذكاء الاصطناعي بالإرهاق بسبب كثرة البيانات.

3. لماذا هذا مهم: تقليل "الهلوسة"

أحد أكبر المشاكل في الذكاء الاصطناعي اليوم هو الهلوسة — أي اختلاق أشياء غير موجودة.

  • إذا كان الذكاء الاصطناعي يركز كثيراً على "الصورة الكبيرة"، فقد يخمن، "هناك قطة على السطح"، لمجرد أنه يرى شكلاً يشبه القطة.
  • إذا كان يركز كثيراً على التفاصيل، فقد يضيع في التفاصيل الصغيرة وينسى السياق العام.

جرانولون يعالج هذا من خلال مطابقة مستوى التفاصيل مع السؤال. ولأنه يرى القدر الصحيح من التفاصيل، فمن غير المرجح أن يختلق إجابات. تظهر الورقة البحثية أنه يقلل من هذه الإجابات "المختلقة" بنسبة تقارب 20% ويعطي الإجابة الصحيحة بنسبة تزيد عن 30% أكثر من النماذج السابقة.

التشبيه: المحقق والعدسة المكبرة

تخيل محققاً يحل جريمة.

  • الذكاء الاصطناعي القديم: المحقق إما ينظر إلى مسرح الجريمة من مروحية (فيفقد الأدلة الموجودة على الأرض) أو ينظر عبر مجهر إلى ذرة غبار واحدة (فيفقد الغرفة بأكملها).
  • جرانولون: لدى المحقق عدسة مكبرة سحرية.
    • عندما يحتاج المحقق لمعرفة من كان في الغرفة، تبتعد العدسة لتظهر الغرفة بأكملها.
    • عندما يحتاج لمعرفة ماذا كُتب على ملاحظة، تكبر العدسة لقراءة خط اليد.
    • ينتقل المحقق بين هذه الرؤى فوراً، بناءً على الدليل المحدد الذي يبحث عنه.

الخلاصة

يعلم جرانولون الذكاء الاصطناعي أن يكون مرناً. إنه يتوقف عن إجبار الكمبيوتر على أن يكون إما "مفكراً في الصورة الكبيرة" أو "عاملاً دقيق التفاصيل". بدلاً من ذلك، يجعله يكون كلاهما، حيث ينتقل بينهما فوراً ليعطيك الإجابة الأكثر دقة وصدقاً وتفصيلاً ممكنة. إنه يشبه إعطاء الذكاء الاصطناعي نظارات تعدل مقاس نظرها تلقائياً حسب ما تنظر إليه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →