← أحدث الأبحاث
💬 NLP

OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs

يُعد OmniTrace إطار عمل خفيف الوزن ومستقل عن النماذج يعالج تحدي عزو العبارات المولدة في النماذج اللغوية الكبيرة متعددة الوسائط من خلال صياغة العزو كمسألة تتبع أثناء التوليد، مما يتيح تفسيرات متماسكة على مستوى النطاق عبر الوسائط دون الحاجة إلى إعادة تدريب أو إشراف.

المؤلفون الأصليون: Qianqi Yan, Yichen Guo, Ching-Chen Kuo, Shan Jiang, Hang Yin, Yang Zhao, Xin Eric Wang

نُشر 2026-04-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Qianqi Yan, Yichen Guo, Ching-Chen Kuo, Shan Jiang, Hang Yin, Yang Zhao, Xin Eric Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق تحاول حل لغز، ولكن بدلاً من مجرد النظر إلى مسرح جريمة، أنت تشاهد فيلماً حياً يتكشف أمامك حيث يقوم المحقق (الذكاء الاصطناعي) بكتابة السيناريو نفسه أثناء عرض الفيلم.

هذا الفيلم لديه أربع كاميرات تعمل في وقت واحد:

  1. النص (نسخة لما يقوله الناس).
  2. الصور (صور للمشهد).
  3. الصوت (أصوات الأحاديث والضوضاء في الخلفية).
  4. الفيديو (الصورة المتحركة للأحداث).

يشاهد الذكاء الاصطناعي هذه الكاميرات الأربع ويبدأ في كتابة قصة. ولكن هنا تكمن المشكلة: كيف نعرف أي جزء من القصة جاء من أي كاميرا؟

إذا كتب الذكاء الاصطناعي: "المشتبه به يرتدي قبعة حمراء"، فهل رأى القبعة الحمراء في الصورة؟ أم سمع شخصاً يذكرها في الصوت؟ أم أنه اختلق الأمر من خياله؟

المشكلة: المحقق "الصندوق الأسود"

حتى الآن، كانت معظم أدوات الذك الذاء الاصطناعي التي تحاول الإجابة على هذا السؤال مثل المحققين القدامى الذين يعملون فقط على مسارح جريمة ثابتة (مثل صورة واحدة أو تقرير مكتوب). لقد كانوا بارعين في قول: "هذه الكلمة في التقر al جاءت من هذا الدليل".

لكن الذكاء الاصطناعي الحديث (المسمى بالنماذج اللغوية الكبيرة متعددة الوسائط - Omni-Modal LLMs) مختلف. إنه راوٍ حي ومُرتجل. ليس لديه سيناريو ثابت؛ بل يكتب كلمة تلو الأخرى بينما يشاهد الفيلم. لم تستطع الأدوات القديمة مواكبة ذلك لأنها كانت تحاول النظر إلى القصة بأكملها بعد انتهائها، بدلاً من تتبع الأدلة أثناء كتابة القصة. لقد كانوا مثل من يحاول معرفة من كتب جملة في كتاب من خلال النظر إلى الحبر بعد طباعة الكتاب، دون معرفة من كان يمسك بالقلم في تلك اللحظة تحديداً.

الحل: OmniTrace (متتبع "السلك الحي")

تقدم الورقة البحثية OmniTrace، وهو إطار عمل جديد يعمل مثل جهاز تنصت عالي التقنية ولحظي لعقل الذكاء الاصطناعي.

إليك كيف يعمل، باستخدام تشبيه بسيط:

1. "السلك الحي" (التتبع أثناء التوليد)

تخيل أن الذكاء الاصطناعي طاهٍ يطهو وجبة معقدة (الإجابة) بينما ينظر إلى أربعة كتب وصفات مختلفة (المدخلات: النص، الصورة، الصوت، الفيديو).

  • الطريقة القديمة: تنتظر حتى تُقدم الوجبة، ثم تسأل الطاهي: "أي كتاب استخدمت لتحضير هذا الطبق؟" قد يخمن الطاهي، أو قد تكون الإجابة غامضة لأن عملية الطهي قد انتهت.
  • طريقة OmniTrace: يقوم OmniTrace بتثبيت مستشعر صغير على يد الطاهي أثناء الطهي. في كل مرة يلتقط فيها الطاهي توابل (كلمة)، يتحقق المستشعر فوراً: "هل حصلت على هذه التوابل من كتاب الصور، أم كتاب الصوات، أم كتاب النص؟"

إنه لا ينتظر حتى النهاية. إنه يتتبع المصدر كلمة بكلمة أثناء تفكير الذكاء الاصطناعي.

2. "مرشح الضجيج" (تجميع الإشارات)

أحياناً، تصبح المستشعرات مضطربة قليلاً. ربما يلقي الذكاء الاصطناعي نظرة خاطفة على صورة كلب بينما يتحدث عن قطة، فيصاب المستشعر بالارتباك.

  • OmniTrace ذكي بما يكفي لإدراك: "مهلاً، تلك الصورة للكلب كانت مجرد نظرة خاطفة لأجزاء من الثانية. السبب الحقيقي لتحدثنا عن القطة هو هذا المقطع الصوتي الذي استمر 5 ثوانٍ".
  • يقوم بتجميع هذه النظرات الصغيرة والمضطربة في كتل ذات معنى. بدلاً من القول: "نظر الذكاء الاصطناعي إلى الصورة 1 لمدة 0.1 ثانية"، يقول: "استخدم الذكاء الاصطناعي الصورة 1 لشرح الجملة الكاملة عن القطة".

3. "المترجم العالمي" (المستقل عن النموذج)

الجزء الأفضل؟ OmniTrace لا يهتم بكيفية تفكير الذكاء الاصطناعي. إنه يعمل مثل محول عالمي. سواء كان الذكاء الاصطناعي يستخدم "الانتباه" (التركيز بدقة على الأشياء) أو "التدرجات" (قياس مدى تأثير التغيير في النتيجة)، يمكن لـ OmniTrace الاتصال بأي من هذه الإشارات وترجمتها إلى إجابة واضحة للبشر.

لماذا هذا مهم؟

فكر في الأمر كأنه مدقق حقائق للمستقبل.

  • الثقة: إذا أخبرك الذكاء الاصطناعي: "هذا الدواء يعالج المرض"، يمكن لـ OmniTrace أن يشير إلى الدراسة الطبية المحددة (النص) أو فيديو التجارب السريرية (الفيديو) الذي استخدمه الذكاء الاصطناعي لتقديم هذا الادعاء.
  • تصحيح الأخطاء: إذا أخطأ الذكاء الاصطناعي، يمكنك رؤية أين حدث الارتباك بالضبط. "أوه، لقد تجاهل دليل الصوت وركز فقط على الصورة الضبابية".
  • الشفافية: إنه يمنع الذكاء الاصطناعي من "الهلوسة" (اختلاق أشياء) دون علمنا. فهو يجبر الذكاء الاصطناعي على إظهار خطوات عمله، تماماً كما يظهر الطالب خطواته الرياضية في الاختبار.

الخلاصة

OmniTrace هو أداة تحول "سحر" الذكاء الاصطناعي إلى عملية شفافة. إنه يأخذ التدفق الفوضوي والسريع لذكاء اصطناعي يشاهد فيلماً ويكتب قصة، ويرسم خطاً واضحاً من كل جملة وصولاً إلى اللحظة الدقيقة في الفيلم التي ألهمته. إنه يضمن أنه عندما يتحدث الذكاء الاصطناعي، فإننا نعرف بالضبط أي جزء من العالم يستمع إليه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →