OSCAR: Orchestrated Self-verification and Cross-path Refinement
يُعد OSCAR إطار عمل للاستدلال في وقت التشغيل دون الحاجة لتدريب لنماذج اللغة الانتشارية، حيث يعمل على التخفيف من الهلوسة عبر تحديد مواضع الرموز ذات عدم اليقين العالي من خلال تحليل إنتروبيا السلسلة المتقاطعة وتصحيحها عبر إعادة قناع مستهدفة باستخدام أدلة مسترجعة، مما يستفيد من مسار إزالة الضجيج الأصلي للنموذج لتحقيق دقة واقعية فائقة مقارنة بالنهج التوليدي المتسلسل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول حل لغز معقد، ولكن لديك مساعد آلي سريع وذكي للغاية ومتحمس لإنهاء المهمة. المشكلة هي أن هذا الروبوت يتحمس أحياناً، فيخمن أن قطعة ما تناسب مكانها، ثم يثبتها في مكانها ويبني بقية اللغز حول ذلك التخمين الخاطئ. وبحلول الوقت الذي ينتهي فيه، تبدو الصورة كاملة ومثالية، لكنها في الواقع لا معنى لها. هذا هو بالضبط ما يحدث عندما "تهلوس" نماذج الذكاء الاصطناعي (Hallucinate)—حيث تقدم حقائق تبدو صحيحة ولكنها خاطئة بثقة تامة.
تعمل معظم نماذج الذكاء الاصطناعي الحالية (التي تسمى النماذج التكرارية/التتابعية - Autoregressive) مثل صف من قطع الدومينو: بمجرد سقوط القطعة، لا يمكن "إعادة إسقاطها" أو التراجع عنها. إذا سقطت أول قطعة دومينو في الاتجاه الخاطد، فإن السلسلة بأكملها ستكون محكومة بالفشل.
ومع ذلك، فإن نوعاً جديداً من الذكاء الاصطناعي يسمى نموذج لغة الانتشار (Diffusion Language Model - DLM) يعمل بشكل مختلف. بدلاً من صف من الدومينو، تخيل نحاتاً يعمل على كتلة من الرخام. يبدأ النحات بكتلة خشنة وفوضوية، ثم يبدأ ببطء في نحت الزوائد ليكشف عن التمثال. في أي مرحى من مراحل هذه العملية، يمكن للنحات أن ينظر إلى الكتلة من زوايا مختلفة ويرى أن الشكل ليس صحيحاً تماماً بعد. يمكنه العودة لتصحيح جزء معين دون تدمير التمثال بالكامل.
OSCAR هي طريقة جديدة تعلم الروبوت كيفية استخدام "ميزة النحات" هذه للإمساك بأخطائه قبل أن تصبح دائمة.
إليك كيف يعمل OSCAR، مقسماً إلى خطوات بسيطة:
1. استراتيجية "تفكير الجماعة" (السلاسل المتوازية)
تخيل أنك تطلب من الروبوت كتابة قصة. بد instead من طلب كتابتها مرة واحدة فقط، يطلب OSCAR من ثماني نسخ مختلفة من الروبوت كتابة القصة في نفس الوقت.
- اللمسة المميزة: يتم إخبار كل روبوت بالكشف عن القصة بترتيب عشوائي. قد يكتب أحد الروبوتات النهاية أولاً، ثم المنتصف، ثم البداية. وروبوت آخر قد يبدأ بالمنتصف.
- لماذا؟ إذا اتفقت جميع الروبوتات على كلمة معينة (مثل "باريس") بغض النظر عن الترتيب الذي كتبوا به، فمن المرجح أن هذه الكلمة صحيحة. ولكن إذا كتب أحد الروبوتات "باريس" وكتب آخر "لندن" لأن كلاهما سلك مسارات مختلفة، فهذا إنذار خطر. هذا يعني أن الذكاء الاصطناعي غير متأكد من هذه الحقيقة.
2. "مقياس عدم اليقين" (الاعتلاج بين السلاسل - Cross-Chain Entropy)
يعمل OSCAR كحكم يراقب هذه الروبوتات الثمانية. يقوم بحساب "درجة ارتباك" لكل كلمة.
- درجة منخفضة: جميع الروبوتات متفقة. الذكاء الاصطناعي واثق.
- درجة عالية: الروبوتات تتجادل مع بعضها البعض. الذكاء الاصطناعي مرتبك.
هذا هو الجزء السحري: لا يحتاج OSCAR إلى أن يُعلّم كيفية اكتشاف الأكاذيب. هو فقط ينظر إلى الخلاف بين الروبوتات. إذا لم تستطع الروبوتات الاتفاق، فهذه علامة على أن الحقيقة مهتزة. هذه إشارة "أصلية" مدمجة في طريقة عمل هذه النماذج، على عكس الطرق القديمة التي تتطلب معلماً منفصلاً ليتعلم كيف يبدو الكذب.
3. زر "إعادة المحاولة" (إعادة القناع المستهدفة - Targeted Remasking)
بمجرد أن يرصد OSCAR كلمة أو عبارة مربكة (هلوسة)، فإنه لا يرمي القصة بأكملها. سيكون ذلك هدراً.
- بدلاً من ذلك، يضع قناعاً فوق الجزء المربك فقط.
- يقوم بتجميد بقية القصة (الأجزاء التي اتفق الجميع عليها).
- يطلب من الروبوت "إعادة نحت" ذلك القسم المقنع فقط، وهذه المرة باستخدام محرك بحث للعثور على الحقائق الصحيحة (الأدلة المسترجعة) لمساعدته.
- الأمر يشبه قولك للنحات: "لا تلمس الأرجل أو الرأس. فقط أصلح الذراع، وإليك صورة لما تبدو عليه الذراع الحقيقية".
لماذا يعد هذا أمراً هاماً؟
- لا تدريب إضافي: لا تحتاج لقضاء شهور في تعليم الذكاء الاصطناعي كيف يكون صادقاً. أنت فقط تستخدم ارتباكه الداخلي كدليل.
- أفضل من المنافسين: في الاختبارات، وجد OSCAR وأصلح أخطاءً أكثر من الطرق التي تستخدم "كاشفات أكاذيب" معقدة ومُدربة مسبقاً.
- كفاءة عالية: يستغرق تشغيله وقتاً أطول بنسبة 30% تقريباً من عملية التوليد العادية، لكن نتائجه أكثر دقة بكثير.
تشبيه "التبلور" (Crystallization)
اكتشفت الورقة البحثية أيضاً متى تحدث هذه الأخطاء.
- في الأسئلة الواقعية (مثل "من كان أول رئيس؟")، يحدث الخطأ فوراً تقريباً. إنه يشبه إلقاء حجر ثقيل في الماء؛ حيث تنتشر التموجات (الخطأ) على الفور.
- في المهام الإبداعية (مثل تلخيص قصة طويلة)، يتراكم الخطأ ببطء بمرور الوقت.
OSCAR يعرف هذا. يمكنه اكتشاف هذه الأخطاء مبكراً وإصلاحها قبل أن "تتبلور" (تتصلب) وتصبح كذبة واثقة ودائمة.
الملخص
OSCAR هو بمثابة فريق مراقبة جودة للذكاء الاصطناعي. بدلاً من انتظار انتهاء الذكاء الاصطناعي من مهمته ثم التحقق مما إذا كان صحيحاً، يراقب OSCAR عمل الذكاء الاصطناعي في الوقت الفعلي. إذا بدأ الذكاء الاصطناعي في التذبذب أو الاختلاف مع نفسه، يقوم OSCAR بلطف بتوجيهه نحو المسار الصحيح باستخدام حقائق من العالم الحقيقي، مما يضمن أن تكون المخرجات النهائية إبداعية وصادقة في آن واحد.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.