ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence
تقدم الورقة البحثية "ScientistOne"، وهو نظام بحثي ذاتي التشغيل مبني على إطار عمل "سلسلة الأدلة" (Chain-of-Evidence) الذي يضمن القابلية للتحقق من خلال البناء، مما يلغي الاستشهادات المهلوسة ويحقق درجة تحقق مثالية ومواءمة فائقة بين المنهجية والبرمجية، مع مضاهاة أو تجاوز أداء الخبراء البشريين عبر مهام بحثية رائدة متنوعة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً يمكنك فيه استئجار روبوت عالم ليقوم بواجباتك المدرسية، ويكتب ورقتك البحثية، بل وحتى ينشرها. ستتوقع أن يكون الروبوت ذكياً، أليس كذلك؟ ولكن ماذا لو كان الروبوت حكواتياً بارعاً يؤلف حقائق، ويخترع مصادر وهمية، ويكتب قصة جميلة لا تتطابق مع الواقع الفوضوي لتجاربه؟
هذه هي المشكلة التي يسعى ScientistOne إلى حلها.
المشكلة: العالم "مزيف الأخبار"
يوضح البحث أن وكلاء أبحاث الذكاء الاصطناعي الحاليين أصبحوا جيدين جداً في أمرين:
- القيام بالعمل: يمكنهم كتابة الأكواد البرمجية وإجراء التجارب.
- كتابة القصة: يمكنهم إنتاج أوراق بحثية تبدو احترافية وتدعو للإقناع.
ومع ذلك، هناك فجوة خطيرة بين القصة والحقيقة. يطلق البحث على هذا الأمر اسم "فشل التحقق" (verifiability failure).
فكر في الأمر كأنه ساحر يخرج أرنباً من قبعة.
- الطريقة القديمة: يقول الساحر (الذكاء الاصطناعي): "انظر، أرنب!" فترى أرنباً وتصدقه. لكنك لا تعرف ما إذا كان الأرنب موجوداً بالفعل، أم أنه كان مجرد إكسسوار مزيف، أم أن الساحر سحبه فقط من جيبه.
- الواقع: في 75 ورقة بحثية اختبرها الباحثون، ارتكبت كل الأنظمة الذكية تقريباً أخطاءً. بعضها اخترع استشهادات (كتب وهمية لا وجود لها). وبعضها سجل نتائج يستحيل إعادة إنتاجها. وبعضها وصف آلة معقدة في الورقة، بينما كان الكود الذي قدمته في الواقع مجرد لعبة بسيطة ومعطلة.
وجد البحث أن ما يصل إلى 21% من المراجع في بعض أوراق الذكاء الاصطناعي كانت مختلقة تماماً. الأمر يشبه طالباً يكتب مقالاً تاريخياً ويستشهد بكتاب لم يُكتب أبداً.
الحل: "سلسلة الأدلة"
لإصلاح ذلك، ابتكر الباحثون قاعدة جديدة تسمى سلسلة الأدلة (Chain-of-Evidence - CoE).
تخيل أنك تبني منزلاً.
- بدون CoE: تقوم فقط بطلاء الجدران ووضع لافتة "للبيع". يبدو المنظر جميلاً، لكن الأساس قد يكون من الكرتون.
- مع CoE: يجب أن يكون لكل طوبة في الجدار إيصال. يجب أن يكون لكل عارضة علامة توضح مصدرها بدقة. إذا ادعيت أن المنزل "مقاوم للزلازل"، يجب أن تظهر التقرير الهندسي الذي يثبت ذلك.
ScientistOne هو نظام ذكاء اصطناعي جديد بُني من الصفر لاتباع هذه القواعد. فهو لا يكتفي بكتابة ورقة بحثية فحسب، بل يبني سلسلة إثبات لكل جملة يكتبها.
كيف يعمل ScientistOne (العملية المكونة من ثلاث خطوات)
المحقق (محقق المشكلات):
قبل كتابة أي شيء، يذهب هذا الجزء من الروبوت إلى المكتبة (قواعد البيانات العلمية) ويقرأ 100 كتاب حقيقي. هو لا يخمن الكتب الموجودة؛ بل يقوم بتحميل ملفات الـ PDF الفعلية. إنه يبني خريطة من الحقائق الحقيقية. إذا لم يجد مصدراً، فلا يستخدمه. هذا يوقف مشكلة "الكتاب الوهمي".المستكشف (محرك الاكتشاف):
يحاول هذا الجزء حل المسألة الرياضية أو العلمية. يقوم بإجراء التجارب ويحتفظ بسجل صارم لكل رقم يحصل عليه. إنه مثل عالم يحتفظ بدفتر ملاحظات مختبري حيث يرتبط كل رقم بتشغيل تجربة محددة.المحرر (كاتب الورقة ومتحقق الادعاءات):
هذا هو الجزء الأهم. عندما يكتب الروبوت الورقة، فإنه لا يكتفي بكتابة الكلمات، بل يكتب جملة ويرفق بها "وسماً" فوراً.
- الجملة: "طريقتنا أسرع بنسبة 50%."
- الوسم: [رابط إلى دفتر المختبر، الصفحة 4، السطر 12].
قبل انتهاء الورقة، يقوم متحقق الادعاءات (Claim Verifier) بفحص كل وسم. يسأل: "هل هذا الرقم موجود فعلياً في الدفتر؟ هل هذا الكتاب حقيقي؟" إذا كانت الإجابة "لا"، يتم حذف الجملة أو تصحيحها. إنه مثل محرر صارم يرفض نشر قصة ما لم تكن كل حقيقة مدعومة بإيصال.
النتائج: من الذي اجتاز الاختبار؟
اختبر الباحثون ScientistOne مقابل خمسة أنظمة أبحاث ذكاء اصطناعي أخرى باستخدام "تدقيق النزاهة". لقد فحصوا أربعة أشياء:
- هل تطابقت النتائج؟ (هل قالت الورقة 90% بينما حصل الكود فعلياً على 90%؟)
- هل غشوا؟ (هل حاول الكود الخداع؟)
- هل المراجع حقيقية؟ (هل الكتب موجودة؟)
- هل يتطابق الكود مع القصة؟ (هل وصفوا سيارة فيراري بينما قدموا دراجة هوائية؟)
النتائج:
- الأنظمة الأخرى: فشلت جميعها في اختبار واحد على الأقل. بعضها قدم مراجع وهمية. وبعضها قدم نتائج غير متطابقة. وبعضها وصف خوارزميات غير موجودة في الكود الخاص بها.
- ScientistOne: كان النظام الوحيد الذي اجتاز كل الاختبارات.
- 0 مراجع وهمية (من أصل 337).
- دقة نتائج بنسبة 100% (كل رقم تطابق).
- تطابق كود بنسبة 93% (القصة تطابقت مع الكود).
ما وراء الاختبار
اختبر الباحثون أيضاً ScientistOne في ست مهام صعبة أخرى، مثل التصوير الطبي واكتشاف الأجسام ثلاثية الأبعاد. في هذه الاختبارات، لم يكتفِ ScientistOne باجتياز فحص النزاهة فحسب، بل فاز أيضاً. لقد حصل على "ميداليات ذهبية" في مسابقات فشلت فيها أنظمة الذكاء الاصطنا الأخرى تماماً أو أنتجت نتائج غير صالحة.
الخلاية المستفادة
يخلص البحث إلى أن الثقة هي ميزة معمارية. لا يمكنك مجرد إضافة "فحص ثقة" في نهاية العملية؛ بل يجب بناء النظام بحيث لا يمكنه الكذب دون كسر سلسلة أدلته الخاصة.
يثبت ScientistOne أن الذكاء الاصطناعي يمكن أن يكون باحثاً عالي الأداء وباحثاً صادقاً في آن واحد، ولكن فقط إذا تم تصميمه ليحتفظ بإيصال لكل ادعاء يقدمه. إنه الفرق بين الساحر الذي يخدعك والعالم الذي يريك الرياضيات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.