← أحدث الأبحاث
🤖 AI

Tool Receipts, Not Zero-Knowledge Proofs: Practical Hallucination Detection for AI Agents

إن NabaOS هو إطار عمل خفيف الوزن للتحقق في الوقت الفعلي مستوحى من نظرية المعرفة الهندية، يقوم بالكشف عن هلوسات الوكلاء الاصطناعيين عبر تصنيف الادعاءات وفق مصادر معرفية ومطابقتها مع إيصالات الأدوات الموقعة بـ HMAC، محققاً دقة عالية في الكشف مع حد أدنى من زمن الاستجابة مقارنة بطرق الإثبات التشفيري غير العملية.

المؤلفون الأصليون: Abhinaba Basu

نُشر 2026-03-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Abhinaba Basu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً شخصياً ذكياً للغاية وعالي الكفاءة يُدعى نابا (Naba). يستطيع نابا التحقق من رسائل البريد الإلكتروني الخاصة بك، والبحث عن أسعار الأسهم، وحجز الرحلات الجوية. ولكن مثل أي مساعد قرأ الكثير من الكتب وشاهد الكثير من الأفلام، قد يندفع نابا أحياناً.

أحياناً يقول نابا: "لقد تحققت من بريدك الإلكتروني ووجدت 5 رسائل من أليس"، بينما في الواقع، لم يرجع خادم البريد الإلكتروني سوى 3 رسائل فقط. وفي أحيان أخرى، قد يقول نابا: "لقد اتصلت بالبنك"، بينما هو في الحقيقة اخترع رقماً فقط ليبدو مفيداً. يُسمى هذا "الهلوسة" (Hallucination)، وهي مشكلة كبيرة لأنك قد تتخذ قرارات مالية بناءً على أكاذيب.

تقدم هذه الورقة نظام NabaOS، وهو نظام جديد مصمم للإمساك بـ "أكاذيب" نابا دون إبطاء العمل.

إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: لماذا لا تنجح "البراهين السحرية"؟

حاول العلماء حل هذه المشكلة باستخدام ما يسمى "براهين المعرفة الصفرية" (Zero-Knowledge Proofs) (فكر فيها كأنها "إيصالات سحرية رياضية"). هذه البراهين تشبه الختم التشفيري فائق التعقيد الذي يثبت أن الكمبيوتر أجرى العملية الحسابية بشكل صحيح.

  • العيب: إن إنشاء هذه الأختام السحرية يستغرق دقائق أو حتى ساعات. إذا سألت نابا: "ما هي حالة الطقس؟" واضطررت للانتظار 10 دقائق لانتظار "السحر الرياضي" ليثبت أن الإجابة حقيقية، فلن تستخدم المساعد أبداً. إنه بطيء جداً ويتطلب أجهزة كمبيوتر خارقة ومكلفة.

2. الحل: نظام "الإيصال الرقمي"

بدلاً من السحر الرياضي الثقيل، يستخدم NabaOS نظاماً مستوحى من الفلسفة الهندية القديمة (تحديداً مدرسة النيايا - Nyaya المنطقية)، والتي تصنف المعرفة بناءً على مصدرها.

تخيل NabaOS كـ مدير مطعم لا يثق بالطاهي (الذكاء الاصطائي) ثقة عمياء، بل يقوم المدير بالتحقق من إيصالات المطبخ.

  • كيف يعمل:
    1. عندما يريد نابا التحقق من بريدك الإلكتروني، فإنه يطلب من "المطبخ" (الأداة) القيام بذلك.
    2. يقوم المطبخ بالعمل ويطبع فوراً إيصالاً موقعاً. يقول هذا الإيصال: "لقد تحققت من البريد الإلكتروني. وجدت 3 رسائل. إليك رمز سري يثبت أنني فعلت ذلك."
    3. يقوم نابا بعد ذلك بكتابة تقرير لك.
    4. السحر: قبل أن يعرض عليك التقرير، يقوم NabaOS بسرعة بالتحقق من الإيصال.
      • إذا قال نابا "وجدت 5 رسائل إلكترونية"، بينما يقول الإيصال "3"، فإن النظام يصنفه فوراً ككذبة.
      • إذا قال نابا "لقد تحققت من البنك"، ولكن لا يوجد إيصال لمكالمة بنكية، فإن النظام يعرف أن نابا قد اخترع الأمر.

هذا التحقق يستغرق أقل من 15 مللي ثانية (أسرع من طرفة العين)، لذا لن تضطر للانتظار.

### 3. "ملصقات الثقة" (ليست مجرد نعم/لا)

معظم الأنظمة الأمنية تعطيك ختم "آمن" أو "غير آمن". لكن NabaOS أكثر ذكاءً؛ فهو يمنحك ملصق ثقة بناءً على كيفية معرفة نابا للمعلومة، باستخدام خمس فئات:

  1. الرؤية المباشرة (Pratyakṣa): "رأيت 3 رسائل إلكترونية."
    • الملصق: تم التحقق بالكامل. (الإيصال يثبت ذلك).
  2. التخمين الذكي (Anumāna): "يبدو أن أليس قلقة لأن رسائلها قصيرة."
    • الملصق: تم التحقق غالباً. (الرسائل موجودة بالفعل، لكن "القلق" هو تفسير نابا وليس حقيقة).
  3. النقل عن الغير (Śabda): "رويترز تقول إن أسعار الفائدة في ارتفاع."
    • الملصق: مصدر تم التحقق منه. (لقد تحققنا من أن نابا زار موقع رويترز بالفعل).
  4. عدم وجود شيء (Abhāva): "لا توجد رسائل من بوب."
    • الملصق: غياب تم التحقق منه. (الإيصال يثبت أن عملية البحث لم تسفر عن نتائج).
  5. الرأي المجرد (غير مستند إلى أساس): "أعتقد أن بوب شخص لطيف."
    • الملصق: غير متحقق منه. (لم تُستخدم أي أداة؛ هذا مجرد رأي لنابا).

لماذا هذا مهم: إذا رأيت "تم التحقق غالباً"، فأنت تعلم أن الحقائق صحيحة، لكن الاستنتاج هو مجرد تخمين من نابا. يمكنك حينها أن تقرر مدى الثقة في ذلك التخمين.

4. "الفحص العميق"

أحياناً يكون نابا "وكيلاً مستقلاً" يقوم بمهام معقدة عبر الإنترنت (مثل حجز رحلة). في هذه الحالات، يقوم NabaOS بإجراء فحص عشوائي.

  • إذا قال نابا: "وجدت رحلة طيران على هذا الموقع"، سيقوم NabaOS بزيارة ذلك الموقع بشكل مستقل ليرى ما إذا كانت الرحلة موجودة بالفعل.
  • إذا كان الموقع وهمياً أو الرحلة قد انتهت، سيكتشف NabaOS الكذبة.

5. النتائج

اختبر الباحثون هذا النظام في 1,800 سيناريو مختلف (شملت رسائل البريد الإلكتروني، والأسهم، والأخبار بأربع لغات مختلفة).

  • معدل النجاح: نجح في كشف 91% من الأكاذيب.
  • السرعة: لم يضف أي تأخير يُذكر (أقل من طرفة عين).
  • الدقة: عندما يقول النظام إن ادعاءً ما "تم التحقق بالكامل"، فإنه يكون صحيحاً بنسبة 98.7%.

الخلاصة الكبرى

تحاول أنظمة سلامة الذكاء الاصطنا الحالي إثبات أن الكمبيوتر عمل بشكل صحيح باستخدام رياضيات معقدة. أما NabaOS، فيثبت أن القصة حقيقية من خلال التحقق من الإيصالات.

إنه الفرق بين مطالبة ساحر بإثبات أنه لم يستخدم سلكاً مخفياً (أمر صعب وبطيء) وبين مطالبته بإظهار تذكرة القطار التي ادعى أنه استقلها (أمر سريع، سهل، وموثوق).

من خلال منحك هذه "الإيصالات" و"ملصقات الثقة"، يساعدك NabaOS على معرفة ما يجب أن تصدقه وما يجب أن تدققه، مما يجعل وكلاء الذكاء الاصطناعي آمنين بما يكفي لاستخدامهم في مهام الحياة الواقعية مثل إدارة أموالك أو صحتك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →