← أحدث الأبحاث
🤖 AI

InfiCoEvalChain: A Blockchain-Based Decentralized Framework for Collaborative LLM Evaluation

لمعالجة عدم الاستقرار الإحصائي وعدم الشفافية في تقييم النماذج اللغوية الكبيرة المركزية، تقترح هذه الورقة **InfiCoEvalChain**، وهو إطار عمل لامركزي قائم على تقنية البلوكشين يستفيد من عقد حوسبة غير متجانسة وآلية إجماع مدفوعة بالمكافآت لتوفير تقييمات للنماذج أكثر استقراراً وموثوقية وشفافية.

المؤلفون الأصليون: Yifan Yang, Jinjia Li, Kunxi Li, Puhao Zheng, Yuanyi Wang, Zheyan Qu, Yang Yu, Jianmin Wu, Ming Li, Hongxia Yang

نُشر 2026-02-10
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yifan Yang, Jinjia Li, Kunxi Li, Puhao Zheng, Yuanyi Wang, Zheyan Qu, Yang Yu, Jianmin Wu, Ming Li, Hongxia Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

المشكلة: مشكلة "الامتحان المتقلب"

تخيل أنك طالب تستعد لامتحان نهائي ضخم. خضعت لاختبار تجريبي يوم الاثنين وحصلت على 95%. ثم خضعت للاختبار نفسه تمامًا يوم الثلاثاء، ولكن نظرًا لأن الغرفة كانت أكثر دفئًا قليلاً، والإضاءة كانت مختلفة، وكنت تستخدم علامة تجارية مختلفة من الأقلام، حصلت على 85%.

في عالم الذكاء الاصطناعي، يحدث هذا بالفعل. حاليًا، عندما يريد العلماء معرفة مدى "ذكاء" نموذج ذكاء اصطنا-ي، يستخدمون "المعايير المرجعية" (اختبارات معيارية). ولكن نظرًا لأن الذكاء الاصطناعي يولد الإجابات باستخدام قدر من العشوائية (مثل رمي النرد)، ولأن أجهزة الكمبيوتر المختلفة لها "درجات حرارة" أو عتاد (Hardware) مختلف، فإن الدرجات تتذبذب بشكل عشوائي كبير.

في الوقت الحالي، الفجوة بين "أذكى" نموذج ذكاء اصطناعي و"ثاني أذكى" نموذج هي غالبًا أصغر من هامش الخطأ في الاختبار نفسه. الأمر يشبه محاولة تصنيف أسرع العدائين في العالم، لكن ساعة التوقيت معطلة وتغير قراءتها في كل مرة تضغط فيها على زر البدء. نحن لا نعرف حقًا من هو الفائز؛ نحن نعرف فقط من حصل على "قراءة محظوظة".


الحل: InfiCoEvalChain (اللجنة العالمية)

اقترح الباحثون نظامًا جديدًا يسمى InfiCoevalChain. بدلاً من أن تقوم شركة واحدة كبيرة (مثل جوجل أو OpenAI) بإجراء الاختبار في مختبرها الخاص (صندوق أسود)، يريدون تحويل الاختبار إلى لجنة عالمية لا مركزية.

إليك كيف يعمل ذلك باستخدام ثلاثة استعارات:

1. اللجنة المتنوعة (تنوع العتاد والمعايير)

بدلاً من أستاذ واحد يصحح ورقة، تخيل لجنة مكونة من 1,000 شخص من جميع أنحاء العالم. بعضهم يجلس في جبال ثلجية، وبعضهم في غابات استوائية، وبعضهم يستخدم أجهزة كمبيوتر فائقة القوة، وبعضهم يستخدم أجهزة كمبيوتر قديمة.
من خلال جعل الجميع يقيمون نفس الذكاء الاصطناعي في نفس الوقت، يتم إلغاء "الضجيج" (الغرابة الناتجة عن البيئة) تلقائيًا. إذا كان الذكاء الاصطناعي ذكيًا حقًا، فسيؤدي جيدًا للجميع. أما إذا كان قد حالفه الحظ فقط بسبب إعدادات كمبيوتر معينة، فإن هذا الحظ لن يصمد أمام اللجنة بأكملها.

2. الظرف المختوم (البلوكشين والالتزام والكشف - Commit-Reveal)

للتأكد من عدم وجود غش، يستخدمون تقنية البلوكشين (Blockchain). فكر في هذا كأنه نظام "الظرف المختوم".

  • الخطوة 1 (الالتزام - Commit): يقوم عضو اللجنة بتقييم الذكاء الاصطناعي ويضع درجته في ظرف مغلق ومقفول. ويخبر العالم: "لدي درجة، وهذا بصمة رقمية تثبت أنها مغلقة".
  • الخطوة 2 (الكشف - Reveal): فقط بعد أن يقدم الجميع أظرفهم، تفتح اللجنة جميع الأظرف دفعة واحدة.
    هذا يمنع "التقليد"، حيث ينتظر أحد أعضاء اللجنة ليرى ما قاله أذكى شخص ثم يقوم بمجرد تقليده للحصول على مكافأة.

3. مكافأة "اللعب النظيف" (آلية التحفيز)

كيف تجعل الناس يتوقفون عن الكذب أو التكاسل؟ تستخدم نظام مكافأة ذكي.
تخيل برنامج مسابقات حيث تحصل على المال بناءً على مدى قرب إجابتك من "الإجماع" (المنطقة الوسطى للمجموعة). إذا قدمت درجة مختلفة تمامًا عن الجميع (قيمة شاذة)، يفترض النظام أنك إما غشاش أو أن جهاز الكمبيوتر الخاص بك معطل، ولن تحصل على أي شيء تقريبًا. أما إذا كنت جزءًا من الأغلبية الصادقة، فستحصل على حصة عادلة من الجائزة.


النتيجة: من "الضبابية" إلى "عالية الدقة"

لقد اختبر الباحثون هذا، وكانت النتائج هائلة.

قبل ذلك، كانت الدرجات "ضبابية" — كانت تتذبذب كثيرًا بحيث لا يمكنك الوثوق بها. بعد استخدام طريقة "اللجنة" اللامركزية هذه، انخفضت التقلبات بشكل كبير (في أحد الاختبارات، انخفض هامش الخطأ من 1.67 إلى 0.28).

باختصار: لقد نقلوا تقييم الذكاء الاصطناعي من "قياس خاص مهتز" إلى "إجماع عام راسخ". إنه مثل الانتقال من صورة كاميرا مهتزة باليد إلى صورة احترافية واضحة للغاية. الآن، عندما تقول لوحة الصدارة إن "النموذج أ أفضل من النموذج ب"، يمكننا حقًا تصديق ذلك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →