← أحدث الأبحاث
💬 NLP

compar:IA: The French Government's LLM arena to collect French-language human prompts and preference data

تقدم الورقة البحثية compar:IA، وهي منصة مفتوحة المصدر تابعة للحكومة الفرنسية تجمع بيانات ضخمة لتفضيلات البشر باللغة الفرنسية من خلال مقارنات ثنائية عمياء لمعالجة ندرة مجموعات البيانات غير الإنجليزية لتدريب وتقييم النماذج اللغوية الكبيرة.

المؤلفون الأصليون: Lucie Termignon, Simonas Zilinskas, Hadrien Pélissier, Aurélien Barrot, Nicolas Chesnais, Elie Gavoty

نُشر 2026-02-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Lucie Termignon, Simonas Zilinskas, Hadrien Pélissier, Aurélien Barrot, Nicolas Chesnais, Elie Gavoty

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالم الذكاء الاصطناعي كمكتبة ضخمة حيث كُتبت الكتب بالكامل تقريبًا باللغة الإنجليزية. إذا حاولت قراءة كتاب بالفرنسية أو الإسبانية أو لغة أخرى، فقد تبدو القصة ركيكة، أو قد تتصرف الشخصيات بغرابة، أو قد لا يكون النصيحة منطقية من الناحية الثقافية. يحدث هذا لأن "طلاب" الذكاء الاصطناعي قضوا معظم وقتهم في دراسة الكتب الإنجليزية ونادراً ما تدربوا على اللغات الأخرى.

ولإصلاح ذلك، أنشأت الحكومة الفرنسية ساحة لعب خاصة تسمى compar:IA. فكر في الأمر كمسابقة تذوق أعمى عامة وضخمة للذكاء الاصطناعي، ولكن بدلاً من تذوق الآيس كريم، يتم فيها تذوق الإجابات على الأسئلة.

إليك كيف يعمل الأمر، مقسماً إلى أجزاء بسيطة:

1. اختبار التذوق الأعمى (كيف يعمل)

تخيل أنك تدخل غرفة وترى طباخين غامضين (نماذج ذكاء اصطناعي) يطهون إجابة لسؤالك. أنت لا تعرف هويتهما بعد.

  • الخطوة 1: تطرح سؤالاً (مثل، "كيف أصنع الكرواسان؟" أو "أخبرني بنكتة").
  • الخطوة 2: يكتب كلا الطباخين استجابة. تقرأهما جنباً إلى جنب.
  • الخطوة 3: تختار الاستجابة التي أعجبتك أكثر.
  • الخطوة 4: فقط بعد تصويتك، يكشف الطباخان عن اسميهما.

هذه الطريقة "العمياء" حاسمة؛ فهي تمنعك من اختيار طباخ لمجرد أنك تعرف اسمه أو علامته التجارية. إنها تضمن أن يكون التصويت مبنياً بحتًا على جودة الإجابة.

2. لماذا بناء هذا؟ (المشكلة)

معظم بيانات تدريب الذكاء الاصطناعي تشبه نظاماً غذائياً يعتمد فقط على الطعام الإنجليزي. ولهذا السبب، يواجه الذكاء الاصطناعي صعوبة في فهم الثقافة الفرنسية، واللغة العامية، وقواعد السلامة. لتعليم ذكاء اصطناعي أن يكون جيداً في اللغة الفرنسية، تحتاج إلى آلاف الفرنسيين ليقولوا: "أعجبتني هذه الإجابة، لكنني كرهت تلك".

قبل compar:IA، كانت هذه البيانات إما مخفية داخل شركات التكنولوجيا الكبرى أو أنها ببساطة لم تكن موجودة للمتحدثين بالفرنسية. إن compar:IA هو مطبخ عام حيث يمكن لأي شخص المساعدة في طهي هذه البيانات، ومن ثم يتم مشاركة الوصفة (البيانات) بحرية مع الجميع.

3. الحصاد (ما الذي جمعوه)

منذ افتتاحه في أواخر عام 2024، كان هذا الملعب الرقمي مشغولاً للغاية. وبحلول أوائل عام 2026، قاموا بجمع:

  • أكثر من 600,000 سؤال طرحها أشخاص حقيقيون.
  • أكثر من 250,000 صوت قررت أي إجابة ذكاء اصطناعي كانت أفضل.
  • 89% من البيانات باللغة الفرنسية، وهو أمر مذهل في عالم تهيمن عليه البيانات الإنجليزية.

لم يكتفوا بجمع الأصوات فحسب؛ بل طلبوا أيضاً من المستخدمين التفاعل مع أجزاء محددة من الإجابات، مما خلق خريطة غنية لما يهتم به المتحدثون بالفرنسية فعلياً.

4. من يستخدمه ولماذا؟

  • للناس العاديين: هي وسيلة مجانية للدردشة مع نماذج ذكاء اصطناعي مختلفة (بعضها مشهور، وبعضها جديد ومفتوح المصدر) لرؤية كيف تفكر. كما توضح لهم مقدار الطاقة (الكهرباء) التي يستهلكها الذكاء الاصطناعي للإجابة، مما يشجعهم على التفكير في البيئة.
  • للعلماء والشركات: يمكنهم تحميل "كتاب الوصفات" (البيانات) لتدريب نماذج الذكاء الاصطناعي الخاصة بهم للتحدث بالفرنسية بشكل أفضل.
  • للمدارس: يستخدم المعلمون المنصة لتوض Av الطلاب كيف يعمل الذكاء الاصطناعي، محولين المنصة إلى أداة تعليمية حيث يتناقش الطلاب حول أي إجابة ذكاء اصطناعي هي الأكثر عدلاً أو دقة.

5. قواعد اللعبة (الخصوصية والسلامة)

لقد كان المبتكرون حذرين للغاية بشأن الخصوصية.

  • لا توجد عمليات تسجيل دخول: لا تحتاج إلى تقديم اسمك أو بريدك الإلكتروني للعب. هذا يقلل من حواجز الدخول ولكنه يعني أن عليهم أن يكونوا حذرين للغاية لاحقاً.
  • الفلتر (المصفاة): قبل مشاركة أي بيانات مع الجمهور، يقوم كمبيوتر ذكي بمسح كل محادثة. إذا رصد اسماً لشخص حقيقي، أو عنواناً، أو معلومات خاصة، فإنه يرمي المحادثة بأكملها في السلة. من الأفضل فقدان بعض نقاط البيانات بدلاً من تسريب أسرار شخص ما بالخطأ.
  • المصدر المفتوح: يتم إصدار البيانات بموجب ترخيص حكومة فرنسية، مما يعني أن أي شخص يمكنه استخدامها للبحث أو بناء أدوات جديدة، طالما أنه يحترم القواعد.

6. لوحة النتائج

تحتوي المنصة أيضاً على لوحة صدارة (قائمة ترتيب). إنها تشبه لوحة نتائج الرياضة التي تظهر أي نماذج الذكاء الاصطناعي يفضلها الفرنسيون أكثر. ومع ذلك، يحذر المؤلفون من أن هذا ليس اختباراً مثالياً لـ "الذكاء"؛ فهو يوضح فقط ما "أعجب" الناس في سياق غير رسمي. إنه أشبه بمسابقة شعبية أكثر من كونه امتحاناً نهائياً.

7. المستقبل

يرى الفريق الفرنسي أن هذا نموذج أولي. إنهم يعملون بالفعل على توسيع "اختبار التذوق" ليشمل لغات أخرى (بدءاً من الدنماركية) حتى تتمكن الدول الأخرى من بناء حدائق بيانات عامة خاصة بها.

باختصار: compar:IA هي خدمة عامة تعتمد على التعهيد الجماعي لتفضيلات اللغة الفرنسية لتعليم الذكاء الاصطناعي كيف يتحدث، ويفكر، ويتصرف مثل متحدث فرنسي بشري، مع الحفاظ على العملية مفتوحة، وخاصة، ومجانية للاستخدام من قبل الجميع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →