ConCISE: A Reference-Free Conciseness Evaluation Metric for LLM-Generated Answers
تقدم هذه الورقة ConCISE، وهو مقياس جديد غير مرجعي يقيم إيجاز الاستجابات الناتجة عن النماذج اللغوية الكبيرة (LLMs) من خلال حساب متوسط نسب الضغط من التلخيص التجريدي والاستخراجي مع تقنية إزالة الكلمات، مما يتيح الكشف الآلي عن الحشو دون الحاجة إلى تعليقات توضيحية بشرية مرجعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تطلب شطيرة من متجر للأطعال. تطلب شطيرة "هام وجبنة" بسيطة. وبدلاً من مجرد تسليمك الشطيرة، يقدم لك الطاهي مقالاً من 20 صفحة عن تاريخ القمح، وأنماط هجرة الخنازير، ونقاشاً فلسفياً حول أخلاقيات الجبن، ثم يسلمك الشطيرة في النهاية.
من الناحية التقنية، ما فعله صحيح، لكنه مرهق، ومربك، وأنت تدفع مقابل كل كلمة كتبها الطاهي.
هذا هو بالضبط ما يحدث مع النماذج اللغوية الكبيرة (LLMs) اليوم. فهي بارعة في الإجابة على الأسئلة، لكنها غالباً ما تعاني من "الإطناب". فهي تثرثر، وتكرر نفسها، وتحشو إجاباتها بالحشو. وهذا أمر سيء للمستخدمين (الذين يريدون إجابات سريعة) وسيء للشركات (التي تدفع مقابل كل كلمة/رمز "token").
تقدم الورقة البحثية التي شاركتَها أداة جديدة تسمى ConCISE (مقياس تقييم الإيجاز) لحل هذه المشكلة. وإليك كيف تعمل، مشروحة ببساطة.
المشكلة: كيف نقيس "الزيادة عن الحد"؟
عادةً، لتقييم مقال ما، تحتاج إلى "إجابة مثالية" (معيار ذهبي) لتقارنها به. ولكن في العالم الحقيقي، لا نملك دائماً إجابة مثالية؛ نحن نملك فقط إجابة الذكاء الاصطناعي.
إذاً، كيف تعرف ما إذا كان الذكاء الاصطناعي ثرثاراً جداً دون وجود "مفتاح إجابة" من معلم؟ ConCISE هو قاضٍ "مستقل عن المرجع". فهو لا يحتاج إلى إجابة مثالية ليعرف ما إذا كانت الإجابة الحالية طويلة جداً. إنه يعمل كأنه محرر ذكي يعرف تماماً ما الذي يجب حذفه.
الحل: طريقة "القصات الثلاث"
لا يقوم ConCISE بالتخمين فحسب؛ بل يمرر إجابة الذكاء الاصطناعي عبر ثلاثة "مرشحات" (فلاتر) ليرى مقدار الحشو الذي يمكن إزالته مع الحفاظ على المعنى سليماً. فكر في الأمر كأنك نحات يحاول العثور على التمثال داخل الحجر.
"إعادة الكتابة" (الملخص التجريدي):
تخيل أنك تطلب من ذكاء اصطناعي آخر، ذكي جداً، أن يعيد كتابة إجابتك الطويلة بأسلوبه الخاص، ولكن بجعلها أقصر بكثير. إذا كانت الإجابة الأصلية 500 كلمة وإعادة الكتابة هي 100 كلمة، فهذا دليل كبير: الإجابة الأصلية كانت تحتوي على الكثير من الأشياء الزائدة."التظليل" (الملخص الاستخراجي):
تخيل أنك تطلب من الذكاء الاصطناعي أن يقوم فقط بتظليل الجمل الأكثر أهمية في النص الأصلي وتجاهل الباقي. إذا كانت النسخة الأصلية رواية من 10 صفحات والنسخة "المظللة" هي صفحتان فقط، فإن الأصل كان متضخماً."المقص" (حذف الكلمات):
هذا هو الاختبار الأكثر مباشرة. يُطلب من الذكاء الاصطناعي أن يأخذ مقصاً ويقص كل كلمة ليست ضرورية تماماً للحفاظ على المعنى. إذا استطعت قص 80% من الكلمات ولا تزال الجملة منطقية، فإن الإجابة الأصلية كانت مسرفة جداً.
النتيجة: يأخذ ConCISE نتائج هذه الاختبارات الثلاثة، ويحسب متوسطها، ويعطيك درجة. كلما ارتفعت الدرجة، زاد مقدار "الحشو" الذي تمت إزالته، مما يعني أن الإجابة الأصلية كانت مسرفة جداً.
التجربة: هل نجح الأمر؟
اختبر الباحثون هذا على مجموعة بيانات من الأسئلة والأجوبة (مستندة إلى ويكيبيديا). أنشأوا نسختين من الإجابات:
- الإجابة الجيدة: قصيرة ومباشرة.
- الإجابة السيئة: نفس الحقائق، ولكن تمت إعادة كتابتها لتكون طويلة جداً، ومكررة، ومملة (مثل مقال الطاهي المكون من 20 صفحة).
بعد ذلك، طلبوا من البشر تقييم أي الإجابات كانت أفضل. وبعد ذلك، تركوا ConCISE يقيمها.
النتائج:
- كان ConCISE متوافقاً مع الحكم البشري. عندما قال البشر: "هذه الإجابة طويلة جداً"، وافقهم ConCISE الرأي.
- الطرق القديمة: فشلت أدوات تقييم الذكاء الاصطناعي القياسية الأخرى (التي تعطي فقط درجة من 10) فشلاً ذريعاً. فقد ظنت غالباً أن الإجابات الطويلة والمترهلة كانت "أفضل" لأنها بدت أكثر "ثقة" أو تفصيلاً. أما ConCISE فقد حدد بشكل صحيح أنها كانت هدراً.
لماذا يهم هذا؟
فكر في ConCISE كأنه حارس بوابة في ملهى ليلي.
- حراس البوابة في أنظمة الذكاء الاصطناعي القديمة كانوا مثل الحراس الذين يسمحون لأي شخص بالدخول طالما يملك تذكرة، حتى لو كان يصرخ ويرقص فوق الطاولات.
- ConCISE هو الحارس الذي يفحص القائمة، ويرى من هو المطلوب فعلياً، ويطرد الأشخاص الذين يشغلون مساحة فقط ويضيعون وقت "الدي جي".
الخلاصة
تقدم هذه الورقة طريقة عملية للتحقق تلقائياً مما إذا كان الذكاء الاصطناعي ثرثاراً جداً دون الحاجة إلى أن يقرأ إنسان كل إجابة. إنها تساعد المطورين على بناء ذكاء اصطناعي فعال، وواضح، ومحترم لوقت المستخدم — كما توفر المال في تكاليف الحوسبة عبر عدم توليد كلمات غير ضرورية.
باختصار: ConCISE يساعد الذكاء الاصطناعي على تعلم قول المزيد بالقليل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.