← أحدث الأبحاث
💬 NLP

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

تقدم هذه الورقة HoWToBench، وهو معيار صيني واسع النطاق للكتابة، وتقترح شجرة الكتابة (ToW)، وهو إطار تقييم ذو بنية شجرية يعمل على نمذجة تجميع الميزات الفرعية بشكل صريح لتحقيق ارتباط عالٍ مع الأحكام البشرية ومتانة ضد الاضطرابات النصية، مما يعالج أوجه القصور في المقاييس الحالية في تقييم قدرات الكتابة لدى النماذج اللغوية الكبيرة التي تضاهي المستوى البشري.

المؤلفون الأصليون: Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

نُشر 2026-04-22
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث HoWToBench و Tree-of-Writing (ToW)، مترجمة إلى لغة بسيطة وسهلة الاستخدام مع بعض الاستعارات الإبداعية.

المشكلة الكبيرة: "القاضي الآلي" بدأ يفقد تركيزه

تخّل أنك طاهٍ مشهور. لقد انتهيت للتو من إعداد وجبة معقدة مكونة من 10 أطباق. أنت تريد أن تعرف ما إذا كانت جيدة أم لا.

في الماضي، لتقييم كتابة الذكاء الاصطناعي، كنا نستخدم طريقتين رئيسيتين:

  1. قاضي "النسخ واللصق": كنا نقارن كتابة الذكاء الاصطنا1 بـكتابة البشر كلمة بكلمة. إذا لم يتطابقا تماماً، فإن الذكاء الاصطناعي يفشل. هذا يشبه تقييم عازف جاز بناءً على مدى قدرته على عزف أغنية مطابقة تماماً للتسجيل الأصلي؛ وهذا يغفل جانب الإبداع.
  2. قاضي الروبوت "ذو المحاولة الواحدة": كنا نطلب من ذكاء اصطناعي آخر قراءة الكتابة وإعطاءها درجة (مثلاً: "8 من 10"). لكن المشكلة هنا هي أن القاضي الروبوت سيء في الرياضيات. فعندما يحاول دمج درجات "القواعد"، و"الإبداع"، و"المنطق"، فإنه غالباً ما يكتفي بجمعها وتقسيمها أو يصاب بالارتباك. قد يعطي درجة عالية لمقال ممل لمجرد أنه طويل، أو درجة منخفضة لقصة عبقرية لمجرد وجود خطأ مطبعي واحد.

يطلق الباحثون على هذا اسم "عدم اتساق التفاوض" (Negotiation Inconsistency). الأمر يشبه طلب قرار من لجنة من الروبوتات لتحديد الفائز في عرض مواهب، ولكن في كل مرة تسألهم، يغيرون آراءهم لأنهم لا يستطيعون الاتفاق على كيفية وزن المواهب المختلفة.

الحل: "شجرة الكتابة" (Tree of Writing - ToW)

قام المؤلفون ببناء طريقة جديدة لتقييم الكتابة تسمى Tree-of-Writing (ToW).

الاستعارة: الشجرة مقابل العصير (Smoothie)

  • الطريقة القديمة (العصير): تضع كل المكونات (القواعد، الحبكة، العاطفة، التنسيق) في الخلاط. تحصل على عصير (درجة واحدة). لا يمكنك تذوق الفراولة منفصلة عن الموز. إذا كان الخلاط معطلاً، فسيكون طعم المشروب كاملاً سيئاً.
  • الطريقة الجديدة (الشجرة): تخيل شجرة.
    • الجذر هو الدرجة النهائية.
    • الأغصان الرئيسية هي فئات كبيرة: المحتوى (القصة)، التنسيق (الهيكل)، والانطباع (الجو العام أو "الروح").
    • الأوراق هي تفاصيل صغيرة: "هل الافتتاحية جذبتك؟" "هل المنطق سليم؟" "هل الفقرات ذات حجم مناسب؟"

كيف تعمل:
بدلاً من روبوت واحد يخمن الدرجة كاملة، يقوم النظام بإرسال "وكلاء خبراء" (Expert Agents) إلى أوراق محددة.

  • أحد الوكلاء يتحقق مما إذا كان المنطق منطقياً.
  • وآخر يتحقق مما إذا كان التنسيق (مثل العناوين والقوائم) صحيحاً.
  • وثالث يتحقق من العمق العاطفي.

والأهم من ذلك، أن هناك "مُتفاوضاً" (ذكاء اصطنا- ذكاء اصطناعي ذكي) يقرر مدى أهمية كل ورقة قبل بدء عملية التقييم. فبالنسبة لقصيدة، تأخذ "العاطفة" وزناً كبيراً. أما بالنسبة لعقد قانوني، فيأخذ "المنطق" الوزن الأكبر. هذا يمنع الروبوت من الارتباك بشأن ما هو مهم.

الاختبار الجديد: HoWToBench

لاختبار نظام التقييم الجديد هذا، قاموا ببناء اختبار ضخم يسمى HoWToBench.

الاستعارة: "مطبخ الشيف الماهر"
معظم اختبارات الذكاء الاصطناعي تشبه طلب ملء فراغ في جملة من روبوت. هذا سهل.
أما HoWToBench فهو يشبه إعطاء الروبوت لوحة بيضاء فارغة وقول: "اكتب رواية غموض"، أو "اكتب خطاباً لعمدة المدينة"، أو "اكتب عقداً لفندق في الفضاء".

  • 12 نوعاً أدبياً: اختبروا كل شيء من الشعر والقصص الخيالية إلى الوثائق الحكومية الرسمية وخطط العمل.
  • 3 مستويات صعوبة:
    1. الإكمال (Completion): "إليك قصة، أكمل الجزء الأوسط منها". (سهل)
    2. الدليل (Guide): "إليك مخطط تفصيلي، اكتب القصة بناءً عليه". (متوسط)
    3. المفتوح (Open): "إليك موضوع، اكتب ما تشاء عنه". (صعب)

لقد استخدموا خبراء بشريين حقيقيين (كتاب، صحفيون، محررون) لتقييم عمل الذكاء الاصطناعي، مما خلق "معياراً ذهبياً" لمعرفة ما إذا كان نظام "شجرة الكتابة" صحيحاً بالفعل.

الاكتشافات المذهلة

عندما أجروا الاختبارات، وجدوا بعض الأشياء التي أدهشت الجميع:

  1. الطول ليس دائماً أفضل:

    • الأسطورة: "إذا كتب الذكاء الاصطناعي مقالاً ضخماً، فلا بد أنه ذكي".
    • الواقع: وجدت الدراسة أن المدخلات والمخرجات الطويلة غالباً ما حصلت على درجات أقل. إذا قام الذكاء الاصطنا- الذكاء الاصطناعي بتكديس الكلمات فقط ليبدو ذكياً، فإن ذلك يضر بدرجته في الواقع. البشر يفضلون الكتابة الموجزة والمؤثرة على الكلام الكثير الذي لا معنى له.
    • التشبيه: الأمر يشبه الكوميدي الذي يلقي نكتة. إذا قال النكتة في 5 ثوانٍ، ستكون مضحكة. أما إذا استمر في الكلام لمدة 20 دقيقة قبل الوصول إلى لب الموضوع، فلن تكون مضحكة.
  2. النقاد "الهشّون":

    • اختبروا مدى قوة النقاد. أخذوا قصة جيدة من إنتاج الذكاء الاصطناعي وفعلوا بها أشياء غريبة: حذفوا فقرة، أو كرروا فقرة، أو غيروا النوع الأدبي.
    • النتيجة: طرق التقييم القديمة (مثل مطابقة الكلمات البسيطة أو نقاد الذكاء الاصطناعي التقليديين) ارتبكت وأعطت درجات متفاوتة بشكل جنوني.
    • الشجرة: ظل نظام Tree-of-Writing هادئاً. فقد أدرك أن القصة لا تزال جيدة حتى لو نقصت فقرة، أو أن التكرار كان سيئاً. لقد كان قوياً ومتماسكاً (Robust).
  3. فخ "التقليد":

    • العديد من نماذج الذكاء الاصطناعي بارعة في اتباع التعليمات عندما يكون لديها الكثير من المساعدة (مثل وصفة الطعام). لكن عندما تسحب منها "الوصفة" (الكتابة المفتوحة)، فإنها تعاني لتكون مبدعة حقاً. إنها جيدة في تقليد البشر، لكنها ليست بعد بمستوى الكتابة البشرية.

لماذا يهم هذا؟

هذه الورقة البحثية تمثل خطوة كبيرة للأمام لأنها تتوقف عن معاملة الكتابة كمسألة رياضية (عد الكلمات) وتبدأ في معاملتها كـ فن.

من خلال استخدام هيكل الشجرة، جعلوا عملية التقييم شفافة. يمكننا الآن معرفة لماذا حصل الذكاء الاصطنا- الذكاء الاصطناعي على درجة سيئة (مثلاً: "لقد فشل في المنطق، لكنه أبدع في العاطفة"). هذا يساعد المطورين على إصلاح نماذجهم ويساعدنا على الثقة في الذكاء الاصطناعي عندما يكتب القصص أو العقود أو الخطابات.

باخت- باختصار، لقد بنوا طريقة أكثر ذكاءً وشبهاً بالبشر لتقييم كتابة الذكاء الاصطناعي، مثبِتين أن الجودة لا تتعلق بمدى طول ما تكتبه، بل بمدى جودة ما تكتبه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →