← أحدث الأبحاث
🤖 machine learning

Reinforcing Human Behavior Simulation via Verbal Feedback

تقدم هذه الورقة نموذج DITTO، وهو نموذج تم تدريبه عبر التعلم التعزيزي باستخدام التغذية الراجعة اللفظية لمحاكاة السلوك البشري بشكل أفضل، إلى جانب مجموعة اختبار SOUL، مما يظهر تحسينات كبيرة في الأداء مقارنة بالنماذج الأساسية وتفوقاً على GPT-5.4 في مهام محاكاة متعددة شبيهة بالبشر.

المؤلفون الأصليون: Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang, Pei Zhou, Sherry Wu, Sean Welleck, Graham Neubig, Yiming Yang, Maarten Sap

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang, Pei Zhou, Sherry Wu, Sean Welleck, Graham Neubig, Yiming Yang, Maarten Sap

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "تعزيز محاكاة السلوك البشري عبر التغذية الراجعة اللفظية" باستخدام لغة بسيطة وتشبيهات إبداعية.

الفكرة الكبرى: تعليم الذكاء الاصطناعي كيف "يتصرف كبشر" من خلال التحدث إليه

تخيل أنك تعلم طفلاً كيف يتصرف في مأدبة عشاء.

  • الطريقة القديمة (المكافآت الرقمية): تعطي الطفل درجة مثل "6 من 10" بعد انتهائه من الأكل. أنت لا تخبره لماذا حصل على 6. هل تحدث كثيراً؟ هل استخدم الشوكة الخاطئة؟ هل سكب الحساء؟ ليس لديه أدنى فكرة عن كيفية التحسن، لذا سيقوم بمجرد التخمين في المرة القادمة.
  • الطريـقة الجديدة (التغذية الراجعة اللفظية): تجلس معه وتقول له: "لقد كنت رائعاً في استخدام المنديل، لكنك قاطعت جدتك أثناء حديثها، وكان ذلك وقاحة. في المرة القادمة، انتظر حتى تنهي كلامها".

تجادل هذه الورقة بأن نماذج الذكاء الاصطناعي الحالية (LLMs) يتم تدريبها مثل ذلك الطفل الذي يحصل على درجة "6". إنها بارعة في الرياضيات والبرمجة لأن هذه الأشياء لها إجابات صحيحة وخاطئة واضحة (مثل درجات الاختبار). ولكن عندما نطلب من الذكاء الاصطناعي محاكاة السلوك البشري — مثل تمثيل دور مريض، أو طالب، أو صديق — فإن الدرجات الرقمية البسيطة لا تجدي نفعاً. البشر يتعلمون الأعراف الاجتماعية من خلال الكلمات، والتفسيرات، والتصحيحات، وليس من خلال الأرقام.

قام المؤلفون ببناء نظام جديد يسمى DITTO يعلم الذكاء الاصطناعي كيف يتصرف كبشر باستخدام طريقة "التغذية الراجعة اللفظية" هذه.


كيف يعمل DITTO: لعبة "المسودة والتنقيح"

تخ die DITTO كورشة عمل للكتابة الإبداعية حيث يكون الذكاء الاصطناعي هو الطالب والمحرر في آن واحد. إليك العملية:

  1. المسودة الأولى (الطالب): يحاول الذكاء الاصطناعي الإجابة على أمر ما (مثلاً: "تقمص دور معلم غاضب"). يكتب استجابته.
  2. النقد (القاضي): يقرأ "قاضٍ" ذكاء اصطناعي قوي المسودة ويعطي تغذية راجعة لفظية. هو لا يكتفي بقول "عمل جيد"، بل يقول: "كنت مهذباً أكثر من اللازم. المعلم الغاضب سيكون أكثر نفاداً للصبر. أيضاً، لقد نسيت ذكر الواجب المنزلي".
  3. المسودة الثانية (المعلم): يأخذ الذكاء الاصطناعي تلك التغذية الراجعة المحددة ويكتب نسخة جديدة ومحسنة من الاستجابة.
  4. الدرس (السحر): يقوم النظام بتدريب الذكاء الاصطناعي على النظر إلى الأمر الأصلي وتوليد النسخة المحسنة فوراً، دون الحاجة لنص التغذية الراجعة بعد ذلك. الأمر يشبه الطالب الذي يقرأ ملاحظات المعلم، ويصلح المقال، ثم يحفظ "إحساس" كيفية كتابة مقال جيد بحيث لا يحتاج للملاحظات في المرة القادمة.

النتيجة: يتعلم الذكاء الاصطناعي "استيعاب" النصيحة داخلياً. عندما تتحدث إليه لاحقاً، يتصرف بشكل أكثر بشرية لأنه تعلم لماذا تعتبر بعض السلوكيات أفضل، وليس فقط أنها أفضل.


الملعب: SOUL (صالة ألعاب المحاكاة)

لاختبار ما إذا كان هذا يعمل حقاً، بنى الباحثون صالة ألعاب ضخمة تسمى SOUL (صالة ألعاب محاكاة السلوك البشري - Simulation gym Of hUman-Like behavior).

تخيل صالة ألعاب بها 10 محطات مختلفة، كل منها يختبر نوعاً مختلفاً من المهارات "البشرية":

  • نظرية العقل (Theory of Mind): هل يستطيع الذكاء الاصطناعي فهم أن شخصاً آخر يعرف شيئاً لا يعرفه هو؟ (مثل لعبة الغميضة).
  • لعب الأدوار (Role Play): هل يمكنه تمثيل شخصية معينة من كتاب دون الخروج عن الشخصية؟
  • المهارات الاجتماعية (Social Skills): هل يمكنه إدارة محادثة للوصول إلى هدف (مثل طلب زيادة في الراتب) دون أن يكون فظاً؟
  • محاكاة المستخدم (User Simulation): هل يمكنه التظاهر بأنه عميل مرتبك يتحدث إلى مكتب المساعدة؟

وجدوا أن نماذج الذكاء الاصطناعي الحالية غالباً ما تفشل في هذه الاختبارات. كانت تبدو آلية للغاية، أو مثالية جداً، أو متشابهة جداً مع بعضها البعض.

النتائج: DITTO يفوز في الصالة الرياضية

اختبر الباحثون نموذجهم الجديد (DITTO) مقابل أفضل النماذج الموجودة حالياً (بما في ذلك النماذج العملاقة من شركات التقنية الكبرى).

  • الدرجة: تحسن DITTO بنسبة 36% مقارنة بالنموذج الأساسي.
  • المواجهة: هزم DITTO نموذج "GPT-5.4" المتطور في 6 من أصل 10 تحديات.
  • أين تألق: كان بارعاً بشكل خاص في المهام التي تتطلب دقة وتفاصيل، مثل المهارات الاجتماعية ولعب الأدوار. لقد تعلم كيف يحافظ على الأسرار بشكل أفضل وكيف يدير محادثات معقدة دون أن "يتعثر" أو يبدو مزيفاً.

لماذا هذا مهم (وفقاً للورقة البحثية)

تدعي الورقة أنه لجعل الذكاء الاصطناعي مفيداً حقاً لمحاكاة البشر (مثل روبوتات العلاج النفسي، أو المعلمين التعليميين، أو التدريب على خدمة العملاء)، يجب أن نتوقف عن معاملتهم كطلاب رياضيات يحتاجون فقط إلى درجة. يجب أن نعاملهم ككائنات اجتماعية تحتاج إلى تفسيرات.

من خلال استخدام التغذية الراجعة اللفظية (الكلمات) بدلاً من مجرد المكافآت الرقمية (الأرقام)، يتعلم الذكاء الاصطنا_ "نسيج" السلوك البشري. إنه يتعلم أن كون المرء "فظاً" ليس مجرد درجة منخفضة، بل هو طريقة محددة في التحدث تجرح المشاعر.

باختصار: DITTO هو ذكاء اصطناعي تعلم كيف يتصرف كبشر من خلال الاستماع إلى انتقادات معلمه المفصلة، وممارسة التصحيحات، ثم نسيان ملاحظات المعلم لأنه أخيراً "فهم الأمر".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →