Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs
تكشف هذه الدراسة عن تباين كبير في اتخاذ القرارات المحفوفة بالمخاطر بين النماذج اللغوية الكبيرة القائمة على الاستنتاج وتلك القائمة على المحادثة، حيث وجدت أن نماذج الاستنتاج تُظهر سلوكاً عقلانياً غير حساس للسياق يشبه سلوك الوكلاء الأمثل، بينما تُظهر نماذج المحادثة تحيزات شبيهة بالبشر وفجوة كبيرة بين الأوصاف الصريحة وسجلات النتائج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك توظف نوعين مختلفين من المساعدين الآليين (AI) لمساعدتك في اتخاذ قرار استثماري عالي المخاطر. لديك خياران: النابغة في الرياضيات (نموذج استدلالي) والصديق الثرثار (نموذج حواري).
هذه الورقة البحثية هي في الأساس تقرير تقييمي حول كيفية تعامل هذين النوعين من الذكاء الاصطناي مع المخاطر، وعدم اليقين، والأسئلة الملتوية. لقد أخضعهم الباحثون لسلسة من الاختبارات لمعرفة ما إذا كانوا يتصرفون كآلات باردة وحاسبة، أو بشر عاطفيين، أو شيئاً بينهما.
إليك تفصيل نتائجهم، باستخدام بعض التشبيهات من الحياة اليومية.
1. الفريقان: المحاسب مقابل بائع القهوة
وجدت الدراسة أن جميع نماذج الذكاء الاصطناعي التي اختبروها انقسمت بشكل طبيعي إلى مجموعتين متميزتين:
- نماذج الاستدلال (RMs): فكر في هذه النماذج كأنها محاسبون صارمون وفائقو المنطق. لقد تم تدريبهم بكثافة على الرياضيات والمنطق. عندما تطلب منهم الاختيار بين رهان عالي المخاطر وآخر آمن، يتصرفون كبرنامج كمبيوتر مثالي. إنهم يتجاهلون المشتتات، ولا يرتبكون من طريقة صياغة السؤال، ويختارون دائماً الخيار الذي يحقق أعلى متوسط عائد. إنهم "عقلانيون" بالمعنى الاقتصادي الصارم.
- النماذج الحوارية (CMs): فكر في هذه النماذج كأنها بائعو قهوة ثرثارون أو جيران ودودون. هم بارعون في الدردشة، وكتابة القصص، والظهور بمظهر بشري. ومع ذلك، عندما يتعلق الأمر بالرياضيات والمخاطر، فهم أكثر "شبهاً بالبشر" في عيوبهم. ينجرفون بسهولة خلف كيفية صياغة السؤال، ويرتبكون من ترتيب الخيارات، وغالباً ما يتخذون قرارات لا تزيد من أرباحهم إلى الحد الأقصى.
المفاجأة الكبرى: النماذج "الثرثارة" هي في الواقع أكثر شبهاً بالبشر الحقيقيين من نماذج "النابغة في الرياضيات". فالنماذج النابغة منطقية للغاية لدرجة أنها لا تشبهنا على الإطلاق.
2. فجوة "الوصف مقابل التجربة"
هذا هو الاكتشاف الأكثر إثارة للاهتمام في الورقة، ويسمى فجوة DH.
تخيل أنني عرضت عليك مقامرة:
- السيناريو أ (الوصف): أقول لك، "هناك احتمال 70% أن تربح 100 دولار، واحتمال 30% أن تربح لا شيء".
- السيناريو ب (التجربة): أنا لا أخبرك بالاحتمالات. بدلاً من ذلك، أعرض لك قائمة بآخر 20 مرة لُعبت فيها هذه اللعبة: "لقد ربحت 100 دولار خمس عشرة مرة، وحصلت على 0 دولار خمس مرات".
كيف يتفاعل البشر: عادة ما يتصرف البشر بشكل مختلف في هاتين الحالتين. نحن نميل إلى أن نكون أكثر حذراً عندما نقرأ الاحتمالات فقط، لكننا نأخذ مخاطر أكبر عندما "نرى" تاريخ الفوز. هذه سمة بشرية معروفة.
كيف تفاعل الذكاء الاصطناعي:
- النابغة في الرياضيات (RMs): لم يهتموا. سواء أعطيتهم الاحتمالات أو التاريخ، فقد قاموا بحساب الرياضيات واختاروا نفس الفائز في كل مرة. كانوا محصنين ضد "الفجوة".
- النماذج الحوارية (CMs): وقعوا تماماً في الفخ. عندما عُرض عليهم تاريخ الفوز، بدأوا يتصرفون مثل البشر تماماً—يأخذون مخاطر لم يكونوا ليأخذوها لو أعطيتهم الأرقام فقط. لديهم "فجوة" كبيرة بين طريقة تفكيرهم عند القراءة مقابل طريقة تفكيرهم عند "تجربة" البيانات.
3. تأثير "اشرح لنفسك"
طلب الباحثون أيضاً من الذكاء الاصطناعي شرح سبب اتخاذه لقرار ما.
- النتيجة: من المثير للدهشة أن طلب شرح قصير من جملة واحدة جعل الذكاء الاصطناعي (خاصة النماذج الحوارية) يتخذ قرارات أفضل وأكثر عقلانية. كان الأمر يشبه طلب "توضيح خطوات الحل" من طالب في اختبار رياضيات؛ فقد أجبرهم ذلك على التمهل والتفكير بمنطقية.
- ومع ذلك، إذا طلبوا شرحاً رياضياً طويلاً ومعقداً، فقد ارتبكت النماذج الحوارية أحياناً واتخذت خيارات أسوأ، ويرجح أن ذلك بسبب محاولتهم "الظهور بمظهر ذكي" بدلاً من أن يكونوا أذكياء بالفعل.
4. ما الذي يصنع الفارق؟
لماذا توجد نماذج ذكاء اصطناعي "نابغة في الرياضيات" وأخرى "ثرثارة"؟
وجدت الدراسة أن المفتاح ليس فقط حجم النموذج (عدد الخلايا العصبية لديهم). المفتاح هو التدريب.
- إذا تم ضبط النموذج بدقة من أجل الاستدلال الرياضي، فإنه يصبح "نموذج استدلال" (RM). يصبح آلة حاسبة باردة وقاسية.
- إذا تم تدريب النموذج فقط للدردشة واتباع التعليمات دون هذا التركيز الرياضي المحدد، فإنه يظل "نموذجاً حوارياً" (CM).
الخلاصة
إذا كنت تبني ذكاءً اصطناعياً لإدارة أموالك، أو إدارة محفظة أسهم، أو اتخاذ قرارات سلامة حاسمة، فأنت تريد النابغة في الرياضيات (نموذج الاستدلال). إنهم متسقون، ومنطقيون، ولن يتم خداعهم بطريقة صياغة السؤال.
إذا كنت تريد ذكاءً اصطناعياً للدردشة مع العملاء، أو كتابة القصص، أو محاكاة السلوك البشري لسيناريو فيلم، فإن النموذج الحواري ممتاز. ولكن كن حذراً: إذا طلبت منهم اتخاذ قرار مالي، فقد يتصرفون بشكل غير عقلاني، تماماً كما يفعل البشر.
باختصار: تحذر الورقة من أن ليس كل أنواع الذكاء الاصطناعي متساوية. بعضها صُمم ليكون روبوتات مثالية، بينما صُمم البعض الآخر ليكونوا بشراً غير كاملين. ومعرفة الفرق بينهما أمر بالغ الأهمية قبل أن تتركهم يتخذون القرارات نيابة عنك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.