← أحدث الأبحاث
🤖 AI

CryptoAnalystBench: Failures in Multi-Tool Long-Form LLM Analysis

تقدم هذه الورقة CryptoAnalystBench، وهو معيار تقييمي وإطار عمل شامل مصمم لكشف وتصنيف أوضاع الفشل الحرجة في وكلاء النماذج اللغوية الكبيرة (LLMs) المتطورة عند إجراء تحليل متعدد الأدوات ومعقد على بيانات العملات المشفرة والتمويل اللامركزي (DeFi) عالية الكثافة، مما يوفر في النهاية تصنيفاً دقيقاً وآلية تغذية راجعة قابلة للتوسع لتحسين الاستدلال التحليلي طويل المدى.

المؤلفون الأصليون: Anushri Eswaran, Oleg Golev, Darshan Tank, Sidhant Rahi, Himanshu Tyagi

نُشر 2026-03-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Anushri Eswaran, Oleg Golev, Darshan Tank, Sidhant Rahi, Himanshu Tyagi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك وظفت مساعد بحث فائق الذكاء ولا يكل يُدعى "CryptoBot" لمساعدتك في إدارة أموالك. تسأله سؤالاً معقداً مثل: "هل يجب أن أنقل مدخراتي من إيثيريوم (Ethereum) إلى سولانا (Solana) في الربع القادم، وما هي المخاطر؟"

للإجابة على هذا، لا يقوم "CryptoBot" بمجرد التخمين. بل يعمل كالمحقق: يستدعي ما يصل إلى 20 أداة مختلفة (مثل التحقق من أسعار الأسهم المباشرة، وقراءة سجلات البلوكشين، والبحث في المقالات الإخبارية، وتحليل الأكواد البرمجية) لجمع آلاف الأدلة. ثم يكتب لك تقريراً مفصلاً وطويلاً.

المشكلة:
يطرح ورقة بحثية بعنوان "CryptoAnalystBench" سؤالاً مخيفاً: ماذا يحدث عندما يتعرض هذا المحقق فائق الذكاء للإرهاق؟

وجد المؤلفون أنه حتى أكثر نماذج الذكاء الاصطناعي تقدماً (النماذج الرائدة - frontier models) غالباً ما تفشل بطرق خفية وخطيرة عندما تضطر للتعامل مع كم هائل من المعلومات في وقت واحد. قد تصيب في الحقائق لكنها تغفل عن السياق، أو قد تخلط بين مصدرين مختلفين للحقيقة وتخلق فوضى مربكة.

إليك تفصيل لنتائج الورقة البحثية باستخدام تشبيهات بسيطة:

1. فخ "كثرة المعلومات"

تخيل أنك تحاول طهي وجبة معقدة، ولكن بدلاً من الحصول على وصفة واحدة، تم تسليمك 50 كتاب طهي مختلف، و10 خلاصات إخبارية مباشرة عن أسعار المواد الغذية، وفيديو مباشر لطباخ يقطع الخضروات.

  • التحدي: يتعين على الذكاء الاصطناعي قراءة كل هذا، ومعرفة أي المعلومات حديثة (ليست من العام الماضي) ودمجها في وجبة واحدة مثالية.
  • الفشل: قد يقوم الذكاء الاصطناعي بتقطيع البصل (الحصول على البيانات) لكنه ينسى تشغيل الموقد (تجاهل التوقيت)، أو قد يخلط بين وصفة من عام 2020 ومكونات من عام 2025، مما ينتج عنه طبق مذاقه سيء.

2. "بطاقة التقييم" الجديدة (CryptoAnalystBench)

قام المؤلفون ببناء اختبار خاص يسمى CryptoAnalystBench. اعتبره بمثابة "دورة تعليم القيادة" للذكاء الاصطناعي، ولكن بدلاً من قيادة سيارة، يقود الذكاء الاصطنا_في سفينة مالية عالية السرعة وسط عاصفة.

  • الاختبار: لقد صمموا 198 سؤالاً واقعياً يطرحها مستثمرو الكريبتو الحقيقيون فعلياً.
  • الهدف: معرفة ما إذا كان بإمكان الذكاء الاصطناعي التعامل مع الضغط الناتج عن البيانات اللحظية دون أن يتحطم.

3. "الخطايا السبع المميتة" لمحللي الذكاء الاصطناعي

اكتشف الباحثون أن الذكاء الاصطناعي لا يرتكب مجرد أخطاء حسابية بسيطة، بل يرتكب أخطاء "عليا" يصعب رصدها. لقد وضعوا "تصنيفاً للفشل" (قائمة بالخطايا) لوصف هذه الأخطاء:

  • خطأ "الخبز القديم" (التقادم - Staleness): يعطيك الذكاء الاصطناعي سعراً من الأسبوع الماضي، بينما تحرك السوق منذ ساعات. الأمر يشبه إخبار شخص ما بأن الجو مشمس بينما السماء تمطر بغزارة الآن.
  • خطأ "الفصام" (الادعاءات المتناقضة - Inconsistent Claims): يقول الذكاء الاصطنا_في "البيتكوين ارتفع بنسبة 10%"، وبعد ثلاث جمل يقول "البيتكوين انخفض بنسبة 5%"، دون أن يدرك أنه ناقض نفسه.
  • خطأ "المترجم المرتبك" (التوفيق بين المصادر - Source Reconciliation): ينظر الذكاء الاصطنا_في إلى موقعين إخباريين مختلفين؛ أحدهما يقول إن قيمة العملة 10 دولارات، والآخر يقول 12 دولاراً. وبدلاً من قول "مهلاً، هذه المصادر تختلف"، فإنه يختار واحداً منها ويكذب، متظاهراً بأن هذا هو الحقيقة المطلقة.
  • خطأ "السطحية" (التركيب الضحل - Shallow Synthesis): يسرد الذكاء الاصطنا_في 10 حقائق لكنه لا يشرح لماذا تهم هذه الحقائق. الأمر يشبه طالباً يسرد المكونات لكنه لا يشرح كيفية خبز الكعكة.
  • خطأ "غياب ملصق التحذير" (نقص المخاطر - Missing Risk): يخبرك الذكاء الاصطنا_في بمقدار المال الذي يمكنك ربحه، لكنه ينسى ذكر أنك قد تخسر كل شيء.
  • خطأ "المقامر الواثق بزيادة" (التنبؤ المفرط في الثقة - Overconfident Prediction): يتنبأ الذكاء الاصطنا_في بالمستقبل بيقين 100% ("هذه العملة ستتضاعف!") في حين لا يمكن لأحد أن يعرف ذلك بالتأكيد.
  • خطأ "السؤال الخاطئ" (نقص أو سوء صياغة السؤال - Partial/Misframed): سألته عن "المخاطر"، فأعطاك درساً تاريخياً عن تأسيس العملة.

4. مشكلة "القاضي"

لتقييم تقارير الذكاء الاصطنا_في، استخدم المؤلفون ذكاءً اصطناعياً آخر كـ "قاضٍ".

  • المشكلة: "القاضي" جيد في رصد الأخطاء الكبيرة، لكنه ليس مثالياً. الأمر يشبه معلماً يمكنه تحديد ما إذا كانت المقالة "جيدة" أو "سيئة"، لكنه قد يختلف مع خبير بشري حول الدرجة الدقيقة.
  • الحل: أدرك المؤلفون أنه بدلاً من محاولة جعل "القاضي" يعطي درجة مثالية من 1 إلى 10، فمن الأفضل استخدامه لـ تحديد أخطاء محددة (مثل "هذا الجزء قديم" أو "هذا تناقض"). وهذا أكثر فائدة لإصلاح الذكاء الاصطنا_في.

5. الخلاصة الكبرى

تخلص الورقة البحثية إلى أن "الدقة الواقعية" ليست كافية.
في عالم التمويل والعملات الرقمية، يمكن للذكاء الاصطنا_في أن يكون مصيباً بنسبة 99%، ومع ذلك قد يعطيك نصيحة كارثية إذا أخطأ في التوقيت، أو تجاهل المخاطر، أو فشل في التوفيق بين البيانات المتضاربة.

التشبيه:
تخيل نظام ملاحة (GPS).

  • الذكاء الاصطنا_في القديم: "انعطف يساراً بعد 500 قدم". (قد يكون محقاً، ولكن إذا كان الطريق مغلقاً، فستصطدم).
  • الذكاء الاصطنا_في الجديد (الهدف): "انعطف يساراً بعد 500 قدم، ولكن كن حذراً: الطريق مغلق بسبب أعمال إنشائية، وحركة المرور كثيفة. إليك طريق بديل".

يقول المؤلفون: نحن بحاجة للتوقف عن مجرد التحقق مما إذا كان الذكاء الاصطنا_في يعرف الحقائق. نحن بحاجة للبدم في التحقق مما إذا كان يفهم القصة، والتوقيت، والمخاطر الكامنة وراء تلك الحقائق. لقد أطلقوا مجموعة الاختبارات الخاصة بهم لكي يتمكن المطورون من إصلاح هذه "الخطايا السبع المميتة" قبل الوثوق بالذكاء الاصطنا_في في أموالنا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →