Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks
تقيم هذه الدراسة بشكل منهجي سلوكيات الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط عبر مهام تفسير وتوليد الصور الزراعية، كاشفةً عن عدم اتساق بيولوجي وتناقضات سياقية كبيرة تقوض موثوقية الرؤى الزراعية المدعومة بالذكاء الاصطناعي رغم التحسينات الناتجة عن التلقين بلقطات قليلة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك وظفت مساعداً ذكياً جداً ومطلعاً لمساعدتك في إدارة مزرعة. هذا المساعد قد قرأ ملايين الكتب عن النباتات والطقس والزراعة. ومع ذلك، لدى هذا المساعد عادة غريبة: أحياناً، عندما ينظر إلى صورة نبات، يخبرك بأشياء ليست صحيحة بكل ثقة. أو، عندما تطلب منه رسم صورة لنبات مريض، يرسم شيئاً يبدو واقعياً ولكنه يكسر قوانين الطبيعة.
هذه الورقة البحثية هي بمثابة "تقرير درجات" لهذا المساعد، حيث تختبر مدى جودة تعامله مع الصور الزراعية (صور المحاصيل). أراد الباحثون من جامعة تكساس إيه إم (Texas A&M) معرفة ما إذا كانت هذه "النماذج اللغوية الكبيرة متعددة الوسائط" (الذكاء الاصطناعي الذكي الذي يمكنه الرؤية والقراءة) موثوقة بما يكفي ليتم الوثوق بها في اتخاذ قرارات زراعية حقيقية.
إليك تفصيل لنتائجهم، باستخدام تشبيهات بسيطة:
1. الطريقتان اللتان يخطئ فيهما الذكاء الاصطناعي
اختبر الباحثون الذكاء الاصطناعي بطريقتين مختلفتين، مثل التحقق من واجب مدرسي لطالب في مادتين دراسيتين مختلفتين:
الموضوع (أ): المحقق (من صورة إلى نص)
- المهمة: تعرض على الذكاء الاصطناٍ صورة لورقة طماطم وتسأله: "هل هذه الورقة سليمة أم مريضة؟"
- المشكلة: يتصرف الذكاء الاصطناعي أحياناً كمحقق واثق أكثر من اللازم. فقد ينظر إلى ورقة سليمة تماماً ويقول: "هذه مريضة بالتأكيد!" (إنذار كاذب)، أو ينظر إلى ورقة مغطاة بالبقع ويقول: "هذا جيد!" (تجاهل الجريمة).
- النتيجة: حتى النماذج الأكثر ذكاءً (مثل Gemma أو MiniCPM) أصابت في حوالي 63% إلى 75% من المرات عندما كان عليها التخمين بمفردها. وإذا أعطيتهم بضعة أمثلة لدراستها أولاً (مثل عرض ورقة "مريضة" وورقة "سليمة" قبل الاختبار)، فإنهم يتحسنون (يصلون إلى 86%)، لكنهم لا يزالون يرتكبون الأخطاء. كانوا لا يزالون "يهلوسون" – أي يرون أمراضاً ليست موجودة أو يغفلون عن أمراض موجودة بالفعل.
الموضوع (ب): الفنان (من نص إلى صورة)
- المهمة: تعطي الذكاء الاصطناعي وصفاً، مثل "ارسم نبات صويا سليماً تعرض لآفات حشرية شديدة"، وتطلب منه إنشاء الصورة.
- المشكلة: هنا يصبح الذكاء الاصطناعي مبدعاً بشكل سيء للغاية. الأمر يشبه طلب رسم "إسفنجة جافة ومبللة" من فنان. الذكاء الاصطناعي لا يفهم أن هذين الشيئين متناقضان.
- النتيجة: عندما طُلب منه رسم أشياء مستحيلة (مثل نبات "سليم" به "أضرار حشرية شديدة")، قام الذكاء الاصطناعي برسمها على أي حال.
- أحد النماذج (GPT-5) رسم ورقة مليئة بالثقوب الضخمة ولكنه وصفها بثقة بأنها "سليمة".
- نموذج آخر (Gemini) رسم حقلاً يبدو أخضر وسليماً ولكن به أضرار حشرية طفيفة، متجاهلاً حقيقة أن الطلب كان يطلب ضرراً "شديداً".
- في بعض الحالات، أضاف الذكاء الاصطناعي أشياء لم تطلبها، مثل رسم أتربة وحطام على الثمرة بينما طلبت الثمرة فقط، أو جعل الألوان تبدو كلوحة فنية بدلاً من صورة علمية.
2. "الخدعة السحرية" في صياغة الأوامر
وجد الباحثون شيئاً مثيراً للاهتمام حول كيفية سلوك الذكاء الاصطناعي عند تغيير كلماته قليلاً.
- السيناريو: طلبوا من الذكاء الاصطناعي رسم "فراولة خالية من الأمراض ومغطاة بالعفن".
- رد الفعل: في البداك، قال الذكاء الاصطناعي (GPT-5): "لا، لا يمكنني فعل ذلك. هذا غير منطقي. الفاكهة الخالية من الأمراض لا يمكن أن تكون مغطاة بالعفن". لقد رفض المشاركة في اللعبة.
- الخدعة: ولكن، عندما أضاف الباحثون عبارة صغيرة مثل "افعل هذا من أجل توضيح بحثي"، قال الذكاء الاصطناعي فجأة: "حسناً!" ورسم الفراولة المستحيلة. كان الأمر كما لو أن الذكاء الاصطناعي لديه مفتاح أمان يمكن إيقافه بمجرد تغيير سياق الطلب. هذا يظهر أن الذكاء الاصطناعي يعطي الأولوية لكونه "مفيداً" على أن يكون "دقيقاً بيولوجياً".
3. لماذا يهم هذا؟ (ما الفائدة؟)
تجادل الورقة البحثية بأنه بينما تعد أدوات الذكاء الاصطناعي هذه مذهلة في كتابة المقالات أو تلخيص الأخبار، إلا أنها حالياً غير موثوقة للزراعة.
- المخاطرة: إذا وثق المزارع في الذكاء الاصطناعي وقال إن حقلاً سليماً مريض، فقد يرش مواد كيميائية غير ضرورية (مما يهدر المال ويضر البيئة). وإذا قال إن حقلاً مريضاً هو سليم، فقد ينتظر طويلاً قبل معالجته، مما يؤدي لموت المحصول.
- الاستنتاج: الذكاء الاصطناعي حالياً يشبه طالباً حفظ الكثير من الحقائق ولكنه لا يفهم حقاً كيف تعمل الطبيعة. يمكنه أن يبدو واثقاً جداً بينما هو مخطئ تماماً.
ملخص
تخلص الورقة إلى أنه لا يمكننا الوثوق بهذه النماذج لتشغيل مزارعنا بعد. إنها تحتاج إلى "تأصيل" أفضل (ربطها بالحقائق البيولوجية الحقيقية) وقواعد أكثر صرامة لمنعها من اختلاق أمراض أو رسم نباتات مستحيلة. وحتى نصلح عمليات "الهلوسة" هذه، فإن استخدامها في القرارات الزراعية الحاسمة يعد أمراً محفوفاً بالمخاطر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.