The Collective Turing Test: Large Language Models Can Generate Realistic Multi-User Discussions
تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة يمكنها توليد محادثات على وسائل التواصل الاجتماعي متعددة المستخدمين بواقعية كافية لخداع القراء البشر، كما يتضح من خطأ المشاركين في تمييز المحتوى المُنشأ بواسطة الذكاء الاصطناعي واعتباره منشورات كتبها بشر بنسبة 39% من المرات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك دخلت إلى مقهى صاخب حيث يتجاذب الناس أطراف الحديث حول طاولات مختلفة. فجأة، لاحظت طاولتين تبدوان متطابقتين تماماً: نفس عدد الأشخاص، نفس أكواب القهوة، ونفس لغة الجسد. لكن هنا تكمن الخدعة: إحدى الطاولتين مليئة ببشر حقيقيين، والأخرى مليئة بروبوتات متطورة للغاية تحاول التصرف تماماً كالبشر.
مهمتك هي؟ الجلوس والاستماع لفترة، ثم تخمين أي طاولة هي الحقيقية.
هذا هو بالضبط ما فعله الباحثون في هذه الورقة البحثية، ولكن بدلاً من المقهى، استخدموا Reddit (منتدى ضخم عبر الإنترنت)، وبدلاً من الروبوتات، استخدموا نماذج لغوية كبيرة (LLMs) مثل GPT-4o و Llama 3. وقد أطلقوا على هذه التجربة اسم "اختبار تورينج الجماعي".
إليك تفاصيل نتائجهم، مشروحة ببساطة:
1. الإعداد: لعبة المحتال الكبرى
أخذ الباحثون محادثات حقيقية من Reddit. ثم طلبوا من نموذجين من الذكاء الاصط الاصطناعي كتابة محادثات جديدة حول نفس المواضيع تماماً، مع محاولة مطابقة طول وأسلوب المحادثات الحقيقية.
بعد ذلك، عرضوا أزواج المحادثات هذه (واحدة حقيقية وأخرى مزيفة) على أكثر من 200 متطوع بشري. كان على المتطوعين الاختيار: "أي واحدة كتبها إنسان؟"
2. المفاجأة الكبرى: الذكاء الاصطناعي أصبح بارعاً بشكل مخيف
قد تتوقع أن البشر سيكتشفون الروبوتات بسهولة. ففي النهاية، غالباً ما يبدو الذكاء الاصطناعي مهذباً للغاية أو آلياً، أليس كذلك؟
ليس بعد الآن.
- النتيجة: أخطأ البشر بنسبة 39% من المرات.
- ما يعنيه هذا: في حوالي 4 من كل 10 حالات، كانت محادثات الذكاء الاصطناعي واقعية للغاية لدرجة أن الناس اعتقدوا أنها كُتبت بواسطة بشر حقيقيين.
- "عتبة تورينج": في اختبار تورينج الكلاسيكي، إذا استطاعت الآلة خداع الإنسان لأكثر من 30% من الوقت، يُعتبر ذلك نجاحاً. هذه النماذج لم تكتفِ بالنجاح فحسب، بل سحقت التوقعات.
3. المتنافسون: GPT-4o مقابل Llama 3
استخدم الباحثون "عقلين" مختلفين في الاختبار:
- GPT-4o: المساعد المصقول، المؤسسي، و"الآمن". إنه يشبه مرشداً سياحياً يرتدي ملابس أنيقة، لا يسب أبداً ويستخدم دائماً قواعد لغوية مثالية.
- Llama 3: نموذج مفتوح المصدر تم تدريبه على جزء ضخم من الإنترنت، بما في ذلك المنتديات. إنه يشبه شخصاً عادياً يجلس في حانة.
من فاز بجائزة "الأكثر بشرية"؟
للمفاجأة، كان Llama 3 أصعب في كشفه من GPT-4o.
- لماذا؟ GPT-4o مثالي للغاية. إنه مهذب ومنظم بشكل مبالغ فيه. أما Llama 3، فقد بدا أكثر "فوضوية" وغير رسمي، وهو بالضبط كيف يتحدث الناس في الواقع على Reddit. لقد بدا أكثر عضوية، كأنه شخص حقيقي يكتب على هاتفه.
4. هل الطول مهم؟ (اختبار "باختصار شديد")
تساءل الباحثون: إذا كانت المحادثة طويلة جداً، هل سيكون من الأسهل كشف كذبة الذكاء الاصطناعي؟
- النظرية: المحادثات الطويلة تعطي الذكاء الاصطناعي فرصاً أكبر للوقوع في الخطأ، أو فقدان الزخم، أو قول شيء غريب.
- الواقع: لم يكن الأمر بهذه البساطة.
- المحادثات القصيرة جداً كان من الصعب الحكم عليها.
- المحادثات متوسطة الطول (حوالي 8 تعليقات) كانت في الواقع الأسهل للبشر للحكم عليها بشكل صحيح.
- الالتواء: عندما تصبح المحادثات طويلة جداً (16 تعليقاً)، يصاب البشر بالتعب والارتباك، وتعود قدرتهم على كشف الذكاء الاصطناعي للانخفاض مرة أخرى. يبدو أنه إذا استطاع الذكاء الاصطناعي الحفاظ على الدور لفترة من الوقت، فإن البشر يتوقفون عن التركيز في النهاية.
5. كيف كشف البشر التزييف؟
عندما نجح البشر في كشف الذكاء الاصطناب، ما الذي كشفه؟ لقد بحثوا عن ثلاثة أشياء رئيسية:
- الأسلوب (الدليل الأكبر): كان الذكاء الاصطناعي مهذباً للغاية، رسمياً للغاية، ويفتقر إلى العامية أو الأخطاء المطبعية. مستخدمو Reddit الحقيقيون يشتمون، يستخدمون الرموز التعبيرية، يمزحون، وأحياناً يكتبون بقواعد لغوية سيئة. كان الذكاء الاصطناعي "نظيفاً أكثر من اللازم".
- المحتوى: افتقر الذكاء الاصطناعي إلى القصص الشخصية. البشر الحقيقيون يقولون: "حدث لي هذا الأسبوع الماضي!". أما الذكاء الاصطناعي فيقدم فقط حقائق عامة.
- الاتفاق: كان مستخدمو الذكاء الاصطناعي يميلون إلى الاتفاق مع بعضهم البعض أكثر من اللازم. الجدالات الحقيقية على الإنترنت فوضوية؛ أما محادثات الذكاء الاصطناعي فكانت تبدو كدائرة اتفاق مهذبة وزائفة.
لماذا يجب أن نهتم؟
ترسل هذه الورقة رسالة مختلطة:
🟢 الأخبار الجيدة:
يمكن للباحثين الآن استخدام هؤلاء "الممثلين" من الذكاء الاصطناعي لمحاكاة وسائل التواصل الاجتماعي. هذا أمر رائع لاختبار سياسات السلامة. على سبيل المثال، قبل طرح ميزة جديدة لمنع خطاب الكراهية، يمكننا اختبارها على مجتمع محاكى من البشر الآليين لمعرفة مدى فعاليتها، دون المخاطرة بإيذاء أشخاص حقيقيين.
🔴 الأخبار السيئة:
إذا كان بإمكان الذكاء الاصطناعي خداع البشر بنسبة 40% من الوقت، فهذا يعني أن الجهات السيئة يمكنها استخدام هذا لإنشاء "أسراب الذكاء الاصطناعي" (AI Swarms). تخيل مجموعة من البوتات تتظاهر بأنها أشخاص حقيقيون لبدء جدالات وهمية، أو نشر معلومات مضللة، أو جعل منتج مزيف يبدو شائعاً. وبما أنها تبدو حقيقية للغاية، فسيكون من الصعب جداً علينا التمييز بين الحقيقي والمزيف.
الخلاصة
لقد وصلنا إلى نقطة يمكن فيها للحواسيب أن تتحدث مثل البشر تقرياً بنفس جودة حديث البشر مع بعضهم البعض. إنهم ليسوا مثاليين بعد (لا يزالون مهذبين للغاية ويفتقرون إلى القصص الشخصية)، لكنهم يصبحون بارعين بشكل مخيف. في المرة القاد_مة التي تقرأ فيها قسم تعليقات ساخناً، قد ترغب في التأكد مرتين: هل هذا شخص حقيقي، أم مجرد روبوت مقنع للغاية؟
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.