LLMs for Survey Text Analysis – A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis
تُظهر هذه الدراسة أن نموذج GPT-5.4 يمكنه محاكاة الأداء البشري في التحليل الاستقرائي للمحتوى لبيانات الاستطلاع، محققاً مستويات من الاتفاق في الترميز وتوليد الموضوعات تضاهي مستوى الاتساق الداخلي لدى البشر، مما يؤكد إمكاناته كأداة دعم قابلة للتوسع في البحث النوعي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
البحث النوعي هو فن فهم الكلمات. فعندما يحتاج العلماء أو علماء الاجتماع أو صانعو السياسات إلى فهم أفكار الناس ومشاعرهم وتجاربهم، فإنهم غالباً ما يطرحون أسئلة مفتوحة. فبدلاً من وضع علامة في خانة محددة، يكتب الشخص فقرة عن حياته، أو صراعاته، أو آماله. ولتحويل آلاف الفقرات هذه إلى معرفة مفيدة، يجب على الباحثين قراءة كل واحدة منها، وإيجاد الأفكار المتكررة، وتجميعها في فئات. هذه العملية، المعروفة باسم تحليل المحتوى، هي العمود الفق الفقري لفهم السلوك البشري، لكنها عملية بطيئة ومجهدة للغاية. لعقود من الزمن، كانت الطريقة الوحيدة للقيام بذلك هي عبر العقول البشرية، التي تقرأ سطراً بسطر. والآن، دخل نوع جديد من الأدوات إلى الغرفة: النماذج اللغوية الكبيرة. هذه أنظمة ذكاء اصطناعي مدربة على كميات هائلة من النصوص يمكنها قراءة اللغة وفهمها وتلخيصها. والسؤال الكبير للمجتمع العلمي ليس فقط ما إذا كانت هذه الآلات تستطيع القراءة، بل ما إذا كان بإمكانها التفكير كباحث بشري عندما تتطلب المهمة إيجاد أنماط خفية دون وجود قواعد مكتوبة مسبقاً.
وضع فريق من الباحثين من جامعات عبر أوروبا هدفهم للإجابة على هذا السؤال من خلال مقارنة مباشرة. لقد أخذوا مجموعة بيانات من واقع حقيقي من استطلاع شمل 2800 طالب دكتوراه في جميع أنحاء أوروبا، حيث تم سحب 10% من الاستجابات عشوائياً لتكون أساساً للدراسة. ومن هذه العينة، تم تحليل ما مجموعه 903 استجابة عبر ستة أسئلة محددة مفتوحة بعمق. في جانب واحد من التجربة، قرأ خمسة باحثين بشريين هذه الإجابات وقاموا بما يسمى بالتحليل الاستقرائي للمحتوى. وهذا يعني أنهم لم يبدأوا بقائمة من الفئات لفرض الإجابات عليها؛ بل قرأوا النص، وحددوا الأفكار الجوهرية، ووضعوا تسمياتهم الخاصة لتلك الأفكات، ثم جمعوا تلك التسميات في موضوعات أوسع. إنها عملية إبداعية وتفسيرية، تعتمد على الحكم البشري لتحديد ما هو مهم. وفي الجانب الآخر، استخدم الباحثون نموذجاً لغوياً متطوراً للقيام بنفس المهمة تماماً على النص نفسه. وقد أُعطيت الآلة نفس التعليمات لقراءة الإجابات، وإيجاد الأفكار الرئيسية، وتجميعها في موضوعات، وكل ذلك دون إخبارها بما يجب أن تبحث عنه مسبقاً.
قام الباحثون بعد ذلك بمقارنة مجموعتي النتائج لمعرفة مدى تطابق الآلة مع البشر. لم يبحثوا عن تطابق مثالي، لأن حتى الخبراء البشر المختلفين غالباً ما يختلفون في كيفية تسمية جملة معينة. بدلاً من ذلك، قاموا بقياس التوافق العام للمجموعات. وأظهرت النتائج مستوى متوسطاً من الاتفاق. فعند النظر في التسميات المحددة التي وضعها الببحاث والآلة للنص، فقد اتفقا بنسبة 61 بالمائة من الوقت. وعند النظر في الموضوعات الأوسع التي بنوها من تلك التسميات، كان الاتفاق أقل قليلاً، بنسبة 54 بالمائة. ولوضع ذلك في السياق، تحقق الباحثون أيضاً من مدى اتفاق الخبراء البشر الخمسة مع بعضهم البعض. فقد اتفق البشر مع بعضهم البعض بنسبة 68 بالمائة في التسميات والموضوعات. وهذا يعني أن الفجوة بين الإنسان والآلة لم تكن كبيرة؛ فقد أدت الآلة عملها بانسجام يكاد يضاهي انسجام خبير بشري مع خبير بشري آخر.
ومع ذلك، فإن القصة ليست موحدة عبر جميع المواضيع. فقد اختلف الاتفاق بين البشر والآلة بشكل كبير اعتماداً على ما كان الطلاب يكتبون عنه. فبالنسبة للأسئلة المتعلقة بالأوضاع المالية، واجهت الآلة صعوبة أكبر، حيث أظهرت توافقاً أقل مع الباحثين البشر. أما بالنسبة للأسئلة المتعلقة بالتجارب الشخصية أو الملاحظات العامة، فقد كان التوافق أقوى بكثير. وتشير الدراسة إلى أن موثوقية الآلة تعتمد بشكل كبير على طبيعة البيانات ووضوح النص. فعندما كان النص غامضاً أو كان المنطق الداخلي لتجميع الآلة الخاص بها مهزوزاً، انخفض الاتفاق مع البشر. ووجد الباحثون أنه كلما كانت الآلة غير متسقة مع نفسها، كانت أيضاً غير متسقة مع البشر، وكان الأمر نفسه ينطبق على الفريق البشري. وهذا يشير إلى أن صعوبة الموضوع المحدد تلعب دوراً رئيسياً في مدى فعالية الأداة.
كما طُلب من المبرمجين البشر الذين شاركوا في الدراسة تقديم انطباعاتهم حول عمل الآلة. وقد أفادوا بأن تصنيفات الآلة تعكس تفكيرهم، وأنهم يثقون في الأداة للمساعدة في تحليل البيانات المستقبلية. وخلص الباحثون إلى أن أنظمة الذكاء الاصطناعي هذه ليست جاهزة لاستبدال الحكم البشري تماماً، خاصة في العمل المعقد وعالي المستوى لبناء النظريات. ومع ذلك، تشير النتيات إلى أن هذه الأدوات فعالة للغاية في التعامل مع المراحل الأولى المجهدة من حيث العمل في فرز النصوص. يمكنها القيام بالعمل الشاق المتمثل في قراءة آلاف الاستجابات وإيجاد الأنماط الأولية، مما يسم يسمح للباحثين البشر بالتركيز على التفسير والتحقق الأعمق من تلك الأنماط. لا تدعي الدراسة أن الآلة مثالية أو أنها حلت مشكلة تحليل النصوص، لكنها تشير إلى أنها شريك قوي وقابل للتوسع للباحثين الذين يحتاجون إلى فهم كميات كبيرة من القصص الإنسانية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.