Evaluating Human and LLM-Generated Thematic Analysis in HRI for Vulnerable Populations: A Comparative and Ethical Analysis
تقدم هذه الورقة تحليلاً مقارناً وأخلاقياً للتحليل الموضوعي المُنتَج بشرياً مقابل ذلك المُنتَج بواسطة النماذج اللغوية الكبيرة في أبحاث التفاعل بين الإنسان والروبوت التي تشمل الفئات المستضعفة، حيث تقيم مدى الاتفاق وتتقصى ما إذا كانت النماذج اللغوية الكبيرة تنطوي على مخاطر تمثيل تجارب المشاركين بشكل خاطئ أو تهميشها.
في مجال التفاعل بين الإنسان والروبوت، يلجأ الباحثون غالباً إلى الروبوتات الاجتماعية لمساعدة الأشخاص الذين يواجهون تحديات كبيرة في حياتهم اليومية، مثل الأفراد ذوي الإعاقة أو الأطفال المصابين بأمراض مزمنة. ولفهم كيفية تجربة هؤلاء الأشخاص لهذه التكنولوجيا حقاً، يعتمد العلماء على منهجية تسمى "التحليل الموضوعي". هذا التحليل هو عملية بشرية دقيقة، حيث يقرأ الباحثون ساعات من نصوص المقابلات، بحثاً عن أنماط فيما يقوله الناس. إن الأمر لا يقتصر مجرد عدّ الكلمات؛ بل يتطلب تعاطفاً عميقاً، ووعياً ثقافياً، وقدرة على فهم الواقع المعاش الدقيق للشخص المتحدث. ولعقود من الزمن، اعتُبر هذا العمل حرفة بشرية متأصلة، تتطلب اشتباكاً تأملياً مع البيانات لضمان سماع أصوات المشاركين المستضعفين بدقة واحترام.
مؤخراً، دخلت أداة جديدة إلى المختبر: النماذج اللغوية الكبيرة. هذه برامج حاسوبية قوية مدربة على كميات هائلة من النصوص، يمكنها القراءة والتلخيص وحتى تحديد الأنماط في اللغة البشرية. ومع ازدياد قدرة هذه النماذج، بدأ الباحثون يتساءلون عما إذا كان بإمكانها المساعدة في الأعباء الثقيلة للتحليل الموضوعي. هل يمكن للحاسوب أن يقرأ المقابلات ويجد نفس الموضوعات التي سيجدها البشر؟ وبينما أظهرت الاختبارات المبكرة في سياقات عامة نتائج واعدة، ظل هناك سؤال جوهري بلا إجابة: هل ينجح هذا الأمر عندما تكون البيانات مستمدة من فئات مستضعفة؟ فإذا أخطأ الحاسوب في تفسير تجربة شخص ذي إعاقة، فإن الخطأ لن يكون مجرد خلل إحصائي؛ بل إنه يخاطر بتهميش الأشخاص الذين يهدف البحث إلى مساعدتهم.
وضع فريق من الباحثين في جامعة كامبريدج هدفهم للإجابة على هذا السؤال عبر وضع الذكاء الاصطعي والذكاء البشري جنباً إلى جنب. لقد أخذوا بيانات مقابلات من دراسة سابقة شملت 31 طالباً جامعياً من ذوي الإعاقة، بما في ذلك المصابين بالتوحد، وصعوبات التعلم المحددة، وحالات الصحة النفسية. كان هؤلاء الطلاب قد تفاعلوا مع روبوتات اجتماعية وعوامل صوتية صُممت لمساعدتهم في إدارة حياتهم الجامعية. طلب الباحثون من خبير بشري، متخصص في مجال الإعاقة والتعليم، تحليل النصوص باستخدام المنهجية القياسية الصارمة. وفي الوقت نفسه، قاموا بتغذية النص ذاته في نموذج لغوي متطور، مع توجيهه لاتباع نفس الخطوات وإيجاد نفس الموضوعات.
أظهرت النتائج أن الحاسوب لم يكن تائهاً تماماً. فعندما نظر الباحثون في كيفية تجميع الحاسوب لتعليقات الطلاب، وجدوا أن الحاسوب كان يؤدي أداءً أفضل بكثير من العشوائية. فقد نجح في تحديد أن موضوعات معينة، مثل صعوبة التفاعل مع الروبوت أو الحاجة إلى أن يفهم الروبوت طبيعة الإعاقة، كانت مرتبطة ببعضها البعض. وفي الواقع، بالنسبة لبعض الموضوعات المباشرة، كانت تسميات الحاسوب مشابهة جداً في المعنى لتسميات البشر. ومع ذلك، لم يكن الاتفاق مثالياً، ولم تكن الاختلافات عشوائية؛ فكلما انتقل التحليل من الملخصات البسيطة إلى الأفكار الأكثر تجريداً وعمقاً، بدأ الحاسوب في الانحراف.
ظهرت أهم النتائج عندما فحص الباحثون طبيعة الخلافات. فقد وجدوا أن الحاسوب غالباً ما تعامل مع المقابلات كعملية سطحية، حيث اختار الكلمات الأكثر وضوحاً بدلاً من فهم المعنى الأعمق. فعلى سبيل المثال، عندما تحدث طالب عن خوف محدد من "التمييز ضد ذوي الإعاقة" (Ableism)، كان الحاسوب غالباً ما يستبدل هذا المصطلح الدقيق بكلمة "التمييز" (Discrimination) الأكثر عمومية وأقل تحديداً. ورغم أن هذا قد يبدو تبديلاً طفيفاً، إلا أنه يمحو فعلياً الواقع المحدد لتجربة الطالب، ويحول صراعاً فريداً إلى فئة عامة. وفي حالات أخرى، أغفل الحاسوب الوزن العاطفي لتعليق ما بالكامل، مركزاً بدلاً من ذلك على المنفعة العملية للروبوت، متجاهلاً بذلك مشاعر القلق أو العزلة لدى الطالب.
تشير الدراسة إلى أنه بينما يمكن لهذه الأدوات المعتمدة على الذكاء الاصطناعي أن تكون مفيدة في المراحل الميكانيكية المبكرة للبحث، مثل الفرز عبر كميات كبيرة من النصوص لإيجاد الأنماط الأولية، إلا أنها ليست جاهزة بعد لتحل محل الحكم البشري في السياقات الحساسة. فالحاسوب يعاني في استيعاب الفروق الدقيقة المتعلقة بالقوة، والهوية، والتجربة المعاشة. كما أنه يميل إلى تعميم القصص الفردية لتصبح اتجاهات على مستوى السكان، وهي عادة يمكن أن تؤدي إلى تهميش المشاركين الذين وُجد البحث لدعمهم. ويخلص الباحثون إلى أنه بالنسبة للدراسات التي تشمل الفئات المستضعفة، يظل العنصر البشري لا غنى عنه. يمكن للحاسوب أن يساعد، لكن لا يمكن الوثوق به لتفسير جوهر التجربة الإنسانية بمفرده، لأن القيام بذلك ينطوي على خطر إساءة تمثيل الأصوات التي تحتاج إلى أن تُسمع بوضوح أكبر.
ملخص تقني: تقييم التحليل الموضوعي المولد بواسطة البشر والنماذج اللغوية الكبيرة في مجال التفاعل بين الإنسان والروبوت (HRI) للفئات الضعيفة
بيان المشكلة
يُنظر إلى التحليل الموضوعي (TA) تقليديًا على أنه عملية بشرية متأصلة، تأملية وتفسيرية، تتطلب حكمًا سياقيًا وحسًا أخلاقيًا. وبينما أظهرت النماذج اللغوية الكبيرة (LLMs) إمكانات واعدة في أتمتة الترميز وتوليد الموضوعات، فإن قابليتها للتطبيق في المجالات الحساسة — وتحديدًا أبحاث التفاعل بين الإنسان والروبوت (HRI) التي تشمل الفئات الضعيفة (مثل الأشخاص ذوي الإعاقة) — لا تزال غير مفحوصة إلى حد كبير. تعتمد الدراسات المقارنة الحالية بشكل أساسي على مقاييس اتفاق المقيمين الإجمالية، مما يفشل في التحقيق بشكل منهجي فيما إذا كانت التباينات بين التحليلات البشرية وتحليلات النماذج اللغوية الكبيرة هي تباينات عشوائية أم أنها تعكس أنماطًا تفسيرية منهجية ذات عواقب أخلاقية. هناك فجوة حرجة في فهم ما إذا كان التحليل الموضوعي المولد بواسطة النماذج اللغوية الكبيرة يخاطر بتهميش أو سوء تمثيل التجارب المعاشة للمشاركين الضعفاء، خاصة فيما يتعلق باتجاهية الخلافات وأهميتها الأخلاقية.
المنهجية
تقدم هذه الدراسة تحليلًا مقارنًا للتحليل الموضوعي المولد بواسطة البشر والنماذج اللغوية الكبيرة والمطبق على بيانات مقابلات من دراسة مستخدم داخل العينة (within-subjects) في مجال التفاعل بين الإنسان والروبوت (HRI)، شملت 31 طالبًا جامعيًا من ذوي الإعاقات المتنوعة (بما في ذلك التوحد، وصعوبات التعلم المحددة، والحالات النفسية). استخدمت الدراسة تصميمًا (2×2) يربط بين أدوار الدعم (التوجيه مقابل منصة الاستماع) وبين تجسيدات الوكيل (الروبوت Pepper مقابل جهاز Amazon Echo Dot).
تضمنت المنهجية ثلاث مراحل تحليلية متميزة:
التحليل الموضوعي البشري: قام باحث متخصص في الإعاقة والاختلاف العصبي بإجراء تحليل موضوعي تأملي باتباع إطار عمل براون وكلارك المكون من ست مراحل. تضمنت العملية التعرف على البيانات، والترميز الاستقرائي للقطاعات البارزة، وبناء الموضوعات المرشحة، والتي تم تنقيحها لتعكس وجهات نظر المشاركين.
التحليل الموضوعي للنماذج اللغوية الكبيرة: تم تكييف نفس إطار العمل المكون من ست مراحل لنموذج لغوي كبير (Claude Sonnet 4.6 مع خاصية التفكير الممتد). تم تزويد النموذج بسياق خاص بالمجال (تصميم الدراسة، التركيبة السكانية للمشاركين، التركيز التحليلي) وتمت معالجة البيانات في دفعات لإدارة أحمال الرموز (tokens). جُمعت الرموز من جميع الدفعات وتم توحيدها لتوليد مجموعة موحدة من الموضوعات.
التقييم المقارن:
اتساق التجميع (RQ1): استُخدمت "المعلومات المتبادلة المعدلة" (AMI) لقياس الاتفاق بين تجميعات البشر والنماذج اللغوية الكبيرة للعبارات على مستويات الموضوع والموضوع الفرعي، مع تصحيح احتمالية الصدفة.
التشابه الدلالي (RQ2): استُخدمت تضمينات الجمل مسبقة التدريب (all-mpnet-base-v2) لحساب تشابه جيب التمام بين تسميات البشر والنماذج اللغوية الكبيرة للرموز، والموضوعات الفرعية، والموضوعات الرئيسية.
التحليل الأخلاقي النوعي (RQ3): أُجري تقييم نوعي لعبارات مختارة (الأعلى والأدنى في التشابه الدلالي) باستخدام ثلاثة معايير: التأسيس التفسيري (عمق الاشتباك مقابل إعادة الصياغة)، الأمانة التمثيلية (الإخلاص لصوت المشارك)، وخطر التحيز والتهميش (احتمالية الإسكات أو سوء التمثيل).
النتائج الرئيسية
النتائج الكمية
اتساق التجميع: أنتج النموذج اللغوي الكبير تجميعات تتماشى مع التجميعات البشرية بشكل أفضل بكثير من الصدفة. بلغت قيمة (AMI) المرصودة 0.231 على مستوى الموضوع و 0.225 على مستوى الموضوع الفرعي. ومع ذلك، كان التوافق غير متكافئ؛ فبينما أظهرت موضوعات مثل "الحساسية تجاه احتياجات الإعاقة" و"متطلبات الجهد" توافقًا قويًا مع موضوعات محددة للنموذج اللغوي، فإن الموضوع البشري "ديناميكيات القوة" كان موزعًا عبر فئات متعددة للنموذج اللغوي، مما يشير إلى ضعف الربط للموضوعات المنتشرة مفاهيميًا.
التشابه الدلالي: تباين التوافق الدلالي عبر المستويات والموضوعات. على مستوى الرموز، لوحظ أعلى اتساق في العبارات المرتبطة بـ "الحساسية تجاه احتياجات الإعاقة". وعلى مستوى الموضوعات الفرعية، لوحظ أعلى اتساق في "متطلبات الجهد"، مع وجود مستويات متقاربة في "سلاسة التفاعل" و"السمات الاجتماعية". أما على مستوى الموضوعات الرئيسية، فقد وُجد أقوى توافق في "الحساسية تجاه احتياجات الإعاقة" و"سلاسة التفاعل". في المقابل، لوحظ أدنى تشابه دلالي في "ديناميكيات القوة" و"متطلبات الجهد". ومن الملاحظ أن الموضوعات الفرعية كانت أحيانًا أسوأ أداءً من الموضوعات الرئيسية، مما يعكس صعوبة النموذج في المستوى المتوسط من التجريد حيث يجب عليه تجميع الرموز بشكل متماسك دون المرونة التي تتمتع بها الموضوعات الأوسع.
النتائج النوعية
كشف التحليل النوعي أن الخلافات كانت منهجية وليست عشوائية، وغالبًا ما تضمنت تحولات في التفسير والتجريد:
التأسيس التفسيري: غالبًا ما كانت رموز النموذج اللغوي الكبير تعمل كإعادة صياغة أو استخراج للعناصر اللغوية البارزة بدلاً من كونها تسميات تفسيرية حقيقية. على سبيل المثال، في حالات التشابه المنخفض، فشل النموذج في تجريد المعنى الإجمالي، وركز بدلاً من ذلك على عبارات منفصلة.
الأمانة التمثيلية والتحيز: حددت الدراسة مخاطر "التعقيم الدلالي" والتعميم. في إحدى الحالات، استبدل النموذج اللغوي المصطلح المحدد للمشارك "التمييز ضد ذوي الإعاقة" (ableism) بالمصطلح الأوسع "التمييز" (discrimination)، مما أدى إلى تسطيح حساب متعلق بالضرر الخاص بالإعاقة. وفي حالة أخرى، أعاد النموذج صياغة تأمل في التجربة العلاقاتية كبيان نفعي وظيفي، معطيًا الأولوية للأطر الموجهة نحو المهام على الأطر الوجدانية.
خطر التهميش: تشكل هذه التحولات المنهجية مخاطر أخلاقية من خلال احتمال إسكات تجارب محددة للمشاركين أو فرض أطر مهيمنة تعمم التجارب المعاشة الفردية إلى فئات على مستوى السكان.
المساهمات الرئيسية
أول تحليل مقارن في سياقات HRI/الفئات الضعيفة: هذه هي الدراسة الأولى التي تبحث في جدوى وملاءمة التحليل الموضوعي المعتمد على النماذج اللغية الكبيرة تحديدًا ضمن أبحاث التفاعل بين الإنسان والروبوت (HRI) التي تشمل الفئات الضعيفة.
ما وراء مقاييس الاتفاق: يتجاوز البحث مجرد الاتفاق بين المقيمين ليدرس طبيعة الخلافات، موضحًا أن التباينات المنهجية تحمل ثقلًا أخلاقيًا فيما يتعلق بمن يتم التركيز على تجاربهم.
إطار تقييم أخلاقي: تقدم الدراسة إطارًا للتقييم النوعي (التأسيس التفسيري، الأمانة التمثيلية، خطر التحيز/التهميش) لتقييم الآثار الأخلاقية للتحليل المدعوم بالنماذج اللغية الكبيرة في المجالات الحساسة.
أدلة تجريبية على القيود: توفر النتائج أدلة تجريبية على أنه بينما يمكن للنماذج اللغية الكبيرة دعم المهام التحليلية منخفضة المستوى (مثل الترميز الأولي، والتعرف على البيانات)، فإن موثوقيتها تنخفض مع زيادة مستوى التجريد والغموض التفسيري، خاصة في الموضوعات المتعلقة بالهوية والقوة والتجربة المعاشة.
الأهمية والادعاءات
يزعم البحث أن التحليل الموضوعي المدعوم بالنماذج اللغية الكبيرة يقدم دورًا محدودًا في أبحاث HRI. وبينما يمكن للنماذج اللغية الكبيرة دعم المراحل المبكرة من التحليل بفعالية، تجادل الدراسة بأن آليات "الإنسان في الحلقة" (human-in-the-loop) تظل ضرورية للتفسيرات عالية المستوى، خاصة عند التعامل مع الفئات الضعيفة. ويؤكد المؤلفون أن مخاطر سوء التمثيل، وتسطيح التجربة المعاشة، وتضخيم التحيزات المعيارية تزداد حدة في هذه السياقات. وبناءً على ذلك، يجب على الباحثين الذين يستخدمون التحليل الموضوعي المدعوم بالنماذج اللغية الكبيرة ممارسة الرقابة التأملية لضمان عدم تهميش تجارب المشاركين الذين يهدفون إلى دراستهم بشكل منهجي. وتخلص الدراسة إلى أن الأنماط الملحوظة من المرجح أن تمتد إلى الفئات الضعيفة الأخرى، مما يستوجب الحاجة إلى سير عمل هجين (بشري-ذكاء اصطناعي) حيث يقوم الباحثون البشريون بمراجة وتنقيح المخرجات المولدة بواسطة النماذج اللغية الكبيرة للتخفيف من المخاطر الأخلاقية.