Evaluating and Mitigating Hallucinations in Retrieval-Augmented Question Answering over Uzbek School Textbooks
تقدم هذه الدراسة مجموعة بيانات UzHistQA وتوضح أنه في حين أن التوليد المعزز بالاسترجاع يقلل بشكل كبير من الهلوسة في الإجابة على أسئلة التاريخ الأوزبكي، فإن فرض آليات الاستشهاد والامتناع عن الإجابة يعد ضروريًا للقضاء تمامًا على الإجابات المختلقة، مما يسلط الضوء على الحاجة إلى تقييم جودة الاسترجاع وأمانة التوليد بشكل منفصل في اللغات ذات الموارد المحدودة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في الفصول الدراسية الحديثة، يتجه الطلاب بشكل متزايد إلى الذكاء الاصطناعي لشرح المفاهيم الصعبة، أو تلخيص الفصول، أو التحضير للاختبارات. هذه المساعدات الرقمية مبنية على نماذج لغوية كبيرة، وهي أنظمة تدربت على كميات هائلة من النصوص التي يمكنها توليد إجابات سلسة، وواثقة، ومقنعة في كثير من الأحيان. ومع ذلك، يبرز خطر متميز عندما يطرح الطالب سؤالاً لا يعرف إجابته بعد: فهو يفتقر إلى المعرفة التي تمكنه من التحقق من الرد. فإذا اخترع النظام حقيقة ما، فستمر الأخطاء دون ملاحظة، ويتعلم الطالب شيئاً خاطئاً. ولإصلاح ذلك، طور الباحثون طريقة تسمى "التوليد المعزز بالاسترجاع". فبدلاً من الاعتماد فقط على الذاكرة الداخلية للنموذج، يبحث النظام أولاً في وثيقة موثوقة محددة — مثل كتاب مدرسي — للعثور على الفقرة ذات الصلة قبل الإجابة. وهذا يبقي الاستجابة مرتكزة على الواقع، لكنه لا يضمن المثالية. فقد يفشل النظام في العثور على الفقرة الصحيحة، أو قد يجد الفقرة الصحيحة ثم يتجاهلها، أو قد يسيء تفسير ما وجده.
هذا عدم اليقين حاد بشكل خاص في اللغة الأوزبكية، وهي لغة يتحدث بها الملايين ولكنها تُعتبر "منخفضة الموارد" في عالم الذكاء الاصطناعي. فخلافاً للغة الإنجليزية، التي تهيمن على البيانات المستخدمة لتدريب هذه النماذج، تمتلك الأوزبكية نصوصاً رقمية أقل. علاوة على ذلك، فإن الأوزبكية لغة إلصاقية، مما يعني أن كلمة جذرية واحدة يمكن تعديلها بالعديد من النهايات المختلفة لإنشاء مجموعة واسعة من الأشكال السطحية. فالطالب الذي يسأل عن "الاستقلال" قد يستخدم شكلاً للكلمة يبدو مختلفاً تماماً عن الشكل المستخدم في الكتاب المدرسي، مما يتسبب في فشل نظام البحث في العثور على الإجابة تماماً. وحتى الآن، لم تكن هناك طريقة معيارية لاختبار مدى جودة عمل هذه الأنظمة لتاريخ أوزبكستان أو لقياس عدد المرات التي تخترع فيها أشياء من تلقاء نفسها.
تعالج دراسة حديثة أجراها الباحث المستقل روزيمبوي خولموروتوف هذه الفجوة من خلال بناء مجموعة اختبار محددة تسمى UzHistQA، استناداً إلى كتاب مدرسي رسمي لتاريخ الصف العاشر يغطي الأعوام من 1917 إلى 1991. حلل الباحث الكتاب المدرسي ووجد عقبة لغوية كبيرة: فمن بين ما يقرب من 31,000 كلمة في الكتاب، ظهر أكثر من نصف أشكال الكلمات الفريدة مرة واحدة فقط. هذا التنوع الشديد يعني أن البحث البسيط عن تطابقات دقيقة للكلمات من المرجح أن يفشل. ولاختبار كيفية التغلب على ذلك، أنشأت الدراسة 56 سؤالاً، بما في ذلك بعض الأسئلة التي لا يستطيع الكتاب المدرسي الإجابة عليها ببساطة، لمعرفة ما إذا كان النظام سيعترف بجهله أم سيخترع استجابة. ثم قارن الباحث بين أربع طرق مختلفة لتشغيل النظام: طريقة تعتمد فقط على ذاكرتها الداخلية، وطريقة تبحث في الكتاب المدرسي باستخدام بحث دلالي قياسي، وطريقة تجمع بين ذلك وبين البحث بالكلمات المفتاحية، ونسخة أخيرة تم توجيهها بصرامة للاستشهاد بمصدرها ورفض الإجابة إذا كانت الأدلة مفقودة.
كانت النتائج صارخة. فعندما اعتمد النظام فقط على ذاكرته الداخلية دون النظر في الكتاب المدرسي، قدم ادعاءات غير مدعومة أو مختلقة في 91 بالمائة من ردوده. لقد اختلق بثقة تواريخ وأسماء وقوائم للأسئلة التي لم يغطها الكتاب المدرسي. وعندما أُجبر النظام على النظر في الكتاب المدرسي أولاً، انخفض معدل هذه الادعاءات غير المدعومة بشكل كبير إلى 9 بالمائة فقط. وقد أكد ذلك أن ترسيخ الإجابات في النص الفعلي أمر ضروري للموثوقية. ومع ذلك، كشفت الدراسة أيضاً عن تعقيد مفاجئ. فالنسخة التي استخدمت الطريقة الأكثر تطوراً للبحث، والتي جمعت بين الفهم الدلالي ومطابقة الكلمات المفتاحية، وجدت بالفعل الفقرات الصحيحة في كثير من الأحيان أكثر من البحث الأبسط. ورغم العثور على أدلة أفضل، أنتج هذا النظام المتقدم ادعاءات غير مدعومة أكثر من النظام الأبسط. يبدو أنه عندما استرجع النظام مجموعة أكبر وأكثر تنوعاً من الفقرات، فإن المعلومات الإضافية أربكت النموذج، مما أدى به إلى إجراء استنتاجات أو حسابات غير صحيحة حتى عندما كانت الحقائق موجودة أمامه مباشرة.
كانت التشكيلة الأكثر فعالية للسلامة هي تلك التي فرضت قواعد صارمة: كان على النظام الاستشهاد بالصفحة المحددة لكل ادعاء، وتم توجيهه لقول "أنا لا أعرف" إذا لم يتضمن الكتاب المدرسي الإجابة. هذا النهج ألغى جميع الإجابات المختلقة للأسئلة التي لا يغطيها الكتاب المدرسي. وكان المقابل هو أن النظام رفض الإجابة على 14 بالمائة من الأسئلة التي كان بإمكانه الإجابة عليها، حتى في بعض الحالات التي كانت فيها الإجابة موجودة في النص المسترجع. ويخلص الباحث إلى أنه في السياق التعليمي، يعد هذا الرفض ميزة ضرورية. فالطالب الذي يتلقى "أنا لا أعرف" يمكنه أن يطلب المساعدة من المعلم، أما الطالب الذي يتلقى إجابة مختلقة وواثقة، فإنه يتعلم معلومة خاطئة ولا يملك وسيلة لمعرفة أنها خطأ. وتؤسس الدراسة أنه بينما يجعل "التوليد المعزز بالاسترجاع" هذه الأنظمة قابلة للتطبيق في التعليم الأوزبكي، فإنه يتطلب تصميماً دقيقاً لمنع النظام من الهلوسة، وتسلط الضوء على أن العثور على المعلومات الصحيحة وكتابة إجابة صحيحة هما تحديان منفصلان يجب قياسهما بشكل مستقل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.