Testing Frontier LLMs on Indian Statutory Interpretation: The Indian Construction Canon Benchmarking (ICCB) -Pilot Benchmark
تقدم هذه الورقة البحثية معيار ICCB-Pilot لتقييم النماذج اللغوية الكبيرة الرائدة في التفسير التشريعي الهندي، كاشفةً أنه في حين تستطيع النماذج غالباً التنبؤ بالنتائج القانونية الصحيحة، إلا أنها تفشل في تحديد وتطبيق القواعد التفسيرية الأساسية بشكل صحيح، مما يشير إلى أن استدلالها يعتمد على مطابقة الأنماط السطحية بدلاً من الفهم الفقهي الحقيقي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم القانون، نادراً ما تكون قراءة النص التشريعي ببساطة قراءة تعريف في قاموس. فعندما يواجه القاضي قانوناً غامضاً أو مبهماً، فإنه لا يكتفي بمجرد التخمين للوصول إلى الإجابة؛ بل يتبع مجموعة محددة من الأدوات الذهنية تُعرف بـ "قواعد التفسير" (canons of construction). وهذه القواعد هي قواعد استرشادية راسخة توضح كيفية فهم النص. فعلى سبيل المثال، قد تنص إحدى القواعد على أنه إذا كان القانون يهدف لمعاقبة شخص ما، فيجب قراءته بصرامة شديدة، حرفياً كما هو. وقد تنص قاعدة أخرى على أنه إذا كان القانون مصمماً لمساعدة الفقراء، فيجب قراءته بشكل واسع ليشمل أكبر عدد ممكن من الناس. هذه الأدوات هي الفارق بين قاضٍ يسترجع مجرد قضية سابقة، وقاضٍ يمارس التفكير المنطقي في مشكلة جديدة. ومع بدء دخول أنظمة الذكاء الاصطناعي إلى قاعات المحاكم والمكاتب القانونية، يبرز سؤال جوهري: هل تفهم هذه الآلات حقاً كيفية استخدام هذه الأدوات، أم أنها مجرد بارعة جداً في تخمين الإجابة الصحيحة بناءً على الأنماط التي رأتها من قبل؟
لقد شرع فريق من الباحثين من أكاديمية مانيبل للتعليم العالي في الهند في اختبار هذا السؤال باستخدام أحدث أجيال نماذج الذكاء الاصطناعي. حيث قاموا بإنشاء اختبار متخصص، أطلقوا عليه اسم "المعيار المرجعي" (benchmark)، يركز بالكامل على كيفية تفسير هذه الآلات للقوانين الهندية. وبدلاً من مطالبة الحواسيب بمجرد التنبؤ بنتيجة قضية ما، طلب منهم الباحثون شرح طريقة تفكيرهم. قدم الاختبار للنماذج أربعين سيناريو قانونياً مختلفاً مستمداً من أحكام قضائية هندية حقيقية. وفي كل سيناريو، كان على النموذج تحديد قاعدة التفسير المحددة التي يجب استخدامها، وشرح تلك القاعدة بشكل صحيح، ثم تطبيقها على الوقائع للوصول إلى استنتاج. وقد قيم الباحثون النماذج بناءً على خمسة جوانب متميزة: ما إذا كانت قد اختارت القاعدة الصحيحة، وما إذا كانت قد وصفت تلك القاعدة بدقة وفقاً للتقاليد القانونية الهندية، وما إذا كانت قد طبقتها بشكل صحيح على الوقائع، وما إذا كانت قد توصلت إلى الإجابة النهائية الصحيحة، ومدى وضوح منطقها العام.
وكشفت النتائج عن فجوة صارخة بين ما تستطيع الآلات فعله وبين كيفية قيامها به. فقد كانت أقوى نماذج الذكاء الاصطناعي المختبرة جيدة بشكل مدهش في الوصول إلى الإجابة النهائية الصحيحة. وفي حالات كثيرة، توصلت إلى نفس النتيجة التي كان سيصل إليها القاضي البشري. ومع ذلك، عندما نظر الباحثون في كيفية وصول النماذج إلى تلك النتائج، تغيرت الصورة. فقد فشلت النماذج تكراراً في تحديد القاعدة القانونية المحددة التي تستخدمها. وكثيراً ما توصلت إلى النتيجة الصحيحة دون معرفة الأداة الصحيحة لاستخدامها، مما يشير إلى أنها تطابق الموقف مع نمط مألوف بدلاً من اتباع مسار منطقي. الأمر يشبه طالباً يمكنه حل مسألة رياضية معقدة بشكل صحيح، لكنه لا يستطيع شرح الصيغة التي استخدمها أو لماذا نجحت. ووجدت الدراسة أنه عندما أخبر الباحثون النماذج صراحةً بالقاعدة التي يجب استخدامها، أصبحت النماذج أفضل بكثير في تسمية تلك القاعدة، لكن قدرتها على شرحها أو تطبيقها لم تتحسن بشكل ملحوض. وهذا يشير إلى أن النماذج تمتلك المعرفة بهذه القواعد القانونية، لكنها تجد صعوبة في الوصول إليها بمفردها دون توجيه مباشر.
كما لاحظ الباحثون أن النماذج تتصرف بشكل مختلف اعتماداً على كيفية طرح السؤال. فعندما تُترك لتكتشف المشكلة بنفسها، غالباً ما تتردد النماذج أو ترفض الإجابة، وخاصة النموذج مفتوح المصدر الذي تم اختباره. ولكن، عندما قدم لها الباحثون تلميحاً حول نوع القاعدة المراد استخدامها، كانت النماذج أكثر استعداداً للمشاركة. ورغم هذا التحسن في الاستعداد، ظلت المشكلة الجوهرية قائمة: كانت النماذج لا تزال أفضل في تخمين النتيجة الصحيحة من بناء الحجة القانونية الصحيحة. أحد النماذج، على وجه الخصوص، وصل باستمرار إلى النتيجة الصحيحة في كثير من الأحيان أكثر مما حدد المبدأ القانوني بشكل صحيح، ومع ذلك، ارتكب أخطاء جسيمة في استنتاجاته النهائية. هذا الانفصال بين الإجابة الصحيحة وعملية الاستنتاج الصحيحة يعد اكتشافاً هاماً. فهو يعني أنه إذا تم نشر هذه الأنظمة في بيئات قانونية حقيقية بناءً على قدرتها فقط على التنبؤ بالنتائج، فقد تقدم إجابات صحيحة لأسباب خاطئة، وهو أمر قد يكون خطيراً في نظام يكون فيه المنطق نفسه لا يقل أهمية عن النتيجة.
وخلصت الدراسة إلى أنه على الرغم من أن أنظمة الذكاء الاصطناعي هذه أدوات قوية، إلا أنها لم تتقن بعد نوع التفكير المطلوب للتفسير القانوني. فهي تبدو معتمدة بشكل كبير على التعرف على الأنماط بدلاً من التطبيق المتسلسل للقواعد القانونية الذي يستخدمه القضاة البشر. ويؤكد الباحثون أن هذا لا يعني أن التكنولوجيا عديمة الفائدة، ولكنه يعني أيضاً أنه لا يمكننا الوثوق في هذه الأنظمة لتعمل مثل المحامين لمجرد أنها تحصل على الإجابة الصحيحة. وتعد هذه الدراسة بمثابة تجربة استرشادية، وهي اختبار صغير النطاق صُمم لإثبات أن هذا النوع المحدد من التقييم ممكن وضروري. ويخطط الفريق لتوسيع هذا العمل في المستقبل، عبر اختبار المزيد من النماذج ومجموعة أوسع من القوانين لمعرفة ما إذا كانت هذه الأنماط ستظل ثابتة في جميع الحالات. وفي الوقت الحالي، تشير النتائج إلى تحذير واضح: في العالم المعقد للقانون، الحصول على الإجابة الصحيحة ليس كافياً؛ بل يجب على الآلة أيضاً أن تكون قادرة على توضيح خطوات عملها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.