RTI-Bench: A Structured Dataset for Indian Right-to-Information Decision Analysis
تقدم هذه الورقة البحثية RTI-Bench، وهي أول مجموعة بيانات مهيكلة متاحة للعموم لقرارات حق الحصول على المعلومات في الهند، وتتضمن تسميات للنتائج، واستشهادات بالإعفاءات، ومكونات تعليلية، صُممت لتمكين تحليل وتوقع نتائج الاستئناف الإداري.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل نظام "حق الحصول على المعلومات" (RTI) في الهند كمكتبة ضخمة وصاخبة حيث يحق لكل مواطن أن يطلب من الحكومة أي كتاب (معلومات) يريده. ولكن هنا تكمن المشكلة: المكتبيون (الموظفون الحكوميون) غالبًا ما يردون بشفرة سرية، والمدير الرئيسي للمكتبة (اللجنة المركزية للمعلومات - CIC) يكتب الأحكام النهائية بلغة قانونية كثيفة تشعرك وكأنك تقرأ كتاب تعاويذ أجنبي. معظم الناس يستسلمون لأنهم لا يستطيعون معرفة ما إذا كان الاستئناف يستحق العناء أم لا، أو ما يعنيه القرار فعليًا.
تقدم هذه الورقة البحثية RTI-Bench، وهي أداة جديدة مصممة لترجمة "كتاب التعاويذ" هذا إلى لغة إنجليزية بسيطة وتنظيم سجلات المكتبة بحيث يمكن للحواسيب أن تتعلم للمساعدة في عملية التيسير.
إليك تفصيل لما تفعله الورقة البحثية بالفعل، باستخدام تشبيهات بسيطة:
1. المشكلة: جدار من النصوص
تصدر اللجنة المركزية للمعلومات (CIC) آلاف القرارات كل عام. هذه القرارات عامة، لكنها مكتوبة بطريقة تفترض أنك محامٍ. إذا كنت تريد معرفة ما إذا كان ينبغي عليك محاربة قرار حكومي، فعليك الخوض في صفحات من المصطلحات المعقدة. تجادل الورقة بأننا بحاجة إلى "حجر رشيد" لفك تشفير هذه الوثائق.
2. الحل: RTI-Bench (خزانة الملفات المنظمة)
قام المؤلفون ببناء مجموعة بيانات مهيكلة تسمى RTI-Bench. فكر في هذا كتحويل كومة فوضوية من 1,516 وثيقة قانونية إلى خزانة ملفات رقمية مرتبة حيث لكل مجلد ملصقات واضحة.
- ماذا يوجد بداخلها: يحتوي كل ملف على علامات توضح النتيجة (هل فاز المواطن؟)، والأسباب المستخدمة (لماذا خسروا؟)، والجدول الزمني للأحداث.
- المصدر: لقد جمعوا البيانات من مكانين:
- 1,218 ملخصًا موجودًا عبر الإنترنت (والذي قاموا بتنقيته).
- 298 ملف PDF جديد تم تحميله مباشرة من موقع اللجنة المركزية للمعلومات (CIC) بين عامي 2023 و2026.
3. الطريقة: "المكتبي الآلي" (الاستخراج القائم على القواعد)
قد تتوقع أنهم استخدموا ذكاءً اصطناعيًا متطورًا لقراءة هذه الوثائق. بدلاً من ذلك، بنوا مسار عمل قائم على القواعد.
- التشبيه: تخيل مكتبيًا آليًا لا "يفكر" أو "يخمن". بدلاً من ذلك، يتبع قائمة مراجعة صارمة: "إذا رأيت كلمة 'DECISION' بأحرف كبيرة، انظر إلى السطر التالي. إذا رأيت 'Rs.'، ابحث عن رقم."
- لماذا فعلوا ذلك؟ يقول المؤلفون إن استخدام ذكاء اصطناعي ذكي (LLM) لتصنيف الوثائق القانونية أمر محفوف بالمخاطر لأن الذكاء الاصطناعي قد يخترع حقائق أو يرتبك. "روبوتهم الغبي" قابل للتكرار بنسبة 100%، ولا يكلف شيئًا، ويعمل في أقل من 90 ثانية على حاسوب محمول عادي.
- النتيجة: تحققوا من 50 ملفًا عشوائيًا يدويًا ووجدوا أن الروبوت كان دقيقًا بنسبة 95.3%.
4. التحدي: ثلاثة "خطوط" مختلفة
اكتشفت الورقة البحثية أن اللجنة المركزية للمعلومات (CIC) قد غيرت نماذج وثائقها ثلاث مرات منذ عام 2017.
- 2023a: يستخدم هيكلًا محددًا لـ "الحقائق / القرار".
- 2023b: يفصل "الملاحظات" عن "القرارات".
- 2026: التنسيق الحالي، الذي يستخدم كتل "DECISION" كبيرة وعريضة.
لقد تمت برمجة الروبوت للتعرف على هذه الخطوط الثلاثة المختلفة وتغيير استراتيجية القراءة الخاصة به وفقًا لذلك، تمامًا مثل مترجم ينتقل بين لهجات مختلفة.
5. الاختبار الأول: هل يمكن للحاسوب تخمين الفائز؟
اختبر المؤلفون نموذجًا أساسيًا للذكاء الاصطناعي (Mistral 7B) على 100 حالة لمعرفة ما إذا كان بإمكانه التنبؤ بالنتيجة بمجرد قراءة النص.
- الدرجة: حقق الذكاء الاصطناعي دقة بنسبة 57.3%.
- المقارنة: إذا كان الذكاء الاصطناعي سيخمن الإجابة الأكثر شيوعًا في كل مرة (مثل طالب يخمن الخيار "ج" في اختبار متعدد الخيارات)، فسيحصل فقط على 14.3% من الإجابات الصحيحة.
- الخلاصة: الذكالة الاصطناعي يؤدي بشكل أفضل بكثير من التخمين العشوائي، مما يثبت أن الحواسيب يمكنها تعلم فهم هذه القرارات القانونية، ولكن لا تزال هناك مساحة كبيرة للتحسين (خاصة بالنسبة للنتائج النادرة).
6. ماذا يمكننا أن نفعل بهذا؟ (المهام الأربع)
تقترح الورقة البحثية أربع ألعاب محددة للباحثين للعبها باستخدام هذه البيانات:
- التنبؤ بالنتيجة: "بناءً على القصة، هل سيفوز المواطن أم سيخسر؟"
- كشف الاستثناءات: "أي قاعدة سرية (مثل الخصوصية أو السرية التجارية) استخدمتها الحكومة لقول 'لا'؟"
- الملخص باللغة البسيطة: "ترجم هذا الأمر القانوني إلى جملة يفهمها الشخص العادي."
- التحقق من الامتثال: "هل اتبعت الحكومة الأمر بالفعل، أم أنهم بحاجة إلى غرامة؟" (ملاحظة: لديهم 17 مثالًا فقط لهذا، لذا فهو مجرد اختبار تجريبي).
7. التفاصيل الدقيقة (القيود)
المؤلفون صادقون جدًا بشأن ما لا تستطيع هذه الأداة فعله بعد:
- التغطية: لديهم فقط حوالي نصف ملفات PDF الجديدة المصنفة بالكامل؛ أما الباقي فيحتاج إلى مزيد من العمل.
- النطاق: يغطي هذا فقط اللجنة المركزية، وليس اللجان على مستوى الولايات (التي تتعامل مع حالات أكثر حتى).
- المنطق المفقود: الروبوت يلتقط الاستثناءات فقط عندما تكتب الحكومة رقم القاعدة صراحةً. إذا استخدموا قاعدة دون تسميتها، فإن الروبوت يخطئها.
- الأخلاقيات: يحذرون من عدم استخدام هذه الأداة لتثبيط الناس عن تقديم الاستئنافات. مجرد كون الاستئناف "غير مرجح الفوز" لا يعني أنه لا ينبغي تقديمه، لأن فعل التقديم في حد ذاته يضع الحكومة تحت المساءلة.
الملخص
RTI-Bench هي أول مجموعة بيانات منظمة ومنشورة لقرارات الـ RTI في الهند. إنها تستخدم روبوتًا بسيطًا قائمًا على القواعد لتحويل ملفات PDF القانونية الفوضوية إلى بيانات نظيفة. تظهر الاختبارات الأولية أن الحواسيب يمكنها البدء في فهم هذه القرارات، مما يمهد الطريق لأدوات مستقبلية قد تساعد المواطنين العاديين في التنقل في العالم المعقد لطلبات المعلومات الحكومية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.