← أحدث الأبحاث
💬 NLP

CitiLink-Minutes: A Multilayer Annotated Dataset of Municipal Meeting Minutes

تقدم هذه الورقة البحثية CitiLink-Minutes، وهي مجموعة بيانات متعددة الطبقات والموسومة تضم أكثر من مليون رمز (token) مستخرجة من ١٢٠ محضر اجتماع بلدية باللغة البرتغالية الأوروبية، وتتميز ببيانات وصفية مهيكلة، ومواضيع نقاش، ونتائج تصويت، وذلك لتعزيز الأبحاث في مجال معالجة اللغات الطبيعية واسترجاع المعلومات للحوكمة المحلية.

المؤلفون الأصليون: Ricardo Campos, Ana Filipa Pacheco, Ana Luísa Fernandes, Inês Cantante, Rute Rebouças, Luís Filipe Cunha, José Miguel Isidro, José Pedro Evans, Miguel Marques, Rodrigo Batista, Evelin Amorim, Alípio J
نُشر 2026-03-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ricardo Campos, Ana Filipa Pacheco, Ana Luísa Fernandes, Inês Cantante, Rute Rebouças, Luís Filipe Cunha, José Miguel Isidro, José Pedro Evans, Miguel Marques, Rodrigo Batista, Evelin Amorim, Alípio Jorge, Nuno Guimarães, Sérgio Nunes, António Leal, Purificação Silvano

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل اجتماع مجلس المدينة كأنه مكتبة ضخمة وفوضوية تُكتب فيها مئات الكتب كل عام. هذه الكتب هي محاضر الاجتماعات—السجلات الرسمية لما ناقشه السياسيون، والقوانين التي مرروها، ومن صوت لصالح ماذا.

لفترة طويلة، كانت هذه الكتب مغلقة في غرفة مظلمة. كانت مكتوبة بأسلوب مربك، ومليئة بالمصطلحات القانونية المعقدة، ولم يقم أحد بتنظيمها من قبل. أرادت برامج الكمبيوتر (الذكاء الاصطناعي) قراءتها للمساعدة في فهم كيفية عمل مدننا، لكنها لم تستطع لأن الكتب كانت فوضوية للغاية ولم تكن تحتوي على "فهارس" أو "جداول محتويات" لإرشادها.

يقدم هذا البحث مشروع CitiLink-Minutes، الذي يعمل بمثابة أمين مكتبة فائق التنظيم لكتيبات مجالس المدن هذه. إليك التفصيل البسيط:

1. المشكلة: جدار من النصوص

تخيل محاضر اجتماعات مجلس المدينة كمجموعة ضخمة وغير مرتبة من الملاحظات اللاصقة.

  • المشكلة: إذا أردت أن تعرف، "هل صوت مجلس المدينة لإصلاح الحفر في المنطقة الشمالية؟" عليك قراءة آلاف الصفحات من النصوص للعثين على تلك الجملة الواحدة.
  • الفجوة: بينما بنى الباحثون أدوات رائعة لتحليل الكلام (مثل نصوص المناظرات التلفزيونية)، إلا أنهم لم يمتلكوا أدوات جيدة للسجلات المدنية المكتوبة. لقد افتقروا إلى مجموعة بيانات نظيفة ومصنفة لتدريب ذكائهم الاصطناعي.

2. الحل: الفهرس الفائق "CitiLink"

ابتكر الباحثون مجموعة بيانات جديدة تسمى CitiLink-Minutes. تخيل أنهم أخذوا 120 كتاباً من هذه "الملاحظات اللاصقة" الفوضوية من ست مدن برتغالية مختلفة وأعطوها عملية تجديد شاملة.

لم يكتفوا بمسح الصفحات ضوئياً فحسب؛ بل أضافوا أربعة طبقات من "التظليل" (التعليقات التوضيحية) لكل جملة، مثل دليل دراسي ملون:

  • الطبقة 1: "مَن" (المعلومات الشخصية): وجدوا كل اسم ودور (مثل "العمدة" أو "عضو المجلس") ثم مسحوا الأسماء الحقيقية (استبدلوها بـ "الشخص أ" أو "العضو ب"). هذا يشبه طمس الوجوه في الصورة حتى يتعلم الذكاء الاصطناعي هيكل الاجتماع دون انتهاك الخصوصية.
  • الطبقة 2: "متى وأين" (البيانات الوصفية): قاموا بتحديد التاريخ، والوقت، والموقع، ونوع الاجتماع. إنه يشبه وضع بطاقة مكتبة مثالية على كل كتاب.
  • الطبقة 3: "ماذا" (المواضيع): حددوا المواضيع الرئيسية. هل كان الاجتماع عن "الميزانيات"؟ "الطرق"؟ "المدارس"؟ لقد صنفوا كل موضوع حتى يمكنك البحث حسب الموضوع.
  • الطبقة 4: "النتيجة" (التصويت): هذا هو الجزء الأكثر إثارة. لقد تتبعوا بدقة من صوت بـ "نعم"، ومن صوت بـ "لا"، ومن غاب، وما هو القرار النهائي. هذا يحول فقرة نصية إلى لوحة نتائج واضحة.

3. اللمسة البشرية

قد تعتقد أن الكمبيوتر قام بذلك، لكن لا. لقد استعان الباحثون بفريق من اللغويين البشر (مثل المحررين الخبراء) لقراءة كل صفحة وتطبيق هذه التصنيفات يدوياً.

  • لماذا؟ لأن الكمبيوتر يرتبك من اللغة البشرية الفوضوية. يمكن للإنسان أن يميز بين المزحة والتصويت الجاد؛ أما الكمبيوتر فغالباً لا يستطيع ذلك.
  • النتيجة: لقد أنشأوا مجموعة بيانات "المعيار الذهبي". إنها تشبه امتحان تدريبي مع نموذج الإجابة مرفق به، لكي يتمكن الباحثون الآخرون من تدريب ذكائهم الاصطناعي للقيام بنفس المهمة.

4. اختبار الذكاء الاصطنا artificial (النماذج المرجعية)

لإثبات فعالية هذه المجموعة من البيانات، جرب الباحثون تعليم نوعين من الذكاء الاصطناعي قراءة هذه المحاضر:

  1. "القارئ" (المُشفّر - Encoder): نموذج يقرأ النص ويستخرج الحقائق.
  2. "الكاتب" (التوليدي - Generative): نموذج يحاول التلخيص أو الإجابة على الأسئلة.

النتيجة: أدى نموذج "القارئ" (تحديداً النموذج المدرب على اللغة البرتغالية) مهمة رائعة. فقد استطاع إيجاد نتائج التصويت والمواضيع بدقة عالية. أما نموذج "الكاتب" فكان جيداً ولكنه ارتكب أخطاء أكثر. وهذا يخبرنا أنه بالنسبة لهذه المهمة المحددة، فإن الذكاء الاصطناعي الحذر الباحث عن الحقائق أفضل من الذكاء الاصطناعي الثرثار الذي يلخص النصوص.

5. لماذا يهم هذا؟

فكر في CitiLink-Minutes كأنه فتح الأبواب أمام "الصندوق الأسود" لمجلس المدينة.

  • للصحفيين: يمكنهم فوراً معرفة كيف صوت سياسي معين على قضية معينة.
  • للمواطنين: يمكنهم رؤية ما تفعله حكومتهم المحلية بالضبط دون الحاجة لقراءة 50 صفحة من النصوص القانونية.
  • للباحثين: لديهم أخيراً ساحة لعب نظيفة وآمنة ومنظمة لبناء أدوات أفضل لفهم الديمقراطية.

العائق (القيود)

يعترف البحث بأن مجموعة البيانات ليست مثالية بعد:

  • هي تغطي فقط ست مدن في البرتغال. إنه يشبه امتلاك خريطة لست بلدات فقط؛ قد لا تعمل بشكل مثالي لمدينة في دولة أخرى بقواعد مختلفة.
  • بعض تفاصيل التصويت لا تزال غامضة قليلاً (على سبيل المثال، نعرف أن "حزباً" قد صوت، ولكن ليس دائماً كل فرد بعينه).
  • الأسماء حالياً هي مجرد "الشخص أ"، ولكن النسخ المستقبلية قد تستخدم طرقاً أذكى لإخفاء الهويات مع الحفاظ على فائدة البيانات.

باخت hol (الخلاصة)

يتعلق هذا البحث بتحويل سجلات اجتماعات المدن المملة والفوضوية والصعبة القراءة إلى قاعدة بيانات نظيفة، قابلة للبحث، وآمنة من حيث الخصوصية. هذه هي المرة الأولى التي يتم فيها القيام بذلك بهذا القدر من الشمول لـمحاضر الاجتماعات المكتوبة، مما يمنح الذكاء الاصطناعي فرصة للمساعدة أخيراً في فهم كيف تعمل حكوماتنا المحلية حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →