COCI: Conference Organisers and Content Identifier
تقدم هذه الورقة إطار عمل COCI، وهو إطار عمل قائم على الذكاء الاصطناعي يستخدم النماذج اللغوية الكبيرة والخرائط الدلالية لاستخراج بيانات وصفية مهيكلة من طلبات تقديم الأوراق البحثية غير المهيكلة، وبالتالي دمج الأدبيات الرمادية في الرسوم البيانية للمعرفة العلمية الراسخة من أجل التحليل المنهجي.
غالبًا ما يُتخيل العلم على أنه مجموعة من الكتب المكتملة والمقالات المجلدة، وهي التقارير النهائية للأبحاث التي مرت عبر بوابات تحريرية صارمة. ومع ذلك، فإن جزءًا هائلاً من الحوار العلمي يحدث قبل وقت طويل من طباعة تلك الصفحات النهائية. هذا هو عالم "الأدب الرمادي"، وهو مصطلح يطلق على الوثائق التي توجد خارج قنوات النشر التقليدية. ومن بين هذه الوثائق "دعوات تقديم الأوراق البحثية"، وهي في الأساس دعوات يرسلها منظمو المؤتمرات لجمع أبحاث جديدة. وتعد هذه الوثائق حيوية لأنها تكشف عن الشرارات الأولى للأفكار الجديدة، وتوضح المواضيع التي يتحمس لها الباحثون ومن يقود المسيرة. ومع ذلك، نظرًا لأن هذه الدعوات غالبًا ما تكون مبعثرة عبر قوائم البريد الإلكتروني وصفحات الويب البسيطة، فإنها تفتقر إلى الملصقات المنظمة والمنسقة التي تستخدمها المكتبات وقواعد البيانات لتنظيم المعلومات. وهذا يجعل من المستحيل تقريبًا دراستها على نطاق واسع، مما يترك فجوة كبيرة في فهمنا لكيفية تطور العلم ومن يشكله.
ولحل هذه المشكلة، قام فريق من الباحثين ببناء أداة رقمية جديدة تسمى COCI، وهي اختصار لـ "مُعرّف منظمي المؤتمرات والمحتوى" (Conference Organisers and Content Identifier). فكر في هذا النظام كمترجم ماهر للغاية يمكنه قراءة النصوص الفوضوية وغير المنظمة وتحويلها إلى قائمة نظيفة ومنظمة من الحقائق. لقد غدّى الباحثون نظامهم بنصوص خام من أربعين دعوة مؤتمر مختلفة، تغطي مجالات من علوم الحاسوب إلى علوم المواد. تستخدم الأداة ذكاءً اصطناعيًا متقدمًا لمسح النص واستخراج تفاصيل محددة: اسم المؤتمر، ومكان وزمان انعقاده، والمواضيع العامة التي ستتم مناقشتها، والأهم من ذلك، أسماء وأدوار كل شخص ينظم الحدث.
وما يجعل هذه الأداة قوية بشكل خاص هو ما تفعله بعد استخراج تلك الأسماء. فبدلاً من مجرد إدراج شخص ما باسم "جون سميث"، يعمل النظام على ربط ذلك الاسم بمعرّف رقمي فريد ودائم يستخدمه المجتمع البحثي العالمي. فهو يتحقق من نتائج بحثه مقابل عدة قواعد بيانات ضخمة ومرموقة لضمان أنه وجد الشخص الصحيح والمؤسسة الصحيحة. إذا وجد النظام تطابقًا، فإنه يربط معرّفًا فريدًا بملف الشخص الشخصي، مما يربطه بأعماله السابقة ومؤسسته. كما يفعل الشيء نفسه مع المؤتمر نفسه، حيث يربط الحدث بسجلات معروفة للتجمعات المماثلة. هذه العملية تحول دعوة بسيطة وغير رسمية إلى بيانات مهيكلة يمكن ربطها مع السجلات العلمية الأخرى، مما يسد الفجوة فعليًا بين الإعلانات غير الرسمية والخرائط الرسمية للمعرفة العلمية.
اختبر الباحثون نظامهم عن طريق معالجة أربعين نموذجًا من العالم الحقيقي ثم التحقق يدويًا من النتائج لمعرفة مدى أدائه. نجحت الأداة في استخراج البيانات الوصفية (metadata) من كل وثيقة قامت بتحليلها. وفي حالة محددة، كشفت مخرجات النظام عن عدم تطابق في قاعدة بيانات خارجية؛ وأظهر التحقيق أن هذا لم يكن فشلًا في خوارزمية المحاذاة الخاصة بـ COCI، بل كان خطأً قائمًا في قاعدة بيانات OpenAlex نفسها، والتي أدرجت اسم المنظم كاسم مستعار لشخص باحث آخر. تسلط هذه الحالة الضوء على أن موثوقية الاستخراج الدلالي تعتمد أحيانًا على جودة البيانات المترابطة (Linked Data) الخارجية. كما بنى الفريق واجهة مرئية تعرض هذه المعلومات بوضوح، حيث تُظهر تفاصيل المؤتمر، وقائمة المنظمين مع هوياتهم المتحقق منها، والمواضيع المخططة وفقًا للفئات العلمية القياسية. ويفتح هذا التمثيل المهيكل مسارات للاتصال بقواعد البيانات الخارجية، مما يسمح بالاحتمالية المستقبلية للتحقق مما إذا كان المنظمون قد شاركوا سابقًا في سلوكيات أكاديمية غير سليمة.
الهدف النهائي من هذا العمل هو إعطاء اعتراف رسمي للعمل غير المرئي الذي يقوم به تنظيم المجتمع العلمي. ومن خلال تحويل هذه الوثائق المتفرقة وغير الرسمية إلى بيانات مهيكلة، أنشأ الباحثون أساسًا لطريقة جديدة لتتبع صحة وجودة المؤتمرات الأكاديمية. وفي المستقبل، يخططون لبناء نظام يبحث تلقائيًا عن الدعوات الجديدة فور ظهورها، مما يخلق سجلًا حيًا لكيفية تشكل المجتمعات العلمية وتغيرها. ومن شأن ذلك أن يسمح للمجتمع الأوسع بفهم المراحل المبكرة لاتجاهات البحث وتقدير الأشخاص الذين يبنون منصات الاكتشاف، مما يضمن رؤية العمل المتمثل في تنظيم العلم وتقديره تمامًا مثل البحث نفسه.
بيان المشكلة على الرغم من الدور الحاسم للأدبيات الرمادية في التواصل العلمي، إلا أن المصنفات مثل "دعوات تقديم الأوراق البحثية" (Calls for Papers - CfPs) تظل معزولة إلى حد كبير عن الرسوم البيانية المعرفية العلمية الحديثة (SKGs). وخلافاً للمنشورات الرسمية أو حتى المسودات الأولية (preprints) التي غالباً ما تستخدم مستودعات ومعرفات كائن رقمي (DOIs) قياسية، تتميز دعوات تقديم الأوراق بكونها غير منظمة، وشديدة التباين، وتتوزع عبر قنوات مؤقتة (مثل القوائم البريدية، وصفحات الويب الثابتة). هذا النقص في الضبط الببليوغرافي التقليدي والاتساق الهيكلي قد أعاق تاريخياً المعالجة واسعة النطاق، مما ترك بُعداً حيوياً للبحث — وتحديداً المراحل المبكرة والجنينية للفعاليات الأكاديمية والتنظيم المجتمعي — مغفولاً عنه في تحليلات الميتا-علم (metascience) والقياس العلمي (scientometrics).
المنهجية يقدم البحث إطار عمل COCI (مُعرف المنظمين والمحتوى للمؤتمرات)، وهو إطار يعتمد على الذكاء الاصطناعي مصمم لأتمتة استخراج البيانات الوصفية دقيقة التفاصيل والمنظمة من النصوص الخام لدعوات تقديم الأوراق (CfP). يعمل النظام عبر مسار متعدد المراحل يدمج النماذج اللغوية الكبيرة (LLMs) مع تقنيات الربط الدلالي:
هندسة الأوامر والاستخراج: تبدأ العملية بالاستعلام من نموذج GPT-4o باستخدام قالب أمر (prompt) متكرر ومصقول تم ضبطه بدقة بناءً على أكثر من 40 ملف دعوة (CfP) من مجالات أكاديمية متنوعة. يقوم النموذج بتحليل النص الخام لتحديد العناصر الرئيسية (اسم الفعالية، السلسلة، السنة، الموقع، المواضيع، واللجنة المنظمة). ولض้อม ضمان قابلية القراءة الآلية، يتم فرض مخطط JSON صارم أثناء طلب واجهة برمجة التطبيقات (API).
فض الالتباس بين المؤلفين والكيانات: يتم مطابقة المنظمين المستخرجين مع قاعدة بيانات OpenAlex. ولمعالجة تحديات فض الالتباس بين المؤلفين، يستخدم النظام استراتيجية هجينة: حيث يعطي الأولوية لمطابقة المؤسسات أولاً للحد من هلوسات النماذج اللغوية الكبيرة فيما يتعلق بالانتماءات. وعند الضرورة، يلجأ إلى عمليات بحث تعتمد على الاسم فقط باستخدام قواعد استدلالية قائمة على عدد المنشورات وتشابه "ليفنشتاين" للنصوص (Levenshtein string similarity). تعمل هذه الخطوة على إثراء الملفات الشخصية بمعرفات مستمرة، بما في في ذلك معرفات ORCID ومعرفات سجل المنظمات البحثية (ROR).
محاذاة سلسلة المؤتمرات: يتم محاذاة أسماء سلاسل المؤتمرات المستخرجة مع ثلاث قواعد معرفية خارجية: DBLP، وAIDA Dashboard، وTIB ConfIDent. ويستخدم ذلك نهجاً ثنائ الطبقات:
البحث الدلالي: يتم تحويل النص إلى تضمينات متجهة كثيفة بأبعاد 384 باستخدام نموذج all-MiniLM-L6-v2 من فئة SentenceTransformers.
التحقق: يتم التحقق من المطابقات بصرامة باستخدام تشابه "ليفنشتاين" لتجنب الإيجابيات الكاذبة الشائعة في الاسترجاع القائم على المتجهات فقط. تضمن قدرات الرب cross-referencing أن أي مطابقة في قاعدة بيانات واحدة (مثل DBLP) تسترجع تلقائياً المعرفات المقابلة لها في قواعد البيانات الأخرى.
الربط الموضوعي الدلالي: يتم ربط المواضيع البحثية غير المنظمة والعشوائية مع تصنيف OpenAlex المنضبط. وبشكل مشابه لمحاذاة السلاسل، يتم تحويل المواضيع إلى تضمينات متجهة كثيفة ومقارنتها مع تضمينات مفاهيم OpenAlex مسبقة الحساب باستخدام تشابه جيب التمام (cosine similarity). يتم تطبيق عتبة تشابه افتراضية قدرها 0.6 لتحديد المصطلحات المتكافئة دلالياً، مما يسمح للنظام بالتعامل مع إعادة الصياغة والاختلافات النحوية الطفيفة دون الاعتماد على المطابقة النصية الجامدة.
التصور والتصدير: تُعرض البيانات المعالجة عبر واجهة ويب (Streamlit)، تعرض البيانات الوصفية الأساسية، وجدولاً تفاعلياً للمنظمين مع ملفات شخصية علمية مرتبطة، والمواضيع المربوطة. يمكن تصدير مجموعة البيانات المثرية كملف Microsoft Excel.
المساهمات الرئيسية
تطوير إطار العمل: إنشاء COCI، وهي أداة مصممة خصيصاً لسد الفجوة بين النشر العلمي غير الرسمي (دعوات تقديم الأوراق) وبين موارد الويب الدلالي المنظمة.
دمج الأدبيات الرمادية: التطبيق الناجح للنماذج اللغوية الكبيرة (LLMs) جنباً إلى جنب مع الربط الدلالي لاستخراج بيانات وصفية منظمة من وثائق غير متجانسة للغاية وغير منظمة كانت تقاوم التحليل واسع النطاق سابقاً.
الإثراء الدلالي: القدرة على ربط الكيانات المستخرجة بقواعد المعرفة الراسخة (OpenAlex, DBLP, TIB ConfIDent, AIDA)، مما يحول بيانات الفعالاليات المعزولة إلى مجموعة بيانات مترابطة ومتماسكة صالحة للرسوم البيانية المعرفية العلمية.
الموارد المفتوحة: إصدار كود COCI (الإصدار 1.2.0) وفيديو توضيحي للمجتمع العلمي.
النتائج تم تقييم إطار العمل على مجموعة بيانات مكونة من 40 دعوة (CfP) تغطي علوم الحاسوب، الهندسة، القياس العلمي، وعلوم المواد.
الأداء: نجح COCI في معالجة جميع الوثائق الأربعين واستخراج بياناتها الوصفية.
التحديات المحددة: أبرز التقييم أن موثوقية الاستخراج الدلالي تعتمد على جودة البيانات المترابطة (Linked Data) الخارجية. تضمنت إحدى الحالات الشاذة تحديداً خطأ في ربط أحد المنظمين بملف تعريف في OpenAlex تحت اسم مختلف؛ وكشف التحقيق أن هذا كان خطأً موجوداً بالفعل داخل قاعدة بيانات OpenAlex نفسها (حيث أدرج الاسم كاسم مستعار لباحث آخر)، وليس فشلاً في خوارزمية المحاذاقة الخاصة بـ COCI.
المتانة: يتضمن النظام قواعد استدلالية لمعالجة هلوسات النماذج اللغوية الكبيرة، مثل رفض بيانات الانتماء إذا تجاوز عدد المنظمين الفريدين عدد المؤسسات الفريدة بشكل كبير.
الأهمية يزعم البحث أن COCI يضع الأساس للتحليل المنهجي للفعاليات الأكاديمية غير القائمة على الناشرين. ومن خلال هيكلة الأدبيات الرمادية وربطها بالرسوم البيانية المعرفية الخارجية، توفر الأداة لعلماء الميتا-علم أداة تأسيسية لتتبع العلم في مراحله الأولى. ويرى المؤلفون أن هذا التمثيل المنظم يتيح:
تقييم صحة وجودة العلم في المؤتمرات الأكاديمية (على سبيل المثال، تقييم تنوع وخبرة الفرق التنظيمية).
التحقيق في احتمالية سوء السلوك الأكاديمي من خلال الربط المتقاطع للمنظمين مع قواعد بيانات مثل Retraction Watch وPubPeer.
إنشاء منصة اعتراف رسمية تمنح الباحثين ائتماناً قابلاً للقياس لمساهماتهم المجتمعية، على غرار النموذج الذي وضعه Publons لمراجعة الأقران.
تشمل الأعمال المستقبلية التي حددها المؤلفون تطوير محرك زحف مستمر لحصاد الدعوات الجديدة من سجلات مثل WikiCFP، وتنفيذ طرق منهجية للتحليلات الطولية لتتبع النماذج الناشئة وشبكات التعاون.