CiteRadar: A Citation Intelligence Platform for Researcher Profiling and Geographic Visualization
تُعد CiteRadar أداة مفتوحة المصدر تعمل عبر سطر الأوامر، تُمكّن الباحثين من تحليل تأثير الاستشهاد الخاص بهم وتصور النطاق الجغرافي من خلال دمج خمسة مصادر بيانات غير متجانسة عبر مسار معالجة قوي يتميز بإصلاحات متخصصة لنمذجة بيانات "Google Scholar"، وفك التباس أسماء المؤلفين، وإثراء بيانات المواقع من "OpenAlex" لإنتاج مخرجات مهيكلة وخرائط عالمية تفاعلية.
تخيل أنك باحث قد كتبت ورقة بحثية. أنت تعرف عدد المرات التي تم فيها الاستشهاد بها، لكنك لا تعرف من يقرؤها، أو أين يجلسون، أو مدى شهرتهم. الأمر يشبه معرفة أن أغنية ما قد عُزفت مليون مرة، ولكن دون معرفة ما إذا كانت تُغنى من قبل جوقة في كاتدرائية أو طفل في مرآب.
CiteRadar هو أداة جديدة ومجانية تعمل مثل محقق عالي التقنية لأبحاثك. يأخذ رابطاً واحداً لملفك الشخصي على "Google Scholar" ويبني "خريطة" كاملة لحيّك الفكري.
إليك كيف يعمل، مقسماً إلى أجزاء بسيطة:
1. المشكلة: "الصندوق الأسود" للاستشهادات
حالياً، إذا أردت معرفة من يبني على عملك، فلديك خياران سيئان:
خيار "الجدار المدفوع": يمكنك دفع آلاف الدولارات سنوياً للجامعات مقابل قواعد بيانات فاخرة (مثل Web of Science) التي تخبرك بهذه المعلومات.
الخيار "الأعمى": يمكنك استخدام أدوات مجانية مثل Google Scholar، لكنها تعطيك فقط رقماً إجمالياً (مثلاً: "500 استشهاد") دون إخبارك بالأسماء أو المواقع الخاصة بالأشخاص وراء هذه الأرقام.
2. الحل: CiteRadar
CiteRadar هو برنامج مفتوح المصدر ومجاني يسد هذه الفجوة. تعطي البرنامج معرف Google Scholar الخاص بك، وهو يقوم تلقائياً بخمس مهام ليعطيك تقريراً كاملاً:
جمع الأدلة: يقرأ قائمة أوراقك البحثية ويجد كل ورقة بحثية استشهدت بك على الإطلاق.
ملء الفراغات: يذهب إلى قواعد بيانات مجانية أخرى ليجد الأسماء الكاملة، والجامعات، والدول للأشخاص الذين استشهدوا بك.
فرز الحشود: ينشئ قائمتين: واحدة لمن يستشهد بك أكثر، وأخرى لمن هم أكثر "تأثيراً" (بناءً على نجاح مسيرتهم المهنية).
رسم الخريطة: ينشئ خريطة عالم تفاعلية توضح بدقة أماكن تواجد هؤلاء الباحثين. ప
تلخيص القصة: يكتب ملخصاً بنص بسيط يمكنك وضعه في طلب منحة أو سيرة ذاتية.
3. كيف يحل ألغاز "البيانات الفوضوية"
يشرح البحث أن الإنترنت فوضوي، وكان على CiteRadar ابتكار بعض الحيل الذكية للتعامل مع ذلك:
خلل "المساحة غير المرئية": يستخدم كود Google Scholar نوعاً خاصاً من "المساحات" (characters) يبدو طبيعياً على شاشتك ولكنه يربك الحواسيب. إذا حاول الحاسوب قراءة "المؤلف - المجلة، السنة" ولم يعرف كيفية التعامل مع هذه المساحة الخاصة، فإنه يعتقد أن هذا الجزء بالكامل هو اسم المؤلف. يمتلك CiteRadar "مترجماً" خاصاً يصلح هذا الخلل غير المرئي حتى يتمكن من فصل الأسماء عن المجلات بشكل صحيح.
مشكلة "توأم الاسم": تخيل وجود شخصين باسم "جون سميث". أحدهما بروفيسور مشهور ذو مسيرة مهنية ضخمة، والآخر طالب جديد. إذا نظر الحاسوب إلى الاسم فقط، فقد ينسب بالخطأ إحصائيات المسيرة المهنية للبروفيسور إلى الطالب. يستخدم CiteRadar "فحصاً ذا خطوتين": ينظر إلى الاسم و الجامعة معاً. إذا لم تتطابق الجامعة، فهو يدرك أنهما شخصان مختلفان. هذا يمنع "الطالب الجديد" من الحصول على درجة مسيرة مهنية مضخمة وهمية.
إصلاح "العنوان الخاطئ": أحد مصادر البيانات (OpenAlex) يعطي الباحثين رابطاً ويبياً لملفاتهم، لكن الحاسوب يحتاج إلى نوع مختلف من الروابط للحصول على بيانات المدينة. يقوم CiteRadar تلقائياً باستبدال "رابط الويب" بـ "رابط البيانات"، مما يحول نسبة النجاح في العثور على المدن من 0% إلى 60%.
4. ما الذي تحصل عليه؟
عندما ينتهي البرنامج، تحصل على مجلد يحتوي على:
خريطة عالم: يمكنك النقر على نقطة في الخريطة (مثل سيول أو بوسطن) ورؤية قائمة منبثقة لكل باحث من تلك المدينة استشهد بعملك.
قوائم التصنيف: يمكنك رؤية قائمة بـ "معجبيك المخلصين" (الأشخاص الذين يستشهدون بك كثيراً) و"معجبيك المهمين/VIP" (الباحثين المشهورين الذين يستشهدون بك).
تقرير ملخص: ملف نصي بسيط يخبرك: "134 شخصاً من 11 دولة استشهدوا بك، مع أكبر مجموعة في الولايات المتحدة".
لماذا هذا مهم؟
يجادل البحث بأن هذه الأداة تساعد الباحثين بثلاث طرق عملية ومحددة:
طلبات المنح: يمكنك أن تظهر لجهة التمويل: "انظروا، عملي يُستخدم من قبل مختبرات في ألمانيا والبرازيل"، مما يثبت أن بحثك له انتشار عالمي حقيقي.
الترقيات الوظيفية: يمكنك أن تثبت لجامعتك: "أنا أُستشهد بي من قبل علماء كبار مشهورين"، وهو أمر أكثر إبهاراً من مجرد قول "لدي 500 استشهاد".
إيجاد المتعاونين: إذا رأيت تجمعاً للباحثين في مدينة معينة يقرؤون عملك بالفعل، فأنت تعرف بالضبط من يجب أن تراسله لبدادة شراكة.
باخت-الكلمات، يحول CiteRadar قائمة مملة من الأرقام إلى خريطة حية ونابضة لمجتمع أبحاثك، مما يساعدك على رؤية من يستمع وأين يتواجدون.
إليك ملخص تقني مفصل لورقة البحث بعنوان "CiteRadar: منصة ذكاء الاستشهاد لتوصيف الباحثين والتصور الجغرافي."
1. بيان المشكلة
بينما تُعد مؤشرات القياس الببليوغرافي الإجمالية (مثل إجمالي عدد الاستشهادات، ومؤشر h) معايير قياسية لقياس التأثير البحثي، إلا أنها تفشل في الإجابة على أسئلة دقيقة وحاسمة للتطور المهني، وطلبات المنح، واكتشاف التعاون. يحتاج الباحثون إلى معرفة:
المنصات التجارية (Web of Science، Scopus) توفر هذه البيانات ولكنها تتطلب اشتراكات مؤسسية باهظة الثمن.
Google Scholar مجاني واسع الاستخدام ولكنه لا يكشف إلا عن أعداد إجمالية دون بيانات وصفية مهيكلة لكل مؤلف أو بيانات جغرافية.
واجهات برمجة التطبيقات المفتوحة (OpenAlex، CrossRef) توفر بيانات خام ولكنها تتطلب هندسة مخصصة كبيرة لتجميعها في أداة متماسكة ومؤتمتة.
الأدوات المفتوحة الموجودة (مثل CitationMap) تفتقر إلى تمييز المؤلفين، والتصنيفات المهيكلة، وإثراء البيانات من مصادر متعددة.
2. المنهجية
CiteRadar هو أداة سطر أوامر مفتوحة المصدر بلغة Python، تقوم بأتمتة مرحلة تدفق مكونة من خمس مراحل لتحويل معرف مستخدم واحد من Google Scholar إلى تقرير شامل لذكاء الاستشهاد. يدمج النظام خمسة مصادر بيانات متباينة: Google Scholar، وOpenAlex، وCrossRef، وSemantic Scholar، وOpenStreetMap Nominatim.
مراحل التدفق:
كشط بيانات Scholar وتتبع الاستشهادات:
يكشط قائمة المنشورات الكاملة من ملف تعريف Google Scholar.
يتتبع روابط "استشهد به" (Cited by) لكل ورقة بحثية ذات استشهادات أكبر من 0.
استراتيجية مكافحة الحظر: يستخدم بصمات متصفح واقعية، وتوقيت طلبات متحفظ (تأخير لمدة ثانيتين)، والتعافي التدريجي من خطأ 429 لتجنب تحديد معدل الطلبات.
إثراء البيانات الوصفية (CrossRef):
بالنسبة للأوراق التي يختصر فيها Google Scholar قوائم المؤلفين (عادةً عندما يتجاوز العدد 5 مؤلفين)، يقوم CiteRadar بالاستعلام من واجهة برمجة تطبيقات CrossRef باستخدام مطابقة تشابه العناوين لاسترداد قوائم مؤلفين كاملة ومهيكلة.
توصيف المؤلف عبر مصادر متعددة:
يحلل البيانات الوصفية الكاملة للمؤلف (الاسم، المؤسسة، الدولة، المدينة) عبر تسلسل هرمي للأولويات:
Semantic Scholar (الثانوي): حل بديل للأسماء والانتسابات.
CrossRef (الطرفي): حل بديل للأسماء المهيكلة.
إصلاح الرابط (URL Fix): صحح خطأً حرجاً حيث كان يتم جلب روابط الويب الخاصة بمؤسسات OpenAlex بدلاً من نقاط نهاية واجهة برمجة التطبيقات (API endpoints)، مما رفع توافر بيانات المستوى المدني من 0% إلى حوالي 60%.
تمييز المؤلفين وتصنيفهم:
ينفذ خوارزمية تمييز من مرحلتين لمنع دمج الكيانات ذات "الأسماء المتشابهة" (وهو فشل شائع في القياسات الببليوغرافية).
المرحلة 1: يتحقق من مؤسسة المؤلف المرشح مقابل مؤسسة الورقة البحثية المسجلة في المرحلة 3 باستخدام تشابه النصوص مع تصفية الكلمات الشائعة (stop-word-filtered).
المرحلة 2: في حال عدم وجود معرف OpenAlex، يبحث بالاسم ويقوم بتصفية المرشحين بناءً على تشابه الأسماء ومطابقة المؤسسة.
التصنيف: ينشئ جدولين مصنفين: الأول حسب تكرار الاستشهاد (كم عدد الأوراق التي استشهدت بالباحث) والثاني حسب مؤشر h (تأثير الباحث المستشهد به).
ينشئ خريطة عالم تفاعلية ذاتية الاحتواء باستخدام مكتبة Folium.
الترميز الجغرافي (Geocoding): يستخدم OpenStreetMap Nominatim لتحويل أزواج (المدينة/الدولة) إلى إحداثيات.
التصور: يستخدم علامات دائرية ذات مقياس لوغاريتمي لتمثيل كثافة الباحثين، مما يمنع المدن الكبيرة من حجب المدن الأصغر.
3. المساهمات التقنية الرئيسية
تحدد الورقة وتحل أربعة تحديات تقنية محددة:
محلل مسافات Unicode غير الفاصلة (Non-Breaking Space): يستخدم Google Scholar HTML رمز U+00A0 (مسافة غير فاصلة) بدلاً من المسافات القياسية حول الفواصل. يقوم CiteRadar بتنفيذ تطبيع صريح لـ Unicode لضمان تحليل حقول المجلة والسنة بشكل صحيح، والتي تظل فارغة في المحللات البدائية.
تشابه المؤسسات المصفى بالكلمات الشائعة: لحل مشكلة تمييز المؤلفين، يقوم النظام بتصفية الكلمات الشائعة للمؤسسات (مثل "University"، "of"، "Lab") قبل حساب تشابه النصوص. هذا يمنع المطابقات الخاطئة بين المؤسسات المتميزة (مثل "Texas Tech University" مقابل "University of Texas") ويقلل أخطاء نسب مؤشر h بنسبة تصل إلى 9 أضعاف.
تحويل رابط API الخاص بـ OpenAlex: اكتشف المؤلفون أن جلب بيانات المؤسسات عبر رابط الويب يعيد صفحات HTML بدلاً من JSON. قاموا بهندسة تحويل للمسار (/openalex.org/→/api.openalex.org/institutions/)، مما زاد نسبة المؤلفين الذين لديهم بيانات على مستوى المدينة من 0% إلى حوالي 60%.
المقياس اللوغاريتمي للخريطة: تستخدم الخريطة التفاعلية دالة مقياس لوغاريتمي لنصف قطر العلامات (r(n)=max(7,7+10log2(n+1))) ولوحة ألوان مرتبة إدراكياً لعرض كثافة الاستشهادات بفعالية دون ازدحام بصري.
4. النتائج ودراسة الحالة
تحقق المؤلفون من صحة CiteRadar من خلال توصيف ملف تعريف Google Scholar الخاص بهم (في مجال HPC وAI Systems).
النطاق: عالجت عملية التدفق 134 باحثاً مستشهداً فريداً عبر 11 دولة و31 مؤسسة.
الرؤية الجغرافية: حددت تجمعاً مهيمناً في الولايات المتحدة (64%) وتجمعاً مستقلاً هاماً في كوريا الجنوبية (9%)، وتحديداً في جامعة سوغانغ (Sogang University).
نجاح التمييز: نجح النظام في التمييز بين الباحثين ذوي الأسماء المتشابهة، وتصفية المدخلات الزائفة (مثل أسماء المؤتمرات التي اختلطت بأسماء المؤلفين) ونسب مؤشر h بشكل صحيح.
النتائج القابلة للتنفيذ:
كشف عن اعتماد منهجية المؤلف من قبل 20 باحثاً في مختبر أوك ريدج الوطني (مفيد لمقترحات منح وزارة الطاقة الأمريكية DOE).
حدد باحثين رفيعي المستوى (مؤشر h ≥ 50) استشهدوا بالعمل، مما يوفر أدلة نوعية لحالات الترقية أو التثبيت الأكاديمي.
اكتشف تأثيراً عابراً للتخصصات (أوراق اختبار نماذج LLM تم الاستشهاد بها من قبل باحثي تصميم VLSI).
5. الأهمية
يسد CiteRadar الفجوة بين بيانات الاستشهاد الخام والذكاء القابل للتنفيذ للباحثين الأفراد.
سهولة الوصول: يعمل على دمقرطة الوصول إلى ذكاء القياس الببليوغرافي رفيع المستوى الذي كان محصوراً سابقاً في المؤسسات ذات الاشتكات الباهظة.
الدقة: ينتقل من مجرد "كم عدد" الاستشهادات إلى "مَن" و"أين"، مما يتيح تعاوناً مستهدفاً وتخطيطاً استراتيجياً للمسار المهني.
قابلية التكرار: كحزمة يمكن تثبيتها عبر أمر pip install واحد، فإنه يقدم سير عمل شفافاً وقابلاً للتكرار لتحليل الاستشهادات.
المتانة: من خلال معالجة السمات الخاصة بالتحليل وقيود واجهات برمجة التطبيقات لمصادر البيانات الرئيسية، يضع معياراً جديداً للموثوقية في أدوات الاستشهاد مفتوحة المصدر.
التوفر: الأداة مفتوحة المصدر (رخصة MIT) ومتاحة على https://github.com/chenxuniu/citeradar.