← أحدث الأبحاث
💬 NLP

From Prompt to Graph: Comparing LLM-Based Information Extraction Strategies in Domain-Specific Ontology Development

تقيم هذه الدراسة ثلاث استراتيجيات قائمة على النماذج اللغوية الكبيرة —التلقين المسبق، والتعلم في السياق، والضبط الدقيق— لأتمتة بناء الأنطولوجيا الخاصة بمجال تصنيع السباكة، بهدف تحديد النهج الأكثر فعالية لبناء والتحقق من صحة رسم بياني معرفي مع مدخلات الخبراء.

المؤلفون الأصليون: Xuan Liu, Ziyu Li, Mu He, Ziyang Ma, Xiaoxu Wu, Gizem Yilmaz, Yiyuan Xia, Bingbing Li, He Tan, Jerry Ying Hsi Fuh, Wen Feng Lu, Anders E. W. Jarfors, Per Jansson

نُشر 2026-02-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xuan Liu, Ziyu Li, Mu He, Ziyang Ma, Xiaoxu Wu, Gizem Yilmaz, Yiyuan Xia, Bingbing Li, He Tan, Jerry Ying Hsi Fuh, Wen Feng Lu, Anders E. W. Jarfors, Per Jansson

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من الكتب التقنية القديمة والفوضوية حول السباكة (عملية صب المعدن المنصهر في القوالب لصنع الأشياء). هذه الكتب ملي-ئة بالمعرفة القيمة، لكنها مدفونة داخل فقرات نصية، مكتوبة بأساليب مختلفة، ومبعثرة في كل مكان.

لجعل هذه المعرفة مفيدة للحواسيب، يحتاج المهندسون إلى بناء خريطة رقمية (تسمى الأنطولوجيا أو علم الوجود). هذه الخريطة تنظم المعلومات في فئات واضحة (مثل "المواد"، أو "العيوب"، أو "المعدات") وترسم خطوطاً تربط بين الأفكار ذات الصلة (مثل "درجة الحرارة تتحكم في وقت التصلب").

المشكلة هي أن بناء هذه الخريطة يدوياً يشبه محاولة قراءة كل صفحة من تلك الكتب، وتحديد الكلمات المهمة، ورسم الخطوط الرابطة بينها بنفسك. إن الأمر يستغرق وقتاً طويلاً، ويكلف الكثير من المال، وهو عمل ممل للغاية.

تسأل هذه الورقة البحثية: هل يمكننا استخدام ذكاء اصطناعي فائق الذكاء (نموذج لغوي كبير أو LLM) للقيام بالعمل الشاق بدلاً منا؟

اختبر الباحثون ثلاث طرق مختلفة لطلب قراءة هذه الكتب وبناء الخريطة من الذكاء الاصطناعي. إليكم كيف فعلوا ذلك، مشروحاً بأمثلة تشبيهية بسيطة:

المساعدون الثلاثة للذكاء الاصطناعي الذين تم اختبارهم

1. مساعد "المعرفة العامة" (النموذج اللغوي الكبير المُدرب مسبقاً)

  • كيف يعمل: تعطي الذكاء الاصطناعي مجموعة من التعليمات (أمر/Prompt) مثل: "اقرأ هذا النص وأخبرني بالكلمات المهمة وكيف ترتبط ببعضها". أنت لا تظهر له أي أمثلة لما تريده؛ بل تأمل فقط أن يكون لديه معرفة كافية من تدريبه العام.
  • النتيجة: الأمر يشبه طلب المساعدة من أمين مكتبة واسع الاطلاع ليخمن ما تحتاجه. لقد أصاب في بعض الأمور لكنه أغفل الكثير من التفاصيل. فقد وجد حوالي 77% من الكلمات الصحيحة ولكنه فاته الكثير من الروابط. إنه سريع وغير مكلف، لكنه ليس دقيقاً بما يكفي لخريطة مثالية.

2. مساعد "أرني مثالاً" (التعلم في السياق أو ICL)

  • كيف يعمل: قبل أن تطلب من الذكاء الاصطناعي قراءة النص الجديد، تعرض عليه بضعة أمثلة لما تريده. الأمر يشبه قولك: "هذه صفحة عينة حيث قمت بتحديد كلمة 'معدن' ورسمت خطاً إليها بكلمة 'قالب' مع عبارة 'مصنوع من'. الآن، افعل الشيء نفسه لهذه الصفحة الجديدة".
  • النتيجة: هذا يشبه إعطاء أمين المكتبة ورقة غش. لقد وجد كلمات أكثر بكثير من الطريقة الأولى (ما يقرب من 3 أضعاف!). ومع ذلك، كان لديه عادة غريبة في عدم الاتساق؛ ففي بعض الأحيان يطلق على العلاقة وصف "يتم معالجته بواسطة"، وفي أحيان أخرى يطلق عليها "يُصنع بواسطة"، رغم أنهما يعنيان الشيء نفسه. كما واجه صعوبة في إدراك أن كلمتين مختلفتين قد تعنيان نفس الشيء تماماً (المترادفات).

3. مساعد "المتدرب الذي درس ملاحظاتك" (الضبط الدقيق أو Fine-Tuning)

  • كيف يعمل: بدلاً من مجرد عرض الأمثلة، تقوم بـ "تدريب" الذكاء الاصطناعي خصيصاً على مجموعة بياناتك الصغيرة المصنفة. أنت تغذيه بالأمثلة مراراً وتكراراً حتى يتعلم القواعد والأسلوب المحدد الذي تريده. الأمر يشبه توظيف موظف جديد وقضاء أسبوع في تعليمه بالضبط كيف تنظم شركتك ملفاتها.
  • النتيجة: كان هذا هو الفائز الواضح. نظرًا لأنه تم تدريبه خصيصاً على أسلوبك، فقد كان دقيقاً للغاية. وجد الكلمات الصحيحة بنسبة 94% والروابط الصحيحة بنسبة 87%. كما كان أفضل بكثير في إدراك أن "درجة الانصهار" و"درجة حرارة الانصهار" هما الشيء نفسه.

النتيجة النهائية

استخدم الباحثون الطريقة الأفضل (المتدرب الذي تم ضبطه بدقة) لبناء أنطولوجيا سباكة حقيقية.

  • قاموا بتغذية النظام بآلاف الجمل من الكتب التقنية.
  • استخرج الذكاء الاصطناعي المصطلحات الرئيسية والعلاقات.
  • قاموا بتنظيف التكرارات وتنظيم كل شيء في قاعدة بيانات رسومية (Neo4j).
  • الإثبات: قام خبراء بشريون (مهندسو سباكة حقيقيون) بمراجعة عمل الذكاء الاصطناعي. وقد أكدوا أن 97% من المفاهيم و 93% من العلاقات كانت صحيحة.

الخلاصة

تخلص الورقة البحثية إلى أنه بينما يمكنك مجرد سؤال ذكاء اصطٍعي ذكي للقيام بالمهمة، إلا أنه من الأفضل تعليمه خصيصاً لمجالك.

  • الذكاء الاصطناعي العام: جيد كمسودة أولية سريعة، لكنه فوضوي.
  • الذكاء الاصطناعي القائم على الأمثلة: جيد في إيجاد الأشياء، لكنه فوضوي في التسميات.
  • الذكاء الاصطناعي المُدرب: هو الأكثر دقة وموثوقية، وقادر على بناء خريطة معرفية احترافية وعالية الجودة حتى مع وجود كمية صغيرة نسبياً من بيانات التدريب.

تثبت هذه الدراسة أنه مع التدريب الصحيح، يمكن للذكاء الاصطناعي تحويل الوثائق الهندسية غير المنظمة والفوضوية إلى قاعدة معرفية رقمية نظيفة ومنظمة وقابلة للاستخدام، مما يوفر على الخبراء العمل الشاق للتدوين اليدوي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →