A Hybrid Semantic–Lexical Framework for Intelligent Data Quality Enhancement Using Ontology Reasoning and NLP-Based Validation
تقترح هذه الورقة إطار عمل هجينًا دلاليًا-معجميًا يدمج الاستدلال القائم على الأنطولوجيا مع التحقق المعجمي المدفوع بمعالجة اللغات الطبيعية لتعزيز كشف الشذوذ السياقي والتصحيح الذكي للبيانات في مجموعات البيانات النصية غير المتجانسة بشكل كبير، كما يتضح من الأداء المتفوق على البيانات الصحية الملوثة مقارنة بالنهج التقليدية المعتمدة على المعجم فقط.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في العالم الحديث، تُعد البيانات هي الوقود الذي يغذي كل شيء، من السجلات الطبية إلى الأسواق المالية. ومع ذلك، غالبًا ما يكون هذا الوقود ملوثًا. فتمامًا كما يتعثر محرك السيارة بسبب البنزين الملوث، تفشل الأنظمة الحاسوبية الذكية عندما تُغذى بمعلومات غير دقيقة أو ناقصة أو مربكة. وتتفاقم هذه المشكلة بشكل خاص مع النصوص، حيث يمكن لخطأ مطبعي بسيط أو كلمة في غير موضعها أن يغير المعنى الكامل للسجل. لقد اعتمدت الأساليب التقليدية لتنظيف هذه البيانات على التحقق من الأخطاء الواضحة، مثل الأرقام المفقودة أو الكلمات التي لا تتناسب مع قائمة صارمة. ومع ذلك، غالبًا ما تغفل هذه الأساليب عن المشكلات الأعمق حيث تكون الكلمات مكتوبة إملائيًا بشكل صحيح ولكنها لا تعطي معنى في سياقها المحدد. ولحل هذه المشكلة، يتجه الباحثون إلى الجمع بين أداتين قويتين: خريطة هيكلية لكيفية عمل العالم، تُعرف باسم "الأنطولوجيا" (Ontology)، والقدرة على فهم اللغة البشرية، والمعروفة باسم "معالجة اللغات الطبيعية".
لقد طور فريق من الباحثين نظامًا جديدًا يدمج هذين النهجين لإنشاء طريقة أكثر ذكاءً لتنظيف البيانات. ويقدم عملهم، الذي نُشر في دراسة حديثة، إطار عمل هجينًا مصممًا للكشف عن الأخطاء وإصلاحها في مجموعات البيانات النصية الفوضوية، لا سيما تلك الموجودة في مجال الرعاية الصحية. لا يكتفي النظام بالبحث عن الأخطاء المطبعية فحسب؛ بل يفهم المعنى الكامن وراء الكلمات. ومن خلال الجمع بين قاعدة معرفية رسمية تحدد كيفية ارتباط المفاهيم الطبية ببعضها البعض وبين تحليل لغوي متقدم، يستطيع إطار العمل رصد التناقضات التي قد تغفل عنها الأساليب القديمة. فعلى سبيل المثال، يمكنه تحديد أن وصف أعراض المريض صحيح من الناحية النحوية، ولكنه مستحيل طبيًا بالنظر إلى حالته المرضية الأخرى المسجلة.
اختبر الباحثون نظامهم باستخدام مجموعة بيانات مستمدة من سجلات صحية متعلقة بمرض كوفيد-19، وهو مجال تعد فيه دقة البيانات أمرًا بالغ الأهمية لتتبع الأمراض واتخاذ قرارات تنقذ الأرواح. وقد أدخلوا عمدًا أنواعًا مختلفة من الأخطاء في البيانات، بما في ذلك القيم المفقودة، والمصطلحات الطبية التي بها أخطاء إملائية، والمدخلات المربكة دلاليًا، لمحاكاة نوع الأخطاء التي تحدث في عمليات حفظ السجلات في العالم الحقيقي. ثم كُلِّف النظام بمهمة العثور على هذه الأخطاء واقتراح التصحيحات. وبخلاف الأساليب السابقة التي قد تكتفي بالتحقق مما إذا كانت الكلمة مكتوبة إملائيًا بشكل صحيح أو ما إذا كان الرقم ضمن نطاق معين، فإن إطار العمل الجديد هذا يتحقق مما إذا كانت المعلومات تتوافق مع القصة الأشمل لسجل المريض. فهو يستخدم خريطة هيكلية للمعرفة الطبية لفهم أن أعراضًا معينة تنتمي إلى أمراض محددة، ويستخدم تحليل اللغة لالتقاط الاختلافات الطفيفة في الإملاء التي قد يغفل عنها البشر.
كانت نتائج التجربة واضحة؛ فقد تفوق النظام الهجين بشكل كبير على النهج التي اعتمدت على تحليل اللغة وحدها. فعندما اختبر الباحثون النظام بدون خريطة المعرفة الهيكلية، واجه صعوبة في التمييز بين الكلمات غير المعتادة والكلمات الخاطئة فعليًا في السياق الطبي. ومع ذلك، بمجرد تزويد النظام بالأنطولوجيا، تحسنت قدرته على اكتشاف الأخطاء الحقيقية بشكل كبير. وفي حالة اختبار محددة، ارتفعت دقة النظام في تحديد نقاط البيانات الصحيحة من 60 بالمائة إلى أكثر من 96 بالمائة بعد دمج خريطة المعرفة بالكامل. وهذا يشير إلى أن الجمع بين فهم قواعد المجال وتحليل النص نفسه هو أكثر فعالية بكثير من استخدام أي من الطريقتين بشكل منفصل.
كما قاس البحث مدى استقرار النظام عند تشغيله عدة مرات. وأظهرت النت Results وجود تباين ضئيل جدًا في الأداء، مما يشير إلى أن إطار العمل موثوق ومتسق. لقد تمكن النظام من العثور على الأخطاء واقتراح الإصلاحات بدقة عالية، مما يعني أنه عندما يشير إلى سجل ما بأنه إشكالي، فإنه يكون محقًا في الغالب. ورغم أن النظام لم يكتشف كل خطأ، إلا أن الأخطاء التي اكتشفها كانت موثوقة للغاية، مما يقلل من خطر الإنذارات الكاذبة التي قد تهدر وقت البشر. وأشار الباحثون إلى أن النظام يعمل بشكل أفضل عندما تكون خريطة المعرفة الأساسية كاملة ودقيقة، مما يسلط الضوء على أن جودة البيانات تعتمد بشكل كبير على جودة المعرفة المستخدمة لتنظيفها.
يمثل هذا العمل خطوة مهمة للأمام في كيفية التعامل مع الكميات الهائلة من البيانات النصية التي يتم إنتاجها يوميًا. فمن خلال تعليم الحواسيب ليس فقط فهم الكلمات، بل وأيضًا العلاقات بينها، نجح الباحثون في ابتكار أداة يمكنها تنظيف البيانات بمستوى من الذكاء كان مخصصًا سابقًا للخبراء البشريين. وقد أثبت إطار العمل فعالية خاصة في بيئة الرعاية الصحية المعقدة وعالية المخاطر، حيث يمكن لخطأ واحد أن يؤدي إلى عواقب وخيمة. وتخلص الدراسة إلى أنه على الرغم من أن النظام ليس مثاليًا ويعتمد على جودة قاعدته المعرفية، إلا أنه يقدم حلاً قويًا وقابلاً للتوسع لتحسين جودة البيانات في البيئات غير المتجانسة. ومع استمرار نمو حجم البيانات وتعقيدها، ستصبح مثل هذه الأنظمة الذكية ضرورية لضمان أن تكون المعلومات التي توجه قراراتنا نظيفة وموثوقة قدر الإمكان.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.