← أحدث الأبحاث
💻 computer science

Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy

تقدم هذه الورقة نظام EndoASR، وهو نظام للتعرف التلقائي على الكلام متكيف مع المجال، يعمل على تحسين دقة النسخ والتعرف على المصطلحات الطبية بشكل كبير من أجل التعاون الفوري بين الإنسان والذكاء الاصطناعي في تنظير الجهاز الهضمي، مما يظهر قدرة قوية على التعميم ونشراً فعالاً عند الحواف عبر إعدادات سريرية متعددة المراكز.

المؤلفون الأصليون: Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang

نُشر 2026-04-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك جراح تجري عملية دقيقة داخل جسم مريض باستخدام كاميرا طويلة ومرنة (منظار). يداك مشغولتان بالإمساك بالكاميرا والأدوات، لذا لا يمكنك الكتابة أو تدوين الملاحظات. بدلاً من ذلك، تتحدث بصوت عالٍ، واصفاً ما تراه: "أرى نتوءاً أحمر صغيراً على الجانب الأيسر من القولون، يبدو كأنه لحمية (polyp)، دعونا نزيله".

في عالم مثالي، سيستمع جهاز كمبيوتر إليك ويكتب فوراً تقريراً طبياً مثالياً. لكن في العالم الحقيقي، يشبه هذا الأمر محاولة إجراء محادثة جادة مع صديق يتحدث لغة مختلفة تماماً، بينما تعمل مجموعة من عمال البناء بجانبك بضجيج شديد.

تقدم هذه الورقة البحثية EndoASR، وهو "مستمع ذكي" جديد صُمم خصيصاً لحل هذه المشكلة لأطباء الجهاز الهضمي. إليك قصة كيفية بنائه، مشروحة ببساًطة:

1. المشكلة: "العامّي" مقابل "المتخصص"

فكر في المساعدات الصوتية القياسية (مثل Siri أو Alexa أو نماذج الذكاء الاصطناعي الضخمة التي يستخدمها الجميع) كأنها أمين مكتبة عامّي. هم بارعون في قراءة الكتب عن التاريخ، أو الطبخ، أو الثقافة العامة. ولكن إذا طلبت منهم قراءة كتاب طبي معقد، فسوف يتعثرون.

  • فجوة المفردات: يستخدم الأطباء كلمات محددة جداً مثل "Paris classification IIa" أو "Boston Bowel Preparation Scale". أمين المكتبة العامّي لم يسمع هذه الكلمات من قبل وسوف يخمن بشكل خاطئ.
  • فجوة الضجيج: غرفة المنظار صاخبة. هناك أجهزة تصدر أصواتاً، وخراطيم شفط، وعدة أشخاص يتحدثون. أمين المكتبة العامّي يصاب بالارتباك بسبب ضوضاء الخلفية.

لقد اختبر الباحثون هؤلاء "الأمناء العامّيين" في غرفة منظار حقيقية، وفشلوا فشلاً ذريعاً، حيث ارتكبوا الكثير من الأخطاء التي تجعلهم غير مفيدين.

2. الحل: تدريب "متدرب متخصص"

بما أنهم لم يتمكنوا من العثور على تسجيلات حقيقية كافية لأطباء يتحدثون (بسبب قواعد خصوصية المريض)، فقد اضطر الباحثون إلى التفكير بإبداع. لقد بنوا معسكراً تدريبياً اصطناعياً.

  • الخطوة 1: النص (التكيف اللغوي): أخذوا الآلاف من التقارير الطبية المكتوبة الحقيقية واستخدموا روبوتاً لتحويل النص إلى كلام (Text-to-Speech) ليقرأها بصوت عالٍ. خلق هذا مكتبة ضخمة من أصوات الأطباء "المزيفة" التي تنطق المصطلحات الطبية المثالية. لقد علموا نموذج الذكاء الاصطناعي الخاص بهم الاستماع إلى هذا، مما حوله إلى خبير في المفردات الطبية.
  • الخطوة 2: صالة الألعاب الرياضية للضجيج (القوة والتحمل): معرفة الكلمات وحدها لا تكفي؛ يجب أن يسمعها الذكاء الاصطناعي فوق الضجيج. أخذوا ذلك الكلام "المزيف" وخلطوه مع تسجيلات من ضوضاء غرفة المنظار الفعلية (أصوات التنبيه، الشفط، إلดับ). لقد دربوا الذكاء الاصطناعي على تجاهل الفوضى والتركيز على صوت الطبيب.

هذه العملية المكونة من خطوتين خلقت EndoASR، وهو نموذج يعمل كقاموس طبي وسماعة عازلة للضوضاء في آن واحد.

3. تجربة القيادة: من المختبر إلى العالم الحقيقي

لم يكتفِ الباحثون باختبار هذا النموذج في مختبر هادئ، بل أخذوه في رحلة عبر خمس مستشفيات مختلفة.

  • النتيجة: في هذه الاختبارات الواقعية، كان EndoASR بمثابة دليل محلي خبير مقارنة بالسائح المرتبك (النماذج القديمة). لقد قلل الأخطاء بنسبة 30% تقريباً، وحصل على المصطلحات الطبية بشكل صحيح بنسبة تقارب 85% (مقارنة بنحو 60% للنماذج القديمة).
  • السرعة: كان سريعاً للغاية. بينما كانت النماذج الأخرى تستغرق لحظة "للتفكير" (مثل مترجم بطيء)، كان EndoASR فورياً تقريباً، مما يسمح للطبيب بالتحدث ورؤية النص يظهر على الشاشة في الوقت الفعلي دون انتظار.

4. لماذا يهم هذا: تأثير "العمل الجماعي"

الجزء الأكثر أهمية ليس مجرد أن الكمبيوتر يسمع الكلمات بشكل صحيح، بل ما يحدث بعد ذلك.
تخيل أن الذكاء الاصطناعي هو عضو في الفريق يساعد الطبيب.

  • إذا سمع الذكاء الاصطناعي كلمة "لحمية" (polyp) بشكل صحيح، فيمكنه فوراً استحضار دليل العلاج المناسب أو ملء نموذج التأمين.
  • إذا أخطأ الذكاء الاصطناعي وسمع "لحمية" (polyp) بدلاً من "جرو صغير" (puppy)، فإن الفريق بأكمله سيرتبك، وسيكون التقرير خاطئاً، وتصبح سلامة المريض في خطر.

من خلال إصلاح عملية السمع (ASR)، يعمل الفريق بأكمله (الطبيب + الذكاء الاصطناعي) بشكل أفضل معاً. يمكن للطبيب إبقاء يديه على الأدوات وعينيه على الشاشة، واثقاً من أن الذكاء الاصطناعي سيتولى مهمة الأوراق.

الخلاصة

تظهر هذه الورقة البحثية أنه لجعل الذكاء الاصطناعي مفيداً في عالم الطب الصاخب والمزدحم وعالي المخاطر، لا يمكنك مجرد استخدام أداة "واحدة تناسب الجميع". عليك بناء متخصص يتحدث لغة الطبيب ويرتدي سماعات عازلة للضوضاء. EndoASR هو ذلك المتخصص، المستعد ليكون الآذان الموثوقة للفريق الطبي المكون من البشر والذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →