AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach
تقدم الورقة البحثية AgenticASR، وهو إطار عمل وكيل (agentic framework) يعمل على تحسين التعرف على الكلام في الوقت الفعلي من خلال مراجعة النصوص المنسوخة بشكل تكراري لإزالة التأتأة وتصحيح التصحيحات الذاتية مع الحفاظ على القصد النهائي للمتحدث، وقد تم التحقق من ذلك عبر معيار مرجعي جديد ثنائي اللغة وأداء متفوق عبر واجهات أمامية متعددة للتعرف التلقائي على الكلام (ASR).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تدوين قصة صديق لك، لكن صديقك يتحدث تماماً كالبشر: يتعثر في الكلمات، ويقول "اممم" و"آه"، ويبدأ جملة، ثم يدرك أنه ارتكب خطأً، ثم يصحح نفسه في منتصف الكلام. إذا كتبت كل صوت يصدر عنه، فستحصل على نص فوضوي ومربك مليء بالبدايات الخاطئة والتكرارات. هذا ما تفعله تقنية تحويل الكلام إلى نص التقليدية؛ إنها كاتب حرفي جداً يلتقط "صوت" الكلام ولكن ليس "قصد" الرسالة. من ناحية أخرى، تحاول بعض الأدوات الجديدة تنظيف النص، لكنها عادة ما تنتظر حتى ينتهي الشخص من الكلام تماماً قبل أن تبدأ في التحرير. وهذا يخلق مشكلة: إذا قال صديقك، "قابلني عند منزل ماري... انتظر، لا، ماري (Marie)"، فإن الأداة التي تنتظر حتى النهاية قد تكون قد كتبت بالفعل "ماري" (Mary) ولا يمكنها العودة لإصلاح ذلك دون البدء من جديد. الهدف من هذا البحث هو بناء نظام يعمل كأنه محرر فائق السرعة ومنتبه، يستمع في الوقت الفعلي، ويلتقط الأخطاء أثناء حدوثها، ويعيد كتابة النص فوراً ليكون نظيفاً وسهل القراءة، كل ذلك بينما لا يزال الشخص يتحدث.
يقدم البحث نهجاً جديداً يسمى AgenticASR (التعرف الوكيل على الكلام). فكر في الأمر كفريق مكون من شخصين يعملان في بث مباشر. الشخص الأول هو "الكاتب" (الواجهة الأمامية لـ ASR)، الذي يكتب بسرعة كل ما يسمعه، بما في ذلك التلعثم وكلمات مثل "اممم". الشخص الثاني هو "المُنقّح" (الجزء الوكيلي)، وهو محرر ذكي يلقي نظرة باستمرار على الجمل القليلة الأخيرة التي كتبها "الكاتب". بمجرد أن يكتب "الكاتب" قطعة نصية، ينظر إليها "المُنقّح"، ويصلح الفوضى، ويستبدل النسخة الفوضوية بنسخة نظيفة.
هنا تكمن الخدعة السحرية: "المُنقّح" لا ينظر فقط إلى الجملة الحالية؛ بل يحتفظ بـ "نافذة" صغيرة من آخر بضع قطع نصية في ذهنه. إذا كتب "الكاتب" "قابل ماري"، ثم جاءت القطعة التالية كـ "انتظر، ماري (Marie)"، فإن "المُنقّح" يرى الرابط فوراً. يدرك أن القطعة الأولى كانت خطأً، فيحذف "ماري" (Mary)، ويحدث الجملة بأكملها لتصبح "قابل ماري (Marie)" قبل أن ينهي المتحدث فكرته التالية. هذا يسمح للنظام بالتعامل مع التصحيحات الذاتية والتوضيحات أثناء حدوثها، بدلاً من الانتظار حتى يتوقف الكلام.
لاختبار ما إذا كان هذا ينجح حقاً، بنى المؤلفون ساحة لعب خاصة تسمى AASR-Bench. تخيل مسار عقبات ضخم يحتوي على 917 سيناريو مختلفاً، تتراوح بين الدردشات العادية ومكالمات خدمة العملاء إلى جلسات البرمجة التقنية والبحث الصوتي. لقد أنشأوا 6,637 سؤالاً صغيراً ومحدداً (معايير تقييم) لدرجة النتائج، حيث تحقق من أمور مثل: "هل أزالوا كلمات 'اممم'؟"، "هل صححوا إملاء الاسم؟"، و"هل حافظوا على المعنى النهائي بشكل صحيح؟". لم ينظروا فقط إلى عدد الكلمات الصحيحة؛ بل نظروا إلى مدى قابلية النص للقراءة وفائدته.
تشير النتائج إلى أن هذا النهج "الوكيل" (Agentic) يمثل خطوة كبيرة للأمام. فعندما اختبروا AgenticASR مقابل الأنظمة الأخرى، أنتج باستمرار نصاً أكثر نظافة ودقة. على سبيل المثال، باستخدام إعداد محدد (Qwen3-ASR-1.7B مع المُنقّح الخاص بهم)، سجل النظام 79.95 في مقيماهم العام، متفوقاً على أفضل الطرق الأخرى بفارق مريح. ووجدت الدراسة أن النظام يعمل بشكل أفضل عندما ينظر إلى "نافذة" من حوالي ثلاث قطع كلامية في المرة الواحدة. كان حجم هذه النافذة هو النقطة المثالية: فقد كانت كبيرة بما يكفي لالتقاط التصحيحات التي حدثت قبل بضع ثوانٍ (مثل التحول من "ماري - Mary" إلى "ماري - Marie")، ولكنها صغيرة بما يكفي للحفاظ على سرعة النظام.
اكتشف المؤلفون أيضاً أن حجم "المُنقّح" أمر مهم. فالمحرر الأكبر والأكثر ذكاءً (نموذج بـ 4 مليارات معلمة) كان يؤدي وظيفة أفضل قليلاً في إصلاح الجمل المعقدة، لكنه يستغرق وقتاً أطول قليلاً في التفكير. ومع ذلك، حتى النماذج الأصغر والأسرع كانت أفضل بكثير من الأنظمة التي تنتظر حتى النهاية للتحرير. تؤكد الورقة البحثية أن هذا النظام ليس مثالياً؛ فإذا أخطأ "الكاتب" الأولي في سماع كلمة تماماً، فلا يمكن لـ "المُنقّح" أن يخترعها من العدم. ولكن بالنسبة للأمور الواقعية والفوضوية التي نقولها بالفعل—مثل الحشوات، والتلعثم، والتصحيحات في منتصف الجملة—يقترح AgenticASR طريقة عملية للحصول على نص نظيف وسهل القراءة فوراً، محولاً التدفق الفوضوي للكلام البشري إلى قصة مصقولة أثناء حدوثها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.