Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance
تقدم الورقة البحثية Earnings25، وهو معيار مرجعي شامل مدته 500 ساعة يتكون من مكالمات أرباح كاملة ومقاطع متوازنة قطاعياً مع نصوص متوافقة وبيانات وصفية مهيكلة، والمصمم لتقييم وتأسيس خطوط أساس قابلة للتكرار لأنظمة التعرف التلقائي على الكلام في مكالمات أرباح الشركات باللغة الإنجليزية تحت ظروف واقعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت فهم المحادثة البشرية. قد تبدأ بجعله يستمع إلى قصص واضحة وبطيئة تُقرأ من كتاب. لكن الحياة الواقعية فوضوية؛ فالناس يقاطعون بعضهم البعض، ويستخدمون لغة عامية، ويتحدثون بلكنات مختلفة، ويدرجون كلمات معقدة لا تظهر في كتب القصص. هذا هو عالم التعرف التلقائي على الكلام (ASR) — التقنية التي تحول الكلمات المنطوقة إلى نص. وبينما أصبحت هذه الروبوتات جيدة جداً في الاستماع إلى الأصوات الواضحة، إلا أنها غالباً ما تتعثر عندما تصبح المحادثة فوضوية، أو تقنية، أو مليئة بالمصطلحات المتخصصة. السؤال الكبير الذي يواجه العلماء هو: كيف نعرف ما إذا كان الروبوت مستعداً حقاً للعالم الحقيقي، أم أنه مجرد بارع في قراءة النصوص المكتوبة؟ وللإجابة على ذلك، نحتاج إلى "امتحان نهائي" لا يعتمد فقط على الذاكرة، بل هو اختبار للقدرة على البقاء في بيئة صاخبة ومعقدة.
هنا يأتي دور فريق من بلومبرغ (Bloomberg) ليقدم تحدياً جديداً وضخماً يسمى Earnings25. فكر في مكالمات الأرباح المالية كأنها "أولمبياد" الخطاب المؤسسي. هذه المكالمات هي مؤتمرات هاتفية تستمر لمدة ساعة، حيث يتحدث رؤساء الشركات والمحللون الماليون عن الأموال، والأسهم، والخطط المستقبلية. إنها عاصفة مثالية من الصعوبات: الناس يتحدثون بسرعة، ويستخدمون مصطلحات مالية ثقيلة، ويقاطعون بعضهم البعض، ويتنقلون بين قراءة نصوص معدة مسبقاً والإجابة على أسئلة عفوية وصعبة. أدرك المؤلفون أن الاختبارات الحالية تشبه التدرب على ماراثون عبر الجري على جهاز المشي في صالة رياضية هادئة؛ فهي لم تلتقط التلال، أو الرياح، أو الحشود. لذا، قاموا ببناء معيار جديد فائق التفصيل لمعرفة مدى قدرة روبوتات التعرف على الكلام الحالية على التعامل مع الفوضى الحقيقية والمربكة في العالم المالي.
تحدي الاستماع المالي العظيم
يقدم البحث Earnings25، وهو مجموعة بيانات ضخمة وجديدة صُممت لتكون الاختبار القاسي النهائي لأنظمة الذكاء الاصطناعي للتعرف على الكلام. لم يكتفِ المؤلفون بجمع بعض المكالمات الهاتفية العشوائية، بل بنوا "ساحتين" متميزتين لاختبار الروبوتات بطرق مختلفة.
الساحة الأولى هي testset-full، وهي مجموعة هائلة تضم 498 ساعة من مكالمات الأرباح الكاملة وغير المحررة لشركات "S&P 500" في الربع الرابع من عام 2025. تخيل الاستماع إلى ما يقرب من 500 ساعة من الاجتماعات المالية المتتالية دون توقف. هذه المجموعة تحافظ على التدفق الطبيعي الكامل للمحادثة، بما في ذلك لحظات الصمت المحرجة، والأصوات المتداخلة، والقصص الطويلة والمتشعبة التي تحدث في الحياة الواقعية. إن الأمر يشبه إعطاء الروبوت موسماً كاملاً من برنامج تلفزيوني معقد لمشاهدته، بدلاً من مجرد بعض المقاطع القصيرة.
الساحة الثانية هي testset-segmented، وهي مجموعة أكثر تنقيحاً تتكون من 46 ساعة مقسمة إلى 290 جزءاً محدداً من الصوت. هنا، لعب الباحثون لعبة ذكية من "العدالة". في العالم الحقيقي، تتحدث بعض الصناعات (مثل البنوك أو شركات النفط) بشكل متكرر أكثر من غيرها (مثل التصنيع المتخصص). إذا استمعت فقط إلى القطاعات الأكثر شيوعاً، فقد تعتقد أن الروبوت رائع، لكنه قد يفشل فشلاً ذريعاً عندما يسمع عن شيء نادر. ولإصلاح ذلك، اختار الفريق جزءاً واحداً بالضبط لكل صناعة من بين أكثر من 2000 مكالمة، مما يضمن أن كل نوع من أنواع الأعمال — من "الطابعات ثلاثية الأبعاد" إلى "توربينات الرياح" — يحصل على صوت متساوٍ. هذه الأجزحة قصيرة، حوالي 5 إلى 10 دقائق لكل منها، مما يجعلها مثالية لاختبار مدى قدرة الروبوت على التعامل مع المفردات الصعبة والمحددة دون أن يشعر بالارتباك بسبب محتوى طويل جداً.
السر الخفي: البيانات الوصفية و"من قال ماذا"
ما يجعل Earnings25 مميزاً حقاً ليس مجرد الصوت؛ بل "ورقة الغش" التي تأتي معه. معظم مجموعات البيانات القديمة كانت تعطيك الصوت والنص فقط. أما Earnings25 فيعطيك الصوت، والنص، وخريطة مفصلة لـ من قال ماذا، ومتى، ولماذا.
قام الباحثون بتصنيف كل متحدث حسب دوره: هل كان المُشغل (operator) الذي يقرأ القواعد المملة في البداية؟ هل كان الرئيس التنفيذي (CEO) الذي يلقي خطاباً مصقولاً؟ أم كان محللاً (analyst) يطرح سؤالاً صعباً وغير مُعد مسبقاً؟ كما قاموا بتسمية الصناعة وهيكل المكالمة. وهذا يسمح للعلماء بطرح أسئلة مثل: "هل يرتبك الروبوت أكثر عندما يتحدث الرئيس التنفيذي، أم عندما يقاطعه المحلل؟" أو "هل يفشل أكثر في صناعة التكنولوجيا الحيوية أم في صناعة البنوك؟". هذا يحول اختبار "كم عدد الكلمات التي أصابها؟" البسيط إلى تحقيق عميق في أين ولماذا يعاني الروبوت.
النتائج: الروبوتات جيدة، لكنها ليست مثالية
أخضع الفريق نظامين شهيرين للتعرف على الكلام، وهما Whisper وParakeet-TDT، لاختبار قاسٍ. لم يعطوا الروبوتات أي تدريب خاص على هذه البيانات المحددة؛ بل طلبوا منها فقط الاستماع والتدوين، محاكيين سيناريو من العالم الحقيقي حيث يتعين على الروبوت فهم الأمور أثناء حدوثها.
أظهرت النتائج أنه رغم كون هذه الروبوتات مثيرة للإعجاب، إلا أنها لا تزال بعيدة جداً عن الهدف. في مجموعة الـ 498 ساعة الضخمة، أخطأ أفضل نموذج (Parakeet-TDT) في حوالي 10.8% من الكلمات. وفي المجموعة الأصغر والمتوازنة صناعياً، ارتفع معدل الخطأ قليلاً إلى 11.1%. هذه الزيادة الصغيرة هي في الواقع أمر كبير؛ فهي تشير إلى أنه عندما تجبر الروبوت على الاستماع إلى صناعات نادرة وصعبة ("الذيل الطويل" للأعمال)، فإنه يتعثر أكثر.
يسلط البحث الضوء على اكتشاف رائع: النتائج الإجمالية قد تكون مضللة. إذا نظرت فقط إلى متوسط معدل الخطأ، فقد تعتقد أن الروبوت يقوم بعمل رائع لأنه جيد في الصناعات الشائعة مثل البنوك. ولكن عندما تنظر إلى مجالات محددة ومعقدة مثل التكنولوجيا الحيوية (Biotech) أو الصيدلة (Pharma)، فإن معدل الخطأ يقفز إلى أكثر من 15%. الأمر يشبه طالباً يحصل على درجة "امتياز" في اختبار الرياضيات لأنه تفوق في الأسئلة السهلة، لكنه رسب في قسم التفاضل والتكامل المتقدم. "المعدل" العام يخفي حقيقة أنه لا يزال يعاني في الأجزاء الأكثر صعوبة.
لماذا يهم هذا الأمر؟
يحرص المؤلفون على عدم الادعاء بأنهم "حلوا" المشكلة. بدلاً من ذلك، هم يقدمون معياراً قابلاً لإعادة الإنتاج — طريقة موحدة للجميع لقياس التقدم. قبل Earnings25، كان من الصعب معرفة ما إذا كان نظام ذكاء اصطناعي جديد أفضل بالفعل أم أنه كان محظوظاً فقط بالبيانات التي اختُبر عليها. الآن، لدى الباحثين ساحة لعب واضحة وعادلة مع تفاصيل غنية لفهم أين تفشل نماذجهم بالضبط.
كما يشير البحث إلى حدوده الخاصة. يركز Earnings25 على المكالمات باللغة الإنجليزية، ومعظمها من شركات مقره في الولايات المتحدة. وبينما يجعل هذا الاختبار منضبطاً وعالي الجودة، إلا أنه لا يستوعب بعد التنوع الكامل للهجات واللغات العالمية. ويقترح المؤلفون أن الخطوة التالية هي توسيع "تحدي الاستماع المالي" ليشمل المزيد من الدول واللغات.
باختصار، Earnings25 هو مكتبة ضخمة ومنظمة بدقة من الفوضى المالية. هو لا يخبرنا فقط ما إذا كان الروبوت يستطيع السمع؛ بل يخبرنا ما إذا كان الروبوت يستطيع فهم عالم الأعمال المليء بالضجيج، والمصطلحات، والتداخلات، والمخاطر العالية. وحتى الآن، الروبوتات تستمع، لكنها لا تزال تتعلم كيف تواكب المحادثة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.