DuplexWorld: Can voice agents help you get through the day?
تقدم الورقة البحثية DuplexWorld، وهو معيار شامل يضم ستة مجالات من العالم الحقيقي و156 سيناريو لتقييم وكلاء الصوت من الكلام إلى الكلام بشكل شمولي بناءً على مقاييس المحادثة والتحليل والطبيعية، مما يكشف عن فجوات كبيرة في الأداء في الأنظمة الحالية رغم تزايد اعتمادها.
تخيل أنك تحاول تعليم روبوت كيف يتحدث مع البشر. لفترة طويلة، اختبر العلماء هذه الروبوتات عبر مطالبتها بقراءة النصوص ذهاباً وإياباً، مثل لعبة سريعة جداً من تبادل رسائل البريد الإلكتروني. لكن الحياة الواقعية ليست نصوصاً؛ بل هي فوضوية، وصاخبة، وتحدث في الوقت الفعلي. هذا هو عالم وكلاء الصوت من "الكلام إلى الكلام" (S2S). فكر فيهم كرفقاء رقميين يمكنهم سماعك، وفهم صوتك، والتحدث إليك فوراً، تماماً مثل البشر في مكالمة هاتفية. السؤال الكبير الذي يطرحه العلماء هو: هل تستطيع هذه الروبوتات حقاً "فعل" أشياء من أجلنا، مثل إصلاح حساب بنكي أو إرشادنا عبر مدينة ما، أم أنها مجرد بارعة جداً في التظاهر بالاستماع؟ نحن نهتم لأننا إذا سمحنا لهؤلاء الوكلاء بتولي مهامنا اليومية، فنحن بحاجة لمعرفة ما إذا كانوا سينجزون العمل فعلياً دون أن يضلوا الطريق، أو ينسوا أسماءنا، أو يقاطعونا أثناء الحديث.
إليك "DUPLEXWORLD"، وهو "أرض تدريب" جديدة ابتكرها الباحثون لاختبار وكلاء الصوت هذه في العالم الحقيقي. فبدلاً من مجرد مطالبتهم بحل مسائل رياضية على الشاشة، بنى الباحثون ستة "عوالم" مختلفة تحاكي حياتنا اليومية: الخدمات المصرفية، التأمين، السفر، الرعاية الصحية، اللوجستيات، وعالم جديد معقد يسمى "تحديد المسار" (حيث يتعين على الوكيل توجيه شخص يسير عبر مدينة). وضعوا خمسة وكلاء صوت تجاريين مختلفين في هذه العوالم وأعطوهم 156 سيناريو مختلفاً لحلها، بإجمالي أكثر من 3,800 محادثة. الأمر يشبه لعبة فيديو ضخمة وعالية المخاطر حيث يتعين على الوكلاء الموازنة بين الاستماع، والتفكير، والعمل في آن واحد.
والنتائج؟ حتى "أفضل" الوكلاء لا يزالون قيد التطوير. وجد الباحثون أن كونك بارعاً في المحادثة لا يعني أنك بارع في المهمة. قد يبدو أحد الوكلاء طبيعياً للغاية ويحافظ على تدفق المحادثة بشكل مثالي، لكنه قد يفشل في حجز الرحلة بالفعل أو العث Sie الحساب البنكي الصحيح. في الواقع، نجح الوكيل الأفضل أداءً في حوالي 49% فقط من المهام من محاولته الأولى (بدرجة 0.490). وهناك نتيجة رئيسية أخرى وهي أن "التبدو جيداً" هو فخ؛ فالوكلاء الذين حصلوا على أعلى درجات جودة الصوت لم يكونوا بالضرورة هم من أتموا المهام بشكل أفضل. وفي عالم "تحديد المسار"، فإن الوكلاء الذين قضوا وقتاً طويلاً في "الاستكشاف" أو طرح الكثير من الأسئلة تاهوا أكثر، بينما الوكلاء الذين التزموا بخطة ما وصلوا إلى وجهتهم.
كما تنفي الورقة البحثية صراحةً فكرة أنه يمكننا ببساطة الحكم على هؤلاء الوكلاء بناءً على مدى أدبهم أو سلاسة حديثهم. تُظهر البيانات أن الوكيل يمكن أن يكون "ثرثاراً" لا يفعل أي شيء في الواقع، وإذا نظرنا فقط إلى درجات المحادثة، فقد نختار الروبوت الخاطئ للقيام بالمهمة. علاوة على ذلك، وجد الباحثون أن حتى الأنظمة الأفضل تعاني من مشكلة الموثوقية؛ فإذا طلبت منهم تجربة نفس المهمة ثلاث مرات، فإنهم غالباً ما يفشلون مرة واحدة على الأقل. تشير الدراسة إلى أنه لكي يتمكن وكلاء الصوت من مساعدتنا حقاً، يجب أن يصبحوا أفضل بكثير في العمل الفعلي، وليس فقط في الكلام. إنه تذكير بأنه رغم أن التكنولوجيا مثيرة للإعجاب، إلا أننا لسنا مستعدين تماماً لتسليم تفاصيل حياتنا اليومية إليها بعد.
ملخص تقني: DUPLEXWORLD
بيان المشكلة
تفشل المعايير المرجعية الحالية لوكلاء الصوت من نوع (Speech-to-Speech - S2S) في تقييم الأداء بشكل شامل عبر المحاور التي تهم النشر في العالم الحقيقي. فغالباً ما تختزل التقييمات الحالية وكلاء الصوت في اختبارات لاستدعاء الأدوات الوكيلية (agentic tool calling) مقابل قواعد بيانات ثابتة، متجاهلةً تنوع الحوارات الكلامية الذي تفرضه الأنشطة اليومية العادية. علاوة على ذلك، نادراً ما تختبر هذه المعايوهات قدرة الوكيل على المساعدة بأمانة في مهام تتجاوز مجرد التلاعب بقواعد البيانات، مثل الملاحة أو التنسيق المعقد متعدد الخطوات. وقد أظهرت المعايير السابقة أن وكلاء الصوت لا يحتفظون إلا بجزء ضئيل من قدرات الوكلاء النصيين تحت الظروف الصوتية الواقعية، وأنه لا يوجد نظام واحد حالياً يتفوق في آن واحد على دقة المهام وتجربة المحادثة. هناك حاجة إلى معيار مرجعي موحد يقيم الوكلاء عبر "عوالم" متنوعة وواقعية باستخدام مجموعة مقاييس متسقة واحدة.
المنهجية
قدم المؤلفون DUPLEXWORLD، وهو معيار مرجعي مصمم للتقييم الشامل والموحد لوكلاء الصوت كاملي الاتجاه (full-duplex).
هيكل المعيار المرجعي
ستة عوالم: يمتد المعيار عبر ستة مجالات متميزة: الخدمات المصرفية، التأمين، السفر، الرعاية الصحية، اللوجستيات، وتحديد المسار (Pathfinding).
تركز المجالات الخمسة الأولى على المؤسسات، حيث تحا المحاكاة سيناريوهات يصل فيها المتصل إلى خط المؤسسة بعد فشل الخدمة الذاتية. يجب على الوكيل تولي المكالمة، وإدارة استدعاءات الأدوات، والتنقل في مساحة حالة لا تتحرك سجلاتها إلا عبر إجراءات الوكيل.
يقدم عالم تحديد المسار (Pathfinding) حدوداً جديدة: مهمة ملاحة حيث يعمل الوكيل كمساعد للمشاة على شبكة حضرية اصطناعية بمساحة 8×8. وخلافاً لعوالم المؤسسات، تتغير الحالة هنا بناءً على الأفعال الجسدية للمشاة، والتي يؤثر عليها الوكيل حصرياً من خلال اللغة. هذا يفرض عدم تماثل المعلومات وتحدي التخطيط لتعبيرات قد تصبح غير ذات صلة قبل نطقها.
السيناريوهات والأنواع: يتكون المعيار من 156 سيناريو مؤلفاً (استُخدم 144 منها للنتائج الرئيسية) عبر 11 نوعاً من المحادثات. تمثل هذه الأنواع أشكال التفاعل (مثل: النية الواحدة، إعادة التوجيه، المساعدة طوال اليوم) بدلاً من مستويات الصعوبة.
أداة التقييم: تعمل أداة تقييم موحدة واحدة على جميع التقييمات. تستخدم تصميماً قائماً على "التكات" (ticks) بفاصل 200 مللي ثانية مع مستخدم محاكى (GPT-5.6-Luna)، وللحصول على قنوات واقعية، تستخدم نموذج قرار (Claude-Haiku-4.5) للتعامل مع المقاطعات والاستجابات الخلفية (backchanneling).
الأنظمة التي تم تقييمها: تم اختبار خمسة أنظمة تجارية للاتصال الصوتي في الوقت الفعلي:
Nova 2 Sonic
Gemini-3.1-Flash-Live
GPT-Realtime-2.1
GPT-Realtime-2.1-mini
Grok Voice Think Fast 1.0
الظروف: أُجريت التقييمات عبر قناتين صوتيتين: "نظيفة" (بدون تدهور) و"واقعية" (تحاكي ضوضاء الهاتف، سقوط الإطارات، كتم الصوت، إلخ). تم تشغيل كل سيناريو خمس مرات لكل نظام لكل قناة، بإجمالي 3,825 محادثة مسجلة.
المقاييس
تتكون مجموعة التقييم من 12 مقياساً مقسمة إلى ثلاث ركائز، يتم حسابها دون تكوين درجة مركبة واحدة:
القدرة الوكيلية (Agentic Capability): تقيس نجاح المهمة عبر فحص حالة الهدف (GS)، وPass@1، وPass@3، وPass3 (احتمالية نجاح جميع الـ k من الجولات). كما تتضمن مقاييس الجهد (نسبة الجهد الزائد ϱ+ وحصة الجهد الناقص π−).
الديناميكيات الحوارية: تشمل درجات تبادل الأدوار (TT)، وتقدم المحادثة (CP)، والانتقائية (SEL) فيما يتعلق بالمشتتات المحقونة.
الطبيعية (Naturalness): تشمل الأمانة (FAI) التي يحكم عليها نموذج لغوي كبير (LLM)، ومؤشرات جودة الصوت (DNSMOS, UTMOS, NISQA).
المساهمات الرئيسية
نطاق موسع: يعد DUPLEXWORLD أول معيار مرجعي يجمع بين عالم الملاحة وخمسة عوالم مؤسسية، مغطياً 156 سيناريو و11 نوعاً من المحادثات. وهو يقدم حدوداً جديدة لاختبار القدرة الوكيلية في البيئات غير الثابتة والإدراكية.
مجموعة تقييم موحدة: يوفر أداة واحدة ومجموعة مقاييس تغطي مجالات ومتطلبات متنوعة، مما يسمح بالمقارنة المباشرة بين الأنظمة عبر أنواع مختلفة من المهام والظروف الصوتية.
دليل تجريبي على انفصال القدرات: تقدم الدراسة دليلاً على أن القدرات الحوارية، والوكيلية، والطبيعية لا "تسير جنباً إلى جنب". يمكن للنظام أن يتفوق في ركيزة واحدة بينما يفشل في ركائز أخرى.
النتائج
كشف تقييم الأنظمة التجارية الخمسة عن وجود مجال كبير للتحسين عبر جميع المحاور:
حدود الأداء: حتى أفضل الأنظمة أداءً حققت Pass@1 بنسبة 0.490، ودرجة تبادل أدوار بنسبة 0.653، وDNSMOS بنسبة 3.378 (مجمعة عبر العوالم).
الاعتماد على العالم: يعتمد الأداء بشكل كبير على العالم المحدد. على سبيل المثال، تراوح Pass@1 لنظام GPT-Realtime-2.1 من 0.200 في عالم الخدمات المصرفية إلى 0.674 في عالم السفر، رغم أن الأنظمة كانت متطابقة.
انفصال المهارات:
الحوارية مقابل الوكيلية: أفضل المتحدثين لم يكونوا هم الأفضل في إتمام المهام. أظهر نظام Nova 2 Sonic، على سبيل المثال، تبادل أدوار محترماً وانتقائية عالية، لكنه أظهر قدرة وكيلية تقترب من الصفر.
الجودة الصوتية مقابل الكفاءة: لم تتنبأ الجودة الصوتية (درجات MOS) بإتمام المهمة. فالأنظمة ذات درجات MOS المتشابهة كانت تمتلك درجات Pass@1 متفاوتة تماماً.
أنماط الفشل:
عوالم المؤسسات: غالباً ما فشلت الأنظمة المنخرطة في العمل عبر "الإفراط في العمل" (تجاوز عدد استدعاءات الأدوات المثالي)، بينما فشلت الأنظمة غير المنخرطة عبر "نقص العمل".
تحديد المسار: طبقت الدراسة عدسة الاستكشاف-الاستغلال (explore–exploit). الأنظمة التي استكشفت أكثر (عبر فحص العلامات، أو المشي التجريبي) وصلت أقل. أعلى المستكشفين لم يصل أبداً، بينما كانت الأنظمة الأقل استكشافاً هي الأكثر عرضة للنجاح.
الموثوقية: تتدهور الموثوقية بسرعة؛ حيث كان Pass@3 حوالي نصف Pass@1 للأنظمة الرائدة، ولم ينجح أي نظام في اجتياز سيناريو واحد في خمس جولات بشكل موثوق عبر جميع العوالم.
الاختناقات: في عوالم المؤسسات، كان الخطأ في سماع بيانات الاعتماد (معدل الخطأ في الكلمات - WER) عائقاً رئيسياً، حيث سُمعت حوالي 1 من كل 6 من بيانات الاعتماد المنطوقة بشكل خاطئ، مما حد من التحقق من الهوية.
الأهمية والادعاءات
يزعم البحث أن وكلاء الصوت الحاليين، رغم التطور السريع، ليسوا جاهزين بعد للاندماج السلس في الحياة اليومية أو المهام المؤسسية المعقدة.
ضرورة المعيار المرجعي: المعايير الحالية غير كافية لأنها لا تأخذ في الاعتبار تنوع الديناميكيات الحوارية أو تختبر الوكلاء في مهام تتجاوز التلاعب بقواعد البيانات. يعالج DUPLEXWORLD ذلك من خلال توفير بيئة اختبار أوسع وأكثر واقعية.
تحذير النشر: يجادل المؤلفون بأن الجودة الصوتية المدركة هي مؤشر ضعيف للكفاءة. إن الاعتماد على "القدرة على الظهور بمظهر جيد" لاتخاذ قرارات الشراء قد يؤدي إلى اختيار أنظمة تفشل في المهمة الأساسية.
توصيات المقاييس: يوصي المؤلفون بضرورة أن يذكر المجال حصة الجهد الناقص (π−) جنباً إلى جنب مع درجات الإتمام، حيث أنها مؤشر قوي للفشل لا يمكن "ربحه" عبر الصمت.
الادعاءات المتواضعة: يقر البحث بوجود قيود، بما في ذلك استخدام الكلام الاصطناعي بدلاً من كلام البشر الحقيقيين للمتصلين، وطبيعة المعيار المرجعي المقتصرة على اللغة الإنجليزية، وحقيقة أن المقاييس القائمة على الحكم لم تتم إعادة التحقق من صحتها مقابل التقييمات البشرية على هذه المجموعة المحددة. ويؤكد المؤلفون أن النتائج تسلط الضوء على الفجوات في التكنولوجيا الحالية بدلاً من تقديم حل نهائي.