STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
تُعد STITCH طريقة توليد مبتكرة لنماذج اللغة المنطوقة تعمل على تقليل زمن الاستجابة عبر التداخل بين قطع التفكير غير المنطوقة وقطع الاستجابة المنطوقة، مما يسمح للنموذج بـ "التفكير" أثناء تشغيل الصوت للمستخدم في آن واحد.
تخيل أنك تجري محادثة مع صديق ذكي جداً. عادةً، عندما تسأله سؤالاً رياضياً صعباً، فإنه إما:
"المتمتم": يبدأ في الكلام فوراً، لكنه يتلعثم، ويصحح نفسه، وفي النهاية يصل إلى الإجابة. (هذه هي الطريقة التي تعمل بها معظم النماذج الصوتية الحالية للذكاء الاصطناعي).
"المفكر الصامت": يحدق فيك في صمت تام لمدة 30 ثانية بينما يجري العمليات الحسابية في رأسه، ثم يبدأ أخيراً في التحدث. (هذه هي طريقة "سلسلة الأفكار" في الذكاء الاصطناعي — إنها ذكية، لكن الصمت يكون مربكاً ويجعلك تشعر وكأن الآلة معطلة).
لقد ابتكر الباحثون في مايكروسوفت والجامعة الوطنية في تايوان طريقة ثالثة، أطلقوا عليها اسم STITCH.
التشبيه: "الطاهي ومساعد الطاهي"
فكر في الذكاء الاصطناائي كفريق مطبخ محترف.
في الطريقة القديمة (المفكر الصامت)، يجب على "رئيس الطهاة" (جزء التفكير/الاستنتاج) أن ينهي الوصفة بأكملها، ويطبخ الوجبة كاملة، ويقدمها بشكل مثالي قبل أن يُسمح لـ "النادل" (جزء التحدث) حتى بدخول غرفة الطعام. يجلس الزبون هناك وهو يحدق في طاولة فارغة، ويزداد جوعاً ونفاذ صبر.
يعمل STITCH مثل رقصة متزامنة عالية السرعة بين "الطاهي" و"مساعد الطاهي":
مساعد الطاهي (الصوت): يقدم فوراً مقبلات صغيرة (الكلمات القليلة الأولى من الاستجابة) ليخبر الزبون: "لا تقلق، الطعام قادم!". هذا يلغي ذلك الصمت المربك الذي يسمى "الفراغ".
رئيس الطهاة (التفكير): بينما ينشغل مساعد الطاهي بتقديم تلك المقبلات، يكون رئيس الطهاة في الخلف، يقطع الخضروات بجنون ويطبخ الوجبة الرئيسية (التفكير المعقد).
ولأن عملية "التقديم" (التحدث) تستغر وقتاً أطول بكثير من "التقطيع" (التفكير)، يمكن للطاهي في الواقع إنهاء الجزء التالي من الوجبة بينما لا يزال الزبون يتناول اللقمة الأولى. إنهم يقومون بـ "حياكة" (stitching) التفكير والتحدث معاً بسلاسة تجعل الزبون لا يشعر أبداً بفجوة في الخدمة.
كيف يعمل الأمر في الواقع؟ (سر "التقطيع")
بدلاً من التفكير في فقرة منطقية ضخمة وطويلة، يقوم STITCH بتقسيم كل شيء إلى "كتل" (chunks) صغيرة.
الكتلة 1: يقوم الذكاء الاصطناعي بقدر ضئيل من "التفكير الصامت" (ما يكفي فقط للبدء).
الكتلة 2: يبدأ فوراً في قول بضع كلمات بصوت عالٍ.
الخدعة السحرية: بينما يتم تشغيل هذه الكلمات عبر مكبرات الصوت الخاصة بك، يستخدم الذكاء الاصطناعي هذا "الوقت المجاني" للقيام بكتلة كبيرة من التفكير الصامت للجزء التالي من الجملة.
لماذا يعد هذا أمراً مهماً؟
إنه ذكي: لأن الذكاء الاصطناعي لا يزال "يفكر" أثناء حديثه، فإنه يؤدي بشكل أفضل بكثير في المهام الصعبة مثل الرياضيات. هو لا يكتفي بالتخمين؛ بل يحسب بدقة.
إنه سريع: لا يحتوي على ذلك التوقف الطويل والمربك في البداية. إنه يشبه المحادثة البشرية الحقيقية والاستجابية.
إنه طبيعي: إنه يحقق ذكاء "المفكر الصامت" مع سرعة "المتمتم".
باخت-القول: يسمح STITCH للذكاء الاصطناعي بأن "يفكر على قدميه" — أي استخدام الوقت الذي يقضيه في التحدث للقيام بالعمل الشاق في التفكير.
ملخص تقني: STITCH: التفكير والحديث المتزامن مع التفكير المجزأ
نُشر في: ICLR 2026
1. بيان المشكلة
تُصمم نماذج اللغة المنطوقة (SLMs) الحالية لاستقبال مدخلات صوتية وتوليد استجابات منطوقة. ومع ذلك، فهي تفتقر إلى عملية تفكير داخلية غير منطوقة. بينما يستخدم البشر التفكير الذهني لصياغة أفكار منطوقة واضحة وموجزة، تقوم نماذج اللغة المنطوقة الحالية عادةً بتوليد رموز صوتية بشكل مباشر.
بينما يمكن دمج "سلسلة الأفكال" (Chain-of-Thought - CoT) في النماذج اللغوية الكبيرة القائمة على النصوص لتحسين الدقة، فإن تطبيقها على نماذج اللغة المنطوقة يطرح تحديًا رئيسيًا وهو: زمن الاستجابة (Latency). إن النهج البديهي — وهو توليد سلسلة كاملة من الأفكار النصية قبل البدء في التحدث — يؤدي إلى تأخيرات كبيرة وغير قابلة للتحكم، مما يجعل التفاعل في الوقت الفعلي مستحيلاً. الهدف هو تمكين نماذج اللغة المنطوقة من "التفكير" (الاستنتاج) و"التحدث" (النطق) في آن واحد دون زيادة زمن الاستجابة الملحوظ للمستخدم.
2. المنهجية
يقترح المؤلفون STITCH، وهو مسار توليد مبتكر يتناوب بين توليد أجزاء تفكير غير منطوقة وأجزاء استجابة منطوقة. الجوهر يكمن في أن الوقت المطلوب لتشغيل جزء صوتي للمستخدم أطول بكثير من الوقت المطلوب لتوليد المجموعة التالية من الرموز (Tokens).
يقدم البحث نسختين رئيسيتين من إطار عمل STITCH:
STITCH-R (التفكير أولاً - Reasoning First): يقوم النموذج بتوليد جزء تفكير جزئي (Nreason من الرموز)، يليه جزء من الرموز النصية (Ntext) والرموز الصوتية (Nspeech). وبينما يقوم فك تشفير الكلام بتخليق وتشغيل الجزء الصوتي الأول للمستخدم، يستخدم النموذج ذلك "الوقت المجاني" لتوليد الجزء التالي من التفكير الجزئي. وهذا يخلق دورة مستمرة من التفكير أثناء نطق الفكرة السابقة.
STITCH-S (التحدث أولاً - Speaking First): للقضاء على التأخير الأولي الناتج عن انتظار أول جزء من التفكير، يعكس STITCH-S الترتيب. يبدأ بتوليد أول جزء من الاستجابة المنطوقة (نص + صوت) فوراً، ثم يولد جزء التفكير أثناء تشغيل ذلك الصوت. هذا يضمن أن يمتلك النموذج نفس "زمن استجابة الحزمة الأولى" الذي تمتلكه نماذج اللغة المنطوقة القياسية التي لا تستخدم التفكير.
نهج التدريب: تم ضبط النماذج باستخدام هيكل GLM-4-Voice-9B. تم بناء بيانات التدريب عبر أخذ مسارات التفكير الموجودة و"حياكتها" (stitching) في تسلسلات متداخلة من رموز التفكير، والرموز النصية، والرموز الصوتية.
3. المساهمات الرئيسية
أول عملية تفكير غير منطوقة لنماذج اللغة المنطوقة: كان المؤلفون أول من قدم عملية تفكير داخلية صامتة لنماذج اللغة المنطوقة.
تفكير محايد لزمن الاستجابة: أثبتوا أنه يمكن إضافة التفكير إلى نماذج اللغة المنطوقة دون زيادة زمن استجابة الحزمة الأولى (تحديداً عبر نسخة STITCH-S).
نموذج التوليد المجزأ: قدموا طريقة لاستغلال "وقت الخمول" أثناء تشغيل الصوت لإجراء عمليات حسابية في الخلفية (التفكير).
4. النتائج
تم تقييم الأداء على مجموعات بيانات الاستدلال الرياضي والاستدلال غير الرياضي (المعتمد على المعرفة).
أداء الاستدلال: تفوقت نماذج STITCH بشكل كبير على النماذج المرجعية. في خمس مجموعات بيانات للأسئلة والأجوبة الرياضية، تفوقت STITCH-R وSTITCH-S على النماذج التي لا تستخدم التفكير بنسبة تتجاوز 15%. وحتى نسخة "التحدث أولاً" (STITCH-S)، التي تتميز بصفر تأخير مضاف، أظهرت تحسينات هائلة مقارنة بالنماذج التي تفتقر للتفكير.
زمن الاستجابة: حققت STITCH-S نفس زمن استجابة الحزمة الأولى التي تحققها نماذج اللغة المنطوقة المتداخلة القياسية، مما يوفر قدرة تفكير "مجانية" من حيث الوقت.
المهام غير المتعلقة بالاستدلال: أدت النماذج أداءً مشابهاً لنماذج اللغة المنطوقة القياسية في مهام الأسئلة والأجوبة الواقعية والحوار، مما يثبت أن إضافة التفكير لا تضعف القدرات الحوارية العامة أو جودة الكلام (مقاسة عبر UTMOSv2 ودرجات الطلاقة من GPT-4o).
التقييم البشري: صنف المختبرون البشريون STITCH-S كأكثر النماذج استجابة، تليها STITCH-R، وكلاهما اعتُبر أكثر استجابة من النموذج المرجعي "التفكير قبل التحدث" (TBS).
5. الأهمية
يمثل STITCH خطوة مهمة نحو جعل المساعدين الذكيين أكثر "شبهاً بالبشر". من خلال فصل العملية الإدراكية الداخلية عن المخرجات اللفظية الخارجية، نجح الباحثون في حل المقايضة الأساسية بين الذكاء (عمق الاستدلال) والتفاعلية (انخفاض زمن الاستجابة). يسمح هذا الإطار بنشر نماذج عالية القدرة وكثيفة الاستدلال في تطبيقات صوتية في الوقت الفعلي، مثل المساعدين الافتراضيين المتطورين، والمعلمين، والمترجمين الفوريين، دون الصمت المحرج المرتبط عادةً بالعمليات الحسابية المعقدة.