Click-to-Ask: An AI Live Streaming Assistant with Offline Copywriting and Online Interactive QA
تقدم هذه الورقة "Click-to-Ask"، وهو مساعد بث مباشر مدعوم بالذكاء الاصطناعي يجمع بين المعالجة متعددة الوسائط غير المتصلة بالإنترنت لإنشاء نصوص ترويجية متوافقة، وبين وحدة تفاعلية عبر الإنترنت تمكن مقدمي البث من معالجة استفسارات المشاهدين في الوقت الفعلي بكفاءة، مما يعزز التفاعل والكفاءة التشغيلية في التجارة الإلكترونية.
تخيل أنك بائع في بث مباشر، أنت أمام الكاميرا، تمسك بهاتف ذكي جديد، وتحاول بيعه لآلاف الأشخاص. إنها وظيفة مليئة بالطاقة العالية، لكنها تأتي مع صداعين كبيرين:
عمل التحضير: قبل أن تذهب للبث المباشر، عليك قراءة مئات الصفحات من الكتيبات التقنية، وقوائم الأسعار، وقوائم الميزات، ثم كتابة سيناريو جذاب لبيع الهاتف. يستغrق الأمر ساعات.
فوضى البث المباشر: بينما تقوم بالبيع، يكتب الناس أسئلة في الدردشة مثل: "هل يدعم الشحن السريع؟" أو "هل الشاشة مقاومة للخدش؟". عليك أن تتوقف، وتبحث عن الإجابة في ملاحظاتك، ثم تنطق بها بصوت عالٍ. إذا فاتتك إجابة، فقدت عملية بيع.
"Click-to-Ask" هو بمثابة توظيف مساعد طيار ذكي للغاية وغير مرئي يجلس بجانبك ويحل كلا المشكلتين فوراً.
إليك كيف يعمل، مقسماً إلى أجزاء بسيطة:
1. مدرب "ما قبل المباراة" (النموذج غير المتصل - Offline Module)
اعتبر هذا بمثابة مساعد البحث الشخصي الخاص بك الذي يعمل بينما أنت نائم.
المشكلة: أنت تضع كومة فوضوية من الملفات على مكتبك: ملفات PDF، مستندات Word، صور للمنتج، وملاحظات صوتية. إنها فوضى عارمة.
حل الذكاء الاصطناعي: يعمل الذكاء الاصطناعي مثل أمين مكتبة فائق التنظيم. يقرأ جميع ملفاتك الفوضوية، ويتجاهل الحشو الممل، وينشئ لك "ورقة غش" منظمة ومرتبة من الحقائق حول المنتج.
كاتب السيناريو: بعد ذلك، يعمل كـ كاتب مبدع. يأخذ ورقة الغش تلك ويكتب لك سيناريو مبيعات ممتعاً ومثيراً.
مفتش السلامة: أخيراً، يعمل كـ محرر صارم. يقوم بمسح السيناريو للتأكد من أنك لا تقول أي شيء غير قانوني أو مخالف للقواعد (مثل الوعود بـ "علاجات معجزة" أو استخدام كلمات محظورة). إذا وجد مشكلة، فإنه يصلحها قبل أن ترى السينديو حتى.
النتيجة: بدلاً من قضاء 4 ساعات في التحضير، تقضي 5 دقائق فقط. تحصل على سيناريو مثالي جاهز للانطلاق.
أنت الآن في بث مباشر. هنا يحدث السحر في الوقت الفعلي.
المشكلة: يكتب أحد المشاهدين: "هل البطارية كبيرة؟". لا يمكنك قراءة كل تعليق بينما تمسك بالهاتف وتبتسم.
حل الذكاء الاصطناعي: هذا هو جزء "Click-to-Ask".
ترى سؤالاً يظهر على شاشتك.
ببسا de تقوم بالنقر على ذلك السؤال باستخدام الماوس أو إصبعك.
السحر: الذكاء الاصطناعي لا يقرأ النص فحسب؛ بل ينظر إلى المكان الذي نقرت فيه بالضبط على الشاشة. هو يعرف: "آه، المستخدم نقر على التعليق المتعلق بالبطارية".
يسحب الإجابة فوراً من "ورقة الغش" الخاصة بك (البيانات المنظمة) ومن "ذاكرته" (ما قلته للتو قبل دقيقة).
يهمس لك بالإجابة المثالية، أو حتى يكتبها لك لتقرأها.
خدعة "الذاكرة": تخيل أنك تروي قصة. إذا سألك أحدهم: "ماذا قلت عن السعر؟"، فأنت لست بحاجة لتذكر القصة بأكملها؛ تحتاج فقط لتذكر الدقائق القليلة الماضية. الذكاء الاصطناعي يفعل هذا أيضاً. هو يقسم بثك المباشر الطويل إلى "حلقات" أو أحداث قصيرة. إذا كنت تتحدث لمدة ساعة، فإن الذكاء الاصطناعي لا يحاول تذكر كل شيء من البداية. هو يتذكر فقط "المشهد" الحالي والدقائق القليلة الماضية، لذا لا يرتبك أو يشعر بالارتباك أبداً.
3. كيف تعلم ليكون بهذا المستوى من المهارة
تذكر الورقة البحثية أن الذكاء الاصطناعي احتاج إلى تدريب خاص لفهم أين نقرت.
التشبيه: تخيل تعليم كلب جلب الأشياء. إذا قلت له فقط "اجلب"، فقد يركض الكلب في الاتجاه الخاطئ. ولكن إذا أشرت بإصبعك إلى الكرة، فسيعرف الكلب بالضبط ما يجب فعله.
التقنية: قام الباحثون بتعليم الذكاء الاصطناعي من خلال إظهار آلاف الصور لبث مباشر مع "مؤشرات أصابع" (تلميحات بصرية) عليها. كما استخدموا طريقة تدريب خاصة (تسمى GRPO) تكافئ الذكاء الاصطناعي عندما يصيب الإجابة وتعاقبه عندما يخمن بشكل خاطئ. جعل هذا الذكاء الاصطناعي حاداً للغاية في ربط نقرتك بالسؤال الصحيح.
الخلاصة
Click-to-Ask هو بمثابة امتلاك فريق من ثلاثة أشخاص فائق الكفاءة يعمل لصالحك:
باحث ينظم ملفاتك الفوضوية.
كاتب ينشئ سيناريو المبيعات الخاص بك.
مساعد مباشر يستمع إلى نقراتك ويجيب الجمهور فوراً.
النتيجة:
بالنسبة لمقدم البث: ضغط أقل، وقت تحضير أقل، ومبيعات أكثر.
بالنسبة للمشاهد: يحصل على إجابات فورية، مما يجعله يشعر بأنه مسموع ويجعله أكثر عرضة للشراء.
بالنسبة للإحصائيات: في الاختبارات، كان النظام صحيحاً بنسبة 91% في التعرف على السؤال وقدم إجابات بجودة 88%، وهو تحسن هائل مقارنة بالطرق القديمة.
إنه يحول وظيفة المبيعات الفوضوية وعالية الضغط إلى محادثة سلسة وتفاعلية.
إليك ملخص تقني مفصل لورقة البحث بعنوان: "Click-to-Ask: مساعد بث مباشر مدعوم بالذكاء الاصطناعي لكتابة المحتوى الإعلاني غير المتصل بالإنترنت والأسئلة والأجوبة التفاعلية عبر الإنترنت."
1. بيان المشكلة
لقد أحدثت التجارة عبر البث المباشر (LSC) تحولاً في تجارة التجزئة الرقمية من خلال دمج الترفيه، والتفاعل الاجتماعي، والتسوق. ومع ذلك، يواجه مقدمو البث المباشر عقبتين حرجتين:
تكاليف التحضير العالية: يتطلب صياغة محتوى إعلاني ترويجي عالي الجودة ومتوافق مع المعايفت وقتاً وجهداً كبيرين لتلخيص معلومات المنتج من مصادر متنوعة (ملفات PDF، صور، مواصفات) مع الالتزام باللوائح الصارمة للمنصات.
زمن الاستجابة للتفاعل في الوقت الفعلي: أثناء البث المباشر، يكافح مقدمو البث للوصول السريع إلى تفاصيل منتج محددة للإجابة على استفسارات المشاهدين (التي تظهر غالباً كـ "دردشة فقاعية" أو تعليقات) في الوقت الفعلي. غالباً ما تفشل مساعدات الذكاء الاصطناعي الحالية في ربط سؤال المشاهد المحدد (الذي تم النقر عليه على الشاشة) بالسياق الصحيح أو بيانات المنتج بدقة، مما يؤدي إلى الهلوسة أو استجابات غير ذات صلة.
2. المنهجية
يقترح المؤلفون نظام Click-to-Ask، وهو مساعد مدعوم بالذكاء الاصطناعي ينقسم إلى وحدتين متكاملتين تماماً: وحدة غير متصلة بالإنترنت (Offline Module) لتحضير المحتوى، ووحدة متصلة بالإنترنت (Online Module) للتفاعل في الوقت الفعلي.
أ. الوحدة غير المتصلة بالإنترنت: الكتابة الإعلانية المؤتمتة
تقوم هذه الوحدة بتحويل مدخلات المنتج غير المتجانسة إلى بيانات مهيكلة وتوليد نصوص ترويجية متوافقة.
معالجة المدخلات: تقبل النصوص، الصور، والملفات (PDF, DOC, WAV). وهي تستخدم محرك MinerU الخاص بها لإجراء التعرف الضوئي على الحروف (OCR) وتحليل التخطيط لملفات PDF، بالإضافة إلى تقنية ASR لتحويل الصوت إلى نص.
وحدة دمج المعلومات (IIM): تستخدم نموذج لغة كبير (LLM) مع مطالبات "سلسلة الأفكام" (CoT) لاستخراج عناصر المنتج البارزة، وإزالة التكرار، وتصفية الضجيج. تقوم بدمج البيانات المقدمة من المستخدم مع المعرفة الخارجية لإنشاء مدخل قاعدة بيانات مهيكل (الاسم، السعر، المواصفات، الميزات، الخدمات).
وحدة توليد الكتابة الإعلانية (CGM): مدعومة بنموذج لغة ورؤية كبير (VLM)، تقوم هذه الوحدة بتوليد نصوص مقنعة بنبرات مختلفة (أدبية، احترافية) بناءً على البيانات المهيكلة وصور المنتج. كما تدمج السرد القائم على السيناريوهات والإشارات العاطفية.
وحدة تنقية المصطلحات المحظورة (PTPM): طبقة أمان حاسمة تقوم بفحص النص المولد مقابل معجم مستمد من إرشادات المنصات (مثل TikTok). تستخدم منطق "سلسلة الأفكار" (CoT) لتحديد ومراجعة أو إزالة المصطلات غير المتوافقة مع الحفاظ على السلاسة الدلالية.
ب. الوحدة المتصلة بالإنترنت: الأسئلة والأجوبة التفاعلية
تمكن هذه الوحدة مقدمي البث من النقر على أسئلة المشاهدين أثناء البث لتفعيل استجابات فورية وسياقية.
روبوت الدردشة القائم على النقر: عندما ينقر مقدم البث على رسالة، يلتقط النظام إطار الفيديو وإحداثيات النقر.
تخليق بيانات التدريب: لتعليم النموذج ربط إحداثيات النقر بمناطق نصية محددة، قام المؤلفون بتخليق مجموعة بيانات (8 آلاف صورة، 32 ألف زوج من الأسئلة والأجوبة) عن طريق دمج نصوص الأسئلة داخل الصور وتعيين إحداثيات بكسل عشوائية، محاكيةً منطق مجموعة بيانات CLEVR.
التعلم القائم على النقر (GRPO): يتم ضبط النموذج باستخدام تحسين السياسة النسبي للمجموعات (GRPO).
دالة المكافأة: تُمنح المكافآت عند تحديد نص السؤال بشكل صحيح في الموقع الذي تم النقر عليه (q^=q∗) وتوليد الإجابة الصحيحة (a^=a∗).
المحفزات البصرية: لحل مشكلة ضعف نماذج VLM في ربط الإحداثيات بالمحتوى البصري، يتم وضع أيقونة مؤشر الماوس فوق نقطة النقر أثناء التدريب. هذا المحفز البصري يحسن المحاذاة متعددة الوسائط بشكل كبير.
الذاكرة التاريخية القائمة على الأحداث: للتعامل مع البث الطويل دون إثقال النموذج:
تجزئة أحداث البث (SES): تقوم بتجزئة فيديو البث بشكل غير متزامن إلى "أحداث" منطقية بناءً على التماسك الدلالي (باستاستخدام تشابه ميزات ViT والتدفق البصري).
مسرع استخراج المعرفة (KEA): يسرع توليد التعليقات التوضيحية عبر اختيار رموز التعليقات التاريخية المثلى كبادئات باستخدام توقعات الرمز التالي (next-token prediction logits)، مما يقلل العبء الحسابي لاسترجاع التاريخ الكامل.
3. المساهمات الرئيسية
بنية ثنائية الوحدات: نظام مبتكر يفصل بين توليد المحتوى (خارج الإنترنت) والتفاعل في الوقت الفعلي (عبر الإنترنت)، مصمم خصيصاً لسير عمل التجارة عبر البث المباشر.
محاذاة الإحداثيات البصرية: تقديم المحفزات البصرية (أيقونات مؤشر الماوس) بالتزامن مع تدريب GRPO لحل التحدي المتمثل في ربط إحداثيات النقر بمناطق النص في إطارات البث المباشر.
إدارة الذاكرة الفعالة: توفر وحدتا SES و KEA حلاً جاهزاً للتشغيل (plug-and-play) لإدارة سياق الفيديو طويل المدى، مما يسمح بتجزئة الأحداث غير المتزامنة وتسريع استرجاع التعليقات التوضيحية التاريخية.
أتمتة الامتثال: مسار متكامل لا يكتفي بتوليد النصوص فحسب، بل يقوم أيضاً بتنقية المحتوى تلقائياً من المصطلحات المحظورة، مما يضمن الامتثال التنظيمي قبل البث.
4. النتائج التجريبية
تم تقييم النظام على مجموعة بيانات مخصصة تضم 396 إطاراً لبث مباشر بأسلوب TikTok عبر خمس فئات (إلكترونيات، أجهزة منزلية، ملابس، أغذية، أخرى).
الأداء غير المتصل بالإنترنت: نجحت وحدة PTPM في تقليل متوسط عدد المصطلحات المحظورة في النص المولد من 4.36 إلى 0.36، مما أظهر فعالية عالية في تصفية الامتثال.
النموذج المرجعي (Qwen2.5-VL 7B): حقق QRA = 0.512 و RQ = 0.536. عانى من صعوبة في الربط المكاني.
إضافة GRPO (نص فقط): تحسن متوسط (QRA 0.599).
إضافة المحفزات البصرية (بدون GRPO): تحسن إلى QRA 0.591.
النظام الكامل (المحفزات البصرية + GRPO): حقق نتائج رائدة (state-of-the-art) بـ QRA = 0.913 و RQ = 0.876.
الاستنتاج: الجمع بين المحفزات البصرية وتحسين السياسة أمر ضروري لتحديد موقع السؤال بدقة وتوليد الاستجابة.
5. الأهمية
التطبيق العملي: يعالج Click-to-Ask مباشرة نقاط الألم التشغيلية لمقدمي البث المباشر، مما يقلل بشكل كبير من وقت التحضير ويعزز التفاعل مع الجمهور من خلال أسئلة وأجوبة فورية ودقيقة.
التقدم التقني: تثبت الورقة أن نماذج VLM القياسية يمكن تكييفها بفعالية لمهام تفاعل واجهة المستخدم المحددة (النقر للسؤال) من خلال تخليق البيانات المستهدفة والمحفزات البصرية، وهو اكتشاف ذو صلة بالتفاعل بين الإنسان والحاسوب (HCI) والوكلاء متعددي الوسائط.
القابلية للتوسع: يضمن التصميم غير المتزامن لوحدات الذاكرة (SES/KEA) بقاء النظام مستجيباً حتى أثناء البث طويل المدى، مما يجعله قابلاً للتطبيق في بيئات التجارة الإلكترونية ذات الحركة المرورية العالية.
تم عرض النظام على أجهزة محمولة، وهو يمثل حلاً قوياً للجيل القادم من التجارة المدعومة بالذكاء الاصطناعي.