← أحدث الأبحاث
💬 NLP

StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data

يُعد StocksTalk وكيلًا حواريًا شفافًا يدعم التفاعل الصوتي، يقوم بتحويل الطلبات المالية المنطوقة إلى استعلامات SQL صالحة وقابلة للتنفيذ عبر الجمع بين التعرف المستمر على الكلام، واستخراج القيود المعزز بالاسترجاع، والتحقق التفاعلي من خلال العنصر البشري، وذلك للتفوق على النهج الأساسي للنماذج اللغوية الكبيرة في الدقة والاستقرار.

المؤلفون الأصليون: Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

نُشر 2026-08-20
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم التمويل، غالبًا ما يبدو اتخاذ القرار وكأنه بحث عن إبرة في كومة قش، لكن كومة القش هذه مكونة من ملايين الأرقام، والإبرة هي نمط محدد من النمو أو القيمة. لعقود من الزمن، حاول الباحثون تعليم الحواسيب فهم لغة البشر حتى يتمكن أي شخص من طرح سؤال والحصول على إجابة دقيقة من قاعدة بيانات. يهدف هذا المجال، المعروف باسم "تحويل النص إلى لغة SQL"، إلى ترجمة الطريقة المرنة وغير المنظمة التي يتحدث بها البشر إلى اللغة الصارمة والدقيقة التي تتطلبها قواعد بيانات الحاسوب. ومع ذلك، فإن معظم هذه الأنظمة تم اختبارها في ظروف هادئة ومثالية مع نصوص مكتوبة؛ فهي تعاني عندما تواجه واقع الكلام البشري، الذي غالبًا ما يكون مليئًا بالضوضاء في الخلفية، واللكنات، والميل الطبيعي للتحدث بأفكار غير مكتملة. وفي ساحة الاستثمار عالية المخاطر، حيث يمكن لخطأ في فهم رقم واحد أن يؤدي إلى خطأ مكلف، تبرز الفجوة بين ما يقوله الشخص وما ينفذه الحاسوب كفجوة خطيرة.

قام فريق من الباحثين في المعهد الهندي للتكنولوجيا (IIIT-Delhi) ومعهد سنغافورة للتكنولوجيا ببناء نظام جديد يسمى "StocksTalk" لسد هذه الفجوة. لقد أنشأوا مساعدًا يعمل بالصوت مصممًا خصيصًا لتحويل أفكار الاستثمار المنطوقة إلى استعلامات قواعد بيانات صالحة وقابلة للعمل. وخلافًا للأدوات السابقة التي قد تخمن قصد المستخدم وتأمل في الأفضل، بُني "StocksTalk" ليكون شفافًا وحذرًا. فهو لا يعامل عملية البحث عن الأسهم كقفزة واحدة من المنطق، بل كسلسلة من الخطوات الدقيقة حيث يتحقق الحاسوب من عمله ويدعو الإنسان للقيام بالمثل. يستمع النظام للمستخدم وهو يتحدث، ويقوم بتفكيك الجملة إلى قواعد مالية محددة، ويتحقق من تلك القواعد مقابل قاعدة بيانات السوق في الوقت الفعلي، ثم يعرض للمستخدم بالضبط ما ينوي القيام به قبل تشغيل عملية البحث فعليًا.

اختبر الباحثون هذا النظام باستخدام مجموعة معدة بعنازة من 150 مطالبة صوتية، تغطي ثلاثة أنواع مختلفة من استراتيجيات الاستثمار: البحث عن الشركات سريعة النمو، وإيجاد الأسهم التي تدفع توزيعات أرباح منتظمة، والبحث عن الأصول المقومة بأقل من قيمتها الحقيقية. وقد سجلوا هذه المطالبات في بيئتين مختلفتين تمامًا: إحداهما في غرفة هادئة والأخرى في كافتيريا صاخبة لمحاكاة المشتتات في العالم الحقيقي. وأظهرت النتائج أنه بينما كان بإمكان نموذج ذكاء اصطناعي قياسي غير مدعوم بآليات تحقق توليد استعلام بنسبة 81 بالمائة تقريبًا دون الانهيار، إلا أنه غالبًا ما أنتج إجابات غير متسقة منطقيًا أو غير منطقية ماليًا. ومن خلال إضافة طبقات من التحقق وطريقة لاسترجاع تعريفات مالية محددة أثناء العملية، حسن النظام قدرته على توليد استعلامات صحيحة لتصل إلى ما يقرب من 98 بالمائة. والأهم من ذلك، أن قدرة النظام على البقاء على المسار الصحيح أثناء محادثة ذهاب وإياب تحسنت بشكل كبير، حيث قفزت من حوالي 51 بالمائة من الدقة إلى ما يقرب من 89 بالمائة عندما يُسمح للإنسان بالتحقق من الخطوات على طول الطريق.

يكمن جوهر نجاح النظام في كيفية تعامله مع عدم اليقين في الكلام البشري. فعندما يقول المستخدم شيئًا مثل "ابحث عن أسهم تكنولوجية كبيرة ذات هوامش ربح متزايدة"، لا يقوم النظام فورًا بإطلاق عملية بحث. بدلاً من ذلك، يقوم أولاً بتحويل الصوت إلى نص، ثم يستخدم نظام استرجاع للبحث عن المعنى الدقيق لـ "هوامش ربح متزايدة" في سياق قاعدة البيانات المحددة التي يستخدمها. بعد ذلك، يقوم بإنشاء مسودة استعلام ويعرضها للمستخدم على لوحة تحكم. تعرض لوحة التحكم هذه القواعد المستخرجة، والعمليات الرياضية التي اختارها، والرمز البريدي النهائي الذي ينوي تشغيله. يمكن للمستخدم معرفة ما إذا كان الحاسوب قد أساء فهم رقم أو فئة وتصحيح ذلك قبل بدء البحث. وقد أثبت نهج "الإنسان في الحلقة" (human-in-the-loop) هذا أنه ضروري، خاصة للطلبات المعقدة التي تتضمن شروطًا متعددة، حيث كان النظام وحده سيرتكب أخطاء في حالة واحدة من كل ثلاث محاولات تقريبًا.

كما سلطت الدراسة الضوء على أن العقبة الكبرى تظل هي جودة التعرف على الصوت نفسها. فعندما تم تسجيل الصوت في بيئة صاخبة، انخفضت قدرة النظام على تحديد أرقام ومصطلحات مالية معينة بشكل كبير، مما أدى إلى المزيد من الأخطاء في الاستعلام النهائي. وهذا يشير إلى أنه بينما تكون طبقات المنطق والتحقق قوية، فإن الخطوة الأولى المتمثلة في سماع المستخدم بوضوح لا تزال هي الجزء الأكثر هشاشة في السلسلة. ووجد الباحثون أن طريقتهم في تقسيم المشكلة إلى مراحل أصغر وقابلة للتحقق منعت النظام من تراكم الأخطاء الصغيرة وتحولها إلى إخفاقات كبيرة. فعلى سبيل المثال، في محادثة متعددة الأدوار حيث يقوم المستخدم بتنقيح بحثه، كان النظام بدون التحقق البشري يفقد المسار الأصلي للقيود غالبًا، بينما حافظ الإصدار التفاعلي على المسار الصحيح بنسبة تقترب من 90 بالمائة.

وبالنظر إلى المستقبل، يتصور الفريق توسيع هذا النهج ليشمل الأخبار وتقارير الأرب "في الوقت الفعلي"، مما يسم يسمح للنظام بالإجابة على أسئلة مثل "أي الشركات تجاوزت تقديرات أرباحها في الربع الأخير؟" من خلال جلب بيانات جديدة فور وصولها. كما يخططون للسماح للنظام بمقارنة النتائج الجديدة مع محفظة المستخدم الحالية، مما يتيح تقديم نصائح أكثر تخصيصًا. يوضح هذا العمل أنه بالنسبة للمهام المعقدة وعالية المخاطر، فإن المسار الأكثر موثوقية ليس بناء آلة تحاول أن تكون مثالية بمفردها، بل بناء آلة تعرف متى تتوقف، وتظهر عملها، وتطلب المساعدة. ومن خلال جعل عملية الاستنتاج مرئية وقابلة للتعديل، يحول "StocksTalk" صندوق الذكاء الاصطناعي الأسود إلى أداة تعاونية، مما يضمن أن الإجابة النهائية ليست مجرد تخمين، بل حقيقة تم التحقق منها وجاهزة للعالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →