← أحدث الأبحاث
💻 computer science

Ludi0.1{}_{\scriptscriptstyle 0.1}: An Agentic System for Socially Intelligent Robots

تقدم الورقة البحثية Ludi0.1{}_{\scriptscriptstyle 0.1}، وهو نظام وكيل يجمع بين نموذج لغوي بصري مضبوط بدقة وأدوات متخصصة في الملاحة والتلاعب لتمكين الروبوتات ذات الذكاء الاجتماعي من التعامل مع التفاعلات البشرية الغامضة ومتعددة الأدوار من خلال الاستدلال المدرك للسياق والسلوك التكيفي.

المؤلفون الأصليون: Wooseong Chung, William Cong, Jakub Dworakowski, Ethan Ewer, Tri Wahyu Guntara, Yeonwoo Jeong, Tianchong Jiang, Chaewon Kim, Hyunseo Kim, Jinwoo Kim, Jinyeon Kim, Yea-Seul Kim, Jack Kunde, Kangwook Le
نُشر 2026-08-25
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Wooseong Chung, William Cong, Jakub Dworakowski, Ethan Ewer, Tri Wahyu Guntara, Yeonwoo Jeong, Tianchong Jiang, Chaewon Kim, Hyunseo Kim, Jinwoo Kim, Jinyeon Kim, Yea-Seul Kim, Jack Kunde, Kangwook Lee, Sangheon Lee, Robert Nowak, Junha Roh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

على مدى عقود، ظل حلم وجود روبوت متعاون محدودًا بواقع بسيط: الآلات بارعة في اتباع التعليمات الصارمة لكنها سيئة للغاية في فهم الطبيعة الفوضوية والمتغيرة للمحادثة البشرية. إذا قلت لروبوت تقليدي "أحضر لي العلبة الحمراء"، فسيجد العلبة الحمراء ويحضرها، حتى لو غيرت رأيك في منتصف العملية. فهو يفتقر إلى الذكاء الاجتماعي لإدراك أن نيتك قد تطورت، ليتوقف عن فعله، وليكيف سلوكه بناءً على معلومة جديدة. هذه الفجوة بين البرمجة الجامدة والتفاعل البشري المرن هي التحدي المركزي الذي يحاول الباحثون الآن حله. إن المجال ينتقل لما هو أبعد من تعليم الروبوتات مجرد الرؤية والحركة؛ الهدف الجديد هو تعليمها الاستماع، والتذكر، والتفكير، وتغيير رأيها في الوقت الفعلي، تمامًا كما يفعل البشر عندما يعملون معًا.

لقد اتخذ فريق في "لودو روبوتيكس" (Ludo Robotics) خطوة كبيرة نحو هذا الهدف من خلال نظام جديد يسمى "لودي 0.1" (Ludi0.1). هذا ليس قطعة واحدة من البرمجيات تحاول القيام بكل شيء في آن واحد، بل هو فريق منسق من الأدوات المتخصصة التي تعمل معًا تحت إشراف "دماغ" مركزي. هذا الدماغ هو نوع من الذكاء الاصطناعي المدرب على فهم كل من الصور واللغة، ولكنه تم تعليمه خصيصًا كيفية التعامل مع الأخذ والرد في محادثة حقيقية. بنى الباحثون نظامًا يمكن لهذا الدماغ من خلاله أن ينظر إلى ما يراه، ويستمع إلى ما يقوله الشخص، ويتذكر ما حدث قبل لحظة، ثم يقرر ما إذا كان سيتحدث، أو يتحرك، أو يلتقط شيئًا، أو ينتظر. الابتكار الرئيسي هو أن النظام مصمم للتعامل مع المقاطعات والتصحيحات. فإذا بدأ شخص ما بطلب "كوكا كولا"، وبدأ الروبوت في الوصول إليها، لكن الشخص قال فجأة: "في الواقع، هي تفضل بيبسي"، فإن "لودي 0.1" يدرك أن الخطة القديمة لم تعد صالحة. يتوقف عن الوصول إلى الكوكا كولا، ويحول تركيزه إلى البيبسي، ويواصل المهمة مع التعليمات الجديدة، كل ذلك دون كسر تدفق التفاعل.

لبناء هذا، لم يعتمد الباحثون على نموذج واحد ضخم يحاول تعلم كل شيء من الصفر. بد بدلاً من ذلك، أنشأوا هيكلًا يعمل فيه نموذج استدلال مركزي كمدير. يتلقى هذا المدير تدفقًا من المعلومات: بث فيديو مباشر من عيون الروبوت، ونص ما قاله الإنسان للتو، وسجل لكل ما فعله الروبوت أو فكر فيه حتى الآن. وبناءً على هذه الصورة الكاملة، يقرر المدير الأداة التي سيستخدمها تاليًا. هذه الأدوات هي برامج متخصصة لمهام محددة، مثل التحقق مما إذا كان جسم ما في متناول اليد، أو التنقل إلى غرفة مسمى مثل غرفة النوم، أو الإمساك بجسم ما بالفعل. قد يقرر المدير طرح سؤال توضيحي، أو قد يقرر المشي إلى مكتب. والأهم من ذلك، أن النظام مصمم ليعمل محليًا على محطة عمل مزودة بمعالج رسومات (GPU) في الموقع متصلة بالروبوت، مما يعني أنه لا يحتاج إلى انتظار اتصال بالإنترنت ليفكر أو يتصرف. وهذا يسمح للروبوت بالاستجابة فورًا، حتى أثناء حديثه أو تحركه.

اختبر الفريق هذا النظام على "يونيتري جي 1" (Unitree G1)، وهو روبوت بشري يقف ويمشي مثل الإنسان. لقد أنشأوا محاكاة لبيئة منزلية لتدريب الروبوت، مولدين آلاف الأمثلة للتفاعلات المعقدة. في سيناريوهات التدريب هذه، مارس الروبوت التعامل مع الطلبات الغامضة، والتعامل مع التصحيحات في منتصف المهمة، وإدارة المهام متعددة الخطوات. على سبيل المثال، تعلم الروبوت أنه إذا قال المستخدم "أحضر اللابتوب الأوسط"، فيجب عليه أولاً النظر إلى المشهد لتحديد أي لابتوب هو الموجود في المنتصف قبل أن يحاول التقاطه. تضمنت بيانات التدريب مواقف غير فيها المستخدم رأيه، أو قاطع الروبوت، أو قدم معلومات جديدة بينما كان الروبوت يقوم بالفعل بعمل ما. وجد الباحثون أنه من خلال ضبط نموذج الاستدلال المركزي الخاص بهم على أنماط التفاعل هذه، أصبح الروبوت أفضل بكثير في إكمال المهام بنجاح. وفي اختباراتهم، تمكن النظام من إكمال 20 من أصل 28 سيناريو معقدًا من البداية إلى النهاية، وهو تحسن كبير مقارنة بالنسخة غير المدربة من نفس النموذج.

يكمن نجاح "لودي 0.1" في قدرته على إبقاء المحادثة والعمل الفيزيائي مرتبطين بنفس الواقع. الروبوت لا ينطق كلمات فحسب؛ بل ينطق كلمات مرتبطة مباشرة بما يراه وما يفعله. إذا كان الروبوت يمشي إلى غرفة، فيمكنه شرح أين يذهب. وإذا لم يستطع الوصول إلى جسم ما، فيمكنه قول ذلك بصدق. يحافظ النظام على سجل مشترك للتفاعل، مما يسمه بتذكر أن المستخدم أراد في الأصل كوكا كولا ولكنه تحول بعد ذلك إلى بيبسي. هذه الذاكرة ليست مجرد قائمة من الحقائق؛ إنها سياق حي يشكل كل قرار جديد يتخذه الروبوت. وقد أظهر الباحثون ذلك في اختبار واقعي حيث طلب مستخدم من الروبوت إحضار مشروب لشخص في غرفة النوم. عندما صحح المستخدم الطلب من كوكا كولا إلى بيبسي بينما كان الروبوت يمد يده بالفعل نحو العلبة الأولى، توقف الروبوت على الفور، وحول تركيزه إلى المشروب الصحيح، وانتقل إلى غرفة النوم، ووضع المشروب على المكتب، كل ذلك مع شرح أفعاله للمستخدم.

بينما يعد النظام مثيرًا للإعجاب، إلا أن الباحثين واضحون بشأن حدوده الحالية. ذكاء الروبوت هو مزيج من دماغ مركزي وأدوات منفصلة ومتخصصة. يقرر الدماغ ما يجب فعله، وتقوم الأدوات بالعمل، لكنهما ليسا عقلًا واحدًا موحدًا بعد. هذا الفصل يمكن أن يسبب أحيانًا تأخيرات أو يجعل سلوك الروبوت يبدو مجزأً قليلاً، كما لو أن أجزاء مختلفة من النظام تتحدث مع بعضها البعض بدلاً من العمل ككيان واحد. يقر الباحثون بأن الخطوة التالية هي الانتقال لما هو أبعد من هذا النهج الجزئي. إنهم يعملون نحو نسخة مستقبلية، "لودي 1.0" (Ludi 1.0)، والتي ستكون نموذجًا تأسيسيًا واحدًا يدمج الإدراك، واللغة، والذاكرة، والتحكم الفيزيائي في نظام واحد متماسك. في الوقت الحالي، يعمل "لودي 0.1" كنموذج أولي عامل ومصدر لبيانات قيمة. ومن خلال مراقبة كيفية تفاعل الروبوت مع الناس، يجمع الباحثون أنواع الآثار الواقعية اللازمة لتدريب الجيل القادم من الروبوتات الاجتماعية المتكاملة حقًا.

إن العمل المقدم في هذه الورقة يثبت أن التعاون السلس بين الإنسان والروبوت ممكن اليوم، بشرط أن يكون النظام مصممًا للتعامل مع عدم القدرة على التنبؤ بالنية البشرية. لقد أظهر الباحثون أنه من خلال الجمع بين نواة استدلال ومهارات فيزيائية متخصصة وذاكرة قوية للتفاعل، يمكن للروبوت التكيف مع التغييرات في منتصف المهمة. هذه ليست مشكلة محلولة، ولا يزال النظام الحالي يعتمد على بنية مهيكلة بدلاً من ذكاء موحد ومتعلم بالكامل. ومع ذلك، فإن النتائج تشير إلى مسار واضح للمضي قدمًا. إن القدرة على التوقف، والاستماع، والمراجعة، والاستمرار لم تعد مجرد مفهوم نظري؛ بل هي قدرة يمكن بناؤها واختبارها الآن. وبينما يستمر الفريق في تحسين هذه الأنظمة، فإن الفجوة بين الآلات الجامدة في الماضي والشركاء التعاونيين في المستقبل تستمر في التقلص.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →