← أحدث الأبحاث
⚡ electrical engineering

Privileged observations enable rapid and reliable policy discovery directly in the physical world

تُثبت هذه الورقة أن الملاحظات المتميزة لنظام فيزيائي فوضوي تُعد حاسمة لتمكين وكلاء التعلم المعزز من اكتشاف سياسات عالية الأداء بسرعة مباشرة في العالم الحقيقي، حيث فشلت الوكلاء التي تفتقر إلى بيانات التدفق هذه في تعلم استراتيجيات زيادة السحب رغم نجاحها في تعلم استراتيجيات تقليل السحب.

المؤلفون الأصليون: Antonio Terpin, Raffaello D'Andrea

نُشر 2026-09-15
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Antonio Terpin, Raffaello D'Andrea

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل سباحاً يحاول التحرك عبر الماء. لو كان بإمكانه رؤية التيارات وهي تلتف حوله، لربما تعلم كيف يلوِي جسده بطريقة تقطع المقاومة، أو ربما بطريقة تلتقط الماء لتدفعه للأمام. هذا هو جوهر التحكم النشط في التدفق: وهو مجال يحاول فيه المهندسون التلاعب بالحركة غير المرئية والفوضوية للسوائل لتحسين كيفية تحرك الأجسام أو بقائها ثابتة. لعقود من الزمن، عرف العلماء أن تدوير أسطوانة في مجرى مائي يمكن أن يغير مقدار دفع الماء ضدها. أحياناً، يقلل الدوران المستمر من السحب، مما يسمح للجسم بالانزلاق بسهولة أكبر. وفي أحيان أخرى، يمكن لتدوير إيقاعي محدد أن يزيد بالفعل من السحب، مما يعيق حركة الجسم. كان التحدي دائماً يكمكمن في تحديد التوقيت والسرعة الدقيقين لهذا الدوران لتحقيق أفضل نتيجة، خاصة لأن تدفق الماء فوضوي ويصعب التنبؤ به.

عادةً، عندما يريد المهندسون تعليم حاسوب كيفية التحكم في مثل هذا النظام، فإنهم يبنون نموذجاً افتراضياً للماء ويتركون الحاسوب يتدرب هناك. لكن النماذج الافتراضية ليست مثالية أبمة؛ فهي تفتقر إلى التفاصيل الصغيرة والمضطربة للماء الحقيقي. لذا، قرر فريق من الباحثين في معهد ETH زيورخ تخطي المحاكاة تماماً. لقد بنوا قناة مائية فيزيائية وعلموا وكيلاً حاسوبياً التعلم مباشرة من الماء الحقيقي المتلاطم. وكان السؤال الذي طرحوه بسيطاً ولكنه عميق: لكي يتعلم الحاسوب أفضل طريقة للتحكم في الماء، هل يحتاج إلى رؤية الماء وهو يلتف حول الجسم أثناء عملية التعلم؟ أم يمكنه استنتاج ذلك بمجرد الشعور بالدفع والجذب على الجسم نفسه؟

قام الباحثون بإعداد قناة مائية على طاولة، وهي خزان شفاف يدور فيه الماء في حلقة. داخل القناة، توجد أسطوانة في المجرى، ويمكن لمحرك تدويرها بأي سرعة أو اتجاه. وللقياس مدى دفع الماء ضد الأسطوانة، استخدموا مستشعراً حساساً لعزم الدوران. ولرؤية الماء، استخدموا تقنية تسمى قياس سرعة الصور الجسيمية (PIV). يتضمن ذلك تسليط ورقة ليزر عبر الماء، الذي يحتوي على جزيئات عائمة صغيرة، والتقاط صور سريعة. ومن خلال تتبع حركة تلك الجزيئات بين الصور، يمكن للحاسوب بناء خريطة تفصيلية وفورية لسرعة واتجاه الماء خلف الأسطوانة مباشرة. هذه الخريطة هي "الملاحظة المتميزة" – وهي معلومات إضافية يمكن للحاسوب رؤيتها أثناء التدريب، ولكن قد لا يحتاج إليها لاحقاً.

قاموا بتدريب وكيل تعلم عام الأغراض، وهو نوع من الذكاء الاصطناعي، للتحكم في الأسطوانة. في مجموعة واحدة من التجارب، تم تزويد الوكيل بكل من الشعور بالسحب وخريطة تفصيلية لتدفق الماء. وفي مجموعة أخرى، تم تزويد الوكيل فقط بالشعور بالسحب، مع إخفاء خريطة الماء عنه. كان الهدف مزدوجاً: أولاً، إيجاد طريقة لتدوير الأسطوانة لتقليل السحب قدر الإمكان، وثانياً، إيجاد طريقة لتدويرها لزيادة السحب قدر الإمكان.

كانت النتائج مذهلة وكشفت عن تباين مفاجئ. عندما كان لدى الوكيل إمكانية الوصول إلى الخريطة التفصيلية لتدفق الماء، تعلم بسرعة هائلة. ففي غضما دقائق من التفاعل مع الماء الحقيقي، اكتشف استراتيجية لتقليل السحب بنسبة 32 بالمائة تقريباً. كما وجد بسرعة استراتيجية لزيادة السحب بنسبة 25 بالمائة تقريباً. طابقت هذه الأرقام أو حتى تجاوزت قليلاً أداء أفضل الاستراتيجيات المعروفة التي صممها البشر، والتي تم تطويرها عبر عقود من الدراسة.

ومع ذلك، عندما أخفى الباحثون خريطة الماء وأجبروا الوكيل على التعلم باستخدام قياس السحب فقط، تغيرت القصة تماماً. كان لا يزال بإمكان الوكيل التعلم كيفية تقليل السحب، محققاً في النهاية انخفاضاً بنسبة 31 بالمائة تقريباً، لكن الأمر استغرق وقتاً أطول وكان أكثر تذبذباً. ولكن عندما كان الهدف هو زيادة السحب، فشل الوكيل. فبدون رؤية تدفق الماء، لم تنجح أي من عمليات التدريب في تعلم استراتيجية تزيد السحب بشكل ملحوظ، رغم أن أفضل استراتيجية ممكنة كانت موجودة وممكنة فيزيائياً. لم يستطع الوكيل فهم كيفية جعل الماء يدفع بقوة أكبر، رغم وجود تلك الإمكانية.

لفهم سبب حدوث ذلك، نظر الباحثون بدقة فيما كان يفعله الماء. ووجدوا أنه كلما بدأت الأسطوانة في الدوران، كان رد فعل الماء دائماً تقريباً هو الدفع بشكل أقل ضد الأسطوانة، بغض النظر عما إذا كان الهدف هو الدفع أكثر أو أقل. هذا الانخفاض الأولي في السحب هو استجابة فيزيائية طبيعية. وبالنسبة للوكيل الذي يحاول تقليل السحب، كان هذا الانخفاض الأولي علامة مفيدة تشير إلى أنه على المسار الصحيح. أما بالنسبة للوكيل الذي يحاول زيادة السح، فقد كان هذا الانخفاض الأولي مربكاً؛ فقد بدا وكأنه عكس ما يريد تحقيقه تماماً. وبدون خريطة الماء التفصيلية لرؤية الصورة الأكبر وفهم أن السحب سيرتفع في النها، ظل الوكيل عالقاً في هذا الانخفاض الأولي ولم يتعلم الاستراتيجية الصحيحة أبداً.

بعد ذلك، اختبر الباحثون ما إذا كانت الاستراتيجيات التي تعلمها الوكيل بوجود خريطة الماء يمكن استخدامها بدونها. قاموا بتسجيل أنماط الدوران الدقيقة التي استخدمها الوكيل عندما كان لديه الخريطة، ثم أعادوا تشغيل تلك الأنماط كمتواليات ثابتة، دون أي ملاحظات جديدة. ومن المثير للدهشة، عملت هذه المتواليات الثابتة بنفس كفاءة الوكيل الحي الذي يعمل بالاستجابة اللحظية. لقد تعلم الوكيل مجموعة محددة من الحركات التي تعمل بشكل جيد جداً لدرجة أنه لم يعد بحاجة لمراقبة الماء لتنفيذها. وهذا يثبت أن خريطة الماء لم تكن ضرورية لأداء المهمة، ولكنها كانت ضرورية تماماً لاكتشاف المهمة.

يسلط هذا الاكتشاف الضوء على تمييز حاسم في التعلم: ما تحتاجه لإيجاد الحل غالباً ما يختلف عما تحتاجه لاستخدامه. في هذه الحالة، عملت الرؤية الغنية والتفصيلية لتدفق الماء كمعلم، حيث أرشدت الوكيل عبر التفاعلات الأولية المربكة للسائل. وبمجرد أن وجد الوكيل المسار الصحيح، استطاع سلوكه وهو معصوب العينين. تشير الدراسة إلى أنه في الأنظمة الفيزيائية المعقدة، قد يكون الوصول إلى معلومات إضافية خلال مرحلة التعلم هو العامل الحاسم بين النجاح والفشل، حتى لو لم تكن تلك المعلومات متاحة عند تشغيل النظام فعلياً. إنها تظهر أنه لكي يتقن الذكاء الاصطناعي العالم الحقيقي الفوضوي والمضطرب، قد يحتاج إلى السماح له برؤية أكثر مما سيُسمح له باستخدامه أبداً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →