← أحدث الأبحاث
💻 computer science

Seg-ReSearch: Segmentation with Interleaved Reasoning and External Search

تقدم الورقة البحثية Seg-ReSearch، وهو نموذج تجزئة مبتكر يتغلب على قيود المعرفة المجمدة لنماذج اللغات الكبيرة متعددة الوسائط من خلال دمج الاستدلال المتداخل مع البحث الخارجي، والذي تم التحقق من صحته عبر معيار جديد (OK-VOS) واستراتيجية تدريب بمكافأة هرمية تحقق أداءً هو الأفضل في فئته في مهام التجزئة ذات العالم المفتوح.

المؤلفون الأصليون: Tianming Liang, Qirui Du, Jian-Fang Hu, Haichao Jiang, Zicheng Lin, Wei-Shi Zheng

نُشر 2026-02-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tianming Liang, Qirui Du, Jian-Fang Hu, Haichao Jiang, Zicheng Lin, Wei-Shi Zheng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث "Seg-ReSearch" باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة: "الدماغ المتجمد" للذكاء الاصطناعي

تخيل أن لديك مساعداً آلياً ذكياً جداً، وهو بارع في النظر إلى الصور ومقاطع الفيديو؛ حيث يمكنه أن يقول لك: "هذا كلب" أو "هذه سيارة حمراء". ومع ذلك، فإن هذا الروبوت يمتلك دماغاً متجمداً. معرفته حُبست في مكانها في اليوم الذي صُنع فيه.

إذا سألته: "من فاز بالجائزة ليلة أمس؟" أو "ابحث لي عن اللعبة الجديدة التي صدرت بالأمس فقط"، فسوف يتعثر الروبوت. هو لا يعرف ما حدث بعد تجميد دماغه. الأمر يشبه أمين مكتبة لديه كتب مطبوعة حتى عام 2024 فقط؛ فإذا سألته عن حدث في عام 2025، فلن يتمكن من مساعدتك، حتى وإن كان ذكياً جداً.

نماذج الذكاء الاصطناعي الحالية تشبه أمين المكتبة هذا؛ فهي بارعة في التفكير المنطقي، لكنها لا تستطيع البحث عن معلومات جديدة لحل مشكلة ما.

الحل: Seg-ReSearch (المحقق مع هاتف ذكي)

ابتكر المؤلفون نظاماً جديداً يسمى Seg-ReSearch. لا تنظر إلى هذا النظام كمين مكتبة، بل كـ محقق يحمل هاتفاً ذكياً.

عندما تعطيه مهمة معقدة — مثل "ابحث عن الفنان الذي استضاف برنامجاً في اليوم الذي ذهب فيه شخص معين إلى الفضاء" — فإن المحقق لا يخمن فحسب. بدلاً من ذلك، يتبع عملية ديناميكية:

  1. يفكر: "أنا لا أعرف التاريخ الذي ذهب فيه هذا الشخص إلى الفضاء. أحتاج للبحث عن ذلك".
  2. يبحث: يستخدم هاتفه (الإنترنت) للعثور على التاريخ.
  3. يفكر مجدداً: "حسناً، الآن لدي التاريخ. أحتاج لمعرفة من استضاف البرنامج في ذلك اليوم".
  4. يبحث مجدداً: يبحث عن قائمة المضيفين.
  5. يجد: "آها! لقد كانت أريانا غراندي. الآن، دعني أنظر إلى الفيديو لأجد وجهها".
  6. يشير: يقوم بتحديد الشخص داخل الفيديو.

هذه العملية "المتداخلة" تعني أن الذكاء الاصطناعي يتوقف عن التفكير ليبحث في الويب، يقرأ ما يجده، ثم يواصل التفكير. هذا يكسر حد "الدماغ المتجمد".

التحدي: تعليم المحقق كيف يبحث ببراعة

قد تعتقد: "فقط اسمح للذكاء الاصطناعي بالبحث في الويب متى أراد". لكن الباحثين وجدوا مشكلة شائكة: كيف تعلم الذكاء الاصطناعي أن يبحث بشكل صحيح؟

إذا كنت تكافئ الذكاء الاصطناعي فقط عندما يصل إلى الإجابة النهائية الصحيحة (مثل إعطاء طالب درجة في نهاية الفصل الدراسي فقط)، فإن الذكاء الاصطناعي سيصبح كسولاً؛ قد يتخطى العمل الشاق المتمثل في البحث ويقوم بالتخمين فقط، على أمل أن يحالفه الحظ.

وإذا كافأت الذكاء الاصطناعي على كل خطوة يتخذها (مثل إعطاء درجة مقابل كل جملة مكتوبة)، فقد يعلق في حلقة مفرغة، ويبحث عن أشياء عديمة الفائدة لمجرد الحصول على النقاط، دون حل المشكلة فعلياً.

الحل: "المكافأة الهرمية" (استراتيجية المدرب)
صمم المؤلفون نظام تسجيل خاص (آلية مكافأة) لتدريب الذكاء الاصطناعي، تماماً مثل مدرب يدرب رياضياً:

  • التوجيه الأولي (خط البداية): يعطي المدرب مكافأة صغيرة لمجرد اتخاذ خطوة أولى جيدة. هذا يضمن أن يبدأ الذكاء الاصطناعي في الاتجاه الصحيح دون إجباره على نسخ الخطوة الأولى للمدرب بدقة.
  • مكافأة العملية المتناقصة (وتيرة الماراثون): بينما يبحث الذكاء الاصطناعي، يحصل على نقاط مقابل البحث، لكن النقاط تصبح أصغر كلما زاد بحثه. هذا يشجع الذكاء الاصطناعي على البحث بما يكفي لإيجاد الإجابة، ولكنه يمنعه من البحث للأبد لمجرد جمع النقاط. هذا يعلمه أن يكون فعالاً.
  • مكافأة النتيجة (خط النهاية): أخيراً، يحصل الذكاء الاصطناعي على مكافأة كبيرة فقط إذا حدد ووضع دائرة حول الشيء الصحيح في الفيديو بشكل صحيح.

هذا التوازن يعلم الذكاء الاصطناعي أن يكون محققاً ذكياً وفعالاً، وليس مجرد مخمن كسول أو باحث مهووس.

الاختبار الجديد: OK-VOS

لإثبات نجاح نظامهم، صمم الباحثون اختباراً جديداً يسمى OK-VOS (تقسيم كائنات الفيديو بناءً على المعرفة الخارجية).

تخيل اختبار فيديو تتضمن أسئلة يستحيل الإجابة عليها دون استخدام "جوجل".

  • السؤال: "ابحث عن الشخص الذي فاز بجائزة 'أفضل فنان جديد' في الفيديو، ولكن فقط إذا فاز بها في عام 2025".
  • الذكاء الاصطناعي القديم: "لا أعرف من هو هذا الشخص. بيانات تدريبي تتوقف عند عام 2024".
  • Seg-ReSearch: "دعني أتحقق من الأخبار... حسناً، لقد وجدت الفائز. الآن دعني أجده في الفيديو".

أظهرت النتائج أن Seg-ReSearch سحق المنافسة. فبينما عانت النماذج الأخرى أو فشلت تماماً في هذه الأسئلة المتعلقة بـ "المعرفة الخارجية"، استخدم Seg-ReSearch حلقة البحث والاستنتاج للعثور على الإجابات والإشارة إلى الأشخاص أو الأشياء الصحيحة في الفيديو.

الملخص

Seg-ReSearch هو طريقة جديدة تجعل الذكاء الاصطناعي ينظر إلى مقاطع الفيديو. فبدلاً من الاعتماد فقط على ما حفظه في الماضي، فإنه يتعلم كيف يفكر، ويبحث في الويب، ويفكر مجدداً، ويبحث مجدداً حتى يجد الإجابة. إنه يستخدم طريقة تدريب خاصة لضمان أن يبحث الذكاء الاصطناعي بذكاء، وليس بشكل عشوائي. وهذا يسمح له بالتعامل مع أسئلة العالم الحقيقي حول الأحداث الجديدة، والمنتجات الجديدة، والحقائق المحددة التي لم يكن أحد يتوقعها وقت بناء الذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →