← أحدث الأبحاث
💻 computer science

CIRCLED: A Multi-turn CIR Dataset with Consistent Dialogues across Domains

تقدم الورقة البحثية CIRCLED، وهو عبارة عن مجموعة بيانات لاسترجاع الصور المركب متعددة الأدوار (MTCIR) واسعة النطاق وعالية الجودة تغطي تسعة مجالات، والتي تعالج أوجه القصور في مجموعات البيانات الحالية المقتصرة على الأزياء من خلال ضمان اتساق الحوار وتوفير معيار مرجعي قوي للأبحاث المستقبلية.

المؤلفون الأصليون: Tomohisa Takeda, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tomohisa Takeda, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثين على زيّ معين في متجر ضخم لا ينتهي، لكن لا يمكنك وصفه بدقة في جملة واحدة. أنت تعلم أنك تريد "فستاناً أحمر"، ولكن عندما ترى النتائج، تفكر: "لا، هذا زاهٍ جداً. أريده داكناً، بأكمام طويلة، وربما بحزام".

في عالم علوم الحاسوب، يسمى هذا استرجاع الصور المركب متعدد الأدوار (Multi-Turn Composed Image Retrieval - CIR). وهو نظام حيث تبدأ بصورة ووصف نصي، ثم تستمر في تحسين بحثك دوراً تلو الآخر حتى تجد بالضبط ما تريد.

يقدم البحث أداة جديدة تسمى CIRCLED لمساعدة الباحثين في بناء أنظمة أفضل لهذا النوع من البحث. إليك تفصيل ما قاموا به، باستخدام تشبيهات بسيطة.

المشكلة: "الخريطة المكسورة"

قبل هذا البحث، كان لدى الباحثين مجموعة بيانات (مجموعة من مسائل التدريب) تسمى Multi-turn FashionIQ. لكن المؤلفين يقولون إن مجموعة البيانات القديمة كانت تشبه الخريطة المكسورة.

  • المشكلة: في مجموعة البيانات القديمة، لم تكن الخطوات للوصول إلى الإجابة منطقية دائماً. تخيل أنك تبحث عن "فستان أسود".
    • الدور الأول: تطلب "فستاناً أحمر".
    • الدور الثاني: يعرض لك النظام "فستان حفلات ملوناً".
    • الدور الثالث: تطلب "فستاناً أسود".
    • الخلل: تضمنت مجموعة البيانات القديمة أحياناً خطوات تجعل البحث يبتعد فعلياً عن الهدف، أو تعليمات مكررة بلا معنى (مثل قول "اجعله أحمر" ثلاث مرات متتالية). كان الأمر يشبه نظام GPS يخبرك أن تقود شمالاً، ثم جنوباً، ثم شمالاً مرة أخرى، دون أن يقربك أبداً من وجهتك.
  • القصور: كانت مجموعة البيانات القديمة تقتصر فقط على الملابس (الأزياء). لم تختبر ما إذا كان بإمكان النظام العثور على كلب، أو سيارة، أو منظر طبيعي.

الحل: CIRCLED (الـ "بوصلة المثالية")

بنى المؤلفون CIRCLED، وهي مجموعة بيانات جديدة تعمل مثل بوصلة مثالية.

  1. التقدم المتسق: في CIRCLED، كل خطوة في المحادثة تدفعك لتقترب من الهدف. إذا كان الهدف هو "فستان أسود"، فإن كل دور يقربك قليلاً من الفستان الأسود، ولا يبتعد عن المسار أبداً.
  2. معلومات جديدة: في كل مرة تتحدث فيها، تضيف شيئاً جديداً. أنت لا تكرر نفسك. إنه يشبه المحقق الذي يجمع الأدلة: "أولاً، إنه كلب. ثانياً، إنه كلب من فصيلة جولدن ريتريفر. ثالثاً، يرتدي طوقاً أحمر". كل دليل يضيف قيمة.
  3. آفاق أوسع: لم يكتفوا بالملابس فقط، بل وسعوا مجموعة البيانات لتشمل عناصر عامة (مثل تلك الموجودة في مجموعتي البيانات CIRR وCIRCO)، بحيث يمكن للنظام تعلم البحث عن أي شيء، وليس الأزياء فقط.

كيف بنوا ذلك: "مساعد المتجر الآلي"

لإنشاء مجموعة البيانات هذه، لم يطلبوا من البشر كتابة محادثات عشوائية، بل استخدموا مساراً آلياً ذكياً:

  1. نقطة البداية: أخذوا عمليات بحث موجودة من دور واحد (صورة واحدة + نص واحد).
  2. المحاكاة: استخدموا ذكاءً اصطناعياً قوياً (نموذج لغوي كبير - LLM) ليعمل كـ "مساعد متجر".
    • ينظر الذكاء الاصطناعي إلى نتائج البحث.
    • إذا لم يكن العنصر المثالي في المقدمة، يختار الذكاء الاصطناعي أقرب عنصر وجده.
    • ثم يكتب الذكاء الاصطناعي تعليمات جديدة حول كيفية تغيير ذلك "العنصر الأقرب" ليصبح هو "العنصر المثالي".
    • مثال: "الفستان أحمر، لكنني أريده أسود. وأضف حزاماً أيضاً".
  3. ضبط الجودة (الفلاتر): هذا هو الجزء الأهم. لقد مرروا المحادثات عبر أربعة فلاتر صارمة لضمان الجودة:
    • فلتر النجاح: هل وجد البحث العنصر في النهاية؟ إذا لم يكن كذلك، يتم استبعاده.
    • فلتر تعدد الأدوار: هل استغرق الأمر بالفعل أكثر من خطوة واحدة؟ إذا تم العثور على الإجابة فوراً، فهي ليست محادثة "متعددة الأدوار"، لذا يتم استبعادها.
    • فلتر اتساق الترتيب: هل ساءت نتائج البحث في المنتصف؟ إذا اختفى "العنصر المثالي" من قائمة العشرة الأوائل في منتصف الدردشة، فإن المحادثة معطلة. يتم استبعادها.
    • فلتر عدم التكرار: هل كرر الذكاء الاصطناعي نفس الكلمات؟ إذا كانت التعليمات الجديدة مشابهة جداً للقديمة، يتم استبعادها.

النتيجة: "ملعب ضخم وعالي الجودة"

النتيجة النهائية هي مجموعة بيانات تحتوي على 22,608 محادثة (جلسات).

  • هي أكبر بنحو ضعفي أفضل مجموعة بيانات سابقة.
  • تحتوي على أكثر من 200,000 صورة.
  • تغطي الأزياء (فساتين، قمصان) والعناصر العامة (حيوانات، أشياء).
  • تتراوح المحادثات بين 2 إلى 6 أدوار، بمتوسط حوالي 2.5 دور.

لماذا يهم هذا؟

اختبر المؤلفون عدة طرق ذكاء اصطناعي موجودة على مجموعة البيانات الجديدة هذه، ووجدوا أن:

  • النص هو الملك: في هذه المحادثات متعددة الأدوار، التعليمات النصية التي تقدمها أهم بكثير من الصور المرجعية التي تعرضها.
  • التعلم التدريجي: أفضل الأنظمة هي تلك التي يمكنها تذكر تاريخ المحادثة بالكامل، وليس فقط آخر شيء قلته.
  • معيار جديد: لأن CIRCLED متسقة وعالية الجودة، فهي تمنح الباحثين طريقة عادلة لاختبار ما إذا كانت "روبوتات البحث" الجديدة لديهم تصبح أكثر ذكاءً حقاً أم أنها مجرد تخمين.

باختاً، CIRCLED هي ميدان تدريب جديد وعالي الجودة يضمن أن يتعلم الذكاء الاصطناعي إجراء محادثة منطقية وخطوة بخطوة للعثيد تماماً عما تبحث عنه، دون أن يرتبك أو يكرر نفسه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →