← أحدث الأبحاث
💻 computer science

Testing JSON Schema Instruction Artifacts: Distributional Robustness under Validation-Equivalent Serialization and JSON Mode

تُظهر هذه الدراسة أن عمليات تسلسل (JSON Schema) المتكافئة في التحقق يمكن أن تؤدي إلى تغييرات ذات دلالة إحصائية ومعنى عملي في توزيعات مخرجات النماذج اللغوية، مما يكشف أن التكافؤ في التحقق وحده غير كافٍ ليكون أوراكل تراجع (regression oracle) لضمان المتانة التوزيعية في الأنظمة المنشورة.

المؤلفون الأصليون: Shengyao Sun

نُشر 2026-08-07
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shengyao Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعطي روبوتاً ذكياً جداً، ولكنه حرفي للغاية في فهمه، مجموعة من التعليمات لبناء نوع معين من السندوتشات. تكتب التعليمات على ورقة. الآن، تخيل أن لديك ختماً سحرياً مكتوب عليه: "وصفة هذا السندوتش مثالية". هذا الختم يتحقق مما إذا كنت قد وضعت جميع المكونات الصحيحة (الخبز، الجبن، اللحم) وما إذا كنت قد نسيت الخردل بالخطأ. ولكن هنا تكمن الخدعة: الختم لا يهتم بالترتيب الذي كتبت به الخطوات. سواء قلت "ضع اللحم على الخبز، ثم الجبن" أو "ضع الجبن على الخبز، ثم اللحم"، فإن الختم يعطي علامة "مثالي" نفسها لأن السندوتش النهائي يحتوي على نفس الأجزاء.

في عالم علوم الحاسوب، يسمى هذا "الختم" JSON Schema. إنه كتاب قواعد يخبر برامج الكمبيوتر كيف يجب أن تبدو قطعة من البيانات. عندما نطلب من الذكاء الاصطناعي (AI) كتابة كود برمجي أو تنظيم معلومات، فإننا غالباً ما نعطيه كتاب القواعد هذا كمجموعة من التعليمات. السؤال الكبير الذي يسأله الباحثون هو: إذا قمنا بخلط ترتيب التعليمات على الورقة -دون تغيير القواعد الفعلية أو "الختم المثالي"- هل سيظل الذكاء الاصطناعي يبني نفس السندوتش تماماً؟ أم أن الذكاء الاصطناعي سيصاب بالارتباك بسبب الترتيب الجديد ويقدم شيئاً مختلفاً قليلاً، حتى لو اجتاز فحص الختم؟ هذا الأمر مهم لأنه إذا غير الذكاء الاصطناعي رأيه لمجرد أننا أعدنا ترتيب الكلمات، فسيصبح غير موثوق للقيام بمهام مهمة مثل السجلات الطبية أو التقارير المالية.

هذه الورقة تشبه قصة بوليسية حيث يحقق المؤلف، شينغياو سون (Shengyao Sun)، فيما إذا كان "عقل" الذكاء الاصطناعي حساساً لترتيب الكلمات في كتب القواعد هذه. اختبرت الدراسة ذلك من خلال الطلب من نماذج ذكاء اصطناعي مختلفة حل نفس الألغاز باستخدام نفس كتب القواعد، ولكن مع كتابة التعليمات بترتيبات مختلفة. لم يكتفوا بسؤالها مرة واحدة فقط؛ بل سألوها خمس مرات لكل نسخة للتأكد من أن أي تغييرات لم تكن مجرد حظ عشوائي. ووجدوا أنه بالنسبة لبعض أنظمة الذكاء الاصطناعي، كان لترتيب الكلمات تأثير. فعندما تم تبديل ترتيب الخصائص (مثل "الاسم" أو "العمر")، بدأ الذكاء الاصطناعي في إعطاء إجابات مختلفة، رغم أن الإجابات كانت لا تزال "صحيحة" تقنياً وفقاً لكتاب القواعد.

ومع ذلك، القصة ليست نفسها لكل ذكاء اصطناعي. وجد المؤلف أن هذا "الحساسية للترتيب" تعتمد كلياً على نظام الذكاء الاصطناعي الذي تستخدمه. فبالنسبة لأنظمة "Sonnet" و"Qwen"، تسبب الخلط في تغييرات ملحوظة في الإجابات -بزيادة قدرها 5% إلى 12% في عدم الاتفاق عن المعتاد. ولكن بالنسبة لأنظمة "GPT" و"DeepSeek"، لم يؤثر الخلط تقريباً على الإطلاق. كما تحققت الدراسة مما إذا كان وضع "JSON Mode" الخاص (وهو إعداد يخبر الذكاء الاصطناعي بأن يكون حذراً للغاية فيما يتعلق بالتنسيق) سيحل المشكلة. ومن المثير للدهشة، أنه لم يفعل؛ إذ ظل الذكاء الاصطناعي يرتبك بسبب ترتيب الكلمات حتى في هذا الوضع الصارم.

الاستنتاج الأكثر أهمية هو أنه ليس من الضروري أن يعني قول برنامج كمبيوتر إن مجموعة التعليمات "صالحة" أو "صحيحة" أن الذكاء الاصطناعي سيتصرف بنفس الطريقة إذا قمت بتعديل التنسيق. يقترح المؤلف أنه لا ينبغي لنا أن نثق في "الختم" بعد الآن. بدلاً من ذلك، نحتاج إلى معاملة مجموعات التعليمات هذه مثل الكود البرمجي: يجب أن نثبتها في ترتيب قياسي (مثل سرد المكونات دائماً أبجدياً) واختبارها بعناية قبل السماح لها بالعمل في العالم الحقيقي. تثبت الدراسة أن التحقق من الصحة ليس كافياً؛ فنحن بحاجة إلى التحقق مما إذا كان سلوك الذكاء الاصطناعي يظل مستقراً عندما يتم إعادة ترتيب التعليمات، لأن ترتيب الكلمات، بالنسبة لبعض أنواع الذكاء الاصطناعي، هو جزء سري من الوصفة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →