PromptSplit: Revealing Prompt-Level Disagreement in Generative Models
المؤلفون الأصليون: Mehdi Lotfian, Mohammad Jalali, Farzan Farnia
المؤلفون الأصليون: Mehdi Lotfian, Mohammad Jalali, Farzan Farnia
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: PromptSplit
بيان المشكلة
انتشرت النماذج التوليدية الموجهة بالأوامر (Prompt-guided) التي تشمل الرؤية واللغة، ومع ذلك لا تزال الأساليب المنهجية لمقارنة سلوكياتها بالنسبة لأوامب مدخلات محددة محدودة. توفر مقاييس التقييم الحالية، مثل FID وInception Score وCLIP-Score، مؤشرات جودة إجمالية تضغط سلوك النموذج في قيم عددية مفردة. غالبًا ما تحجب هذه المقاييس التباينات المعتمدة على الأوامر؛ فعلى سبيل المثال، قد تنتج نماذج مختلفة صورًا عالية الجودة لأمر معين، لكنها قد تختلف بشكل كبير في "المحتوى" أو "الأسلوب" بناءً على فئات أوامر محددة (على سبيل المثال، نموذج ينتج باستمرار شخصيات ذكور بينما ينتج نموذج آخر شخصيات إناث للأمر "شخص"). تعمل طرق المقارنة الطيفية والتوزيعية الحالية عادةً في بيئة خالية من الأوامر، مما يؤدي إلى تهميش الأوامر والفشل في عزل فئات المدخلات المحددة المسؤولة عن التباين السلوكي.
المنهجية
يقترح المؤلفون PromptSplit، وهو إطار عمل طيفي غير مُوجّه (unsupervised) يعتمد على الأوامر، مصمم للكشف عن عدم الاتفاق المعتمد على الأوامر بين نموذجين توليديين وتحليله.
1. التمثيل المشترك للطلب والمخرج (Joint Prompt-Output Representation)
يبني PromptSplit تمثيلاً مشتركاً عن طريق تكوين تضمينات حاصل الضرب التنسوري (tensor-product embeddings) لسمات الأمر (ϕT) وسمات المخرج (ϕX أو ϕY). بالنسبة لأمر t ومخرج x، يتم تعريف الميزة المشتركة كالتالي:
ϕ⊗(t,x)=ϕT(t)⊗ϕX(x)
هذا يستحث نواة ضرب (product kernel) هي: k⊗([t,x],[t′,x′])=kT(t,t′)⋅kX(x,x′)، مما يلتقط التفاعلات الضربيه بين فضاءات المدخلات والمخرجات.
2. فرق التباين النواتي (Kernel Covariance Difference)
بالنسبة لمجموعتي البيانات DX (من النموذج X) و DY (من النموذج Y)، تحسب الطريقة مؤثرات التباين النواتي التجريبية المشتركة C^T⊗X و C^T⊗Y. جوهر التحليل هو مؤثر فرق التباين:
Λ^X,Y∣T=C^T⊗X−ηC^T⊗Y
حيث η هو معلمة فائقة (hyperparameter). تكشف المتجهات الذاتية الرئيسية لهذا المؤثر عن الاتجاهات في الفضاء المشترك حيث تظهر النماذج اختلافاً سلوكياً كبيراً.
3. خدعة النواة والتحليل الطيفي (Kernel Trick and Spectral Analysis)
إن التفكيك الذاتي المباشر لمؤثر التباين عالي الأبعاد غير ممكن حسابياً. يطبق المؤلفون "خدعة النواة" (kernel trick) لصياغة مصفوفة نواة كتلية KX,ηY∣T بحجم (n+m)×(n+m)، والتي تشترك في نفس القيم الذاتية غير الصفرية للمؤثر عالي الأبعاد. وتتوافق المتجهات الذاتية لهذه المصفوفة الكتلية مع أنماط عدم الاتفاق في الفضاء المشترك.
4. الإسقاط العشوائي القابل للتوسع (Scalable Random Projection)
للتعامل مع مجموعات البيانات واسعة النطاق (حيث يتجاوز n,m عشرات الآلاف)، يستخدم PromptSplit تقريب الإسقاط العشوائي. يتم إسقاط السمات التنسورية المشتركة إلى بُعد أقل r باستخدام مصفوفات عشوائية غاوسية. يقلل هذا من التعقيد الحسابي للتحليل الطيفي من O((n+m)3) إلى O((n+m)r2+r3).
- الضمان النظري: يثبت البحث أن الانحراف المتوقع لتقدير الفضاء الذاتي عن النتيجة كاملة الأبعاد محدود بـ O(1/r2)، مما يضمن أن التقريب يحافظ على اتجاهات عدم الاتفاق باحتمالية عالية.
المساهمات الرئيسية
- صياغة المقارنة على مستوى الأمر: يعمل العمل على صياغة مقارنة النماذج كمسألة طيفية مشتركة بين الأمر والمخرج، متجاوزاً المقاييس الإجمالية لتحديد فئات الأوامر المحددة التي تسبب تباينات في سلوك النماذج.
- إطار عمل PromptSplit: تقديم إطار عمل قائم على النواة يربط الأوامر والمخرات عبر تضمينات حاصل الضرب التنسوري لتحليل الطيف الذاتي لفروق التباين النواتي المشترك.
- التقريب القابل للتوسع: تطوير طريقة إسقاط عشوائي تتيح تحليل مجموعات البيانات الكبيرة مع حد خطأ نظري قدره O(1/r2)، مما يجعل الطريقة عملية لتقييم النماذج التوليدية في العالم الحقيقي.
- القابلية للتفسير: توفر الطريقة "أنماطاً" (modes) تفسيرية لعدم الاتفاق، وتربط صراحةً بين عناقيد الأوامر وطبيعة تباين المخرجات.
النتائج التجريبية
قيم المؤلفون PromptSplit عبر إعدادات تحويل النص إلى صورة (T2I) والنص إلى نص (LLM):
- التحقق الاصطناعي: في البيئات المحكومة (مثل MNIST-M مع اختلافات معروفة في الألوان/التدرج الرمادي للأوامر)، نجح PromptSplit في تحديد فئات الأوامر الحقيقية المسؤولة عن عدم الاتفاق.
- نماذج تحويل النص إلى صورة: كشفت المقارنات بين Stable Diffusion XL وPixArt-Σ وKandinsky عن تباينات تعتمد على الأوامر في الأسلوب، والتركيب، والمواءمة. على سبيل المثال، حددت الطريقة أوامر محددة متعلقة بالمهن (مثل "ممرضة"، "نجار") حيث أنتجت النماذجة تمثيلات بصرية مختلفة بشكل كبير.
- النماذج اللغوية الكبيرة (LLMs): حددت المقارنات بين Qwen 3 وGemma 3 على مجموعة بيانات NQ-Open عناقيد متميزة من الأسئلة (مثل الأسئلة المتعلقة برؤساء الولايات المتحدة أو الممثلين) حيث ولدت النماذج إجابات متباينة.
- تطبيق التوجيه (Guidance Application): أظهر المؤلفون استخدام PromptSplit لتوجيه عملية الانتشار الكامن (latent diffusion process)، حيث نجح في مواءمة توزيع الصور المولدة مع مجموعة بيانات مرجعية (مثل أساليب رسم معينة) من خلال دمج تدرج عدم الاتفاق في عملية أخذ العينات.
الأهمية والادعاءات
يزعم البحث أن PromptSplit يقدم أداة مبدئية وتفسيرية للكشف عن أين وكيف تختلف النماذج التوليدية، مما يعالج الفجوة التي تركتها مقاييس الجودة الإجمالية. من خلال نمذجة فضاء (الأمر-المخرج) المشترك صراحةً، فإنه يعزل فئات المدخلات المحددة التي تقود الاختلافات السلوكية.
يضع المؤلفون PromptSplit كـ طريقة طيفية من الدرجة الثانية تعتمد على التضمين. ويشيرون بتواضع إلى أنه بينما يتيح التصميم القابلية للتوسع والتفسير، فإنه لا يهدف إلى توصيف جميع الجوانب من الدرجة العليا للسلوك التوليدي الشرطي. يُقدم العمل كخطوة نحو تقييم أكثر دقة مشروط بالأوامر للنظام البيئي المتنامي لنماذج الذكاء الاصطنا التوليدي. وقد أتيحت النسخة التنفيذية للجمهور لتسهيل المزيد من الأبحاث في هذا المجال.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث AI كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.