Beyond Tokens: A Survey on Decoding Methods for Large Language and Vision-Language Models
تستعرض هذه الدراسة المسحية بشكل منهجي طرق فك التشفير الناشئة للنماذج اللغوية الكبيرة ونماذج اللغة والرؤية، حيث تصنفها إلى ثلاثة نماذج لتسليط الضوء على كفاءتها في محاذاة مخرجات النماذج مع قصد المستخدم أثناء الاستدلال، مع تحديد التحديات الحالية واتجاهات البحث المستقبلية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً تستطيع فيه الحواسيب كتابة القصص، وحل الألغاز المعقدة، ووصف محتويات صورة بوضوح مذهل. هذا هو واقع النماذج اللغوية الكبيرة ونماذج الرؤية واللغة الحديثة، وهي أنظمة قوية تدربت على كميات هائلة من المعرفة البشرية. ومع ذلك، فإن هذه الآلات ليست مثالية؛ فهي أحياناً تخترع حقائق، أو تنتج محتوى ضاراً، أو تقع في فخ التكرار الممل، وتفشل في مطابقة قصد الشخص الذي طرح السؤال. لسنوات، كان الحل الأساسي لهذه العيوب هو إعادة تدريب الآلة بالكامل، وهي عملية مكلفة للغاية وبطيئة وتستهلك الكثير من الطاقة. أما النهج الآخر فكان يتمثل في صياغة الأسئلة الموجهة للآلة بعناقة شديدة، لكن هذه الطريقة تتسم بالهشاشة؛ إذ يمكن لتغيير طفيف في الصياغة أن يتسبب في فشل الكمبيوتر. والآن، يحول الباحثون اهتمامهم إلى رافعة مختلفة أكثر كفاءة: اللحظة التي يختار فيها الكمبيوتر كلمته التالية بالفعل.
يرسم استطلاع جديد أجراه هوراين وانغ وزملاؤه في جامعة إيموري، ومعهد إلينوي للتكنولوجيا، وجامعة إلينوي شيكاغو، خارطة طريق لمجال يتطور بسرعة مخصص لهذه الخطوة النهائية من عملية التوليد. يطلق الباحثون على هذه التقنيات اسم "طرق فك الترميز" (decoding methods). وبدلاً من تغيير "دماغ" الكمبيوتر، تعمل طرق فك الترميز كمرشح متطور أو دليل أثناء الجزء من الثانية الذي تقرر فيه الآلة ما ستقوله تالياً. ويكشف الاستطلاع أن المجال يتحول بعيداً عن القواعد البسيطة والجامدة نحو ثلاث استراتيجيات جديدة قوية: فك الترميز التبايني، وفك الترميز الموجه، وفك الترميز المتوازي. تسمح هذه الأساليب للكمبيوتر بمقارنة الاحتمالات المختلفة، أو اتباع قواعد سلامة أو منطق محددة، أو حتى تخمين عدة كلمات مسبقاً في آن واحد، وكل ذلك دون الحاجة إلى إعادة تدريبه.
تعمل الاستراتيجية الأولى من هذه الاستراتيجيات، وهي فك الترميز التبايني، من خلال جعل الكمبيوتر ينظر إلى مسارين مختلفين لكلمته التالية في الوقت ذاته. يمثل أحد المسارين ما يعتقد الكمبيوتر أنه الإجابة الأفضل والأكثر فائدة، بينما يمثل الآخر نسخة أقل رغبة أو غير صحيحة. ومن خلال المقارنة بينهما، يمكن للنظام تضخيم الخيار الجيد وكبح الخيار السيئ. وقد أثبتت هذه التقنية فعالية ملحوحة في منع الكمبيوتر من "الهلوسة"، أو التصريح بثقة بأشياء ليست حقيقية. على سبيل المثال، عندما ينظر نموذج الرؤية واللغة إلى صورة ويصفها، يمكن لطرق التباين أن تساعده على تجاهل تحيزاته الداخلية والالتزام بدقة بما هو مرئي في الصورة. كما يساعد هذا النهج الكمبيوتر على البقاء آمناً، عبر تصفية اللغة السامة أو الضارة من خلال مقارنة الردود الآمنة بالردود غير الآمنة، كل ذلك مع الحفاظ على النموذج الأصلي كما هو.
أما الاستراتيجية الثانية، وهي فك الترميز الموجه، فتقدم مجموعة خارجية من القواعد أو "مدرباً" يراقب عملية التوليد في الوقت الفعلي. فبدلاً من ترك الكمبيوتر يختار الكلمة التالية بناءً على تدريبه الخاص فحسب، تستخدم هذه الطريقة أداة منفصلة لتقييم كل كلمة محتملة قبل قبولها. قد يكون هذا المدرب مرشح سلامة يحظر العبارات الخطيرة، أو مدققاً منطقياً يضمن اتباع البرهان الرياضي للخطوات الصحيحة، أو مديراً إبداعياً يوجه القصة نحو نبرة معينة. ويسلط الاستطلاع الضوء على أن هذه الطريقة مفيدة بشكل خاص للمهام المعقدة مثل كتابة الأكواد البرمجية أو حل مشكلات الاستدلال متعدد الخطوات. ومن خلال التحقق المستمر من العمل مقابل مجموعة من المعايير، يمكن للكمبيوتر إنتاج نتائج أكثر دقة وموثوقية، مما يجعله يصحح أخطاءه بفعالية أثناء الكتابة.
والتحول الكبير الثالث يتجه نحو فك الترميز المتوازي، الذي يعالج مسألة السرعة. تقليدياً، تولد هذه الحواسيب النصوص كلمة بكلمة، وهي عملية بطيئة تصبح عائقاً مع زيادة حجم النماذج. يغير فك الترميز المتوازي قواعد اللعبة بالسماح للكمبيوتر بصياغة عدة كلمات في وقت واحد ثم التحقق بسرعة من صحتها. يشبه الأمر كاتباً يرسم جملة كاملة في ذهنه قبل الالتزام بكتابتها على الورق، بدلاً من المعاناة فوق كل حرف على حدة. وقد وجد الباحثون أن نهج "المسودة والتحقق" هذا يمكن أن يسرع بشكل كبير من سرعة إنتاج هذه النماذج للنصوص، مما يجعلها أكثر عملية للتطبيقات التي تعمل في الوقت الفعلي. وتعمل هذه الطريقة عبر أنواع مختلفة من التوليد، من كتابة المقالات إلى إنشاء الصور، وتفعل ذلك دون التضحية بجودة المخرجات.
وبعيداً عن هذه الركائز الثلاث الرئيسية، يفصل الاستطلاع كيفية تطبيق هذه الطرق لحل مشكلات محددة من الواقع. في مجال السلامة، تُستخدم تقنيات فك الترميز لمنع الكمبيوتر من التعرض للخداع للكشف عن معلومات خاصة أو توليد محتوى ضار. وفي مجال الطب والعلوم، تساعد هذه التقنيات في استخراج معلومات دقيقة من الوثائق والصور المعقدة، مما يقلل من خطر وقوع أخطاء خطيرة. ويشير الباحثون أيضاً إلى أن هذه الطرق لا تهدف فقط إلى جعل الكمبيوتر أكثر ذكاءً أو سرعة، بل تتعلق بجعله أكثر موثوقية. فمن خلال التحكم في عملية التوليد مباشرة، يمكن للمطورين ضمان توافق الآلة مع القيم والتوقعات البشرية دون التكلفة الباهظة لإعادة التدريب.
وعلى الرغم من هذه التطورات، يشير المؤلفون إلى أن هذا المجال لا يزال في مرحلة النضج. فالعديد من هذه التقنيات تعتمد على أمثلة مختارة بعناية أو إعدادات محددة تعمل جيداً لمهمة واحدة ولكنها قد تفشل في مهمة أخرى. هناك أيضاً حاجة لفهم أفضل لسبب عمل هذه الطرق، حيث إن الآليات الداخلية لهذه الأنظمة قد تبدو أحياناً كـ "صندوق أسود". علاوة على ذلك، مع زيادة قوة هذه الأدوات، تظهر مخاطر أمنية جديدة، مثل احتمال قيام المهاجمين بالتلاعب بعملية فك الترميز لتجاوز تدابير السلامة. ويقترح الباحثون أن العمل المستقبلي يجب أن يركز على جعل هذه الطرق أكثر شمولية، وأسه أسهل فهماً، وأكثر متانة ضد مثل هذه التهديدات.
في النهاية، يرسم هذا الاستطلاع صورة لمجال يمر بمرحلة انتقالية. إن عصر مجرد جعل النماذج أكبر يفسح المجال لعصر جعلها أكثر ذكاءً وتحكماً من خلال فن فك الترميز. ومن خلال صقل كيفية اختيار هذه الآلات لكلماتها، يفتح الباحثون آفاقاً جديدة من الموثوقية والسرعة والسلامة. ويشير هذا العمل إلى أن مستقبل الذكاء الاصطناعي قد لا يعتمد على بناء أدمغة أكبر، بل على تعليم هذه الأنظمة الموجودة كيف تفكر بعناية أكبر فيما تقوله تالياً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.