Features have life history. And we should care
تكشف هذه الورقة أن النماذج اللغوية تمتلك "سقالة حاملة" مستمرة مكونة من حوالي 50 ميزة متفرقة تتجمع بسرعة خلال أول 1% من التدريب، لتعمل كأساس حامل للثقل يملي البنية التمثيلية للنموذج وتطوره اللاحق.
24608 ورقة بحثية
تكشف هذه الورقة أن النماذج اللغوية تمتلك "سقالة حاملة" مستمرة مكونة من حوالي 50 ميزة متفرقة تتجمع بسرعة خلال أول 1% من التدريب، لتعمل كأساس حامل للثقل يملي البنية التمثيلية للنموذج وتطوره اللاحق.
تقترح الورقة البحثية HELLoRA، وهي طريقة لضبط النماذج بكفاءة في المعلمات لنماذج خليط الخبراء (Mixture-of-Experts)، حيث تقوم بإلحاق وحدات تكييف منخفضة الرتبة (Low-Rank Adaptation) بالخبراء الأكثر تفعيلاً فقط، مما يقلل من المعلمات القابلة للتدريب والتكاليف الحسابية مع تحسين الأداء في المهام اللاحقة بشكل كبير مقارنة بطريقة LoRA القياسية.
تقترح الورقة البحثية "المحول ذو الحلقة الكاملة" (Fully Looped Transformer)، وهو بنية خالية من المعلمات تعمل على تثبيت ديناميكيات التدريب وتحسين الأداء في المهام اللاحقة عبر إدخال هيكل حلقي كامل وحقن الانتباه للتخفيف من تذبذب التدرج وانفجار المتبقي في كتل المحول المعاد استخدامها بشكل متكرر.
تقدم هذه الورقة البحثية التكميم القطري ثنائي الاتجاه (BDQ)، وهو إطار عمل جديد للتكميم بعد التدريب يستمد حلاً مثالياً نظرياً بناءً على مقياس "تسطيح" (Flatness) جديد لتشتيت القيم المتطرفة للتنشيط بفعالية، مما يحقق دقة هي الأفضل في فئتها في تكميم النماذج اللغوية الكبيرة ذات البتات المنخفضة.
تدافع هذه الورقة الموقفة عن تطوير "مجسات بيانات" منهجية — وهي تسلسلات اصطناعية مشتقة من عمليات عشوائية محددة — للارتقاء لما وراء الاستدلالات التجريبية كثيفة الحوسبة، ولتحقيق فهم نظري ومبدئي لكيفية تأثير خصائص بيانات معينة بشكل جوهري على أداء النماذج اللغوية الكبيرة، وقدرتها على التعميم، ومتانتها عبر مختلف مراحل سير العمل.
تقدم هذه الورقة البحثية خوارزمية تجميع الجودة متعددة المقاييس التكيفية (AMSGA)، وهي امتداد مبتكر لخوارزمية "الأمام-للأمام" (Forward-Forward) تعمل على تعزيز الاستقرار والمتانة والتعميم من خلال تجميع التمثيلات متعددة المقاييس واستراتيجيات التدريب التكيفية، محققةً مكاسب أداء كبيرة في مجموعتي بيانات MNIST وFashion-MNIST مع الحفاظ على المعقولية البيولوجية وكفاءة الذاكرة.
تقدم هذه الورقة RecoAtlas، وهو معيار ومجموعة أدوات لتقييم وكلاء التسوق القائمين على النماذج اللغوية الكبيرة باستخدام مقاييس المنفعة المرتكزة على السلوك إلى جانب التماسك الدلالي، مما يثبت أن التفسيرات المنطقية لا تضمن مجموعات توصية فعالة وأن الأداء يتوسع مع قدرة النموذج والمواءمة مع الأدوات.
تقدم الورقة البحثية "المفككات المزدوجة القائمة على الكتل" (Block-Based Double Decoders)، وهي بنية ترانسفورمر مبتكرة تجمع بين كفاءة التدريب لنماذج "المفكك فقط" (decoder-only) وكفاءة الاستدلال لنماذج "المشفر-المفكك" (encoder-decoders) عبر استخدام أقنعة انتباه قائمة على الكتل ذات سببية مزدوجة لتحقيق أداء توسع فائق مع تقليل تكاليف الذاكرة والحوسبة بشكل كبير.
تحدد هذه الورقة وتتحقق من بنية تركيبية للمبادئ الأدبية الأولية —بما في ذلك بوابات التسمية، والسمات الذاتية، والمعدلات الأسلوبية— ضمن النماذج اللغوية الكبيرة المضبوطة بالتعليمات (Llama 3.1 وGemma 2) باستخدام المشفّرات التلقائية المتناثرة، مما يثبت أن توجيه السمات المستهدف يمكنه توليد مخرجات عاطفية وأسلوبية محددة بشكل موثوق عبر بنيات نماذج مختلفة بتكلفة حوسبية ضئيلة.
تقدم هذه الورقة البحثية طريقة HPML (التعلم متعدد الوكلاء المعتمد على إسقاط هودج)، وهي طريقة تعمل على تثبيت التعلم التعزيزي متعدد الوكلاء ذي المجموع العام عبر إسقاط حقل تحديث السياسة المشتركة على مكون تدرج متري عبر تفكيك هودج، مما يقلل من الديناميكيات الدورية ويحسن التقارب من خلال جهد ليابونوف.