cs.CL
11158 ورقة بحثية
ClinicalBench: Stress-Testing Assertion-Aware Retrieval for Cross-Admission Clinical QA on MIMIC-IV
تقدم هذه الورقة ClinicalBench، وهو إطار عمل ومجموعة بيانات لاختبار الإجهاد في استرجاع المعلومات المدرك للادعاءات في الأسئلة والأجوبة السريرية عبر حالات التنويم المختلفة، مما يثبت أن نظام استرجاع الرسوم البيانية للمعرفة المدرك للقصد يحسن دقة الاسترجاع بشكل كبير مقارنة بالنماذج الكثيفة عبر نماذج لغوية كبيرة متعددة، مع تسليط الضوء على الضرورة القصوى للمراجعة الطبية من قبل الأطباء للتحقق من صحة معايير الأسئلة والأجوبة السريرية.
Decomposing Evolutionary Mixture-of-LoRA Architectures: The Routing Lever, the Lifecycle Penalty, and a Substrate-Conditional Boundary
تُفكك هذه الورقة البحثية نظام "خليط لورا" (LoRA) تطوريًا يعتمد على ركيزة ذات 150 مليون معلمة، لتكشف أنه في حين أن إعادة كتابة موجه محدد تقود مكاسب الأداء، فإن مكون دورة حياة التطور يعمل كعائق صافٍ للأداء، حيث ثبت أن آلية البحث مفيدة فقط في ظل ظروف محددة لما قبل المحاذاة.
The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models
يقدم النموذج ثنائي المجلس (Bicameral Model) واجهة عصبية قابلة للتدريب تتيح لنموذجين لغويين مجمدين التنسيق بشكل ثنائي الاتجاه من خلال اقتران مستمر للحالة الخفية، مما يسمح لنموذج أولي بقيادة المهام بينما يقوم نموذج مساعد بتنفيذ الأدوات أو الأكواد، وهو ما يعزز الأداء بشكل كبير في الحساب والمنطق والاستدلال الرياضي دون الاعتماد على التواصل القائم على النصوص.
How Does Differential Privacy Affect Social Bias in LLMs? A Systematic Evaluation
تقيم هذه الورقة بشكل منهجي تأثير الخصوصية التفاضلية على التحيز الاجتماعي في النماذج اللغوية الكبيرة عبر أربعة نماذج، كاشفةً أنه بينما تقلل الخصوصية التفاضلية من التحيز في مهام تقييم الجمل، إلا أنها لا تحسن العدالة بشكل موحد عبر جميع المهام، وأن تقليل الحفظ لا يعني بالضرورة تقليل عدم الإنصاف.
ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction
تقدم الورقة البحثية ReVision، وهي طريقة تقلل من تكرار الرموز المرئية في مسارات وكلاء استخدام الكمبيوتر من خلال الإزالة الانتقائية للرقع المتكررة عبر لقطات الشاشة المتتالية، مما يؤدي إلى خفض تكاليف الرموز بشكل كبير مع تحسين معدلات النجاح وتمكين الوكلاء من الاستفادة بفعالية من السياقات التاريخية الأطول.
Unlocking LLM Creativity in Science through Analogical Reasoning
تقدم هذه الورقة البحثية الاستدلال القياسي كنهج مبتكر للتخفيف من حدة انهيار النمط في النماذج اللغوية الكبيرة، حيث تُظهر أنه يعزز بشكل كبير تنوع وجدة الحلول العلمية المولدة مع تحقيق أداء رائد عبر مهام طبية حيوية متعددة.
ReAD: Reinforcement-Guided Capability Distillation for Large Language Models
يُعد ReAD إطار عمل لتقطير القدرات الموجه بالتعزيز، يعالج الترابط بين قدرات النموذج من خلال تخصيص ميزانية ثابتة من الرموز (tokens) ديناميكيًا لتحسين المنفعة في المهام اللاحقة مع تقليل الآثار الجانبية الضارة والجهد الضائع.
Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling
تقدم هذه الورقة DuST، وهو إطار عمل للتدريب الذاتي يستفيد من أخذ العينات في وقت الاختبار لإنشاء "فضاء حكم مزدوج" حيث تتعلم النماذج ترتيب البرامج المرشحة عبر التعلم المعزز في السياسة (on-policy reinforcement learning)، مما يحسن قدرتها على الحكم على صحة الكود وتوليد حلول عالية الجودة دون مكافآت مباشرة للتوليد الصحيح.
LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?
تقدم الورقة البحثية LatentRouter، وهو إطار عمل مبتكر يحسن عملية اختيار النماذج متعددة الوسائط من خلال صياغة التوجيه كأداة للتنبؤ بالمنفعة المضادة للواقع، حيث تتواصل الكبسولات المتعلمة ورموز قدرة النموذج في تواصل كامن لتقدير ومطابقة نقاط القوة المحددة للنماذج المرشحة مع مدخلات الصور والأسئلة، مما يتفوق على النماذج المرجعية الحالية في كل من الأداء وكفاءة التكلفة.