cs.CL
11070 ورقة بحثية
Beyond Gold Standards: Epistemic Ensemble of LLM Judges for Formal Mathematical Reasoning
تقدم هذه الورقة البحثية مجموعة (ensemble) من حكام النماذج اللغوية الكبيرة (LLM judges) القائمة على أسس معرفية وصورية (EFG)، والتي تقيم مهام الصياغة التلقائية الصورية عبر إطار عمل متعدد الأبعاد يشمل الحفاظ المنطقي، والاتساق الرياضي، والجودة الصورية، والصحة الصورية، مما يثبت تفوقها على النماذج ذات التقييم العام كبديل قابل للتوسع وقابل للتفسير لتقييم الاستدلال الرياضي الصوري.
When to Ponder: Adaptive Compute Allocation for Code Generation via Test-Time Training
تقدم الورقة البحثية PonderTTT، وهي استراتيجية حوسبة تكيفية خالية من التدريب تستفيد من فقدان إعادة البناء ذاتي الإشراف لتفعيل تحديثات التدريب أثناء الاختبار ديناميكيًا للنماذج اللغوية الكبيرة، مما يحسن بشكل كبير أداء توليد الكود البرمجي للمدخلات الصعبة دون الحاجة إلى تسميات الحقيقة الأرضية.
MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation
يُعد MedRAGChecker إطار عمل للتحقق على مستوى الادعاءات لعمليات التوليد المعزز بالاسترجاع في المجال الحيوي الطبي، حيث يقوم بتفكيك الإجابات الطويلة إلى ادعاءات ذرية والتحقق منها باستخدام الاستدلال باللغة الطبيعية واتساق الرسم البياني للمعرفة لتقديم تشخيصات مفصلة حول الموثوقية، وفجوات الأدلة، والأخطاء الحرجة المتعلقة بالسلامة.
DOREMI: Optimizing Long Tail Predictions in Document-Level Relation Extraction
Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care
تقدم هذه الورقة مجموعة بيانات صوتية بنغالية اصطناعية مكونة من 10,000 عينة ومتاحة للجمهور لخدمة عملاء الاتصالات، تم إنشاؤها عبر تقنية استنساخ الصوت OmniVoice وتم التحقق من تحقيقها اتساقاً عالياً بين النص والصوت بمتوسط معدل خطأ في الكلمات يبلغ 2.54%.
Who Do Language Models Think Is Competent? A Mechanistic Analysis of Occupational Bias
تكشف هذه الورقة أن النماذج اللغوية غالباً ما تحتفظ بانحيازات تمثيلية داخلية فيما يتعلق بكفاءة المستخدم بناءً على الخصائص الديموغرافية مثل النوع الاجتماعي والعرق، حتى عندما تبدو مخرجاتها الملحوظة غير منحازة، مما يثبت أن التقييمات السلوكية وحدها غير كافية للكشف عن أوضاع الفشل الكامنة هذه.
Inhibitory Attention for Clinical Long-Context Reasoning: Characterizing and Mitigating Lost-in-the-Middle Effects in EHR Processing
تحدد هذه الورقة وتُوصّف مشكلة "الضياع في المنتصف السريري" في النماذج اللغوية الكبيرة التي تعالج السجلات الصحية الإلكترونية الطويلة، مُبينةً أن بوابة اختيار خفيفة الوزن ومشروطة بالاستعلام (QCCS) تتفوق بشكل كبير على طرق الاسترجاع التقليدية من خلال إعطاء الأولوية لصلة السياق بدلاً من مجرد الاستدعاء لتحسين دقة اتباع التعليمات.
Exploratory As-Analyzed No-Detection of Culturally-Marked Predicate-Triggered PII Amplification in a Synthetic-English RAG Probe: A Predicate-Resource-Confounded Audit
تُدقق هذه الدراسة الاستكشافية نظام استرجاع معزز بالتوليد (RAG) باللغة الإنجليزية اصطناعي عبر أربع مجموعات ثقافية، وتجد عدم وجود دليل ذي دلالة إحصائية على أن الاستعلامات المحملة بالصور النمطية تزيد من تسريب المعلومات الشخصية مقارنة بالاستعلامات المحايدة، رغم أن المؤلفين يحذرون من أن نتائجهم تمثل "عدم اكتشاف" وليس إثباتاً لعدم وجود تأثير نظراً لمحدودية حجم العينة والعوامل المربكة مثل آثار صدى المطالبة (prompt-echo artifacts).
Self-Speculation for Faster Reasoning Models
تقدم هذه الورقة البحثية طريقة SSR (التكهن الذاتي لنماذج الاستدلال)، وهي طريقة فك تشفير خالية من التدريب تعمل على تسريع النماذج اللغوية الكبيرة عبر الاستفานدة من استجابات سلسلة الأفك "الجزئية" كمسودات للتحقق من مسارات الاستدلال الكاملة وتمديدها، مما يحقق خفضاً في زمن الاستجابة يصل إلى 24.1% في مهام التوليد الطويلة والمعقدة.