💬 NLP

Comparing energy consumption and accuracy in text classification inference

تقيم هذه الدراسة بشكل منهجي المقايضات بين الدقة واستهلاك الطاقة في استنتاج تصنيف النصوص، كاشفةً أنه بينما تستهلك النماذج اللغوية الكبيرة غالباً طاقة أكثر من النماذج التقليدية، إلا أنها لا تتفوق عليها بالضرورة في إعدادات التعلم الصفري، وأن وقت تشغيل الاستنتاج يمكن أن يعمل كبديل عملي لاستخدام الطاقة.

Johannes Zschache, Tilman Hartwig2026-04-22
⚡ electrical engineering

Computational Narrative Understanding for Expressive Text-to-Speech

تقدم هذه الورقة LibriQuote، وهي مجموعة بيانات واسعة النطاق تضم 5.3 ألف ساعة من اقتباسات الشخصيات التعبيرية من الكتب الصوتية والمعززة بتسميات توضيحية زائفة سياقية، والتي تثبت أن الضبط الدقيق أو التدريب على هذه البيانات يعزز بشكل كبير من القدرة التعبيرية ووضوح نماذج تحويل النص إلى كلام.

Gaspard Michel, Elena V. Epure, Christophe Cerisara2026-04-22
💬 NLP

RepIt: Steering Language Models with Concept-Specific Refusal Vectors

تقدم الورقة البحثية RepIt، وهو إطار عمل فعال من حيث كفاءة البيانات يعمل على عزل ناقلات التنشيط الخاصة بالمفاهيم لإنشاء "كائنات نموذجية" ذات أبواب خلفية دلالية، مما يمكّن النماذج اللغوية الكبيرة من تجاوز حالات الرفض الأمني انتقائياً في المواضيع الخطيرة مثل أسلحة الدمار الشامل مع الحفاظ على السلوك الآمن في الاختبارات المعيارية العادية.

Vincent Siu, Nathan W. Henry, Nicholas Crispino, Yang Liu, Dawn Song, Chenguang Wang2026-04-22
💬 NLP

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

تقدم هذه الورقة معيار InsideOut لتحديد وقياس "تحيز الداخل والخارج" (insider-outsider bias) بشكل منهجي في نصوص المقابلات التي تولدها النماذج اللغوية الكبيرة، حيث تفضل النماذج الثقافات السائدة على غيرها، وتثبت أن أطر التخفيف القائمة على الوكلاء تتفوق بشكل كبير على الأساليب القائمة على التلقين في الحد من هذا التحيز الثقافي.

Yixin Wan, Xingrun Chen, Kai-Wei Chang2026-04-22
💬 NLP

From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models

تحدد هذه الورقة وتُوصّف ظاهرة "قصر النظر الناجم عن الأداة" (TIM)، وهي ظاهرة تحقق فيها النماذج اللغوية المعززة بالأدوات (TaLMs) دقة أعلى في الإجابات النهائية للمسائل الرياضية، ولكنها تعاني من تدهور في تماسك الاستدلال عبر معاملة مخرجات الأدوات كبدائل للاستدلال، وتقترح إطار عمل لتحسين التفضيل لإعادة محاذاة النماذج نحو استخدام الأدوات كأدلة مساعدة بدلاً من كونها اختصارات استدلالية.

Farima Fatahi Bayat, Pouya Pezeshkpour, Estevam Hruschka2026-04-22
💬 NLP

When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers

تستقصي هذه الورقة بشكل منهجي الظروف التي يؤدي فيها التحقق القائم على النماذج اللغوية الكبيرة إلى تحسين أداء الحلّال عبر 37 نموذجاً و9 معايير مرجعية، مقدمةً مقياس "كسب التحقق" (verifier gain) للكشف عن أن التحقق عبر عائلات النماذج المختلفة هو الأكثر فعالية، وأن تدريب ما بعد المعالجة في الاستدلال ينقل الفوائد من التحسين الذاتي إلى التحسين عبر عائلات النماذج، وأن المهام الرياضية أو المنطقية هي الأكثر استجابة لمكاسب التحقق.

Jack Lu, Ryan Teehan, Jinran Jin, Mengye Ren2026-04-22
💬 NLP

TabReX : Tabular Referenceless eXplainable Evaluation

تقدم هذه الورقة TabReX، وهو إطار عمل قائم على الرسوم البيانية وغير معتمد على مرجع، يقوم بتقييم الجداول المُنشأة بواسطة النماذج اللغوية الكبيرة عبر محاذاة الرسوم البيانية للمعرفة المعيارية لإنتاج درجات قابلة للتفسير وواعية بالمعايير، ويتحقق من متانته من خلال مقياس TabReX-Bench المقترح حديثاً.

Tejas Anvekar, Junha Park, Aparna Garimella, Vivek Gupta2026-04-22
💬 NLP

ContextLeak: Auditing Leakage in Private In-Context Learning Methods

تقدم هذه الورقة ContextLeak، وهو أول إطار عمل للتدقيق التجريبي في تسرب المعلومات في أسوأ الحالات في التعلم داخل السياق الخاص باستخدام إدراج "الكناري" للكشف عن أن أساليب الحفاظ على الخصوصية الحالية غالباً ما تفشل في تحقيق التوازن بين الأمان والمنفعة، إما عبر تسريب البيانات الحساسة أو تدهور أداء النموذج بشكل حاد.

Jacob Choi, Shuying Cao, Xingjian Dong, Amin Banayeeanzade, Wang Bill Zhu, Robin Jia, Sai Praneeth Karimireddy2026-04-22
💬 NLP

STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning

تقدم هذه الورقة STReasoner، وهو إطار عمل مبتكر يمكّن النماذج اللغوية الكبيرة من إجراء الاستدلال المكاني-الزماني في السلاسل الزمنية من خلال دمج الهياكل الرسومية والنصوص عبر معيار جديد (ST-Bench) وخوارزمية تعلم تعزيزي مدركة للمكان (S-GRPO)، محققةً مكاسب كبيرة في الدقة بجزء ضئيل من تكلفة النماذج المملوكة.

Juntong Ni, Shiyu Wang, Qi He, Ming Jin, Wei Jin2026-04-22
💬 NLP

SAGE-32B: Agentic Reasoning via Iterative Distillation

تقدم هذه الورقة البحثية نموذج SAGE-32B، وهو نموذج لغوي بـ 32 مليار معلمة مبني على Qwen2.5-32B يتخصص في الاستدلال الوكيل والتخطيط بعيد المدى من خلال التقطير التكراري ونهج الاستدلال العكسي، محققاً أداءً فائقاً في اختبارات الأدوات المتعددة مقارنة بالنماذج ذات الحجم المماثل.

Basab Jha, Firoj Paudel, Ujjwal Puri, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junh (…)2026-04-22