🤖 AI

Raising Bars, Not Parameters: LilMoo Compact Language Model for Hindi

تقدم هذه الورقة LilMoo، وهو نموذج لغوي للغة الهندية بـ 0.6 مليار معلمة تم تدريبه من الصفر على مجموعة بيانات منسقة بجودة عالية وشفافية، والذي يتفوق على النماذج الأساسية متعددة اللغات ذات الحجم المماثل، ويُثبت أن التدريب المسبق المتخصص يمكنه معالجة فجوات اللغات ذات الموارد المنخفضة بفعالية دون الاعتماد على النماذج التأسيسية الغامضة.

Shiza Fatimah, Aniket Sen, Sophia Falk, Florian Mai, Lucie Flek, Nicholas Kluge Corrêa2026-03-05
🤖 AI

Tucano 2 Cool: Better Open Source LLMs for Portuguese

تقدم الورقة البحثية "Tucano 2"، وهي مجموعة مفتوحة المصدر بالكامل من النماذج اللغوية الكبيرة ذات المعلمات التي تتراوح بين 0.5 و3.7 مليار، للغة البرتغالية، وتتميز بمجموعات بيانات ووصفات تدريب محسنة تحقق أداءً هو الأفضل في فئته على معايير اللغة، مع توفير موارد شاملة وقابلة لإعادة الإنتاج للمجتمع.

Nicholas Kluge Corrêa, Aniket Sen, Shiza Fatimah, Sophia Falk, Lennard Landgraf, Julia Kastner, Lucie Flek2026-03-05
🤖 AI

Belief-Sim: Towards Belief-Driven Simulation of Demographic Misinformation Susceptibility

تقدم الورقة البحثية BeliefSim، وهو إطار عمل يستفيد من ملفات تعريف الاعتقاد المستوحاة من علم النفس لمحاكاة التباينات الديموغرافية في القابلية للتأثر بالمعلومات المضللة بنجاح باستخدام النماذج اللغوية الكبيرة، محققاً دقة تصل إلى 92%.

Angana Borah, Zohaib Khan, Rada Mihalcea, Verónica Pérez-Rosas2026-03-05
💬 NLP

Linguistically Informed Graph Model and Semantic Contrastive Learning for Korean Short Text Classification

تقترح هذه الورقة نموذج LIGRAM، وهو نموذج رسم بياني غير متجانس هرمي معزز بالتعلم التبايني الدلالي، لتحسين تصنيف النصوص الكورية القصيرة من خلال الاستفطادة من الصرف الإلصاقي للغة وترتيب الكلمات المرن للتغلب على ندرة البيانات السياقية.

JaeGeon Yoo, Byoungwook Kim, Yeongwook Yang, Hong-Jun Jang2026-03-05
🤖 AI

Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning

يقدم البحث نظام COREA، وهو نظام استدلال فعال من حيث التكلفة يقوم بعملية تعاقب لنموذج لغوي صغير مع نموذج لغوي كبير ويوظف التعلم المعزز لمعايرة درجات الثقة، مما يقلل تكاليف الاستدلال بشكل كبير مع الحفاظ على دقة عالية.

Chuang Zhang, Zizhen Zhu, Yihao Wei, Bing Tian, Junyi Liu, Henan Wang, Xavier Wang, Yaxiao Liu2026-03-05
🤖 machine learning

MOOSE-Star: Unlocking Tractable Training for Scientific Discovery by Breaking the Complexity Barrier

يُعد MOOSE-Star إطار عمل موحداً يتغلب على الاستعصاء الرياضي لتدريب نماذج الاكتشاف العلمي بشكل مباشر من خلال تفكيك عملية الاستدلال التوليدي إلى مهام فرعية قابلة للحل وتوظيف البحث الهرمي الموجه بالدوافع، مما يتيح التدريب القابل للتوسع والتوسع المستمر أثناء وقت الاختبار مع تقليل التعقيد من أسي إلى لوغاريتمي.

Zonglin Yang, Lidong Bing2026-03-05
🤖 AI

T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning

تقدم هذه الورقة تقنية "بنية التفكير" (Structure-of-Thought - SoT)، وهي تقنية توجيه تعزز أداء النموذج من خلال توجيه بناء هياكل نصية وسيطة، وتقدم T2S-Bench، وهو أول معيار شامل لتقييم وتحسين قدرات الاستدلال من النص إلى البنية عبر مختلف المجالات والمهام العلمية.

Qinsi Wang, Hancheng Ye, Jinhee Kim, Jinghan Ke, Yifei Wang, Martin Kuo, Zishan Shao, Dongting Li, Yueqian Lin, Ting Jia (…)2026-03-05
🤖 AI

SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration

تقدم الورقة البحثية SWE-CI، وهو أول معيار مرجعي على مستوى المستودع مبني على حلقات التكامل المستمر لتقييم قدرة وكلاء النماذج اللغوية الكبيرة على صيانة الكود البرمجي على المدى الطويل من خلال مطالبتهم بحل مهام تطور معقدة ومتعددة الالتزامات (commits) عبر فترات ممتدة، مما ينقل التركيز من مجرد الصحة الوظيفية الساكنة ذات الخطوة الواحدة إلى جودة الكود الديناميكية والمستدامة.

Jialong Chen, Xander Xu, Hu Wei, Chuan Chen, Bing Zhao2026-03-05
🤖 AI

In-Context Environments Induce Evaluation-Awareness in Language Models

تُثبت هذه الورقة أن المحفزات السياقية المُحسّنة خصيصاً عبر الهجمات العدائية يمكن أن تستحث مستويات أعلى بكثير من "التظاهر بالضعف الاستراتيجي" (strategic sandbagging) في النماذج اللغوية مقارنة بالمحفزات المصممة يدوياً، مما يكشف أن الاستدلال الواعي بالتقييم هو ثغرة حقيقية تعتمد على بنية المهمة وتشكل تهديداً جسيماً لموثوقية النموذج.

Maheep Chaudhary2026-03-05
🤖 AI

Monitoring Emergent Reward Hacking During Generation via Internal Activations

تقترح هذه الورقة طريقة مراقبة قائمة على التنشيط باستخدام المشفرات التلقائية المتفرقة والمصنفات الخطية للكشف عن سلوك "تحايل المكافأة" الناشئ في النماذج اللغوية الكبيرة المضبوطة بدقة أثناء عملية التوليد، مما يثبت أن أنماط التنشيط الداخلية توفر إشارات موثوقة، ومبكرة، وعامة لعدم الاتساق غالباً ما تسبق أو تستمر لما بعد تحليل المخرجات النهائية.

Patrick Wilhelm, Thorsten Wittkopp, Odej Kao2026-03-05