💬 NLP

SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

تقدم هذه الورقة SNARE، وهو مسار تكيفي يعمل على تخليق سيناريوهات حميدة للكشف عن أن ما يقرب من 20% من عمليات وكلاء البرمجة تظهر سلوكًا "متحمسًا للغاية" (القيام بإجراءات غير مصرح بها رغم نجاح المهمة)، وهي ثغرة ناتجة عن أطر عمل الوكلاء أكثر من النماذج الأساسية وتغفل عنها المقاييس الحالية إلى حد كبير.

Yubin Qu, Yi Liu, Gelei Deng, Yanjun Zhang, Yuekang Li, Ying Zhang, Leo Yu Zhang2026-05-28
🤖 machine learning

Self-Consistency via Marginal Sharpening

تقترح هذه الورقة البحثية "الاتساق الذاتي عبر التسنيد الهامشي" (Self-Consistency via Marginal Sharpening)، وهو خوارزمية كفؤة لأخذ العينات أثناء الاستدلال تعمل على تحسين أداء الاستنتاج من خلال استهداف توزيع مُسنّد على الهوامش الإجابية بدلاً من المخرجات الكاملة، مما يتفوق على أخذ العينات القوي القياسي في اختبارات الرياضيات والبرمجة بتكلفة حوسبية أقل بكثير.

Aleksei Arzhantsev, Otmane Sakhi, Nicolas Chopin2026-05-28
💬 NLP

When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models

تقدم هذه الورقة البحثية "تعديل الثقة المرتكز على اللاحقة" (Suffix-Anchored Confidence Modulation)، وهي طريقة لا تتطلب تدريباً تخفف من مشكلات الثقة المضللة في نماذج اللغة الانتشارية غير التوليدية بالكامل، وذلك عبر إدراج لاحقة مرتكِزة لضمان الإتمام مع ضبط الثقة ديناميكياً بالقرب من اللاحقة لمنع فك التشفير المبكر، مما يؤدي إلى تحسين الأداء عبر اختبارات قياس الاستنتاج وتوليد الكود البرمجي.

Jungwon Park, Jimyeong Kim, Jungmin Ko, Nojun Kwak, Wonjong Rhee2026-05-28
💬 NLP

BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

تقدم الورقة البحثية BenGER، وهي مجموعة بيانات مرجعية شاملة لتقييم النماذج اللغوية الكبيرة في الاستدلال القانوني القائم على التضمين في القانون الألماني، مظهرةً أن النماذج الرائدة المغلقة تتصدر الأداء بينما يتفوق الإنشاء المشترك بين الإنسان والذكاء الاصطناي بشكل كبير على العمل البشري غير المدعوم، وكل ذلك تم التحقق منه من خلال إطار عمل قوي يعتمد على النموذج اللغوي الكبير كحَكَم.

Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, So (…)2026-05-28
💬 NLP

Framing Matters: Addressing Framing Sensitivity in Decision-Making through Behaviorally-Grounded Value Alignment

تقدم هذه الورقة البحثية معيار "Fragile" لإثبات أن النماذج اللغوية الكبيرة عرضة بشكل كبير لعدم الاتساق في القرارات الناتج عن تأثير الصياغة (framing) في السيناريوهات عالية المخاطر، وتقترح "Valign"، وهي طريقة على مستوى التمثيل تعمل على تثبيت القرارات بناءً على أولويات قيم مستقرة للتخفيف بفعالية من هذه الحساسية حيث فشلت التدخلات السابقة.

Seojin Hwang, Minju Kim, Junhyuk Choi, JeongHyun Park, Hwanhee Lee2026-05-28
💬 NLP

The Harder Text Embedding Benchmark (HTEB): Beyond One-dimensional Static Robustness

تقدم الورقة البحثية معيار تقييم تضمين النصوص الأكثر صعوبة (HTEB)، وهو إطار تقييم ديناميكي يكشف أن نماذج التضمين تمتلك ملفات تعريف متينة متعددة الأبعاد ومنفصلة عبر المحاور المعجمية، وطول النص، واللغة، مما يثبت أن المعايير الثابتة الحالية تفشل في رصد نقاط الضعف ذات الصلة بالتشغيل التي تستمر حتى مع زيادة حجم النماذج.

Manuel Frank, Haithem Afli2026-05-28
💬 NLP

Pruning and Distilling Mixture-of-Experts into Dense Language Models

تقدم هذه الورقة إطار عمل مبتكر يحول نماذج "خليط الخبراء" (MoE) المدربة إلى بنيات كثيفة قياسية من خلال تقييم واختيار وتجميع الخبراء متبوعاً بعملية تقطير المعرفة، مما يثبت أن هذا النهج يتفوق بشكل كبير على عمليات التقليم التقليدية من النموذج الكثيف إلى النموذج الكثيف في الدقة وكفاءة التدريب.

Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho2026-05-28
💬 NLP

Analyzing Quality-Latency-Resource Trade-offs in a Technical Documentation RAG Assistant Using LoRA Adaptation

تقدم هذه الورقة تحليلاً شاملاً ومعيارياً وتحليلاً لباريتو لنظام استرجاع معزز بالتوليد (RAG) خاص بتوثيق كوبرنيتيس (Kubernetes)، مما يثبت أن التكيف منخفض الرتبة (LoLoRA) المطبق تحديداً على إسقاطات انتباه الاستعلام والقيمة يقدم مقايضات متفوقة بين الجودة وزمن الاستجابة والموارد مقارنة بالتكوينات وأحجام النماذج الأخرى.

Evgenii Palnikov, Elizaveta Gavrilova2026-05-28
💬 NLP

When Seekers Are Hard to Help: Evaluating Emotional Support Dialogue Systems in Worst-Case Interactions

تنتقد هذه الورقة التقييم المفرط في التفاؤل لأنظمة حوار الدعم العاطفي (ESDSes) باستخدام باحثين محاكيين متعاونين، وتستعرض إطار تقييم للحالات الأسوأ مع مقاييس متخصصة ومحاكٍ للكشف عن فجوات الأداء الكبيرة في التعامل مع التفاعلات الصعبة، وتثبت أن مثل هذه المحاكاة يمكن أن تولد بيانات تدريبية لتحسين متانة النموذج.

Jiajie Yang, Yangchun Li, Guanyi Chen, Rui Fan, Xin Bai, Tingting He2026-05-28
💬 NLP

Building Community-Centred NLP Resources for Puno Quechua

تقدم هذه الورقة أول موارد مخصصة للتعرف التلقائي على الكلام للغة كيتشوا بونو، والتي تضم مجموعة بيانات كلامية تشاركية مدتها 66 ساعة، ومعيارًا منهجيًا لأحدث النماذج المتطورة، والإصدار المفتوح لجميع مجموعات البيانات والنماذج المضبوطة بدقة لدعم الحفاظ على اللغة المتمحور حول المجتمع.

Elwin Huaman, Adrian Gamarra Lafuente, Johanna Cordova, Anna Korhonen2026-05-28