💬 NLP

Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs

تقدم الورقة البحثية Backtrader-Bench، وهو إطار عمل مبتكر لتقييم وكلاء البرمجة القائمين على النماذج اللغوية الكبيرة في التداول الخوارزمي من خلال أسئلة متعددة الخيارات ذاتية التوليد ومحققة برمجياً، مما يثبت أن الوكلاء المعززين بالأدوات يتفوقون بشكل كبير على النماذج المرجعية غير المعززة بالأدوات مع تأسيس بنية تحتية قابلة للتوسع للتدريب المستقبلي باستخدام التعلم التعزيزي.

Ruoxi Zhao, Maziar Raissi2026-08-13
💬 NLP

TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation

تقدم الورقة البحثية TRACE Bench، وهو إطار عمل تقييمي قائم على قوائم التحقق الموجهة بالمهام للوكلاء، يقوم بتفكيك ملفات تعريف الأدوار إلى عناصر قابلة للتحقق لتوفير تسجيل درجات شفاف وقائم على الأدلة وتحقيق تغطية شبه كاملة لمتطلبات الأدوار مقارنة بمعايير الحوار الحر الحالية.

Jiahui Zhang, Ziwei Zhang, Yipeng Wang, Yibo Liu, Haozhou Pang, Yikai Hu, Hongyan Ren, Lan Zhou, Qi Gan, Kai Sheng2026-08-13
💬 NLP

Lost in Compaction: Evaluating Side-Constraint Loss under Context Compaction

تحدد هذه الورقة أن طرق ضغط السياق الحالية تتخلص بشكل منهجي من قيود الجلسة الحرجة، وتُكمّم هذا الفشل من خلال مجموعة تقييم COMPINT الجديدة، وتقترح مستخرجاً جاهزاً للتشغيل (plug-and-play) واعياً بقيود السياق (SC-aware) يحقق احتفاظاً بالقيود بنسبة تزيد عن 90% دون تعديل النماذج الحالية.

Zhiqi Wang, Yichi Zhang, Dongwon Lee, Yuchen Yang2026-08-13
💬 NLP

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

تجادل هذه الورقة بأن تمثيل المهارات كبرامج قابلة للتنفيذ هو الاستراتيجية الأكثر فعالية من حيث التكلفة لتكييف وكلاء النماذج اللغوية الكبيرة مع مجالات جديدة، وتثبت من خلال وكيل "SpeedRunner" المقترح أن التعلم التدريجي لهذه البرامج وإعادة صياغتها من المسارات السابقة يقلل التكاليف بشكل كبير مع الحفاظ على المتانة عبر بيئات متنوعة.

Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews2026-08-13
🤖 machine learning

Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport

تقترح الورقة البحثية الضبط الدقيق عديم الوزن (WFT)، وهو أسلوب لزمن فك التشفير لا يتطلب تدريباً يعمل على تخصيص النماذج اللغوية الكبيرة عبر نقل بقايا فضاء اللوجيت عبر عامل بادئة متقاطع، محققاً أداءً يضاهي الضبط الدقيق الخاضع للإشراف بتكلفة حوسبية تقل عن 7% مع تجنب تحديثات الأوزان.

Bohan Zhang, Anqi Ni, Yixin Wang, Paramveer S. Dhillon2026-08-13
🤖 AI

When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs

تُظهر هذه الورقة أنه بالنسبة للنماذج اللغوية الكبيرة الصغيرة المضبوطة بالتعليمات في المسائل العلمية الصعبة، فإن الاتساق الذاتي عبر التصويت بالأغلبية غالباً ما يقلل من الدقة مقارنة بالاستدلال أحادي العينة لأن الاتفاق العالي بين الإجابات المولدة لا يرتبط بشكل موثوق بالصحة.

Utkarsh Bahuguna2026-08-13
💬 NLP

Measure, Don't Optimize: Forecasting Recovery in LLM Unlearning

تقدم هذه الورقة J-Access، وهو تدقيق في وقت الاستدلال باستخدام تحليل جاكوبي لقياس إمكانية الوصول إلى المعرفة المتبقية في النماذج اللغوية الكبيرة التي خضعت لعملية "إلغاء التعلم"، حيث وجدت أنه بينما يتنبأ بفعالية بقابلية استعادة النموذج على مستوى النموذج، فإنه يفشل في تحديد حقائق محددة قابلة للاستعادة ولا يمكن استخدامه كهدف تحسين مباشر دون المخاطرة بالإخفاء الخادع للمعرفة.

Zirui Song, Huaxing Liu, Xiang Wang, Shuai Li, Xinye Li, Lang Gao, Jinghui Zhang, Zheng Lu, Fengxian Ji, Xiaojun Chang (…)2026-08-13
🤖 AI

Social Chain of Thought: A Multi-Agent Architecture Grounded in Medical Differential Diagnosis Methodology

تقدم هذه الورقة البحثية "سلسلة التفكير الاجتماعي" (SCoT)، وهي بنية متعددة الوكلاء قائمة على منهجية التشخيص التفريقي الطبي، والتي تتفوق على نماذج الاستدلال أحادية الهيكل ونماذج التوسع المرجعية من خلال استخدام محادثات تداولية متعددة الجولات بين المتخصصين لتحسين استدعاء التشخيص بشكل كبير، لا سيما في الحالات المعقدة.

Del Coburn, Scott Sanner, Dan Silver2026-08-13
💬 NLP

Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models

تجادل هذه الورقة بأن تجانس المخرجات في النماذج اللغوية الكبيرة لا ينتج أساساً عن عملية المحاذاة، بل يتم تعلمه أثناء مرحلة ما قبل التدريب ويتم كشفه أو تضخيمه فقط من خلال مراحل ضبط التعليمات والمحاذاة اللاحقة.

Alexandrine Fortier, Hazel Chen, Peter West2026-08-13
💬 NLP

Stigma and Support in Online Sexual Violence Narratives on Reddit

تقدم هذه الورقة مجموعة بيانات SCOPE لتحليل العلاقة بين أنواع الوصمة في سرديات العنف الجنسي عبر الإنترنت والدعم المقابل المقدم من مجتمعات "ريديت"، كاشفةً أن الوصمة الداخلية هي السمة السردية الأكثر انتشاراً، بينما تعطي استجابات المجتمع الأولوية باستمرار لدعم المعلومات والتقدير.

Shirlene Rose Bandela, Karan Bindal, Vaibhav Garg, Rezvaneh Rezapour2026-08-13