💬 NLP

Can Language Models Identify Shadow Trading Targets? An NLP Evaluation of SEC Enforcement Theory

تقيم هذه الورقة ما إذا كانت نماذج معالجة اللغات الطبيعية قادرة على تحديد أهداف "التداول الظلي" من خلال تحليل التشابه الدلالي في إفصاحات هيئة الأوراق المالية والبورصات، حيث وجدت عدم وجود ارتباط معنوي بين تحديد الأقران الخوارزمي وعوائد الأسهم غير الطبيعية، مما يتحدى الأساس التجريبي لنظرية إنفاذ القانون الخاصة بهيئة الأوراق المالية والبورصات.

Sarah Wilson, Michael MacKay, Anthony Marello, Trinav Bhattacharyya2026-08-04
💬 NLP

Prompt-Induced Waste in Large Reasoning Models: A Preregistered Two-Harness Benchmark of Coding Agents

تُظهر هذه الدراسة المرجعية المسجلة مسبقاً أن صياغة الأوامر وتصميم الهيكل التجريبي يرفعان بشكل كبير تكاليف الاستنتاج لوكلاء البرمجة الكبار — غالباً بمعدل يتراوح بين 2.4 إلى 30 ضعفاً — دون تحسين النجاح في المهام، مع كون تعليمات محددة مثل "طوّر مقاربات متعددة" وهياكل تجريبية معينة هي المحركات الأساسية لهذا عدم الكفاءة.

Sarel Weinberger, Amir Hozez2026-08-04
💬 NLP

HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

تقدم هذه الورقة البحثية HopRefusalBench، وهو أول معيار اختبار مصمم لتقييم كيفية تعامل الوكلاء المعززين بالبحث مع الأسئلة متعددة الخطوات غير القابلة للإجابة، مما يكشف أنه بينما تستطيع النماذج غالباً تحديد السبب الصحيح لعدم إمكانية الإجابة، إلا أنها تفشل تكراراً في الالتزام بالرفض المناسب، وتلجأ بدلاً من ذلك إلى الهلوسة أو استنفاد ميزانيات البحث.

Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Bowen Song2026-08-04
💬 NLP

EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents

يُعد EviSD إطار عمل للتقطير الذاتي المشروط بالأدلة، يعمل على تعزيز وكلاء اللغة المعززين بالبحث من خلال الاستفيد من الأدلة على مستوى الحالة والإجابات الذهبية كمعلومات متميزة لتنقية تخصيص الائتمان على مستوى الإجراء أثناء التدريب، مما يحقق أداءً فائقاً عبر معايير قياس متعددة دون تغيير سلوك وقت الاستدلال.

Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Shu Wu, Bowen Song, Liang Wang2026-08-04
💬 NLP

When Retrieval Helps and Distracts: Evaluating Evidence-Generating LLMs for Biomedical Claim Verification

تقيم هذه الورقة البحثية تكوينات مختلفة لنماذج اللغات الكبيرة (LLMs) للتحقق من الادعاءات الطبية الحيوية على معيار CARE-XAI، حيث وجدت أنه في حين تتفوق النماذج التي خضعت لضبط دقيق في توليد الأدلة، فإن تعزيز الاسترجاع يقدم فوائد متباينة اعتماداً على المصدر، كما تقدم أداة Bio-GRACE كأداة تشخيصية جديدة لقياس فائدة الاسترجاع بشكل أفضل بما يتجاوز مقاييس الاستدعاء البسيطة.

Pritam Deka, Prabhjot Singh2026-08-04
💬 NLP

QR-Erase: Efficient Subspace-Based Machine Unlearning with Layer Localization

يُعد QR-Erase إطار عمل فعال لـ "إلغاء التعلم" (machine unlearning) يعتمد على الفضاءات الجزئية (subspace-based)، حيث يستخدم تحليل QR المحوري وتحديد المواقع في الطبقات لإزالة المعلومات الخاصة بالمهمة بدقة من معاملات النموذج، محققاً بذلك توازناً متفوقاً بين النسيان والاحتفاظ يضاهي الأساليب القائمة على تحليل القيم المفردة (SVD) مع تجنب تكاليفها الحسابية.

Tyler Lizzo, Larry Heck2026-08-04
💬 NLP

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

تقدم هذه الورقة DunphyBench، وهو معيار جديد لتقييم اتخاذ القرار المتجسد طويل الأمد والمتوافق مع التفضيلات البشرية، وتقترح MeMento، وهو ضاغط ذاكرة مشروط بالتفضيلات يحسن دقة الوكيل بشكل كبير مع تقليل استخدام الذاكرة بشكل جذري من خلال معالجة الاختناقات الناتجة عن السجل متعدد الوسائط الخام.

Bingxuan Li, Rui Yang, Cheng Qian, Jiateng Liu, Jeonghwan Kim, Zhenhailong Wang, Manling Li, Tong Zhang, Heng Ji2026-08-04
💬 NLP

PALMs: Using Multi Construct-Grounded Rationales for Modeling Population Preferences in LLMs

تقدم هذه الورقة نماذج لغوية متوافقة مع السكان (PALMs)، وهي مجموعة من النماذج المتوافقة مع مجموعات سكانية وطنية محددة عبر الاستفادة من مسوغات قائمة على مفاهيم متعددة لضبط التفضيلات، والتي تتفوق بشكل كبير على النماذج المرجعية الحالية في محاكة القيم الثقافية والمعتقدات والاستدلال الاجتماعي المتنوع دون الحاجة إلى إشراف خاص بالمهام.

Priyanka Dey, Brihi Joshi, Preyashi Poddar, Jieyu Zhao, Emilio Ferrara2026-08-04
💬 NLP

Retrieval Augmented Biomedical Question Answering with Weak Question Recovery and Neural Reranking for BioASQ Task 14b

تقدم هذه الورقة البحثية خط العمل الخاص بفريق DS@GT ARC لـ BioASQ في المهمة 14b، والذي يدمج التوسع متعدد المصادر للاستعلام، وإعادة الترتيب العصبي، واستراتيجية استرداد الأسئلة الضعيفة المشروطة لتحسين متانة الاسترجاع وأداء MAP@10 بشكل كبير في الاستعلامات الطبية الحيوية الصعبة.

Xueying Zhao, Lee Mai, Balaji Anandganesh2026-08-04
🤖 machine learning

Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics

تقدم هذه الورقة البحثية "السؤال يولد سؤالاً" (QbQ)، وهو منهج تعليمي ذاتي التطور يعمل بشكل تكراري على توليد متغيرات للمسائل من نقاط القوة الحالية للنموذج للتغلب على ندرة البيانات ومحدودية مسارات الاستدلال، مما نجح في كسر مستويات الأداء الثابتة في الضبط الدقيق للرياضيات التنافسية عبر تحقيق درجة 16.5% في مقياس pass@1 على اختبار AIME.

Longtian Bao, Jianyou Wang, Yang Zhang, Youze Zheng, Ramamohan Paturi2026-08-04