💬 NLP

DynaWeb: Model-Based Reinforcement Learning of Web Agents

تقدم الورقة البحثية DynaWeb، وهو إطار عمل للتعلم التعزيزي القائم على النموذج يقوم بتدريب وكلاء الويب المستقلين من خلال الاستفتادة من نموذج عالم مُتعلم لمحاكاة التفاعلات وتوليد مسارات اصطناعية، مما يتغلب على أوجه عدم الكفاءة والمخاطر المرتبطة بالتدريب المباشر على الإنترنت مع تحسين الأداء بشكل كبير في الاختبارات المعيارية الصعبة.

Hang Ding, Peidong Liu, Junqiao Wang, Ziwei Ji, Meng Cao, Rongzhao Zhang, Lynn Ai, Eric Yang, Tianyu Shi, Lei Yu2026-04-21
💬 NLP

BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks

تقدم الورقة البحثية BenchMarker، وهي مجموعة أدوات مستوحاة من التعليم تستخدم حكامًا يعتمدون على النماذج اللغوية الكبيرة للكشف عن التلوث، والاختصارات، وأخطاء الكتابة في معايير الاختبار متعددة الخيارات، كاشفةً أن مثل هذه العيوب تستمر عبر 12 مجموعة بيانات رئيسية، وتؤدي إلى تشويه مقاييس التقييم بشكل كبير، وغالبًا ما تظهر حتى في المعايير التي تم إصلاحها مسبقًا.

Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Ra (…)2026-04-21
💬 NLP

Althea: Human-AI Collaboration for Fact-Checking and Critical Reasoning

تقدم الورقة البحثية "أليثيا" (Althea)، وهو نظام تعاون بين الإنسان والذكاء الاصطناجعي يعتمد على الاسترجاع، يعمل على تعزيز دقة التحقق من الحقائق والتفكير النقدي من خلال هيكلة العمل المعرفي عبر التفاعل الموجه، مبرهناً في نهاية المطاف أن السقالات التربوية تؤدي إلى تحسينات أكثر ديمومة في الاستقلال الإبستمي للمستخدم مقارنة بالأحكام المؤتمتة أو البحث الموجه ذاتياً بمفرده.

Svetlana Churina, Kokil Jaidka, Anab Maulana Barik, Harshit Aneja, Cai Yang, Wynne Hsu, Mong Li Lee2026-04-21
💬 NLP

MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering

تقترح الورقة البحثية إطار عمل MARA، وهو إطار عمل متعدد الوسائط للتوليد المعزز بالاسترجاع التكيفي يعمل على تحسين الإجابة على الأسئلة المتعلقة بالمستندات من خلال تقديم ترميز للمناطق المتوافقة مع الاستعلام لاسترجاع دقيق ومتحكم في الأدلة ذاتي التأمل للتوليد التكيفي، متفوقاً بذلك على الأساليب الحالية الرائدة عبر ستة معايير مرجعية.

Hui Wu, Haoquan Zhai, Yuchen Li, Hengyi Cai, Peirong Zhang, Yidan Zhang, Lei Wang, Chunle Wang, Yingyan Hou, Shuaiqiang (…)2026-04-21
💬 NLP

Diagnosing LLM-based Rerankers in Cold-Start Recommender Systems: Coverage, Exposure and Practical Mitigations

تقدم هذه الورقة دراسة تشخيصية منهجية تكشف أن أجهزة إعادة الترتيب من نوع (cross-encoder) القائمة على النماذج اللغوية الكبيرة (LLM) تؤدي أداءً أدنى من نماذج الشعبية البسيطة في توصيات الأفلام عند بدء التشغيل البارد، وذلك بسبب الإخفاقات الحرجة في تغطية الاسترجاع، والتحيز الشديد في التعرض، وضعف التمييز في الدرجات، مما يؤدي إلى استراتيجيات قابلة للتنفيذ للبحث الهجين وتحسين المرشحين.

Ekaterina Lemdiasova, Nikita Zmanovskii2026-04-21
🤖 machine learning

Annotation Entropy Predicts Per-Example Learning Dynamics in LoRA Fine-Tuning

تُظهر هذه الورقة أن الضبط الدقيق باستخدام تقنية LoRA يتسبب بشكل فريد في تدهور أداء النموذج في الأمثلة ذات التباين العالي بين المقيّمين (الإنتروبيا العالية للتوسيم)، وهي ظاهرة تتميز بزيادة الخسارة أثناء التدريب والتي ترتبط ارتباطاً وثيقاً بعدم اليقين في التوسيم وتختلف عن الضبط الدقيق الكامل.

Brady Steele2026-04-21
💬 NLP

Benchmarking Real-Time Question Answering via Executable Code Workflows

تقدم هذه الورقة البحثية RT-QA، وهو إطار تقييم ديناميكي يستخدم سير عمل برمجيات قابلة للتنفيذ لتقييم الإجابة على الأسئلة في الوقت الفعلي، كاشفةً أن حتى النماذج الأكثر تطوراً تعاني من صعوبات في التكيف الزمني بسبب الاسترجاب الكسول والارتباك الزمني، حيث حققت دقة تبلغ 46% فقط.

Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu, Zhongjian Miao, Wei Chen, Bo Chen, Xiaobing Zhao2026-04-21
💬 NLP

Training for Compositional Sensitivity Reduces Dense Retrieval Generalization

تُظهر هذه الورقة أن تدريب نماذج الاسترجاع الكثيف على الحساسية التركيبية باستخدام السلبيات المستهدفة بنيوياً يؤدي إلى تدهور كبير في أداء التعميم في حالة عدم وجود بيانات مسبقة، بينما تُظهر أن الموثقات على مستوى الرمز (token-level) مثل MaxSim أو نماذج المحولات الصغيرة (Transformers) فوق خرائط التشابه هي أكثر ملاءمة للتمييز بين حالات "الخطأ الوشيك" البنيوي في سيناريوهات إعادة الترتيب.

Radoslav Ralev, Aditeya Baral, Iliya Zhechev, Jen Agarwal, Srijith Rajamohan2026-04-21
💬 NLP

Clinical Note Bloat Reduction for Efficient LLM Use

تقدم الورقة البحثية TRACE، وهو خط معالجة مسبقة قابل للتوسع يستفيد من البيانات الوصفية للسجلات الصحية الإلكترونية وإزالة التكرار القائم على التكرار لإزالة ما يقرب من نصف "تضخم الملاحظات" الزائد في التوثيق السريري، مما يقلل بشكل كبير من تكاليف استدلال النماذج اللغوية الكبيرة مع الحفاظ على الأداء في المهام السريرية اللاحقة.

Jordan L. Cahoon, Chloe Stanwyck, Asad Aali, Rachel Madding, Emma Sun, Yixing Jiang, Renumathy Dhanasekaran, Emily Alsen (…)2026-04-21
💬 NLP

Cross-Family Speculative Decoding for Polish Language Models on Apple~Silicon: An Empirical Evaluation of Bielik~11B with UAG-Extended MLX-LM

تقدم هذه الورقة تقييماً تجريبياً لفك التشفير التخميني عبر العائلات المختلفة لنماذج اللغة البولندية على معالجات "Apple Silicon"، حيث تُظهر أنه في حين أن ترجمة الرموز المدركة للسياق تحسن معدلات القبول، فإن قيود عرض نطاق الذاكرة الموحدة وعدم توافق أجهزة الترميز تحد من مكاسب الإنتاجية، لا سيما عندما تضعف أداء نماذج المسودة المتخصصة مقارنة بالبدائل العامة.

Krzysztof Fonal2026-04-21