🤖 AI

Fine-Tuning and Evaluating Conversational AI for Agricultural Advisory

تقدم هذه الورقة بنية نموذج لغوي كبير هجينة وإطار تقييم (DG-EVAL) يجمع بين الضبط الدقيق الخاضع للإشراف على حقائق زراعية منسقة من قبل خبراء مع طبقة ربط واعية بالسلامة لتقديم مشورة محادثات دقيقة ومناسبة ثقافيًا وفعالة من حيث التكلفة لصغار المزارعين في الهند.

Sanyam Singh, Naga Ganesh, Vineet Singh, Lakshmi Pedapudi, Ritesh Kumar, SSP Jyothi, Archana Karanam, C. Yashoda, Mettu (…)2026-03-05
🤖 AI

Language Model Goal Selection Differs from Humans' in an Open-Ended Task

تكشف هذه الدراسة أن النماذج اللغوية الكبيرة الحالية تبتعد بشكل كبير عن البشر في اختيار الأهداف مفتوحة النهايات من خلال تفضيل استراتيجيات "اختراق المكافأة" الاستغلالية على الاستكشاف المتنوع، مما يتحدى موثوقيتها كبدائل لاتخاذ القرار البشري في التطبيقات الحرجة.

Gaia Molinaro, Dave August, Danielle Perszyk, Anne G. E. Collins2026-03-05
🤖 AI

PlugMem: A Task-Agnostic Plugin Memory Module for LLM Agents

تقدم الورقة البحثية PlugMem، وهو وحدة ذاكرة إضافية غير مرتبطة بمهمة محددة تعمل على هيكلة الذكريات العرضية في رسم بياني مدمج متمحور حول المعرفة لتمكين الاسترجاع والاستدلال الفعال لوكلاء النماذج اللغوية الكبيرة، مما يظهر أداءً فائقاً عبر معايير متنوعة مقارنة بكل من النماذج المرتبطة بمهام محددة والنماذج الأساسية الحالية غير المرتبطة بمهمة محددة.

Ke Yang, Zixi Chen, Xuan He, Jize Jiang, Michel Galley, Chenglong Wang, Jianfeng Gao, Jiawei Han, ChengXiang Zhai2026-03-05
🤖 AI

TTSR: Test-Time Self-Reflection for Continual Reasoning Improvement

تقترح هذه الورقة إطار عمل TTSR، وهو إطار عمل ذاتي التطور في وقت الاختبار حيث يتبادل نموذج لغوي واحد دوري الطالب والمعلم لتحليل إخفاقات الاستدلال وتوليد أسئلة متغيرة مستهدفة، مما يتيح تحسينًا مستقرًا ومستمرًا في أداء الاستدلال على المعايير المرجعية الصعبة.

Haoyang He, Zihua Rong, Liangjie Zhao, Yunjia Zhao, Lan Yang, Honggang Zhang2026-03-05
🤖 AI

TATRA: Training-Free Instance-Adaptive Prompting Through Rephrasing and Aggregation

تُعد TATRA طريقةً للتلقين (prompting) لا تتطلب تدريباً ولا بيانات، حيث تقوم ببناء أمثلة قليلة التخصيص لكل حالة من خلال إعادة الصياغة والتجميع الفوري، محققةً أداءً هو الأفضل في مجاله (state-of-the-art) في اختبارات الاستدلال والتصنيف دون الحاجة إلى تحسين خاص بالمهمة أو بيانات مصنفة.

Bartosz Dziuba, Kacper Kuchta, Paweł Batorski, Przemysław Spurek, Paul Swoboda2026-03-05
💬 NLP

How LLMs Cite and Why It Matters: A Cross-Model Audit of Reference Fabrication in AI-Assisted Academic Writing and Methods to Detect Phantom Citations

تقدم هذه الدراسة تدقيقاً واسع النطاق لـ 10 نماذج لغوية كبيرة (LLMs) تجارية، يكشف عن تباين كبير في معدلات هلوسة الاستشهاد عبر النماذج والمجالات، بينما تثبت أن التزييف الناجم عن الأوامر (prompt-induced fabrication) يمكن الحد منه بفعالية من خلال توافق النماذج المتعددة، والتكرار داخل الأمر نفسه، ومصنف ببليوغرافي خفيف الوزن يكتشف الاستشهادات الوهمية دون استعلامات لقواعد بيانات خارجية.

MZ Naser2026-03-05
💬 NLP

Benchmarking Legal RAG: The Promise and Limits of AI Statutory Surveys

تقوم هذه الورقة البحثية بقياس أداء أدوات استرجاع المعلومات المعزز بالتوليد (RAG) القانونية الناشئة مقابل مجموعة بيانات LaborBench، كاشفةً أنه في حين أن منصات الذكاء الاصطناي التجاري لا تؤدي أداءً جيداً مقارنةً بـ RAG القياسي، فإن أداة مخصصة (STARA) تحسن الدقة بشكل ملحوظ، رغم أن المزيد من التحليل يشير إلى أن أداءها الحقيقي أعلى حتى بسبب حالات الحذف التي لم تُحسب سابقاً في بيانات الحقيقة الأرضية.

Mohamed Afane, Emaan Hariri, Derek Ouyang, Daniel E. Ho2026-03-05
🤖 AI

From Exact Hits to Close Enough: Semantic Caching for LLM Embeddings

تتناول هذه الورقة التحدي الذي يصعب حله في زمن متعدد الحدود (NP-hard) والمتمثل في التخزين المؤقت الدلالي الأمثل غير المتصل (offline semantic caching) لتمثيلات النماذج اللغوية الكبيرة (LLM embeddings)، وذلك عبر اقتراح خوارزميات تقريبية تعمل في زمن متعدد الحدود (polynomial-time heuristics) وسياسات متصلة (online policies) مبتكرة تستفيد من الحداثة والتكرار والمحلية لتحسين سرعة الاستجابة، وخفض التكاليف، وتعزيز الدقة الدلالية.

Dvir David Biton, Roy Friedman2026-03-05
🤖 AI

Developing an AI Assistant for Knowledge Management and Workforce Training in State DOTs

تقترح هذه الورقة إطار عمل للتعزيز التوليدي المستند إلى الاسترجاع متعدد الوكلاء يدمج النماذج اللغوية الكبيرة ذات الأوزان المفتوحة ونماذج الرؤية واللغة لتعزيز إدارة المعرفة وتدريب القوى العاملة في وزارات النقل بالولايات، وذلك من خلال تمكين استجابات مدركة للسياق ومستندة إلى الأدلة من الوثائق الفنية النصية والبصرية.

Divija Amaram, Lu Gao, Gowtham Reddy Gudla, Tejaswini Sanjay Katale2026-03-05
🤖 AI

HumanLM: Simulating Users with State Alignment Beats Response Imitation

تقترح الورقة البحثية HumanLM، وهو إطار تدريب مبتكر يحسن محاكاة المستخدم من خلال محاذاة الحالات الكامنة القائمة على أسس نفسية مع الاستجابات الحقيقية عبر التعلم المعزز، متفوقاً بذلك على أساليب محاكاة الاستجابة الحالية في معيار Humanual الشامل وفي التقييمات البشرية في الوقت الفعلي.

Shirley Wu, Evelyn Choi, Arpandeep Khatua, Zhanghan Wang, Joy He-Yueya, Tharindu Cyril Weerasooriya, Wei Wei, Diyi Yang (…)2026-03-05