💬 NLP

Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas

تقدم هذه الورقة البحثية RINoBench، وهو أول معيار شامل لتقييم أحكام حداثة الأفكال البحثية المؤتمتة، والذي يكشف أنه على الرغم من قدرة النماذج اللغوية الكبيرة على توليد استدلال مشابه للخبراء البشر، إلا أنها لا تزال تواجه صعوبة في إنتاج تقييمات دقيقة للحداثة تتوافق مع المعايير الذهبية البشرية.

Tim Schopf, Michael Färber2026-03-12
💬 NLP

Large language models can disambiguate opioid slang on social media

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة تتفوق بشكل كبير على الاستراتيجيات التقليدية القائمة على المعاجم في فك غموض المصطلحات العامية للأفيونيات بدقة وتحديد منشورات وسائل التواصل الاجتماعي ذات الصلة عبر سيناريوهات المعاجم، والسيناريوهات الخالية من المعاجم، وسيناريوهات المصطلحات العامية الناشئة، مما يعزز مراقبة أزمة الجرعات الزائدة من الأفيونيات.

Kristy A. Carpenter, Issah A. Samori, Mathew V. Kiang, Keith Humphreys, Anna Lembke, Johannes C. Eichstaedt, Russ B. Alt (…)2026-03-12
💬 NLP

Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck

تقدم هذه الورقة البحثية DIBJudge، وهو إطار عمل للضبط الدقيق يتسم بالمتانة يعمل على تخفيف تحيز "لغة الترجمة" (translationese) في أنظمة النماذج اللغوية الكبيرة متعددة اللغات التي تعمل كحكم، وذلك باستخدام عنق زجاجة للمعلومات مفكك الارتباط لعزل الارتباطات العرضية عبر اللغات عن التمثيلات الحرجة للحكم.

Hongbin Zhang, Kehai Chen, Xuefen Bai, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang2026-03-12
⚡ electrical engineering

Speech Codec Probing from Semantic and Phonetic Perspectives

تحلل هذه الورقة بشكل منهجي أجهزة ترميز الكلام واسعة الاستخدام وتكشف أنها تشفر في المقام الأول المعلومات الصوتية بدلاً من المعلومات المعجمية-الدلالية، مما يسلط الض الضوء على عدم تطابق حرج مع الدلالات المستمدة من النصوص يستلزم نهج تصميم جديدة من أجل دمج فعال مع النماذج اللغوية الكبيرة متعددة الوسائط.

Xuan Shi, Chang Zeng, Tiantian Feng, Shih-Heng Wang, Jianbo Ma, Shrikanth Narayanan2026-03-12
💬 NLP

Learning to Negotiate: Multi-Agent Deliberation for Collective Value Alignment in LLMs

تقدم هذه الورقة إطار عمل للتفاوض متعدد الوكلاء يدرب النماذج اللغوية الكبيرة على التوافق مع الوكالة الجماعية وحل صراعات القيم من خلال المداولة عبر اللعب الذاتي المُحسّنة بواسطة التعلم المعزز من التغذية الراجعة للنماذج اللغوية الكبيرة (RLAIF) باستخدام خوارزمية (GRPO)، مما يظهر قدرات محسنة في حل الصراعات دون المساس بالأداء اللغوي العام.

Panatchakorn Anantaprayoon, Nataliia Babina, Nima Asgharbeygi, Jad Tarifi2026-03-12
💬 NLP

Human-AI Co-reasoning for Clinical Diagnosis with Evidence-Integrated Language Agent

تقدم الورقة البحثية PULSE، وهو وكيل استدلال طبي يدمج نموذج لغة كبير مضبوطاً في مجال متخصص مع استرجاع الأدبيات العلمية لتحقيق دقة تشخيصية تضاهي مستوى الخبراء عبر مختلف معدلات حدوث الأمراض، مع إظهار قدرته على تعزيز اتخاذ القرار لدى الأطباء ومخاطر الانحياز للأتمتة في تدفقات العمل التعاونية في آن واحد.

Zhongzhen Huang, Yan Ling, Hong Chen, Ye Feng, Li Wu, Linjie Mu, Shaoting Zhang, Xiaofan Zhang, Kun Qian, Xiaomu Li2026-03-12
💬 NLP

Safe and Scalable Web Agent Learning via Recreated Websites

تقدم هذه الورقة VeriEnv، وهو إطار عمل يستفيد من النماذج اللغوية لاستنساخ المواقع الإلكترونية الواقعية تلقائياً إلى بيئات اصطناعية آمنة وقابلة للتحقق، مما يمكّن الوكلاء الويب المستقلين من إجراء تطور ذاتي قابل للتوسع وتحقيق تعميم قوي دون الاعتماد على التفاعلات غير الآمنة في العالم الحقيقي أو إشارات المكافأة الاستدلالية.

Hyungjoo Chae, Jungsoo Park, Alan Ritter2026-03-12
🤖 machine learning

Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning

تقدم هذه الورقة البحثية طريقة إعادة تحجيم المكافأة النسبية للمجموعة (GR3^3)، وهي طريقة جديدة في التعلم المعزز تعمل بفعالية على تخفيف تضخم الطول في النماذج اللغوية الكبيرة من خلال إعادة صياغة التحكم في الطول كنموذج إعادة تحجيم ضربي، مما يحقق تحسيناً غير فاقد للأداء وأداءً فائقاً مقارنة بالنماذج المرجعية الحالية دون المساس بالقدرات اللاحقة.

Zichao Li, Jie Lou, Fangchen Dong, Zhiyuan Fan, Mengjie Ren, Hongyu Lin, Xianpei Han, Debing Zhang, Le Sun, Yaojie Lu, X (…)2026-03-12
💬 NLP

MUNIChus: Multilingual News Image Captioning Benchmark

تقدم الورقة البحثية MUNIChus، وهو أول معيار متعدد اللغات لوصف صور الأخبار يضم تسع لغات بما في ذلك اللغات ذات الموارد المنخفضة، لمعاللة ندرة مجموعات البيانات غير الإنجليزية وتقييم أداء النماذج الحديثة في هذه المهمة الصعبة.

Yuji Chen, Alistair Plum, Hansi Hettiarachchi, Diptesh Kanojia, Saroj Basnet, Marcos Zampieri, Tharindu Ranasinghe2026-03-12
💬 NLP

Disentangling Similarity and Relatedness in Topic Models

تقدم هذه الورقة دالة تسجيل عصبية تم تدريبها على معيار مرجعي اصطناعي مُصنف بواسطة نموذج لغوي كبير للفصل بين التشابه التصنيفي والارتباط الموضوعي في نماذج المواضيع، مما يثبت أن هذين البعدين الدلاليين لا يميزان الاختلافات عبر عائلات النماذج فحسب، بل يتنبآن أيضاً بالأداء في المهام اللاحقة.

Hanlin Xiao, Mauricio A. Álvarez, Rainer Breitling2026-03-12