💬 NLP

A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States

تقدم هذه الورقة مجموعة بيانات ضخمة تضم أكثر من 700,000 مقطع من البرامج الإذاعية الدينية باللغة الإنجليزية، تم تفريغها وتصنيف المتحدثين فيها، من شهر يوليو 2025، جُمعت من 785 بثاً عبر الويب تمثل أكثر من 2,000 محطة في الولايات المتحدة، وذلك لتسهيل البحث في محتوى الوسائط الدينية، والخطاب الاجتماعي السياسي، ومعالجة الكلام.

Samuel Bestvater, Athena Chapekis, Skyler Seets, Anna Lieb, Sono Shah, Aaron Smith2026-07-30
💬 NLP

Evaluating Prompt Scope and Demonstration Similarity in Local LLM Machine Translation

تقيم هذه الورقة كيف تؤثر نطاقات التلقين واستراتيجيات اختيار النماذج التوضيحية على أداء الترجمة الآلية للنماذج اللغوية الكبيرة المحلية المضبوطة بالتعليمات عبر عائلات لغوية متعددة، لتجد أنه في حين تظل أنظمة الترجمة الآلية المخصصة متفوقة، فإن التلقين بأسلوب القليل من الأمثلة القائم على التضمين والتلقين بنطاق العائلة يمكن أن يعزز النماذج الأكبر رغم ما يسببه من تحديات في المخرجات المهيكلة للنماذج الأصغر.

Mihael Arcan2026-07-30
💬 NLP

AgentGUI: An Interface for Observing and Steering Long-Running AI Agents

تقدم الورقة البحثية AgentGUI، وهي واجهة رسومية مستضافة محلياً مصممة لتعزيز الإشراف البشري على وكلاء الذكاء الاصطناعي الذين يعملون لفترات طويلة من خلال تصورات غنية للمسارات وقدرات التوجيه، والتي أظهرت دراسة مستخدمين أنها تحسن بشكل كبير سرعة تحليل المسار ومعدلات إكمال المهام.

Xuan Zhao, Jiwoong Sohn, Qinyue Zheng, Michael Moor2026-07-30
💬 NLP

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

تقدم هذه الورقة "التوصيف التشخيصي المعرفي" (CDP)، وهو إطار عمل يعتمد على التعلم الصفري، يقوم بتوجيه النماذج اللغوية الكبيرة لمحاكاة ملفات تعريف معرفية متنوعة للممتحنين، مما يحسن بشكل كبير من توافقها مع المختبرين البشريين عبر توزيعات القدرة، وأنماط الإتقان، وصعوبات الفقرات لتمكين المعايرة السيكومترية العملية وفعالة التكلفة.

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson2026-07-30
💬 NLP

Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens

تُظهر هذه الورقة أنه بينما لا تتأثر نماذج الكلام ذات التعلم الذاتي القائمة على الترميز (codec-based) باللغة المستخدمة في تدريب الترميز الصوتي العصبي الأساسي، فإن أداءها في المهام اللاحقة يعتمد بشكل حاسم على مواءمة لغة ما قبل التدريب (pre-training) مع اللغة المستهدفة، مما يشير إلى إمكانية إعادة استخدام ترميز واحد عبر لغات مختلفة بينما يجب أن يكون ما قبل التدريب خاصاً بكل لغة.

Daigo Takizawa, Tomohiko Nakamura, Samuele Cornell, William Chen, Satoru Fukayama, Shinji Watanabe2026-07-30
💬 NLP

(Im)Paired Programming: Coding Agents Improve Productivity but Harm Understanding

تكشف هذه الدراسة أنه في حين أن وكلاء البرمجة يعززون إنتاجية المطورين بشكل كبير من خلال تسريع إنجاز المهام، فإنهم في الوقت نفسه يضعفون استيعاب المستخدمين للكود وقدرتهم على توسيع عملهم، لا سيما عندما تتضمن التفاعلات صياغة أوامر منخفضة الجهد، مما يسلط الض الضوء على مقايضة حرجة بين الكفاءة والفهم يجب على المطورين معالجتها.

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber2026-07-30
💬 NLP

Misalignment Has a Personality: A Big Five Account of Emergent Misalignment

تقترح هذه الورقة أن عدم الاتساق الناشئ في النماذج اللغوية الضبطية يتجلى في شكل تحول في الشخصية، حيث تُظهر تطبيق ناقلات سمات الشخصية الخمس الكبرى كشف توقيع ثابت يتمثل في انخفاض الطيبة والضمير، إلى جانب ارتفاع الانبساطية والعصابية عبر مختلف مجموعات البيانات والنماذج غير المتسقة.

Hasibur Rahman, Smit Desai2026-07-30
💬 NLP

Voice Memory for Agentic Speech Recognition

تقدم هذه الورقة "ذاكرة الصوت" (Voice Memory)، وهي بنية "مستمع-مفكر" مخصصة للاستنتاج فقط وقابلة للتدقيق، تستخدم مصححًا مجمدًا ومُحسِّنًا محكومًا بالدرجات لتحسين ملف ذاكرة لكل مجال بشكل تكراري، مما يقلل بشكل كبير من معدلات الخطأ في الكلمات عبر مجالات متنوعة مع تجنب مشكلات التصحيح المفرط الشائعة في التصحيح التوليدي غير المقيد.

Chao-Han Huck Yang, Zih-Ching Chen, Piotr Zelasko, Zhehuai Chen, Jagadeesh Balam, Boris Ginsburg2026-07-30
💬 NLP

ForgetBench: Benchmarking Forgetting Dynamics of Long-Term Parametric Memory in Language Models

تقدم هذه الورقة ForgetBench، وهو معيار مرجعي جديد صُمم لتقييم ديناميكيات النسيان طويل الأمد واستقرار الاستبقاء لنماذج اللغات الكبيرة تحت التحرير المعرفي المستمر، مما يكشف أن الطرق الحالية تكافح لتحقيق التوازن بين التحديثات المعرفية الفعالة والحفاظ على المعلومات المكتسبة سابقاً.

Ruxi Gu, Zhenliang Zhang, Wei Wang2026-07-30
🤖 machine learning

Learning Dynamic User Personas from Implicit Interaction Streams via Iterative Refinement

تقدم الورقة البحثية إطار العمل IRIS، الذي يتعلم شخصيات المستخدمين الديناميكية مباشرة من تدفقات التفاعل الضمنية من خلال التحسين التكراري، مما يظهر دقة فائقة في التنبؤ بالقرارات على بيانات من العالم الحقيقي مقارنة بالشخصيات الثابتة والنهج القائم على الذاكرة فقط دون الحاجة إلى تعليقات صريحة من المستخدم.

Haifeng Wu2026-07-30