💬 NLP

Semantic Shift: the Fundamental Challenge in Text Embedding and Retrieval

تحدد هذه الورقة "التحول الدلالي" — وهو التطور والانتشار المهيكل للدلالات داخل النص — باعتباره العامل المسبب الجوهري وراء انهيار التضمين وتدهور الاسترجاع، مقدمةً إطاراً نظرياً ومقياساً قابلاً للحوسبة لتشخيص الحالات التي يضر فيها تباين الخواص (anisotropy) بالمهام اللاحقة بما يتجاوز مجرد طول النص.

Hang Gao, Dimitris N. Metaxas2026-03-24
💬 NLP

PROMPT2BOX: Uncovering Entailment Structure among LLM Prompts

تقدم الورقة البحثية PROMPT2BOX، وهو إطار عمل مبتكر يقوم بتضمين مطالبات النماذج اللغوية الكبيرة (LLM) في فضاء تضمين صندوقي (box embedding space) لالتقاط علاقات الخصوصية التي تتجاوز مجرد التشابه الموضوعي، مما يتيح تحليلاً أكثر دقة لنقاط الضعف وتحسيناً في التجميع الهرمي مقارنة بالطرق التقليدية القائمة على المتجهات.

Neeladri Bhuiya, Shib Sankar Dasgupta, Andrew McCallum, Haw-Shiuan Chang2026-03-24
💬 NLP

KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning

تقدم الورقة البحثية KG-Hopper، وهو إطار عمل للتعلم المعزز يُمكّن النماذج اللغوية الكبيرة مفتوحة المصدر ذات الـ 7 مليارات بارامتر المدمجة من إجراء استدلال متكامل متعدد القفزات على الرسوم البيانية للمعرفة في جولة استدلال واحدة، متفوقةً بذلك على الأنظمة التسلسلية الأكبر والنماذج المملوكة لجهات متعددة في عدة اختبارات معيارية.

Shuai Wang, Yinan Yu2026-03-24
💬 NLP

Cross-Context Verification: Hierarchical Detection of Benchmark Contamination through Session-Isolated Analysis

تقدم هذه الورقة مفهوم التحقق عبر السياقات (CCV) والبنية الهرمية للتحقق عبر السياقات (HCCA)، وهو إطار عمل "الصندوق الأسود" الذي يكتشف تلوث المعايير المرجعية في مهام البرمجة لنماذج اللغات الكبيرة (LLMs) من خلال قياس تنوع الحلول عبر جلسات مستقلة واستخدام تحليل متعدد الوكلاء مقيد المعلومات للتمييز بين الاستنتاج الحقيقي والاستدعاء المثالي، مما يعالج أوجه القصور في طرق الكشف الحالية ويكشف عن معدلات عالية من الإيجابيات الكاذبة في تسميات التلوث السابقة.

Tae-Eun Song2026-03-24
🤖 machine learning

DSPA: Dynamic SAE Steering for Data-Efficient Preference Alignment

تقدم الورقة البحثية DSPA، وهي طريقة لمحاذاة التفضيلات أثناء الاستدلال تعمل على توجيه كامنات المشفّر التلقائي المتناثر ديناميكيًا بناءً على سياق المطالبة لتحقيق أداء تنافسي بتكاليف حوسبة أقل بكثير ودون تحديثات للأوزان.

James Wedgwood, Aashiq Muhamed, Mona T. Diab, Virginia Smith2026-03-24
💬 NLP

TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild

تقدم هذه الورقة TaigiSpeech، وهي مجموعة بيانات من العالم الحقيقي تضم 3,000 عبارة من 21 متحدثاً مسناً للغة التايجية (Taigi) مصممة للكشف عن القصد في تطبيقات الرعاية الصحية والمساعدات المنزلية، إلى جانب استراتيجيات تعدين بيانات قابلة للتوسع باستخدام التوسيم الزائف بواسطة النماذج اللغوية الكبيرة (LLM) والأطر متعددة الوسائط لمعالجة ندرة البيانات المصنفة للغات ذات الموارد المنخفضة وغير المكتوبة.

Kai-Wei Chang, Yi-Cheng Lin, Huang-Cheng Chou, Wenze Ren, Yu-Han Huang, Yun-Shao Tsai, Chien-Cheng Chen, Yu Tsao, Yuan-F (…)2026-03-24
💬 NLP

Triangulating Temporal Dynamics in Multilingual Swiss Online News

تستخدم هذه الورقة منهجية ثلاثية التثليث تجمع بين التحليل الكمي لأكثر من 1.7 مليون مقال والرؤى النوعية للكشف عن كيفية تشكيل السياقات اللغوية والثقافية لأنماط زمنية متميزة في الأخبار الرقمية السويسرية عبر المناطق الفرنسية والألمانية والإيطالية.

Bros Victor, Dufraisse Evan, Popescu Adrian, Gatica-Perez Daniel2026-03-24
💬 NLP

SynSym: A Synthetic Data Generation Framework for Psychiatric Symptom Identification

تقدم الورقة البحثية إطار عمل SynSym، الذي يستفيد من النماذج اللغوية الكبيرة لتوليد بيانات اصطناعية متنوعة وذات أسس سريرية لتحديد الأعراض النفسية، مما يثبت أن النماذج المدربة على هذه البيانات الاصطناعية تحقق أداءً مماثلاً لتلك المدربة على بيانات حقيقية مشروحة.

Migyeong Kang, Jihyun Kim, Hyolim Jeon, Sunwoo Hwang, Jihyun An, Yonghoon Kim, Haewoon Kwak, Jisun An, Jinyoung Han2026-03-24
💬 NLP

DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing

تقدم الورقة البحثية DATASHI، وهو متن موازٍ جديد للغتين الإنجليزية والتاشلحيت، صُمم لمعالجة تحديات الموارد المنخفضة في معالجة اللغة الأمازيغية من خلال تمكين دراسات التنميط الكتابي وإثبات أن النماذج اللغوية الكبيرة الحديثة، ولا سيما Gemini-2.5-Pro، يمكنها التعامل بفعالية مع السمات الفونولوجية المعقدة للغة من خلال التلقين بلقطات قليلة.

Nasser-Eddine Monir, Zakaria Baou2026-03-24
🔬 optics

PRISM: Breaking the O(n) Memory Wall in Long-Context LLM Inference via O(1) Photonic Block Selection

تقدم الورقة البحثية PRISM، وهو محرك تشابه ضوئي يكسر عنق زجاجة عرض نطاق الذاكرة بمقياس O(n) في استنتاج النماذج اللغوية الكبيرة ذات السياق الطويل، وذلك عبر إجراء عملية اختيار لكتل KV بمقياس O(1)، مما يحقق تفوقاً في الطاقة بمقدار أربعة مراتب عشرية وانخفاضاً في حركة البيانات بمقدار 16 ضعفاً مقارنة بالنماذج المرجعية القائمة على وحدات معالجة الرسومات مع الحفاظ على دقة بنسبة 100%.

Hyoseok Park, Yeonsang Park2026-03-24