💬 NLP

FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents

يقدم FlexSQL عميلًا لتحويل النص إلى SQL يتفوق على النماذج الأقوى في معيار Spider2-Snow من خلال توظيف مبدأ تصميم مرن يسمح باستكشاف المخطط ديناميكيًا، وفحص البيانات، وخطط تنفيذ متنوعة مع آلية إصلاح ثنائية المستويات طوال عملية الاستدلال.

Quang Hieu Pham, Yang He, Ping Nie, Canwen Xu, Davood Rafiei, Yuepeng Wang, Xi Ye, Jocelyn Qiaochu Chen2026-05-06
💻 computer science

Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

تقترح هذه الورقة SALO، وهو كاشف عند وقت الاستدلال يستفيد من التتبع السببي لتحديد "مسارات الرفض" المستمرة والمتفرقة في التمثيلات الكامنة، مما يحقق كشفاً قوياً لعمليات كسر الحماية (بمعدل نجاح يتجاوز 90%) ضد الهجمات التي تنجح في كبح إشارات الرفض النهائية.

Xulin Hu, Che Wang, Wei Yang Bryan Lim, Jianbo Gao, Zhong Chen2026-05-06
💻 computer science

Evaluating Reasoning Models for Queries with Presuppositions

تقيم هذه الورقة نماذج الاستدلال الكبيرة (LRMs) في الاستعلامات التي تحتوي على افتراضات مسبقة خاطئة، وتجد أنها على الرغم من تفوقها على النماذج غير الاستدلالية بهامش ضئيل، إلا أنها لا تزال تخفق بشكل متكرر في تحدي الافتراضات الخاطئة، لا سيما عندما يتم التعبير عن تلك الافتراضات بقوة.

Rose Sathyanathan, Kinshuk Vasisht, Danish Pruthi2026-05-06
💻 computer science

How Language Models Process Negation

تتقصى هذه الورقة المعالجة الآلية للنفي في النماذج اللغوية الكبيرة، كاشفةً أنه بينما ينبع ضعف الدقة من اختصارات الانتباه في الطبقات المتأخرة، فإن النماذج توظف داخلياً كلاً من الآليات التثبيطية والبنائية — مع هيمنة الأخيرة — للتعامل بشكل صحيح مع العبارات المنفية.

Zhejian Zhou, Tianyi Zhou, Robin Jia, Jonathan May2026-05-06
💻 computer science

The TTS-STT Flywheel: Synthetic Entity-Dense Audio Closes the Indic ASR Gap Where Commercial and Open-Source Systems Fail

تتناول هذه الورقة الأداء الضعيف لأنظمة التعرف التلقائي على الكلام (ASR) الحالية في المجال المتخصص للصوت المختلط بين اللغات الهندية، وذلك عبر تقديم حلقة طيران (flywheel) مفتوحة المصدر من تحويل النص إلى كلام (TTS) ومن الكلام إلى نص (STT) تقوم بتخليق 22,000 عبارة كثيفة الكيانات لتحسين معدل إصابة الكيان (Entity-Hit-Rate) بشكل كبير للتعرف على الكلام بلغة التيلوجو.

Venkata Pushpak Teja Menta2026-05-06
💻 computer science

Semantically Enriching Investor Micro-blogs for Opinion-Aware Emotion Analysis: A Practical Approach

تقترح هذه الورقة نهجاً عملياً لتعزيز تحليل التدوينات المصغرة للمستثمرين من خلال تعزيز مجموعة بيانات StockEmotions برسوم بيانية للآراء ذات بنية دلالية مستمدة من StockTwits، مما يثبت أن دمج هذه الدلالات الرأيه عبر الشبكات العصبية الرسومية يحسن بشكل كبير من أداء تصنيف المشاعر.

Gaurav Negi, Paul Buitelaar2026-05-06
💻 computer science

PIIGuard: Mitigating PII Harvesting under Adversarial Sanitization

تُعد PIIGuard آلية دفاع على مستوى صفحات الويب تستخدم قطعاً برمجية مخفية ومُحسّنة من لغة HTML لتوجيه النماذج اللغوية الكبيرة بعيداً عن الكشف عن معلومات الهوية الشخصية (PII) الخاصة ببيانات الاتصال، مما يحقق معدلات نجاح عالية في منع تسرب البيانات مع الحفاظ على الفائدة للاستعلامات الحميدة.

Mingshuo Liu, Yiwei Zha, Min Chen2026-05-06
💻 computer science

Effective Performance Measurement: Challenges and Opportunities in KPI Extraction from Earnings Calls

تتناول هذه الورقة التحديات المتعلقة باستخراج مؤشرات الأداء الرئيسية (KPIs) من نصوص مكالمات الأرباح غير المهيكلة عبر تقديم معايير مرجعية جديدة، وإثبات أوجه القصور في النماذج المدربة على ملفات هيئة الأوراق المالية والبورصات الأمريكية (SEC) المهيكلة، واقتراح نظام قائم على النماذج اللغوية الكبيرة (LLM) ومُحقَّق بشرياً يحقق دقة بنسبة 79.7% لاستخراج المعلومات مفتوحة النهايات.

Rasmus T. Aavang, Rasmus Tjalk-Bøggild, Alexandre Iolov, Giovanni Rizzi, Mike Zhang, Johannes Bjerva2026-05-06
🤖 machine learning

OCRR: A Benchmark for Online Correction Recovery under Distribution Shift

تقدم هذه الورقة البحثية OCRR، وهو معيار مرجعي جديد لتقييم استعادة التصحيح عبر الإنترنت تحت تأثير انزياح التوزيع، وتثبت أن ركيزة مقترحة تعتمد على الإضافة فقط وسلسلة الهاش تتفوق بشكل كبير على النماذج المرجعية الحالية للتعلم المستمر والضبط الدقيق من خلال تحقيق دقة عالية في الفئات الجديدة مع الحفاظ في الوقت ذاته على الأداء في البيانات الأصلية وبأقل قدر من استهلاك الذاكرة.

Adrian Grassi2026-05-06
💻 computer science

Geometric Deviation as an Unsupervised Pre-Generation Reliability Signal: Probing LLM Representations for Answerability

تُثبت هذه المقالة أن قياس الانحراف الهندسي للحالات الخفية عن مجموعة مرجعية قابلة للإجابة يوفر إشارة موثوقة وغير خاضعة للإشراف قبل عملية التوليد للكشف عن الاستعلامات غير القابلة للإجابة في المجالات المهيكلة مثل الرياضيات والبرمجة، رغم أن هذا التأثير لا يعمم على المطالبات الواقعية.

Yucheng Du2026-05-06