💬 NLP

DexterSQL: Deep Schema Exploration and Rule-based Correction for Text-to-SQL Generation

يُعد DexterSQL نظاماً لتحويل النصوص إلى لغة SQL يعتمد على التلقين، وهو يعمل على تعزيز دقة التوليد دون الحاجة إلى الضبط الدقيق من خلال دمج الاستكشاف العميق للمخطط لحل غموض الأعمدة، وتنقيب القواعد المستقلة عن قواعد البيانات لتصحيح إخفاقات النماذج اللغوية الكبيرة المتكررة، وتوظيف التوليد متعدد المسارات الموجه بأشجار التبعية لتحسين التعامل مع الشروط في الاستعلامات المعقدة.

Anik Pramanik, Murat Kantarcioglu, Vincent Oria, Shantanu Sharma2026-08-13
🤖 AI

Policy-as-logic for robust reasoning over rules

تقدم هذه الورقة نهجاً رمزياً هجيناً يجمع بين النماذج اللغوية لاستخراج الحقائق ومحلل مجموعات الإجابات (answer set solver) للاستدلال المنطقي لضمان التزام استجابات الذكاء الاصطناعي بالسياسات المكتوبة، محققةً دقةً وقابلية تفسير ومتانة فائقة مع تقليل استهلاك الرموز (tokens) بشكل كبير مقارنة بالطرق الحالية.

Rahul Nair, Bastian Lipka, Elizabeth Daly2026-08-13
🤖 AI

OEIS Open: How many conjectures can language models turn into theorems?

تقدم هذه الورقة "OEIS Open"، وهو معيار مرجعي آمن لـ 492 حدسية رياضية مُصاغة رسمياً من سلسلة OEIS، مما يوضح أن النماذج اللغوية المجهزة بأدوات دنيا يمكنها حل ما يقرب من 30% إلى 44% من هذه المشكلات المفتوحة بتكلفة متواضلة، رغم أن الوصول إلى أدبيات واسعة وحلقات وكيلة متطورة لم يحسن الأداء بشكل ملحوظ.

Tom Adamczewski2026-08-13
💬 NLP

Accuracy and Order Sensitivity Diverge Under Label-Free Strategies

توضح هذه الورقة أنه في حين أن منع النماذج اللغوية الكبيرة من رؤية تسميات الخيارات أثناء الإجابة على الأسئلة متعددة الخيارات يزيل بنجاح الانحياز الموقعي، إلا أنه يفشل في تحسين الدقة وغالبًا ما يؤدي إلى تدهور الأداء، مما يكشف أن العائق الأساسي هو حجب الخيارات وليس آلية المطابقة.

Karl Hanna, Chen Feng2026-08-13
🤖 machine learning

TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement

يُعد TailBooster إطار عمل توليدي ثنائي الطبقات يجمع بين استخراج الذيل الإحصائي وفرض الصلاحية التشغيلية القائم على التعلم العميق لتخليق أحداث نقل جوي متطرفة واقعية، مما يحسن بشكل كبير من دقة التنبؤ بالتأخيرات النادرة وأوقات الطيران غير الطبيعية مقارنة بطرق تعزيز البيانات التقليدية.

Karim Aly, Alexei Sharpanskykh, Jacco Hoekstra2026-08-13
🤖 machine learning

LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

يُعد LoongReflect إطار عمل تدريبي يعزز التفكير طويل الأمد في وكلاء البحث من خلال صياغة التأمل كسياسة للتحكم في الذاكرة وتوظيف آلية تقطير ثنائية القنوات لمواءمة قرارات التأمل المحلية مع نتائج المهام العالمية، مما يتغلب على تحديات الإشراف الشحيح لتعلم التعزيز القائم على النتائج.

Zhixin Zhang, Xinke Jiang, Zhibang Yang, Weixuan Xu, Guohong Qiu, Xu Chu, Junfeng Zhao, Yasha Wang2026-08-13
🤖 AI

HCGRec: Hint-Conditioned Generative Recommendation with Semantic IDs

تعد HCGRec إطار عمل توليدي للتوصية بالمعرفات الدلالية يعمل على تخفيف اختناقات التحسين في مرحلة ما بعد التدريب القائمة على المكافأة من خلال توفير تلميحات بادئة مستهدفة دنيا للحالات الصعبة ديناميكيًا، مما يحول سيناريوهات المكافأة الصفرية إلى مقارنات معلوماتية عبر استراتيجية مبتكرة لتفكيك الائتمان الواعي بالتلميحات.

Kangning Zhang, Haotian Fang, Xukun Luo, Hao Yin, Yang Gao, Peng Yan, Weiwen Liu, Weinan Zhang, Yong Yu2026-08-13
🤖 AI

Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

تقترح الورقة البحثية إطار عمل لتقييم موثوقية مستوى الادعاء (CLR)، وهو إطار عمل لا يتطلب تدريباً يعزز كفاءة الاستنتاج في وقت الاختبار من خلال الانتقال من تقييم المسار الكامل إلى التكذيب المستهدف على مستوى الادعاء، مما يعيد تخصيص الحوسبة للتحقق من الادعاءات الحاسمة للقرار ويحسن الدقة بشكل كبير مع تقليل استخدام الرموز (tokens).

Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Junlin Zhang2026-08-13
🤖 AI

CTBench: Evaluating Troubleshooting Capabilities of AI Agents in Realistic Telecom Network Operations

تقدم هذه الورقة CTBench، وهو معيار مرجعي عام مصمم لتقييم قدرات الوكلاء ذوي الذكاء الاصطناعي في استكشاف الأخطاء وإصلاحها في عمليات شبكات الاتصالات الواقعية، كاشفةً أنه بينما يتفوق الوكلاء الحاليون في استعادة المسارات، فإنهم يواجهون صعوبة في تحليل السبب الجذري وغالباً ما يفشلون في تقديم التشخيصات القائمة على الأدلة المطلوبة في الممارسة التشغيلية.

Xingyu Yan, Tingting Dai, Antonio De Domenico, Mohamed Sana, Nicola Piovesan, Changchang Li, Bowen Liu, Kun Jiang, Mengj (…)2026-08-13
🤖 AI

RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks

لمعالجة أوجه القصور في المعايير المرجعية الحالية في تقييم نوى Triton التي تولدها النماذج اللغوية الكبيرة، قدم المؤلفون RealisticTritonBench، وهو معيار مرجعي جديد مستمد من طلبات السحب الخاصة بالأطر البرمجية في العالم الحقيقي، مما يتيح تقييماً واقعياً للأداء من البداية إلى النهاية ويكشف أن النماذج اللغوية الكبيرة الرائدة حالياً لا تزال تعاني في مثل هذه المهام.

Jinjun Huang, Zhongzhen Wen, Tongtong Xu, Meng Yan, Xin Xia, Zhongxin Liu2026-08-13