🤖 machine learning

Symbolic Graphics Programming with Large Language Models

تقدم هذه الورقة SGP-GenBench لتقييم قدرة النماذج اللغوية الكبيرة على توليد برامج الرسوميات الرمزية (SVGs)، وتقترح نهجاً للتعلم التعزيزي بمكافآت قابلة للتحقق يعزز بشكل كبير جودة التوليد والمواءمة الدلالية، مما يمكّن النماذج مفتوحة المصدر من مضاهاة أداء الأنظمة الرائدة.

Yamei Chen, Haoquan Zhang, Yangyi Huang, Zeju Qiu, Kaipeng Zhang, Yandong Wen, Weiyang Liu2026-08-10
🤖 machine learning

λ\boldsymbolλ-Orthogonality Regularization for Compatible Representation Learning

تقدم هذه الورقة البحثية تنظيم التعامد-λ\lambda (λ\lambda-Orthogonality)، وهو أسلوب يجمع بين قيود التعامد المرنة والتحويلات التآلفية لتمكين تعلم التمثيلات المتوافقة عبر الشبكات العصبية المدربة بشكل مستقل، مما يحافظ على هياكل النماذج الأصلية وأداء الصفر-مرحلة (zero-shot) مع التكيف مع التوزيعات الجديدة.

Simone Ricci, Niccolò Biondi, Federico Pernici, Ioannis Patras, Alberto Del Bimbo2026-08-10
🤖 machine learning

Mitigating Negative Flips via Margin Preserving Training

تقترح هذه الورقة إطار تدريب مبتكر يخفف من الانقلابات السلبية في أنظمة تصنيف الصور المتطورة من خلال الحفاظ على هوامش النموذج الأصلي عبر معايرة اللوغيت مع توظيف التقطير البؤري مزدوج المصدر للحفاظ على دقة عالية في كل من الفئات القديمة والجديدة.

Simone Ricci, Niccolò Biondi, Federico Pernici, Alberto Del Bimbo2026-08-10
💻 computer science

Direct Visual Grounding by Directing Attention of Visual Tokens

تقترح هذه الورقة البحثية فقدان انتباه كولباك-ليبلر (KLAL) مبتكرًا يشرف مباشرة على انتباه الرموز البصرية للرموز اللغوية ذات الصلة في نماذج الرؤية واللغة، مما يحسن الأداء في مهام التأسيس البصري من خلال معالجة إشارات الانتباه غير الكافية التي يوفرها التنبؤ بالرمز التالي القياسي.

Parsa Esmaeilkhani, Longin Jan Latecki2026-08-10
⚡ electrical engineering

Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT

تقدم هذه الورقة البحثية CTO، وهو أول إطار عمل للمشغل العصبي لإعادة بناء التصوير المقطعي المحوسب من مشاهد شحيحة، والذي يستفيد من فضاءات الدوال المستمرة، والمعالجة ثنائية النطاق، والالتفافات المتوافقة مع الدوران لتحقيق تعميم فائق غير مرتبط بالدقة واستنتاج أسرع بكثير مقارنة بالطرق الحالية القائمة على الشبكات العصبية الالتفافية والنماذج الانتشارية.

Aujasvit Datta, Jiayun Wang, Asad Aali, Anima Anandkumar2026-08-10
💻 computer science

SciLT: Long-tailed Image Classification under Scientific Image Domains

تقترح هذه الورقة SciLT، وهو إطار عمل مبتكر يستخدم دمج الميزات التكيفي والتعلم بالإشراف المزدوج لمعالجة تحديات تصنيف الصور ذات التوزيع طويل الذيل بفعالية في المجالات العلمية حيث يحقق الضبط الدقيق للنماذج التأسيسية القياسية مكاسب محدودة.

Jiahao Chen, Bing Su2026-08-10
💻 computer science

Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models

تقترح الورقة البحثية DeSAP، وهي طريقة مبتكرة لتقليم الرموز (token pruning) لنماذج الرؤية واللغة الكبيرة التي تستخدم التشابه المنفصل لالتقاط الصلة الدقيقة بين الوسائط المتعددة، مما يتيح تقليماً واعياً بالمهام يقلل التكاليف الحسابية بشكل كبير مع الحفاظ على أداء عالٍ.

Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao2026-08-10
💻 computer science

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

تُعد VisCo إطار عمل كفؤاً في التدريب يستفيد من نموذج رؤية-لغة مُدرب مسبقاً كـمُشفّر جوهري لضغط الرموز البصرية إلى مجموعة مدمجة من رموز الذاكرة، محققاً أداءً فائقاً واستقراراً عبر مختلف نسب الضغط دون الحاجة إلى إعادة تدريب مكثفة أو وحدات خارجية.

Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu2026-08-10
💬 NLP

GEB-Bench: Abstract Structures Told in Many Voices

يقدم GEB-Bench معياراً مرجعياً جديداً يقيم قدرة نماذج الذكاء الاصطناعي على التعرف على الزخارف الهيكلية المجردة ورسم خرائطها عبر وسائط متنوعة، مما يكشف عن فجوة ثابتة ومنتظمة بين التعرف أحادي الصوت والتجريد عابر الأصوات، وهي فجوة تستمر حتى في النماذج الرائدة.

Tong Zhang, Zhiyuan Shi, Yun Peng, Tao Xie2026-08-10
🤖 AI

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

تقترح هذه الورقة البحثية "تنبؤ انتباه الطبقة المتوسطة" (MAP)، وهي طريقة تحدد ديناميكيًا طبقات الانتباه المثلى الخاصة بكل عينة وتعمل على تقطيرها في متنبئ خفيف الوزن لتقليص الرموز البصرية قبل معالجتها بواسطة النموذج اللغوي، مما يحقق تسريعًا في الأداء بنسبة 3.09 ضعفًا من البداية إلى النهاية مع الحفاظ على 97.5% من الأداء على نموذج LLaVA-NeXT-7B.

Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu2026-08-10