🤖 AI

TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation

يعالج TokenTrim الانزياح الزمني في توليد الفيديو الطويل ذاتي الانحدار من خلال تقديم طريقة أثناء الاستنتاج تحدد وتقلم الرموز الكامنة غير المستقرة قبل إعادة استخدامها كشرط، مما يحسن الاتساق طويل الأمد دون تعديل بنية النموذج أو عملية التدريب.

Ariel Shaulov, Eitan Shaar, Amit Edenzon, Lior Wolf2026-02-03
🤖 AI

LogicGaze: Benchmarking Causal Consistency in Visual Narratives via Counterfactual Verification

تقدم الورقة البحثية LogicGaze، وهو إطار عمل مرجعي مبتكر يتكون من 40,000 مقطع فيديو وصورة مع اضطرابات مضادة للواقع، صُمم لتقييم وكشف ثغرات الهلوسة السببية في نماذج الرؤية واللغة المتطورة من خلال بروتوكول تقييم ثلاثي الأجزاء.

Rory Driscoll, Alexandros Christoforos, Chadbourne Davis2026-02-03
🤖 machine learning

Opportunistic Promptable Segmentation: Leveraging Routine Radiological Annotations to Guide 3D CT Lesion Segmentation

تقدم الورقة البحثية SAM2CT، وهو نموذج تجزئة قابل للتلقين مبتكر يستفيد من التوصيفات الإشعاعية الروتينية (مثل الأسهم والخطوط) المخزنة في نظام PACS لإنشاء تجزئات ثلاثية الأبعاد عالية الجودة لآفات الأشعة المقطعية تلقائياً، مما يوفر حلاً قابلاً للتوسع لإنشاء مجموعات بيانات طبية مشروحة واسعة النطاق دون جهد يدوي مكثف.

Samuel Church, Joshua D. Warner, Danyal Maqbool, Xin Tie, Junjie Hu, Meghan G. Lubner, Tyler J. Bradshaw2026-02-03
🤖 AI

Bridging the Semantic Chasm: Synergistic Conceptual Anchoring for Generalized Few-Shot and Zero-Shot OOD Perception

تقدم هذه الورقة البحثية SynerNet، وهو إطار عمل رائد متعدد الوكلاء يخفف من تدهور المحاذاة عبر الوسائط في نماذج الرؤية واللغة من أجل الإدراك خارج التوزيع، محققاً مكاسب أداء كبيرة في سيناريوهات التعلم من أمثلة قليلة والتعلم بدون أمثلة على مقياس VISTA-Beyond.

Alexandros Christoforos, Sarah Jenkins, Michael Brown, Tuan Pham, David Chen2026-02-03
🔢 mathematics

3DGS2^2-TR: Scalable Second-Order Trust-Region Method for 3D Gaussian Splatting

تقترح الورقة البحثية 3DGS2^2-TR، وهو مُحسِّن منطقة ثقة من الدرجة الثانية، قابل للتوسع وخالٍ من المصفوفات، يقرب الانحناء عبر طريقة هوتشينسونون وينظم التحديثات باستخدام مسافة هيلينجر المربعة لتحقيق تقارب أسرع واستهلاك أقل للذاكرة مقارنة بنهج الدرجة الثانية الحالية مع الحفاظ على تعقيد مشابه لخوارزمية ADAM.

Roger Hsiao, Yuchen Fang, Xiangru Huang, Ruilong Li, Hesam Rabeti, Zan Gojcic, Javad Lavaei, James Demmel, Sophia Shao2026-02-03
🤖 machine learning

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

تعالج هذه الورقة نقص بيانات التقييم البصري لمراقبة سلامة المختبرات ذاتية القيما عبر تقديم مسار لتوليد مجموعات البيانات الاصطناعية واقتراح طريقة محاذاة موجهة بمخطط المشهد، مما يحسن بشكل كبير قدرة النماذج اللغوية البصرية على اكتشاف المخاطر في الإعدادات البصرية فقط.

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chen (…)2026-02-03
🤖 AI

Text is All You Need for Vision-Language Model Jailbreaking

تقدم هذه الورقة البحثية Text-DJ، وهو هجوم اختراق جديد يتجاوز ضمانات السلامة في النماذج اللغوية البصرية الكبيرة عن طريق تحويل النصوص الضارة إلى شبكة من الصور التي تحتوي على استعلامات فرعية حميدة مبعثرة ومشتتات غير ذات صلة، مما يستغل قدرات التعرف الضوئي على الحروف (OCR) لدى النماذج وعدم قدرتها على الربط بين المدخلات متعددة الوسائط المجزأة.

Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh2026-02-03
🤖 machine learning

DISK: Dynamic Inference SKipping for World Models

تقدم الورقة البحثية DISK، وهي طريقة استدلال تكيفية لا تتطلب تدريباً، تستخدم وحدات تحكم ثنائية الفرع وقرارات تخطي عبر الوسائط لتحقيق تسريع بمقدار ضعفين في انتشار المسار و1.6 ضعف في انتشار الفيديو لنماذج العالم ذاتية الانحدار مع الحفاظ على دقة التنبؤ والجودة البصرية.

Anugunj Naman, Gaibo Zhang, Ayushman Singh, Yaguang Zhang2026-02-03
🤖 AI

Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models

تقترح الورقة البحثية SparseCut، وهي بنية مبتكرة تعزز النماذج اللغوية الكبيرة متعددة الوسائط من خلال إدخال اتصالات اختصار متفرقة ووحدة دمج متعددة الحبيبات لدمج الميزات المرئية الهرمية بكفاءة دون زيادة العبء الحسابي أو طول المدخلات.

Jingrui Zhang, Feng Liang, Yong Zhang, Wei Wang, Runhao Zeng, Xiping Hu2026-02-03
🤖 machine learning

NPNet: A Non-Parametric Network with Adaptive Gaussian-Fourier Positional Encoding for 3D Classification and Segmentation

تُعد NPNet شبكة سحابة نقاط ثلاثية الأبعاد غير معلمية بالكامل تحقق أداءً قويًا في التصنيف والتقسيم، لا سيما في إعدادات التعلم من أمثلة قليلة، وذلك من خلال استخدام مؤثرات حتمية وتشفير موضعي غاوسي-فورييري تكيُّفي للتعامل مع المقاييس والكثافات المتغيرة دون أوزان متعلمة.

Mohammad Saeid, Amir Salarpour, Pedram MohajerAnsari, Mert D. Pesé2026-02-03