💬 NLP

SpikeLogBERT: Energy-Efficient Log Parsing Using Spiking Transformer Networks

SpikeLogBERT एक ऊर्जा-कुशल लॉग पार्सिंग फ्रेमवर्क है जो स्पार्स, इवेंट-ड्रिवन कंप्यूटेशन के माध्यम से सैद्धांतिक ऊर्जा खपत को महत्वपूर्ण रूप से कम करते हुए, HDFS डेटासेट पर अत्याधुनिक सटीकता प्राप्त करने के लिए स्पाइकिंग ट्रांसफॉर्मर आर्किटेक्चर को BERT नॉलेज डिस्टिलेशन के साथ एकीकृत करता है।

Thuan Bui, Duong Do, Tung Vu, Duc-Tho Mai, Cong-Kha Pham2026-07-01
🤖 AI

Real-Time Source-Free Object Detection

यह शोध पत्र RT-SFOD को प्रस्तुत करता है, जो YOLOv10 पर आधारित एक रियल-टाइम सोर्स-फ्री ऑब्जेक्ट डिटेक्शन फ्रेमवर्क है, जो एक नवीन ड्यूल-हेड स्यूडो-लेबल फ्यूजन रणनीति और मल्टी-स्केल एडेप्टिव रिप्रेजेंटेशन डाइवर्सिफिकेशन लॉस का उपयोग करके ड्यूल-हेड डिटेक्टर्स में वैनिला सेल्फ-ट्रेनिंग की सीमाओं को दूर करते हुए, मौजूदा तरीकों की तुलना में काफी अधिक थ्रूपुट और कम पैरामीटर्स के साथ स्टेट-ऑफ-द-आर्ट अडैप्टेशन सटीकता प्राप्त करता है।

Sairam VCR, Varun Gopal, Poornima Jain, Vineeth N Balasubramanian, Muhammad Haris Khan2026-07-01
💻 computer science

SENSE-VAD: Sentient and Semantic Video Anomaly Detection for Autonomous Driving

यह शोध पत्र SENSE-VAD को प्रस्तुत करता है, जो स्वायत्त ड्राइविंग (ऑटोनॉमस ड्राइविंग) के लिए पहला सिंथेटिक बेंचमार्क है जो विशेष रूप से सामाजिक रूप से जटिल वीडियो विसंगतियों—जैसे कि वे अंतर-एजेंट संबंध जो गति-आधारित पहचान को चुनौती देते हैं—को लक्षित करता है, और यह विविध परिदृश्यों को उत्पन्न करने के लिए CARLA और Unreal Engine का लाभ उठाता है तथा यह प्रदर्शित करता है कि वर्तमान अत्याधुनिक विधियाँ इस विशिष्ट चुनौती का समाधान करने में विफल रहती हैं।

Nghia T. Nguyen, Lokman Bekit, Yasin Yilmaz2026-07-01
💻 computer science

DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation

ड्राइववीवर (DriveWeaver) स्वायत्त ड्राइविंग सिमुलेशन के लिए एक नवीन ढांचा है जो पॉइंट-कंडीशन्ड वीडियो इनपेंटिंग और एक ग्लोबल-टू-लोकल पदानुक्रमित रणनीति का लाभ उठाता है ताकि उच्च गुणवत्ता वाले, टेम्पोरल रूप से सुसंगत और ज्यामितीय रूप से सटीक वाहन सम्मिलन को निर्बाध प्रकाश एकीकरण के साथ उत्पन्न किया जा सके, जिससे पूर्व-पुनर्निर्मित 3D संपत्तियों पर निर्भर किए बिना स्केलेबल सीन ऑगमेंटेशन सक्षम हो सके।

Junzhe Jiang, Zipei Ma, Zijie Pan, Li Zhang2026-07-01
💻 computer science

DEMUN: Fast and accurate discovery of music notation in very large collections

यह शोध पत्र DEMUN प्रस्तुत करता है, जो एक तेज़ और अत्यधिक सटीक दो-चरणीय डिटेक्टर है जो विशाल, गैर-विशिष्ट पुस्तकालय संग्रहों के भीतर विरल संगीत नोटेशन की पहचान करने में सक्षम है, जिसने चार मिलियन छवियों के डेटासेट से हजारों पहले से अज्ञात दस्तावेजों को सफलतापूर्वक खोज निकाला है।

Vojtěch Dvořák, Filip Bím, Jiří Mayer, Martina Dvořáková, Markéta Herzanová Vlková, Pavel Pecina, Petr Žabička, Jan Haji (…)2026-07-01
💻 computer science

AnyBokeh: Physics-Guided Any-to-Any Bokeh Editing with Optical Fingerprint Transfer

AnyBokeh एक भौतिकी-निर्देशित (physics-guided) ढांचा है जो साइनेड सर्कल-ऑफ-कन्फ्यूजन (signed circle-of-confusion) और डिस्पैरिटी मैप्स के माध्यम से स्रोत ऑप्टिकल विशेषताओं का अनुमान लगाकर, ऑप्टिकल फिंगरप्रिंट्स को स्थानांतरित करने और सापेक्ष ब्लर को संश्लेषित करने के माध्यम से एकल छवि से नियंत्रणीय एनी-टू-एनी (any-to-any) बोकेह संपादन सक्षम करता है, जिससे पारंपरिक ऑल-इन-फोकस पुनर्निर्माण पाइपलाइनों के आर्टिफैक्ट्स और सीमाओं से बचा जा सकता है।

Xinyu Hou, Xiaoming Li, Zongsheng Yue, Chen Change Loy2026-07-01
💻 computer science

Planar-SfM: Camera Pose Estimation via Homography Graph Embeddings

यह शोध पत्र Planar-SfM को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो होमोग्राफी-आधारित पोज़ अनुमानों और एक स्पेक्ट्रल ग्राफ एम्बेडिंग दृष्टिकोण का लाभ उठाकर स्ट्रक्चर फ्रॉम मोशन में प्लेनर दृश्यों की चुनौती को एक लाभ में बदल देता है ताकि अत्यधिक प्लेनर और सामान्य 3D वातावरण दोनों में कैमरा पोज़ को मजबूती से रिकवर किया जा सके।

Gabi Pragier, Matan Karklinsky, David Ungarish, Avi Ben-Cohen2026-07-01
🤖 AI

LUNA: Learning Universal 3D Human Animation Beyond Skinning

LUNA एक नवीन, LBS-मुक्त न्यूरल एनिमेशन मॉडल है जो विविध 2D इनपुट्स को सीधे फोटोयलिस्टिक 3D मानव एनिमेशन में मैप करने के लिए एक ट्रांसफार्मर-आधारित मोशन रिग्रेसर और हाइब्रिड सुपरविजन का लाभ उठाता है, जो स्पष्ट बॉडी फिटिंग पर निर्भर किए बिना विभिन्न पहचानों (identities) में ज़ीरो-शॉट जनरलाइजेशन प्राप्त करता है।

Peng Li, Rawal Khirodkar, Junxuan Li, Yuan Dong, Chen Cao, Yuan Liu, Wenhan Luo, Yike Guo, Shunsuke Saito2026-07-01
💻 computer science

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

CoLT एक नवीन ढांचा है जो विस्तृत टेक्स्ट-आधारित चेन-ऑफ-थॉट रीजनिंग को कुशल, स्टेप-लेवल लेटेंट थॉट रिप्रेजेंटेशन्स से बदलकर मल्टी-मोडल लार्ज लैंग्वेज मॉडल्स को बेहतर बनाता है, जो एक ऐसी प्रशिक्षण रणनीति के माध्यम से महत्वपूर्ण इन्फरेंस स्पीडअप और श्रेष्ठ प्रदर्शन प्राप्त करता है जो द्विदिश पर्यवेक्षण (bidirectional supervision) के लिए एक हल्के बाहरी डिकोडर का उपयोग करती है जबकि इन्फरेंस के दौरान इसे हटा दिया जाता है।

Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu2026-07-01
🤖 machine learning

Automated Background Swapping for Robustness against Spurious Backgrounds

यह शोध पत्र ऑटोमेटेड बैकग्राउंड स्वैपिंग (AutoBackSwap) को प्रस्तुत करता है, जो एक डेटा ऑग्मेंटेशन विधि है जो फोरग्राउंड को बैकग्राउंड से अलग करती है और नए बैकग्राउंड को सिंथेसाइज करती है ताकि उन क्लासिफायरों को प्रशिक्षित किया जा सके जो स्पूरियस बैकग्राउंड सहसंबंधों के विरुद्ध सुदृढ़ हों, भले ही मूल प्रशिक्षण डेटा में कोई काउंटर-एग्जांपल मौजूद न हो।

Cesar Roder, Kajetan Schweighofer2026-07-01