← नवीनतम पेपर
🤖 machine learning

Heteroscedastic Diffusion for Multi-Agent Trajectory Modeling

यह शोध पत्र U2Diffine को प्रस्तुत करता है, जो एक एकीकृत डिफ्यूजन मॉडल है जो चार स्पोर्ट्स डेटासेट्स पर अत्याधुनिक विधियों से बेहतर प्रदर्शन करते हुए, स्टेट-वाइज हेटेरोसेडास्टिक अनसर्टेंटी एस्टीमेट्स और जेनरेटेड मोड्स के लिए एरर प्रोबेबिलिटी रैंकिंग प्रदान करते हुए, मल्टी-एजेंट ट्रेजेक्टरी कंप्लीशन और फोरकास्टिंग को एक साथ निष्पादित करता है।

मूल लेखक: Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अराजक बास्केटबॉल खेल देख रहे हैं। खिलाड़ी दौड़ रहे हैं, पास दे रहे हैं और एक-दूसरे से बच रहे हैं। अब, कल्पना कीजिए कि आप एक कोच हैं जो यह अनुमान लगाने की कोशिश कर रहे हैं कि अगले कुछ सेकंड में हर कोई कहाँ होगा। या, कल्पना कीजिए कि आप एक वीडियो एडिटर हैं जो एक ग्लिच वाली रिकॉर्डिंग को ठीक करने की कोशिश कर रहे हैं जहाँ कैमरे ने थोड़े समय के लिए एक खिलाड़ी को ट्रैक करना छोड़ दिया था, और आपको उस वीडियो को फिर से सुचारू बनाने के लिए "लापता फ्रेमों को भरने" की आवश्यकता है।

यह पेपर एक नए कंप्यूटर मस्तिष्क (एक AI मॉडल) से परिचय कराता है जिसे U2Diffine (और इसका तेज़ संस्करण, U2Diff) कहा जाता है, जिसे ठीक यही काम करने के लिए डिज़ाइन किया गया है: एक ही समय में कई लोगों (या वस्तुओं) के मूवमेंट पाथ (गति पथ) का अनुमान लगाना और उन्हें सुधारना।

यहाँ उन्होंने क्या किया, इसका सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: भविष्य (और अतीत) का अनुमान लगाना

अधिकांश AI मॉडल जो मूवमेंट का अनुमान लगाते हैं, वे भविष्यवक्ताओं की तरह होते हैं जो भविष्य का अनुमान लगाने के लिए केवल अतीत को देखते हैं। वे कहते हैं, "जहाँ आप थे, उसके आधार पर, आप यहाँ होंगे।"

  • दोष: वे अक्सर "क्या हो सकता है" (what ifs) को अनदेखा कर देते हैं। एक वास्तविक खेल में, एक खिलाड़ी रुक सकता है, मुड़ सकता है या ब्लॉक किया जा सकता है। AI आमतौर पर केवल एक "सर्वश्रेष्ठ अनुमान" वाला पथ, या कुछ यादृच्छिक (random) अनुमान देता है, बिना आपको यह बताए कि वह उन अनुमानों में कितना "आश्वस्त" है।
  • लापता कड़ी: यदि AI अनिश्चित है, तो उसे कहना चाहिए, "मैं निश्चित नहीं हूँ, रास्ता इस बड़े घेरे में कहीं भी हो सकता है।" यदि वह आश्वस्त है, तो उसे कहना चाहिए, "मैं बहुत आश्वस्त हूँ, रास्ता यह छोटी सी रेखा है।" इस पेपर में इसे "अनिश्चितता" (uncertainty) कहा गया है।

2. समाधान: "अनिश्चितता-जागरूक" डिफ्यूजन मॉडल

लेखकों ने डिफ्यूजन मॉडल्स पर आधारित एक प्रणाली बनाई है। डिफ्यूजन को मिट्टी के साथ काम करने वाले मूर्तिकार की तरह समझें।

  • प्रक्रिया: कल्पना कीजिए कि आपके पास एक आदर्श मूर्ति है (वास्तविक मूवमेंट पथ)। AI पहले उसे शोर (noise/static) के एक ढेर में बदल देता है। फिर, यह सीखता है कि उस शोर को धीरे-धीरे वापस एक मूर्ति में कैसे बदला जाए, चरण-दर-चरण।
  • ट्विस्ट: आमतौर पर, मूर्तिकार केवल मूर्ति को सही दिखाने की कोशिश करता है। लेखकों ने अपने मूर्तिकार को यह भी सिखाया कि हर चरण में अपने हाथ के हिलने या डगमगाने (shakiness) का मानसिक नोट कैसे रखा जाए।
    • यदि हाथ डगमगा रहा है, तो AI पथ के चारों ओर एक बड़ा, धुंधला बादल बना देता है।
    • यदि हाथ स्थिर है, तो वह एक सटीक, सीधी रेखा खींचता है।
  • परिणाम: AI आपको केवल एक पथ नहीं देता; यह एक पथ साथ ही एक "कॉन्फिडेंस मैप" देता है जो दिखाता है कि भविष्यवाणी कहाँ जोखिम भरी है और कहाँ सुरक्षित है।

3. दो संस्करण: "परिशुद्धता" बनाम "रफ़्तार"

लेखकों ने अलग-अलग जरूरतों के लिए इस AI के दो संस्करण बनाए हैं:

  • U2Diffine (परिशुद्ध मूर्तिकार): यह संस्करण बहुत सावधान है। यह यह गणना करने के लिए जटिल गणित (जिसे "फर्स्ट-ऑर्डर टेलर एप्रोक्सिमेशन" कहा जाता है) का उपयोग करता है कि अनिश्चितता शोर से वास्तविक दुनिया में वापस कैसे फैलती है। यह एक मास्टर मूर्तिकार की तरह है जो हर मिलीमीटर को मापता है। यह सबसे सटीक है लेकिन इसे चलाने में अधिक समय लगता है।
  • U2Diff (रफ़्तार वाला): यह संस्करण समय बचाने के लिए जटिल गणित को छोड़ देता है। यह भारी गणनाएं किए बिना अनिश्चितता के बारे में एक स्मार्ट अनुमान लगाता है। यह अपने परिशुद्ध संस्करण की तुलना में लगभग 4 गुना तेज़ है और पथ का अनुमान लगाने में लगभग उतना ही अच्छा है, हालांकि "कॉन्फिडेंस मैप" पर थोड़ा कम सटीक है।

4. "रैंकिंग" सहायक (RankNN)

कभी-कभी, AI 20 अलग-अलग संभावित भविष्य (20 अलग-अलग "क्या हो सकता है" वाले परिदृश्य) उत्पन्न करता है। आप कैसे जानेंगे कि कौन सा सबसे अधिक संभावित है?

  • पुराना तरीका: आप शायद केवल उसे चुन सकते हैं जो सबसे "सुचारू" (smooth) दिखता है।
  • नया तरीका (RankNN): लेखकों ने एक विशेष "जज" (एक न्यूरल नेटवर्क) जोड़ा है जो सभी 20 परिदृश्यों को देखता है और प्रत्येक को "गलत होने की कितनी संभावना है" का स्कोर देता है।
  • उपमा: कल्पना कीजिए कि एक स्पोर्ट्स एनालिस्ट 20 अलग-अलग गेम रीप्ले देख रहा है। केवल अनुमान लगाने के बजाय, यह एनालिस्ट खिलाड़ियों की गतिविधियों और भविष्यवाणी की "डगमगाहट" को देखता है और कहता है, "परिदृश्य #3 के सही होने की 90% संभावना है, जबकि परिदृश्य #15 शायद गलत है।" यह स्वचालित रूप से सबसे अच्छी भविष्यवाणी चुनने में मदद करता है।

5. उन्होंने इसका परीक्षण कहाँ किया?

उन्होंने इसका परीक्षण मेडिकल डेटा या सेल्फ-ड्राइविंग कारों पर नहीं किया (जब तक कि पेपर में ऐसा न कहा गया हो, जो कि नहीं कहा गया है)। उन्होंने इसे सख्ती से स्पोर्ट्स डेटा पर परखा:

  • बास्केटबॉल: 10 खिलाड़ियों और एक गेंद को ट्रैक करना।
  • फुटबॉल (अमेरिकन): 22 खिलाड़ियों और एक गेंद को ट्रैक करना।
  • सॉकर (फुटबॉल): 22 खिलाड़ियों और एक गेंद को ट्रैक करना।

6. बड़ी जीत

पेपर का दावा है कि उनकी विधि दो मुख्य तरीकों से वर्तमान सर्वोत्तम तरीकों (State-of-the-Art) से बेहतर है:

  1. सटीकता: यह खिलाड़ियों के स्थान का अधिक सटीक अनुमान लगाती है, विशेष रूप से जब वीडियो के लापता हिस्सों को "ठीक करने" (trajectory completion) की कोशिश की जाती है।
  2. विश्वसनीयता: यह जानने में बहुत बेहतर है कि वह कब अनिश्चित है। यदि AI कहता है "मैं निश्चित नहीं हूँ," तो इसका मतलब आमतौर पर यह होता है कि स्थिति वास्तव में अराजक या अनुमान लगाने में कठिन है। यह सिस्टम को स्पोर्ट्स वीडियो फुटेज को ठीक करने जैसे वास्तविक दुनिया के अनुप्रयोगों के लिए अधिक भरोसेमंद बनाता है।

संक्षेप में: उन्होंने कंप्यूटर के लिए खेल देखने, खिलाड़ियों की गति का अनुमान लगाने और टूटे हुए वीडियो रिकॉर्डिंग को ठीक करने का एक स्मार्ट तरीका बनाया है, और साथ ही ईमानदारी से यह भी बताता है कि वह कब केवल अनुमान लगा रहा है और कब वह आश्वस्त है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →