← नवीनतम पेपर
🤖 AI

A Unified Framework for Trajectory Prediction with Explicit Planning and Reaction Decomposition

यह शोध पत्र INTraJ का प्रस्ताव करता है, जो एक एकीकृत प्रक्षेपवक्र पूर्वानुमान ढांचा (trajectory prediction framework) है जो सामाजिक प्रभाव को संदर्भ प्रक्षेपवक्रों को उत्पन्न करने के लिए एक योजना चरण और स्थानीय समायोजन के लिए एक प्रतिक्रिया चरण में विभाजित करता है, जिससे चरणबद्ध सामाजिक मॉडलिंग की महत्वपूर्ण भूमिका को प्रमाणित करते हुए कई बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त किया गया है।

मूल लेखक: Jiaheng Chen, Jiaxing Li, Tinghe Zhang, Chaopeng Guo

प्रकाशित 2026-08-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaheng Chen, Jiaxing Li, Tinghe Zhang, Chaopeng Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह अनुमान लगाने की कोशिश कर रहे हैं कि आपका एक दोस्त पाँच मिनट में कहाँ होगा। यदि आप केवल यह देखते हैं कि वह अभी कहाँ चल रहा है, तो आप अनुमान लगा सकते हैं कि वह सीधा चलता रहेगा। लेकिन यदि आप देखते हैं कि एक कुत्ता उनकी ओर दौड़कर आ रहा है, या दोस्तों का एक समूह हाथ हिलाकर बुला रहा है, तो आपका अनुमान बदल जाता है। आप अनुमान लगाते हैं कि कुत्ता उन्हें रोकने की कोशिश कर सकता है, या दोस्त उन्हें मुड़ने के लिए प्रेरित कर सकते हैं। यही ट्रैजेक्टरी प्रेडिक्शन (trajectory prediction) का मूल है, जो कंप्यूटर विज्ञान का एक ऐसा क्षेत्र है जो चलती हुई चीजों, जैसे हाईवे पर कारों या किसी व्यस्त चौक पर लोगों के भविष्य के रास्तों का अनुमान लगाने की कोशिश करता है। यह केवल गणित के बारे में नहीं है; यह इस बारे में है कि कैसे एक चलती हुई वस्तु दूसरी वस्तुओं के प्रति प्रतिक्रिया करती है। सेल्फ-ड्राइविंग कारों के सुरक्षित होने के लिए, वे केवल रोबोट की तरह दुनिया को अनदेखा करते हुए नहीं चल सकतीं; उन्हें यह "सोचना" होगा कि अन्य ड्राइवरों और पैदल यात्रियों की गतिविधियाँ कैसी होंगी, और उन गतिविधियों से उनके अपने पथ में क्या बदलाव आएंगे। सबसे बड़ी चुनौती यह figuring out करना रही है कि कंप्यूटर को एक साथ बहुत अधिक विवरणों से भ्रमित हुए बिना इस तरह की सामाजिक सोच विकसित करने के लिए कैसे सिखाया जाए।

यहाँ INTraJ आता है, जो शोधकर्ताओं द्वारा प्रस्तावित एक नया फ्रेमवर्क है जो सुझाव देता है कि हम इस समस्या को गलत तरीके से देख रहे थे। पूरे भविष्य के पथ को एक ही विशाल, अव्यवस्थित मस्तिष्क-विस्फोट (brain-burst) के रूप में देखने के बजाय, INTraJ इसे दो अलग-अलग चरणों में तोड़ने का सुझाव देता है: योजना बनाना (Planning) और प्रतिक्रिया देना (Reaction)। इसे एक रोड ट्रिप की योजना बनाने की तरह समझें। पहले, आप मानचित्र देखते हैं और अपना सामान्य मार्ग तय करते हैं ("योजना")। आप जानते हैं कि आपको शहर A से शहर B तक जाना है, और आपने ट्रैफिक रिपोर्ट भी देख ली है कि बड़े जाम कहाँ हो सकते हैं। यह आपकी "सामाजिक योजना" (socialized plan) है। लेकिन एक बार जब आप वास्तव में गाड़ी चला रहे होते हैं, तो आप केवल मानचित्र के भरोसे नहीं रह सकते। यदि कोई गिलहरी आपकी कार के सामने आ जाती है, तो आप रास्ता बदलते हैं। यदि निर्माण कार्य के कारण कोई लेन बंद है, तो आप दूसरी लेन में चले जाते हैं। ये आपकी "प्रतिक्रियाएं" (Reactions) हैं।

पेपर का तर्क है कि अधिकांश वर्तमान कंप्यूटर मॉडल मानचित्र पढ़ने और अचानक रास्ता बदलने, दोनों को एक ही समय में करने की कोशिश करते हैं, जिससे वे अव्यवस्थित और त्रुटियों के प्रति संवेदनशील हो जाते हैं। INTraJ इन दोनों को अलग करके इस समस्या को ठीक करता है। यह पहले एक "सामाजिक इरादा" (Socialized Intent) बनाता है—एक सुचारू, आदर्श पथ, जिस पर एजेंट (जैसे कार या व्यक्ति) तब जाएगा यदि वह दूसरों की भविष्य की गतिविधियों के बारे में पहले से सोच ले। फिर, यह इसके ऊपर एक "प्रतिक्रिया" (Reaction) परत जोड़ता है, जो उन त्वरित, स्थानीय समायनों को संभालती है जिनकी आवश्यकता तब होती है जब चीजें बिल्कुल योजना के अनुसार नहीं होती हैं।

शोधकर्ताओं ने चार अलग-अलग डेटासेट्स पर इस विचार का परीक्षण किया, जिसमें वास्तविक दुनिया का ड्राइविंग डेटा (Argoverse 2) और भीड़ की गति का डेटा (जैसे शहर में चलते लोग) शामिल था। उन्होंने पाया कि प्रक्रिया को "योजना बनाकर फिर प्रतिक्रिया देने" में विभाजित करके, कंप्यूटर ने बहुत बेहतर भविष्यवाणियां कीं। विशेष रूप से, अंतिम भविष्यवाणियां अधिक सटीक थीं, खासकर लंबी अवधि के अनुमानों के लिए (जैसे कि 1 सेकंड के बजाय 5 सेकंड में कोई व्यक्ति कहाँ होगा)। भीड़भाड़ वाले शहर के डेटासेट्स में, इस नई पद्धति ने अंतिम भविष्यवाणी की त्रुटि को काफी कम कर दिया, जिससे एक डेटासेट पर औसत त्रुटि घटकर 9.87 पिक्सेल रह गई और दूसरे पर दीर्घकालिक सटीकता में 12% से अधिक सुधार हुआ। यहाँ तक कि अधिक प्रभावशाली बात यह है कि यह "दो-चरणीय" दृष्टिकोण उतना ही प्रभावी रहा चाहे कंप्यूटर एक साथ कई कारों के पथ की भविष्यवाणी कर रहा हो या भीड़ में केवल एक व्यक्ति की।

यह पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि सामाजिक प्रभाव केवल सूचना का एक एकल, उलझा हुआ जाल है जिसे एक साथ संसाधित करने की आवश्यकता है। इसके बजाय, यह सुझाव देता है कि सामाजिक प्रभाव अलग-अलग समय पर अलग-अलग भूमिकाएँ निभाता है: पहले, यह बड़ी तस्वीर वाली योजना को आकार देता है, और दूसरा, यह त्वरित स्थानीय सुधारों को ट्रिगर करता है। लेखक इन परिणामों को लेकर आश्वस्त हैं क्योंकि उन्होंने कई अलग-अलग कंप्यूटर "बैकबोन्स" (वे इंजन जो गणित का काम करते हैं) पर इस पद्धति का परीक्षण किया और हर बार निरंतर सुधार देखा। उन्होंने यह भी दिखाया कि यह विधि मजबूत है; भले ही कंप्यूटर का यह अनुमान थोड़ा गलत हो कि अन्य लोग क्या करेंगे (जैसे कि वह सोचता है कि एक कार बाएं मुड़ेगी जबकि वह वास्तव में सीधी जाती है), INTraJ सिस्टम क्रैश नहीं होता है। यह गलती को सहजता से संभालता है, अपनी योजना को बिना बिखेरे समायोजित करता है।

संक्षेप में, INTraJ कंप्यूटरों को बेहतर तरीके से "सामाजिक" होना सिखाता है, उन्हें कार्य करने से पहले आगे की सोचने के लिए प्रशिक्षित करके। यह कुछ ऐसा है जैसे किसी छात्र को कहना, "केवल आने वाले प्रश्नों पर प्रतिक्रिया न दें; पहले पूरी परीक्षा पढ़ें, एक योजना बनाएं, और फिर कठिन हिस्सों को हल करें।" बड़ी तस्वीर को छोटे विवरणों से अलग करके, शोधकर्ताओं ने एक तरीका खोजा है जिससे भविष्य के स्वायत्त ड्राइविंग और भीड़ विश्लेषण के लिए ट्रैजेक्टरी प्रेडिक्शन अधिक सुचारू, सुरक्षित और विश्वसनीय बन सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →