← नवीनतम पेपर
💻 computer science

Three-Step Hierarchical Transformer for Multi-Pedestrian Trajectory Prediction

यह शोध पत्र एक तीन-चरणीय पदानुक्रमित (hierarchical) ट्रांसफॉर्मर का प्रस्ताव करता है जो स्केलेबिलिटी और व्याख्यात्मकता में सुधार करते हुए वास्तविक दुनिया के डेटासेट पर अत्याधुनिक पैदल यात्री प्रक्षेपवक्र (trajectory) भविष्यवाणी प्रदर्शन प्राप्त करने के लिए टेम्पोरल एनकोडिंग, मल्टीमॉडल फ्यूजन और सोशल इंटरेक्शन रीजनिंग को स्पष्ट रूप से अलग करता है।

मूल लेखक: Raphaël Delécluse, Hazem Wannous, Laurent Grisoni, Laurent Guimas

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Raphaël Delécluse, Hazem Wannous, Laurent Grisoni, Laurent Guimas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रेलवे स्टेशन में खड़े हैं, और आपको यह अनुमान लगाने की कोशिश करनी है कि कोई विशिष्ट व्यक्ति अगले कुछ सेकंड में कहाँ होगा। इसे अच्छी तरह से करने के लिए, आपको तीन अलग-अलग चीजों को देखना होगा:

  1. वे अभी कैसे चल रहे हैं (क्या वे तेज़ चल रहे हैं? क्या वे रुक रहे हैं?)।
  2. उनके शरीर की भाषा (body language) क्या कहती है (क्या वे अपना सिर घुमा रहे हैं? क्या उन्होंने एक सूटकेस पकड़ा हुआ है जो यह संकेत देता है कि वे रुक सकते हैं?)।
  3. उनके आस-पास के अन्य लोग क्या कर रहे हैं (क्या भीड़ उनका रास्ता रोक रही है? क्या कोई दोस्त उन्हें बुला रहा है?)।

अधिकांश कंप्यूटर प्रोग्राम जो ऐसा अनुमान लगाने की कोशिश करते हैं, वे बहुत अधिक बोझिल हो जाते हैं। वे इन तीनों चीजों को एक साथ देखने की कोशिश करते हैं, जिससे गणित जटिल, धीमा और समझने में कठिन हो जाता है।

यह पेपर एक नया कंप्यूटर मॉडल पेश करता है जिसे थ्री-स्टेप हिरार्किकल ट्रांसफॉर्मर (Three-Step Hierarchical Transformer) कहा जाता है। इसे एक टीम के रूप में सोचें जिसमें तीन विशेषज्ञ जासूस एक लाइन में काम कर रहे हैं, न कि एक ऐसे जासूस के रूप में जो सब कुछ एक साथ करने की कोशिश कर रहा है।

तीन-चरणीय जासूस टीम (The Three-Step Detective Team)

चरण 1: "मोशन ट्रैकर" (टेम्पोरल एनकोडर - Temporal Encoder)
सबसे पहले, मॉडल केवल उस व्यक्ति के अब तक के पथ (path) को देखता है। यह उनकी बॉडी लैंग्वेज और अन्य लोगों को अनदेखा कर देता है। यह एक धावक की तरह है जो केवल ट्रैक को देखता है।

  • यह क्या करता है: यह पूछता है, "पिछले कुछ सेकंड में इस व्यक्ति जहाँ भी रहा है, उसके आधार पर वह आगे कहाँ जा सकता है?"
  • उपमा (Analogy): कल्पना कीजिए कि एक मौसम विज्ञानी जो केवल हवा की गति को देखता है। वे भविष्यवाणी कर सकते हैं कि तूफान आ रहा है या नहीं, लेकिन उन्हें यह नहीं पता कि बारिश हो रही है या नहीं। यह चरण भविष्य के पथ का एक "कच्चा मसौदा" (rough draft) तैयार करता है।

चरण 2: "बॉडी लैंग्वेज रीडर" (मोडैलिटी डिकोडर - Modality Decoder)
इसके बाद, मॉडल उस कच्चे मसौदे को अतिरिक्त सुरागों का उपयोग करके परिष्कृत (refine) करता है। यह व्यक्ति की मुद्रा (pose) (क्या वे अपना सिर बाईं ओर घुमा रहे हैं?), उनके बाउंडिंग बॉक्स (वे कितने बड़े दिख रहे हैं?), या अन्य दृश्य विवरणों को देखता है।

  • यह क्या करता है: "मोशन ट्रैकर ने कहा कि वे सीधे जाएंगे, लेकिन देखो! वे अपना सिर बाईं ओर घुमा रहे हैं। चलिए पथ को थोड़ा बदलते हैं।"
  • उपमा: यह एक ऐसे जासूस की तरह है जो एक संदिग्ध को नक्शा पकड़े हुए देखता है। भले ही संदिग्ध सीधा चल रहा था, लेकिन नक्शा बताता है कि वह किसी कोने पर रुक सकता है। मॉडल बहुत अधिक डेटा में उलझे बिना इन शारीरिक संकेतों को जल्दी से समझने के लिए एक "स्मार्ट सारांश" (एक हल्का GRU) का उपयोग करता है।

चरण 3: "क्राउड मैनेजर" (सीन ट्रांसफॉर्मर - Scene Transformer)
अंत में, मॉडल पूरे दृश्य को देखता है। यह लक्षित व्यक्ति के परिष्कृत पथ को भीड़ में मौजूद अन्य सभी के पथों के साथ तुलना करता है।

  • यह क्या करता है: "यदि यह व्यक्ति बाईं ओर जाता है, तो क्या वह किसी से टकरा जाएगा? क्या लोगों का वह समूह एक साथ चल रहा है?" यह सुनिश्चित करने के लिए पथ को समायोजित करता है कि व्यक्ति दीवार या किसी मित्र से न टकरा जाए।
  • उपमा: यह एक ऑर्केस्ट्रा के कंडक्टर की तरह है। कंडक्टर केवल एक वायलिन को नहीं सुनता; वह यह भी सुनता है कि वायलिन ड्रम और बांसुरी के साथ कैसे फिट बैठता है। यदि ड्रम तेज़ होते हैं, तो वायलिन को शायद धीमा बजने की आवश्यकता हो सकती है। यहाँ, मॉडल यह सुनिश्चित करता है कि व्यक्ति का पथ पूरी भीड़ के संदर्भ में सही हो।

यह डिज़ाइन क्यों विशेष है

1. यह कुशल है (ऊर्जा बचाता है)
यदि आप तीनों चरणों को एक साथ करने की कोशिश करते (समय, बॉडी लैंग्वेज और पूरी भीड़ को एक साथ देखना), तो कंप्यूटर को बहुत अधिक गणित करना पड़ता, जैसे कि एक विशाल पहेली को हल करने की कोशिश करना जहाँ हर टुकड़ा दूसरे टुकड़े से जुड़ा हुआ है। यह बहुत धीमा और महंगा हो जाता है।

  • पेपर का दावा: इसे तीन चरणों में तोड़कर, मॉडल केवल तभी भारी गणित करता है जब इसकी आवश्यकता होती है। यह डाक छाँटने जैसा है: पहले देश के अनुसार, फिर शहर के अनुसार, फिर गली के अनुसार। यह एक ही बार में हर पत्र को हर संभावित पते के लिए छाँटने की तुलना में बहुत तेज़ है।

2. यह लचीला है (लापता जानकारी को संभालता है)
कभी-कभी कैमरा किसी व्यक्ति का चेहरा मिस कर सकता है, या वीडियो धुंधला हो सकता है।

  • पेपर का दावा: क्योंकि चरण अलग-अलग हैं, यदि "बॉडी लैंग्वेज" चरण कोई सुराग मिस कर देता है, तो मॉडल अभी भी एक अच्छा अनुमान लगाने के लिए "मोशन ट्रैकर" और "क्राउड मैनेजर" चरणों का उपयोग कर सकता है। यह केवल इसलिए क्रैश नहीं होता क्योंकि जानकारी का एक हिस्सा गायब है।

3. यह स्पष्ट है (समझने में आसान)
चूंकि चरण अलग-अलग हैं, शोधकर्ता मॉडल को देख सकते हैं और कह सकते हैं, "आह, त्रुटि चरण 2 में हुई थी, चरण 3 में नहीं।" इससे इसे ठीक करना और सुधारना आसान हो जाता है।

परिणाम: क्या यह काम कर गया?

लेखकों ने इस "तीन-चरणीय टीम" का परीक्षण तीन अलग-अलग डेटासेट्स (सिम्युलेटेड वीडियो गेम्स और शहरों एवं घरों के अंदर चलते लोगों के वास्तविक वीडियो) पर किया।

  • परिणाम: मॉडल ने लगभग सभी मौजूदा तरीकों से बेहतर प्रदर्शन किया। यह विशेष रूप से यह भविष्यवाणी करने में अच्छा था कि लोग कहाँ पहुँचेंगे (Final Displacement Error) और औसत रूप से वे कितनी दूर भटक गए (Average Displacement Error)।
  • वास्तविक दुनिया का प्रमाण: यह न केवल आदर्श, साफ-सुथले सिमुलेशन में, बल्कि भीड़भाड़ वाले, वास्तविक दुनिया के वातावरण (जैसे JRDB और Urban डेटासेट) में भी अच्छी तरह से काम करता है।
  • विशिष्ट जीत: पेपर नोट करता है कि मॉडल "अर्ली टर्निंग" (जल्दी मुड़ने वाले) व्यवहारों को पहचानने में विशेष रूप से अच्छा है—यानी, बॉडी लैंग्वेज के सुरागों की मदद से, यह भविष्यवाणी करना कि कोई वास्तव में मुड़ने से पहले ही मुड़ने वाला है।

सारांश

संक्षेप में, यह पेपर प्रस्ताव करता है कि कंप्यूटर के लिए यह अनुमान लगाना एक स्मार्ट तरीका है कि पैदल यात्री कहाँ जाएंगे। सब कुछ एक साथ मिला देने वाले "किचन सिंक" दृष्टिकोण के बजाय, यह एक तीन-चरणीय असेंबली लाइन का उपयोग करता है:

  1. गति (movement) को देखें।
  2. बॉडी लैंग्वेज को पढ़ें।
  3. भीड़ की जाँच करें।

यह दृष्टिकोण तेज़ है, कम कंप्यूटर पावर का उपयोग करता है, और हमारी व्यस्त दुनिया में लोगों के चलने के सटीक अनुमान लगाने के लिए अधिक सटीक परिणाम देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →