← नवीनतम पेपर
💻 computer science

FoSS: Modeling Long Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier State Space Integration

FoSS एक द्वि-शाखा (dual-branch) ढांचा है जो Argoverse बेंचमार्क पर अत्याधुनिक प्रक्षेपवक्र भविष्यवाणी सटीकता प्राप्त करने के लिए फ्रीक्वेंसी-डोमेन फूरियर विश्लेषण को लीनियर-टाइम सिलेक्टिव स्टेट-स्पेस मॉडल्स के साथ एकीकृत करता है, जबकि कम्प्यूटेशनल जटिलता और मॉडल मापदंडों को महत्वपूर्ण रूप से कम करता है।

मूल लेखक: Yizhou Huang, Gengze Jiang, Yihua Cheng, Kezhi Wang

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yizhou Huang, Gengze Jiang, Yihua Cheng, Kezhi Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह अनुमान लगाने की कोशिश कर रहे हैं कि अगले कुछ सेकंड में एक कार कहाँ होगी। यह सेल्फ-ड्राइविंग कारों के लिए एक अत्यंत महत्वपूर्ण काम है। यदि कार का अनुमान गलत होता है, तो इससे दुर्घटना हो सकती है।

समस्या यह है कि वर्तमान कंप्यूटर मॉडल एक दुविधा में फंसे हुए हैं:

  1. "सुपर-ऑब्जर्वर" (ट्रांसफॉर्मर्स): ये मॉडल एक साथ सब कुछ देखते हैं और बहुत सटीक होते हैं, लेकिन वे अविश्वसनीय रूप से धीमे और भारी होते हैं, जैसे किसी एक शब्द को खोजने के लिए पूरी लाइब्रेरी पढ़ने की कोशिश करना।
  2. "स्पीड-रीडर" (रिकरेंट मॉडल्स): ये तेज़ होते हैं लेकिन अक्सर बड़ी तस्वीर देखने में चूक जाते हैं या जटिल, दीर्घकालिक पैटर्न में उलझ जाते हैं।

यह पेपर एक नया मॉडल पेश करता है जिसे FoSS (फूरियर-स्टेट स्पेस) कहा जाता है। FoSS को एक "दो-मस्तिष्क वाले जासूस" के रूप में समझें जो दो पूरी तरह से अलग तरीकों से समस्या को देखकर कार के भविष्य का रहस्य सुलझाता है।

FoSS के दो मस्तिष्क

1. टाइम-ब्रेन (द स्टोरीटेलर - कहानी सुनाने वाला)

यह हिस्सा कार की गति को ठीक वैसे ही देखता है जैसे वह घटित हो रही है, प्रति सेकंड। यह एक फिल्म को फ्रेम-दर-फ्रेम देखने जैसा है।

  • यह क्या करता है: यह एक विशेष "सिलेक्टिव स्टेट स्पेस" (SSM) इंजन का उपयोग करता है। एक ऐसे लाइब्रेरियन की कल्पना करें जो केवल किताब के उन हिस्सों को पढ़ता है जो वर्तमान अध्याय के लिए प्रासंगिक हैं, बाकी को अनदेखा कर देता है। यह मॉडल को लंबे समय के पैटर्न (जैसे "यह कार इस चौराहे पर आमतौर पर बाएं मुड़ती है") को याद रखने की अनुमति देता है बिना बहुत अधिक डेटा से अभिभूत हुए। यह तेज़ और कुशल है।

2. फ्रीक्वेंसी-ब्रेन (द म्यूजिक कंपोजर - संगीतकार)

यह एक चतुर नया तरीका है। कार के पथ को ग्राफ पर एक रेखा के रूप में देखने के बजाय, यह मस्तिष्क गति को संगीत के नोट्स (फ्रीक्वेंसी) में तोड़ देता है।

  • लो नोट्स (बेस): ये बड़ी तस्वीर का प्रतिनिधित्व करते हैं। क्या कार सीधी जा रही है? क्या वह स्टॉप साइन के लिए धीमी हो रही है? ये "ग्लोबल ट्रेंड्स" हैं।
  • हाई नोट्स (ट्रेबल): ये बारीक विवरणों का प्रतिनिधित्व करते हैं। क्या कार थोड़ा लहरा रही है? क्या वह किसी उभार के कारण झटके ले रही है? ये "लोकल डायनेमिक्स" हैं।

संगीत के साथ समस्या: आमतौर पर, यदि आप एक गाने को नोट्स में तोड़ते हैं, तो लो और हाई नोट्स बेतरतीब ढंग से आपस में मिल जाते हैं। कंप्यूटर के लिए किसी गाने से सीखना कठिन होता है यदि बेस ड्रम, सिम्बल क्रैश के तुरंत बाद बज रहा हो।

FoSS का समाधान (हेलिक्ससॉर्ट): लेखकों ने एक "हेलिक्ससॉर्ट" मॉड्यूल का आविष्कार किया है। एक सर्पिल सीढ़ी (spiral staircase) की कल्पना करें। वे सभी संगीत नोट्स को करीने से व्यवस्थित करते हैं: लो नोट्स नीचे, हाई नोट्स ऊपर।

  • अब, कंप्यूटर पहले "बेस" सुन सकता है ताकि सामान्य दिशा को समझ सके, और फिर बारीक विवरणों को समझने के लिए "ट्रेबल" सुन सकता है। यह एक किताब को शुरू से अंत तक पढ़ने जैसा है, न कि बेतरतीब ढंग से इधर-उधर कूदने जैसा।

वे एक साथ कैसे काम करते हैं

एक बार जब दोनों मस्तिष्क अपना काम कर लेते हैं, तो वे बीच में मिलते हैं:

  1. द मीटिंग (क्रॉस-अटेंशन): "स्टोरीटेलर" (समय) और "कंपोजर" (फ्रीक्वेंसी) अपने नोट्स की तुलना करते हैं। वे पूछते हैं, "क्या बड़ी तस्वीर बारीक विवरणों से मेल खाती है?" यदि वे सहमत होते हैं, तो भविष्यवाणी बहुत मजबूत हो जाती है।
  2. द क्रिस्टल बॉल (मल्टीमॉडल प्रेडिक्शन): कार बाएं मुड़ सकती है, या वह सीधी जा सकती है। FoSS केवल एक पथ का अनुमान नहीं लगाता; यह कई संभावित भविष्य उत्पन्न करता है (जैसे मौसम का पूर्वानुमान कहना कि "बारिश की 70% संभावना है, धूप की 30% संभावना है")।
  3. द फाइनल डिसीजन: यह संभावनाओं को तौलता है और सबसे संभावित पथ देता है, साथ ही कार को बताता है, "मुझे इस बारे में काफी यकीन है," या "मैं थोड़ा अनिश्चित हूँ, सावधान रहें।"

यह एक बड़ी बात क्यों है?

  • यह तेज़ है: यह वर्तमान सर्वोत्तम मॉडलों की तुलना में लगभग 22% तेज़ चलता है। यह वास्तविक समय की ड्राइविंग के लिए महत्वपूर्ण है जहाँ मिलीसेकंड मायने रखते हैं।
  • यह हल्का है: यह 40% कम मेमोरी (पैरामीटर्स) का उपयोग करता है। इसका मतलब है कि यह केवल विशाल सुपरकंप्यूटर पर ही नहीं, बल्कि कारों के अंदर छोटे, सस्ते कंप्यूटरों पर भी चल सकता है।
  • यह सटीक है: वास्तविक ड्राइविंग डेटा (Argoverse) पर परीक्षणों में, इसने किसी भी पिछले तरीके की तुलना में कार की गतिविधियों की अधिक सटीकता से भविष्यवाणी की, विशेष रूप से लंबी अवधि की भविष्यवाणियों (6 सेकंड आगे देखना) के लिए।

एनालॉजी सारांश (उपमा सारांश)

कल्पना कीजिए कि आप एक डांसर के पथ की भविष्यवाणी करने की कोशिश कर रहे हैं।

  • पुराने मॉडल या तो हर एक पैर की हरकत को घूरते हैं (बहुत धीमे) या बस नृत्य की सामान्य शैली का अनुमान लगाते हैं (बहुत अस्पष्ट)।
  • FoSS एक कोरियोग्राफर की तरह है जो नृत्य की शैली जानने के लिए संगीत (लय और टेम्पो = फ्रीक्वेंसी) सुनता है, जबकि साथ ही साथ डांसर के कदमों (समय) को देखता है ताकि देख सके कि वे वास्तव में कहाँ बढ़ रहे हैं। संगीत को धीमी बीट्स से तेज़ बीट्स तक व्यवस्थित करके, कोरियोग्राफर नृत्य की चालों की सटीक, तेज़ और बहुत कम प्रयास के साथ भविष्यवाणी कर सकता है।

संक्षेप में, FoSS "बड़ी तस्वीर देखने" और "बारीकियों को देखने" के सर्वश्रेष्ठ गुणों को जोड़ता है ताकि सेल्फ-ड्राइविंग कारों को सुरक्षित, तेज़ और स्मार्ट बनाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →