← नवीनतम पेपर
🤖 machine learning

TrajDLM: Topology-Aware Block Diffusion Language Model for Trajectory Generation

TrajDLM एक टोपोलॉजी-जागरूक ब्लॉक डिफ्यूजन लैंग्वेज मॉडल है जो उन्हें डिस्क्रीट रोड सेगमेंट अनुक्रमों के रूप में मॉडल करके उच्च-निष्ठा वाले, सड़क-नेटवर्क-अनुपालन GPS प्रक्षेपवक्र (ट्रैजेक्टरीज) उत्पन्न करता है, जो प्रभावी रूप से जनरेशन गति और टोपोलॉजिकल निष्ठा के बीच संतुलन बनाता है और दक्षता एवं ज़ीरो-शॉट ट्रांसफर क्षमताओं में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Wilson Wongso, Lihuan Li, Arian Prabowo, Xiachong Lin, Baiyu Chen, Hao Xue, Flora D. Salim

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wilson Wongso, Lihuan Li, Arian Prabowo, Xiachong Lin, Baiyu Chen, Hao Xue, Flora D. Salim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को व्यस्त शहर में कार चलाना सिखाने की कोशिश कर रहे हैं। आपके पास दो मुख्य समस्याएँ हैं:

  1. "घोस्ट कार" (Ghost Car) की समस्या: यदि आप रोबोट को केवल एक सीधी रेखा में बिंदु A से बिंदु B तक जाने के लिए कहते हैं, तो वह किसी इमारत या पार्क के बीच से निकल सकता है क्योंकि उसे सड़कों के बारे में "पता" नहीं है। यह एक नक्शे पर बिना सड़कों को देखे एक रेखा खींचने जैसा है।

  2. "स्लो टर्टल" (Slow Turtle) की समस्या: यदि आप रोबोट को हर एक चौराहे को देखने और हर कदम उठाने से पहले पूछने के लिए सिखाते कि, "क्या मैं यहाँ से बाईं ओर मुड़ सकता हूँ? क्या मैं दाईं ओर मुड़ सकता हूँ?" तो वह अविश्वसनीय रूप से सटीक होगा, लेकिन उसे एक एकल यात्रा की योजना बनाने में बहुत समय लगेगा।

मौजूदा तरीके आमतौर पर आपको या तो तेज़ "घोस्ट कार" या धीमे "टर्टल" में से किसी एक को चुनने के लिए मजबूर करते हैं।

मिलिए TrajDLM से: "स्मार्ट ब्लॉक प्लानर"

लेखकों ने एक नया सिस्टम बनाया है जिसे TrajDLM कहा जाता है जो इन दोनों समस्याओं को एक साथ हल करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "जीपीएस डॉट्स" के बजाय "रोड चंक्स" (Road Chunks) में सोचना

अधिकांश पुराने सिस्टम यात्रा को एक समय में एक छोटे जीपीएस निर्देशांक (coordinate) की भविष्यवाणी करने की कोशिश करते हैं (जैसे कि डॉट्स को जोड़कर बनाई जाने वाली एक पहेली)। TrajDLM खेल बदल देता है। डॉट्स के बजाय, यह सड़क खंडों के ब्लॉकों (blocks of road segments) में सोचता है।

कल्पना कीजिए कि आप एक कहानी लिख रहे हैं। एक-एक अक्षर लिखने के बजाय, आप एक साथ पूरा वाक्य लिखते हैं। TrajDLM सड़कों के साथ यही करता है। यह यात्रा के एक हिस्से (मान लीजिए 32 सड़क खंड) को देखता है और उस पूरे हिस्से को एक साथ "ठीक" या "डिनोइज़" (denoise) करने की कोशिश करता है। यह एक ऐसे चित्रकार की तरह है जो एक समय में एक सिंगल पिक्सेल को पेंट करने के बजाय, कैनवास के एक पूरे हिस्से को एक साथ ठीक करता है। यह इसे बहुत तेज़ बनाता है (पिछले सबसे अच्छे तरीके से 2.8 गुना तेज़)।

2. "रोड मैप ब्रेन" (The Road Map Brain)

यह सुनिश्चित करने के लिए कि रोबोट इमारतों के बीच से न चले जाए, TrajDLM के पास एक विशेष "मस्तिष्क" है जिसे रोड नेटवर्क एनकोडर (Road Network Encoder) कहा जाता है।

इसे रोबोट को यात्रा शुरू करने से पहले शहर का एक भौतिक नक्शा देने जैसा समझें। वह केवल "सड़क A" और "सड़क B" को याद शब्द के रूप में नहीं देखता; वह समझता है कि सड़क A, सड़क B से जुड़ती है, लेकिन सड़क C एक डेड एंड (बंद रास्ता) है। यह शहर की सड़कों के आकार और नियमों को सीखता है। यह सुनिश्चित करता है कि हर उत्पन्न की गई यात्रा शारीरिक रूप रूप से संभव है और वास्तविक सड़कों का अनुसरण करती है।

3. "ट्रैफिक कोप" (The Traffic Cop) सैंपलिंग

एक अच्छे मस्तिष्क के होने के बावजूद, रोबोट कभी-कभी मूर्खतापूर्ण गलती कर सकता है, जैसे कि गलत दिशा में वन-वे सड़क पर मुड़ने की कोशिश करना।

TrajDLM एक "ट्रैफिक कोप" (जिसे टोपोलॉजी-कन्स्ट्रेंड सैंपलिंग कहा जाता है) का उपयोग करता है। हर बार जब रोबोट एक नई सड़क का सुझाव देता है, तो ट्रैफिक कोप नक्शे की जाँच करता है।

  • "क्या आप वास्तव में पिछली सड़क से इस नई सड़क तक पहुँच सकते हैं?"
  • "क्या यह सड़क जुड़ी हुई है?"

यदि उत्तर "नहीं" है, तो ट्रैफिक कोप तुरंत उस विचार को ब्लॉक कर देता है और रोबोट को एक वैध सड़क चुनने के लिए मजबूर करता है। यह गारंटी देता है कि अंतिम यात्रा सुसंगत और यथार्थवादी है।

उन्होंने क्या सिद्ध किया?

शोधकर्ताओं ने इस सिस्टम का परीक्षण तीन वास्तविक शहरों में किया: बीजिंग, पोर्टो और सैन फ्रांसिस्को

  • गति बनाम गुणवत्ता: उन्होंने पाया कि TrajDLM एक "गोल्डिलॉक्स" (Goldilocks) समाधान था। यह उतना ही सटीक था जितने कि धीमे, सावधान तरीके (जो सड़कों का पूरी तरह पालन करते थे) थे, लेकिन यह अव्यवस्थपूर्ण, तेज़ तरीकों के लगभग बराबर तेज़ था।
  • "ज़ीरो-शॉट" (Zero-Shot) ट्रिक: उन्होंने सिस्टम को बीजिंग के 2015 के डेटा पर प्रशिक्षित किया। फिर, उन्होंने इसे 2007-2011 के एक पूरी तरह से अलग डेटासेट के लिए यात्राएं उत्पन्न करने के लिए कहा जिसमें बाइक, बस और पैदल चलने वाले शामिल थे (केवल कारें नहीं)। भले ही उसने इन विशिष्ट पैटर्न को पहले कभी नहीं देखा था, फिर भी इसने यथार्थवादी मार्ग उत्पन्न किए। यह किसी को सेडान चलाना सिखाने और फिर उन्हें अतिरिक्त पाठों के बिना ट्रक या मोटरसाइकिल चलाने में सक्षम बनाने जैसा है।

निष्कर्ष

TrajDLM वास्तविक मानव गतिविधि की तरह दिखने और महसूस होने वाली नकली जीपीएस यात्राएं बनाने का एक नया तरीका है। यह सड़कों को टुकड़ों (chunks) में समूहीकृत करके, शहर के मानचित्र ढांचे को सीखकर और हर चाल की जाँच करने के लिए एक "ट्रैफिक कोप" रखकर ऐसा करता है। यह शहरों और योजनाकारों को लाखों यथार्थवादी यात्रा परिदृश्य जल्दी से उत्पन्न करने की अनुमति देता है, जो यातायात योजनाओं का परीक्षण करने या आपात स्थिति का अनुकरण करने के लिए बहुत उपयोगी है, बिना किसी की वास्तविक गोपनीयता का उल्लंघन किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →