← नवीनतम पेपर
🤖 machine learning

TRAM: Test-Time Risk Adaptation with Mixture of Agents

यह शोधपत्र TRAM का प्रस्ताव करता है, जो एक ज़ीरो-अपडेट टेस्ट-टाइम अडैप्टेशन विधि है जो लक्षित रिवॉर्ड और ऑक्यूपेंसी-आधारित जोखिम बाधाओं के आधार पर उन्हें स्कोर और मिक्स करके जोखिम-तटस्थ नीतियों के एक निश्चित पुस्तकालय को एक जोखिम-जागरूक एजेंट में गतिशील रूप से संयोजित करती है, जिससे बिना मॉडल रिट्रेनिंग की आवश्यकता के सुरक्षा और संरेखण सुनिश्चित होता है।

मूल लेखक: Mohamad Fares El Hajj Chehade, Amrit Singh Bedi, Amy Zhang, Hao Zhu

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohamad Fares El Hajj Chehade, Amrit Singh Bedi, Amy Zhang, Hao Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने विशेषज्ञों की एक ड्राइवर टीम तैयार की है। उनके प्रशिक्षण के दौरान, आपने उन्हें विभिन्न गंतव्यों तक कुशलतापूर्वक पहुँचने के लिए गाड़ी चलाना सिखाया। आपने उन्हें विशेष रूप से "सावधान" या "लापरवाह" होना नहीं सिखाया; आपने बस उन्हें अच्छी तरह से गाड़ी चलाना सिखाया। वे आपकी सोर्स पॉलिसीज़ (Source Policies) हैं।

अब, कल्पना कीजिए कि आप उन्हें एक नए शहर में तैनात करते हैं। अचानक, नियम बदल जाते हैं:

  • शायद वहां एक नया निर्माण क्षेत्र (एक खतरा/hazard) है जिससे उन्हें बचना है।
  • शायद नगर परिषद कहती है, "स्कूलों के पास 20 मील प्रति घंटे से तेज़ न चलें" (एक जोखिम सीमा/risk threshold)।
  • शायद एक नया बॉस कहता है, "बिल्कुल उस सुरक्षित, उबाऊ कार की तरह गाड़ी चलाओ" (एक व्यवहार संबंधी संदर्भ/behavioral reference)।

आमतौर पर, यदि नियम बदलते हैं, तो आपको अपने सभी ड्राइवरों को सब कुछ फिर से सीखने के लिए वापस ड्राइविंग स्कूल भेजना पड़ता है। इसमें समय, पैसा और कंप्यूटिंग शक्ति लगती है।

TRAM (टेस्ट-टाइम रिस्क एडेप्टेशन वाया मिक्सचर ऑफ एजेंट्स) बिना किसी को वापस स्कूल भेजे इसे संभालने का एक नया तरीका है।

मुख्य विचार: "स्मार्ट डिस्पैचर" (Smart Dispatcher)

ड्राइवरों को फिर से प्रशिक्षित करने के बजाय, TRAM तैनाती के क्षण में एक सुपर-स्मार्ट डिस्पैचर की तरह कार्य करता है।

  1. लाइब्रेरी (The Library): आप अपने मूल ड्राइवरों (सोर्स पॉलिसीज़) को बिल्कुल वैसा ही रखते हैं जैसा वे हैं। वे "रिस्क-न्यूट्रल" हैं, जिसका अर्थ है कि वे गाड़ी चलाना जानते हैं लेकिन उन्हें अत्यधिक सावधान या अत्यधिक आक्रामक होने के लिए मजबूर नहीं किया गया है। यह उनके कौशल को विविध और उपयोगी बनाए रखता है।
  2. नया नियम पुस्तिका (The New Rulebook): जब आप नए शहर में पहुँचते हैं, तो आप नए सुरक्षा नियमों (जोखिम) को परिभाषित करते हैं।
  3. स्कोरकार्ड (The Scorecard): हर एक चौराहे पर (प्रत्येक निर्णय बिंदु पर), डिस्पैचर सभी उपलब्ध ड्राइवरों को देखता है। वह पूछता है:
    • "ड्राइवर A हमें लक्ष्य तक कितनी तेज़ी से पहुँचा सकता है?"
    • "ड्राइवर A नए निर्माण क्षेत्र के साथ कितना जोखिम लेता है?"
    • "ड्राइवर B कितना जोखिम लेता है?"
  4. सिला हुआ रास्ता (The Stitched Path): डिस्पैचर उस विशिष्ट क्षण के लिए सबसे अच्छा ड्राइवर चुनता है।
    • यदि सड़क साफ है, तो वह सबसे तेज़ ड्राइवर को चुन सकता है।
    • यदि कोई खतरा दिखाई देता है, तो वह तुरंत उस ड्राइवर पर स्विच कर जाता है जो उस विशिष्ट खतरे के साथ सुरक्षित रूप से नेविगेट करना जानता है।
    • यदि सड़क फिर से सुरक्षित हो जाती है, तो वह वापस तेज़ ड्राइवर पर स्विच कर जाता है।

परिणाम एक स्टिच्ड पॉलिसी (Stitched Policy) है: विभिन्न विशेषज्ञ ड्राइवरों के बीच स्विच करते हुए एक एकल यात्रा, जो एक ऐसा पथ बनाती है जो कुशल भी है और सुरक्षित भी, और यह सब ड्राइवरों के दिमाग में कोड की एक भी लाइन बदले बिना किया जाता है।

शुरुआत से ही सुरक्षा के लिए प्रशिक्षण क्यों नहीं दिया जाता?

पेपर तर्क देता है कि ड्राइवरों को बहुत जल्दी "सुरक्षित" होने के लिए प्रशिक्षित करना एक बुरा विचार है।

  • "अत्यधिक सतर्कता" की समस्या (The "Over-Cautious" Problem): यदि आप एक ड्राइवर को 'वैरिएंस' (अनिश्चितता) से बचने के लिए प्रशिक्षित करते हैं, तो वे सड़क के किसी भी झटके से इतने डर सकते हैं कि वे कभी ड्राइव करने के लिए घर से बाहर ही नहीं निकल पाएंगे। वे काम पूरा करने के लिए आवश्यक जोखिम लेने की अपनी क्षमता खो देते हैं।
  • "गलत प्रकार की सुरक्षा" की समस्या (The "Wrong Kind of Safe" Problem): एक ड्राइवर जिसे "वैरिएंस" से बचने के लिए प्रशिक्षित किया गया है, वह यह नहीं समझ सकता है कि एक विशिष्ट रेड ज़ोन से होकर गुजरना खतरनाक है। वे सोच सकते हैं, "मैं बहुत सुचारू रूप से गाड़ी चला रहा हूँ, इसलिए मैं सुरक्षित हूँ," भले ही वे सीधे एक दीवार की ओर जा रहे हों।

TRAM इस समस्या को हल करता है क्योंकि यह ड्राइवरों को प्रशिक्षण के दौरान विविध और लचीला रखता है और केवल वास्तविक मिशन शुरू होने पर ही विशिष्ट "सेफ्टी फ़िल्टर" लागू करता है।

यह कैसे काम करता है (रूपक/Metaphor)

ड्राइवरों को एक ऑर्केस्ट्रा में विभिन्न वाद्य यंत्रों के रूप में सोचें।

  • प्रशिक्षण: आप वायलिन, ड्रम और बांसुरी को उनके नोट्स पूरी तरह से बजाना सिखाते हैं। आप उन्हें अभी "दुखी" या "ज़ोर से" बजाने के लिए नहीं कहते।
  • तैनाती: आप कॉन्सर्ट हॉल में जाते हैं और कहते हैं, "आज, हमें एक दुखद, शांत गीत चाहिए।"
  • TRAM की भूमिका: वाद्य यंत्रों को फिर से सिखाने के बजाय, कंडक्टर (TRAM) तुरंत निर्णय लेता है: "बांसुरी को धुन बजानी चाहिए, लेकिन ड्रम बहुत धीरे बजने चाहिए, और वायलिन को एक निचला स्वर थामना चाहिए।"
  • परिणाम: संगीत बिना संगीतकारों को उनके वाद्य यंत्रों को फिर से सीखने की आवश्यकता के बिना, माहौल के अनुकूल तुरंत बदल जाता है।

यह पेपर वास्तव में क्या सिद्ध करता है

लेखकों ने इस विचार का परीक्षण कई तरीकों से किया:

  • ग्रिडवर्ल्ड्स (Gridworlds): सरल भूलभुलैया वाले खेल जहाँ उन्होंने प्रशिक्षण के बाद नए "खतरे वाले क्षेत्र" जोड़े। TRAM सफलतापूर्वक उनसे बच गया जबकि अन्य विफल रहे।
  • रोबोटिक्स (Reacher & Safety-Gymnasium): रोबोटिक भुजाओं को नियंत्रित करना। जब स्क्रीन पर एक नया "नो-गो" घेरा दिखाई दिया, तो TRAM ने रोबोट की गतिविधियों को समायोजित किया ताकि वह उससे बच सके, जबकि अन्य विधियों ने या तो टक्कर मारी या वे बहुत धीमे थे।
  • LLMs (लार्ज लैंग्वेज मॉडल्स): उन्होंने इसका उपयोग AI चैटबॉट्स को समायोजित करने के लिए किया। यदि कोई चैटबॉट ऐसे उत्तर उत्पन्न कर रहा था जो बहुत अधिक "जोखिम भरे" या सुरक्षा दिशानिर्देशों के साथ संरेखित नहीं थे, तो TRAM जनरेशन रणनीति को एक सुरक्षित रणनीति में बदल सकता था, बिना विशाल AI मॉडल को फिर से प्रशिक्षित किए।

कमी (सीमाएं)

पेपर ईमानदार है कि TRAM क्या नहीं है:

  • यह कोई जादुई छड़ी नहीं है जो हर संभावित सुरक्षा समस्या को पूरी तरह से हल कर देती है।
  • यह शुरुआत में एक अच्छे "ड्राइवर लाइब्रेरी" (सोर्स पॉलिसीज़) पर निर्भर करता है। यदि आपके सभी ड्राइवर खराब हैं, तो डिस्पैचर उन्हें अच्छा नहीं बना सकता।
  • यह एक "सरोगेट" (विकल्प) विधि है। यह मौजूदा व्यवहारों को जोड़ने का एक बहुत अच्छा अनुमान है, लेकिन यह हर एक संभावित भविष्य के परिदृश्य के लिए पूर्ण समाधान की गणितीय गारंटी नहीं देता है। हालाँकि, यह मापने योग्य तरीका प्रदान करता है कि यह आदर्श के कितने करीब है।

सारांश

TRAM एक ऐसी विधि है जो आपको पहले से प्रशिक्षित, लचीले AI एजेंटों की एक लाइब्रेरी लेने और उपयोग के समय उन्हें नए सुरक्षा नियमों के अनुकूल तुरंत ढालने की अनुमति देती है। यह एक स्मार्ट स्विचबोर्ड की तरह कार्य करके यह करता है, जो मौजूदा व्यवहारों में से वर्तमान स्थिति के लिए सबसे अच्छे व्यवहार को चुनता है, न कि एजेंटों को वापस स्कूल जाकर सब कुछ फिर से सीखने के लिए मजबूर करता है। यह शून्य से पुन: प्रशिक्षण (retraining from scratch) के बजाय मौके पर अनुकूलन (adapting on the fly) के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →