← नवीनतम पेपर
⚡ electrical engineering

ERFSL: An Efficient Reward Function Searcher via Language Models for Custom-Environment Multi-Objective Optimization (Student Abstract)

यह शोध पत्र ERFSL का प्रस्ताव करता है, जो एक कुशल ढांचा है जो कस्टम मल्टी-ऑब्जेक्टिव लर्निंग कार्यों के लिए रिवॉर्ड फंक्शन घटकों और भारों को स्वचालित रूप से उत्पन्न करने, उनकी आलोचना करने और पुनरावृत्ति के माध्यम से अनुकूलित करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे न्यूनतम फीडबैक पुनरावृत्तियों के साथ उपयोगकर्ता की आवश्यकताओं के अनुरूप तीव्र अभिसरण प्राप्त होता है।

मूल लेखक: Guanwen Xie, Jingzehua Xu, Yiyuan Yang, Yimian Ding, Shuai Zhang

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guanwen Xie, Jingzehua Xu, Yiyuan Yang, Yimian Ding, Shuai Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि रोबोट एक साथ तीन काम करे: टकराने से बचना, बैटरी की शक्ति बचाना और अधिक से अधिक वस्तुओं (items) को इकट्ठा करना। समस्या यह है कि रोबोट को यह कैसे करना है, यह बताना बेहद कठिन है। आपको रोबोट को यह बताने के लिए कि उसे हर क्रिया के लिए कितने अंक देने चाहिए, एक "स्कोरकार्ड" (जिसे रिवॉर्ड फंक्शन कहा जाता है) लिखना होगा। यदि आप गणित में गलती करते हैं, तो रोबोट या तो लगातार टकरा सकता है या वस्तुओं को पूरी तरह से अनदेखा कर सकता है।

यह पेपर ERFSL पेश करता है, जो एक स्मार्ट सहायक है जो आपके लिए इस स्कोरकार्ड को स्वचालित रूप से लिखने और ट्यून करने के लिए एक लार्ज लैंग्वेज मॉडल (जैसे कि एक सुपर-स्मार्ट AI चैटबॉट) का उपयोग करता है।

ERFSL कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:

1. अनुवादक (एनवायरनमेंट डिस्क्रिप्शन)

सबसे पहले, आप AI को साधारण अंग्रेजी में बताते हैं कि आप क्या चाहते हैं (जैसे, "टकराने से बचें," "ऊर्जा बचाएं")। AI एक अनुवादक की तरह कार्य करता है, जो आपकी अस्पष्ट इच्छाओं को एक विशिष्ट, क्रमांकित चेकलिस्ट में बदल देता है। यह आपकी व्याख्या की जांच भी करता है ताकि यह सुनिश्चित हो सके कि यह स्पष्ट है, और यदि निर्देश बहुत धुंधले हैं तो आपसे विवरण भरने के लिए कहता है।

2. कोड लेखक और संपादक (रिवॉर्ड कोड जनरेशन)

इसके बाद, AI आपके स्कोरकार्ड के लिए वास्तविक कंप्यूटर कोड लिखने की कोशिश करता है।

  • लेखक (The Writer): यह आपकी प्रत्येक आवश्यकता के लिए कोड का एक छोटा सा हिस्सा बनाता है।
  • संपादक (The Editor - रिवॉर्ड क्रिटिक): चूंकि AI गलतियाँ कर सकता है (जैसे कि किसी ऐसे वेरिएबल का उपयोग करना जो मौजूद नहीं है), एक "क्रिटिक" कोड की जांच करता है। यदि कोड टूटा हुआ है, तो क्रिटिक त्रुटि की ओर इशारा करता है, और AI तुरंत उसे ठीक कर देता है। पेपर का दावा है कि यह बहुत कुशल है; आमतौर पर, AI फीडबैक के केवल एक दौर के बाद कोड को सही कर लेता है।

3. ट्यूनर (रिवॉर्ड वेट सर्च)

यह सबसे कठिन हिस्सा है। कल्पना कीजिए कि आपके पास एक रेडियो के तीन नॉब (knobs) हैं: एक "क्रैश पेनल्टी" के लिए, एक "एनर्जी पेनल्टी" के लिए, और एक "आइटम बोनस" के लिए।

  • यदि आप "क्रैश" वाले नॉब को बहुत अधिक घुमा देते हैं, तो रोबोट हिलने से भी डर जाएगा।
  • यदि आप इसे बहुत कम रखते हैं, तो वह बार-बार टकराएगा।
  • आपको इन सटीक सेटिंग्स को खोजने की आवश्यकता है ताकि रोबोट सब कुछ अच्छी तरह से कर सके।

ERFSL इन सटीक सेटिंग्स को खोजने के लिए एक चतुर रणनीति का उपयोग करता है:

  • प्रारंभिक अनुमान (The Initial Guess): यह यह देखने के लिए कि क्या होता है, नॉब सेटिंग्स के 5 अलग-अलग संयोजनों का परीक्षण करके शुरू होता है।
  • लॉग रीडर (The Log Reader): यह एक "ट्रेनिंग डायरी" (लॉग्स) को देखता है जो दिखाता है कि रोबोट ने कैसा प्रदर्शन किया। क्या वह टकराया? क्या उसकी बैटरी खत्म हो गई?
  • जेनेटिक ट्यूनर (The Genetic Tuner): डायरी के आधार पर, AI एक जेनेटिक इंजीनियर की तरह कार्य करता है। यह सबसे अच्छा प्रदर्शन करने वाली सेटिंग्स लेता है, उन्हें आपस में मिलाता है, और नए संयोजन आजमाता है। यह तय करता है कि किसी नॉब को ऊपर घुमाना है, नीचे करना है, या बस थोड़ा बदलाव करना है।

यह विशेष क्यों है?

यह पेपर इस सिस्टम के कुछ "सुपरपावर्स" पर प्रकाश डालता है:

  • यह लचीला (Resilient) है: भले ही आपने गलती से एक नॉब को 500 गुना अधिक मजबूत सेट कर दिया हो (एक बड़ी गलती), यह सिस्टम केवल लगभग 5 प्रयासों में सही संतुलन खोज सकता है।
  • यह स्मार्ट मॉडल्स के साथ काम करता है: यह न केवल सबसे बड़े, सबसे महंगे मॉडल्स के साथ, बल्कि छोटे और तेज़ AI मॉडल्स (जैसे GPT-4o mini) के साथ भी अच्छी तरह से काम करता है।
  • यह मॉड्यूलर (Modular) है: पूरे स्कोरकार्ड को एक साथ ठीक करने के बजाय, यह समस्या को छोटे टुकड़ों में तोड़ देता है (कोड लिखना, फिर वेट्स को ट्यून करना), जिससे भ्रमित होने की संभावना बहुत कम हो जाती है।

निचोड़ (The Bottom Line)

ERFSL को अपने रोबोट के लिए एक स्मार्ट कोच के रूप में समझें। आपको रोबोट को सिखाने के लिए जटिल गणितीय समीकरण लिखने के लिए संघर्ष करने के बजाय, आप बस कोच को अपने लक्ष्य बता देते हैं। कोच नियम लिखता है, त्रुटियों के लिए उनकी जांच करता है, और फिर सेटिंग्स के साथ तब तक प्रयोग करता है जब तक कि रोबोट पूरी तरह से प्रदर्शन न करने लगे। शोधकर्ताओं ने इसका परीक्षण अंडरवॉटर रोबोट्स (AUVs) से जुड़े एक सिमुलेशन पर किया और पाया कि यह सुरक्षा, ऊर्जा और प्रदर्शन को संतुलित करने वाले नियमों का एक सेट तेजी से बना सकता है, जो पिछले तरीकों से बेहतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →