← नवीनतम पेपर
🤖 AI

BONSAI: Evolvability-Guided Tree Search over Skills

BONSAI फ्रोजन एजेंटों (frozen agents) के लिए एक नवीन कौशल-अनुकूलन ढांचा है जो ओवरफिटिंग स्पाइक्स (overfitting spikes) और सुधारात्मक पठारों (improvable plateaus) के बीच अंतर करने के लिए इवॉल्वेबिलिटी-गाइडेड मोंटे कार्लो ट्री सर्च (evolvability-guided Monte Carlo tree search) का उपयोग करता है, जो होल्डआउट सटीकता (heldout accuracy) में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Yash Priya Shastri, Anand Eswaran, Adnan Qidwai, Pankaj Thorat, Sachin Joshi

प्रकाशित 2026-08-10
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yash Priya Shastri, Anand Eswaran, Adnan Qidwai, Pankaj Thorat, Sachin Joshi

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक जटिल काम करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक स्प्रेडशीट को ठीक करना या एक कठिन गणित की समस्या को हल करना। शर्त यह है कि रोबोट "फ्रीज" (frozen) है। उसका मस्तिष्क एक जगह लॉक है; आप उसे फिर से प्रशिक्षित (retrain) नहीं कर सकते, उसके न्यूरॉन्स में बदलाव नहीं कर सकते, या उसे अपनी गलतियों से सीखने नहीं दे सकते जैसे कि एक मानव छात्र सीखता है। इसे बेहतर बनाने का एकमात्र तरीका इसे अंग्रेजी में निर्देशों का एक सेट—एक "कौशल" (skill)—लिखना है। इस कौशल को केवल एक साधारण कमांड के रूप में न समझें, बल्कि इसे एक विस्तृत फील्ड मैनुअल के रूप में देखें जो रोबोट को बताता है कि कौन से उपकरण उठाने हैं, किन खतरों से बचना है, और अपना काम सौंपने से पहले अपने काम की दोबारा जांच कैसे करनी है।

बड़ा सवाल यह है कि वैज्ञानिक: एक परफेक्ट मैनुअल कैसे लिखें? यदि आप बस कुछ बदलाव करते हैं, परीक्षण करते हैं, और जो काम करते हैं उन्हें रखते हैं, तो आप फंस सकते हैं। यह एक पहाड़ पर चढ़ने जैसा है जहाँ मानचित्र केवल आपकी वर्तमान ऊँचाई दिखाता है। आप एक छोटी, नुकीली चोटी पर पहुँच सकते हैं जो ऊँची दिखती है, लेकिन वह इतनी संकरी है कि अगला कदम आपको सीधे खाई में ले जाएगा। या, आप एक चौड़े, ढालू पठार पर हो सकते हैं जहाँ हर कदम आगे बढ़ने से आप और ऊँचे स्थान की ओर जाते हैं, लेकिन आप केवल अपनी वर्तमान ऊँचाई देखकर अंतर नहीं बता सकते। यह शोध पत्र इस परिदृश्य में नेविगेट करने का एक नया तरीका पेश करता है, जो जीव विज्ञान से लिए गए एक विचार "इवॉल्वेबिलिटी" (evolvability - विकसित होने की क्षमता) का उपयोग करता है: एक ऐसे पथ की क्षमता जो गलत मोड़ लेने पर भी अच्छे परिणाम उत्पन्न करना जारी रख सके।


समस्या: "नुकीली चोटी" का जाल (The Trap of the "Sharp Peak")

IBM रिसर्च के शोधकर्ताओं ने देखा कि हम आमतौर पर इन AI मैनुअल्स को सुधारने के तरीके में एक खामी है। मानक तरीका सरल है: एक मैनुअल लें, AI को इसे फिर से लिखने के लिए कहें, नए संस्करण का परीक्षण करें, और यदि स्कोर बढ़ता है, तो इसे रखें। यदि स्कोर कम होता है, तो इसे फेंक दें।

समस्या यह है कि यह तरीका "अंधा" है। यह केवल वर्तमान मैनुअल के स्कोर को देखता है। यह यह नहीं बता सकता कि एक मैनुअल एक चौड़े पठार (एक सुरक्षित, स्थिर क्षेत्र जहाँ छोटे बदलाव आमतौर पर और भी बेहतर परिणामों की ओर ले जाते हैं) पर बैठा है या एक नुकीली, ओवरफिट स्पाइक (एक नाजुक चोटी जहाँ स्कोर उच्च है, लेकिन कोई भी छोटा बदलाव उन दस चीजों को तोड़ देता है जो पूरी तरह से काम कर रही थीं) पर बैठा है। यदि आप एक स्पाइक पर हैं, तो अगला संपादन उस एक छोटी त्रुटि को ठीक कर सकता है लेकिन दस अन्य चीजों को खराब कर सकता है जो पूरी तरह से काम कर रही थीं। मानक तरीका खाई में गिर जाता है क्योंकि यह केवल उच्च स्कोर देखता है, खतरे को नहीं।

समाधान: BONSAI और "इवॉल्वेबिलिटी" कंपास

इसे ठीक करने के लिए, टीम ने BONSAI नामक एक नया फ्रेमवर्क बनाया। केवल यह देखने के बजाय कि मैनुअल अभी कितना अच्छा है, BONSAI पूछता है: "इस मैनुअल के आसपास का पड़ोस कैसा है?"

वे प्रकृति से लिए गए एक चतुर रूपक का उपयोग करते हैं: इवॉल्वेबिलिटी (Evolvability)। जीव विज्ञान में, किसी प्रजाति का मूल्यांकन केवल इस आधार पर नहीं किया जाता कि वह आज कितनी अच्छी तरह जीवित रहती है, बल्कि इस आधार पर किया जाता है कि भविष्य में उपयोगी संतान उत्पन्न करने की उसकी क्षमता क्या है। एक प्रजाति जो "चौड़े पठार" पर होती है, वह उत्परिवर्तित (mutate) हो सकती है और फिर भी जीवित रह सकती है; एक प्रजाति जो "नुकीली स्पाइक" पर होती है, वह थोड़ा सा बदलने पर ही खत्म हो जाती है।

BONSAI एक आदर्श मैनुअल की खोज को एक पेड़ उगाने की तरह मानता है।

  1. पेड़: यह एक "बीज" मैनुअल से शुरू होता है।
  2. शाखाएँ: हर बार जब AI मैनुअल को फिर से लिखने की कोशिश करता है, तो यह एक नई शाखा (चाइल्ड नोड) उगाता है।
  3. कंपास: अगली शाखा को खोजने का निर्णय लेते समय, BONSAI केवल उस शाखा को नहीं चुनता जिसका स्कोर सबसे अधिक है। यह उस शाखा को चुनता है जो सबसे अच्छा भविष्य दिखाती है। यह इवॉल्वेबिलिटी नामक एक स्कोर की गणना करता है, जो मूल रूप से उस मैनुअल में किए गए सभी छोटे बदलावों (उत्परिवर्तन) का औसत स्कोर है।

यदि कोई मैनुअल एक "स्पाइक" पर है, तो उसके पड़ोसी भयानक स्कोर वाले होंगे, और इवॉल्वेबिलिटी स्कोर कम होगा। BONSAI इससे बचता है। यदि कोई मैनुअल एक "पठार" पर है, तो उसके पड़ोसी भी अच्छे स्कोर वाले होंगे, और इवॉल्वेबिलिटी स्कोर उच्च होगा। BONSAI इन सुरक्षित, उत्पादक क्षेत्रों में गहराई तक जाता है।

यह कैसे काम करता है: "ग्राफ्ट" (Graft) ट्रिक

शोधकर्ताओं ने GRAFT नामक एक विशेष विशेषता जोड़ी है। कल्पना कीजिए कि आपके पास पेड़ की दो शाखाएँ हैं: एक शाखा ने सीखा कि "गणित की समस्याओं" को कैसे संभालना है, और दूसरी शाखा ने सीखा कि "स्प्रेडशीट" को कैसे संभालना है। वे अलग-अलग रास्तों पर हैं और कभी एक-दूसरे से बात नहीं करते।

आमतौर पर, AI इन कौशलों को संयोजित नहीं कर सकता क्योंकि वह एक समय में केवल एक ही मैनुअल को देखता है। लेकिन GRAFT AI को "गणित" वाली शाखा को झाँकने, वहां काम करने वाली एक ट्रिक देखने और उस ट्रिक को "स्प्रेडशीट" मैनुअल में कॉपी करने की अनुमति देता है। यह एक माली की तरह है जो एक पेड़ से एक मजबूत शाखा लेता है और उसे दूसरे पेड़ में लगा देता है (grafting) ताकि उसे नई शक्तियाँ मिल सकें। यह पेड़ की संरचना को तोड़े बिना होता है, जिससे AI अपने खोज के विभिन्न हिस्सों से सबसे अच्छे विचारों को मिला और मिला सकता है।

परिणाम: ऊँचाई तक पहुँचना

टीम ने तीन चुनौतियों पर BONSAI का परीक्षण किया:

  1. SpreadsheetBench: एक्सेल फाइलों को ठीक करना।
  2. SearchQA: सर्च परिणामों का उपयोग करके क्विज़ प्रश्नों के उत्तर देना।
  3. LiveMathematicianBench: गणित की समस्याओं को हल करना।

उन्होंने एक फ्रीज़ किए गए 30-बिलियन-पैरामीटर AI एजेंट (परफ़ॉर्मर) और मैनुअल लिखने के लिए एक अलग AI (ऑप्टिमाइज़र) का उपयोग किया। उन्होंने अपने कम्प्यूटिंग बजट (समान मात्रा में कंप्यूटिंग पावर) का उपयोग करते हुए BONSAI की तुलना दो अन्य तरीकों, GEPA और SkillOpt से की।

परिणाम स्पष्ट थे:

  • SpreadsheetBench पर, BONSAI ने शुरुआती मैनुअल की तुलना में सटीकता में 5.71 अंक का सुधार किया और सबसे अच्छे प्रतियोगी (GEPA) को 2.14 अंकों से पीछे छोड़ दिया।
  • SearchQA पर, इसने शुरुआती मैनुअल की तुलना में 6.57 अंक का सुधार किया।
  • LiveMathematicianBench पर, अंतर बहुत बड़ा था। BONSAI 64.91% सटीकता तक पहुँचा, जबकि शुरुआती मैनुअल केवल 28.23% पर था, और प्रतिस्पर्धी GEPA 56.14% पर था।

शोधकर्ताओं ने पाया कि जब उन्होंने "इवॉल्वेबिलिटी" कंपास को बंद कर दिया और केवल AI को लालची होकर उच्चतम स्कोर के पीछे भागने दिया (पुराने तरीकों की तरह), तो AI जल्दी ही उन "नुकीली चोटियों" पर फंस गया और सुधार करना बंद कर दिया। हालाँकि, BONSAI ने खोज में गहराई तक बेहतर समाधान खोजे क्योंकि वह जानता था कि कौन से रास्ते सुरक्षित हैं।

निष्कर्ष

यह शोध पत्र सुझाव देता है कि फ्रीज़ किए गए AI एजेंटों को स्मार्ट बनाने के लिए, हमें केवल वर्तमान में उच्चतम स्कोर नहीं देखना चाहिए। हमें सबसे आशाजनक पड़ोस को देखना चाहिए। तात्कालिक, नाजुक जीत के बजाय स्थिरता और भविष्य की क्षमता (इवॉल्वेबिलिटी) को महत्व देने वाले ट्री-सर्च मेथड का उपयोग करके, BONSAI ने AI के पालन करने के लिए बेहतर निर्देश खोजे। इसे AI के मस्तिष्क को फिर से प्रशिक्षित करने की आवश्यकता नहीं थी; इसे बस एक बेहतर फील्ड मैनुअल लिखने की आवश्यकता थी, और इसने यह जाना कि कौन से रास्ते सुरक्षित रूप से चलने लायक हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →