← नवीनतम पेपर
💬 NLP

AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection

यह शोध पत्र AdaptEvolve प्रस्तुत करता है, जो एक ऐसा ढांचा है जो आंतरिक पीढ़ी विश्वास (intrinsic generation confidence) के आधार पर प्रत्येक परिशोधन चरण के लिए सबसे उपयुक्त लार्ज लैंग्वेज मॉडल को गतिशील रूप से चुनकर विकासवादी एआई एजेंटों की दक्षता में सुधार करता है, जिससे उच्च सटीकता बनाए रखते हुए अनुमान लागत (inference costs) में लगभग 38% की कमी आती है।

मूल लेखक: Pretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

प्रकाशित 2026-04-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उच्च-जोखिम वाली प्रोग्रामिंग प्रतियोगिता चला रहे हैं जहाँ लक्ष्य जटिल प्रोग्रामिंग पहेलियों को हल करना है। आपके पास आपकी मदद के लिए दो प्रकार के समीक्षक (reviewers) उपलब्ध हैं:

  1. जूनियर इंटर्न (छोटा मॉडल): तेज़, सस्ता, और सामान्य कार्यों को संभालने में उत्कृष्ट। हालाँकि, वे वास्तव में कठिन, पेचीदा समस्याओं पर अटक सकते हैं या गलतियाँ कर सकते हैं।
  2. सीनियर एक्सपर्ट (बड़ा मॉडल): अत्यंत बुद्धिमान और सबसे कठिन पहेलियों को हल करने में सक्षम, लेकिन धीमा, नियुक्त करने में महंगा, और उत्तर देने में अधिक समय लेता है।

समस्या:
पारंपरिक "विकासवादी" (evolutionary) AI सिस्टम में (जहाँ AI प्रयास करता है, विफल होता है, सीखता है और फिर से प्रयास करता है), सिस्टम आमतौर पर एक समीक्षक को चुनता है और पूरी प्रक्रिया के लिए उसी के साथ बना रहता है।

  • यदि आप केवल इंटर्न का उपयोग करते हैं, तो आप पैसा बचाते हैं लेकिन शायद सबसे कठिन पहेलियों को कभी हल न कर पाएं।
  • यदि आप केवल एक्सपर्ट का उपयोग करते हैं, तो आप सब कुछ हल कर लेते हैं, लेकिन इसमें बहुत अधिक खर्च आता है और बहुत समय लगता है।
  • कुछ सिस्टम एक "नियम पुस्तिका" (static routing) का उपयोग करने का प्रयास करते हैं ताकि यह तय किया जा सके कि किसे परामर्श दिया जाए, लेकिन ये नियम कठोर होते हैं। उन्हें यह नहीं पता होता कि इंटर्न वास्तव में कब आश्वस्त महसूस कर रहा है या समस्या अचानक कितनी कठिन हो गई है।

समाधान: AdaptEvolve
लेखकों ने एक नया सिस्टम विकसित किया है जिसे AdaptEvolve कहा जाता है। कल्पना कीजिए कि यह एक बुद्धिमान, वास्तविक समय का मैनेजर है जो यह देखता है कि इंटर्न कैसे काम कर रहा है और यह तय करता है कि उसे काम पूरा करने देना है या सीनियर एक्सपर्ट को बुलाना है।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "कॉन्फिडेंस पल्स" (आत्मविश्वास की धड़कन) को सुनना

बाहरी विशेषज्ञ से यह अनुमान लगाने के लिए पूछने के बजाय कि समस्या कितनी कठिन है, AdaptEvolve इंटर्न के अपने "मूड" को सुनता है।

  • जब इंटर्न कोड टाइप करता है, तो सिस्टम उनके आत्मविश्वास (confidence) की जाँच करता है।
  • उच्च आत्मविश्वास: इंटर्न धाराप्रवाह टाइप करता है, अपने उत्तरों के प्रति आश्वस्त है, और कोड ठोस दिखता है। सिस्टम कहता है: "बहुत बढ़िया! चलते रहो, इंटर्न। तुम यह कर सकते हो।"
  • कम आत्मविश्वास: इंटर्न हिचकिचाता है, पीछे हटता है, या कोड डगमगाता हुआ दिखता है (उच्च "एन्ट्रॉपी" या अनिश्चितता)। सिस्टम कहता है: "ओह नहीं, यह जोखिम भरा लग रहा है। रुक जाओ! चलिए इस विशिष्ट भाग के लिए सीनियर एक्सपर्ट को बुलाते हैं।"

2. "वार्म-अप" और "अनुकूली प्रबंधक" (Adaptive Manager)

इन निर्णयों को सीखने के लिए, सिस्टम एक त्वरित वार्म-अप (50 समस्याओं के साथ एक अभ्यास दौर की तरह) आयोजित करता है।

  • यह देखता है कि इंटर्न इन 50 समस्याओं को कैसे हल करता है और नोट करता है: "जब इंटर्न यहाँ हिचकिचाया, तो वह विफल रहा। जब वह वहाँ आश्वस्त था, तो वह सफल रहा।"
  • यह डेटा के आधार पर एक सरल डिसीजन ट्री (फ्लोचार्ट) बनाता है।
  • महत्वपूर्ण बात यह है कि यह मैनेजर अनुकूली (adaptive) है। यदि प्रतियोगिता अधिक कठिन हो जाती है (जैसे-जैसे AI कठिन समस्याओं को हल करने के लिए विकसित होता है), तो मैनेजर अपने नियमों को तुरंत अपडेट करता है। यदि समस्याएँ अधिक पेचीदा हो जाती हैं, तो मैनेजर एक्सपर्ट को जल्दी बुलाने के बारे में सीख जाता है। यह किसी स्थिर नियम पुस्तिका पर निर्भर नहीं है जो पुराना हो जाए।

3. परिणाम: दोनों दुनियाओं का सर्वश्रेष्ठ संगम

लेखकों ने प्रोग्रामिंग बेंचमार्क (जैसे LiveCodeBench और MBPP) पर इस सिस्टम का परीक्षण किया। उन्होंने यहाँ क्या पाया:

  • लागत बचत: इंटर्न को आसान काम संभालने देने और केवल अत्यंत आवश्यक होने पर ही महंगे एक्सपर्ट को बुलाने से, उन्होंने कुल कंप्यूटेशनल लागत को लगभग 38% कम कर दिया।
  • प्रदर्शन: उन्होंने गुणवत्ता में बहुत अधिक कमी नहीं की। सिस्टम अभी भी उन 97.5% समस्याओं को हल करता है जिन्हें "केवल एक्सपर्ट वाला" सिस्टम हल कर सकता था।
  • दक्षता: इसने एक "पारेटो फ्रंटियर" (Pareto frontier) बनाया, जो एक सुंदर तरीका है यह कहने का कि उन्होंने वह आदर्श संतुलन पा लिया है जहाँ आपको अपने पैसे के बदले सबसे अधिक मूल्य मिलता है।

सारांश उपमा

कल्पना कीजिए कि आप कार चला रहे हैं।

  • पुराना तरीका: या तो आप पूरी दूरी एक धीमी, ईंधन-कुशल कॉम्पैक्ट कार में तय करते हैं (कुछ भी भारी हल नहीं कर पाते) या एक ईंधन की खपत करने वाली रेस कार में (सब कुछ हल करते हैं, लेकिन बहुत खर्च होता है)।
  • AdaptEvolve: आप हाईवे पर कॉम्पैक्ट कार चलाते हैं। लेकिन जैसे ही आप सामने एक खड़ी, पथरीली पहाड़ी सड़क देखते हैं (एक कठिन समस्या), आपका बुद्धिमान सिस्टम आपको तुरंत एक रेस कार में बदल देता है। एक बार जब आप पहाड़ पार कर लेते हैं, तो यह वापस कॉम्पैक्ट कार में बदल जाता है। आप गैस बचाते हैं, लेकिन आप पहाड़ को भी फतह करते हैं।

यह पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता है कि यह कविता लिखने या गणितीय प्रमाण जैसे गैर-प्रोग्रामिंग कार्यों के लिए काम करता है, जहाँ "उत्तर" कोई कोड नहीं है जिसे स्वचालित रूप से टेस्ट किया जा सके।
  • यह दावा नहीं करता है कि यह मानव प्रोग्रामरों को पूरी तरह से बदल देगा, बल्कि यह AI प्रोग्रामिंग प्रक्रिया को सस्ता और तेज़ बनाने के बारे में है।
  • यह विशेष रूप से "विकासवादी" (evolutionary) सिस्टम पर केंद्रित है जहाँ AI कोड उत्पन्न करता है, परीक्षण करता है, और समय के साथ सुधार करता है।

संक्षेप में, AdaptEvolve एक बुद्धिमान स्विच है जो AI की अपनी "अंतरात्मा" (आत्मविश्वास) का उपयोग यह तय करने के लिए करता है कि कब एक सस्ते उपकरण का उपयोग करना है और कब महंगे एक्सपर्ट को बुलाना है, जिससे गुणवत्ता से बहुत अधिक समझौता किए बिना पैसे की बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →