← नवीनतम पेपर
🤖 AI

TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration

यह शोधपत्र TREX प्रस्तुत करता है, जो एक ट्री-आधारित सर्च फ्रेमवर्क के भीतर रिसर्चर (Researcher) और एक्जीक्यूटर (Executor) मॉड्यूल के बीच सहयोग को व्यवस्थित करके, एक मल्टी-एजेंट सिस्टम के रूप में पूरे LLM ट्रेनिंग लाइफसाइकिल को स्वचालित करता है, और नए FT-Bench बेंचमार्क के माध्यम से इसकी प्रभावशीलता को प्रदर्शित करता है।

मूल लेखक: Zerun Ma, Guoqiang Wang, Xinchen Xie, Yicheng Chen, He Du, Bowen Li, Yanan Sun, Wenran Liu, Kai Chen, Yining Li

प्रकाशित 2026-04-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zerun Ma, Guoqiang Wang, Xinchen Xie, Yicheng Chen, He Du, Bowen Li, Yanan Sun, Wenran Liu, Kai Chen, Yining Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु शेफ (AI एजेंट) है और एक बहुत ही विशिष्ट, कठिन चुनौती है: "एक आदर्श मॉलिक्यूलर सूप बनाएं जो स्वादिष्ट हो, स्वास्थ्यवर्धक हो और एक गुप्त रेसिपी का पालन करता हो।"

आमतौर पर, इस शेफ को सिखाने के लिए, आपको एक मानव मास्टर शेफ को सामग्री, तापमान और मसालों के साथ वर्षों तक प्रयोग करने की आवश्यकता होगी। लेकिन क्या होगा यदि आप एक ऐसा रोबोट बना सकें जो आपके लिए ये प्रयोग करे, और हर गलती और सफलता से सीखे?

यही TREX है। यह AI रोबकों की एक टीम है जिसे बड़े भाषा मॉडलों (LLMs) को विशिष्ट कार्यों में बेहतर बनाने के लिए स्वचालित रूप से सिखाने के लिए डिज़ाइन किया गया है, बिना किसी इंसान द्वारा हर कदम पर निगरानी किए।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. दो शेफ: रिसर्चर (शोधकर्ता) और एक्सेक्यूटर (निष्पादक)

TREX केवल एक रोबोट नहीं है; यह दो विशेषज्ञ एजेंटों के बीच की एक साझेदारी है जो मिलकर काम करते हैं:

  • द रिसर्चर (रणनीतिकार): इसे उस हेड शेफ के रूप में सोचें जो कुक बुक्स पढ़ता है, कुकिंग शो देखता है और पेंट्री (सामग्री भंडार) को देखता है। इसका काम यह तय करना है कि आगे क्या आज़माना है। "शायद हमें अधिक नमक की आवश्यकता है?" या "आइए एक अलग प्रकार का आटा आज़माते हैं।" यह योजना बनाने के लिए वैज्ञानिक शोध पत्रों और डेटा को पढ़ता है।
  • द एक्सेक्यूटर (हाथ): यह उस सु-शेफ (sous-chef) की तरह है जो वास्तव में खाना बनाता है। यह रिसर्चर की योजना लेता है, सामग्री (डेटा) उठाता है, चूल्हा (कंप्यूटर GPU) चालू करता है, और प्रयोग चलाता है। यह रिसर्चर को बताता है, "सूप जल गया," या "यह अद्भुत स्वाद वाला है!"

2. प्रयोगों का "पेड़" (संभावनाओं का मानचित्र)

जब इंसान प्रयोग करते हैं, तो वे अक्सर एक चीज़ आज़माते हैं, विफल होते हैं, फिर दूसरी चीज़ आज़माते हैं, और शायद याद रखते हैं कि क्या काम आया। TREX एक ट्री सर्च (Tree Search) का उपयोग करके इसे बड़े पैमाने पर करता है।

एक बगीचे में उगते हुए एक विशाल पेड़ की कल्पना करें:

  • जड़ें (Roots): शुरुआती बिंदु (बुनियादी मॉडल)।
  • शाखाएं (Branches): हर बार जब रिसर्चर के पास एक विचार आता है (जैसे, "अधिक डेटा जोड़ें" या "सीखने की गति बदलें"), तो यह एक नई शाखा उगाता है।
  • पत्तियां (Leaves): प्रयोगों के परिणाम।

TREX एक स्मार्ट एल्गोरिदम (जिसे MCTS कहा जाता है, एक सुपर-स्मार्ट GPS की तरह) का उपयोग यह तय करने के लिए करता है कि किन शाखाओं की खोज की जाए। यह केवल बेतरतीब ढंग से नहीं भटकता; यह देखता है कि कौन सी शाखाएं सबसे स्वादिष्ट सूप बना रही हैं और उन शाखाओं को और गहरा विकसित करता है, जबकि जो खराब स्वाद देती हैं उन्हें काट देता है। यह इसे मानव की तुलना में बहुत तेज़ी से सटीक रेसिपी खोजने में सक्षम बनाता है।

3. "जादुई पेंट्री" (AIDP लाइब्रेरी)

खाना पकाने का सबसे कठिन हिस्सा सामग्री तैयार करना है। आपको उन्हें पूरी तरह से काटना, धोना और मिलाना होता है। AI के लिए, यह "डेटा प्रोसेसिंग" है।

TREX के पास एक विशेष टूलकिट है जिसे AIDP (AI डेटा प्रोसेसर) कहा जाता है। इसे एक जादुвई, खुद को साफ करने वाली रसोई के रूप में सोचें जहाँ रोबोट बिना थके या गंदगी किए तुरंत 10,000 प्याज काट सकता है या 50 अलग-अलग मसालों को मिला सकता है। यह सुनिश्चित करता है कि बर्तन में जाने से पहले "सामग्री" (डेटा) हमेशा एकदम सही हो।

4. "स्वाद परीक्षण" (बैड-केस विश्लेषण)

जब एक्सेक्यूटर सूप का एक बैच पूरा करता है, तो वह केवल "अच्छा" या "बुरा" नहीं कहता। वह इसकी गहराई से जांच करता है।

  • स्वाद परीक्षण: यह देखता है कि ठीक कौन से व्यंजन विफल हुए।
  • निदान (Diagnosis): "ओह, सूप केवल तभी बहुत नमकीन था जब हमने टमाटरों का उपयोग किया था।"
  • सबक: रिसर्चर इस विशिष्ट विफलता से सीखता है और अगली योजना को समायोजित करता है। इसे बैड-केस एनालिसिस (Bad-Case Analysis) कहा जाता है। यह हर विफलता को एक मूल्यवान सबक में बदल देता है, जिससे यह सुनिश्चित होता है कि अगली कोशिश बेहतर हो।

5. चुनौती: FT-Bench

यह साबित करने के लिए कि यह रोबोट शेफ वास्तव में अच्छा है, लेखकों ने एक "कुकिंग ओलंपिक्स" बनाया जिसे FT-Bench कहा जाता है।

  • उन्होंने TREX को 10 अलग-अलग, बहुत कठिन चुनौतियाँ दीं (जैसे, "मेडिकल नोट्स लिखना," "नए अणु डिजाइन करना," या "कानूनी पहेलियाँ सुलझाना")।
  • उन्होंने देखा कि TREX ने इन्हें बार-बार हल करने की कोशिश की।
  • परिणाम: TREX ने न केवल ठीक-ठाक प्रदर्शन किया; कई मामलों में, इसने ऐसी रेसिपी तैयार कीं जो मानव विशेषज्ञों द्वारा बनाई गई रेसिपी से भी बेहतर थीं। इसने सामग्री और तकनीकों के ऐसे संयोजन खोज निकाले जिनके बारे में इंसानों ने नहीं सोचा था।

यह क्यों महत्वपूर्ण है

TREX से पहले, AI को नया कौशल सिखाना एक बच्चे को कार चलाने के निर्देश देते हुए बगल वाली सीट पर बैठकर चिल्लाने जैसा था। यह धीमा, महंगा था और इसके लिए एक मानव विशेषज्ञ की आवश्यकता थी।

TREX एक सेल्फ-ड्राइविंग कार की तरह है जो खुद को चलाना सिखाती है। यह सड़क की खोज करती है, दुर्घटनाग्रस्त होती है (सुरक्षित रूप से), दुर्घटना से सीखती है, और अपने आप सबसे अच्छा रास्ता निकाल लेती है।

इसका मतलब यह है कि भविष्य में, हमें AI मॉडल को ट्यून करने के लिए मानव डेटा वैज्ञानिकों की सेना की आवश्यकता नहीं होगी। हम बस AI को एक लक्ष्य दे सकते हैं, और TREX टीम बाहर जाएगी, प्रयोग करेगी, सीखेगी, और एक सुपर-स्मार्ट मॉडल लेकर वापस आएगी जो काम करने के लिए तैयार होगा। यह स्वयं "सीखने" की प्रक्रिया का स्वचालन (automation) है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →