← नवीनतम पेपर
🤖 machine learning

ELMER: Evolutionary Language Model that Explores and Refines

यह शोध पत्र ELMER को प्रस्तुत करता है, जो एक विकासवादी भाषा मॉडल (evolutionary language model) है जो शक्ति के आधार पर प्राकृतिक-भाषा नीति उत्परिवर्तन (natural-language policy mutations) को निर्देशित करने के लिए डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन के साथ फाइन-ट्यून किए गए Qwen3-8B का उपयोग करता है, जो यह प्रदर्शित करता है कि भाषा-आधारित निरूपण (representations) प्रोग्राम विकास में पारंपरिक सिंटैक्टिक एडिट मेट्रिक्स की तुलना में बेहतर व्यवहार संबंधी अंशांकन (behavioral calibration) और खोज दक्षता प्रदान करते हैं।

मूल लेखक: Matthew Siper, Ahmed Khalifa, Julian Togelius

प्रकाशित 2026-08-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Matthew Siper, Ahmed Khalifa, Julian Togelius

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं, लेकिन आपके पास उसे जॉयस्टिक देने के बजाय, हर बार गलती करने पर आपको उसके लिए नियमों का एक नया सेट लिखना पड़ता है। यह प्रोग्राम इवोल्यूशन (program evolution) की दुनिया है, जहाँ वैज्ञानिक बेहतर सॉफ़्टवेयर को "प्रजनन" कराने के लिए कंप्यूटर का उपयोग करते हैं—मामूली बदलाव करके, उनका परीक्षण करके और विजेताओं को चुनकर। लंबे समय तक, यह प्रक्रिया अंधेरे में तीर चलाने जैसी रही है। वैज्ञानिक यह तो बता सकते थे कि कोड का नया संस्करण बेहतर है या बदतर, लेकिन उनके पास यह नियंत्रित करने का कोई तरीका नहीं था कि इसमें कितना बदलाव हुआ है। कोड के एक शब्द में एक छोटा सा बदलाव गलती से एक सौम्य चलने वाले रोबोट को एक अराजक, टकराने वाले मलबे में बदल सकता था, जबकि एक बड़ा पुनर्लेखन (rewrite) रोबोट को बिल्कुल वैसा ही छोड़ सकता था जैसा वह पहले था। बड़ा सवाल जो शोधकर्ता पूछ रहे थे वह यह है: क्या हम एक ऐसा सिस्टम बना सकते हैं जो न केवल यह समझे कि क्या बदलना है, बल्कि रोबोट के व्यवहार को कितनी दूर ले जाना है, ताकि हम उसे सटीक रूप से एक लक्ष्य की ओर निर्देशित कर सकें?

यहीं पर पेपर "ELMER: Evolutionary Language Model that Explores and Refines" आता है। शोधकर्ताओं, मैथ्यू सिपर, अहमद खलीफा और जूलियन टोगेलियस ने एक चतुर नया सिस्टम बनाया है जो एक बड़े लैंग्वेज मॉडल (एक सुपर-स्मार्ट AI जो मानव भाषा समझता है) का उपयोग एक "म्यूटेशन ऑपरेटर" के रूप में करता है। कंप्यूटर कोड को अंधाधुंध एडिट करने के बजाय, AI एक ट्रेडिंग रणनीति के प्राकृतिक भाषा विवरण (natural language description) को एडिट करता है—जैसे कि स्टॉक खरीदने और बेचने की एक रेसिपी। AI को तीन विशिष्ट कार्यों को समझने के लिए प्रशिक्षित किया गया है: एक रेसिपी को कोड में अनुवाद करना, कोड को वापस रेसिपी में अनुवाद करना, और सबसे महत्वपूर्ण बात, एक "स्ट्रेंथ" (शक्ति) कमांड के आधार पर रेसिपी को बदलना (mutate करना)। यदि आप AI को "लो स्ट्रेंथ" (कम शक्ति) वाला बदलाव करने के लिए कहते हैं, तो यह रेसिपी में थोड़ा सा बदलाव करता है। यदि आप "हाई स्ट्रेंथ" (उच्च शक्ति) कहते हैं, तो यह पूरी चीज़ को फिर से लिख देता है।

टीम ने इसका परीक्षण वित्तीय ट्रेडिंग पर किया, जिसमें ऐतिहासिक बाजार डेटा का उपयोग करके यह देखा गया कि नई रणनीतियाँ कितनी अच्छी तरह प्रदर्शन करती हैं। उन्होंने पाया कि AI को इस बात पर ध्यान देने के लिए प्रशिक्षित करके कि रोबोट के वास्तविक कार्य कैसे बदलते हैं (इसका "व्यवहार संबंधी विस्थापन" या behavioral displacement), वे "स्ट्रेंथ" कमांड को प्रभावी बना सके। जब उन्होंने एक छोटे बदलाव के लिए कहा, तो AI ने आमतौर पर एक छोटा बदलाव किया; जब उन्होंने एक बड़े बदलाव के लिए कहा, तो उसने एक बड़ा बदलाव किया। यह एक बड़ी बात है क्योंकि यह प्रोग्राम इवोल्यूशन की अराजक प्रक्रिया को कार चलाने (स्टीयरिंग) जैसा बना देता है। पेपर दिखाता है कि प्राकृतिक भाषा विवरणों का उपयोग करने से AI सीधे कच्चे कोड को एडिट करने की तुलना में अधिक स्मार्ट और नियंत्रित चालें चल पाता है। अपने परीक्षणों में, भाषा-आधारित सिस्टम ने उन सभी तरीकों में से सबसे अच्छा प्रदर्शन करने वाली ट्रेडिंग रणनीति खोजी, जिनका उन्होंने प्रयास किया था, और ऐसा उन्होंने अधिक कुशलता से किया, यानी कम प्रयासों के साथ अच्छे परिणाम प्राप्त किए। हालाँकि यह सिस्टम पूरी तरह से सटीक नहीं है और इसमें अभी भी कुछ अनिश्चितता (randomness) है, लेकिन परिणाम बताते हैं कि AI को मानव भाषा में अपने बदलावों के बारे में "बोलना" सिखाने से हमें संभावित कंप्यूटर प्रोग्रामों के विशाल स्थान के माध्यम से उसे निर्देशित करने का एक बहुत बेहतर तरीका मिलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →