← नवीनतम पेपर
💻 computer science

STRIDE: Post-Training LLMs to Reason and Refine Bio-Sequences via Edit Trajectories

STRIDE एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को डिस्क्रीट बायोलॉजिकल सीक्वेंस ऑप्टिमाइज़ेशन के लिए निष्पादन योग्य (executable), सत्यापन योग्य (verifiable) एडिट ट्रेजेक्टरीज जेनरेट करने में सक्षम बनाता है, जो प्रोटीन और मॉलिक्यूलर डिज़ाइन कार्यों में मौजूदा तरीकों की तुलना में सफलता दर और नवीनता (novelty) में महत्वपूर्ण सुधार करता है।

मूल लेखक: Daiheng Zhang, Shiyang Zhang, Sizhuang He, Yangtian Zhang, Syed Asad Rizvi, David van Dijk

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daiheng Zhang, Shiyang Zhang, Sizhuang He, Yangtian Zhang, Syed Asad Rizvi, David van Dijk

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक रेसिपी को बेहतर बनाने की कोशिश कर रहे हैं। आपके पास एक बुनियादी व्यंजन है (मूल प्रोटीन या अणु) जो खाने योग्य है, लेकिन आप इसे अद्भुत बनाना चाहते हैं (अधिक फ्लोरोसेंट, अधिक ड्रग-लाइक, या अधिक स्थिर)।

समस्या क्या है? आप बस यादृच्छिक (random) सामग्रियां नहीं डाल सकते। यदि आप बहुत अधिक नमक डालते हैं, तो व्यंजन खराब हो जाएगा। यदि आप कोई चरण भूल जाते हैं, तो केमिस्ट्री टूट जाएगी। आपको एक सटीक योजना की आवश्यकता है: "यहाँ एक चुटकी नमक डालें, वहाँ से एक गाजर निकालें, बेसिल को धनिया से बदलें।"

यह ठीक वैसा ही है जैसा STRIDE पेपर करता है, लेकिन खाना पकाने के बजाय जीव विज्ञान और रसायन विज्ञान के लिए।

यहाँ इसका सरल विवरण दिया गया है कि यह कैसे काम करता है, कुछ रोजमर्रा के उदाहरणों का उपयोग करते हुए:

1. समस्या: "ब्लैक बॉक्स" बनाम "ब्लूप्रिंट"

  • पुराना तरीका (डिफ्यूजन मॉडल्स): कल्पना करें कि आप एक कार को ठीक करने की कोशिश कर रहे हैं और उसे चलते समय उसे बेतरतीब ढंग से हिला रहे हैं, इस उम्मीद में कि कोई हिस्सा जादू से अपनी जगह पर फिट हो जाएगा। यह अंततः काम कर सकता है, लेकिन आपको पता नहीं होगा कि यह कैसे हुआ, और आप प्रक्रिया में इंजन को तोड़ भी सकते हैं। ये मॉडल अंतिम परिणाम का अनुमान लगाने में अच्छे हैं लेकिन चरणों को समझाने में खराब हैं।
  • अन्य पुराना तरीका (मानक AI): कल्पना करें कि एक शेफ है जो बस कहता है, "यहाँ नई रेसिपी है!" बिना यह बताए कि क्या बदला गया है। यह स्वादिष्ट हो सकता है, लेकिन अगर यह गलत है, तो आपको पता नहीं चलेगा कि इसे कैसे ठीक किया जाए।
  • STRIDE का समाधान: STRIDE AI को एक ब्लूप्रिंट के साथ मास्टर एडिटर के रूप में कार्य करने के लिए मजबूर करता है। अंतिम व्यंजन का अनुमान लगाने के बजाय, यह एक चरण-दर-चरण निर्देश पुस्तिका लिखता है: "चरण 1: टमाटर काटें। चरण 2: लहसुन डालें। चरण 3: प्याज निकालें।"

2. STRIDE कैसे काम करता है: दो-चरणीय प्रशिक्षण (Two-Stage Training)

STRIDE एक लार्ज लैंग्वेज मॉडल (शेफ) को यह करने के लिए दो चरणों में प्रशिक्षित करता है:

चरण 1: नियम सीखना (सुपरवाइज्ड फाइन-ट्यूनिंग)

  • उदाहरण: इसे एक शेफ को "एक टूटे हुए वाक्य को कैसे ठीक करें" पर एक पाठ्यपुस्तक देने के रूप में सोचें।
  • प्रक्रिया: शोधकर्ता एक "पहले" वाला अनुक्रम (एक जंगली प्रोटीन) और एक "बाद" वाला अनुक्रम (एक बेहतर प्रोटीन) लेते हैं। वे पहले को दूसरे में बदलने के लिए सबसे छोटा, सबसे कुशल तरीका खोजने के लिए एक गणितीय ट्रिक (जिसे लेवेनश्टीन अलाइनमेंट कहा जाता है) का उपयोग करते हैं।
  • परिणाम: AI संपादन (edits) की एक साफ सूची आउटपुट करना सीख जाता है: "यह अक्षर हटाएँ, वह अक्षर डालें, इस शब्द को बदलें।" यह वैध (molecules के व्याकरण को न तोड़ें) और न्यूनतम (अनावश्यक परिवर्तन न करें) बनना सीखता है।

चरण 2: लक्ष्य सीखना (रीइन्फोर्समेंट लर्निंग)

  • उदाहरण: अब शेफ नियमों को जानता है, लेकिन उन्हें यह सीखने की जरूरत है कि क्या स्वादिष्ट होता है
  • प्रक्रिया: AI एक विशिष्ट गुण (जैसे प्रोटीन को अधिक चमकीला बनाना) में सुधार करने के लिए संपादन करने की कोशिश करता है।
    • यदि संपादन प्रोटीन को अधिक चमकीला बनाता है, तो AI को एक "हाई फाइव" (पुरस्कार/रिवॉर्ड) मिलता है।
    • यदि संपादन प्रोटीन को तोड़ देता है या उसे कम चमकीला बना देता है, तो AI को "टाइम आउट" (दंड/पेनल्टी) मिलता है।
  • ट्विस्ट: AI को यह भी बताया जाता है, "चरण 1 में सीखे गए नियमों को न भूलें!" यह सुनिश्चित करता है कि वह केवल उच्च स्कोर पाने के लिए एक वैध दिखने वाला लेकिन टूटा हुआ अणु बनाकर धोखाधड़ी न करे।

3. सीक्रेट सॉस: "एडिट ट्रेजेक्टरीज" (Edit Trajectories)

STRIDE का जादू यह है कि यह अनुकूलन (optimization) की प्रक्रिया को केवल एक अंतिम चित्र के रूप में नहीं, बल्कि एक कहानी या मूवी स्क्रिप्ट की तरह मानता है।

  • यह क्यों मायने रखता है?
    • नियंत्रण: क्योंकि AI हर एक चरण (इन्सर्ट, डिलीट, रिप्लेस) लिखता है, इंसान उस स्क्रिप्ट को देख सकते हैं और कह सकते हैं, "आह, इसने स्थिरता के लिए यहाँ एक विशिष्ट अमीनो एसिड जोड़ा है।"
    • सुरक्षा: यदि AI अणु के किसी महत्वपूर्ण हिस्से को हटाने की कोशिश करता है, तो "स्क्रिप्ट" इसे तुरंत प्रकट कर देती है।
    • लचीलापन: यह अनुक्रम की लंबाई (सीक्वेंस की लंबाई) को बदलने में सक्षम है (अंकों को जोड़ना या हटाना), जो रेसिपी में सामग्री की संख्या बदलने जैसा है, जिसे कई अन्य AI मॉडल संभालने में संघर्ष करते हैं।

4. परिणाम: एक बेहतर शेफ

पेपर ने STRIDE का परीक्षण दो चीजों पर किया:

  1. प्रोटीन: उन्हें अधिक चमकदार (फ्लोरोसेंस) बनाना।
  2. अणु (Molecules): उन्हें बेहतर दवाएं बनाना (अधिक घुलनशील, सुरक्षित आदि)।

परिणाम:

  • सफलता दर: जटिल बदलाव करते समय STRIDE 42% बार सही होने से बढ़कर 89% बार सही होने लगा।
  • रचनात्मकता: इसने केवल मौजूदा रेसिपी की नकल नहीं की; इसने 97% नए, अद्वितीय समाधानों का आविष्कार किया जिन्हें किसी ने पहले नहीं देखा था।
  • विश्वसनीयता: अन्य तरीकों की तुलना में इसने शायद ही कभी "टूटे हुए" अणु (अमान्य रसायन विज्ञान) बनाए।

सारांश

STRIDE AI को एक रैंडम गेसर के बजाय एक सर्जिकल एडिटर बनने के लिए सिखाने जैसा है। केवल बेहतर जैविक अनुक्रम की उम्मीद करने के बजाय, यह एक सटीक, चरण-दर-चरण "एडिट स्क्रिप्ट" लिखता है जो एक शुरुआती बिंदु को बेहतर में बदल देता है। यह इस प्रक्रिया को पारदर्शी, नियंत्रणीय और नए उपचारों और प्रोटीनों को बनाने में बहुत अधिक सफल बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →