← नवीनतम पेपर
💻 computer science

SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback

SAIL एक नवीन फ्रेमवर्क है जो डिफ्यूजन मॉडल्स को सेल्फ-एनोटेशन और रैंक की गई प्रेफरेंस मिक्सअप की एक क्लोज्ड-लूप प्रक्रिया के माध्यम से पुनरावृत्ति द्वारा स्वयं को सुधारने की प्रक्रिया के जरिए न्यूनतम फीडबैक का उपयोग करके मानवीय प्राथमिकताओं के साथ प्रभावी संरेखण प्राप्त करने में सक्षम बनाता है।

मूल लेखक: Xiaoxuan He, Siming Fu, Wanli Li, Zhiyuan Li, Dacheng Yin, Kang Rong, Fengyun Rao, Bo Zhang

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xiaoxuan He, Siming Fu, Wanli Li, Zhiyuan Li, Dacheng Yin, Kang Rong, Fengyun Rao, Bo Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बच्चे को सुंदर परिदृश्य (landscapes) पेंट करना सिखा रहे हैं।

वर्तमान में, लोग AI (डिफ्यूजन मॉडल) को "अच्छा" कला बनाना सिखाने के दो तरीके अपनाते हैं:

  1. "विशाल पुस्तकालय" विधि (Offline DPO): आप बच्चे को दस लाख पेंटिंग्स की एक लाइब्रेरी देते हैं, जिनमें से प्रत्येक को "अच्छा" या "बुरा" लेबल किया गया है। यह काम तो करता है, लेकिन इसमें बहुत अधिक खर्च होता है और इसे व्यवस्थित करने में बहुत समय लगता है।
  2. "सख्त जज" विधि (Online DPO): आप एक पेशेवर कला समीक्षक को बच्चे के पास बैठने के लिए काम पर रखते हैं। हर बार जब बच्चा कुछ पेंट करता है, तो समीक्षक उसे एक स्कोर देता है। समस्या यह है कि समीक्षक के अजीब पूर्वाग्रह हो सकते हैं, या वे केवल एक ही चीज़ (जैसे चमकीले रंग) पर ध्यान दे सकते हैं और बाकी सब कुछ अनदेखा कर सकते हैं।

यह पेपर एक तीसरे तरीके का परिचय देता है: SAIL (Self-Amplified Iterative Learning)।

अवधारणा: "कलाकार-समीक्षक" लूप

एक विशाल सेना वाले शिक्षकों या एक अकेले पक्षपाती समीक्षक के बजाय, SAIL, AI को एक ऐसे छात्र में बदल देता है जो स्वयं ही अपना शिक्षक भी है।

इसे एक "स्व-सुधार करने वाले संगीतकार" के रूप में सोचें।

कल्पना कीजिए कि एक गिटारवादक है जिसके पास शुरू में केवल एक वास्तविक शिक्षक से कुछ बुनियादी सबक हैं (यह "न्यूनतम मानवीय फीडबैक" है)। उन पहले कुछ पाठों के बाद, गिटारवादक अब शिक्षक का इंतज़ार नहीं करता है। इसके बजाय, वह तीन-चरणीय लूप का पालन करता है:

  1. जैम सेशन (Generation): गिटारवादक कई अलग-अलग धुनें बजाता है।
  2. स्व-आलोचना (Self-Rewarding): गिटारवादक अपनी खुद की बजाई हुई धुनों को वापस सुनता है। क्योंकि उसने बुनियादी बातें सीख ली हैं, वह बता सकता है, "वह धुन थोड़ी अस्त-व्यस्त थी, लेकिन इस धुन में लय बहुत अच्छी थी।" वह अपने प्रदर्शन को रैंक करता है।
  3. अभ्यास सत्र (Learning): वह अगला एक घंटा विशेष रूप से उन "अच्छी" धुनों को दोहराने और "खराब" धुनों को ठीक करने के अभ्यास में बिताता है।

इस लूप को बार-बार दोहराकर, गिटारवादक एक विशेषज्ञ (virtuoso) बन जाता है, भले ही उसके पास शुरू में केवल कुछ ही पाठ थे।

असली मंत्र: "मेमोरी मिक्सअप" (Memory Mixup)

इस "स्व-शिक्षण" पद्धति में एक खतरा है: "इको चैंबर प्रभाव" (Echo Chamber Effect)।

यदि कोई छात्र केवल खुद को सुनता है, तो वह यह मानने लग सकता है कि उसकी अपनी गलतियाँ वास्तव में शानदार हैं। वह एक लूप में फंस सकता है जहाँ वह केवल एक विशिष्ट प्रकार के सूर्यास्त को पेंट करना ही जारी रखता है क्योंकि उसे लगता है कि वह एकदम सही है, जिससे वह अंततः कुछ और पेंट करना भूल जाता है। वैज्ञानिक इसे "कैटास्ट्रोफिक फॉरगेटिंग" (catastrophic forgetting) या "डिस्ट्रीब्यूशन कोलैप्स" (distribution collapse) कहते हैं।

इसे रोकने के लिए, शोधकर्ताओं ने एक "मिक्सअप रणनीति" (Mixup Strategy) जोड़ी है।

कल्पना कीजिए कि हर बार जब गिटारवादक अपने नए स्व-सिखाए गए गीतों का अभ्यास करता है, तो उसे अनिवार्य रूप से अपना 25% समय वास्तविक शिक्षक से मिले उन मूल पाठों का अभ्यास करने में बिताना होता है। यह उसे वास्तविकता से जोड़े रखता है और उसे एक अजीब, दोहराव वाले संगीत के सम्मोहन में भटकने से रोकता है।

यह क्यों मायने रखता है?

इसके परिणाम प्रभावशाली हैं। शोधकर्ताओं ने पाया कि SAIL "विशाल पुस्तकालय" विधि की तुलना में बेहतर परिणाम प्राप्त कर सकता है, जबकि इसने केवल 6% डेटा का उपयोग किया।

संक्षेप में: SAIL यह सिद्ध करता है कि AI को हमेशा यह बताने के लिए इंसानों की एक विशाल सेना की आवश्यकता नहीं होती कि क्या "अच्छा" है। यदि आप इसे थोड़ा सा मार्गदर्शन और खुद की आलोचना करने का एक स्मार्ट तरीका दे दें, तो यह बहुत बेहतर, बहुत सुंदर कला बनाने के लिए अपनी छिपी हुई क्षमता को अनलॉक कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →