← नवीनतम पेपर
🤖 AI

STAR: SpatioTemporal Adaptive Reward Allocation for Text-to-Image RL Post-Training

यह शोध पत्र STAR का प्रस्ताव करता है, जो टेक्स्ट-टू-इमेज RL पोस्ट-ट्रेनिंग के लिए एक स्पैटियोटेम्पोरल एडेप्टिव रिवॉर्ड एलोकेशन (SpatioTemporal Adaptive Reward Allocation) विधि है, जो टेक्स्ट-इमेज अटेंशन के आधार पर डिनोइजिंग स्टेप्स के दौरान प्रासंगिक लेटेंट क्षेत्रों में रिवॉर्ड को गतिशील रूप से वितरित करता है, जिससे बिना किसी अतिरिक्त कंप्यूटेशनल ओवरहेड के कंपोजिशनल अलाइनमेंट, टेक्स्ट रेंडरिंग और प्रेफरेंस ऑप्टिमाइजेशन में सुधार होता है।

मूल लेखक: Jinjie Shen, Wei Deng, Xian Hu, Daiguo Zhou, Jian Luan

प्रकाशित 2026-06-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinjie Shen, Wei Deng, Xian Hu, Daiguo Zhou, Jian Luan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली कलाकार को किसी विशिष्ट विवरण के आधार पर चित्र बनाना सिखा रहे हैं, जैसे कि "नीले आकाश के नीचे खड़ी एक लाल साइकिल।"

अतीत में, फीडबैक से सीखने के लिए आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करते समय, प्रक्रिया थोड़ी भद्दी थी। यदि AI ने चित्र गलत बनाया, तो शिक्षक (कंप्यूटर प्रोग्राम) कहता, "तुमने पूरा पेंटिंग ही गलत बना दिया," और उस आलोचना को हर एक ब्रशस्ट्रोक पर समान रूप से लागू करता। इससे कोई फर्क नहीं पड़ता था कि गलती साइकिल के रंग की थी या पृष्ठभूमि में बादल के आकार की; AI को आकाश के लिए भी उतनी ही "डांट" मिलती जितनी साइकिल के लिए। यह एक छात्र को यह बताने जैसा है कि उसने एक बुरा निबंध लिखा है और इसलिए वह हर एक शब्द में फेल हो गया, जबकि कुछ शब्द बिल्कुल सही थे।

यह पेपर STAR (SpatioTemporal Adaptive Reward Allocation) नामक एक नई विधि पेश करता है जो इस समस्या को ठीक करने में मदद करती है। STAR को एक स्मार्ट स्पॉटलाइट के रूप में समझें जो AI शिक्षक को अधिक सटीक रूप से फीडबैक देने में मदद करती है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "एक ही आकार के सभी के लिए" वाली डांट

टेक्स्ट-टू-इमेज AI मॉडल एक धुंधले ढेर को धीरे-धीरे एक स्पष्ट चित्र में बदलकर काम करते हैं।

  • पुराना तरीका: जब AI चित्र पूरा कर लेता था, तो कंप्यूटर यह जाँचता था कि क्या यह टेक्स्ट से मेल खाता है। यदि स्कोर कम होता, तो यह पूरी प्रक्रिया के माध्यम से एक एकल "खराब ग्रेड" वापस भेज देता था। इसने बैकग्राउंड (आकाश, सड़क) और मुख्य विषय (साइकिल) दोनों के साथ बिल्कुल एक जैसा व्यवहार किया।
  • समस्या: AI यह नहीं बता पाता था कि पेंटिंग के किस हिस्से के कारण वास्तव में समस्या आई है। वह शायद आकाश को ठीक करने में समय बर्बाद कर देता, जबकि असली गलती साइकिल के पहियों में थी।

2. समाधान: "स्मार्ट स्पॉटलाइट" (STAR)

STAR खेल बदल देता है क्योंकि यह देखता है कि पेंटिंग करते समय AI कहाँ ध्यान दे रहा था।

  • मन को पढ़ना: जैसे ही AI चित्र बनाता है, वह टेक्स्ट प्रॉम्प्ट ("लाल साइकिल") को देखता है और पूछता है, "मेरी पेंटिंग का कौन सा हिस्सा वर्तमान में 'साइकिल' शब्द के बारे में सोच रहा है?" यह एक विशिष्ट स्थान खोजने के लिए "अटेंशन" (attention) नामक एक अंतर्निहित मानचित्र का उपयोग करता है कि कैनवास के कौन से हिस्से महत्वपूर्ण हैं।
  • फीडबैक निर्देशित करना: जब शिक्षक एक स्कोर देता है, तो STAR उस एकल स्कोर को लेता है और पेंटिंग के केवल उन हिस्सों पर एक तेज स्पॉटलाइट चमकाता है जो महत्वपूर्ण हैं (साइकिल)। यह उन हिस्सों पर स्पॉटलाइट को धीमा कर देता है जो महत्वपूर्ण नहीं हैं (आकाश)।
  • परिणाम: AI अब जानता है, "आह, मुझे साइकिल को ठीक करने की आवश्यकता है क्योंकि फीडबैक सबसे मजबूत वहीं था," बजाय इसके कि वह पूरी तस्वीर को अंधेरे में सुधारने की कोशिश करे।

3. "समय" का कारक

पेपर यह भी उल्लेख करता है कि यह समय के साथ होता है।
कल्पना कीजिए कि पेंटिंग की प्रक्रिया एक फिल्म है।

  • फिल्म की शुरुआत में, AI सामान्य लेआउट (साइकिल कहाँ जाएगी) का खाका खींच रहा होता है।
  • बाद में, वह विवरण (लाल रंग, स्पोक्स) जोड़ रहा होता है।
    STAR जानता है कि "लाल" भाग वाला प्रॉम्प्ट विवरण चरण के दौरान अधिक महत्वपूर्ण होता है, जबकि "साइकिल" का आकार स्केच चरण के दौरान अधिक महत्वपूर्ण होता है। यह हर एक फ्रेम में स्पॉटलाइट की तीव्रता को ठीक करता है ताकि वह उस सटीक क्षण में AI के काम से मेल खा सके।

4. परिणाम: एक बेहतर कलाकार

शोधकर्ताओं ने एक शक्तिशाली AI मॉडल (Stable Diffusion 3.5) पर इस नई विधि का परीक्षण किया। उन्होंने इसे तीन कठिन चीजें करने के लिए कहा:

  1. जटिल दृश्य: सही स्थानों पर कई वस्तुओं को बनाना (जैसे "कुत्ते के बगल में बिल्ली")।
  2. चित्रों में टेक्स्ट: यह सुनिश्चित करना कि चित्र के भीतर लिखे गए शब्द सही ढंग से स्पेल किए गए हैं।
  3. मानवीय प्राथमिकता: ऐसी तस्वीरें बनाना जिन्हें इंसान वास्तव में पसंद करते हैं।

परिणाम:
इस "स्मार्ट स्पॉटलाइट" विधि का उपयोग करके, AI निर्देशों का पालन करने में काफी बेहतर हो गया। उसे एक नए शिक्षक या नए प्रकार के टेस्ट की आवश्यकता नहीं थी; उसे बस यह जानने की आवश्यकता थी कि फीडबैक पर कहाँ ध्यान देना है।

  • इसने वस्तुओं को गिनने और रंगों को सही करने की अपनी क्षमता में सुधार किया।
  • यह चित्रों के भीतर टेक्स्ट लिखने में बहुत बेहतर हो गया।
  • इसने ऐसी तस्वीरें बनाईं जिन्हें इंसानों ने उच्च रेटिंग दी।

मुख्य बात

STAR को AI की सीखने की प्रक्रिया को एक कुंद हथौड़े (पूरी छवि पर समान फीडबैक के साथ प्रहार करना) से अपग्रेड करके एक स्केलपेल (सटीक रूप से उन विशिष्ट भागों को लक्षित करना जिन्हें सुधार की आवश्यकता है) में बदलने के रूप में समझें।

सबसे अच्छी बात? यह अपग्रेड बहुत सस्ता है। यह कंप्यूटर को धीमा नहीं करता है या इसके लिए भारी मात्रा में अतिरिक्त मेमोरी की आवश्यकता नहीं होती है। यह बस उस जानकारी का उपयोग करता है जो AI पहले से ही उत्पन्न कर रहा था ताकि सीखने की प्रक्रिया को बहुत अधिक स्मार्ट और कुशल बनाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →