← नवीनतम पेपर
💻 computer science

Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning

स्टेबल-लेयर्स (Stable-Layers) एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो रिवॉर्ड संपीड़न (reward compression) को दूर करने के लिए वीएलएम-स्कोर (VLM-scored) फीडबैक के माध्यम से दो-चरणीय मूल्यांकन पाइपलाइन का उपयोग करके इमेज लेयर डिकंपोजिशन मॉडल्स को फाइन-ट्यून करता है, जिसके परिणामस्वरूप बिना युग्मित पर्यवेक्षण (paired supervision) के बेहतर लेयर पृथक्करण और पुनर्निर्माण गुणवत्ता प्राप्त होती है।

मूल लेखक: Ciara Rowles, Reshinth Adithyan, Nikhil Pinnaparaju, Vikram Voleti, Mark Boss

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ciara Rowles, Reshinth Adithyan, Nikhil Pinnaparaju, Vikram Voleti, Mark Boss

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुंदर, जटिल पेंटिंग है। अभी, यह कैनवास पर केवल एक सपाट छवि है। यदि आप इसे संपादित करना चाहते हैं—जैसे, पेड़ को बाईं ओर ले जाना या कार का रंग बदलना—तो आपको एक "जादुई इरेज़र" और "जादुई पेंट" का उपयोग करके पेड़ को मैन्युअल रूप से काटने और पृष्ठभूमि को फिर से पेंट करने की आवश्यकता होगी। यह थकाऊ है और अक्सर नकली लगता है।

Stable-Layers एक नया टूल है जो स्वचालित रूप से उस सपाट पेंटिंग को पारदर्शी "शीट्स" (जैसे फोटोशॉप में लेयर्स) के एक स्टैक में अलग कर देता है। एक शीट में केवल पेड़ है, दूसरी में केवल कार है, और तीसरी शीट में पृष्ठभूमि है जिसमें पेड़ और कार पहले से ही "पेंट किए हुए" हैं जहाँ वे पहले थे। यह संपादन को आसान बनाता है: आप बस पेड़ वाली शीट को उठाते हैं और उसे हिला देते हैं।

हालांकि, कंप्यूटर को इस अलगाव को पूरी तरह से करने के लिए सिखाना अविश्वसनीय रूप से कठिन है। वास्तविक दुनिया की तस्वीरों के लिए कोई "उत्तर कुंजी" (answer key) नहीं होती है। यदि आप कंप्यूटर से एक पुल पर खड़े व्यक्ति की फोटो को अलग करने के लिए कहते हैं, तो इसे करने के कई तरीके हैं, और हमारे पास कंप्यूटर को यह दिखाने के लिए कोई आदर्श उदाहरण नहीं है कि "सही" क्या दिखता है।

समस्या: कंप्यूटर अनुमान लगा रहा है

लेखकों ने एक स्मार्ट कंप्यूटर मॉडल (Qwen-Image-Layered) से शुरुआत की जो पहले से ही इस काम में काफी अच्छा था। लेकिन वह अभी भी गलतियाँ करता था। कभी-कभी वह:

  • पृष्ठभूमि को काला या धुंधला छोड़ देता था।
  • पूरी तस्वीर को एक ही लेयर पर रख देता था और अन्य लेयर्स को खाली छोड़ देता था।
  • किसी व्यक्ति को बीच से काट देता था, जैसे उसका सिर एक लेयर पर और पैर दूसरी लेयर पर।

इसे ठीक करने के लिए, उन्हें कंप्यूटर को सिखाने के तरीके की आवश्यकता थी बिना हर एक फोटो के लिए मानव द्वारा बनाया गया सटीक उत्तर दिए।

समाधान: "कला समीक्षक" और "स्वाद परीक्षण"

लेखकों ने Reinforcement Learning नामक एक चतुर तकनीक का उपयोग किया। कंप्यूटर को सही उत्तर दिखाने के बजाय, उन्होंने इसे प्रयास करने दिया, और फिर उन्होंने एक AI कला समीक्षक (एक विजन-लैंग्वेज मॉडल, या VLM) का उपयोग किया जो उसके प्रयासों को ग्रेड देने के लिए किया गया।

यहाँ बताया गया है कि उन्होंने इस प्रशिक्षण को कैसे काम करने के योग्य बनाया, एक सरल उपमा का उपयोग करते हुए:

1. "स्वाद परीक्षण" (समूह चुनौती)
कल्पना कीजिए कि आप एक शेफ हैं जो एक आदर्श सूप बनाने की कोशिश कर रहे हैं। आप एक साथ 16 कटोरे (उम्मीदवार) बनाते हैं।

  • पुराना तरीका: आप प्रत्येक कटोरे को व्यक्तिगत रूप से चखते हैं और उसे 1 से 10 तक का स्कोर देते हैं। समस्या यह है कि समीक्षक बहुत विनम्र या बहुत सख्त हो सकता है, जिससे हर कटोरे को "7" मिल जाता है। यदि उन सभी को 7 मिलता है, तो आपको पता नहीं चलेगा कि कौन सा वास्तव में बेहतर है।
  • Stable-Layers का तरीका (दो-चरणीय स्कोरिंग):
    • चरण 1: समीक्षक प्रत्येक कटोरे को व्यक्तिगत रूप से चखता है और एक मोटा स्कोर देता है।
    • चरण 2 (ग्रिड अंशांकन/Calibration): समीक्षक सभी 16 कटोरों को एक बड़ी मेज पर एक साथ रखता है। अब, समीक्षक उन्हें एक साथ देखता है और कहता है, "ठीक है, कटोरा #3 स्पष्ट रूप से कटोरा #12 से बेहतर है, लेकिन कटोरा #5 सबसे अच्छा है।"
    • यह क्यों मायने रखता है: यह आमने-सामने का तुलनात्मक अध्ययन समीक्षक को चयनात्मक होने के लिए मजबूर करता है। यह एक स्पष्ट रैंकिंग (विचलन) बनाता है ताकि कंप्यूटर को पता चल सके कि किन प्रयासों की नकल करनी है और किनसे बचना है।

2. "जादुई पेंटब्रश" (Flow-GRPO)
कंप्यूटर इन रैंकिंग से सीखने के लिए एक विशेष गणितीय प्रक्रिया (Flow-GRPO) का उपयोग करता है। यह केवल "सर्वश्रेष्ठ" सूप को याद नहीं करता; यह सीखता है कि "सर्वश्रेष्ठ" सूप के करीब पहुँचने के लिए अपने "सामग्रियों" को किस दिशा में ले जाना है। हजारों प्रयासों के बाद, यह लेयर्स को अलग करने में बेहतर होता जाता है।

उन्होंने क्या हासिल किया

इस "कला समीक्षक" और "आमने-सामने" ग्रेडिंग सिस्टम का उपयोग करके, नया Stable-Layers मॉडल मूल मॉडल की तुलना में बहुत अधिक स्मार्ट बन गया:

  • स्वच्छ अलगाव: यह विशिष्ट वस्तुओं (जैसे व्यक्ति, पेड़ या कार) को बिना काटे अपनी अलग लेयर्स पर रखता है।
  • बेहतर बैकग्राउंड: जब यह किसी वस्तु को हटाता है, तो यह पृष्ठभूमि को वास्तविक रूप से भर देता है (जैसे पुल के पीछे पहाड़ दिखाई देना) बजाय इसके कि वहां एक काला छेद छोड़ दे।
  • "खाली" लेयर्स नहीं: यह ऐसी लेयर्स बनाना बंद कर देता है जो केवल खाली या शोर (noise) से भरी होती हैं।

सावधानी (सीमाएँ)

पेपर में कुछ बातें ध्यान में रखने के लिए नोट की गई हैं:

  • समीक्षक एक 'ब्लैक बॉक्स' है: उन्होंने जज के रूप में एक विशिष्ट, प्रोप्रायटरी AI (Gemini) का उपयोग किया। यदि वह AI भविष्य में यह बदलने का निर्णय लेता है कि "अच्छा" क्या दिखता है, तो प्रशिक्षण को समायोजित करने की आवश्यकता हो सकती है।
  • लागत: प्रशिक्षण के प्रत्येक चरण के लिए इन "स्वाद परीक्षणों" को चलाने के लिए बहुत अधिक कंप्यूटर पावर और धन की आवश्यकता होती है।
  • लेयर की संख्या: उन्होंने दक्षता के लिए एक बार में 5 लेयर्स तक संभालने के लिए इसे प्रशिक्षित किया है, हालांकि मूल मॉडल इससे अधिक संभाल सकता है।

संक्षेप में, Stable-Layers कंप्यूटर को जटिल छवियों को संपादन योग्य टुकड़ों में सुलझाने के लिए प्रशिक्षित करता है, इसके लिए कि वह अभ्यास करे, एक AI जज उसके काम को ग्रेड दे, और उस जज को "ठीक" और "महान" के बीच के सूक्ष्म अंतर को खोजने के लिए सभी प्रयासों की आपस में तुलना करने के लिए मजबूर करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →