← नवीनतम पेपर
🤖 AI

Beyond Cropping and Rotation: Automated Evolution of Powerful Task-Specific Augmentations with Generative Models

यह शोध पत्र EvoAug को प्रस्तुत करता है, जो एक स्वचालित पाइपलाइन है जो जनरेटिव मॉडल्स को एक इवोल्यूशनरी एल्गोरिदम के साथ जोड़कर इष्टतम, पदानुक्रमित कार्य-विशिष्ट डेटा ऑग्मेंटेशन (data augmentations) सीखना सुनिश्चित करती है, जो फाइन-ग्रेन्ड क्लासिफिकेशन और फ्यू-शॉट लर्निंग परिदृश्यों में बेहतर प्रदर्शन प्रदर्शित करती है।

मूल लेखक: Judah Goldfeder, Shreyes Kaliyur, Vaibhav Sourirajan, Patrick Minwan Puma, Philippe Martin Wyder, Yuhang Hu, Jiong Lin, Hod Lipson

प्रकाशित 2026-02-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Judah Goldfeder, Shreyes Kaliyur, Vaibhav Sourirajan, Patrick Minwan Puma, Philippe Martin Wyder, Yuhang Hu, Jiong Lin, Hod Lipson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अलग-अलग प्रकार के फूलों को पहचानना सिखाने की कोशिश कर रहे हैं। आपके पास केवल एक गुलाब की तस्वीर, एक ट्यूलिप की और एक डेज़ी की है। यदि आप रोबोट को केवल ये तीन तस्वीरें दिखा देंगे, तो वह भ्रमित हो सकता है। उसे लग सकता है कि गुलाब सिर्फ एक "लाल गोला" है और वह बाद में गुलाबी गुलाब को पहचानने में विफल रहेगा।

इसे ठीक करने के लिए, इंसान डेटा ऑग्मेंटेशन (data augmentation) का उपयोग करते हैं। यह आपकी गुलाब की एक अकेली फोटो को उसकी कई कॉपियां बनाने जैसा है: उसे क्रॉप करना, उसे तिरछा करना, उसे चमकीला बनाना, या उसे पलटना। यह रोबोट को सीखने के लिए अधिक उदाहरण देता है बिना नई तस्वीरें लिए।

लंबे समय तक, ये "कॉपियां" केवल साधारण गणितीय ट्रिक्स (जैसे इमेज को घुमाना) थीं। लेकिन हाल ही में, AI इतना अच्छा हो गया है कि वह पूरी तरह से नई, वास्तविक दिखने वाली छवियां बना सकता है। समस्या क्या है? यदि आप AI से कहें कि "एक गुलाब बनाओ," तो हो सकता है कि वह इसे चार के बजाय पांच पंखुड़ियों के साथ बनाए, या इसमें एक अजीब तना दे दे। यदि आप अपने रोबोट को इन "नकली" फूलों से सिखाते हैं, तो वह गलत सबक सीख सकता है।

एंट्र "EvoAug": द एआई गार्डनर (AI Gardener)

यह पेपर एक नई प्रणाली पेश करता है जिसे EvoAug (इवोल्यूशनरी ऑग्मेंटेशन) कहा जाता है। इसे एक स्मार्ट माली की तरह समझें जो केवल फूलों की कॉपी-पेस्ट नहीं करता, बल्कि उसे ठीक जानता है कि रोबोट को बेहतर ढंग से सिखाने के लिए उन्हें कैसे बदलना है।

यह कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:

1. "मैजिक बॉक्स" बनाम "कॉपी मशीन"

पारंपरिक तरीके एक कॉपी मशीन की तरह हैं। वे आपकी फोटो लेते हैं और उस पर बुनियादी फिल्टर (रोटेट, क्रॉप, रंग बदलना) लागू करते हैं।
EvoAug एक मैजिक बॉक्स (जेनरेटिव AI) का उपयोग करता है। यह बॉक्स आपकी फोटो को देख सकता है और कह सकता है, "ठीक है, आइए इस फूल को थोड़े अलग कोण से देखते हैं," या "आइए लाइटिंग को सूर्यास्त जैसा बनाने के लिए बदलते हैं।"

  • जोखिम: यदि मैजिक बॉक्स बहुत ज्यादा अनियंत्रित हो जाए, तो वह गुलाब को सूरजमुखी में बदल सकता है। यह बुरा है।
  • समाधान: EvoAug मैजिक बॉक्स को मनमानी करने नहीं देता। यह बॉक्स को मजबूर करता है कि वह मूल फोटो का उपयोग एक सख्त गाइड (जैसे एक स्टेंसिल) के रूप में करे, ताकि नई छवि मूल फूल जैसी ही दिखे, बस उसमें दिलचस्प बदलाव हों।

2. "इवोल्यूशनरी गेम" (विकासवादी खेल)

सिस्टम को कैसे पता चलता है कि कौन से "मैजिक बॉक्स" के ट्रिक्स अच्छे हैं और कौन से बुरे? यह इवोल्यूशन (विकास) का उपयोग करता है, ठीक वैसे ही जैसे प्रकृति करती है।

  • पॉपुलेशन (जनसंख्या): कल्पना करें कि छवियों को संशोधित करने के 14 अलग-अलग "रेसिपी" का एक समूह है। कुछ रेसिपी कहती हैं "पहले घुमाएं फिर चमकीला बनाएं।" अन्य कहती हैं "3D एंगल बदलें फिर क्रॉप करें।"
  • टेस्ट: सिस्टम प्रत्येक रेसिपी को रोबोट के सीखने के कार्य पर आज़माता है।
  • सर्वाइवल ऑफ द फिटेस्ट (योग्यतम की उत्तरजीविता): वे रेसिपी जो रोबोट को सबसे अच्छा सीखने में मदद करती हैं, उन्हें रखा जाता है। बुरी रेसिपी को बाहर फेंक दिया जाता है।
  • मिक्सिंग एंड मैशिंग: सिस्टम दो अच्छी रेसिपी को लेता है और उन्हें एक साथ "मैश" करके एक नई, संभावित रूप से बेहतर रेसिपी बनाता है। यह प्रक्रिया बार-बार दोहराई जाती है, जिससे धीरे-धीरे उस विशिष्ट कार्य के लिए एकदम सही सेट विकसित होता है।

3. ट्रिक्स का "पेड़"

सिस्टम इन ट्रिक्स को एक पेड़ (Tree) के रूप में व्यवस्थित करता है।

  • कल्पना करें कि एक पेड़ है जहाँ तना आपकी मूल फोटो है।
  • शाखाएं निर्णय हैं: "क्या हम इसे घुमाते हैं? क्या हम रंग बदलते हैं?"
  • पत्तियां अंतिम संशोधित छवियां हैं।
    EvoAug सीखता है कि कौन सी शाखाएं बढ़ानी हैं और रोबष्ट को बाएं मुड़ने (रोटेट) या दाएं मुड़ने (रंग बदलना) की कितनी संभावना होनी चाहिए। यह एक जटिल, शाखाओं वाला रास्ता बनाता है जो कार्य के लिए विविधता की सही मात्रा बनाता है।

4. "वन-शॉट" समस्या का समाधान

यह पेपर विशेष रूप से सबसे कठिन परिदृश्य को संबोधित करता है: वन-शॉट लर्निंग (One-Shot Learning)। यह तब होता है जब आपके पास प्रति श्रेणी केवल एक तस्वीर होती है।

  • चुनौती: आमतौर पर, यह परीक्षण करने के लिए कि कोई रेसिपी अच्छी है या नहीं, आपको परीक्षण छवियों के एक बड़े समूह की आवश्यकता होती है। यदि आपके पास केवल एक है, तो आपको कैसे पता चलेगा कि नए "नकली" फूल मददगार हैं या नहीं?
  • चतुर ट्रिक: लेखकों ने एक तरीका बनाया जिससे बिना बड़े टेस्ट ग्रुप के रेसिपी का मूल्यांकन किया जा सके। वे देखते हैं कि "नकली" फूल एक साथ कैसे समूह बनाते हैं।
    • अच्छी रेसिपी: नकली गुलाब असली गुलाब के साथ एक तंग समूह में रहते हैं, और वे नकली ट्यूलिप से दूर रहते हैं।
    • बुरी रेसिपी: नकली गुलाब ट्यूलिप के साथ मिल जाते हैं।
      सिस्टम इस "ग्रुपिंग" तर्क का उपयोग करके तब भी सर्वोत्तम रेसिपी विकसित करता है जब डेटा अत्यंत कम हो।

उन्होंने क्या पाया?

शोधकर्ताओं ने कई कठिन कार्यों पर इसका परीक्षण किया, जैसे कुत्तों की विभिन्न नस्लों या कारों के प्रकारों के बीच अंतर करना, जहाँ अंतर बहुत सूक्ष्म होते हैं।

  • परिणाम: EvoAug ने लगातार मानक तरीकों (जैसे केवल इमेज को घुमाना) या यहाँ तक कि AutoAugment जैसे प्रसिद्ध स्वचालित तरीकों की तुलना में बेहतर सीखने में मदद की।
  • आश्चर्य: कुछ मामलों में, AI ने "खोजा" कि उसे कुछ विवरणों (जैसे फूल का रंग) को सुरक्षित रखने की आवश्यकता है जबकि अन्य को (जैसे कोण) बदलना है। यह वही था जो मानव विशेषज्ञ अनुमान लगाते, जिससे सिद्ध हुआ कि सिस्टम सही चीजें सीख रहा है।

सारांश

EvoAug एक ऐसी प्रणाली है जो "सर्वाइवल ऑफ द फिटेस्ट" गेम का उपयोग करती है ताकि प्रशिक्षण डेटा बनाने के लिए शक्तिशाली AI आर्ट जनरेटर का उपयोग करने का सबसे अच्छा तरीका स्वचालित रूप से खोजा जा सके। यह अनुमान लगाने के बजाय कि कौन से इमेज ट्रिक्स काम करेंगे, यह एक कस्टम "ट्रिक्स का पेड़" विकसित करता है जो AI मॉडल को तेजी से और अधिक सटीक रूप से सीखने में मदद करता है, भले ही उनके पास शुरू करने के लिए केवल कुछ ही उदाहरण हों। यह सरल इमेज एडिटिंग और जटिल AI जनरेशन के बीच के अंतर को पाटता है, यह सुनिश्चित करता है कि नया डेटा सहायक हो, हानिकारक नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →