← नवीनतम पेपर
🤖 machine learning

Active Tabular Augmentation via Policy-Guided Diffusion Inpainting

यह शोध पत्र TAP को प्रस्तुत करता है, जो एक नवीन ढांचा है जो डिफ्यूजन इनपेंटिंग (diffusion inpainting) को लर्नर-कंडीशन्ड पॉलिसी (learner-conditioned policy) के साथ जोड़ता है ताकि उच्च-उपयोगिता वाले सिंथेटिक सारणीबद्ध डेटा (synthetic tabular data) को सक्रिय रूप से चुनने और इंजेक्ट करने का कार्य किया जा सके, जिससे वितरण संबंधी निष्ठा (distributional fidelity) और डाउनस्ट्रीम मॉडल प्रदर्शन के बीच के अंतर को पाटकर गंभीर डेटा की कमी के तहत वर्गीकरण और प्रतिगमन परिणामों में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए कर्मचारी (AI मॉडल) को काम करना सिखाने की कोशिश कर रहे हैं, लेकिन आपके पास केवल एक छोटा सा, मुड़ा-तुड़ा हुआ निर्देश मैनुअल (दुर्लभ डेटा/scarce data) है। उन्हें सिखाने में मदद करने के लिए, आप और अधिक निर्देश लिखने का निर्णय लेते हैं।

ज्यादातर लोग मौजूदा मैनुअल को देखकर और उसकी शैली की हुबहू नकल करके नए निर्देश लिखने की कोशिश करते हैं। वे सुनिश्चित करते हैं कि नए पन्ने पुराने पन्नों जैसे ही दिखें, जिनमें समान फॉन्ट और व्याकरण हो। यह वर्तमान AI टूल्स करते हैं: वे फिडेलिटी (Fidelity) पर ध्यान केंद्रित करते हैं (नकली डेटा को असली दिखाने पर)।

हालाँकि, इस शोध पत्र के लेखक, झेयू झांग (Zheyu Zhang) और उनके सहयोगियों ने एक समस्या को समझा: सिर्फ इसलिए कि एक नकली निर्देश असली दिखता है, इसका मतलब यह नहीं है कि वह कर्मचारी को सीखने में मदद करेगा। वास्तव में, यदि आप मैनुअल के आसान हिस्सों की बार-बार नकल करते रहेंगे, तो कर्मचारी ऊब जाएगा और उसमें कोई सुधार नहीं होगा। उन्हें ऐसे निर्देशों की आवश्यकता है जो उन्हें सीखने के लिए पर्याप्त चुनौती दें, लेकिन इतना कठिन भी न हों कि वे भ्रमित होकर हार मान लें।

यह शोध पत्र इस समस्या को हल करने के लिए TAP (Tabular Augmentation Policy) नामक एक नई प्रणाली पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "फिडेलिटी बनाम यूटिलिटी" का अंतर (The "Fidelity vs. Utility" Gap)

डेटा को एक शहर के मानचित्र (map) के रूप में सोचें।

  • पुराना तरीका (उच्च फिडेलिटी/High Fidelity): आप एक मानचित्रकार (cartographer) को शहर के केंद्र का एक सटीक, उच्च-रिज़ॉल्यूशन वाला नक्शा बनाने के लिए नियुक्त करते हैं जहाँ पहले से ही सभी रहते हैं। यह सुंदर और सटीक दिखता है, लेकिन यह कर्मचारी को बाहरी इलाकों या उन कठिन गलियों के बारे में कुछ भी नया नहीं बताता जहाँ वे भटक सकते हैं।
  • लक्ष्य (उच्च यूटिलिटी/High Utility): आप एक ऐसा नक्शा बनाना चाहते हैं जो विशेष रूप से उन कठिन गलियों को उजागर करे जहाँ कर्मचारी वर्तमान में भ्रमित है, ताकि वे वहां नेविगेट करने का अभ्यास कर सकें।

शोध पत्र इसे "फिडेलिटी-यूटिलिटी गैप" कहता है। डेटा को असली दिखाना (फिडेलिटी) अपने आप में उसे सीखने के लिए उपयोगी (यूटिलिटी) नहीं बनाता है।

2. समाधान: TAP एक "स्मार्ट ट्यूटर" के रूप में

केवल यादृच्छिक (random) नए पन्ने बनाने के बजाय, TAP एक स्मार्ट ट्यूटर की तरह काम करता है जो वास्तविक समय में छात्र को सीखते हुए देखता है। यह तीन तरकीबों का उपयोग करता है:

A. "खाली स्थान भरें" का खेल (Diffusion Inpainting)

कल्पना कीजिए कि आपके पास एक वास्तविक निर्देश मैनुअल का पन्ना है, लेकिन आपने आधे शब्दों को काले मार्कर से ढक दिया है।

  • TAP एक शक्तिशाली AI (जिसे Diffusion Model कहा जाता है) का उपयोग यह अनुमान लगाने के लिए करता है कि गायब शब्द क्या होने चाहिए, उन शब्दों के आधार पर जो अभी भी दिखाई दे रहे हैं।
  • यह सुनिश्चित करता है कि नए निर्देश काम के वास्तविक नियमों के साथ सुसंगत रहें (उदाहरण के लिए, आप किसी व्यक्ति का "वेतन" नकारात्मक नहीं रख सकते)। इसे इनपेंटिंग (inpainting) कहा जाता है।

B. "मानसिक स्थिति" की जाँच (The Policy)

यही सबसे महत्वपूर्ण हिस्सा है। नया निर्देश लिखने से पहले, TAP छात्र से पूछता है: "अभी आप कहाँ संघर्ष कर रहे हैं?"

  • यदि छात्र "बिक्री" (Sales) में बहुत अच्छा है लेकिन "रिटर्न" (Returns) में बहुत खराब है, तो TAP "बिक्री" के और अधिक निर्देश लिखने में समय बर्बाद नहीं करेगा।
  • इसके बजाय, यह विशेष रूप से "रिटर्न" अनुभाग को लक्षित करता है। यह तय करता है कि क्या उत्पन्न करना है और छात्र की वर्तमान कमजोरियों के आधार पर मैनुअल में कब जोड़ना है। यह एक कोच की तरह है जो केवल यादृच्छिक ड्रिल नहीं कराता, बल्कि उस विशिष्ट ड्रिल को चुनता है जिसकी एथलीट को अभी आवश्यकता है।

C. "सुरक्षा जाल" (Gating and Windowed Commitment)

कभी-कभी, एक स्मार्ट ट्यूटर भी एक बुरा विचार सुझा सकता है। TAP में दो सुरक्षा जाँचें हैं:

  1. द्वारपाल (The Gatekeeper): किसी भी नए निर्देश को जोड़ने से पहले, एक सख्त नियम-जांचकर्ता (Gate) इसकी जांच करता है। यदि नया निर्देश किसी तार्किक नियम को तोड़ता है (जैसे कि कहना कि एक व्यक्ति 200 साल का है), तो इसे तुरंत कचरे में फेंक दिया जाता है।
  2. परीक्षण अवधि (The Trial Period): TAP केवल एक निर्देश नहीं जोड़ता और उम्मीद नहीं करता। यह नए निर्देशों का एक छोटा बैच एक "वेटिंग रूम" (window) में एकत्र करता है। यह देखने के लिए इस पूरे बैच का परीक्षण करता है कि क्या इससे छात्र वास्तव में बेहतर होता है। केवल तभी जब वह बैच सिद्ध रूप से मदद करता है, उसे स्थायी रूप से मैनुअल में जोड़ा जाता है। यदि बैच जोखिम भरा है, तो उसे हटा दिया जाता है।

3. परिणाम

लेखकों ने इस प्रणाली का परीक्षण सात वास्तविक दुनिया के डेटासेट्स (जैसे मेडिकल रिकॉर्ड, क्रेडिट स्कोर और ऊर्जा उपयोग) पर किया, जहाँ डेटा बहुत कम था।

  • परिणाम: TAP ने अन्य तरीकों को लगातार पछाड़ दिया। कुछ मामलों में, इसने AI की सटीकता में 15.6% तक सुधार किया और त्रुटियों को 32% तक कम कर दिया।
  • क्यों? क्योंकि TAP ने केवल "सुंदर" दिखने वाला नकली डेटा नहीं बनाया; इसने रणनीतिक नकली डेटा बनाया जो सीखने वाले के ज्ञान के विशिष्ट अंतराल (gaps) को भरता है।

सारांश उपमा

यदि पारंपरिक डेटा ऑग्मेंटेशन एक फोटोकॉपी मशीन की तरह है जो पाठ्यपुस्तक की अंतहीन प्रतियां बनाती है, तो TAP एक व्यक्तिगत ट्यूटर की तरह है जो:

  1. पाठ्यपुस्तक को पढ़ता है।
  2. आपकी क्विज़ लेता है।
  3. पहचानता है कि आपको किन प्रश्नों में कठिनाई हुई।
  4. केवल उसी विषय के लिए एक कस्टम अभ्यास प्रश्न लिखता है।
  5. यह सुनिश्चित करने के लिए जाँच करता है कि प्रश्न का अर्थ सही है।
  6. और केवल तभी इसे आपके अध्ययन गाइड में जोड़ता है जब यह वास्तव में आपके स्कोर को बेहतर बनाने में मदद करता है।

शोध पत्र निष्कर्ष निकालता है कि उन स्थितियों में जहाँ डेटा दुर्लभ है, हमें केवल नकली डेटा को "असली" दिखाने की चिंता करने के बजाय, इसे विशिष्ट शिक्षार्थी के लिए उपयोगी बनाने पर ध्यान केंद्रित करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →