← नवीनतम पेपर
💻 computer science

Correcting Class Imbalance in Prior-Data Fitted Networks for Tabular Classification

यह शोध पत्र शास्त्रीय न्यूनीकरण तकनीकों को अनुकूलित करके टैबुलर वर्गीकरण के लिए प्रायर-डेटा फिटेड नेटवर्क्स (PFNs) में क्लास इम्बैलेंस (वर्ग असंतुलन) की चुनौती को संबोधित करता है, यह पाते हुए कि थ्रेशोल्डिंग (सीमा निर्धारण) बेहतर प्रदर्शन के लिए PFN कैलिब्रेशन का लाभ उठाती है जबकि डाउनसैंपलिंग कम अनुमान लागत (इन्फरेंस कॉस्ट) के साथ तुलनीय परिणाम प्रदान करती है।

मूल लेखक: Samuel McDowell, Nathan Stromberg, Lalitha Sankar

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Samuel McDowell, Nathan Stromberg, Lalitha Sankar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट, प्री-ट्रेन्ड डिटेक्टिव है जिसका नाम PFN है। इस जासूस ने अपने प्रशिक्षण के दौरान लाखों काल्पनिक कहानियाँ पढ़ी हैं और वे कुछ सुरागों को देखकर ही नए मामलों को सुलझाने में अविश्वसनीय रूप से कुशल हैं (यह एक तकनीक है जिसे "इन-कॉन्टेक्स्ट लर्निंग" कहा जाता है)। उन्हें हर नए काम के लिए अपने दिमाग को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; वे बस आपके द्वारा दिए गए सबूतों को देखते हैं और एक अनुमान लगाते हैं।

हालाँकि, इस जासूस की एक बड़ी कमजोरी है: क्लास इम्बैलेंस (Class Imbalance)

समस्या: "बहुमत का वोट" वाला पूर्वाग्रह (The "Majority Vote" Bias)

कल्पना कीजिए कि आपने जासूस को 1,000 सिक्कों के ढेर में से एक दुर्लभ, विशिष्ट प्रकार का सिक्का खोजने के लिए कहा है।

  • 950 सिक्के आम पेनी (पैसे) हैं (यह मेजोरिटी क्लास है)।
  • 50 सिक्के दुर्लभ सोने के सिक्के हैं (यह माइनोरिटी क्लास है)।

चूँकि जासूस ने अपने प्रशिक्षण के दौरान बहुत सारे पेनी देखे हैं, इसलिए वे आलसी हो जाते हैं। जब वे कोई नया सिक्का देखते हैं, तो वे हर बार बस "पेनी" का अनुमान लगाते हैं।

  • परिणाम: वे 95% बार सही होते हैं (क्योंकि अधिकांश सिक्के पेनी ही हैं)।
  • पेंच: वे हर एक सोने के सिक्के को मिस कर देते हैं। यदि आप उस दुर्लभ सोने के सिक्के की तलाश कर रहे हैं (जैसे कि कोई दुर्लभ बीमारी या साइबर हमला), तो यह जासूस बेकार है।

पेपर पूछता है: हम इस जासूस को बिना उसे नया एग्जाम देने के लिए मजबूर किए (री-ट्रेनिंग के बिना, जो वे नहीं कर सकते) कैसे ठीक करें?

समाधान: जासूस को बदलने के तीन तरीके

शोधकर्ताओं ने जासूस को दुर्लभ सिक्कों पर ध्यान देने के लिए तीन अलग-अलग "ट्रिक्स" आजमाईं।

1. "स्तर कम करना" वाली ट्रिक (Thresholding)

सामान्य तौर पर, जासूस कहता है, "मुझे 51% यकीन है कि यह सोने का सिक्का है, इसलिए मैं इसे गोल्ड कहूँगा।" लेकिन क्योंकि वे पेनी की ओर झुके हुए हैं, वे सोने के सिक्कों के लिए शायद ही कभी 51% आत्मविश्वास तक पहुँच पाते हैं।

शोधकर्ताओं ने महसूस किया कि जासूस वास्तव में अपने आत्मविश्वास के स्तर के बारे में बहुत ईमानदार हैं (वे "वेल-कैलिब्रेटेड" हैं)। उन्हें बस एक हल्के धक्के की जरूरत है।

  • सुधार: 51% आत्मविश्वास का इंतजार करने के बजाय, हम जासूस को कहते हैं: "अगर तुम्हें 10% भी यकीन है कि यह सोने का सिक्का है, तो इसे गोल्ड ही कह दो!"
  • उपमा: यह एक टेस्ट में पास होने के मानक को कम करने जैसा है। यदि किसी छात्र को आमतौर पर पास होने के लिए 90% की आवश्यकता होती है, लेकिन टेस्ट कठिन है, तो आप मानक को 60% तक कम कर सकते हैं ताकि वे सभी फेल न हो जाएं।
  • परिणाम: इसने अद्भुत काम किया। जासूस ने बहुत अधिक पेनी खोए बिना दुर्लभ सोने के सिक्कों को पकड़ना शुरू कर दिया। यह सबसे सरल और प्रभावी सुधार था।

2. "पेनी को छिपाने" वाली ट्रिक (Downsampling)

नियमों को बदलने के बजाय, हम सबूतों को बदलते हैं। हम 1,000 सिक्कों का ढेर लेते हैं और 900 पेनी फेंक देते हैं, जिससे केवल 50 पेनी और 50 सोने के सिक्के बचते हैं।

  • सुधार: अब ढेर संतुलित है। जासूस केवल "पेनी" का अनुमान लगाकर सही नहीं हो सकता; उन्हें वास्तव में सुरागों को देखना होगा।
  • बोनस: क्योंकि अब देखने के लिए कम सिक्के हैं, जासूस मामला जल्दी सुलझा लेता है (कम कंप्यूटर पावर की आवश्यकता होती है)।
  • परिणाम: इसने भी बहुत अच्छा काम किया, लगभग "स्तर कम करने" वाली ट्रिक के समान।

3. "नकली सिक्के" वाली ट्रिक (Oversampling & Synthetic Upsampling)

यहाँ अन्य तरीकों ने मदद करने की कोशिश की।

  • ओवरसैंपलिंग (Oversampling): हम उन 50 सोने के सिक्कों को लेते हैं और उनकी फोटोकॉपी करते हैं जब तक कि हमारे पास 500 सोने के सिक्के न हो जाएं।
  • सिंथेटिक अपसैंपलिंग (Synthetic Upsampling): हम एक रोबोट का उपयोग करके असली सिक्कों जैसे दिखने वाले नए नकली सोने के सिक्के बनाते हैं और उन्हें ढेर में जोड़ देते हैं।
  • परिणाम: ये तरीके विफल रहे
    • सिक्कों की फोटोकॉपी करना (Oversampling) ने जासूस को भ्रमित कर दिया क्योंकि ढेर अजीब और "स्पाइकी" दिखने लगा।
    • नकली सिक्के (Synthetic) जासूस को कुछ भी नया सिखाने के लिए पर्याप्त अच्छे नहीं थे। वास्तव में, उन्होंने जासूस को असली दुर्लभ सिक्कों को पहचानने में और भी खराब बना दिया।

मुख्य निष्कर्ष (The Big Takeaway)

पेपर ने पाया कि इस समस्या को ठीक करने के लिए आपको जटिल AI जादू की आवश्यकता नहीं है।

  1. नकली डेटा न बनाएं। यह चीजों को बस अस्त-व्यस्त बना देता है।
  2. निर्णय के नियम को समायोजित करें। बस मॉडल को यह बताना कि, "दुर्लभ चीज़ का अनुमान लगाने के लिए थोड़ा अधिक तैयार रहें," लगभग किसी भी अन्य चीज़ से बेहतर काम करता है।
  3. सामान्य डेटा को हटा दें। यदि आपके पास सामान्य चीज़ों का बहुत अधिक डेटा है, तो उसे फेंक दें। यह मॉडल को तेज़ और निष्पक्ष बनाता है।

संक्षेप में: सुपर-स्मार्ट जासूस बस दुर्लभ वस्तुओं के प्रति बहुत अधिक सावधान हो रहा था। उन्हें बस थोड़ा कम सावधान होने के लिए कहकर (थ्रेशोल्ड कम करके) या उन्हें सबूतों का एक छोटा, निष्पक्ष ढेर देकर (डाउनसैंपलिंग), वे उन दुर्लभ चीजों को खोजने में उत्कृष्ट बन गए जिन्हें वे मिस कर रहे थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →