← नवीनतम पेपर
💬 NLP

Structured Semantic Information Helps Retrieve Better Examples for In-Context Learning Applied to Few-Shot Relation Extraction

यह शोध पत्र फ्यू-शॉट रिलेशन एक्सट्रैक्शन (few-shot relation extraction) के लिए एक हाइब्रिड इन-कॉन्टेक्स्ट लर्निंग फ्रेमवर्क का प्रस्ताव करता है जो एलएलएम-जनरेटेड (LLM-generated) उदाहरणों को सिंटैक्टिक-सिमेंटिक स्ट्रक्चरल समानता (syntactic-semantic structural similarity) के आधार पर अतिरिक्त उदाहरणों को चुनने की एक नवीन रणनीति के साथ जोड़ता है, जिससे कई डेटासेट्स और मॉडल परिवारों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Aunabil Chakma, Mihai Surdeanu, Eduardo Blanco

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aunabil Chakma, Mihai Surdeanu, Eduardo Blanco

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन सहायक को कहानी में लोगों के बीच एक विशिष्ट प्रकार के संबंध को पहचानना सिखाने की कोशिश कर रहे हैं। उदाहरण के लिए, आप चाहते हैं कि वह यह पहचान सके कि एक वाक्य कहता है, "यह व्यक्ति उस देश से है।"

आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे रिलेशन एक्सट्रैक्शन (Relation Extraction) कहा जाता है। आमतौर पर, AI को सिखाने के लिए आपको हजारों उदाहरण दिखाने पड़ते हैं। लेकिन क्या होगा अगर आपके पास शुरू करने के लिए केवल एक बेहतरीन उदाहरण हो? यह "1-shot" समस्या है। शोध पत्र पूछता है: हम उस एकल उदाहरण को बिना हाथ से हजारों नए उदाहरण लिखे, एक उपयोगी पाठ में कैसे बदल सकते हैं?

लेखकों ने इसे कैसे हल किया, इसे सरल उपमाओं के माध्यम से समझाया गया है:

समस्या: "एक-उदाहरण" का जाल (The "One-Example" Trap)

कल्पना कीजिए कि आप एक छात्र को "बिल्ली" पहचानना सिखा रहे हैं। आप उसे एक रोएँदार नारंगी बिल्ली की तस्वीर दिखाते हैं और कहते हैं, "यह एक बिल्ली है।" यदि आप फिर उससे एक अंधेरे कमरे में काली बिल्ली को पहचानने के लिए कहते हैं, तो वह भ्रमित हो सकता है क्योंकि उसने केवल नारंगी वाली देखी है। उन्हें यह समझने के लिए अधिक उदाहरणों की आवश्यकता है कि "बिल्लियाँ" कई आकारों, रंगों और प्रकारों में आती हैं, लेकिन उन सभी की मूल पहचान एक ही होती है।

पेपर की शब्दावली में, AI के पास एक "गोल्ड एग्जांपल" (परफेक्ट नारंगी बिल्ली की तस्वीर) है। लक्ष्य यह है कि स्वचालित रूप से और अधिक तस्वीरें (उदाहरण) खोज ली जाएं ताकि AI बेहतर सीख सके।

समाधान: और अधिक उदाहरण खोजने के तीन तरीके

लेखकों ने इन अतिरिक्त उदाहरणों को खोजने के लिए तीन अलग-अलग तरीकों का परीक्षण किया:

1. "पैरट" विधि (LLM Paraphrasing - नकल करने वाला तरीका)
उन्होंने एक लार्ज लैंग्वेज मॉडल (AI शिक्षक) से उस एक परफेक्ट उदाहरण को अलग-अलग शब्दों का उपयोग करके फिर से लिखने के लिए कहा।

  • उपमा: यह छात्र को वाक्य "बिल्ली नारंगी है" को "बिल्ली (feline) के बाल नारंगी हैं" के रूप में फिर से लिखने के लिए कहने जैसा है।
  • समस्या: AI थोड़ा आलसी होता है। यह वाक्य की संरचना को लगभग वैसा ही रखता है, बस कुछ शब्दों को बदल देता है। यह छात्र को एक ही नारंगी बिल्ली की पांच ऐसी तस्वीरें दिखाने जैसा है, जिनमें केवल रोशनी थोड़ी अलग है। यह उन्हें पर्याप्त विविधता नहीं सिखाता है।

2. "सर्च इंजन" विधि (Retrieving from the Wild - वास्तविक दुनिया से खोजना)
AI से नए वाक्य बनाने के लिए कहने के बजाय, वे एक विशाल पुस्तकालय (इंटरनेट) से वास्तविक वाक्यों को लेकर आए।

  • पुराना तरीका (SBERT): उन्होंने एक मानक खोज उपकरण का उपयोग किया जो उन वाक्यों को खोजता है जो समान महसूस होते हैं।
    • समस्या: यह "बिल्ली" खोजने और बदले में बाघ या कुत्ते की तस्वीर प्राप्त करने जैसा है क्योंकि वे सभी "जानवर" हैं। खोज उपकरण विषय को तो देख लेता है लेकिन विशिष्ट संबंध को मिस कर देता है।
  • नया तरीका (Structured Semantic Rules - संरचित अर्थ संबंधी नियम): यह इस पेपर का बड़ा नवाचार है। केवल समान शब्दों को खोजने के बजाय, उन्होंने वाक्य के कंकाल (skeleton) को देखा। उन्होंने विश्लेषण किया कि वाक्य के कर्ता (व्यक्ति) और कर्म (देश) व्याकरणिक रूप से एक-दूसरे से कैसे जुड़े हैं।
    • उपमा: कल्पना कीजिए कि आप एक विशिष्ट प्रकार के हाथ मिलाने (handshake) की तलाश कर रहे हैं। केवल दो हाथों को छूते हुए देखने के बजाय, आप उस विशिष्ट पकड़, कोण और संदर्भ को देखते हैं। भले ही लोग अलग-अलग कपड़े पहने हों या अलग भाषा बोल रहे हों, यदि "हाथ मिलाने की संरचना" समान है, तो वह एक मैच है।
    • परिणाम: इस विधि ने वास्तविक दुनिया के ऐसे उदाहरण खोजे जो संरचनात्मक रूप से संबंधों के लिए एकदम सही मेल थे, भले ही शब्द पूरी तरह से अलग थे।

3. "हाइब्रिड" विधि (दोनों का सबसे अच्छा मिश्रण)
लेखकों ने महसूस किया कि "पैरट" विधि मूल अर्थ को सुरक्षित रखने में अच्छी थी, जबकि "सर्च इंजन" विधि विविधता और वास्तविक दुनिया की विविधता खोजने में माहिर थी।

  • रणनीति: उन्होंने दोनों को मिला दिया। उन्होंने AI से दोबारा लिखे गए सुरक्षित उदाहरण और लाइब्रेरी से विविध, वास्तविक दुनिया के उदाहरण लिए।
  • परिणाम: इसने AI के लिए एक "स्टडी ग्रुप" बनाया। कुछ उदाहरण मूल के बहुत समान थे (नियमों को स्पष्ट रखने के लिए), और अन्य बहुत अलग थे (AI को यह दिखाने के लिए कि नियम कई स्थितियों में लागू होता है)।

मुख्य निष्कर्ष

  • संरचना मायने रखती है: वाक्य के "कंकाल" (सिंटैक्स और सिमेंटिक्स) के आधार पर उदाहरण खोजना, केवल समान ध्वनि वाले वाक्यों को खोजने की तुलना में बहुत बेहतर काम करता है।
  • विविधता अच्छी है, लेकिन संतुलन बेहतर है: यदि आप AI को बहुत अधिक अलग उदाहरण दिखाते हैं, तो वह भ्रमित हो जाता है। यदि आप उसे बहुत अधिक समान उदाहरण दिखाते हैं, तो वह एक ही जगह अटक जाता है। "हाइब्रिड" दृष्टिकोण ने सही संतुलन (sweet spot) खोज लिया।
  • यह छोटे दिमागों के लिए भी काम करता है: यह तरीका विशेष रूप से छोटे AI मॉडल्स के लिए मददगार था। बड़े, स्मार्ट मॉडल्स को शायद इतनी मदद की जरूरत नहीं थी, लेकिन छोटे मॉडल्स को इन संरचित उदाहरणों से काफी सुधार हुआ।
  • कोई ट्रेनिंग की आवश्यकता नहीं: सबसे अच्छी बात? उन्हें AI को फिर से प्रशिक्षित (retrain) करने या उसे नया गणित सिखाने की आवश्यकता नहीं पड़ी। उन्होंने बस यह बदला कि समस्या हल करने से पहले उन्हें कौन से उदाहरण दिखाए जा रहे थे।

निचोड़ (The Bottom Line)

यह पेपर दिखाता है कि यदि आप चाहते हैं कि एक AI केवल एक उदाहरण से नया कौशल सीखे, तो केवल उस उदाहरण को फिर से लिखने के लिए न कहें। इसके बजाय, एक स्मार्ट "स्ट्रक्चरल सर्च" का उपयोग करें ताकि वास्तविक दुनिया के उदाहरण खोजे जा सकें जो एक ही तार्किक पैटर्न साझा करते हैं, उन्हें कुछ पुनर्गठित संस्करणों के साथ मिलाएं, और आपका AI बहुत तेजी से और अधिक सटीकता से सीखेगा।

सीमाओं पर नोट: लेखक उल्लेख करते हैं कि यह विशिष्ट प्रकार के संबंधों के लिए सबसे अच्छा काम करता है और विभिन्न AI मॉडल एक ही मिश्रण के प्रति थोड़ा अलग प्रतिक्रिया दे सकते हैं। उन्होंने यह भी नोट किया कि उनके "स्ट्रक्चरल रूल्स" 100% परफेक्ट नहीं हैं, लेकिन वे सभी पिछले तरीकों को पछाड़ने के लिए पर्याप्त अच्छे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →