← नवीनतम पेपर
💬 NLP

QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructions

यह शोध पत्र QAQ का प्रस्ताव करता है, जो एक नवीन डेटा चयन ढांचा (framework) है जो क्वेरी और उत्तर के बीच द्वि-दिशीय अर्थ संबंधी सुसंगतता (bidirectional semantic coherence) का मूल्यांकन करने के लिए रिवर्स म्यूचुअल इंफॉर्मेशन का लाभ उठाता है, जो उच्च मॉडल प्रदर्शन प्राप्त करने के लिए शोर युक्त सिंथेटिक कोड डेटा को प्रभावी ढंग से फ़िल्टर करता है और प्रशिक्षण सेटों को काफी कम कर देता है।

मूल लेखक: Jiayin Lei, Ming Ma, Yunxi Duan, Chenxi Li, Tianming Yang

प्रकाशित 2026-03-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayin Lei, Ming Ma, Yunxi Duan, Chenxi Li, Tianming Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर कोड लिखना सिखाने की कोशिश कर रहे हैं। आपके पास "अभ्यास समस्याओं" (प्रश्नों) और "समाधानों" (उत्तरों) की एक विशाल लाइब्रेरी है जो अन्य रोबोटों द्वारा बनाई गई है। इसे सिंथेटिक डेटा (synthetic data) कहा जाता है।

समस्या क्या है? सभी अभ्यास समस्याएँ अच्छी नहीं होतीं। कुछ बेमतलब होती हैं, कुछ बहुत आसान होती हैं, और कुछ बस कॉपी-पेस्ट किया हुआ कचरा होती हैं। यदि आप अपने रोबोट को खराब अभ्यास समस्याएँ खिलाते हैं, तो वह बुरी आदतें सीख जाएगा।

यह पेपर एक नई विधि पेश करता है जिसे QAQ (जिसका अर्थ है Question, Answer-Question यानी प्रश्न, उत्तर-प्रश्न) कहा जाता है, ताकि कचरे को बाहर निकाला जा सके और केवल असली सोने को रखा जा सके।

यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है:

1. पुराना तरीका: "यह कितना कठिन है?" (छात्र का दृष्टिकोण)

पहले, शोधकर्ता IFD नामक एक विधि का उपयोग करते थे। कल्पना कीजिए कि एक शिक्षक गणित की एक समस्या को देख रहा है और पूछ रहा है, "एक छात्र के लिए इसे हल करना कितना कठिन है?"

  • यदि उत्तर स्पष्ट है, तो समस्या बहुत आसान है।
  • यदि उत्तर असंभव है, तो समस्या बहुत कठिन है।
  • वे "बिल्कुल सही" स्तर की समस्याओं को रखते थे।

खामी: यह केवल सामने से देखता है। यह यह जाँच नहीं करता कि क्या प्रश्न स्वयं समझ में आने योग्य है। एक रोबोट ऐसा प्रश्न बना सकता है जैसे, "मैं एक 'ग्रिटी सुल्ला मैट्रिक्स' को कोड में कैसे बदलूँ?" रोबोट एक बेहतरीन उत्तर लिख सकता है जो उन बेमतलब शब्दों को ही दोहराता है। "कठिनाई" का स्कोर ठीक दिखता है, लेकिन पूरी चीज़ ही कचरा होती है।

2. नया तरीका: "क्या उत्तर प्रश्न की व्याख्या करता है?" (जासूस का दृष्टिकोण)

लेखक QAQ के माध्यम से पटकथा को उलट देते हैं। "प्रश्न कितना कठिन है?" पूछने के बजाय, वे पूछते हैं: "यदि मैं केवल उत्तर देखूँ, तो क्या मैं अनुमान लगा सकता हूँ कि प्रश्न क्या था?"

वे इसे रिवर्स म्यूचुअल इंफॉर्मेशन (Reverse Mutual Information - RMI) कहते हैं। इसे एक जासूस की तरह समझें जो अपराध स्थल (उत्तर) को देखता है और अपराध (प्रश्न) को फिर से बनाने की कोशिश करता है।

  • अच्छा डेटा (Sweet Spot): आप एक जटिल कोड समाधान देखते हैं। आप उसे देखकर कह सकते हैं, "आह, यह निश्चित रूप से लिस्ट को सॉर्ट करने के प्रश्न का उत्तर रहा होगा।" उत्तर आपको प्रश्न के बारे में एक स्पष्ट सुराग देता है। यह उच्च गुणवत्ता वाला है।
  • खराब डेटा प्रकार A (इको चैंबर): प्रश्न बेमतलब है, और उत्तर बस उन्हीं बेमतलब शब्दों को वापस दोहराता है।
    • प्रश्न: "'फ्लिबर-फ्लैबर' को कैसे ठीक करें?"
    • उत्तर: "'फ्लिबर-फ्लैबर' को ठीक करने के लिए, आपको..."
    • जासूस का दृष्टिकोण: क्योंकि उत्तर प्रश्न को ही दोहराता है, इसलिए प्रश्न का अनुमान लगाना बहुत आसान है। "सुराग" स्पष्ट है क्योंकि यह एक नकल (cheat) है। यह निम्न गुणवत्ता है।
  • खराब डेटा प्रकार B (खोया हुआ संबंध): प्रश्न "नमस्ते!" है और उत्तर एक जटिल पायथन स्क्रिप्ट है।
    • जासूस का दृष्टिकोण: कोड को देखकर, आपको बिल्कुल अंदाजा नहीं होता कि किसी ने "नमस्ते!" क्यों पूछा। उत्तर आपको प्रश्न के बारे में शून्य सुराग देता है। यह निम्न गुणवत्ता है।

3. "कॉग्निटिव गैप" रणनीति: दो शिक्षकों का उपयोग

लेखकों ने महसूस किया कि एक रोबोट (मॉडल) बहुत स्मार्ट या बहुत मूर्ख हो सकता है जिससे वह "अच्छे" और "चालाकी भरे" डेटा के बीच अंतर नहीं कर पाता। इसलिए, उन्होंने दो शिक्षकों का उपयोग किया:

  1. विशेषज्ञ शिक्षक (Strong Model): बहुत बुद्धिमान, गहरे पैटर्न जानता है।
  2. कनिष्ठ शिक्षक (Weak Model): कम अनुभवी, चीजों को सरल रूप में देखता है।

उन्होंने एक विशिष्ट प्रकार के मतभेद को देखा, जिसे वे "कॉग्निटिव गैप" (Cognitive Gap) कहते हैं:

  • परिदृश्य: विशेषज्ञ शिक्षक एक नमूने को देखता है और कहता है, "वाह, यह एक शानदार, जटिल समस्या है जिसका एक बेहतरीन समाधान है!" (हाई स्कोर)।
  • लेकिन कनिष्ठ शिक्षक उसी नमूने को देखता है और कहता, "मुझे समझ नहीं आ रहा कि यहाँ क्या हो रहा है। यह भ्रमित करने वाला है।" (लो स्कोर)।

इसे क्यों रखें?
यदि दोनों शिक्षक इसे आसान मानकर सहमत होते हैं, तो यह शायद बहुत सरल (उबाऊ) है।
यदि दोनों इसे टूटा हुआ मानकर सहमत होते हैं, तो यह कचरा है।
लेकिन यदि विशेषज्ञ वह मूल्य देखता है जिसे कनिष्ठ नहीं देख पाता, तो वह नमूना एक छिपा हुआ रत्न (hidden gem) है। यह रोबोट को नई चीजें सिखाने के लिए पर्याप्त चुनौतीपूर्ण है, लेकिन इतना भी वास्तविक है कि वह वैध है।

परिणाम: कम में अधिक करना

टीम ने 3,00,000 कोड उदाहरणों के एक विशाल डेटासेट पर इसका परीक्षण किया।

  • जादुई संख्या: उन्होंने पाया कि इस "QAQ" फ़िल्टर का उपयोग करके, उन्हें केवल 25% डेटा (शीर्ष 1/4 हिस्सा) रखने की आवश्यकता थी।
  • परिणाम: इस छोटे, फ़िल्टर किए गए 25% पर रोबोट को प्रशिक्षित करना, पूरे 100% बिखरे हुए डेटा पर प्रशिक्षित करने के समान ही प्रभावी रहा।
  • लाभ: इससे बिना रोबोट को कम बुद्धिमान बनाए, समय, पैसा और बिजली (कंप्यूटेशनल लागत) की भारी बचत हुई।

सारांश उपमा

कल्पना कीजिए कि आप एक भारोत्तोलक (weightlifter) के लिए जिम बना रहे हैं।

  • पुरानी विधि: आप यादृच्छिक वजन का ढेर उठाते हैं। कुछ बहुत हल्के हैं (उबाऊ), कुछ बहुत भारी हैं (असंभव), और कुछ कार्डबोर्ड के बने हैं (नकली)। आप यह अनुमान लगाने की कोशिश करते हैं कि कौन से असली हैं यह देखकर कि वे उठाने पर कैसे महसूस होते हैं।
  • QAQ विधि: आप वजन उठाने के बाद भारोत्तोलक के फॉर्म (form) को देखते हैं।
    • यदि उनका फॉर्म एकदम सही है और आप बता सकते हैं कि वे वास्तव में कौन सा व्यायाम कर रहे थे, तो वह एक अच्छा वजन है।
    • यदि वे बस एक कार्डबोर्ड बॉक्स को हिला रहे हैं और फॉर्म नकली लग रहा है, तो वह कचरा है।
    • यदि आपके पास एक कोच (विशेषज्ञ) है जो कहता है, "वह एक बेहतरीन लिफ्ट थी!" और एक प्रशिक्षु (कनिष्ठ) जो कहता है, "मुझे समझ नहीं आया," तो आप उस वजन को रखते हैं। यह एक आदर्श चुनौती है।

मुख्य बात: यह जाँचकर कि क्या उत्तर प्रश्न के संदर्भ में पीछे की ओर (backwards) तर्कसंगत है, और स्मार्ट और कम स्मार्ट रोबोटों के बीच के अंतर को सुनकर, हम सिंथेटिक डेटा को साफ कर सकते हैं और AI को बहुत तेज़ी से और सस्ते में प्रशिक्षित कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →