← नवीनतम पेपर
💻 computer science

CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning

CAP-CoT एक चक्रीय प्रतिकूल प्रॉम्प्टिंग (cycle adversarial prompting) ढांचा है जो एक फॉरवर्ड सॉल्वर, कार्य-अर्थपूर्ण तार्किक त्रुटियां उत्पन्न करने वाले एक एडवरसेरियल चैलेंजर और सॉल्वर एवं चैलेंजर दोनों प्रॉम्प्ट्स को पुनरावृत्ति रूप से अनुकूलित करने के लिए एक फीडबैक एजेंट के बीच एक फीडबैक लूप का उपयोग करके LLM तर्क की सटीकता और स्थिरता में सुधार करता है।

मूल लेखक: Shuxu Chen, Yitian Zhou, Jiaquan Zhang, Haoyu Bian, Aming Wu, Sungyoung Lee, Chaoning Zhang, Hyundong Shin

प्रकाशित 2026-04-28
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Shuxu Chen, Yitian Zhou, Jiaquan Zhang, Haoyu Bian, Aming Wu, Sungyoung Lee, Chaoning Zhang, Hyundong Shin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को जटिल गणित और तर्क संबंधी पहेलियों को हल करना सिखा रहे हैं। अधिकांश लोग छात्र को सही उदाहरण दिखाकर सिखाते हैं: "यहाँ एक समस्या है, और यहाँ इसे हल करने का सही तरीका है।"

यह शोध पत्र, CAP-CoT, यह तर्क देता है कि यह "केवल-सकारात्मक" (positive-only) शिक्षण पद्धति अधूरी है। यह वैसा ही है जैसे केवल आदर्श ड्राइविंग के वीडियो देखकर गाड़ी चलाना सीखना; आप इसमें बहुत अच्छे हो सकते हैं, लेकिन जब तक आप किसी पेचीदा स्थिति का सामना नहीं करते, तब तक आप फंस सकते हैं, और फिर आप ठिठक जाएंगे।

इसे ठीक करने के लिए, शोधकर्ताओं ने तीन विशिष्ट पात्रों से युक्त एक "प्रशिक्षण शिविर" (Training Camp) बनाया।

प्रशिक्षण शिविर के तीन पात्र

  1. द सॉल्वर (द स्टूडेंट - हल करने वाला/छात्र): यह वह AI है जिसे हम सुधारना चाहते हैं। इसका काम एक समस्या को देखना और उत्तर तक पहुँचने के लिए चरण-दर-चरण स्पष्टीकरण (एक "चेन ऑफ थॉट") लिखना है।
  2. द चैलेंजर (द ट्रिकस्टर - चुनौती देने वाला/धोखेबाज): यह एक विशेष AI है जिसका एकमात्र काम एक "स्मार्ट सूत्रधार" (smart saboteur) बनना है। यह समस्या को हल करने की कोशिश नहीं करता; इसके बजाय, यह समस्या को देखता है और एक "नकली" समाधान बनाता है। यह नकली समाधान अविश्वसनीय रूप से विश्वसनीय और पेशेवर दिखता है, लेकिन इसमें एक बहुत ही सूक्ष्म, सूक्ष्म तार्किक जाल होता है—जैसे कि एक सुंदर वाक्य के बीच छिपा हुआ गणितीय त्रुटि।
  3. द फीडबैक एजेंट (द कोच - फीडबैक एजेंट/कोच): यह एक बुद्धिमान गुरु है। कोच, छात्र के वास्तविक उत्तर और ट्रिकस्टर के नकली उत्तर दोनों को देखता है। कोच कहता है, "देखो, छात्र! ट्रिकस्टर ने तुम्हें बेवकूफ बना दिया क्योंकि तुम समीकरण के डोमेन (domain) की जाँच करना भूल गए। और ट्रिकस्टर, तुम बहुत आसान हो रहे हो; अगली बार, अपनी गलती को एक लंबी गणना के बीच में छिपाने की कोशिश करो।"

"चक्र" (The Cycle - असली मंत्र)

सिर्फ एक बार सिखाने के बजाय, वे इन तीनों को एक लूप (चक्र) में डालते हैं।

  • राउंड 1: छात्र एक समस्या को हल करने का प्रयास करता है। ट्रिकस्टर एक "विश्वसनीय झूठ" बनाता है। कोच सत्य और झूठ के बीच के अंतर की ओर संकेत करता है।
  • राउंड 2: कोच छात्र की "नियम पुस्तिका" (प्रॉम्प्ट) को अपडेट करता है ताकि उस विशिष्ट जाल से बचा जा सके। लेकिन कोच ट्रिकस्टर को भी अपडेट करता है, उसे बताते हुए: "छात्र स्मार्ट हो रहा है; अब तुम्हें और भी चालाकी भरे झूठ रचने होंगे!"
  • राउंड 3: चक्र दोहराया जाता है। छात्र अधिक कठोर बनता है, और ट्रिकस्टर अधिक धूर्त।

जब तक वे कुछ राउंड पूरे कर लेते हैं, छात्र "युद्ध-परीक्षित" (battle-tested) हो चुका होता है। उन्होंने न केवल सही होना सीखा है; बल्कि उन्होंने गलत होने से बचना भी सीखा है।

यह क्यों मायने रखता है? (परिणाम)

वास्तविक दुनिया में, AI अक्सर "नाजुकता" (fragility) से ग्रस्त होता है। यदि आप प्रश्न में एक छोटा सा शब्द भी बदल देते हैं, तो AI बिखर सकता है।

शोधकर्ताओं ने कई कठिन बेंचमार्क (जैसे गणित और लंबे संदर्भ वाली रीडिंग) पर इसका परीक्षण किया। उन्होंने पाया कि CAP-CoT ने AI को बनाया:

  1. अधिक स्मार्ट: इसने अधिक उत्तर सही दिए।
  2. अधिक मजबूत: यह "शोर" (noise) या प्रश्न पूछने के तरीके में मामूली बदलावों से आसानी से भ्रमित नहीं हुआ।
  3. अधिक सुसंगत: भले ही आप AI की "रचनात्मकता" (temperature) को बढ़ा दें, फिर भी यह अपने पथ पर बना रहा क्योंकि इसका तार्किक आधार अब बहुत मजबूत हो गया था।

संक्षेप में: CAP-CoT केवल AI को रास्ता दिखाना नहीं सिखाता; यह AI को गड्ढों को पहचानना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →