← नवीनतम पेपर
💬 NLP

CFPO: Counterfactual Policy Optimization for Multimodal Reasoning

यह शोध पत्र काउंटरफैक्चुअल पॉलिसी ऑप्टिमाइज़ेशन (CFPO) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो एक क्रॉस-मोडल काउंटरफैक्चुअल तंत्र के माध्यम से कॉज़ल कंसिस्टेंसी (कारण संबंधी निरंतरता) को लागू करके लार्ज विजन-लैंग्वेज मॉडल्स की मल्टीमॉडल रीजनिंग को बढ़ाता है, जिससे बिना किसी बाहरी रिवॉर्ड मॉडल की आवश्यकता के मतिभ्रम (hallucinations) और ग्राउंडिंग विफलताओं को काफी हद तक कम किया जा सकता है।

मूल लेखक: Zhangyuan Yu, Wanran Sun, Guangjing Yang, Xiaohu Wu, Qicheng Lao

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhangyuan Yu, Wanran Sun, Guangjing Yang, Xiaohu Wu, Qicheng Lao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "CFPO: Counterfactual Policy Optimization for Multimodal Reasoning" शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "आलसी छात्र" AI

कल्पना कीजिए कि एक बहुत ही बुद्धिमान छात्र (AI) है जो एक ऐसी परीक्षा दे रहा है जिसमें एक तस्वीर को देखकर उस पर आधारित सवाल का जवाब देना है। इस छात्र ने हज़ारों किताबें (भाषा डेटा) पढ़ी हैं, इसलिए वह पहले से सुनी हुई बातों के आधार पर उत्तरों का अनुमान लगाने में बहुत माहिर है।

हालाँकि, जब वह तस्वीर को देखता है, तो यह छात्र अक्सर आलसी हो जाता है। तस्वीर के विवरणों को वास्तव में देखने के बजाय, वह केवल अपने सामान्य ज्ञान के आधार पर अनुमान लगाने लगता है।

  • गलती: यदि तस्वीर में एक ज़ेबरा (zebra) है, लेकिन छात्र से पूछा जाता है, "अगर इस जानवर में धारियाँ न होतीं तो क्या होता?", तो आलसी छात्र पूरी तस्वीर को अनदेखा कर सकता है और "हिरण" का अनुमान लगा सकता है क्योंकि जंगल में हिरण आम हैं, भले ही तस्वीर स्पष्ट रूप से घोड़े जैसी आकृति दिखा रही हो।
  • परिणाम: AI कभी-कभी किस्मत से सही उत्तर दे देता है, लेकिन अक्सर यह "भ्रम" (hallucinate) पैदा करता है या अपनी टेक्स्ट-आधारित यादों पर बहुत अधिक सहज होने के कारण दृश्य साक्ष्यों (visual evidence) को अनदेखा कर देता है।

समाधान: "क्या होगा अगर?" वाला खेल (CFPO)

शोधकर्ताओं ने एक नई प्रशिक्षण विधि बनाई है जिसे CFPO (Counterfactual Policy Optimization) कहा जाता है। इसे एक विशेष कोचिंग तकनीक के रूप में समझें जो छात्र को यह साबित करने के लिए मजबूर करती है कि वह वास्तव में तस्वीर देख रहा है, न कि केवल अनुमान लगा रहा है।

यह "क्या होगा अगर?" वाला खेल कैसे काम करता है, यहाँ देखें:

  1. सामान्य दृश्य (तथ्य): छात्र तस्वीर और प्रश्न को देखता है। वह अपना उत्तर लिखता है।
  2. "आंखों पर पट्टी" वाला दृश्य (Counterfactual): कोच अचानक तस्वीर के सबसे महत्वपूर्ण हिस्सों पर एक "पट्टी" (blindfold) लगा देता है (वे हिस्से जिन्हें छात्र घूर रहा था)।
    • उदाहरण: कल्पना कीजिए कि छात्र खजाना खोजने के लिए एक नक्शा देख रहा है। कोच "X" के निशान को एक कागज के टुकड़े से ढक देता है।
  3. परीक्षण: छात्र को फिर से प्रश्न का उत्तर देना होता है, लेकिन इस बार मुख्य दृश्य संकेत छिपे हुए होते हैं।
    • यदि वह वास्तव में ध्यान दे रहा था, तो उसका उत्तर पूरी तरह से बदल जाना चाहिए क्योंकि "X" अब गायब है।
    • यदि वह केवल अपनी याददाश्त के आधार पर अनुमान लगा रहा था (तस्वीर को अनदेखा कर रहा था), तो उसका उत्तर बिल्कुल वैसा ही रहेगा, भले ही तस्वीर बदल गई हो।

प्रशिक्षण का नियम: "साबित करो कि तुमने देखा!"

CFPO सिस्टम एक सख्त नियम का उपयोग करता है: यदि तस्वीर के महत्वपूर्ण हिस्सों को छिपाने पर आपका उत्तर नहीं बदलता है, तो आपको दंड (penalty) दिया जाएगा।

  • लक्ष्य: AI यह सीखता है कि उच्च स्कोर पाने के लिए, उसे वास्तव में दृश्य साक्ष्य (visual evidence) पर निर्भर रहना होगा। वह सीखता है कि यदि तस्वीर बदलती है (या उसके कुछ हिस्से छिपा दिए जाते हैं), तो उसका तर्क (reasoning) भी बदलना चाहिए।
  • परिणाम: AI एक "आलसी अनुमान लगाने वाला" बनने के बजाय एक "सावधान पर्यवेक्षक" बन जाता है। वह यह सीखता है कि जो वह देखता है और जो वह कहता है, उनके बीच संबंध कैसे जोड़ा जाए।

यह क्यों महत्वपूर्ण है ("ग्राउंडिंग" का उदाहरण)

शोध पत्र में, वे "ग्राउंडिंग" (grounding) के बारे में बात करते हैं। कल्पना कीजिए कि आप एक घर बना रहे हैं।

  • पुराना AI: घर को अनुमानों के बादलों पर बनाता है। यह दिखने में अच्छा लगता है, लेकिन अगर हवा चलती है (एक कठिन सवाल आता है), तो घर गिर जाता है क्योंकि यह ज़मीन (छवि/image) से मजबूती से जुड़ा नहीं था।
  • CFPO AI: घर को ठोस कंक्रीट पर बनाता है। "काउंटरफैक्चुअल" परीक्षण एक विंड टनल टेस्ट (हवा के दबाव का परीक्षण) की तरह है। यदि हवा चलने पर (जब दृश्य संकेत हटा दिए जाते हैं) घर डगमगाता है, तो निर्माता को पता चल जाता है कि उसने इसे ठीक से स्थापित नहीं किया था। CFPO निर्माता को दृश्य साक्ष्यों की गहराई तक नींव खोदने के लिए मजबूर करता है।

शोध पत्र ने क्या पाया

शोधकर्ताओं ने इसका परीक्षण चित्रों से जुड़े कठिन गणित और तर्क वाले पहेलियों पर किया।

  • परिणाम: CFPO के साथ प्रशिक्षित AI ने मानक AI की तुलना में काफी बेहतर स्कोर प्राप्त किया।
  • प्रमाण: इसने तथ्यों को मनगढ़ंत बनाना (hallucinations) बंद कर दिया और तस्वीरों के विवरणों का विश्लेषण करके समस्याओं को हल करना शुरू किया, जैसे कि फूलदान में फूलों की गिनती करना या सॉकर जर्सी पर लिखे टेक्स्ट को पढ़ना, न कि केवल इस आधार पर अनुमान लगाना कि उसे क्या देखना चाहिए था।

सारांश

CFPO एक प्रशिक्षण विधि है जो AI को अनुमान लगाना छोड़ने और देखना शुरू करने की शिक्षा देती है। यह "अगर मैं तस्वीर के इस हिस्से को छिपा दूँ तो क्या होगा?" जैसा खेल खेलकर ऐसा करता है। यदि तस्वीर बदलने पर AI का उत्तर नहीं बदलता है, तो उसे पता चल जाता है कि वह ध्यान नहीं दे रहा है। यह AI को अपने तर्क को ठोस दृश्य साक्ष्यों पर बनाने के लिए मजबूर करता है, जिससे यह बहुत अधिक स्मार्ट और विश्वसनीय बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →