← नवीनतम पेपर
💬 NLP

VISTA: Verification In Sequential Turn-based Assessment

VISTA एक नवीन फ्रेमवर्क है जो बहु-चरण संवादों (multi-turn dialogues) में मतिभ्रम (hallucination) का पता लगाने की क्षमता को बढ़ाता है, जो प्रतिक्रियाओं को विश्वसनीय स्रोतों और बातचीत के इतिहास के विरुद्ध क्रमिक सत्यापन के लिए परमाणु दावों (atomic claims) में विभाजित करता है, जिससे यह मौजूदा मेट्रिक्स से बेहतर प्रदर्शन करता है और मानव एनोटेटर सहमति में सुधार करता है।

मूल लेखक: Ashley Lewis, Andrew Perrault, Eric Fosler-Lussier, Michael White

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ashley Lewis, Andrew Perrault, Eric Fosler-Lussier, Michael White

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही जानकार लेकिन कभी-कभी अति-आत्मविश्वासी टूर गाइड के साथ एक लंबी, दोस्ताना बातचीत कर रहे हैं। कभी-कभी, वह गाइड आपको संग्रहालय के बारे में अद्भुत तथ्य बताता है। अन्य समय में, वह शायद किसी ऐसे डायनासोर के बारे में कहानी बना लेता है जो कभी अस्तित्व में ही नहीं था, या वह पूरे आत्मविश्वास के साथ अपनी किसी राय को वैज्ञानिक तथ्य के रूप में पेश करता है।

लंबे समय तक, कंप्यूटर जो यह जाँचने की कोशिश करते थे कि क्या गाइड सच बोल रहा है, वे एक सिंगल स्नैपशॉट लेने वाले फोटोग्राफरों की तरह थे। वे गाइड द्वारा कहे गए एक वाक्य को देखते, एक किताब से मिलान करते और कहते, "सच" या "झूठ"। लेकिन यह बड़ी तस्वीर को देखने में चूक जाता है। यह इस बात को नहीं पकड़ पाता कि गाइड ने पाँच मिनट पहले जो कहा था, उससे वह विरोधाभास तो नहीं कर रहा, या क्या वह सिर्फ इसलिए अंदाज़ा लगा रहा है क्योंकि उसे उत्तर नहीं पता।

यह पेपर VISTA (वेरिफिकेशन इन सीक्वेंशियल टर्न-बेस्ड असेसमेंट) पेश करता है, जो बातचीत को फैक्ट-चेक करने का एक नया तरीका है। VISTA को एक फोटोग्राफर के रूप में नहीं, बल्कि एक नोटबुक लेकर चलने वाले जासूस के रूप में सोचें।

VISTA कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "एटमिक क्लेम" का विभाजन (LEGO सादृश्य)

जब गाइड एक लंबा, जटिल वाक्य बोलता है, तो VISTA केवल टेक्स्ट के पूरे ब्लॉक को नहीं देखता। यह वाक्य को छोटे, व्यक्तिगत LEGO ब्रिक्स (एटमिक क्लेम) में तोड़ देता है।

  • गाइड कहता है: "संग्रहालय 1990 में खुला था और इसमें एक विशाल डायनासोर है।"
  • VISTA इसे विभाजित करता है:
    1. संग्रहालय 1990 में खुला था।
    2. संग्रहालय में एक विशाल डायनासोर है।
      इससे यह सुनिश्चित होता है कि यदि एक ईंट नकली है, तो पूरे ढांचे को खारिज नहीं किया जाएगा; हमें पता चल जाएगा कि कौन सी ईंट टूटी हुई है।

2. "रनिंग नोटबुक" (मेमोरी सादृश्य)

यही VISTA की सुपरपावर है। पुराने तरीकों के विपरीत, जो अतीत को भूल जाते हैं, VISTA उन सभी बातों की एक रनिंग नोटबुक रखता है जिन्हें गाइड पहले ही सच साबित कर चुका है।

  • यदि गाइड टर्न 1 में कहता है, "मुझे जैज़ पसंद है," और टर्न 5 में कहता है, "मुझे जैज़ से नफरत है," तो एक सामान्य चेकर इसे मिस कर सकता है।
  • VISTA अपनी नोटबुक देखता है, पहला बयान देखता है, और तुरंत दूसरे बयान को एक विरोधाभास (contradiction) के रूप में चिह्नित करता है। यह कहानी को वैसे ही ट्रैक करता है जैसे आप वास्तविक बातचीत में करेंगे।

3. "फोर-बॉक्स सॉर्टर" (सॉर्टिंग सादृश्य)

जब VISTA को ऐसा दावा मिलता जिसे वह किसी किताब या नोटबुक से सिद्ध नहीं कर पाता, तो वह केवल "ERROR!" चिल्लाता नहीं है। वह दावे को चार विशिष्ट बॉक्सों में से एक में डाल देता है:

  • 📦 बॉक्स 1: वेरिफाइड (सत्यापित)। "हाँ, किताब कहती है कि यह सच है।"
  • 📦 बॉक्स 2: कॉन्ट्राडिक्टेड (विरोधाभासी)। "नहीं, किताब इसके विपरीत कहती है, या आपने पहले कुछ अलग कहा था।"
  • 📦 बॉक्स 3: लैकिंग एविडेंस (साक्ष्य की कमी)। "यह सच हो सकता है, लेकिन हमारे पास इसे सही साबित करने के लिए अभी कोई किताब नहीं है।"
  • 📦 बॉक्स 4: आउट-ऑफ-स्कोप (राय)। "यह केवल आपकी राय या भावना है, जैसे 'आइसक्रीम सबसे अच्छी है।' हम भावनाओं की फैक्ट-चेक नहीं कर सकते।"

यह क्यों महत्वपूर्ण है?
पुराने सिस्टम "मुझे नहीं पता" (abstention) और "आइसक्रीम सबसे अच्छी है" (राय) को एक झूठ (जैसे "चंद्रमा पनीर से बना है") के समान ही मानते हैं। VISTA समझता है कि यह स्वीकार करना कि आप नहीं जानते वास्तव में ईमानदारी का संकेत है, न कि भ्रम (hallucination) का। यह "मुझे नहीं पता" को "मैं मनगढ़ंत बातें बना रहा हूँ" से अलग करता है।

4. परिणाम: एक बेहतर जासूस

शोधकर्ताओं ने आठ अलग-अलग AI मॉडल्स (छोटे से लेकर विशाल तक) और चार अलग-अलग कन्वर्सेशन डेटासेट्स के खिलाफ VISTA का परीक्षण किया।

  • परिणाम: VISTA ने पिछले सर्वश्रेष्ठ तरीकों (जैसे FActScore या केवल एक बड़े AI से टेक्स्ट को "जज" करने के लिए कहना) की तुलना में अधिक झूठ पकड़े और कम गलतियाँ कीं।
  • सरप्राइज: इसने छोटे, कम शक्तिशाली AI मॉडल्स की सबसे अधिक मदद की। यह एक जूनियर जासूस को बेहतर आवर्धक लेंस (magnifying glass) देने जैसा है; अचानक, वे वरिष्ठ जासूसों के लगभग उतने ही अच्छे से केस सुलझाने लगते हैं।

मुख्य निष्कर्ष

यह पेपर तर्क देता है कि बातचीत में सत्य गतिशील होता है, जैसे एक नदी जो बहती और बदलती है, न कि एक स्थिर मूर्ति। यह तय करने के लिए कि क्या एक AI सच बोल रहा है, हमें पूरी बातचीत सुननी होगी, याद रखना होगा कि पहले क्या कहा गया था, और झूठ, अनुमान और राय के बीच के अंतर को समझना होगा।

VISTA वही नया सुनने वाला कान है। यह हमें ऐसे AI असिस्टेंट बनाने में मदद करता है जो न केवल धाराप्रवाह वक्ता हैं, बल्कि ईमानदार, विश्वसनीय और बातचीत में आत्म-जागरूक साथी भी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →