← नवीनतम पेपर
🤖 AI

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

यह शोध पत्र VeriTrip प्रस्तुत करता है, जो एक सत्यापन योग्य बेंचमार्क है जो एक सिंक्रोनाइज़्ड नॉलेज बेस स्थापित करके और तथ्यात्मक विश्वसनीयता को मापने के लिए अनस्ट्रक्चर्ड मल्टीमॉडल वेब कॉर्पोरा पर ट्रैवल प्लानिंग एजेंटों का मूल्यांकन करता है और स्वायत्त रिट्रीवल कॉग्निटिव लोड और इंस्ट्रक्शन रिटेंशन के बीच एक महत्वपूर्ण ट्रेड-ऑफ को प्रकट करता है।

मूल लेखक: Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक आदर्श छुट्टी की योजना बनाने के लिए एक ट्रैवल एजेंट को काम पर रख रहे हैं। अतीत में, आपने इस एजेंट को विकल्पों का एक साफ-सुथरा, छपा हुआ मेनू (जैसे कि उड़ान का शेड्यूल या होटल की सूची) दिया और उनसे उनमें से सर्वश्रेष्ठ चुनने के लिए कहा। उन्हें बस एक अच्छा प्लान बनाने के लिए गणित और तर्क में कुशल होना था।

लेकिन वास्तविक दुनिया में, कोई साफ-सुथरा मेनू नहीं होता है। वहाँ केवल अराजक, अव्यवस्थित इंटरनेट है: हजारों ट्रैवल ब्लॉग, सोशल मीडिया से धुंधली तस्वीरें, विरोधाभासी समीक्षाएं और पुराने हो चुके वेबसाइट्स।

VeriTrip एआई ट्रैवल एजेंटों के लिए एक नया "टेस्ट ड्राइव" है, जिसे यह देखने के लिए बनाया गया है कि क्या वे इस वास्तविक दुनिया की अव्यवस्था को संभाल सकते हैं। यहाँ शोध पत्र इसे सरल उपमाओं का उपयोग करके समझाता है:

1. समस्या: "साफ कमरा" बनाम "जंगल"

एआई एजेंटों के लिए अधिकांश पिछले परीक्षण एक साफ, सफेद कमरे में उन्हें रखने जैसे थे जहाँ सभी तथ्य दीवार पर सुंदर लिखावट में लिखे थे। एआई को बस दीवार को पढ़ना था और एक योजना लिखनी थी।

लेखक कहते हैं कि यह परीक्षण यह नहीं परखता कि एआई वास्तव में कितना स्मार्ट है। वास्तविक जीवन एक जंगल है।

  • शोर (The Noise): इंटरनेट "शोर" से भरा है—नकली विज्ञापन, भ्रमित करने वाली गलतियाँ, और लोग इस बात पर बहस कर रहे हैं कि कोई रेस्टोरेंट अच्छा है या बुरा।
  • दृश्य पहेली (The Visual Puzzle): कभी-कभी एक उपयोगकर्ता किसी लैंडमार्क (जैसे कि कोई मूर्ति) की धुंधली, कटी हुई फोटो भेजता है और कहता है, "मैं यहाँ जाना चाहता हूँ।" एआई को बिना किसी नेम टैग के यह पता लगाना होगा कि वह वास्तव में कौन सी मूर्ति है।
  • भ्रम का जाल (The Hallucination Trap): यदि एआई को उत्तर नहीं मिलता है, तो वह अपने प्रशिक्षण डेटा से कुछ "याद" करके उसे बना सकता है। यात्रा के मामले में, फ्लाइट नंबर का गलत अनुमान लगाना एक बड़ी आपदा है।

2. समाधान: "VeriTrip" टेस्ट

शोधकर्ताओं ने इन एजेंटों का परीक्षण करने के लिए VeriTrip नामक एक विशेष सैंडबॉक्स बनाया है। इसे इंटरनेट के एक "फ्रोजन स्नैपशॉट" के रूप में समझें।

  • लाइब्रेरी (MRB): उन्होंने वास्तविक यात्रा साइटों से 8,000 से अधिक दस्तावेज़ और 4,000 चित्र एकत्र किए। यह वह "लाइब्रेरी" है जिसे खोजने की अनुमति एआई को दी गई है। यह अव्यवस्थित और अनियंत्रित है, बिल्कुल असली वेब की तरह।
  • उत्तर कुंजी (VKB): एआई से दूर छिपाकर रखी गई एक "गोल्ड स्टैंडर्ड" उत्तर कुंजी है। इसमें उस अव्यवस्थित लाइब्रेरी से निकाले गए वास्तविक तथ्य शामिल हैं।
  • परीक्षण: एआई को एक उपयोगकर्ता का अनुरोध मिलता है (जैसे, "चांगशा के लिए 3 दिनों की यात्रा की योजना बनाएं, बजट $500, और यहाँ एक कांस्य कलाकृति की धुंधली फोटो है")। एआई को निम्नलिखित कार्य करने होंगे:
    1. धुंधली फोटो को देखकर यह पता लगाना कि वह क्या है।
    2. सही तथ्यों को खोजने के लिए अव्यवस्थित लाइब्रेरी में खोजना।
    3. एक योजना बनाना।
    4. चुनौती: शोधकर्ता हर एक विवरण (फ्लाइट नंबर, होटल के नाम, कीमतें) की छिपी हुई उत्तर कुंजी के विरुद्ध जाँच करते हैं। यदि एआई ने कोई तथ्य बनाया है, तो उसे उस हिस्से के लिए शून्य अंक मिलेगा।

3. उन्होंने क्या पाया: "ब्रेन ओवरलोड" का आश्चर्य

शोधकर्ताओं ने सबसे स्मार्ट एआई मॉडल (जैसे GPT-4o, Claude, और Gemini) का परीक्षण किया। यहाँ क्या हुआ:

  • "आलसी" बनाम "कठिन" काम: आसान कार्यों पर, एआई "आलसी" थे। उन्होंने पर्याप्त खोज नहीं की और केवल अपनी याददाश्त के आधार पर अनुमान लगाया। इससे गलतियाँ हुईं। कठिन कार्यों पर, उन्हें अधिक खोजने के लिए मजबूर किया गया, जिससे वे वास्तव में अधिक सटीक हो गए।
  • समझौता (The "Juggling Act"): यह सबसे दिलचस्प खोज है।
    • जब एआई को धुंधली फोटो की पहेली सुलझाने के लिए अपनी "आंखों" का उपयोग करना पड़ा, तो वे तथ्यों को खोजने में बेहतर हो गए (उन्होंने नकली नाम नहीं बनाए)।
    • लेकिन, क्योंकि फोटो पहेली को सुलझाने में उनके "दिमाग की शक्ति" का बहुत अधिक उपयोग हुआ, इसलिए वे उपयोगकर्ता की अन्य प्राथमिकताओं को भूल गए। वे सही होटल तो ढूंढ सकते हैं, लेकिन भूल सकते हैं कि उपयोगकर्ता को शाकाहारी भोजन चाहिए था या उनका बजट क्या था।
    • उपमा: यह एक ऐसे छात्र की तरह है जो एक कठिन गणित की समस्या को हल करने में इतना केंद्रित है कि वह परीक्षा पत्र पर अपना नाम लिखना ही भूल जाता है। उन्होंने गणित तो सही किया, लेकिन वे पूरे असाइनमेंट में विफल रहे।

4. निष्कर्ष: "देखना" "योजना बनाना" नहीं है

शोध पत्र निष्कर्ष निकालता है कि वर्तमान एआई एजेंट दो अलग-अलग चीजों में अच्छे हैं, लेकिन उन्हें मिलाने में खराब हैं:

  1. देखना: वे एक तस्वीर देख सकते हैं और सही जगह का पता लगा सकते हैं।
  2. योजना बनाना: वे एक शेड्यूल व्यवस्थित कर सकते हैं।

लेकिन जब उन्हें एक साथ दोनों काम करने होते हैं, तो वे संघर्ष करते हैं। वे अक्सर तथ्यों को सही पाते हैं लेकिन योजना गलत हो जाती है, या वे योजना को सही पाते हैं लेकिन तथ्य मनगढ़ंत होते हैं।

संक्षेप में: VeriTrip हमें दिखाता है कि एक वास्तव में विश्वसनीय एआई ट्रैवल एजेंट बनाने के लिए, हमें इसे यह सिखाना होगा कि एक अव्यवस्थित दुनिया में तथ्यों को खोजने के साथ-साथ उपयोगकर्ता की विशिष्ट इच्छाओं को भी कैसे बरकरार रखा जाए। अभी, एआई गेंद को गिरा रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →