← नवीनतम पेपर
💬 NLP

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

यह शोध पत्र K-BrowseComp को प्रस्तुत करता है, जो कोरियाई संदर्भों पर आधारित एक नया वेब-ब्राउज़िंग एजेंट बेंचमार्क है जिसमें 400 मैन्युअल रूप से सत्यापित और सिंथेटिक समस्याएँ शामिल हैं, जो यह प्रकट करता है कि सीमांत (फ्रंटियर) और कोरिया-विशिष्ट बड़े भाषा मॉडल भी इन कार्यों के साथ काफी संघर्ष करते हैं, जिससे 0% और 45.67% के बीच सटीकता दर प्राप्त होती है।

मूल लेखक: Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुपर-फास्ट लाइब्रेरियन है जिसने दुनिया की लगभग हर किताब पढ़ ली है। आप उनसे एक साधारण सवाल पूछते हैं, और वे तुरंत जवाब देते हैं। लेकिन क्या होता है जब आप उनसे एक पेचीदा सवाल पूछते हैं जिसमें उन्हें एक विशिष्ट पड़ोस से होकर गुजरना पड़ता है, कुछ खास दरवाजों पर दस्तक देनी पड़ती है, कुछ अलग-अलग बहीखातों (ledgers) की जांच करनी पड़ती है, और उन सुरागों को जोड़ना पड़ता है जो केवल उस स्थानीय क्षेत्र में मौजूद हैं?

यह बिल्कुल वही है जिसके बारे में यह पेपर, K-BROWSECOMP, है।

समस्या: "स्थानीय पड़ोस" का अंतर (The "Local Neighborhood" Gap)

लंबे समय से, हमने AI का परीक्षण तर्क पहेलियों को हल करने या निर्देशों का पालन करने के लिए किया है। AI इसमें बहुत अच्छा हो गया है। लेकिन वास्तविक दुनिया केवल तर्क के बारे में नहीं है; यह संदर्भ (context) के बारे में है।

लेखकों का तर्क है कि जबकि AI "ग्लोबल" इंटरनेट (ज्यादातर अंग्रेजी) में बहुत अच्छा है, लेकिन जब उसे कोरियाई इंटरनेट को नेविगेट करना होता है, तो वह संघर्ष करता है। यह एक शानदार शेफ को ऐसी भाषा में लिखी रेसिपी देने जैसा है जिसे वह बोल नहीं सकता, और ऐसे सामग्रियों का उपयोग करना जो केवल एक विशिष्ट गाँव के बाजार में मिलती हैं। भले ही शेफ को खाना बनाना आता हो, लेकिन वह विशिष्ट सामग्री खोजने या स्थानीय निर्देशों को समझने में भटक सकता है।

वर्तमान में, कोई मानक "टेस्ट" नहीं था जिससे यह देखा जा सके कि AI कोरियाई वेब सर्च के इन विशिष्ट, स्थानीय मामलों को कितनी अच्छी तरह संभाल सकता है। मौजूदा टेस्ट बहुत आसान थे या उनमें AI के लिए उत्तर खोजने के लिए वास्तव में वेब को ब्राउज़ करने की आवश्यकता नहीं थी।

समाधान: एक नया "बाधा दौड़" (A New "Obstacle Course")

शोधकर्ताओं ने एक नया बेंचमार्क बनाया जिसे K-BROWSECOMP कहा जाता है। इसे AI एजेंटों (वेब ब्राउज़ करने वाले रोबोट) के लिए एक विशेष बाधा दौड़ के रूप में समझें।

  • द कोर्स (The Course): इसमें 400 पेचीदा सवाल हैं।
  • नियम: उत्तर देने के लिए, AI केवल अनुमान नहीं लगा सकता या जो उसने याद किया है उस पर निर्भर नहीं रह सकता। उसे:
    1. कोरियाई वेब पर जाना होगा।
    2. विशिष्ट, कठिन-से-खोजने योग्य तथ्यों की तलाश करनी होगी (जैसे, "एक विशिष्ट कवि की 10वीं पुस्तक में 13वीं कविता का शीर्षक क्या है?")।
    3. विभिन्न वेबसाइटों से सुराग जोड़ने होंगे।
    4. एक एकल, सही उत्तर देना होगा।

उन्होंने इस टेस्ट को दो भागों में विभाजित किया है:

  1. सत्यापित सेट (Verified Set - 300 सवाल): इन्हें वास्तविक मनुष्यों द्वारा लिखा और जांचा गया है ताकि यह सुनिश्चित हो सके कि उत्तर सही हैं और सुराग सार्वजनिक कोरियाई वेबसाइटों पर मौजूद हैं।
  2. सिंथेटिक सेट (Synthetic Set - 100 सवाल): यह एक चतुर हिस्सा है। शोधकर्ताओं ने एक AI का उपयोग करके नए, और भी कठिन सवाल बनाने के लिए किया, जो वहां देखते हैं जहां अन्य AI विफल होते हैं। यह एक वीडियो गेम डिजाइनर की तरह है जो खिलाड़ियों को लेवल में फंसते हुए देखता है, और फिर उन्हें उसी तरह फंसाने के लिए एक नया लेवल डिजाइन करता है।

परिणाम: AI रास्ता भटक गया

परिणाम आश्चर्यजनक थे। दुनिया के सबसे उन्नत AI मॉडल (AI के "सुपरस्टार्स") बुरी तरह संघर्ष कर रहे थे।

  • ग्लोबल जायंट्स (Global Giants): सबसे अच्छे मॉडल (जैसे GPT-5.5) केवल लगभग 45% सत्यापित सवालों को सही कर पाए। इसका मतलब है कि वे आधे से अधिक बार विफल रहे।
  • लोकल हीरोज (Local Heroes): कोरियाई AI मॉडल, जिन्हें कोरियाई संस्कृति का विशेषज्ञ होना चाहिए, वे और भी खराब प्रदर्शन करते हैं, जिनका स्कोर 0% से 10% के बीच रहा।
  • सिंथेटिक ट्रैप (Synthetic Trap): AI-जनरेटेड "ट्रैप" सवालों पर, सबसे अच्छे मॉडल ने केवल 26% सही उत्तर दिए।

वे क्यों विफल हुए? ("ट्रैफिक जाम" का उदाहरण)

पेपर केवल यह नहीं कहता कि "वे विफल रहे।" यह बताता है कि वे कैसे विफल हुए। कल्पना कीजिए कि AI एक केस सुलझाने की कोशिश कर रहा एक जासूस है।

  1. सुराग मिलना, धागा खो देना: AI अक्सर सही वेबसाइट (सही सुराग) ढूंढ लेता है, लेकिन फिर वह उस विशिष्ट नियम को भूल जाता है जिसे वह खोज रहा था। यह सही घर ढूंढने लेकिन मेलबॉक्स में विशिष्ट पत्र की जांच करना भूल जाने जैसा है।
  2. गलत दरवाजा चुनना: AI उम्मीदवारों की एक सूची (जैसे K-pop ग्रुप की सूची) पाता है लेकिन उसमें से पहला विकल्प चुन लेता जो अच्छा दिखता है, बिना यह जांचे कि क्या वह सभी नियमों पर खरा उतरता है।
  3. "मुझे नहीं पता" वाला क्षण: कभी-कभी AI जानकारी ढूंढ लेता है लेकिन अंतिम उत्तर लिखने में भ्रमित हो जाता है, इसलिए वह या तो हार मान लेता है या अनुमान लगा लेता है।

लेखकों ने पाया कि समस्या यह नहीं है कि AI जानकारी ढूंढ नहीं सकता। समस्या यह है कि वह खोजते समय जानकारी के विभिन्न टुकड़ों को ट्रैक (याद) नहीं रख पाता। यह एक पहेली सुलझाने जैसा है जबकि कोई आपके टुकड़ों को बार-बार इधर-उधर कर रहा हो; आप सही टुकड़े तो पाते हैं, लेकिन उन्हें सही क्रम में जोड़ नहीं पाते।

निष्कर्ष (The Takeaway)

यह पेपर एक चेतावनी है। यह दिखाता है कि केवल इसलिए कि एक AI स्मार्ट है और बहुत सारे तथ्य जानता है, इसका मतलब यह नहीं है कि वह एक विशिष्ट स्थानीय वातावरण में एक सहायक की तरह काम कर सकता है।

शोधकर्ताओं ने इस टेस्ट और इसके कोड को मुफ्त में जारी किया है, इस उम्मीद में कि डेवलपर्स इसका उपयोग बेहतर "कोरियाई वेब एजेंट" बनाने के लिए करेंगे जो केवल खोजते नहीं हैं, बल्कि वास्तव में कोरियाई डिजिटल दुनिया में नेविगेट करना, याद रखना और कड़ियों को जोड़ना समझते हैं।

संक्षेप में: हमने कोरियाई संदर्भ में AI के दौड़ने के लिए एक कठिन भूलभुलैया बनाई। सबसे तेज़ धावक भी रास्ता भटक गए क्योंकि वे अपना ध्यान केंद्रित नहीं रख सके, न कि इसलिए कि वे रास्ता नहीं देख पा रहे थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →