← नवीनतम पेपर
💻 computer science

Temporal Reliability of ChatGPT-Generated Bilingual Texts: Implications for AI-Assisted Language Learning and Multilingual Information Access

यह अध्ययन वित्त, प्रौद्योगिकी और सार्वजनिक नीति डोमेन में द्विभाषी अनुवाद में चार क्रमिक चैटजीपीटी (ChatGPT) संस्करणों की लौकिक विश्वसनीयता का मूल्यांकन करता है, जो यह प्रकट करता है कि मॉडल अपडेट अर्थ संबंधी सटीकता या पठनीयता में निरंतर सुधार की गारंटी नहीं देते हैं और इसके बजाय विचलन प्रदर्शित करने वाले प्रदर्शन प्रक्षेपवक्र दिखाते हैं जो एआई-सहायता प्राप्त भाषा अनुप्रयोगों के लिए निरंतर, डोमेन-विशिष्ट मूल्यांकन को आवश्यक बनाते हैं।

मूल लेखक: Zhihan Fu

प्रकाशित 2026-07-22
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhihan Fu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक सुपर-स्मार्ट, सर्वज्ञानी रोबोटिक दोस्त है जो पृथ्वी की हर भाषा बोल सकता है। आप उससे एक कठिन वाक्य का अनुवाद करने के लिए कहते हैं, और वह आपको एक सटीक उत्तर देता है। लेकिन क्या होगा अगर आप ठीक वही सवाल एक महीने बाद पूछें, जब रोबोट ने एक "सॉफ्टवेयर अपडेट" लिया हो? क्या वह वही उत्तर देगा या वह कुछ भूल गया है, अपना मन बदल लिया है, या एक अलग शैली में बोलना शुरू कर दिया है? यह आर्टिफिशियल इंटेलिजेंस (AI) और भाषा की दुनिया में एक नए अध्ययन के पीछे का बड़ा सवाल है।

वैज्ञानिक इन सुपर-स्मार्ट रोबों को "लार्ज लैंग्वेज मॉडल्स" (LLMs) कहते हैं। वे डिजिटल मस्तिष्क की तरह हैं जो लिख सकते हैं, अनुवाद कर सकते हैं और चैट कर सकते हैं। आमतौर पर, जब हम एक नया वीडियो गेम या नया फोन खरीदते हैं, तो हम उम्मीद करते हैं कि नया संस्करण पुराने वाले से बेहतर होगा। हम मानते हैं कि यदि कोई कंपनी "वर्जन 5.0" और फिर "वर्जन 6.0" जारी करती है, तो दूसरा वाला अधिक स्मार्ट, तेज़ और सटीक होगा। लेकिन इन AI रोबोटों के साथ, चीजें हमेशा इतनी सरल नहीं होतीं। उन्हें पर्दे के पीछे लगातार सुधारा और अपडेट किया जाता है, जिससे कभी-कभी उनके सोचने या बोलने का तरीका बदल जाता है, और हमें इसकी जानकारी भी नहीं होती। यह अध्ययन एक बहुत ही महत्वपूर्ण प्रश्न पूछता है: यदि आप भाषा सीखने या विदेशी भाषा में समाचार पढ़ने के लिए AI का उपयोग कर रहे हैं, तो क्या आप भरोसा कर सकते हैं कि "नया" संस्करण वास्तव में सबसे अच्छा है? या क्या ऐसा हो सकता है कि रोबोट कुछ चीजों में बेहतर होने के साथ-साथ कुछ अन्य चीजों में खराब भी हो जाए?

प्रयोग: रोबोट की याददाश्त का परीक्षण

यह पता लगाने के लिए, शोधकर्ता ज़िहान फू (Zhihan Fu) ने एक लोकप्रिय AI चैटबॉट (जिसे GPT-5.0, GPT-5.4, GPT-5.5, और GPT-5.6 Sol नाम दिया गया है) के चार अलग-अलग संस्करणों के साथ "अंतर पहचानो" का खेल खेलने का निर्णय लिया। इन संस्करणों को कुछ महीनों के अंतराल पर लिए गए एक ही व्यक्ति के चार अलग-अलग स्नैपशॉट की तरह समझें।

शोधकर्ता ने रोबोट को केवल चैट करने के लिए नहीं कहा; उसने उसे एक बहुत ही विशिष्ट चुनौती दी। उसने तीन वास्तविक दुनिया के लेख लिए—एक पैसे (वित्त) के बारे में, एक सौर ऊर्जा तकनीक के बारे में, और एक सरकारी नियमों (सार्वजनिक नीति) के बारे में—और हर एक संस्करण से उन्हें चीनी से अंग्रेजी में अनुवाद करने के लिए कहा। उसने हर संस्करण के लिए बिल्कुल समान निर्देश दिए और उनके उत्तरों की तुलना एक मानव विशेषज्ञ द्वारा किए गए "गोल्ड स्टैंडर्ड" अनुवाद से की।

उसने अनुवादों का न्याय करने के दो मुख्य तरीके इस्तेमाल किए:

  1. "अर्थ" की जाँच: उसने यह देखने के लिए COMET नामक टूल का उपयोग किया कि रोबक का अर्थ मानव विशेषज्ञ के अर्थ के कितने करीब था। क्या उसने सभी तथ्यों को सही रखा?
  2. "पठनीयता" की जाँच: उसने यह मापा कि पाठ को पढ़ना कितना आसान था। क्या यह बहुत कठिन था? क्या वाक्य बहुत लंबे थे? क्या इसने सही शब्दों का उपयोग किया?

आश्चर्य: रोबोट एक सीधी रेखा में बेहतर नहीं हो रहा है

परिणाम कुछ ऐसे थे जैसे किसी सवारी के लिए ऊपर-नीचे जाने वाले रोलरकोस्टर को देखना, जो अलग-अलग यात्रियों के लिए अलग-अलग दिशाओं में जाता है। सबसे बड़ा आश्चर्य यह था कि AI के नए संस्करण स्वचालित रूप से बेहतर नहीं थे। वास्तव में, रोबोट का प्रदर्शन इस आधार पर अजीब और अप्रत्याशित तरीकों से बदल गया कि वह किस विषय के बारे में बात कर रहा है।

यहाँ बताया गया है कि प्रत्येक "दुनिया" में क्या हुआ जिसे रोबोट ने देखा:

  • सरकारी नियम की दुनिया (सार्वजनिक नीति): यह एकमात्र जगह थी जहाँ रोबोट अर्थ को सही रखने में लगातार बेहतर होता गया। प्रत्येक नए संस्करण के साथ, "अर्थ" का स्कोर बढ़ता गया, जो नवीनतम संस्करण, GPT-5.6 Sol के साथ अपने उच्चतम स्तर पर पहुँच गया। हालाँकि, एक पेंच था: जैसे-जैसे अर्थ अधिक सटीक हुआ, पाठ पढ़ने में कठिन होता गया। नए संस्करणों ने अधिक जटिल, बोझिल शैली में लिखना शुरू कर दिया जो एक सहज कहानी के बजाय एक कठोर कानूनी दस्तावेज़ जैसा महसूस होता था।
  • पैसे की दुनिया (वित्त): यहाँ, रोबलेट कुछ समय के लिए काफी स्थिर रहा, लेकिन फिर वह GPT-5.5 संस्करण के साथ अपने शिखर पर पहुँचा और उसके बाद नवीनतम संस्करण के साथ फिर से थोड़ा खराब हो गया। नवीनतम संस्करण यहाँ विजेता नहीं था।
  • सौर ऊर्जा की दुनिया (तकनीक): यह सबसे रोमांचक सफर था। रोबोट ने मजबूती से शुरुआत की, संस्करण GPT-5.4 के साथ और भी बेहतर हुआ, और उसके बाद के हर अपडेट के साथ खराब होता गया। जब तक नवीनतम संस्करण (GPT-5.6 Sol) आया, तब तक अर्थ को सही रखने की उसकी क्षमता सबसे पहले संस्करण से भी नीचे गिर गई थी! हालाँकि, नवीनतम संस्करण ने एक दिलचस्प काम किया: उसने लंबे, भ्रमित करने वाले वाक्यों को छोटे, प्रभावशाली वाक्यों में तोड़ दिया, जिससे पाठ पढ़ना आसान लगा, भले ही वह वास्तव में कुछ महत्वपूर्ण तकनीकी विवरणों को खो रहा था।

मुख्य निष्कर्ष: "नया" होने का मतलब "बेहतर" होना नहीं है

अध्ययन सुझाव देता है कि हम यह मानकर नहीं चल सकते कि नवीनतम AI अपडेट काम के लिए सबसे अच्छा उपकरण है। यह एक ऐसे शेफ की तरह है जिसे एक नया किचन मिला है। हो सकता है कि नया ओवन उनके केक का स्वाद एकदम सही बना दे, लेकिन नए चाकू उनकी सब्जी काटने की गति को धीमा कर दें।

  • सरकारी ग्रंथों के लिए: नवीनतम AI सबसे सटीक है, लेकिन यह पढ़ने में सबसे कठिन भी है।
  • तकनीकी मैनुअल के लिए: नवीनतम AI छोटे वाक्यों में लिखता है (जो दिखने में अच्छा लगता है), लेकिन वास्तव में यह कुछ महत्वपूर्ण अर्थ खो देता है।
  • पैसे के ग्रंथों के लिए: मध्यवर्ती संस्करण (GPT-5.5) सबसे अच्छा था, न कि नवीनतम वाला।

शोधकर्ता ने पाया कि रोबोट की अर्थ को सही रखने की क्षमता और उसकी पढ़ने में आसानी की क्षमता अक्सर विपरीत दिशाओं में चलती है। कभी-कभी, पाठ को अधिक सटीक बनाने से उसे समझना कठिन हो जाता है। अन्य समय में, इसे छोटा और सरल बनाने से यह कम सटीक हो जाता है।

यह आपके लिए क्यों मायने रखता है

यदि आप भाषा सीखने में मदद के लिए AI का उपयोग करने वाले छात्र हैं, या यदि आप दूसरे देश के समाचार पढ़ने की कोशिश कर रहे हैं, तो यह अध्ययन एक चेतावनी लेबल है। यह हमें बताता है कि हमें केवल नवीनतम AI संस्करण को पकड़कर यह मान नहीं लेना चाहिए कि यह सबसे स्मार्ट है। "सबसे अच्छा" संस्करण पूरी तरह से इस बात पर निर्भर करता है कि आप क्या करने की कोशिश कर रहे हैं।

यदि आपको एक जटिल सरकारी नियम को समझने की आवश्यकता है, तो नवीनतम संस्करण आपको सही तथ्य दे सकता है लेकिन एक भ्रमित करने वाले तरीके में। यदि आप एक तकनीकी मैनुअल पढ़ रहे हैं, तो नवीनतम संस्करण सरल दिख सकता है लेकिन यह एक महत्वपूर्ण सुरक्षा चेतावनी को छोड़ सकता है। अध्ययन सुझाव देता है कि हमें इन AI उपकरणों का बार-बार परीक्षण करने की आवश्यकता है, उन्हें विशिष्ट कार्यों के लिए जाँचने की आवश्यकता है, क्योंकि हर बार अपडेट मिलने पर रोबोट का व्यक्तित्व बदल जाता है। "परफेक्ट" AI अनुवादक अभी मौजूद नहीं है; इसके बजाय, हमारे पास एक ऐसा रोबोट है जो लगातार बदल रहा है, और हमें इस बात के प्रति सावधान रहना होगा कि हम किस कार्य के लिए किस संस्करण पर भरोसा करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →