← नवीनतम पेपर
💻 computer science

Leveraging Language Models for Log Statement Generation in Multilingual Scenarios: How Far Are We?

यह शोध पत्र पांच प्रोग्रामिंग भाषाओं में अत्याधुनिक लॉग जनरेशन दृष्टिकोणों और लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए एक बड़े पैमाने के बहुभाषी बेंचमार्क को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि UniLog समग्र रूप से सर्वश्रेष्ठ प्रदर्शन करता है, फिर भी महत्वपूर्ण भाषा-विशिष्ट चुनौतियां मौजूद हैं जिनके लिए केवल मॉडल के आकार या डेटा की मात्रा को बढ़ाने के बजाय विशेष समाधानों की आवश्यकता है।

मूल लेखक: Kazuki Kusama, Honglin Shu, Masanari Kondo, Yasutaka Kamei

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kazuki Kusama, Honglin Shu, Masanari Kondo, Yasutaka Kamei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सॉफ्टवेयर इंजीनियर हैं जो एक विशाल, जटिल मशीन बना रहे हैं। इसे सुचारू रूप से चलाने के लिए, आपको कोड के माध्यम से "ब्रेडक्रम्ब्स" (लॉग स्टेटमेंट) छोड़ने की आवश्यकता है। ये ब्रेडक्रम्ब्स आपको बताते हैं कि मशीन क्या कर रही है, कहाँ फंसी हुई है, या यदि कुछ टूटने वाला है।

हालाँकि, इन ब्रेडक्रम्ब्स को हाथ से लिखना कठिन काम है। आपको यह तय करना होगा:

  1. नोट कहाँ रखना है (स्थान)।
  2. नोट कितना जरूरी है (स्तर, जैसे "चेतावनी" बनाम "गंभीर त्रुटि")।
  3. नोट वास्तव में क्या कहता है (संदेश)।

यह पेपर उन नए "AI सहायकों" (लार्ज लैंग्वेज मॉडल्स) के लिए एक रिपोर्ट कार्ड की तरह है जिन्हें डेवलपर्स इन ब्रेडक्रम्ब्स को स्वचालित रूप से लिखने के लिए उपयोग करने की कोशिश कर रहे हैं। शोधकर्ताओं ने यह देखना चाहा कि क्या ये AI सहायक अच्छा काम करते हैं जब मशीन को पाँच अलग-अलग भाषाओं (Java, Python, JavaScript, TypeScript, और C#) में बनाया जाता है, न कि केवल एक में।

यहाँ उनके निष्कर्षों का विवरण दिया गया, जो सरल उपमाओं (analogies) का उपयोग करता है:

1. बड़ा परीक्षण: क्या AI एक बहुभाषी रसोई को संभाल सकता है?

शोधकर्ताओं ने पाँच अलग-अलग भाषाओं में 150,000 रेसिपी (कोड उदाहरण) के साथ एक विशाल परीक्षण रसोई बनाई। उन्होंने तीन प्रकार के शेफ से ब्रेडक्रम्ब्स लिखने के लिए कहा:

  • विशेषज्ञ शेफ (Specialized Chefs): वे AI मॉडल जो विशेष रूप से लॉग लिखने के लिए प्रशिक्षित किए गए हैं (जैसे UniLog)।
  • सामान्य शेफ (General Chefs): शक्तिशाली, सामान्य उद्देश्य वाले AI मॉडल (जैसे DeepSeek-V3 या GPT-4) जो सब कुछ थोड़ा-बहुत जानते हैं।

परिणाम:

  • विशेषज्ञ शेफ जीते: UniLog नामक मॉडल सबसे अच्छा रहा। यह एक ऐसे शेफ की तरह था जिसके पास नोट्स लिखने के लिए एक विशिष्ट रेसिपी बुक थी। उसने स्थान, तात्कालिकता और संदेश को लगभग 20% बार सही किया।
  • सामान्य शेफ ने कड़ी मेहनत की: सबसे अच्छा सामान्य AI (DeepSeek-V3) अच्छा था, लेकिन उसने इसे केवल 11% बार ही सही किया।
  • "एक ही आकार सबके लिए" वाली समस्या: AI हर भाषा में समान प्रदर्शन नहीं करता था। यह एक ऐसे शेफ की तरह था जो इतालवी (JavaScript) खाना बनाने में मास्टर है लेकिन थाई (Python) में संघर्ष करता है।
    • JavaScript AI द्वारा संभाले जाने के लिए सबसे आसान था।
    • Python सबसे कठिन था। शोधकर्ताओं ने पाया कि यह आंशिक रूप से इसलिए है क्योंकि Python कोड में अक्सर लूप्स (दोहराए जाने वाले कार्यों) के अंदर नोट्स होते हैं, जो AI के लिए भ्रमित करने वाला होता है।

2. प्रशिक्षण रणनीति: क्या AI को एक समय में एक भाषा सिखानी चाहिए या सभी पाँच भाषाओं को एक ब्लेंडर में डालकर एक साथ सब कुछ सिखाना चाहिए?

परिणाम:

  • विशेषज्ञता जीतती है: AI को एक समय में एक भाषा सिखाना (Monolingual training) सभी भाषाओं को एक साथ मिलाने (Mixing) की तुलना में बहुत बेहतर काम करता है।
  • "छोटा नमूना" आश्चर्य: UniLog के बारे में सबसे आश्चर्यजनक खोज यह थी कि इसे सीखने के लिए 120,000 रेसिपी के विशाल पुस्तकालय की आवश्यकता नहीं थी। इसे वास्तव में अच्छा होने के लिए केवल 500 उदाहरणों की आवश्यकता थी। यह एक ऐसे छात्र की तरह है जो केवल कुछ प्रमुख उदाहरणों का अध्ययन करके एक विषय में महारत हासिल कर सकता है, जबकि अन्य छात्रों को पूरी विश्वकोश पढ़ने की आवश्यकता थी। यह सुझाव देता है कि आप AI को कैसे सिखाते हैं (रणनीति), यह इस बात से अधिक महत्वपूर्ण है कि आप उसे कितना खिलाते हैं।

3. यह कठिन क्यों है? (स्कोर के पीछे का "क्यों")

शोधकर्ताओं ने गहराई से जांच की कि AI कुछ भाषाओं के साथ दूसरों की तुलना में अधिक संघर्ष क्यों करता है। उन्होंने तीन मुख्य कारण पाए:

  • "लूप" का जाल: Python में, कोड अक्सर कार्यों को दोहराता है (लूप्स)। AI एक लूप के अंदर नोट कहाँ रखना है, इस बारे में भ्रमित हो जाता है। यह एक घूमते हुए हिंडोले (carousel) के बीच में नोट लिखने की कोशिश करने जैसा है; यह जानना कठिन है कि ठीक कहाँ रुकें और लिखें।
  • "शब्दावली" का बेमेल होना: भले ही AI जानता हो कि नोट कहाँ रखना है, वह अक्सर शब्दों को गलत कर देता है। Python में, नोट्स बहुत विविध और अद्वितीय होते हैं (जैसे हर बार एक अनूठी कविता लिखना)। JavaScript में, नोट्स अक्सर दोहराए जाने वाले टेम्पलेट होते हैं (जैसे एक फॉर्म भरना)। AI फॉर्म की नकल करने में अच्छा है (JavaScript) लेकिन अनूठी कविता लिखने में खराब है (Python)।
  • "सटीक मिलान" का जाल: शोधकर्ताओं ने महसूस किया कि वे AI को जिस तरह से ग्रेड दे रहे थे वह बहुत सख्त था। वे यह देख रहे थे कि क्या AI का नोट मानव के नोट से अक्षर-दर-अक्षर सटीक मिलान करता है।
    • उपमा: यदि एक मानव लिखता है "इंजन गर्म है," और AI लिखता है "इंजन ओवरहीटिंग हो रहा है," तो सख्त ग्रेडिंग कहती है "गलत!" भले ही अर्थ बिल्कुल सही हो।
    • जब उन्होंने अर्थ की जाँच करने के लिए एक स्मार्ट "जज" (एक अन्य AI) का उपयोग किया, तो उन्होंने पाया कि AI वास्तव में सख्त स्कोर की तुलना में बहुत बेहतर प्रदर्शन कर रहा था। वह उपयोगी नोट्स बना रहा था, बस थोड़े अलग शब्दों के साथ।

निचोड़

पेपर यह निष्कर्ष निकालता है कि हम इस समस्या को हल करने के लिए केवल AI मॉडल को बड़ा नहीं बना सकते या उन्हें अधिक डेटा नहीं दे सकते। यह आकार के बारे में नहीं है; यह "फिट" (उपयुक्तता) के बारे में है।

बहुभाषी दुनिया में इन उपकरणों को प्रभावी बनाने के लिए, हमें उन्हें प्रत्येक प्रोग्रामिंग भाषा की विशिष्ट "व्यक्तित्व" को समझने के लिए डिज़ाइन करना होगा। हम Python को JavaScript की तरह नहीं मान सकते। वर्तमान में सबसे अच्छा दृष्टिकोण विशिष्ट उपकरणों (जैसे UniLog) का उपयोग करना है जो आपके द्वारा उपयोग की जा रही भाषा के लिए विशेष रूप से ट्यून किए गए हैं, बजाय इसके कि सब कुछ करने के लिए एक विशाल, सामान्य-उद्देश्य वाले AI पर भरोसा किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →