← नवीनतम पेपर
💻 computer science

TRACE: Evaluating Execution Efficiency of LLM-Based Code Translation

यह शोधपत्र **TRACE** को प्रस्तुत करता है, जो LLM-अनुवादित कोड की निष्पादन दक्षता (execution efficiency) का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि कार्यात्मक शुद्धता (functional correctness) दक्षता के लिए एक खराब प्रॉक्सी है और वर्तमान मॉडल अक्सर एल्गोरिद्मिक दोषों, भाषा के बेमेल होने और संसाधन कुप्रबंधन के कारण अक्षम कोड उत्पन्न करते हैं।

मूल लेखक: Zhihao Gong, Zeyu Sun, Dong Huang, Qingyuan Liang, Jie M. Zhang, Dan Hao

प्रकाशित 2026-03-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhihao Gong, Zeyu Sun, Dong Huang, Qingyuan Liang, Jie M. Zhang, Dan Hao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक जटिल रेसिपी को फ्रेंच से अंग्रेजी में अनुवाद करने के लिए एक मास्टर ट्रांसलेटर को काम पर रखा है। ट्रांसलेटर ने एक बेहतरीन काम किया है: सामग्री सही है, चरण समझ में आते हैं, और यदि आप अंग्रेजी संस्करण का पालन करते हैं, तो आपको एक स्वादिष्ट केक मिलता है। कार्यात्मक रूप से, अनुवाद एकदम सही है।

लेकिन यहाँ एक पेंच है: फ्रेंच रेसिपी में लिखा था, "बर्तन को 1 मिनट के लिए धीरे से चलाएं।" अंग्रेजी अनुवाद में लिखा है, "बर्तन को 1 मिनट के लिए धीरे से चलाएं," लेकिन ट्रांसलेटर ने गलती से एक छिपा हुआ निर्देश जोड़ दिया है: "शुरू करने से पहले, अपनी मांसपेशियों को गर्म करने के लिए रसोई के चारों ओर 10,000 बार चक्कर लगाएं।"

आपको केक तो मिल जाता है, लेकिन इसे बनाने में 10 मिनट के बजाय 10 घंटे लग जाते हैं। आपने ऊर्जा, समय और पैसा बर्बाद कर दिया।

यह बिल्कुल वही समस्या है जिसे TRACE (इस पेपर का विषय) आर्टिफिशियल इंटेलिजेंस की दुनिया में हल करने की कोशिश कर रहा है।

समस्या: "सही लेकिन धीमा"

कुछ समय से, हम AI मॉडल्स (लार्ज लैंग्वेज मॉडल्स या LLMs) से एक प्रोग्रामिंग भाषा (जैसे C++) से दूसरी प्रोग्रामिंग भाषा (जैसे Python) में कोड अनुवाद करने के लिए कह रहे हैं। हम तब बहुत खुश होते हैं जब कोड काम करता है। यदि AI ऐसा कोड बनाता है जो बिना क्रैश हुए चलता है और सही उत्तर देता है, तो हम उसे एक गोल्ड स्टार देते हैं।

लेकिन शोधकर्ताओं ने महसूस किया: सिर्फ इसलिए कि यह काम करता है, इसका मतलब यह नहीं है कि यह अच्छा है।

उन्होंने पाया कि AI मॉडल अक्सर कोड को इस तरह से अनुवाद करते हैं जो कार्यात्मक रूप से सही तो होता है, लेकिन अविश्वसनीय रूप से अक्षम (inefficient) होता है। यह वैसा ही है जैसे AI ने रेसिपी का अनुवाद तो कर दिया लेकिन वह "रसोई के चारों ओर चक्कर लगाने" वाले चरण को हटाना भूल गया। वास्तविक दुनिया में, इसका मतलब है ऐसा सॉफ्टवेयर जो 500 गुना धीमा चलता है या जरूरत से 30 गुना अधिक कंप्यूटर मेमोरी का उपयोग करता है।

समाधान: द TRACE बेंचमार्क

इसे ठीक करने के लिए, लेखकों ने TRACE बनाया। TRACE को कोड ट्रांसलेटर्स के लिए एक स्ट्रेस टेस्ट जिम के रूप में समझें।

  1. पुराना तरीका: पिछले परीक्षण एक "हल्की जॉगिंग" की तरह थे। वे AI को सरल समस्याएं देते थे (जैसे दो छोटी संख्याओं को जोड़ना) यह देखने के लिए कि क्या कोड काम करता है। AI आसानी से पास हो जाता था।
  2. TRACE का तरीका: TRACE एक भारी बैकपैक के साथ मैराथन है। यह उन्हीं समस्याओं को लेता है लेकिन "स्ट्रेस टेस्ट" बनाता है—विशाल, कठिन इनपुट जो कंप्यूटर को उसकी सीमाओं तक धकेल देते हैं।
    • उपमा: यदि पुराने टेस्ट ने पूछा, "क्या आप 5 पाउंड का वजन उठा सकते हैं?" तो TRACE पूछता है, "क्या आप स्प्रिंट दौड़ते समय 500 पाउंड का वजन उठा सकते हैं?"
    • अचानक, वह AI जो हल्की जॉगिंग में एकदम सही दिख रहा था, भारी भार के नीचे सांस लेने के लिए संघर्ष करने लगता है।

उन्होंने क्या खोजा

शोधकर्ताओं ने 28 अलग-अलग AI मॉडल्स को इस जिम में डाला। यहाँ तीन बड़ी चीजें हैं जो उन्होंने पाईं:

1. "स्मार्ट" होने का मतलब "कुशल" होना नहीं है
जिन AI मॉडल्स को "सटीकता" (correctness) के लिए उच्चतम स्कोर मिले (जिन्हें सबसे अधिक गोल्ड स्टार मिले), वे अक्सर सबसे धीमे धावक थे।

  • उपमा: सबसे प्रसिद्ध, महंगी ट्रांसलेटर (Claude-4-think) व्याकरण में तो बेहतरीन थी लेकिन गति में बहुत खराब थी। वहीं, एक छोटा, कम प्रसिद्ध ओपन-सोर्स मॉडल (Qwen2.5) वास्तव में बहुत तेज़ और अधिक कुशल था।
  • सबक: एक सही अनुवाद, एक अच्छे अनुवाद की गारंटी नहीं है।

2. गलतियाँ एक पैटर्न का पालन करती हैं
शोधकर्ताओं ने देखा कि कोड धीमा क्यों था। उन्होंने तीन मुख्य "दोषियों" को पाया:

  • एल्गोरिदम स्वैप (12%): AI ने गणित को पूरी तरह से बदल दिया। एक तेज़ शॉर्टकट का उपयोग करने के बजाय, इसने समस्या को हल करने के लिए एक धीमा, घुमावदार तरीका अपनाया।
  • गलत टूल (66%): यह सबसे आम गलती थी। AI ने काम के लिए गलत "टूल" चुना।
    • उपमा: कल्पना कीजिए कि मूल कोड ने एक पेचकस (तेज़ और सटीक) का उपयोग किया था। AI ने इसे उपयोग करने के लिए एक हथौड़े (यह काम तो पूरा कर देता है, लेकिन यह अनाड़ी और धीमा है) में बदल दिया। प्रोग्रामिंग में, यह तब होता है जब AI एक धीमी डेटा संरचना (जैसे कि एक ट्री) का उपयोग करता है, जबकि एक तेज़ संरचना (जैसे कि एक हैश मैप) एकदम सही होती।
  • भारी बैकपैक (22%): AI ने अनावश्यक वजन जोड़ दिया। इसने सरल कार्यों के लिए विशाल, भारी वस्तुओं का उपयोग किया, जिससे मेमोरी बर्बाद हुई।
    • उपमा: एक एकल पत्र डिलीवर करने के लिए एक विशाल, औद्योगिक आकार के ट्रक का उपयोग करना।

3. "प्रॉम्प्टिंग" से केवल थोड़ा ही मदद मिलती है
शोधकर्ताओं ने AI को बेहतर निर्देश देकर (जैसे कि, "कृपया कुशल रहें!") इस समस्या को ठीक करने की कोशिश की।

  • उपमा: यह एक धावक को, "तेज़ दौड़ने की कोशिश करो!" कहने जैसा है। यह बहुत थोड़ी मदद करता है, लेकिन यह इस तथ्य को नहीं बदलता कि धावक ने भारी जूते पहने हुए हैं। AI स्वाभाविक रूप से दक्षता को नहीं समझता; यह केवल अनुमान लगाता है।

यह क्यों मायने रखता है

यह पेपर एक चेतावनी है। वर्षों से, हम AI कोड अनुवाद का जश्न सिर्फ इसलिए मना रहे हैं क्योंकि वह "काम करता है।" लेकिन वास्तविक दुनिया में, दक्षता ही सब कुछ है।

यदि आप AI-अनुवादित कोड का उपयोग करके एक वेबसाइट या ऐप बनाते हैं जो 500% धीमा है, तो आपके उपयोगकर्ता अनंत काल तक प्रतीक्षा करेंगे, आपके सर्वर क्रैश हो जाएंगे, और आपका बिजली का बिल आसमान छू जाएगा।

TRACE पहला ऐसा टूल है जो हमें यह पूछने के बजाय कि, "क्या यह काम करता है?" यह पूछने के लिए मजबूर करता है कि, "क्या यह अच्छी तरह से काम करता है?" यह सुनिश्चित करता है कि हमारे द्वारा जनरेट किया गया कोड केवल एक काम करने वाली रेसिपी नहीं है, बल्कि एक ऐसी रेसिपी है जो वास्तव में समय पर खाना मेज पर लाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →