← नवीनतम पेपर
💻 computer science

ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation

ClawTrace एक लागत-जागरूक (cost-aware) ट्रेसिंग प्लेटफॉर्म पेश करता है जो विस्तृत TraceCards उत्पन्न करता है ताकि CostCraft डिस्टिलेशन पाइपलाइन को सक्षम बनाया जा सके, जो सफल व्यवहारों को संरक्षित करते हुए महंगे और अनावश्यक चरणों की लक्षित छंटनी के माध्यम से LLM एजेंट लागतों को प्रभावी ढंग से 32% तक कम करता है।

मूल लेखक: Boqin Yuan, Renchu Song, Yue Su, Sen Yang, Jing Qin

प्रकाशित 2026-04-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Boqin Yuan, Renchu Song, Yue Su, Sen Yang, Jing Qin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन महंगा रोबोट सहायक (एक LLM एजेंट) है जो जटिल समस्याओं को हल करने की कोशिश करता है, जैसे कि स्प्रेडशीट व्यवस्थित करना या कोड लिखना। कभी-कभी, यह रोबोट काम को पूरी तरह से सफलतापूर्वक पूरा कर देता है। अन्य समय में, यह विफल हो जाता है या एक बेहद अक्षम रास्ता अपना लेता है, जिससे हर कदम पर बहुत अधिक पैसा खर्च होता है।

यह शोध पत्र एक नया सिस्टम पेश करता है जिसे ClawTrace कहा जाता है और एक विधि जिसे CostCraft कहा जाता है, ताकि इस रोबोट को उसके 'दिमाग' को फिर से प्रशिक्षित किए बिना, अधिक स्मार्ट और सस्ता बनने के लिए सिखाया जा सके।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "अंधा" शिक्षक

कल्पना कीजिए कि एक शिक्षक छात्र की अध्ययन आदतों को सुधारने की कोशिश कर रहा है, लेकिन वह केवल उनके टेस्ट पेपर देखकर ऐसा करता है।

  • पुराना तरीका: शिक्षक केवल इस बात को देखता है कि छात्र को "A" मिला या "F"।
    • यदि छात्र को "A" मिला, तो शिक्षक कहता है, "बहुत अच्छा, जो कर रहे हो वही करते रहो!"
    • यदि छात्र को "F" मिला, तो शिक्षक कहता है, "इस गलती को सुधारें।"
  • दोष: यह खतरनाक है।
    • परिदृश्य A: छात्र को "A" मिला लेकिन उसने उस टेस्ट के लिए 1 घंटे के बजाय 10 घंटे पढ़ाई की। पुराना शिक्षक कहता है, "यही करते रहो!" क्योंकि परिणाम अच्छा था। छात्र समय बर्बाद करना जारी रखता है।
    • परिदृश्य B: छात्र को "F" मिला क्योंकि वह अपना नाम लिखना भूल गया था। शिक्षक कहता है, "नाम ठीक करें।" लेकिन शायद छात्र ने एक गलत गणित के सवाल पर 5 घंटे बर्बाद कर दिए। शिक्षक इस बर्बादी को नहीं देख पाता क्योंकि वह केवल अंतिम ग्रेड को देखता है।

शोध पत्र का तर्क है कि मौजूदा AI प्रशिक्षण उपकरण इसी तरह के "अंधे" शिक्षक की तरह हैं। वे जानते हैं कि AI सफल हुआ या विफल, लेकिन वे यह नहीं जानते कि प्रत्येक कदम की लागत कितनी थी (पैसे और समय में)। इस 'लागत संकेत' (cost signal) के बिना, AI बेकार के महंगे कदमों को हटाना नहीं सीख सकता।

2. समाधान: "रसीद" (ClawTrace)

लेखकों ने ClawTrace नामक एक टूल बनाया है। इसे रोबोट के दिमाग के लिए एक अत्यंत विस्तृत रसीद प्रिंटर समझें।

  • हर बार जब रोबोट अपने दिमाग से बात करता है (LLM कॉल), किसी टूल का उपयोग करता है (जैसे फ़ाइल खोलना), या किसी सहायक रोब-हेल्पर को जन्म देता है, तो ClawTrace उसे रिकॉर्ड करता है।
  • यह केवल "कार्य संपन्न" नहीं कहता। यह एक TraceCard (एक छोटा सारांश) प्रिंट करता है जो कहता है:
    • "चरण 1: फ़ाइल पढ़ी। लागत: $0.02।"
    • "चरण 2: उसी फ़ाइल को दोबारा पढ़ा। लागत: $0.02। अनावश्यक (Redundant)!"
    • "चरण 3: उत्तर लिखा। लागत: $0.01।"
  • यह रसीद संक्षिप्त और पढ़ने में आसान है, जिससे अन्य सिस्टम पूरी बातचीत के इतिहास की आवश्यकता के बिना इस "रसीद" का विश्लेषण कर सकते हैं।

3. शिक्षक: CostCraft (तीन-कार्रवाई प्रणाली)

इन "रसीदों" का उपयोग करके, एक नया डिस्टिलेशन पाइपलाइन जिसे CostCraft कहा जाता है, रोबोट के लिए नियमों का एक सेट (एक "कौशल") बनाता है। यह एक कोच की तरह कार्य करता है जो तीन विशिष्ट प्रकार की सलाह देता है:

  1. Preserve (बनाए रखें - "जारी रखने वाला नियम"):
    • उपमा: "आपको 'A' मिला, और आपने यह विशिष्ट कार्य सही ढंग से किया। इसे करते रहें।"
    • स्रोत: सफल रन (successful runs) से लिया गया।
  2. Prune (छाँटें - "फालतू चीज़ों को काटने वाला नियम"):
    • उपमा: "आपको 'A' मिला, लेकिन आपने एक ही फ़ाइल को दो बार पढ़ने में $5 बर्बाद किए। अगली बार, इसे एक बार पढ़ें और बाकी बचा लें। आप ग्रेड नहीं खोएंगे, लेकिन पैसे बचा लेंगे।"
    • स्रोत: उन सफल रन से लिया गया जिनमें महंगे, अनावश्यक चरण शामिल थे। यही इस शोध पत्र का मुख्य नवाचार है।
  3. Repair (सुधारें - "गलती को ठीक करने वाला नियम"):
    • उपमा: "आप इसलिए विफल हुए क्योंकि आप गणित की जाँच करना भूल गए। अगली बार, सबमिट करने से पहले गणित की दोबारा जाँच करें।"
    • स्रोत: विफल रन से लिया गया, जिसमें यह देखने के लिए एक "चीट शीट" (oracle) का उपयोग किया गया कि सही उत्तर क्या था।

4. परिणाम: क्या हुआ?

शोधकर्ताओं ने इसका परीक्षण 30 स्प्रेडशीट कार्यों (जैसे रोबोट के लिए गणित की परीक्षा) पर किया।

  • लागत मायने रखती है: जब उन्होंने रसीदों से "लागत" की जानकारी हटा दी, तो रोबोट महंगी गलतियाँ करने लगा। वह या तो काम करना बंद कर देता या गलत परिणाम देता क्योंकि उसे नहीं पता था कि कौन से चरण बेकार थे।
  • "Prune" का आश्चर्य: सबसे दिलचस्प खोज Prune नियमों के बारे में थी।
    • शोधकर्ताओं को लगा कि ये नियम केवल पैसा बचाएंगे।
    • वास्तविकता: वास्तव में, इन नियमों ने रोबोट के प्रदर्शन को भी बचाया। जब उन्होंने "Prune" नियमों को हटाया, तो रोबोट बहुत अधिक बार विफल हुआ।
    • क्यों? यह पता चला कि जब रोबोट को फिजूलखर्ची करने की अनुमति दी जाती है (फ़ाइलों को दो बार पढ़ना, उन चीजों की जाँच करना जिनकी उसे ज़रूरत नहीं है), तो वह अक्सर भ्रमित हो जाता है और अंतिम उत्तर लिखना भूल जाता है। "Prune" नियम एक सुरक्षा कवच (guardrail) के रूप में कार्य करते हैं, जिससे रोबोट केंद्रित रहता है ताकि वह भटक न जाए।
  • क्रॉस-बेंचमार्क टेस्ट: उन्होंने स्प्रेडशीट से सीखे गए नियमों को पूरी तरह से अलग कार्यों (जैसे कोड लिखना या दस्तावेज़ों का विश्लेषण करना) पर आज़माया।
    • "Prune" नियम (बर्बादी को काटना) हर जगह बहुत अच्छे रहे। उन्होंने असंबंधित कार्यों पर भी पैसे बचाए।
    • "Preserve" नियम (विशिष्ट आदतों को बनाए रखना) नए कार्यों पर चीज़ों को बिगाड़ दिया। क्यों? क्योंकि रोबोट ने स्प्रेडशीट के लिए विशिष्ट आदतें (जैसे एक निश्चित फॉर्मेटिंग शैली) सीख ली थीं जो कोडिंग के लिए तर्कसंगत नहीं थीं।

सारांश

शोध पत्र का दावा है कि AI एजेंट को कुशल बनाने के लिए, आप केवल अंतिम ग्रेड (सफलता/विफलता) को देखकर नहीं सीख सकते। आपको एक रसीद (ClawTrace) की आवश्यकता है जो यह दिखाए कि प्रत्येक चरण की लागत कितनी थी।

इस रसीद का उपयोग करके, आप AI को तीन चीजें सिखा सकते हैं:

  1. जो काम करता है उसे बनाए रखें
  2. जो महंगा लेकिन बेकार है उसे काटें (जो आश्चर्यजनक रूप से AI को ट्रैक पर रहने में मदद करता है)।
  3. जो टूट गया उसे सुधारें

लागत को जाने बिना, AI "महंगा" और "भुलक्कड़" बनना सीख जाता है, और अक्सर उन कार्यों में विफल हो जाता है जिन्हें वह आसानी से हल कर सकता था यदि वह बस समय बर्बाद करना बंद कर देता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →