← नवीनतम पेपर
🤖 machine learning

Learning the Error Patterns of Language Models

यह शोध पत्र "प्रिफिक्स फिल्टर्स" (prefix filters) और "पल्ला" (Palla) एल्गोरिदम को पेश करता है जो डोमेन-विशिष्ट बाधाओं को कुशलतापूर्वक सीखने और लागू करने के लिए है जो सामान्य LLM त्रुटि पैटर्न को पकड़ते हैं और उन्हें सुधारते हैं, जिससे आउटपुट वैधता जैसे कि टाइपस्क्रिप्ट (TypeScript) कंपाइलेशन दरों में महत्वपूर्ण सुधार होता है।

मूल लेखक: Jinwoo Kim, Taylor Berg-KirkPatrick, Loris D'Antoni

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinwoo Kim, Taylor Berg-KirkPatrick, Loris D'Antoni

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली लेकिन थोड़ी अनाड़ी रोबोटिक असिस्टेंट है। यह कोड लिखने, कहानियों का सारांश बनाने या रासायनिक अणुओं को डिजाइन करने में बेहतरीन है, लेकिन इसकी कुछ विशिष्ट, दोहराव वाली बुरी आदतें हैं। कभी-कभी यह उस भाषा में एक ऐसा शब्द इस्तेमाल करता है जो अस्तित्व में ही नहीं है जिसे इसे बोलना चाहिए। अन्य समय में, यह अनजाने में किसी व्यक्ति का नाम लीक कर देता है जब इसे उसे गुप्त रखना चाहिए।

"लर्निंग द एरर पैटर्न्स ऑफ लैंग्वेज मॉडल्स" (Learning the Error Patterns of Language Models) नामक शोध पत्र इन रोबोटों को ठीक करने का एक नया तरीका पेश करता है, बिना उन्हें फिर से प्रशिक्षित किए या उन्हें लगातार निगरानी के लिए किसी इंसान को नियुक्त किए।

यहाँ उनके समाधान का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: रोबोट की "बुरी आदतें"

जब ये AI मॉडल विशिष्ट कार्य करने की कोशिश करते हैं (जैसे कि ऐसा प्रोग्राम लिखना जो कंपाइल हो सके), तो वे यादृच्छिक (randomly) रूप से विफल नहीं होते। वे गुच्छों (clusters) में विफल होते हैं।

  • उपमा: कल्पना कीजिए कि एक शेफ केक बनाने की कोशिश कर रहा है। वे हर बार अलग तरीके से विफल नहीं होते। इसके बजाय, वे हमेशा चीनी डालना भूल जाते हैं, या वे हमेशा नीचे से केक जला देते हैं क्योंकि उन्होंने ओवन को बहुत गर्म सेट कर दिया है। उनके पास विशिष्ट "त्रुटि मोड" (error modes) होते हैं।
  • वास्तविकता: शोधकर्ताओं ने पाया कि यदि आप एक AI को टाइपस्क्रिप्ट (TypeScript) कोड लिखने के लिए कहते हैं, तो यह 50% बार विफल हो सकता है, लेकिन उन विफलताओं में से 80% केवल तीन या चार विशिष्ट गलतियों के कारण होती हैं (जैसे कि एक स्थिर वेरिएबल को फिर से असाइन करने की कोशिश करना या इम्पोर्ट स्टेटमेंट को गलत जगह रखना)।

2. समाधान: "प्रिफिक्स फिल्टर्स" (द बाउंसर)

लेखक "प्रिफिक्स फिल्टर्स" (Prefix Filters) बनाने का प्रस्ताव देते हैं। इसे एक क्लब के बाउंसर के रूप में सोचें, लेकिन आईडी चेक करने के बजाय, वे देखते हैं कि रोबोट क्या लिखना शुरू कर रहा है।

  • यह कैसे काम करता है: जैसे ही रोबोट वाक्य या कोड की एक पंक्ति टाइप करना शुरू करता है, बाउंसर (फ़िल्टर) पहले कुछ शब्दों को देखता है।
  • निर्णय: यदि बाउंसर एक ऐसा पैटर्न देखता है जो किसी ज्ञात "बुरी आदत" से मेल खाता है (जैसे, "ओह, आप फंक्शन बॉडी के अंदर import से शुरू कर रहे हैं? यह एक गलती है जिसे हमने हज़ार बार देखा है। रुक जाओ।"), तो वे तुरंत रोबोट को रोक देते हैं।
  • परिणाम: रोबोट को फिर से प्रयास करने के लिए मजबूर किया जाता है, लेकिन इस बार उसे अलग तरह से शुरुआत करनी होगी। यह एक शिक्षक की तरह है जो कहता है, "नहीं, यह वाक्य गलत शुरू हुआ है। फिर से कोशिश करो," इससे पहले कि छात्र पैराग्राफ पूरा भी कर ले।

3. एल्गोरिदम: PALLA (द डिटेक्टिव)

आपको कैसे पता चलेगा कि रोबोट की बुरी आदतें क्या हैं? आपको अनुमान लगाने की आवश्यकता नहीं है। यह पेपर PALLA (Prefix-filters for Learning and Adapting to LLMs) नामक एक एल्गोरिदम पेश करता है।

  • प्रक्रिया:
    1. रोबोट को बेधड़क चलने दें: PALLA AI को बिना किसी नियम के सैकड़ों नमूने उत्पन्न करने देता है।
    2. विफलताओं को पकड़ें: यह एक "जज" (जैसे कोड के लिए कंपाइलर या सारांश के लिए सुरक्षा जांचकर्ता) का उपयोग करके खराब आउटपुट को ढूंढता है।
    3. गलतियों को समूह में बांटें: यह देखता है कि विफलताएं रैंडम नहीं हैं; वे एक साथ क्लस्टर बनाती हैं।
    4. एक स्मार्ट रोबोट से पूछें: PALLA एक बड़े, अधिक स्मार्ट AI से इन गलतियों के क्लस्टर्स को देखने और एक सरल "नियम" (एक पायथन फ़ंक्शन) लिखने के लिए कहता है जो उन्हें पकड़ सके।
    5. नियम का परीक्षण करें: यह जांचता है कि क्या नियम निष्पक्ष है। क्या यह खराब चीजों को पकड़ता है? क्या यह गलती से रोबोट को अच्छी चीजें लिखने से रोकता है? यदि यह बहुत सख्त है, तो यह नियम को ट्यून करता है।

4. परिणाम: एक बड़ी बढ़त

शोधकर्ताओं ने पांच अलग-अलग AI मॉडलों पर चार कार्यों (MLIR कोड लिखना, अणु डिजाइन करना, HR संवादों का सारांश देना, और टाइपस्क्रिप्ट लिखना) पर इसका परीक्षण किया।

  • "जादुई" संख्या: उन्होंने पाया कि कई मॉडलों के लिए, केवल 132 सरल नियम (फिल्टर्स) लगभग सभी खराब आउटपुट को रोकने के लिए पर्याप्त थे।
  • उपमा: यह एक छात्र को गणित की शीर्ष 5 सबसे सामान्य गलतियों से बचने के लिए सिखाने जैसा है। अचानक, उनके टेस्ट स्कोर D से A तक बढ़ जाते हैं, इसलिए नहीं कि उन्होंने नई गणित सीखी है, बल्कि इसलिए क्योंकि उन्होंने उन मूर्खतापूर्ण गलतियों को करना बंद कर दिया जो वे हमेशा करते थे।
  • परिणाम:
    • कोड: एक छोटा AI मॉडल (Qwen-1.5B) जो आमतौर पर 84% बार कोड कंपाइल करने में विफल रहता था, अचानक 70% बार कंपाइल होने लगा। इन फिल्टर्स के साथ, इसने एक बहुत बड़े, अधिक महंगे AI मॉडल (Llama-8B) के बराबर प्रदर्शन किया जिसके पास कोई फिल्टर नहीं था।
    • सुरक्षा: HR बातचीत का सारांश देते समय, फिल्टर्स ने महत्वपूर्ण विवरणों को छोड़े बिना या सारांश को रोबोटिक बनाए बिना, AI को नाम और फोन नंबर लीक करने से सफलतापूर्वक रोका।

5. कमी (सीमाएं)

पेपर ईमानदार है कि यह कहाँ पूरी तरह से काम नहीं करता है:

  • "पहले से ही अच्छा" वाली समस्या: यदि कोई AI किसी कार्य में पहले से ही बहुत अच्छा है (जैसे टाइपस्क्रिप्ट के लिए Gemma-12B), तो सीखने के लिए पर्याप्त गलतियाँ नहीं होती हैं, इसलिए फिल्टर्स ज्यादा मदद नहीं करते हैं।
  • "टेल" (Tail) की समस्या: कभी-कभी रोबोट एक लंबे वाक्य के बिल्कुल अंत में गलती करता है। फ़िल्टर केवल शुरुआत को पकड़ता है। यदि गलती बाद में होती है, तो फ़िल्टर इसे मिस कर सकता है, या रोबोट इसे ठीक करने में बहुत समय बर्बाद कर सकता है।
  • ट्रांसफेरेबिलिटी (Transferability): एक AI मॉडल (जैसे Qwen) पर प्रशिक्षित किया गया फ़िल्टर दूसरे (जैसे Llama) पर हमेशा पूरी तरह से काम नहीं करता है। हर रोबोट की अपनी अनूठी बुरी आदतें होती हैं।

सारांश

यह पेपर तर्क देता है कि AI मॉडलों को पूर्ण बनाने की कोशिश करने के बजाय (जो कठिन है), हमें बस उनकी विशिष्ट, दोहराव वाली बुरी आदतों को सीखना चाहिए और सरल "बाउंसर" बनाने चाहिए जो उन्हें एक बुरा वाक्य पूरा करने से पहले ही रोक सकें। यह AI को विशिष्ट कार्यों के लिए बहुत अधिक विश्वसनीय बनाने का एक सस्ता, तेज़ और प्रभावी तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →