← नवीनतम पेपर
🤖 machine learning

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

यह शोध पत्र भाषा मॉडलों में एक छिपे हुए "एलाइनमेंट ट्रांजिशन" (alignment transition) की पहचान करता है जहाँ तर्क और सत्यनिष्ठा एक महत्वपूर्ण पैमाने के आगे प्रति-सहसंबंधी (anticorrelated) से सहकारी (cooperative) होने की ओर स्थानांतरित हो जाते हैं, जो एक ऐसा चरण परिवर्तन (phase change) है जिसे मॉडल के आंतरिक विवरणों तक पहुँच प्राप्त किए बिना वास्तुशिल्प समायोजन, डेटा क्यूरेशन और प्रशिक्षण विधियों के माध्यम से पूर्वानुमानित और हेरफेर किया जा सकता है।

मूल लेखक: Adil Amin

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adil Amin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Lying Is Just a Phase" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

मुख्य विचार: AI के "बढ़ते समय की मुश्किलें" (Growing Pains)

कल्प_ना कीजिए कि आप एक बच्चे को एक ही समय में बुद्धिमान और ईमानदार बनना सिखा रहे हैं। लंबे समय तक वैज्ञानिकों का मानना था कि जैसे-जैसे आप बच्चे को अधिक शिक्षा (अधिक "स्केल") देते हैं, वे स्वाभाविक रूप से बुद्धिमान और ईमानदार दोनों होते जाते हैं।

यह पेपर तर्क देता है कि AI मॉडल के लिए, यह हमेशा सच नहीं होता है। वास्तव में, एक विशिष्ट "बढ़ते समय की मुश्किल" वाला चरण होता है जहाँ बौद्धिक रूप से अधिक स्मार्ट होने से AI सच बोलने में और भी खराब हो जाता है।

लेखक इसे "अलाइनमेंट टैक्स" (Alignment Tax) कहते हैं। यह एक अस्थायी दंड की तरह है जो आप AI के बड़े होने के दौरान चुकाते हैं। लेकिन अच्छी खबर? यह प्रकृति का कोई नियम नहीं है। यह एक डिज़ाइन दोष है जिसे इंजीनियर ठीक कर सकते हैं।


1. सड़क पर यू-टर्न (U-Turn)

शोधकर्ताओं ने 16 अलग-अलग परिवारों के 63 विभिन्न AI मॉडलों का अध्ययन किया। उन्होंने दो चीजें मापीं:

  1. तर्कशक्ति (Reasoning): AI पहेलियों (जैसे गणित की परीक्षा) को कितनी अच्छी तरह हल करता है।
  2. सत्यनिष्ठा (Truthfulness): AI कितनी अच्छी तरह मनगढ़ंत बातें बनाने से बचता है (जैसे झूठ पकड़ने वाला टेस्ट)।

उन्होंने क्या पाया:

  • छोटे मॉडल ("टैक्स" चरण): जब AI छोटा होता है, तो उसे स्मार्ट बनाने से अक्सर वह सच बोलने में और भी खराब हो जाता है। यह उस किशोर की तरह है जो अपने नए विचारों में इतना आत्मविश्वासी हो जाता है कि वह कूल दिखने के लिए कहानियाँ बनाना शुरू कर देता है। यहाँ दोनों कौशल आपस में लड़ते हैं।
  • क्रिटिकल स्विच (NcN_c): एक विशिष्ट आकार (कुछ मॉडलों के लिए लगभग 3.5 बिलियन पैरामीटर्स) है जहाँ यह बदल जाता है।
  • बड़े मॉडल ("बोनस" चरण): एक बार जब AI इस आकार की सीमा को पार कर लेता है, तो यह लड़ाई समाप्त हो जाती है। अब, इसे स्मार्ट बनाने से यह अधिक ईमानदार भी बनता है। दोनों कौशल एक सुव्यवस्थित मशीन की तरह मिलकर काम करने लगते हैं।

ध्यान देने वाली बात: लॉस कर्व (AI प्रगति को मापने का मानक तरीका) इसे नहीं दिखाता है। यह एक चिकनी, पूर्ण रेखा की तरह नीचे जाता हुआ दिखता है। कौशलों के बीच की यह "लड़ाई" मानक उपकरणों से अदृश्य रहती है, जो सतह के ठीक नीचे छिपी होती है।

2. यह आकार के बारे में नहीं है; यह रेसिपी के बारे में है

आप सोच सकते हैं, "ओह, तो हमें बस इसे ठीक करने के लिए बड़े मॉडल की ज़रूरत है।" पेपर कहता है: नहीं। आकार केवल एक सामग्री है।

"अलाइनमेंट टैक्स" वास्तव में एक डिज़ाइन विकल्प है। शोधकर्ताओं ने तीन "नॉब्स" (बटन/नियंत्रक) खोजे हैं जिन्हें इंजीनियर इस समस्या को ठीक करने के लिए घुमा सकते हैं, यहाँ तक कि बहुत छोटे मॉडलों में भी:

  • नॉब 1: बेहतर डेटा (एक "क्यूरेटेड डाइट"):

    • उपमा: कल्पना कीजिए कि आप एक बच्चे को इंटरनेट की अफवाहों के बजाय केवल उच्च गुणवत्ता वाले, सत्यापित तथ्यों के साथ खिला रहे हैं।
    • परिणाम: Phi मॉडल (1 बिलियन पैरामीटर वाला बहुत छोटा मॉडल), जो सुपर-क्लीन डेटा पर प्रशिक्षित है, एक 10-बिलियन पैरामीटर वाले मॉडल जितना ही ईमानदार और स्मार्ट है जो अव्यवस्थित वेब डेटा पर प्रशिक्षित है। "टैक्स" गायब हो जाता है क्योंकि डाइट बेहतर थी।
    • उदाहरण: Qwen3 मॉडल में कोई "टैक्स" नहीं है क्योंकि उनका प्रशिक्षण डेटा सावधानीपूर्वक क्यूरेट किया गया था।
  • नॉब 2: व्यापक आर्किटेक्चर (एक "चौड़ा गलियारा"):

    • उपमा: कल्पना कीजिए कि एक गलियारा है जहाँ दो लोग (तर्क और सत्य) एक ही समय में एक संकीर्ण दरवाजे से गुजरने की कोशिश कर रहे हैं। वे एक-दूसरे से टकराते हैं और लड़ते हैं। यदि आप दरवाजे को चौड़ा कर देते हैं, तो वे बिना टकराए अगल-बगल चल सकते हैं।
    • परिणाम: समस्या मस्तिष्क की नहीं है; यह आउटपुट प्रोजेक्शन (वह अंतिम दरवाजा जिससे जानकारी गुजरती है) की है। यदि आप उस दरवाजे को चौड़ा करते हैं, तो लड़ाई रुक जाती है, भले ही मॉडल का आकार वही रहे।
  • नॉब 3: आर्किटेक्चर में बदलाव:

    • उपमा: घर के ब्लूप्रिंट (नक्शे) को बदलना।
    • परिणाम: नए डिज़ाइन (जैसे Gemma-4) इस "बढ़ते समय की मुश्किल" वाले चरण को पूरी तरह से छोड़ सकते हैं। एक 4-बिलियन पैरामीटर वाला Gemma-4, पुरानी पीढ़ी के 13-बिलमीटर पैरामीटर वाले मॉडल की तरह व्यवहार करता है।

3. समस्या कहाँ छिपी है?

शोधकर्ताओं ने AI के "मस्तिष्क" (अटेंशन हेड्स) के अंदर देखा।

  • आश्चर्य: मस्तिष्क के अंदर, तर्क और सत्य के लिए जिम्मेदार हिस्से वास्तव में दोस्ताना हैं। वे 95% समय सहयोग कर रहे हैं।
  • असली बाधा (Bottleneck): समस्या बिल्कुल अंत में होती है, जब AI को उत्तर देना होता है। यह एक समूह के दोस्तों द्वारा योजना पर सहमत होने जैसा है, लेकिन जो व्यक्ति समूह की ओर से बोल रहा है, उसके पास एक ऐसा माइक्रोफ़ोन है जो एक साथ दोनों आवाजों को ले जाने के लिए बहुत छोटा है। सिग्नल दब जाता है, और ऐसा लगता है कि वे लड़ रहे हैं।
  • समाधान: यदि आप उस वक्ता को एक बड़ा माइक्रोफ़ोन (चौड़ा आउटपुट लेयर) देते हैं, तो सहयोग स्पष्ट रूप से दिखाई देता है।

4. यह आपके लिए क्यों महत्वपूर्ण है

  • यह न मानें कि "बड़ा ही बेहतर है": यदि आप एक छोटा AI मॉडल (जैसे आपके फोन पर) उपयोग कर रहे हैं, तो केवल उसे बड़ा करने से झूठ बोलने की उसकी प्रवृत्ति ठीक नहीं हो सकती। यह इसे केवल एक ज़्यादा स्मार्ट झूठा बना सकता है।
  • "कपलिंग" (जुड़ाव) की जाँच करें: मॉडल को स्केल करने से पहले, आपको यह देखना चाहिए कि क्या उसके कौशल आपस में लड़ रहे हैं या सहयोग कर रहे हैं।
    • यदि वे लड़ रहे हैं (नेगेटिव कपलिंग): तो केवल अधिक डेटा या आकार न जोड़ें। प्रशिक्षण की रेसिपी बदलें, मॉडल को चौड़ा करें, या डेटा को साफ करें।
    • यदि वे सहयोग कर रहे हैं (पॉजिटिव कपलिंग): तो हाँ, इसे बड़ा बनाने से दोनों कौशल बेहतर होंगे।
  • "टैक्स" वैकल्पिक है: यह पेपर साबित करता है कि "अलाइनमेंट टैक्स" ब्रह्मांड का कोई स्थायी नियम नहीं है। यह वर्तमान इंजीनियरिंग प्रक्रिया में एक बग है जिसे पैच किया जा सकता है।

सारांश उपमा

AI प्रशिक्षण को पुल बनाने की तरह समझें।

  • पुराना दृष्टिकोण: जैसे-जैसे आप अधिक स्टील (पैरामीटर्स) जोड़ते हैं, पुल अपने आप मजबूत और सुरक्षित हो जाता है।
  • नया दृष्टिकोण: निर्माण के बीच में, अधिक स्टील जोड़ने से वास्तव में पुल डगमगा सकता है क्योंकि पुल के दोनों हिस्से विपरीत दिशाओं में खींच रहे होते हैं।
  • समाधान: आपको केवल अधिक स्टील की आवश्यकता नहीं है; आपको ब्लूप्रिंट (आर्किटेक्चर) बदलने या बेहतर सामग्री (क्यूरेटेड डेटा) का उपयोग करने की आवश्यकता है ताकि यह सुनिश्चित हो सके कि दोनों पक्ष एक साथ चलें। एक बार जब आप निर्माण के इस चरण को पार कर लेते हैं, तो पुल अविश्वसनीय रूप से मजबूत और सुरक्षित हो जाता है।

यह पेपर इंजीनियरों को एक डैशबोर्ड और उपकरण प्रदान करता है जिससे वे ठीक से जान सकें कि उनका मॉडल किस चरण में है, ताकि वे केवल "स्केल अप" करने के बजाय "ब्लूप्रिंट को ठीक करने" में समय बर्बाद न करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →