← नवीनतम पेपर
💬 NLP

StyleBench: Evaluating thinking styles in Large Language Models

यह शोध पत्र स्टाइलबेंच (StyleBench) प्रस्तुत करता है, जो 15 ओपन-सोर्स एलएलएम (LLMs) में पांच रीजनिंग शैलियों का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो यह प्रदर्शित करता है कि संरचित तर्क (structured reasoning) के लाभ कार्य की मांगों और मॉडल की क्षमता द्वारा कड़ाई से सीमित हैं, और साथ ही यह भी दिखाता है कि सुदृढीकरण शिक्षण (reinforcement learning), अनुकूल रणनीति चयन को सक्षम करने में सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) से बेहतर प्रदर्शन करता है।

मूल लेखक: Junyu Guo, Shangding Gu, Ming Jin, Costas Spanos, Javad Lavaei

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junyu Guo, Shangding Gu, Ming Jin, Costas Spanos, Javad Lavaei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास पहेलियों की एक श्रृंखला को हल करने के लिए श्रमिकों (AI मॉडल) की एक टीम है। कुछ पहेलियाँ सरल हैं, जैसे "2+2 क्या है?" अन्य जटिल हैं, जैसे "मैं शहर के हर गड्ढे से बचते हुए बिंदु A से बिंदु B तक कैसे पहुँचूँ?"

लंबे समय तक, शोधकर्ताओं को लगा कि श्रमिकों की मदद करने का सबसे अच्छा तरीका उन्हें हर पहेली के लिए एक विशिष्ट, कठोर पद्धति का उपयोग करने के लिए मजबूर करना है। उन्होंने कहा, "चाहे समस्या कुछ भी हो, आपको उत्तर देने से पहले अपने विचारों की एक लंबी, चरण-दर-चरण डायरी लिखनी होगी।" यह एक शेफ को एक साधारण सैंडविच बनाने से पहले प्याज काटने के बारे में 10 प頁 का निबंध लिखने के लिए मजबूर करने जैसा है।

StyleBench एक नया अध्ययन है जो एक अलग सवाल पूछता है: "क्या होगा अगर हम श्रमिकों को काम के आधार पर अपनी सोचने की शैली चुनने दें?"

शोधकर्ताओं ने विभिन्न आकार के 15 AI मॉडलों (छोटे इंटर्न से लेकर विशाल सुपर-ब्रेन तक) पर पांच अलग-अलग "सोचने की शैलियों" का परीक्षण करने के लिए एक "जिम" (जिसे StyleBench कहा जाता है) बनाया।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. पाँच सोचने की शैलियाँ (टूलबॉक्स में उपकरण)

अध्ययन ने सोचने के पांच तरीकों का परीक्षण किया:

  • Chain-of-Thought (CoT): "चरण-दर-चरण" कार्यकर्ता। वे पूर्ण वाक्यों में अपना हर कदम विस्तार से लिखते हैं। अच्छा है: गणित की समस्याओं के लिए। बुरा है: सरल प्रश्नों के लिए (बहुत अधिक लेखन)।
  • Tree-of-Thought (ToT): "एक्सप्लोरर" (खोजकर्ता)। वे एक साथ कई रास्तों को आज़माते हैं, जैसे एक जासूस गिरफ्तारी करने से पहले तीन अलग-अलग संदिग्धों की जाँच करता है। अच्छा है: कठिन, खुले अंत वाली पहेलियों के लिए। बुरा है: छोटे मॉडल (वे भ्रमित हो जाते हैं और हार मान लेते हैं)।
  • Algorithm-of-Thought (AoT): "बैकट्रैकर" (पीछे मुड़ने वाला)। वे एक रास्ता आज़माते हैं, एक मृत अंत (dead end) पर पहुँचते हैं, पीछे हटते हैं, और एक नया रास्ता आज़माते हैं। अच्छा है: छिपे हुए समाधान खोजने के लिए।
  • Sketch-of-Thought (SoT): "स्केच आर्टिस्ट"। वे पूर्ण वाक्यों के बजाय प्रतीकों और छोटे नोट्स का उपयोग करते हैं। अच्छा है: तर्क (logic) वाली पहेलियों के लिए जहाँ गति महत्वपूर्ण है।
  • Chain-of-Draft (CoD): "रफ ड्राफ्ट" लेखक। वे पहले एक त्वरित, कच्चा मसौदा लिखते हैं, फिर उसे साफ करते हैं। अच्छा है: सटीकता खोए बिना कुशल होने के लिए।

2. बड़ी खोज: आकार मायने रखता है (The "Brain Capacity" Rule)

सबसे महत्वपूर्ण निष्कर्ष यह है कि बड़ा होना हमेशा बेहतर नहीं होता, और "अधिक सोचना" हमेशा स्मार्ट नहीं होता।

  • "नन्हे इंटर्न" की समस्या: जब उन्होंने छोटे AI मॉडल को जटिल "एक्सप्लोरर" (Tree-of-Thought) या "बैकट्रैकर" (Algorithm-of-Thought) शैलियाँ दीं, तो मॉडल क्रैश हो गए। यह एक बच्चे को 50 अलग-अलग रूट विकल्पों वाले GPS देने जैसा था; वे बस खो गए। छोटे मॉडलों को सरल, सीधे निर्देशों की आवश्यकता होती है। यदि आप उन्हें "गहराई से सोचने" के लिए मजबूर करते हैं, तो वे अक्सर गलत अनुमान लगाते हैं या भ्रमित हो जाते हैं।
  • "सुपर-ब्रेन" का लाभ: विशाल AI मॉडल (120B पैरामीटर वाले) जटिल शैलियों को संभाल सकते थे। उनके लिए, कई रास्तों को खोजना वास्तव में सबसे कठिन पहेलियों को हल करने में मदद करता था।
  • "ज्ञान बनाम तर्क" का जाल: उन प्रश्नों के लिए जिनमें केवल तथ्यों को जानने की आवश्यकता होती है (जैसे "फ्रांस की राजधानी क्या है?"), जटिल सोचने की शैली का उपयोग करने से किसी को मदद नहीं मिली। यह एक अखरोट तोड़ने के लिए हथौड़े का उपयोग करने जैसा था। AI को बस तथ्य याद करने की आवश्यकता थी।

3. दक्षता का जाल: बहुत अधिक न सोचें!

अध्ययन ने पाया कि सरल कार्यों के लिए, AI को लंबे, संरचित तरीके से "सोचने" के लिए मजबूर करना वास्तव में प्रदर्शन को नुकसान पहुँचाता है।

  • उपमा: कल्पना कीजिए कि आप एक दोस्त से पूछते हैं, "समय क्या हुआ है?" यदि वे कहना शुरू करते हैं, "खैर, पहले मुझे सूरज को देखना होगा, फिर छाया की जाँच करनी होगी, फिर पृथ्वी के घूर्णन की गणना करनी होगी..." तो वे ओवरथिंकिंग (ज़रूरत से ज़्यादा सोच) कर रहे हैं। वे प्रक्रिया में बहुत अधिक समय बिताने के कारण गलत समय बता सकते हैं।
  • परिणाम: संरचित कार्यों (जैसे बुनियादी गणित) के लिए, संक्षिप्त सोचने की शैलियाँ (जैसे Chain-of-Draft) लंबी शैलियों जितनी ही सटीक थीं, लेकिन उन्होंने बहुत कम ऊर्जा और समय का उपयोग किया।

4. क्या हम AI को चुनना सिखा सकते हैं? (The "Manager" Experiment)

शोधकर्ताओं ने एक AI को "मैनेजर" बनने के लिए प्रशिक्षित करने का प्रयास किया जो प्रत्येक समस्या के लिए सही सोचने की शैली चुन सके।

  • "नकल करने वाला" मैनेजर (Supervised Learning): उन्होंने AI को उदाहरण दिखाकर सिखाया कि कौन सी शैली सबसे अच्छा काम करती है। AI ने उदाहरणों की नकल करना सीखा लेकिन एक ही ढर्रे में फंस गया। वह एक "स्टाइल स्नब" (शैली का घमंडी) बन गया, जो गलत होने पर भी हमेशा एक ही शैली चुनता था।
  • "गलती-सुधार" मैनेजर (Reinforcement Learning): उन्होंने GRPO नामक एक विधि का उपयोग किया, जहाँ AI को समस्या को सही ढंग से हल करने के लिए एक "इनाम" मिलता है और समय बर्बाद करने के लिए एक "दंड" मिलता है। यह AI लचीला बनना सीख गया। उसने महसूस किया, "हे, इस गणित की समस्या के लिए, मुझे 'स्टेप-बाय-स्टेप' कार्यकर्ता बनना चाहिए, लेकिन इस तर्क पहेली के लिए, मुझे 'स्केच आर्टिस्ट' बनना चाहिए।" उसने अपने स्वयं के नए हाइब्रिड स्टाइल भी बनाए जब मानक शैलियाँ काम नहीं आईं!

मुख्य निष्कर्ष (The Takeaway)

StyleBench हमें बताता है कि AI की सोच के लिए कोई "एक ही आकार सबके लिए उपयुक्त" (one size fits all) नहीं है।

  • छोटे मॉडल सरल, सीधे सोचने की आवश्यकता रखते हैं।
  • बड़े मॉडल कठिन समस्याओं के लिए जटिल, खोजपूर्ण सोच को संभाल सकते हैं।
  • सरल कार्यों के लिए लंबे स्पष्टीकरण की आवश्यकता नहीं होती; उन्हें गति की आवश्यकता होती है।
  • भवि// भविष्य AI को अधिक गहराई से सोचने के लिए मजबूर करने के बारे में नहीं है; बल्कि AI को यह सिखाने के बारे में है कि कब गहराई से सोचना है और कब बस एक त्वरित उत्तर देना है।

संक्षेप में: अखरोट तोड़ने के लिए हथौड़े का उपयोग न करें, और ईंट तोड़ने के लिए पंख का उपयोग न करें। सबसे अच्छा AI वही है जो जानता है कि कौन सा उपकरण उठाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →