← नवीनतम पेपर
🤖 AI

HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness

यह शोध पत्र HeavySkill प्रस्तुत करता है, जो एक ऐसा दृष्टिकोण है जो गहन सोच (heavy thinking) को LLM मापदंडों के भीतर एक आंतरिक रूप से आत्मसात होने योग्य दो-चरणीय तर्क कौशल (समानांतर तर्क के बाद सारांश) के रूप में मानता है, और यह अनुभवजन्य अध्ययन के माध्यम से प्रदर्शित करता है कि यह दृष्टिकोण पारंपरिक ऑर्केस्ट्रेशन रणनीतियों से बेहतर प्रदर्शन करता है और स्व-विकसित एजेंटों को सक्षम करने के लिए सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से स्केल किया जा सकता है।

मूल लेखक: Jianing Wang, Linsen Guo, Zhengyu Chen, Qi Guo, Hongyu Zang, Wenjie Shi, Haoxiang Ma, Xiangyu Xi, Xiaoyu Li, Wei Wang, Xunliang Cai

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianing Wang, Linsen Guo, Zhengyu Chen, Qi Guo, Hongyu Zang, Wenjie Shi, Haoxiang Ma, Xiangyu Xi, Xiaoyu Li, Wei Wang, Xunliang Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके शोध पत्र "HEAVYSKILL: Heavy Thinking as the Inner Skill in Agentic Harness" की व्याख्या दी गई है।

मुख्य विचार: "एक मस्तिष्क" से "निदेशकों के बोर्ड" तक

कल्पना कीजिए कि आप गणित की एक बहुत कठिन समस्या हल करने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप एक डेस्क पर अकेले बैठते हैं, कड़ी मेहनत से सोचते हैं, और अपना सबसे अच्छा उत्तर लिखते हैं। यदि आपसे कोई गलती हो जाती है, तो शायद आप उसे पकड़ न पाएं।
  • "एजेंटिक हार्नेस" (वर्तमान तकनीक) का तरीका: आप सहायकों की एक टीम को काम पर रखते हैं। एक गणित करता है, दूसरा काम की जाँच करता है, और तीसरा परिणाम का सारांश लिखता है। यह अच्छा काम करता है, लेकिन इसके लिए एक जटिल प्रबंधक (एक "ऑर्केस्ट्रेटर") की आवश्यकता होती है जो सबको बताए कि क्या करना है।
  • HEAVYSKILL का तरीका (यह शोध पत्र): यह शोध पत्र तर्क देता है कि आपको एक जटिल प्रबंधक या अलग-अलग लोगों की टीम की आवश्यकता नहीं है। इसके बजाय, AI मॉडल के पास स्वयं एक आंतरिक "भारी सोच" (heavy thinking) का कौशल होना चाहिए। इसे समस्या पर बहस करने के लिए अपने ही मन को एक "निदेशकों के बोर्ड" (Board of Directors) में विभाजित करने में सक्षम होना चाहिए, और फिर अंतिम निर्णय लेने के लिए एक "CEO" में बदलना चाहिए।

लेखक इसे HEAVYSKILL कहते हैं। उनका दावा है कि यह "भारी सोच" केवल सॉफ़्टवेयर की एक चाल नहीं है; यह एक कौशल है जिसे सीधे AI के मस्तिष्क में समाहित किया जा सकता है।


यह कैसे काम करता है: दो-चरणीय पाइपलाइन

शोध पत्र AI के भीतर होने वाली एक सरल, दो-चरणीय प्रक्रिया का वर्णन करता है:

चरण 1: "ब्रेनस्टॉर्मिंग पार्टी" (समानांतर तर्क - Parallel Reasoning)

कल्पना कीजिए कि आप एक पहेली में फंस गए हैं। केवल सोचने के बजाय, आप अपने 8 अलग-अलग दोस्तों से स्वतंत्र रूप से इसे हल करने के लिए कहते हैं।

  • दोस्त A एक ज्यामितीय (geometric) दृष्टिकोण अपनाता है।
  • दोस्त B एक बीजगणितीय (algebraic) दृष्टिकोण अपनाता है।
  • दोस्त C एक ब्रूट-फोर्स अनुमान (brute-force guess) लगाता है।
  • महत्वपूर्ण नियम: वे इसे हल करते समय एक-दूसरे से बात नहीं कर सकते। उन्हें अलगाव में काम करना चाहिए ताकि वे एक-दूसरे की नकल न करें।

शोध पत्र में, AI एक साथ कई स्वतंत्र तर्क पथ (trajectories) उत्पन्न करता है। कुछ सही हो सकते हैं, कुछ गलत, और कुछ आधे रास्ते तक पहुँचे हुए।

चरण 2: "CEO की बैठक" (क्रमिक विचार-विमर्श - Sequential Deliberation)

अब, कल्पना कीजिए कि एक स्मार्ट CEO (AI का दूसरा हिस्सा) कमरे में प्रवेश करता है। CEO केवल वोटों की गिनती नहीं करता है (जैसे, "3 लोगों ने X कहा, 5 लोगों ने Y कहा, इसलिए X जीत गया")।

  • CEO प्रत्येक मित्र के नोट्स पढ़ता है।
  • CEO तार्किक त्रुटियों (logical errors) की तलाश करता है।
  • CEO पूछता है: "भले ही 7 लोगों ने 'नीला' कहा, लेकिन उनका तर्क त्रुटिपूर्ण है। जिस एक व्यक्ति ने 'लाल' कहा था, वास्तव में उसके पास सही प्रमाण है।"
  • जादू: कभी-कभी, CEO को एहसास होता है कि किसी भी मित्र ने इसे सही ढंग से हल नहीं किया है। उस स्थिति में, CEO गलतियों का उपयोग सुराग के रूप में करता है ताकि समस्या को शुरू से हल किया जा सके, और सभी की सोच के सबसे अच्छे हिस्सों को मिलाकर एक नया, सही उत्तर खोजा जा सके।

शोध पत्र इसे Sequential Deliberation कहता है। यह AI का अपने ही "सोचने के बारे में सोचना" है ताकि सबसे अच्छे संभव उत्तर का संश्लेषण (synthesize) किया जा सके।


"स्किल फ़ाइल" (Skill File) की अवधारणा

लेखकों ने देखा कि वर्तमान AI सिस्टम इन एजेंटों की टीमों को प्रबंधित करने के लिए जटिल कोड का उपयोग करते हैं। वे इसे सरल बनाना चाहते थे।

उन्होंने एक पठनीय "स्किल फ़ाइल" (जैसे कि रेसिपी कार्ड या यूजर मैनुअल) बनाई।

  • उपमा: इसे एक छात्र को दी जाने वाली "चीट शीट" (Cheat Sheet) के रूप में सोचें। हर परीक्षा के लिए एक नया क्लासरूम बनाने के बजाय, आप बस उन्हें एक कार्ड देते हैं जिस पर लिखा होता है: "जब आप गणित की कठिन समस्या देखें, तो रुकें। इसे हल करने के 8 अलग-अलग तरीके लिखें। फिर, उन सभी को ध्यान से पढ़ें और सबसे अच्छा उत्तर लिखें।"
  • शोध पत्र दिखाता है कि यदि आप इस "स्किल फ़ाइल" को एक AI को देते हैं, तो वह बिना किसी जटिल बाहरी प्रबंधक के अपने आप इन निर्देशों का पालन कर सकता है। यह "भारी सोच" को मॉडल की एक मूल क्षमता में बदल देता है।

प्रयोगों ने क्या दिखाया

शोधकर्ताओं ने कठिन गणित प्रतियोगिताओं (जैसे AIME और HMMT) और कोडिंग चुनौतियों पर इसका परीक्षण किया।

  1. "वोटिंग" से बेहतर: आमतौर पर, जब AI कई बार प्रयास करता है, तो हम बस उस उत्तर को चुनते हैं जो सबसे अधिक बार आता है (Majority Voting)। HEAVYSKILL ने इस पद्धति को पीछे छोड़ दिया। "CEO" चरण सही तर्क को पहचानने में बेहतर था, भले ही वह एक अल्पसंख्यक राय (minority opinion) क्यों न हो।
  2. "एक प्रयास" से बेहतर: इसने AI द्वारा समस्या को केवल एक बार हल करने की तुलना में काफी बेहतर प्रदर्शन किया।
  3. "Pass@K" की सीमा: कुछ मामलों में, AI का अंतिम उत्तर इतना अच्छा था कि वह उस सैद्धांतिक सीमा के करीब पहुँच गया जहाँ तक वह मॉडल वास्तव में हो सकता है यदि उसे अपने 8 प्रयासों में से किसी एक में भाग्य मिल जाए।
  4. बेहतर होने के लिए सीखना: उन्होंने दिखाया कि Reinforcement Learning (जहाँ AI को सही होने के लिए "पुरस्कार" मिलता है) नामक तकनीक का उपयोग करके, वे AI को इस "भारी सोच" कौशल में और भी बेहतर होने के लिए सिखा सकते हैं, जिससे प्रभावी रूप से इसे बिना पुन: प्रोग्राम किए गहराई से और व्यापक रूप से सोचना सिखाया जा सके।

शोध पत्र के दावों का सारांश

  • भारी सोच एक कौशल है: यह केवल एक सॉफ़्टवेयर ट्रिक नहीं है; यह एक ऐसी क्षमता है जिसे मॉडल के भीतर समाहित किया जा सकता है।
  • दो चरण महत्वपूर्ण हैं: आपको समानांतर तर्क (कई विचार उत्पन्न करना) के बाद क्रमिक विचार-विमर्श (उन विचारों का आलोचनात्मक विश्लेषण और संश्लेषण) की आवश्यकता है।
  • यह हर जगह काम करता है: यह तरीका गणित, कोडिंग और सामान्य तर्क कार्यों पर काम करता है।
  • यह पोर्टेबल है: आप इस जटिल प्रक्रिया को एक सरल टेक्स्ट फ़ाइल ("स्किल") में बदल सकते हैं जिसे कोई भी आधुनिक AI पढ़ और पालन कर सकता है, जिससे इसे बिना कस्टम कोड के विभिन्न AI सिस्टमों पर काम करने के योग्य बनाया जा सके।

संक्षेप में: शोध पत्र प्रस्तावित करता कि AI को स्मार्ट बनाने का सबसे अच्छा तरीका केवल मॉडल को बड़ा बनाना नहीं है, बल्कि उसे अपने साथ "बहस" करने और फिर केवल अनुमान लगाने के बजाय अपने मस्तिष्क से "वोट" करने के लिए सिखाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →