← नवीनतम पेपर
💬 NLP

Canvas-of-Thought: Grounding Reasoning via Mutable Structured States

Canvas-of-Thought (Canvas-CoT) एक नया मल्टीमॉडल रीजनिंग प्रतिमान (paradigm) पेश करता है जो रैखिक टेक्स्ट श्रृंखलाओं (linear text chains) को एक इंटरैक्टिव HTML Canvas से बदल देता है, जिससे मॉडल CRUD ऑपरेशन्स के माध्यम से सटीक, इन-प्लेस स्टेट अपडेट करने में सक्षम होते हैं और अधिक कुशल एवं सटीक जटिल तर्क (complex reasoning) के लिए एक विजुअल क्रिटीक लूप का उपयोग कर सकते हैं।

मूल लेखक: Lingzhuang Sun, Yuxia Zhu, Ruitong Liu, Hao Liang, Zheng Sun, Caijun Jia, Honghao He, Yuchen Wu, Siyuan Li, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Lingzhuang Sun, Yuxia Zhu, Ruitong Liu, Hao Liang, Zheng Sun, Caijun Jia, Honghao He, Yuchen Wu, Siyuan Li, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल लेगो (LEGO) किला बनाने की कोशिश कर रहे हैं, लेकिन आपको अपने सहायक के साथ संवाद करने के लिए केवल कागज के एक कभी न खत्म होने वाले लंबे स्क्रॉल (लपेटे हुए कागज) का उपयोग करने की अनुमति है।

समस्या: "कभी न खत्म होने वाला स्क्रॉल" (पारंपरिक AI)

वर्तमान में, जब उन्नत AI मॉडल (जैसे ChatGPT या Gemini) किसी कठिन समस्या को हल करने की कोशिश करते हैं—जैसे कि कोई जटिल ज्यामिति पहेली या डिजिटल ड्राइंग डिजाइन करना—तो वे "चेन-ऑफ-थॉट" (Chain-of-Thought) नामक चीज़ का उपयोग करते हैं।

इसे ऐसे समझें कि AI अपने विचारों की एक लंबी, निरंतर डायरी लिख रहा है। यदि AI तर्क लिखने के लिए 10 पेज लिखता है और पेज 11 पर उसे एहसास होता है कि उसने पेज 2 पर एक छोटी सी गलती की थी, तो उसके सामने एक बड़ी समस्या खड़ी हो जाती है। क्योंकि यह केवल टेक्स्ट का एक "स्क्रॉल" है, यह पेज 2 को "मिटा" नहीं सकता। इसे लिखना जारी रखना होगा, उस गलती को समझाने की कोशिश करनी होगी, या इसे पूरे स्क्रॉल को फेंककर शुरुआत से शुरू करना होगा। यह धीमा है, बहुत अधिक "दिमागी शक्ति" (टोकन) का उपयोग करता है, और अक्सर इससे AI भ्रमित हो जाता है और "हैलुसिनेट" (मनगढ़ंत बातें बनाना) करने लगता है क्योंकि वह एक टूटी हुई नींव पर नया विचार बनाने की कोशिश कर रहा होता है।

समाधान: "डिजिटल स्केचपैड" (कैनवस-ऑफ-थॉट)

शोधकर्ताओं ने कैनवस-ऑफ-थॉट (Canvas-of-Thought) बनाया। केवल एक डायरी लिखने के बजाय, उन्होंने AI को एक डिजिटल स्केचपैड (HTML Canvas) दिया।

अब, केवल "मुझे लगता है कि वृत्त (circle) समन्वय X पर है" लिखने के बजाय, AI वास्तव में स्केचपैड पर उस वृत्त को बना सकता है।

यहाँ बताया गया है कि यह सब कुछ कैसे बदल देता है:

1. "इरेज़र और पेंसिल" (CRUD ऑपरेशन्स)
गलती सुधारने के लिए एक नया पैराग्राफ लिखने के बजाय, AI एक डिजिटल इरेज़र या पेंसिल का उपयोग कर सकता है। यदि वह गलत जगह पर एक रेखा खींच देता है, तो वह यह नहीं लिखता कि "ओह, रेखा गलत थी, मुझे एक नई रेखा का वर्णन करना चाहिए।" वह बस कहता है, "लाइन A को लाइन B से बदलें।" वह अपने काम के बाकी हिस्सों को खराब किए बिना अपने ड्राइंग के विशिष्ट हिस्सों को जोड़ सकता है, बदल सकता है या हटा सकता है। यह एक स्क्रॉल के बजाय व्हाइटबोर्ड होने जैसा है।

2. "मिरर टेस्ट" (क्रिटीक लूप)
यह सबसे शानदार हिस्सा है। AI द्वारा अपने स्केचपैड पर कुछ बनाने के बाद, सिस्टम उस ड्राइंग की एक "फोटो" लेता है और वह फोटो वापस AI को दिखाता है।

कल्पना कीजिए कि आप एक व्यक्ति को बनाने की कोशिश कर रहे हैं, लेकिन आपने गलती से उसे तीन हाथ दे दिए। पुराने तरीके में, आप इस बारे में लिखते रह सकते हैं कि वह व्यक्ति कितना अच्छा दिखता है, यह महसूस किए बिना कि ड्राइंग गलत है। Canvas-CoT के साथ, AI अपनी ही ड्राइंग की "फोटो" को देखता है और कहता है, "रुको, मैं इस तस्वीर में तीन हाथ देख रहा हूँ, लेकिन मेरे निर्देशों में केवल दो ही कहा गया था। मुझे इसे ठीक करने की आवश्यकता है।" यह "विजुअल फीडबैक" एक वास्तविकता की जांच (reality check) के रूप में कार्य करता है, जो AI को निरर्थकता की ओर भटकने से रोकता है।

यह क्यों मायने रखता है?

AI को अपना काम देखने और उसे सटीक रूप से संपादित (edit) करने का तरीका देकर, यह निम्नलिखित कार्यों में बहुत बेहतर हो जाता है:

  • ज्यामिति (Geometry): उन गणितीय समस्याओं को हल करना जिनमें आकृतियाँ बनाने की आवश्यकता होती है।
  • कोडिंग (Coding): डिजिटल ग्राफिक्स (SVG) बनाना जो वास्तव में मूल छवि की तरह दिखते हैं।
  • तर्क (Logic): जटिल पहेलियों को हल करना जहाँ एक छोटी सी गलती पूरी प्रक्रिया को बर्बाद कर सकती थी।

संक्षेप में: Canvas-of-Thought AI को "एक लेखक जो केवल टेक्स्ट जोड़ सकता है" से बदलकर "एक वास्तुकार (architect) जो ब्लूप्रिंट बना सकता है, मिटा सकता है और सुधार सकता है" में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →