← नवीनतम पेपर
🤖 AI

Scaling-Aware Adapter for Structure-Grounded LLM Reasoning

यह शोध पत्र Cuttlefish को पेश करता है, जो एक एकीकृत मल्टीमॉडल (multimodal) LLM है जो एक स्केलिंग-अवेयर पैचिंग (Scaling-Aware Patching) तंत्र के माध्यम से क्वेरी टोकन को संरचनात्मक जटिलता के आधार पर अनुकूल रूप से स्केल करके संरचना-आधारित तर्क (structure-grounded reasoning) को बढ़ाता है और मॉडल में स्पष्ट ज्यामितीय संकेतों (geometric cues) को इंजेक्ट करने के लिए एक ज्योमेट्री ग्राउंडिंग एडॉप्टर (Geometry Grounding Adapter) का उपयोग करके मतिभ्रम (hallucinations) को कम करता है।

मूल लेखक: Zihao Jing, Qiuhao Zeng, Ruiyi Fang, Yan Yi Li, Yan Sun, Boyu Wang, Pingzhao Hu

प्रकाशित 2026-05-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihao Jing, Qiuhao Zeng, Ruiyi Fang, Yan Yi Li, Yan Sun, Boyu Wang, Pingzhao Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Scaling-Aware Adapter for Structure-Grounded LLM Reasoning" (जिसमें Cuttlefish का परिचय दिया गया है) के पेपर की सरल, रोज़मर्रा की भाषा में व्याख्या दी गई है।

बड़ी तस्वीर: "अंधा" वैज्ञानिक

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली वैज्ञानिक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसने रसायन विज्ञान और जीव विज्ञान के बारे में लिखी गई अब तक की हर किताब पढ़ ली है। वे अणुओं के नाम जानते हैं, प्रोटीन अनुक्रमों (sequences) में कैसे लिखे जाते हैं, और जीवन के नियमों को समझते हैं।

हालाँकि, एक समस्या है: यह वैज्ञानिक 3D आकृतियों के प्रति अंधा है।

यदि आप उन्हें सामग्री की एक सपाट सूची (एक रासायनिक अनुक्रम) दिखाते हैं, तो वे अनुमान लगा सकते हैं कि व्यंजन का स्वाद कैसा हो सकता है। लेकिन यदि आप उनसे पूछते हैं, "क्या यह अणु इस विशिष्ट ताले में फिट होगा?" या "यह प्रोटीन एक सर्पिल (spiral) में क्यों मुड़ता है?", तो वे बेतहाशा अनुमान लगाने लग सकते हैं। वे कहानी को अच्छा बनाने के लिए ऐसी आकृति बना सकते हैं जो अस्तित्व में ही नहीं है। पेपर में, इसे "स्ट्रक्चरल हैलुसिनेशन" (structural hallucination) कहा गया है।

मौजूदा AI मॉडल इस समस्या को हल करने के लिए वैज्ञानिक को अणु की एक तस्वीर दिखाने की कोशिश करते हैं, लेकिन वे आमतौर पर उस तस्वीर को एक छोटे, निश्चित आकार के सारांश में सिकोड़ देते हैं (जैसे किसी विशाल कैथेड्रल का वर्णन केवल 10 शब्दों में करने की कोशिश करना)। यदि अणु छोटा है, तो वे शब्दों को बर्बाद करते हैं। यदि वह बहुत बड़ा है, तो वे महत्वपूर्ण विवरण खो देते हैं।

Cuttlefish एक नया सिस्टम है जिसे इस वैज्ञानिक को बिना अभिभूत (overwhelm) किए "3D दृष्टि" देने के लिए डिज़ाइन किया गया है।


दो मुख्य समस्याएँ जिन्हें Cuttlefish हल करता है

1. "एक ही आकार सबके लिए" वाली फँसावट (Scaling)

समस्या: कल्पना कीजिए कि आप एक संग्रहालय के टूर गाइड हैं।

  • यदि आप किसी आगंतुक को एक छोटी सी चाबी दिखाते हैं, तो आप उसका वर्णन करने में 1 मिनट बिता सकते हैं।
  • यदि आप उन्हें एक विशाल किला दिखाते हैं, तो आप 10 मिनट बिता सकते हैं।
  • पुराने AI मॉडल एक सख्त टूर गाइड की तरह हैं जो कहते हैं, "मेरे पास सब कुछ बताने के लिए केवल 1 मिनट है, चाहे वह कितना भी बड़ा क्यों न हो।"
    • चाबी के लिए, वे समय बर्बाद करते हैं।
    • किले के लिए, उन्हें मीनारें, कालकोठरी और खाई को छोड़ना पड़ता है, जिससे आगंतुक भ्रमित हो जाता है।

Cuttlefish का समाधान: "स्केलिंग-अवेयर पैचिंग" (Scaling-Aware Patching)
Cuttlefish एक स्मार्ट "गेटिंग" (gating) सिस्टम का उपयोग करता है। यह निर्देश (प्रश्न) और अणु के आकार को देखता है।

  • यदि अणु छोटा है, तो यह विवरण देने के लिए कुछ प्रमुख स्थानों को चुनता है।
  • यदि अणु बहुत बड़ा है (जैसे एक विशाल प्रोटीन), तो यह गतिशील रूप से अपने ध्यान (attention) का विस्तार करता है। यह कहता है, "ठीक है, यह जटिल है; विवरणों को सही ढंग से प्राप्त करने के लिए मुझे 50 अलग-अलग स्थानों पर ज़ूम करने की आवश्यकता है।"
  • उपमा (Analogy): एक कठोर 1-मिनट के भाषण के बजाय, Cuttlefish एक लचीला टूर गाइड है जो इमारत के आकार के आधार पर टूर की लंबाई को समायोजित करता है, यह सुनिश्चित करता है कि कोई भी महत्वपूर्ण विवरण छूटे नहीं।

2. "काल्पनिक आकृतियों" की समस्या (Hallucination)

समस्या: वास्तविक 3D आकार देखे बिना, वैज्ञानिक कह सकता है, "यह प्रोटीन एक गोले जैसा दिखता है," जबकि वास्तव में यह एक सपाट शीट है। वे केवल टेक्स्ट विवरण के आधार पर अनुमान लगा रहे हैं।

Cutilsfish का समाधान: "जियोमेट्री ग्राउंडिंग एडेप्टर" (Geometry Grounding Adapter)
यह हिस्सा एक अनुवादक (translator) की तरह काम करता है जो कच्चे 3D निर्देशांकों (प्रत्येक परमाणु की वास्तविक X, Y, Z स्थिति) को उस भाषा में बदल देता है जिसे वैज्ञानिक समझता है।

  • यह केवल यह नहीं कहता कि "यहाँ एक अणु है।" बल्कि यह विशिष्ट ज्यामितीय विशेषताओं की ओर इशारा करता है: "यहाँ देखें, यहाँ एक तीखा मोड़ है," या "ध्यान दें कि परमाणुओं का यह समूह दूसरे से दूर है।"
  • उपमा: यह अंधे वैज्ञानिक को 3D चश्मा देने जैसा है। अनुमान लगाने के बजाय, अब वे ज्यामिति को "देख" सकते हैं और कह सकते हैं, "आह, मैं अब सर्पिल देख पा रहा हूँ। यही कारण है कि यह काम करता है।" यह उन्हें नकली आकृतियाँ बनाने से रोकता है।

यह कैसे काम करता है ("कट्टलफिश" उपमा)

इस मॉडल का नाम Cuttlefish इसलिए रखा गया है क्योंकि असली जानवर की तरह, यह बहुमुखी है और अपने वातावरण के अनुकूल होने के लिए अपना आकार बदल सकता है।

  • शरीर (The Body): यह एक मानक लार्ज लैंग्वेज मॉडल ("मस्तिष्क") से जुड़ता है।
  • हाथ (The Arms): इसमें एक विशेष कनेक्टर है जो खिंच या सिकुड़ सकता है।
    • यह अणु के उन "एंकर पॉइंट्स" (anchor points) को पकड़ता है जो पूछे गए विशिष्ट प्रश्न के लिए सबसे महत्वपूर्ण हैं।
    • यह उन एंकरों के चारों ओर "पैच" (patches) विकसित करता है ताकि आवश्यक क्षेत्र को कवर किया जा सके।
    • यह इस जानकारी को मस्तिष्क में फीड करता है, यह सुनिश्चित करते हुए कि मस्तिष्क वास्तविक आकार को देखे, न कि केवल एक संकुचित सारांश को।

पेपर क्या दावा करता है (परिणाम)

लेखकों ने तीन प्रकार की जैविक संस्थाओं पर Cutilsfish का परीक्षण किया: अणु (छोटे रसायन), प्रोटीन (बड़े जैविक यंत्र), और न्यूक्लिक एसिड (DNA/RNA)।

  1. बेहतर सटीकता: Cutilsfish ने इन संरचनाओं के बारे में प्रश्नों के उत्तर देने में उन मॉडलों की तुलना में बहुत बेहतर प्रदर्शन किया जो या तो केवल टेक्स्ट पढ़ते थे या पुराने "निश्चित-आकार" के सारांशों का उपयोग करते थे।
  2. कम झूठ (Fewer Lies): इसने काफी कम "हैलुसिनेशन" (नकली आकृतियाँ या गुण बनाना) किए। जब पूछा गया कि एक अणु शरीर में कैसे अवशोषित होता है, तो इसने सही उत्तर देने के लिए वास्तविक 3D आकार का उपयोग किया, जबकि अन्य मॉडलों ने केवल अनुमान लगाया।
  3. दक्षता (Efficiency): इसने कंप्यूटर पावर बर्बाद नहीं की। इसने काम के लिए आवश्यक मात्रा में ही "टोकन" (आकार का वर्णन करने वाले शब्द) का उपयोग किया—छोटी चीजों के लिए कम, बड़ी चीजों के लिए अधिक—न कि हर चीज़ के लिए एक निश्चित मात्रा का उपयोग किया।
  4. एकीकृत (Unified): यह जीव विज्ञान के तीनों प्रकारों (अणु, प्रोटीन, DNA) के लिए एक एकल प्रणाली के रूप में कार्य करता है, जबकि पिछले मॉडलों को अक्सर प्रत्येक के लिए अलग-अलग सिस्टम की आवश्यकता होती थी।

सारांश

Cutilsfish एक ऐसा टूल है जो AI को अणुओं और प्रोटीनों के 3D आकार को "देखना" सिखाता है। यह इस समस्या को हल करता है कि AI बड़े आकार से अभिभूत हो जाता है या छोटे विवरणों को अनदेखा कर देता है, ऐसा करने के लिए यह गतिशील रूप से अपने ध्यान को समायोजित करता है। वास्तविक ज्यामिति को देखने के लिए AI को मजबूर करके, यह AI को नकली संरचनाएं बनाने से रोकता है, जिससे अधिक विश्वसनीय वैज्ञानिक तर्क (reasoning) प्राप्त होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →