Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
यह शोध पत्र ProxyCoT को प्रस्तुत करता है, जो एक प्रशिक्षण ढांचा है जो लघु प्रॉक्सी संदर्भों (short proxy contexts) से प्राप्त उच्च-गुणवत्ता वाले चेन-ऑफ-थॉट ट्रेसेस (chain-of-thought traces) को सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से पूर्ण-लंबाई वाले अनुक्रमों (full-length sequences) में स्थानांतरित करके बड़े भाषा मॉडलों में दीर्घ-संदर्भ तर्क (long-context reasoning) को बढ़ाता है, जिससे कम कम्प्यूटेशनल लागत और मजबूत आउट-ऑफ-डोमेन सामान्यीकरण (out-of-domain generalization) के साथ बेहतर प्रदर्शन प्राप्त होता है।