Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
यह शोध पत्र टेस्ट-टाइम स्केलिंग के लिए एक हल्का, प्रोब-आधारित तरीका प्रस्तावित करता है जो फ्रोजन लार्ज लैंग्वेज मॉडल्स की आंतरिक अवस्थाओं का विश्लेषण करके मल्टी-स्टेप रीजनिंग को सत्यापित करता है, जिससे बिना किसी महंगी एनोटेशन के, बहुत बड़े प्रोसेस रिवॉर्ड मॉडल्स के तुलनीय या उनसे बेहतर प्रदर्शन प्राप्त होता है।