InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning
InftyThink+ एक एंड-टू-एंड सुदृढीकरण शिक्षण (reinforcement learning) फ्रेमवर्क है जो रणनीतिक सारांशीकरण और मॉडल-नियंत्रित पुनरावृत्ति सीमाओं के माध्यम से पुनरावृत्तीय तर्क को अनुकूलित करता है, जो पारंपरिक लॉन्ग चेन-ऑफ-थॉट विधियों की तुलना में सटीकता, दक्षता और सामान्यीकरण में महत्वपूर्ण सुधार करता है।