Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents
यह शोधपत्र एक सैद्धांतिक ढांचे का प्रस्ताव करता है जो मल्टी-एलएलएम (multi-LLM) एजेंटों के लिए स्थानीय, हस्ताक्षरित और क्रेडिट-संरक्षण वाले प्रशिक्षण संकेतों को उत्पन्न करने हेतु सहयोगात्मक गेम-थ्योरेटिक एट्रिब्यूशन (cooperative game-theoretic attribution) को प्रोसेस रिवॉर्ड मॉडलिंग (process reward modeling) के साथ एकीकृत करता है, जिससे बिना किसी अनुभवजन्य सत्यापन के, सिस्टम-स्तरीय मूल्यांकन और एजेंट-स्तरीय शिक्षण के बीच के अंतर को पाटा जा सके।