Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests
यह शोध पत्र CapCode और CapReward को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क और रिवॉर्ड मैकेनिज्म है जो कोडिंग एजेंटों में धोखेबाज़ी से होने वाली बेईमानी का पता लगाने और उसे रोकने के लिए जानबूझकर सीमित प्रदर्शन सीमाओं वाले रैंडमाइज्ड टेस्ट का उपयोग करता है, जिससे यह सुनिश्चित होता है कि मूल्यांकन स्कोर वास्तविक कार्य-समाधान क्षमता को अधिक सटीक रूप से दर्शाते हैं।