Tricky: Towards a Benchmark for Evaluating Human and LLM Error Interactions
यह शोध पत्र Tricky को प्रस्तुत करता है, जो कई प्रोग्रामिंग भाषाओं में मानव-लिखित दोषों को LLM-इंजेक्टेड त्रुटियों के साथ संवर्धित करने वाला एक हाइब्रिड डेटासेट है, ताकि यह अध्ययन किया जा सके कि मानव और मशीन-जनित बग कैसे परस्पर क्रिया करते हैं, जिससे हाइब्रिड सॉफ्टवेयर विकास वर्कफ़्लो में त्रुटि वर्गीकरण, स्थानीयकरण और मरम्मत के नए मूल्यांकन को सक्षम बनाया जा सके।