A Systematic Comparison between Extractive Self-Explanations and Human Rationales in Text Classification
यह शोध पत्र कई टेक्स्ट वर्गीकरण कार्यों में इंस्ट्रक्शन-ट्यून्ड एलएलएम (LLM) से प्राप्त एक्सट्रैक्टिव सेल्फ-एक्सप्लेनेशन (extractive self-explanations) की मानव तर्कसंगतताओं (human rationales) के साथ व्यवस्थित रूप से तुलना करता है, और यह पाता है कि हालांकि दोनों के बीच संरेखण पाठ की लंबाई और कार्य की जटिलता पर निर्भर करता है, फिर भी सेल्फ-एक्सप्लेनेशन्स टोकन-स्तरीय अंतर्दृष्टि प्रदान करते हैं जो पोस्ट-हॉक एट्रिब्यूशन विधियों (post-hoc attribution methods) के संरचनात्मक फोकस से मौलिक रूप से भिन्न हैं।