Compositional Reasoning Depth Predicts Clinical AI Failure: Empirical Evidence Consistent with Transformer Compositionality Limits in Electronic Health Record Question Answering
यह शोध पत्र यह प्रदर्शित करता है कि इलेक्ट्रॉनिक स्वास्थ्य अभिलेखों से नैदानिक प्रश्नों का उत्तर देने के लिए आवश्यक अनुमानित चरणों की संख्या (हॉप काउंट) लार्ज लैंग्वेज मॉडल की विफलता का एक सुदृढ़, सिद्धांत-प्रेरित भविष्यवक्ता है, जो तर्क की गहराई बढ़ने के साथ कई आर्किटेक्चर में सटीकता में निरंतर एकदिष्ट गिरावट (monotonic decline) प्रदर्शित करती है, एक ऐसा रुझान जो विस्तारित सोच (extended thinking) के साथ भी बना रहता है और जिसे कॉन्टेक्स्ट ट्रंकेशन (context truncation) के कारण नहीं माना जा सकता है।