← नवीनतम पेपर
💻 computer science

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

माधो (TraMP-LLaMA) एक नवीन मल्टीमॉडल फ्रेमवर्क है जो नव-निर्मित PFED5-plus डेटासेट पर एक डिकपल्ड इंस्ट्रक्शन-ट्यूनिंग रणनीति के माध्यम से चेहरे के भावों की गंभीरता के स्कोर की संयुक्त रूप से भविष्यवाणी करके और संरचित पाठ्य रिपोर्ट उत्पन्न करके पार्किंसंस रोग के मूल्यांकन में व्याख्यात्मकता को बढ़ाता है।

मूल लेखक: Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ TraMP-LLaMA शोध पत्र का एक सरल अवधारणाओं और रचनात्मक उपमाओं में विभाजित विवरण दिया गया है।

बड़ी समस्या: "ब्लैक बॉक्स" स्कोर

कल्पना कीजिए कि एक डॉक्टर एक मरीज का वीडियो देख रहा है जो पार्किंसंस रोग की जांच के लिए मुस्कुराने या अपनी आँखें सिकोड़ने की कोशिश कर रहा है। वर्तमान में, वे जिस कंप्यूटर सॉफ्टवेयर का उपयोग करते हैं, वह एक कठोर ग्रेडिंग मशीन की तरह काम करता है। यह वीडियो देखता है और एक एकल संख्या निकाल देता है, जैसे कि "गंभीरता स्कोर 4 में से 2"।

हालाँकि वह संख्या समय के साथ प्रगति को ट्रैक करने के लिए उपयोगी है, लेकिन यह निराशाजनक रूप से अस्पष्ट है। यह एक शिक्षक की तरह है जो बिना कोई टिप्पणी लिखे छात्र को निबंध पर "C" ग्रेड दे देता है। आप ग्रेड तो जानते हैं, लेकिन आप यह नहीं जानते कि क्यों मिला। क्या "C" इसलिए मिला क्योंकि लिखावट खराब थी? क्योंकि व्याकरण गलत था? या क्योंकि छात्र उपस्थित ही नहीं हुआ?

चिकित्सा के संदर्भ में, दो मरीजों को एक ही "लेवल 2" स्कोर मिल सकता है, लेकिन बिल्कुल अलग कारणों से। एक की पलकें सख्त हो सकती हैं, जबकि दूसरे का मुँह लटका हुआ हो सकता है। वर्तमान सॉफ्टवेयर इस अंतर को स्पष्ट नहीं कर सकता। यह डॉक्टरों के लिए मशीन पर भरोसा करना या बाद में इसके काम की समीक्षा करना कठिन बना देता है।

समाधान: "द्विभाषी अनुवादक"

लेखकों ने एक नया AI सिस्टम बनाया है जिसे TraMP-LLaMA कहा जाता है। इस सिस्टम को केवल एक ग्रेडर के रूप में नहीं, बल्कि एक द्विभाषी अनुवादक के रूप में सोचें जो दो भाषाओं में धाराप्रवाह बोल सकता है:

  1. संख्याओं की भाषा: यह अभी भी गंभीरता स्कोर की गणना करता है।
  2. कहानियों की भाषा: यह उस स्कोर को सही ठहराने के लिए वीडियो में जो कुछ भी देखा गया, उसका सटीक विवरण देते हुए एक संक्षिप्त, संरचित रिपोर्ट लिखता है।

केवल "लेवल 2" कहने के बजाय, यह कहता है: "लेवल 2। मरीज की पलकें मजबूती से सिकुड़ीं, लेकिन उनका मुँह काफी हद तक स्थिर रहा।" यह एक रहस्यमय संख्या को एक पारदर्शी, ऑडिट योग्य कहानी में बदल देता है।

यह कैसे काम करता है: "दो सिर वाला मस्तिष्क"

इसे बनाने के लिए, AI को एक साथ दो कठिन चीजें सीखने की आवश्यकता थी बिना भ्रमित हुए। लेखकों ने एक विशेष "मस्तिष्क" डिजाइन किया जिसमें दो अलग-अलग हिस्से (हेड्स) थे:

  1. मोशन डिटेक्टिव (स्कोर हेड): यह हिस्सा वीडियो को देखता है और चेहरे के लैंडमार्क्स (जैसे आँखों और मुँह के कोने) की सूक्ष्म गतिविधियों को ट्रैक करता है। यह स्कोर को सही पाने के लिए पूरी तरह से गणित पर ध्यान केंद्रित करता है।
  2. स्टोरीटेलर (रिपोर्ट हेड): यह एक लार्ज लैंग्वेज मॉडल (एक बहुत स्मार्ट चैटबॉट की तरह) है। यह डिटेक्टिव द्वारा खोजे गए साक्ष्यों को लेता है और एक मानव-पठनीय रिपोर्ट लिखता है।

सीक्रेट सॉस: "स्टॉप-ग्रेडिएंट" स्विच
आमतौर पर, यदि आप किसी छात्र को एक ही समय में गणित और कविता दोनों सिखाने की कोशिश करते हैं, तो वे आपस में उलझ सकते हैं। गणित कविता को बिगाड़ सकता है, या कविता गणित से ध्यान भटका सकती है।

लेखकों ने इस समस्या को एक चतुर ट्रिक से हल किया जिसे वे डिकपल्ड इंस्ट्रक्शन ट्यूनिंग (Decoupled Instruction Tuning) कहते हैं। दोनों हेड्स के बीच एक एकतरफा कांच (one-way glass) की कल्पना करें:

  • "स्टोरीटेलर" अपनी रिपोर्ट लिखने के लिए "डिटेक्टिव" के नोट्स देख सकता है।
  • लेकिन, "डिटेक्टिव" सुरक्षित है। यदि "स्टोरीटेलर" अपनी राइटिंग में कोई गलती करता है, तो वह त्रुटि वापस "डिटेक्टिव" के गणितीय गणनाओं को खराब करने के लिए नहीं जा सकती।

यह सुनिश्चित करता है कि गंभीरता स्कोर पूरी तरह से सटीक रहे (एक सख्त गणित शिक्षक की तरह) और साथ ही सिस्टम को एक सहायक स्पष्टीकरण उत्पन्न करने की अनुमति दे (एक रचनात्मक लेखक की तरह)।

नया डेटासेट: PFED5+

इस AI को यह सिखाने के लिए कि ये रिपोर्ट कैसे लिखी जाती हैं, लेखकों को एक नया पाठ्यपुस्तक तैयार करनी पड़ी। उन्होंने एक मौजूदा वीडियो डेटासेट (PFED5) लिया और उसके हर क्लिप में विशेषज्ञों द्वारा लिखे गए विवरण जोड़े।

इसे क्लिनिकल एडिटर्स की एक टीम को काम पर रखने के रूप में सोचें। उन्होंने हर वीडियो को देखा और हर चरण (फेज) के बारे में विस्तार से लिखा:

  • एक्शन से पहले: "चेहरा तटस्थ (neutral) था।"
  • एक्शन के दौरान: "भौंें स्थिर रहीं, लेकिन गाल झुर्रियों के साथ ऊपर उठे।"
  • एक्शन के बाद: "चेहरा वापस तटस्थ अवस्था में आ गया।"

उन्होंने यह सुनिश्चित किया कि ये विवरण विशुद्ध रूप से तथ्यात्मक अवलोकन (जो आप देख सकते हैं) हों, न कि भावनाओं के बारे में अनुमान। इससे एक नया डेटासेट बना जिसे PFED5+ कहा जाता है, जिसका उपयोग AI ने वीडियो साक्ष्य को सही शब्दों के साथ जोड़ने के लिए सीखा।

परिणाम: बेहतर स्कोर और बेहतर कहानियाँ

जब उन्होंने अन्य शीर्ष AI मॉडलों के मुकाबले TraMP-LLaMA का परीक्षण किया:

  • स्कोरिंग के लिए: यह गंभीरता स्कोर की भविष्यवाणी करने में सर्वश्रेष्ठ बन गया, जिसने पिछले तरीकों को महत्वपूर्ण अंतर से पीछे छोड़ दिया (सटीकता में कम से कम 4.39% सुधार)।
  • रिपोर्टिंग के लिए: इसने मानक वीडियो-चैटबॉट्स की तुलना में बेहतर और अधिक सटीक रिपोर्ट लिखी, जो अक्सर 'हैलुसिनेशन' (अपनी ओर से बातें बनाना) करते हैं या चिकित्सा जांच के लिए आवश्यक सूक्ष्म विवरणों को छोड़ देते हैं।

निष्कर्ष

TraMP-LLaMA चिकित्सा उपकरणों को विश्वसनीय बनाने की दिशा में एक कदम है। यह केवल एक ग्रेड नहीं देता; यह अपना काम दिखाता है। गणित को कहानी सुनाने से अलग करके, यह सुनिश्चित करता है कि निदान सटीक हो और अंततः डॉक्टरों को "क्या" के पीछे का "क्यों" भी प्राप्त हो सके।

नोट: यह शोध पत्र इस उपकरण के तकनीकी निर्माण और एक विशिष्ट डेटासेट पर इसके प्रदर्शन पर केंद्रित है। यह दावा नहीं करता है कि इस उपकरण का वर्तमान में अस्पतालों में उपयोग किया जा रहा है या यह मानव डॉक्टरों की जगह लेता है, बल्कि यह बताता है कि यह चेहरे के विश्लेषण को अधिक पारदर्शी बनाने का एक नया तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →