← नवीनतम पेपर
💻 computer science

Vision-Language System using Open-Source LLMs for Gestures in Medical Interpreter Robots

यह शोध पत्र चिकित्सा व्याख्याता रोबोटों के लिए एक गोपनीयता-संरक्षित विजन-लैंग्वेज फ्रेमवर्क प्रस्तुत करता है जो स्थानीय रूप से तैनात ओपन-सोर्स एलएलएम (LLMs) और एक नवीन एनोटेटेड डेटासेट का लाभ उठाकर नैदानिक स्पीच एक्ट्स को सटीक रूप से पहचानने और मानव-समान, उपयुक्त रोबोटिक जेस्चर उत्पन्न करने में सक्षम है।

मूल लेखक: Thanh-Tung Ngo, Emma Murphy, Robert J. Ross

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thanh-Tung Ngo, Emma Murphy, Robert J. Ross

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक व्यस्त अस्पताल के कमरे में एक रोबोटिक डॉक्टर सहायक खड़ा है। इसका काम एक डॉक्टर को उस मरीज के साथ बातचीत करने में मदद करना है जो अलग भाषा बोलता है। आमतौर पर, ये रोबोट केवल शब्दों का अनुवाद करते हैं, जिससे यह थोड़ा यांत्रिक और ठंडा महसूस हो सकता है। लेकिन क्या होगा अगर वह रोबोट सही समय पर सिर हिला सके, इशारा कर सके, या हाथ उठा सके, ठीक वैसे ही जैसे एक इंसान करता है? इस शोध पत्र का लक्ष्य यही है।

शोधकर्ताओं ने एक मेडिकल रोबोट के लिए एक "स्मार्ट शरीर" बनाया है जो न केवल यह समझता है कि क्या कहा जा रहा है, बल्कि यह भी कि उसे शारीरिक रूप से कैसे कहा जाना चाहिए। उन्होंने इसे कैसे किया, इसे यहाँ सरल भाषा में समझाया गया है:

1. समस्या: "मूक" अनुवादक (The "Silent" Translator)

अस्पताल में, केवल शब्द पर्याप्त नहीं होते। यदि डॉक्टर कहता है, "मुझे आगे बढ़ने के लिए आपकी अनुमति चाहिए," तो वे अनुमति (consent) माँगने के लिए अपना हाथ आगे भी बढ़ा सकते हैं या थोड़ा आगे झुक सकते हैं। यदि वे कहते, "एक गहरी सांस लें," तो वे उस क्रिया का प्रदर्शन भी कर सकते हैं।
वर्तमान अनुवाद उपकरण एक रेडियो की तरह हैं: वे केवल आवाज़ प्रसारित करते हैं। वे शारीरिक भाषा (body language) को छोड़ देते हैं। शोधकर्ता एक ऐसा रोबोट चाहते थे जो अपने हाथों और बाहों से भी "बोल" सके, ताकि मरीज सुरक्षित और समझा हुआ महसूस कर सके।

2. समाधान: एक "गोपनीयता-प्रथम" मस्तिष्क (A "Privacy-First" Brain)

रोबोट को यह जानने के लिए पर्याप्त स्मार्ट बनाने के लिए कि उसे कब इशारा करना है, उन्हें एक ऐसे "मस्तिष्क" (एक AI) की आवश्यकता थी जो बातचीत को सुन सके और निर्णय ले सके: "क्या डॉक्टर अनुमति मांग रहा है? क्या डॉक्टर कोई निर्देश दे रहा है? या यह सिर्फ सामान्य बातचीत है?"

  • स्थानीय मस्तिष्क (The Local Brain): अधिकांश AI मॉडल "क्लाउड" (दूर स्थित विशाल सर्वर) में रहते हैं। लेकिन अस्पताल में, मरीज की गोपनीयता सर्वोपरि है। आप नहीं चाहेंगे कि संवेदनशील चिकित्सा डेटा इंटरनेट के माध्यम से उड़ता रहे। इसलिए, टीम ने एक ऐसा सिस्टम बनाया जो पूरी तरह से रोबोट के अपने कंप्यूटर पर चलता है। यह कमरे में रहने वाले एक व्यक्तिगत लाइब्रेरियन की तरह है जो कभी इमारत से बाहर नहीं जाता और कभी किसी को नहीं बताता कि आपने क्या पढ़ा।
  • "फ्यू-शॉट" ट्रिक (The "Few-Shot" Trick): उन्होंने इस स्थानीय AI को "फ्यू-शॉट प्रॉम्प्टिंग" नामक एक चतुर तरीके से सिखाया। कल्पना करें कि आप एक बच्चे को बिल्ली पहचानना सिखा रहे हैं। उन्हें लाखों तस्वीरें दिखाने के बजाय, आप उन्हें तीन उदाहरण दिखाते हैं: "यह एक बिल्ली है। यह एक बिल्ली है। यह एक बिल्ली है। अब, क्या यह एक बिल्ली है?" AI ने केवल कुछ उदाहरण देखकर "सहमति" (Consent) और "निर्देश" (Instruction) वाक्यों को पहचानना सीख लिया।

3. डेटासेट: एक "जेस्चरल डिक्शनरी" (The "Gestural Dictionary")

रोबोट को प्रशिक्षित करने के लिए, टीम को इशारों के साथ जुड़ी चिकित्सा बातचीत के एक शब्दकोश की आवश्यकता थी।

  • उन्होंने एक सार्वजनिक यूट्यूब चैनल से डॉक्टरों की बातचीत के 58 वास्तविक वीडियो लिए।
  • उन्होंने इन वीडियो को हजारों छोटे क्लिप्स में विभाजित किया।
  • उन्होंने प्रत्येक क्लिप को लेबल किया: "यह वाक्य सहमति का अनुरोध है," या "यह हाथ हिलाने का निर्देश है।"
  • उन्होंने इन क्लिप्स में डॉक्टर की हाथ की गतिविधियों को भी रिकॉर्ड किया ताकि रोबोट उन्हें कॉपी करना सीख सके।

4. दो-मोड प्रणाली (The Two-Mode System)

रोबोट के पास दो तरीके से हिलने-डुलने के तरीके हैं, जो इस बात पर निर्भर करते हैं कि AI ने क्या सुना है:

  • मोड A: दर्पण (मानव-अनुकरण) (Mode A: The Mirror - Human-Mimic)
    यदि AI एक सहमति या निर्देश वाला वाक्य सुनता है, तो रोबोट "मिरर मोड" में स्विच हो जाता है। यह मानव वक्ता के वीडियो को देखता है, उनके हाथ की गतिविधियों को पकड़ता है, और उन्हें हुबहू कॉपी करता है।

    • उपमा: यह एक डांस पार्टनर की तरह है जो आपके कदमों को पूरी तरह से दोहराता है। यदि डॉक्टर "रुकने" के लिए हाथ उठाता है, तो रोबोट भी अपना हाथ उठाता है। यह बहुत स्वाभाविक और मानवीय लगता है।
  • मोड B: सुधारक (भाषण-इशारा पीढ़ी) (Mode B: The Improviser - Speech-Gesture Generation)
    यदि AI सामान्य बातचीत सुनता है (कोई विशिष्ट निर्देश या सहमति नहीं), तो रोबोट एक अलग AI का उपयोग करता है जो मूड के अनुकूल एक इशारा खुद बनाता है।

    • उपमा: यह एक जैज़ संगीतकार की तरह है। यदि बातचीत अनौपचारिक है, तो रोबोट लय बनाए रखने के लिए थोड़ा सिर हिलाना या हाथ हिलाना जोड़ देता है, भले ही उसे ठीक से न बताया गया हो कि उसे क्या करना है।

5. परिणाम: क्या यह काम करता है? (The Results: Does It Work?)

उन्होंने इसका परीक्षण एक पेपर (Pepper) रोबोट पर किया, जो एक मित्रवत, मानव सदृश रोबोट है जिसका उपयोग अक्सर अनुसंधान में किया जाता है, जिसमें 26 स्वयंसेवक शामिल थे।

  • "मानवीय" परीक्षण (The "Human" Test): लोगों ने रोबोट को चलते हुए देखा। जब रोबोट वास्तविक मानव इशारों की नकल कर रहा था (मोड A), तो लोगों ने इसे यादृच्छिक (random) इशारे उत्पन्न करने की तुलना में अधिक मानव जैसा बताया। यह मशीन के बजाय एक व्यक्ति जैसा महसूस हुआ।
  • "उपयुक्तता" परीक्षण (The "Appropriateness" Test): लोगों ने यह भी जांचा कि क्या इशारे शब्दों से मेल खाते हैं। रोबोट ने इशारों को सार्थक बनाने के मामले में मौजूदा सर्वोत्तम प्रणालियों के समान ही प्रदर्शन किया।
  • गोपनीयता की जीत (The Privacy Win): क्योंकि सब कुछ स्थानीय स्तर पर चलता है, यह बहुत कम मेमोरी का उपयोग करता है और सभी रोगी डेटा को मशीन के भीतर सुरक्षित रखता है।

बड़ी तस्वीर (The Big Picture)

इस सिस्टम को रोबोट को एक "भावपूर्ण शरीर" देने के रूप में सोचें। पहले, मेडिकल रोबोट टेलीफोन की तरह थे—सुनने में अच्छे, लेकिन महसूस करने में कमजोर। यह नया सिस्टम रोबोट को अपनी "बॉडी लैंग्वेज" का उपयोग करके विश्वास बनाने, चिंता को कम करने और यह सुनिश्चित करने की अनुमति देता है कि मरीज वास्तव में उनकी देखभाल को समझें, जबकि उनकी निजी चिकित्सा गोपनीयता को रोबोट पर ही एक सुरक्षित बॉक्स में बंद रखा जाता है।

यह उन रोबोटों की ओर एक कदम है जो केवल शब्दों का अनुवाद नहीं करते, बल्कि मानवीय जुड़ाव का अनुवाद करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →