← नवीनतम पेपर
💬 NLP

PARHAF, a human-authored corpus of clinical reports for fictitious patients in French

यह शोधपत्र PARHAF को प्रस्तुत करता है, जो 18 विशेषज्ञताओं में 5,000 से अधिक रोगी मामलों को कवर करने वाली 7,394 विशेषज्ञ-लिखित, काल्पनिक फ्रांसीसी नैदानिक रिपोर्टों का एक विशाल ओपन-सोर्स कॉर्पस है, जिसे सख्त डेटा संरक्षण नियमों का पालन करते हुए नैदानिक प्राकृतिक भाषा प्रसंस्करण प्रणालियों के गोपनीयता-संरक्षित प्रशिक्षण और मूल्यांकन को सक्षम करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Xavier Tannier, Salam Abbara, Rémi Flicoteaux, Youness Khalil, Aurélie Névéol, Pierre Zweigenbaum, Emmanuel Bacry

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xavier Tannier, Salam Abbara, Rémi Flicoteaux, Youness Khalil, Aurélie Névéol, Pierre Zweigenbaum, Emmanuel Bacry

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को डॉक्टर बनना सिखाना चाहते हैं। ऐसा करने के लिए, आपको उसे लाखों वास्तविक रोगी कहानियाँ दिखानी होंगी ताकि वह सीख सके कि बीमारियाँ कैसी दिखती हैं, उपचार कैसे काम करते हैं, और डॉक्टर अपने नोट्स कैसे लिखते हैं।

लेकिन यहाँ एक समस्या है: वास्तविक रोगी कहानियाँ अत्यंत गोपनीय होती हैं। उनमें निजी नाम, पते और चिकित्सा इतिहास शामिल होते हैं। यूरोप (और विशेष रूप से फ्रांस) में नियम इतने सख्त हैं कि आप इन कहानियों को बस किसी रोबोट को या शोधकर्ताओं के साथ साझा नहीं कर सकते। यह बिल्कुल वैसा ही है जैसे किसी को कार चलाना सिखाने के लिए किसी अजनबी की कार का उपयोग करना; आप उसे बस यूँ ही चक्कर लगाने के लिए नहीं दे सकते।

वर्षों तक, यह एक बहुत बड़ी बाधा बनी रही। फ्रांस के शोधकर्ता इस कदर फंस गए थे कि वे स्मार्ट मेडिकल AI बनाने के लिए असमर्थ थे क्योंकि उनके पास उपयोग करने के लिए कोई "अभ्यास" डेटा नहीं था।

प्रस्तुत है PARHAF: एक "नकली" मेडिकल लाइब्रेरी।

इस शोध पत्र के लेखकों ने एक शानदार समाधान निकाला। वास्तविक रहस्यों को चुराने के बजाय, उन्होंने पूरी तरह से नई, काल्पनिक रोगी कहानियाँ लिखने का निर्णय लिया।

इसे एक विशाल, सहयोगात्मक लेखन कार्यशाला (writing workshop) की तरह समझें।

उन्होंने इसे कैसे किया (नुस्खा)

  1. लेखक: उन्होंने पूरे फ्रांस से 104 मेडिकल रेजिडेंट्स (प्रशिक्षण ले रहे डॉक्टर) को नियुक्त किया। ये केवल साधारण लोग नहीं थे; वे हृदय शल्य चिकित्सा (heart surgery) से लेकर संक्रामक रोगों तक, हर चीज़ के विशेषज्ञ थे।
  2. कार्य (Assignment): शोधकर्ताओं ने इन डॉक्टरों को "रेसिपी" या परिदृश्य (scenarios) का एक सेट दिया। उदाहरण के लिए: "एक 45 वर्षीय व्यक्ति के बारे में एक कहानी लिखें जो टूटी हुई टांग के साथ आपातकालीन कक्ष (ER) में आया, उसकी सर्जरी हुई, और वह तीन दिन बाद घर चला गया।"
  3. ट्विस्ट: डॉक्टरों को ये कहानियाँ ऐसे लिखनी थीं जैसे कि वे वास्तविक हों, उसी पेशेवर भाषा और संरचना का उपयोग करते हुए जिसका वे रोज़ाना उपयोग करते हैं। लेकिन मरीज़? वे कभी अस्तित्व में ही नहीं थे। नाम, चेहरे, विशिष्ट विवरण—सब कुछ काल्पनिक था।
  4. सुरक्षा जाल (Safety Net): यह सुनिश्चित करने के लिए कि कहानियाँ केवल रैंडम अनुमान नहीं हैं, टीम ने यह तय करने के लिए वास्तविक फ्रांसीसी सरकारी स्वास्थ्य सांख्यिकी (जैसे अस्पताल के दौरों का एक विशाल जनगणना) का उपयोग किया कि कौन सी कहानियाँ लिखी जानी चाहिए। यदि वास्तविक अस्पताल के दौरों का 10% निमोनिया के लिए है, तो उन्होंने यह सुनिश्चित किया कि उनकी "नकली" कहानियों में से 10% निमोनिया के बारे में हों। यह सुनिश्चित करता है कि "नकली" लाइब्रेरी बिल्कुल एक "वास्तविक" लाइब्रेरी की तरह दिखे और महसूस हो।

बॉक्स में क्या है?

परिणाम स्वरूप PARHAF प्राप्त हुआ, जो एक विशाल डिजिटल लाइब्रेरी है जिसमें शामिल हैं:

  • 7,394 मेडिकल रिपोर्ट्स (जैसे डिस्चार्ज सारांश, सर्जरी नोट्स और लैब परिणाम)।
  • 5,009 अद्वितीय "नकली" मरीज़।
  • 18 अलग-अलग चिकित्सा विशिष्टताओं (specialties) की कहानियाँ, ऑन्कोलॉजी (कैंसर) से लेकर ऑब्सटेट्रिक्स (जन्म) तक।

यह डॉक्टरों और AI के लिए एक सिम्युलेटर की तरह है। जिस तरह एक फ्लाइट सिम्युलेटर पायलट को किसी को नुकसान पहुँचाए बिना विमान क्रैश करने का अभ्यास करने देता है, उसी तरह PARHAF AI को किसी की गोपनीयता का उल्लंघन किए बिना बीमारियों का निदान करने का अभ्यास करने देता है।

यह एक बड़ी बात क्यों है?

  • गोपनीयता की गारंटी है: चूंकि मरीज़ों का कभी अस्तित्व ही नहीं था, इसलिए अनजाने में किसी वास्तविक व्यक्ति का रहस्य उजागर होने का शून्य जोखिम है। आप इस डेटा को किसी के भी साथ, कहीं भी, बिना किसी डर के साझा कर सकते हैं।
  • यह ओपन सोर्स है: कई मेडिकल डेटाबेस के विपरीत जो महंगे पासवर्ड के पीछे बंद होते हैं, यह एक सार्वजनिक पार्क की तरह मुफ्त उपयोग के लिए उपलब्ध है।
  • यह यथार्थवादी है: क्योंकि इसे वास्तविक डॉक्टरों ने लिखा है, इसलिए इसकी भाषा प्रामाणिक है। यह केवल एक रोबोट का अनुमान नहीं है कि एक डॉक्टर क्या कह सकता है; यह वास्तविक डॉक्टरों द्वारा उनकी मूल भाषा में बोला गया सत्य है।

"एम्बार्गो" (गुप्त सामग्री)

लेखक इतने सावधान हैं कि वे कहानियों का एक छोटा हिस्सा (लगभग 1,200 दस्तावेज़) एक "टाइम कैप्सूल" में रोक कर रख रहे हैं। वे इन्हें अभी जारी नहीं करेंगे। क्यों? यह सुनिश्चित करने के लिए कि भविष्य में, शोधकर्ता इन कहानियों पर नए AI मॉडल का परीक्षण कर सकें बिना इस बात के कि AI ने पहले से ही इंटरनेट पर इन कहानियों को देख लिया हो। यह सुनिश्चित करता है कि जब हम परीक्षण करते हैं कि क्या एक नया AI स्मार्ट है, तो वह वास्तव में सीख रहा है, न कि केवल इंटरनेट पर मिले उत्तरों को रट रहा है।

निचोड़ (The Bottom Line)

PARHAF मेडिकल AI के लिए एक गोपनीयता-सुरक्षित खेल का मैदान (privacy-safe playground) है। यह "मुर्गी और अंडे" वाली समस्या को हल करता है: हमें बेहतर AI बनाने के लिए डेटा की आवश्यकता है, लेकिन हम वास्तविक डेटा साझा नहीं कर सकते। उच्च गुणवत्ता वाली, यथार्थवादी, लेकिन पूरी तरह से काल्पनिक मेडिकल कहानियों की एक विशाल लाइब्रेरी बनाकर, टीम ने शोधकर्ताओं को भविष्य के स्मार्ट, सुरक्षित और अधिक सहायक मेडिकल टूल बनाने के लिए ईंधन दे दिया है।

संक्षेप में: उन्होंने रोबोटों को डॉक्टर बनने के लिए सिखाने हेतु एक नकली अस्पताल बनाया, बिना किसी भी मरीज की गोपनीयता को खतरे में डाले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →