← नवीनतम पेपर
💬 NLP

Better with Experience: Self-Evolving LLM Agents for Evidence-Grounded Health Community Notes

यह शोध पत्र EvoNote को प्रस्तुत करता है, जो एक स्व-विकसित (self-evolving) LLM एजेंट फ्रेमवर्क है जो सूक्ष्म-स्तरीय क्रेडिट असाइनमेंट (fine-grained credit assignment) वाले अनुभव स्मृति (experience memory) का लाभ उठाकर साक्ष्य-आधारित स्वास्थ्य कम्युनिटी नोट्स (health Community Notes) उत्पन्न करता है, जो एक नए मल्टीमॉडल बेंचमार्क पर मानव-लिखित नोट्स की तुलना में बेहतर उपयोगिता और काफी तेज़ उत्पादन समय प्राप्त करता है।

मूल लेखक: Zihang Fu, Fanxiao Li, Jianyang Gu, Haonan Wang, Preslav Nakov, Bryan Hooi, Min-Yen Kan, Jiaying Wu

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zihang Fu, Fanxiao Li, Jianyang Gu, Haonan Wang, Preslav Nakov, Bryan Hooi, Min-Yen Kan, Jiaying Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Better with Experience: Self-Evolving LLM Agents for Evidence-Grounded Health Community Notes" का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: "भुलक्कड़" तथ्य-जांचकर्ता (The "Amnesiac" Fact-Checker)

कल्पित कीजिए कि सोशल मीडिया पर स्वास्थ्य संबंधी गलत सूचनाओं (जैसे टीकों या चमत्कारी उपचारों के बारे में झूठे दावे) को रोकने के लिए तथ्य-जांचकर्ताओं (fact-checkers) की एक टीम काम कर रही है।

वर्तमान में, ये AI तथ्य-जांचकर्ता भुलक्कड़ इंटर्न (amnesiac interns) की तरह काम करते हैं। हर बार जब उन्हें तथ्य-जांच के लिए एक नया पोस्ट मिलता है, तो वे शून्य से शुरुआत करते हैं। वे वह नहीं याद रखते जो उन्होंने कल सीखा था।

  • परिदृश्य: एक इंटर्न "चमत्कारी कैंसर उपचार" के बारे में एक पोस्ट की जांच करता है और सीखता है कि स्रोत फर्जी है।
  • अगले दिन: एक अलग इंटर्न (या वही इंटर्न जिसका "रीसेट" हुआ मस्तिष्क है) एक समान पोस्ट देखता है जो किसी अन्य "चमत्कारी उपचार" के बारे में है। उन्हें फिर से सब कुछ शून्य से सीखना पड़ता है, जिससे वे अक्सर वही गलतियाँ दोहराते हैं या उन्हीं रेड फ्लैग्स (चेतावनी संकेतों) को पहचानने में चूक जाते हैं।

यह प्रक्रिया धीमी, अक्षम है और लोगों को लंबे समय तक गलत जानकारी के प्रति असुरक्षित छोड़ देती है।

समाधान: EVONOTE (एक "अनुभवी दिग्गज")

लेखकों ने EVONOTE नामक एक नया सिस्टम बनाया है। इसे एक इंटर्न के रूप में नहीं, बल्कि एक अनुभवी जासूस (seasoned veteran detective) के रूप में सोचें जो एक विस्तृत और व्यवस्थित केस फाइल रखता है।

काम पूरा होने के बाद सब कुछ भूल जाने के बजाय, EVONOTE हर तथ्य-जांच कार्य को एक सबक के रूप में लेता है। यह इस बात की "मेमोरी बैंक" बनाता है कि क्या काम आया और क्या नहीं, ताकि यह हर उस पोस्ट के साथ और स्मार्ट हो सके जिसे यह सुधारता है।

यह कैसे काम करता है: तीन-चरणीय लूप (The Three-Step Loop)

EVONOTE एक निरंतर लूप में काम करता है, ठीक वैसे ही जैसे एक जासूस केस सुलझाता है और अपनी हैंडबुक अपडेट करता है:

1. जांच (The Investigation - द एजेंट)
जब कोई चिह्नित पोस्ट आता है, तो EVONOTE केवल अनुमान नहीं लगाता। यह एक जासूस की तरह कार्य करता है:

  • दावे का विश्लेषण करना: "यह व्यक्ति वास्तव में क्या कह रहा है?"
  • साक्ष्य जुटाना: यह सच्चाई खोजने के लिए वेब सर्च करता है, वेबसाइटों पर जाता है और वैज्ञानिक शोध पत्रों को पढ़ता है।
  • नोट लिखना: यह सोशल मीडिया पोस्ट के लिए एक सुधार (correction) का मसौदा तैयार करता है।

2. प्रदर्शन समीक्षा (The Performance Review - द जज)
एक बार नोट लिख दिए जाने के बाद, एक "सोशल यूटिलिटी जज" (एक स्मार्ट AI मूल्यांकनकर्ता) काम की समीक्षा करता है। यह केवल यह नहीं पूछता, "क्या यह सच है?" बल्कि यह स्वास्थ्य संचार के आधार पर चार गहरे प्रश्न पूछता है:

  • समझने योग्य (Understandable): क्या यह एक आम व्यक्ति के पढ़ने के लिए आसान है?
  • सार्थक (Meaningful): क्या यह समझाता है कि उनके स्वास्थ्य के लिए यह क्यों महत्वपूर्ण है?
  • उपयोगी (Usable): क्या यह लोगों को बताता है कि आगे सुरक्षित कदम क्या उठाने चाहिए?
  • विश्वसनीय (Trustworthy): क्या यह स्वीकार करता है कि यदि विज्ञान 100% स्पष्ट नहीं है तो अनिश्चितता मौजूद है?

3. सीखा गया सबक (The Lesson Learned - द मेमोरी इवॉल्वर)
यही जादू वाला हिस्सा है। जज फीडबैक देता है, और एक "मेमोरी इवॉल्वर" उस फीडबैक को एक पुन: प्रयोज्य नियम (reusable rule) में बदल देता है।

  • उदाहरण: यदि AI ने पिछले किसी मामले में उद्धरण (quote) के संदर्भ (context) की जांच करने में चूक की थी, तो मेमोरी इवॉल्वर एक नियम बनाता है: "जब कोई पोस्ट किसी उद्धरण का उपयोग करती है, तो लिखने से पहले हमेशा पूर्ण संदर्भ की जांच करें।"
  • यह नियम मेमोरी बैंक में संग्रहीत किया जाता है। अगली बार जब ऐसा ही कोई पोस्ट आता है, तो सिस्टम स्वचालित रूप से इस नियम को निकाल लेता है और इसे लागू करता है, जिससे वही गलती दोबारा होने से बच जाती है।

परिणाम: तेज़ और बेहतर

शोधकर्ताओं ने 1,200 वास्तविक स्वास्थ्य पोस्ट (टेक्स्ट, इमेज और वीडियो) के एक डेटासेट पर EVONOTE का परीक्षण किया, जिन्हें पहले से ही मनुष्यों द्वारा तथ्य-जांच (fact-check) किया जा चुका था।

  • इंसानों को पछाड़ना: लगभग 90% मामलों में, EVONOTE द्वारा बनाए गए नोट्स को मूल मानव-लिखित नोट्स की तुलना में बेहतर रेटिंग दी गई।
  • गति: जबकि मनुष्यों को सुधार पर सहमति बनाने में औसतन 13 घंटे लगते हैं, EVONOTE 2 मिनट से भी कम समय में एक उच्च गुणवत्ता वाला मसौदा तैयार कर सकता है।
  • बेहतर साक्ष्य: EVONOTE न केवल तेजी से लिखता था; इसने बेहतर स्रोत भी खोजे। यह आधिकारिक स्वास्थ्य संगठनों (जैसे CDC) को उद्धृत करने में अधिक सक्षम था और संदिग्ध समाचार साइटों पर निर्भर रहने की संभावना कम थी।

"कैप्शन" वाली ट्रिक (The "Caption" Trick)

एक दिलचस्प खोज छवियों और वीडियो के बारे में थी। यह सिस्टम तब सबसे अच्छा काम करता है जब यह विश्लेषण करने से पहले छवियों/वीडियो को टेक्स्ट विवरण (कैप्शन) में बदल देता है।

  • उपमा: कल्पना कीजिए कि आप मोटे धुंधले चश्मे पहनकर एक पहेली (puzzle) सुलझाने की कोशिश कर रहे हैं (एक सीधा वीडियो AI)। इसमें टुकड़ों को देखना कठिन है। EVONOTE उन धुंधले चश्मों को उतार देता है, एक इंसान से तस्वीर का स्पष्ट वर्णन करवाता है, और फिर पहेली सुलझाता है। इसने सिस्टम को बहुत अधिक विश्वसनीय बना दिया।

निचोड़ (The Bottom Line)

यह शोध पत्र तर्क देता है कि स्वास्थ्य संबंधी गलत सूचनाओं से लड़ना "रीसेट और रिट्राई" (शून्य से शुरू करने) का खेल नहीं होना चाहिए। इसके बजाय, हमें ऐसे सिस्टम की आवश्यकता है जो अपने स्वयं के इतिहास से सीख सकें

हर तथ्य-जांच एपिसोड को एक पुन: प्रयोज्य सबक में बदलकर, EVONOTE एक स्व-सुधार चक्र (self-improving cycle) बनाता है। यह सुनिश्चित करता है कि अगली बार जब वैसा ही कोई झूठ सामने आता है, तो सिस्टम पहले से ही उसे पहले से अधिक तेज़ी और सटीकता से बेनकाब करने के लिए तैयार हो।

यह शोध पत्र क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह सिस्टम वर्तमान में सभी उपयोगकर्ताओं के लिए X (ट्विटर) पर तैनात है।
  • यह दावा नहीं करता कि यह पूरी तरह से मानव डॉक्टरों या तथ्य-जांचकर्ताओं की जगह लेता है; यह सुझाव देता है कि यह उनकी मदद करने के लिए एक उपकरण है।
  • यह दावा नहीं करता कि यह राजनीतिक या वित्तीय झूठ के लिए भी काम करता है; यह अध्ययन विशेष रूप से स्वास्थ्य संबंधी गलत सूचनाओं पर केंद्रित था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →