← नवीनतम पेपर
🧬 biology

GenomeQA: Benchmarking General Large Language Models for Genome Sequence Understanding

यह शोधपत्र GenomeQA प्रस्तुत करता है, जो कच्चे जीनोम अनुक्रमों (raw genome sequences) को समझने में सामान्य-उद्देश्य वाले लार्ज लैंग्वेज मॉडल्स की क्षमताओं का मूल्यांकन और निदान करने के लिए छह कार्य परिवारों के तहत 5,200 नमूनों वाला एक व्यापक बेंचमार्क है, जो स्थानीय संकेतों का लाभ उठाने की उनकी क्षमता को प्रकट करता है और जटिल बहु-चरणीय अनुमान (multi-step inference) में उनकी सीमाओं को उजागर करता है।

मूल लेखक: Weicai Long, Yusen Hou, Junning Feng, Houcheng Su, Shuo Yang, Donglin Xie, Yanlin Zhang

प्रकाशित 2026-04-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weicai Long, Yusen Hou, Junning Feng, Houcheng Su, Shuo Yang, Donglin Xie, Yanlin Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट, सुशिक्षित लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल या LLM) है जिसने जीव विज्ञान, चिकित्सा और आनुवंशिकी (जेनेटिक्स) की लाखों किताबें पढ़ी हैं। यह लाइब्रेरियन आपसे चैट कर सकता है, जटिल अवधारणाओं को समझा सकता है और शोध पत्रों का सटीक सारांश दे सकता है।

लेकिन यहाँ एक पेच है: क्या होगा यदि आप इस लाइब्रेरियन को अक्षरों की एक कच्ची, बिना फॉर्मेट वाली स्ट्रिंग जैसे ACGTACGT... थमा दें और उनसे केवल उन अक्षरों के आधार पर एक पहेली सुलझाने को कहें?

यही वह चीज़ है जिसकी जांच GenomeQA करता है।

समस्या: "विदेशी भाषा" का अंतर

लंबे समय से, वैज्ञानिकों ने डीएनए पढ़ने के लिए विशेष उपकरण बनाए हैं। ये उन अनुवादकों की तरह हैं जो केवल "डीएनए" बोलते हैं। लेकिन हाल ही में, हमने सामान्य एआई (जैसे वे जिनसे आप चैट करते हैं) का उपयोग विज्ञान में मदद करने के लिए करना शुरू कर दिया है।

समस्या यह है कि डीएनए अंग्रेजी, चीनी या स्पेनिश में नहीं लिखा गया है। यह केवल चार अक्षरों के कोड में लिखा जाता है: A, C, G और T

  • सामान्य एआई मानव भाषा (शब्द, व्याकरण, कहानियाँ) समझने में माहिर हैं।
  • डीएनए में मानव अर्थों में कोई "शब्द" या "व्याकरण" नहीं होता। यह एक लंबा, दोहराव वाला और पेचीदा कोड है जहाँ अर्थ अक्षरों के विशिष्ट पैटर्न पर निर्भर करता है, न कि केवल शब्दों पर।

शोधकर्ता जानना चाहते थे: यदि हम एक सामान्य एआई को एक कच्चा डीएनए अनुक्रम (sequence) दें और उससे जीव विज्ञान का प्रश्न पूछें, तो क्या वह वास्तव में कोड को समझेगा, या वह केवल अनुमान लगाएगा जो सुनने में "वैज्ञानिक" लगता है?

समाधान: GenomeQA ("डीएनए परीक्षा")

यह पता लगाने के लिए, टीम ने GenomeQA बनाया, जो एक सामान्य एआई के लिए एक मानकीकृत परीक्षण (standardized test) की तरह है, लेकिन इसमें "फ्रांस की राजधानी क्या है?" पूछने के बजाय, वे पूछते हैं जैसे:

  • "क्या यह डीएनए अनुक्रम किसी जीन को चालू करने के लिए एक स्विच के रूप में कार्य करता है?"
  • "क्या यह डीएनए मानव, बैक्टीरिया या वायरस का है?"
  • "क्या इस अनुक्रम में प्रोटीन के लिए एक विशिष्ट बाइंडिंग साइट है?"

उन्होंने छह अलग-अलग जैविक पहेलियों को कवर करने वाले 5,200 प्रश्न बनाए। उन्होंने सार्वजनिक डेटाबेस से वास्तविक डीएनए अनुक्रमों को लिया और उन्हें बहुविकल्पीय प्रश्नों में बदल दिया।

प्रयोग: "लाइब्रेरियन" का परीक्षण

उन्होंने आज के छह सबसे स्मार्ट एआई मॉडलों (जैसे GPT-5, Claude, Gemini, आदि) को लिया और उन्हें यह परीक्षा दी। उन्होंने एआई को कुछ भी नया नहीं सिखाया; उन्होंने बस उसे कच्चा डीएनए पढ़ने और उत्तर देने के लिए कहा।

यहाँ उन्हें क्या मिला:

  1. वे पूरी तरह से खोए हुए नहीं हैं, लेकिन वे विशेषज्ञ भी नहीं हैं।
    एआई ने रैंडम अनुमान लगाने (जैसे सिक्का उछालने) से बेहतर प्रदर्शन किया, लेकिन वे पूर्ण नहीं थे। वे सरल पैटर्न को पहचान सकते थे, जैसे कि यदि किसी अनुक्रम में बहुत सारे "G" और "C" अक्षर हैं (जो जीव विज्ञान में एक सामान्य संकेत है)।

  2. "सरल" बनाम "जटिल" का अंतर।

    • आसान कार्य: एआई छोटे, स्पष्ट पैटर्न (जैसे कि एक विशिष्ट 10-अक्षर वाला कोड जो "स्टॉप साइन" के रूप में कार्य करता है) को पहचानने में ठीक थे।
    • कठिन कार्य: जब प्रश्न के लिए लंबी दूरी पर बिंदुओं को जोड़ने की आवश्यकता थी (जैसे "यह अनुक्रम कोशिका केंद्रक में एक 3D लूप का हिस्सा है"), तो एआई संघर्ष करने लगे। वे इस बात के "बड़े चित्र" (big picture) को नहीं देख सके कि डीएनए कैसे मुड़ता और परस्पर क्रिया करता है।
  3. सोचना मदद करता है, लेकिन सब कुछ ठीक नहीं कर देता।
    शोधकर्ताओं ने एआई को उत्तर देने से पहले "ज़ोर से सोचने" (जिसे 'चेन-ऑफ-थॉट' कहा जाता है) की अनुमति दी। इससे उन्हें थोड़ा बेहतर स्कोर करने में मदद मिली, जैसे कि गणित चेक करने के लिए थोड़ा अधिक समय लेने वाला छात्र। लेकिन सोचने के बावजूद, वे सबसे कठिन प्रश्नों पर गलतियाँ करते रहे।

"भ्रम" (Hallucination) की समस्या

इस पेपर का सबसे दिलचस्प हिस्सा यह है कि एआई कैसे विफल हुआ। शोधकर्ताओं ने पाया कि एआई के विफल होने के चार मुख्य तरीके थे:

  • "सामान्य नियम" का जाल: एआई एक सामान्य नियम जानता था (जैसे, "दोहराव आमतौर पर बुरे होते हैं") और उसे बिना सोचे-समझे लागू कर दिया, जिससे उसके सामने मौजूद डीएनए अनुक्रम के विशिष्ट विवरणों की अनदेखी हुई।
  • "अक्षरों की गिनती" का जाल: एआई ने अक्षरों के समग्र मिश्रण को देखा (जैसे, "इसमें बहुत सारे G हैं, इसलिए यह बैक्टीरिया होना चाहिए") और कोड की वास्तविक संरचना को अनदेखा कर दिया।
  • "नकली साक्ष्य" का जाल: यह सबसे डरावना है। एआई डीएनए को देखता, एक उत्तर तय करता, और फिर अपने चुनाव को सही ठहराने के लिए एक विशिष्ट पैटर्न बना लेता जो वास्तव में वहां नहीं था। यह एक ऐसे छात्र की तरह है जो निबंध लिख रहा है और एक ऐसी किताब से उद्धरण (quote) बना रहा है जो अस्तित्व में ही नहीं है।
  • "शोर" (Noise) का जाल: जब उन्हें एक बिखरा हुआ, अर्थहीन डीएनए अनुक्रम दिया गया, तो एआई ने फिर भी एक पैटर्न खोजने की कोशिश की, और खुद को विश्वास दिला दिया कि वह यादृच्छिक शोर वास्तव में एक वास्तविक जैविक संकेत है।

निष्कर्ष

GenomeQA एक चेतावनी है। यह हमें बताता है कि जबकि सामान्य एआई जीव विज्ञान के बारे में बात करने में अद्भुत है, यह अभी तक कच्चे डीएनए को एक मानव जीवविज्ञानी या एक विशेष डीएनए कंप्यूटर की तरह पढ़ नहीं सकता है।

यह एक ऐसे बहुभाषी (जो 20 भाषाएं बोलता है) को एक ऐसी किताब देने जैसा है जो एक गुप्त कोड में लिखी गई है जिसे उसने पहले कभी नहीं देखा है। वे अक्षरों के आकार के आधार पर कुछ शब्द पहचान सकते हैं, लेकिन वे कहानी को नहीं समझ पाएंगे।

यह क्यों मायने रखता है?
यदि हम चाहते हैं कि एआई हमारे जीन को पढ़कर बीमारियों को ठीक करने या नई दवाओं को डिजाइन करने में मदद करे, तो हमें यह जानने की जरूरत है कि वह कहाँ विफल होता है। GenomeQA वैज्ञानिकों को इन विफलताओं को मापने के लिए एक पैमाना और जीनोमिक्स के भविष्य के लिए बेहतर, अधिक विश्वसनीय एआई उपकरण बनाने के लिए एक रोडमैप प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →