← नवीनतम पेपर
💻 bioinformatics

Characterizing homology-induced data leakage and memorization in genome-trained sequence models

यह शोध पत्र प्रकट करता है कि होमोलॉजी-प्रेरित डेटा लीकेज (homology-induced data leakage) जीनोम-प्रशिक्षित अनुक्रम मॉडलों के प्रदर्शन को व्यवस्थित रूप से बढ़ा देता है क्योंकि यह उन्हें सामान्यीकरण योग्य सिद्धांतों के बजाय रटे हुए संबंधों पर निर्भर होने के लिए मजबूर करता है, और अधिक विश्वसनीय मूल्यांकन तथा बेहतर मॉडल सामान्यीकरण क्षमता सक्षम करने के लिए होमोलॉजी-जागरूक डेटा विभाजन हेतु hashFrag टूल का प्रस्ताव करता है।

मूल लेखक: Rafi, A. M., Kiyota, B., Yachie, N., de Boer, C. G.

प्रकाशित 2026-05-25
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Rafi, A. M., Kiyota, B., Yachie, N., de Boer, C. G.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को डीएनए (DNA) की "भाषा" समझना सिखाने की कोशिश कर रहे हैं, ताकि वह केवल उसके अक्षरों (A, C, T, G) के अनुक्रम (sequence) को पढ़कर यह अनुमान लगा सके कि एक विशिष्ट जीन क्या कार्य करता है। ऐसा करने के लिए, आप कंप्यूटर को लाखों उदाहरण (प्रशिक्षण डेटा/training data) दिखाते हैं और फिर उसे उन नए उदाहरणों पर परखते हैं जिन्हें उसने पहले नहीं देखा है (परीक्षण डेटा/test data), यह देखने के लिए कि वह वास्तव में कितना स्मार्ट है।

समस्या: "कजिन" (Cousin) का जाल
यह शोध पत्र तर्क देता है कि वैज्ञानिक आमतौर पर इस डेटा को जिस तरह से विभाजित करते हैं, वह होमोलॉजी (homology) के कारण त्रुटिपूर्ण है। डीएनए की दुनिया में, "होमोलॉजी" का अर्थ है कि अनुक्रम एक-दूसरे से संबंधित हैं, जैसे किसी पारिवारिक वृक्ष में चचेरे भाई-बहन या सगे संबंधी होते हैं। वे एक सामान्य पूर्वज साझा करते हैं और दिखने में बहुत समान होते हैं।

लेखकों का कहना है कि पारंपरिक परीक्षण विधियाँ ऐसी हैं जैसे किसी छात्र को अभ्यास परीक्षा देना और फिर, अंतिम परीक्षा में, लगभग उन्हीं प्रश्नों को देना जो अभ्यास वाले थे, बस कुछ शब्द बदल दिए गए हों। क्योंकि छात्र (AI मॉडल) ने अभ्यास के उत्तर रट लिए थे, इसलिए वह अंतिम परीक्षा में उत्कृष्ट प्रदर्शन करता है। लेकिन इसका मतलब यह नहीं है कि उसने विषय के सिद्धांतों को वास्तव में सीखा है; उसने केवल विशिष्ट प्रश्नों को याद कर लिया है।

शोधकर्ताओं के दृष्टिकोण में, जब परीक्षण सेट के डीएनए अनुक्रम, प्रशिक्षण सेट के अनुक्रमों के "कजिन" होते हैं, तो मॉडल वास्तव में नियमों के आधार पर कार्य का अनुमान नहीं लगा रहा होता है; वह केवल जो उसने पहले देखा था उसे याद (recall) कर रहा होता है। यह एक "डेटा लीक" (data leak) बनाता है जहाँ मॉडल नकल करता है, जिससे वह वास्तवв में जितना स्मार्ट है उससे कहीं अधिक स्मार्ट दिखाई देता है।

मॉडल कैसा व्यवहार करता है
शोधकर्ताओं ने सिमुलेशन का उपयोग करके तीन अलग-अलग व्यवहारों को दिखाया:

  1. दूर के रिश्तेदार (Distant Relatives): जब परीक्षण डीएनए, प्रशिक्षण डीएनए से बहुत भिन्न होता है, तो मॉडल अच्छा प्रदर्शन करता है। यह अच्छी खबर है—इसका मतलब है कि मॉडल ने वास्तव में डीएनए के काम करने के सामान्य नियमों को सीख लिया है।
  2. करीबी रिश्तेदार (Close Relatives): जब परीक्षण डीएनए, प्रशिक्षण डीएनए के बहुत समान होता है, तो मॉडल बहुत अधिक अच्छा प्रदर्शन करता है। यह रटने (memorization) पर निर्भर है। यदि "कजिन" डीएनए वही काम करता है जो मूल डीएनए करता था, तो मॉडल को पूर्ण अंक मिलते हैं, लेकिन वह केवल उत्तर याद करके नकल कर रहा होता है।
  3. जाल (The Trap): खतरा तब होता है जब मॉडल रटने पर निर्भर होता है लेकिन "कजिन" डीएनए ने वास्तव में अपना कार्य बदल लिया होता है (functional divergence)। क्योंकि मॉडल केवल पुराने उत्तर को याद कर रहा है, इसलिए वह नई वास्तविकता का अनुमान लगाने में विफल रहता है, जिससे ऐसी त्रुटियां अनसुनी रह जाती हैं क्योंकि परीक्षण सेटअप बहुत आसान था।

समाधान: "HashFrag"
इसे ठीक करने के लिए, लेखकों ने hashfrag नामक एक उपकरण बनाया है। इसे एक अत्यंत व्यवस्थित लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में समझें जो तुरंत पहचान सकता है कि पुस्तकालय में कौन सी पुस्तकें एक-दूसरे की प्रतियां या थोड़े बदलाव वाली किस्में हैं।

डीएनए डेटा को बेतरतीब ढंग से मिलाने के बजाय, hashfrag इन "कजिन" अनुक्रमों को सावधानीपूर्वक समूहों में व्यवस्थित करता है। यह सुनिश्चित करता है कि यदि डीएनए अनुक्रमों के किसी विशिष्ट परिवार का उपयोग प्रशिक्षण के लिए किया जाता है, तो उसके किसी भी संबंधी को परीक्षण सेट में शामिल करने की अनुमति नहीं दी जाती है। यह मॉडल को मजबूर करता है कि वह भाषा के अंतर्निहित नियमों को समझे, न कि केवल विशिष्ट वाक्यों को रटे।

निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि यदि हम डीएनए में इन पारिवारिक संबंधों को ध्यान में नहीं रखते हैं, तो हम व्यवस्थित रूप से खुद को अपने AI मॉडलों की क्षमता के बारे में झूठ बोल रहे हैं। hashfrag जैसे उपकरणों का उपयोग करके "होमोलॉजी-जागरूक" (homology-aware) विभाजन बनाकर, हम मॉडल को नकल करने से रोक सकते हैं, यह सुनिश्चित करते हुए कि जब हम कहते हैं कि एक मॉडल विश्वसनीय है, तो वह वास्तव में विश्वसनीय है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →