← नवीनतम पेपर
🤖 machine learning

pico-type: A 1.5M-Parameter Byte-Level Multi-Head Content Classifier

यह शोध पत्र pico-type को प्रस्तुत करता है, जो एक हल्का 1.5M-पैरामीटर वाला बाइट-लेवल मल्टी-हेड क्लासिफायर है जो टोकनाइज़ेशन के बिना 10ms से कम समय में कच्चे UTF-8 बाइट्स से सात सामग्री गुणों (भाषा, MIME प्रकार और जोखिम ध्वज सहित) की एक साथ भविष्यवाणी करता है, और वास्तविक दुनिया के डेटासेट पर सिंथेटिक बेसलाइन की तुलना में महत्वपूर्ण सटीकता सुधार प्राप्त करता है।

मूल लेखक: Gautam Kishore

प्रकाशित 2026-08-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gautam Kishore

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कंप्यूटर लगातार सूचनाओं की धाराओं से घिरे रहते हैं, आपके कीबोर्ड पर टाइप किए गए टेक्स्ट से लेकर सॉफ्टवेयर चलाने वाले जटिल कोड और आपकी तस्वीरों को स्टोर करने वाली बाइनरी फाइलों तक। किसी मशीन के लिए इस बाढ़ को समझने के लिए, उसे पहले यह जानने की आवश्यकता है कि वह क्या देख रही है। क्या यह गद्य का एक अंश है, एक प्रोग्रामिंग स्क्रिप्ट है, एक गुप्त पासवर्ड है, या एक संकुचित (compressed) आर्काइव है? अतीत में, कंप्यूटर इन सवालों के जवाब देने के लिए कठोर, हाथ से लिखे गए नियमों पर निर्भर थे, जो फ़ाइल एक्सटेंशन या ज्ञात हेडर जैसे विशिष्ट पैटर्न की जाँच करते थे। हालाँकि ये तेज़ थे, लेकिन ये नियम-आधारित सिस्टम नाजुक थे; वे कुछ नया या अव्यवस्थित सामने आने पर विफल हो जाते थे। हाल ही में, विशाल आर्टिफिशियल इंटेलिजेंस मॉडलों ने दिखाया है कि वे बड़ी लचीलापन के साथ सामग्री को समझ सकते हैं, लेकिन वे अक्सर इतने बड़े और कंप्यूटिंग पावर के भूखे होते हैं कि वे सब कुछ धीमा किए बिना एक मानक लैपटॉप या फोन पर नहीं चल सकते। इंजीनियरों के लिए चुनौती एक बीच का रास्ता खोजने की रही है: एक ऐसा सिस्टम जो बहुत सारी विभिन्न प्रकार की सामग्री को तुरंत पहचानने के लिए पर्याप्त स्मार्ट हो, फिर भी इतना छोटा और कुशल हो कि रोजमर्रा के उपकरणों के बैकग्राउंड में शांति से चल सके।

एक शोधकर्ता ने 'पिको-टाइप' (pico-type) नामक एक नए टूल के साथ इस चुनौती का समाधान किया है। यह एक विशेष कंप्यूटर प्रोग्राम है जिसे एक सार्वभौमिक सामग्री क्लासिफायर (universal content classifier) के रूप में कार्य करने के लिए डिज़ाइन किया गया है। टेक्स्ट को शब्दों या उप-इकाइयों में तोड़ने के बजाय, पिको-टाइप सीधे बाइट्स की कच्ची धारा (raw stream of bytes) को देखता है—जो किसी भी फ़ाइल को बनाने वाले मौलिक डिजिटल निर्माण खंड हैं। यह इस कच्चे डेटा को एक ही, त्वरित पास में प्रोसेस करता है, और साथ ही सामग्री के बारे में सात अलग-अलग सवालों के जवाब देता है। यह फ़ाइल की व्यापक श्रेणी निर्धारित करता है, जैसे कि क्या यह टेक्स्ट, कोड या इमेज है। यह विशिष्ट प्रारूप की पहचान करता है, जैसे कि कोई टेक्स्ट फ़ाइल JSON या HTML में लिखी गई है या नहीं। यह कोड स्निपेट की प्रोग्रामिंग भाषा, पैराग्राफ की मानवीय भाषा, विशिष्ट फ़ाइल प्रकार को पहचानता है, और यहाँ तक कि उजागर पासवर्ड या निजी कुंजियों (private keys) जैसे संभावित सुरक्षा जोखिमों को भी स्कैन करता है।

नवाचार इस बात में निहित है कि शोधकर्ता ने इस सिस्टम को कैसे बनाया। उन्होंने लगभग 1.5 मिलियन पैरामीटर्स वाला एक मॉडल बनाया, जो इसकी जटिलता का एक माप है, जो बड़े लैंग्वेज मॉडल्स में पाए जाने वाले अरबों की तुलना में उल्लेखनीय रूप से छोटा है। इसे प्राप्त करने के लिए, उन्होंने प्री-ट्रेंड लाइब्रेरी या डिक्शनरी का उपयोग करने से परहेज किया जो एक मॉडल को विशिष्ट भाषाओं या प्रारूपों तक सीमित करती हैं। इसके बजाय, मॉडल कच्चे डेटा में पैटर्न को देखते हुए शून्य से सीखता है। यह परतों की एक श्रृंखला का उपयोग करता है जो पहले बाइट स्ट्रीम में छोटे, स्थानीय पैटर्न को स्कैन करती है, ठीक वैसे ही जैसे एक इंसान शब्द का अनुमान लगाने के लिए कुछ अक्षरों पर नज़र डाल सकता है। इसके बाद यह लंबे अनुक्रमों (sequences) को समझने के लिए अपना दृश्य विस्तृत करता है और अंततः उस पूरी जानकारी को एक सारांश में सिकोड़ देता है जो सात अलग-अलग निर्णय लेने वाले 'हेड्स' (heads) को फीड करता है। यह डिज़ाइन इस बात की अनुमति देता है कि मॉडल को चार अलग-अलग आकारों में विभाजित किया जा सके, जो बहुत सीमित उपकरणों के लिए एक बहुत छोटे संस्करण से लेकर सामान्य उपयोग के लिए एक अधिक मजबूत संस्करण तक विस्तृत है, और ये सभी एक ही प्रशिक्षण प्रक्रिया से व्युत्पन्न हैं।

शोधकर्ता ने इस सिस्टम का परीक्षण वास्तविक दुनिया के विविध डेटा पर किया। उन्होंने इसमें सार्वजनिक रिपॉजिटरी से हजारों वास्तविक कोड नमूने और तीस अलग-अलग भाषाओं में विकिपीडिया के हजारों लेख डाले। परिणामों ने दिखाया कि मॉडल अपने काम में अत्यधिक प्रभावी है। मानवीय भाषा की पहचान करने के मामले में, इसने 98.2 प्रतिशत की सटीकता हासिल की, जिससे अंग्रेजी, चीनी और अरबी जैसी भाषाओं के बीच लगभग हर बार सही अंतर किया गया। प्रोग्रामिंग भाषाओं के लिए, इसने चौबीस अलग-अलग भाषाओं में 60.3 प्रतिशत मामलों में भाषा को सही ढंग से पहचाना, जो केवल कृत्रिम, बनावटी उदाहरणों पर निर्भर पिछले प्रयासों से एक महत्वपूर्ण छलांग है। उन कार्यों के लिए जो निश्चित फ़ाइल सिग्नेचर पर निर्भर करते हैं, जैसे कि PDF या JPEG को पहचानना, या टेक्स्ट में छिपी गुप्त कुंजी का पता लगाना, मॉडल ने पूर्ण सटीकता प्राप्त की। पूरी प्रक्रिया में एक मानक कंप्यूटर प्रोसेसर पर लगभग 18 मिलीसेकंड लगते हैं, जिसका अर्थ है कि यह सामग्री का विश्लेषण मानव के पलक झपकने से भी तेज़ कर सकता है।

इस उपलब्धि को जो बात विशेष रूप से उल्लेखनीय बनाती है, वह यह है कि इस मॉडल को किसकी आवश्यकता नहीं है। यह बिना ग्राफिक्स कार्ड के, बिना इंटरनेट कनेक्शन के, और बड़े AI सिस्टमों की भारी स्टोरेज आवश्यकताओं के बिना संचालित होता है। अंतिम उत्पाद लगभग 9 मेगाबाइट आकार की एक एकल फ़ाइल है, जो वेब ब्राउज़र एक्सटेंशन, डेस्कटॉप एप्लिकेशन या मोबाइल ऐप में शामिल होने के लिए पर्याप्त छोटी है। शोधकर्ता ने प्रदर्शित किया कि यह टूल निरंतर बैकग्राउंड में चल सकता है, कंप्यूटर के क्लिपबोर्ड की निगरानी कर सकता है या फ़ाइलों को उनके खोले जाने पर स्कैन कर सकता है, बिना बैटरी को खत्म किए या मशीन को धीमा किए। सरल नियम-आधारित उपकरणों की गति को आधुनिक न्यूरल नेटवर्क की अनुकूलन क्षमता के साथ जोड़कर, पिको-टाइप उन उपकरणों के लिए एक व्यावहारिक समाधान प्रदान करता है जिन्हें अपने डेटा को तुरंत और कुशलता से समझने की आवश्यकता होती है। यह कार्य सुझाव देता है कि अत्यधिक सक्षम सामग्री विश्लेषण के लिए विशाल, संसाधन-गहन मॉडलों की आवश्यकता नहीं होती है, बल्कि इसे सावधानीपूर्वक डिज़ाइन के माध्यम से प्राप्त किया जा सकता है जो रोजमर्रा के हार्डवेयर की सीमाओं का सम्मान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →