← नवीनतम पेपर
💻 computer science

Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System

यह शोधपत्र TorchSight को प्रस्तुत करता है, जो एक ओपन-सोर्स स्थानीय प्रणाली है, जिसमें 78,000 से अधिक नमूनों पर प्रशिक्षित एक फाइन-ट्यून्ड Qwen 3.5 27B मॉडल का उपयोग किया गया है, जो डेटा को स्थानीय नियंत्रण में रखते हुए सुरक्षा दस्तावेज़ वर्गीकरण में वाणिज्यिक क्लाउड-आधारित विकल्पों की तुलना में काफी अधिक सटीकता (95.0%) प्राप्त करता है।

मूल लेखक: Ivan Dobrovolskyi

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ivan Dobrovolskyi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर का स्पष्टीकरण दिया गया है।

बड़ी समस्या: "क्लाउड" बनाम "सेफ रूम" (सुरक्षित कमरा)

कल्पना कीजिए कि आप किसी बैंक या अस्पताल में काम करते हैं। आपके पास हज़ारों दस्तावेज़ हैं, और आपको उन दस्तावेज़ों को ढूँढना है जिनमें गुप्त पासवर्ड, क्रेडिट कार्ड नंबर या वर्गीकृत सैन्य योजनाएँ शामिल हैं।

वर्तमान में, कंपनियों के पास इसे करने के दो मुख्य तरीके हैं:

  1. "रूल बुक" (नियम पुस्तिका) तरीका: वे एक कंप्यूटर प्रोग्राम का उपयोग करते हैं जो विशिष्ट पैटर्न की तलाश करता है, जैसे कि अंकों की एक ऐसी स्ट्रिंग जो क्रेडिट कार्ड जैसी दिखती हो। यह तेज़ है, लेकिन यह "बेवकूफ" है। यदि आप किसी ट्यूटोरियल में एक नकली क्रेडिट कार्ड नंबर के बारे में कहानी लिखते हैं, तो प्रोग्राम "अलर्ट!" चिल्लाने लगता है, भले ही वह सुरक्षित हो। यह उन चीज़ों को मिस कर देता है जो पैटर्न की तरह नहीं दिखतीं लेकिन फिर भी खतरनाक हो सकती हैं।
  2. "क्लाउड" तरीका: वे अपने सभी दस्तावेज़ क्लाउड में मौजूद एक विशाल, स्मार्ट AI (जैसे किसी बड़ी टेक कंपनी के सुपर-इंटेलिजेंट असिस्टेंट) को भेज देते हैं ताकि वह उन्हें पढ़ सके। यह AI बहुत स्मार्ट है और संदर्भ (context) को समझता है। लेकिन, इसका उपयोग करने के लिए, आपको अपने गुप्त दस्तावेज़ अपनी इमारत से बाहर किसी और की इमारत में डाक द्वारा भेजने होंगे। एक बैंक या सेना के लिए, यह एक बहुत बड़ा जोखिम है। वे अपने रहस्यों को इमारत से बाहर नहीं जाने दे सकते।

पेपर का समाधान: लेखक ने TorchSight नामक एक सिस्टम बनाया है। यह आपकी इमारत के अंदर रहने वाले एक सुपर-स्मार्ट सुरक्षा गार्ड को काम पर रखने जैसा है। यह गार्ड संदर्भ समझने के लिए पर्याप्त स्मार्ट है (रूल बुक के विपरीत) लेकिन यह कभी भी इमारत से बाहर नहीं जाता (क्लाउड सर्विस के विपरीत)।

"गार्ड" (AI मॉडल)

लेखक ने एक बहुत बड़े, प्री-ट्रेंड AI दिमाग (जिसे Qwen 3.5 कहा जाता है) को लिया और उसे एक विशेष "ट्रेनिंग कैंप" दिया।

  • प्रशिक्षण (Training): उन्होंने इसे केवल रैंडम दस्तावेज़ नहीं दिखाए। उन्होंने इसे 78,358 उदाहरणों के साथ प्रशिक्षित किया। कुछ असली लीक थे, कुछ दूसरे AI द्वारा बनाए गए नकली उदाहरण थे, और कुछ पेचीदा "जाल" (दस्तावेज़ जो खतरनाक दिखते हैं लेकिन वास्तव में सुरक्षित हैं, या इसके विपरीत) थे।
  • परिणाम: इससे AI का एक विशेष संस्करण बना जिसे Beam कहा गया। इसने असली रहस्य और एक हानिरहित उदाहरण के बीच अंतर करना सीख लिया, जिसे पहचानने में "रूल बुक" और यहाँ तक कि "क्लाउड" AI भी संघर्ष करते थे।

बड़ा टेस्ट: सबसे अच्छा गार्ड कौन है?

लेखक ने नए Beam गार्ड को सबसे अच्छे "क्लाउड" गार्ड्स (जैसे GPT-5, Claude, और Gemini) और पुराने "रूल बुक" गार्ड्स के खिलाफ खड़ा किया। उन्होंने उन सभी को सॉर्ट करने के लिए समान 1,000 दस्तावेज़ दिए।

परिणाम:

  • क्लाउड गार्ड्स: वे लगभग 75% से 80% सही थे। वे ठीक थे, लेकिन उनसे बहुत गलतियाँ हुईं।
  • रूल बुक: यह केवल लगभग 53% सही था। यह बहुत आसानी से भ्रमित हो जाता था।
  • बीम गार्ड (लोकल): इसने 95% सही स्कोर किया।

"फॉल्स अलार्म" (गलत चेतावनी) की समस्या:
एक सुरक्षा प्रणाली का सबसे महत्वपूर्ण हिस्सा केवल बुरे लोगों को पकड़ना नहीं है, बल्कि तब "आग लगी है!" चिल्लाना भी नहीं है जब कोई सिर्फ एक मोमबत्ती पकड़े हुए हो।

  • जब क्लाउड गार्ड्स ने सुरक्षित दस्तावेज़ों (जैसे खाना पकाने की रेसिपी या सार्वजनिक समाचार लेख) को देखा, तो वे अक्सर घबरा गए। उन्होंने 22% से 63% सुरक्षित दस्तावेज़ों को खतरनाक समझा। इससे एक सुरक्षा टीम पागल हो जाएगी क्योंकि उन्हें हर एक सुरक्षित फ़ाइल की जाँच करनी पड़ेगी।
  • Beam केवल 2% सुरक्षित दस्तावेज़ों पर घबराया। वह अन्य लोगों की तुलना में वास्तविक खतरे और हानिरहित फ़ाइल के बीच के अंतर को बहुत बेहतर तरीके से समझता था।

Beam इतना अच्छा क्यों था?

पेपर बताता है कि इसका सीक्रेट सॉस केवल AI का आकार नहीं था, बल्कि यह कैसे सिखाया गया था

  • लेखक ने 51 अलग-अलग प्रकार के रहस्यों (जैसे "मेडिकल रिकॉर्ड," "सैन्य योजनाएं," "पासवर्ड") के साथ एक विशिष्ट "नियम सेट" (टैक्सोनॉमी) बनाया।
  • क्लाउड AI को "रहस्य खोजो" कहा गया था, लेकिन उन्होंने अपने स्वयं के वर्ग बना लिए या वे भ्रमित हो गए।
  • Beam को कड़ाई से इन 51 श्रेणियों का पालन करने के लिए फाइन-ट्यून किया गया था। इसने सुरक्षा टीम की भाषा बोलने में महारत हासिल की। यह एक कुत्ते को "अच्छे बनो" कहने के बजाय उसे "बैठो, रुको और विशिष्ट चीजें लाओ" सिखाने जैसा था।

"बाहरी दुनिया" का टेस्ट

यह सुनिश्चित करने के लिए कि Beam केवल अभ्यास टेस्ट को याद नहीं कर रहा था, लेखक ने इसे 500 पूरी तरह से अलग दस्तावेज़ों पर टेस्ट किया जिन्हें इसने पहले कभी नहीं देखा था (जैसे सार्वजनिक डेटाबेस से वास्तविक फिशिंग ईमेल और मेडिकल रिकॉर्ड)।

  • Beam ने अभी भी 93.8% स्कोर किया।
  • क्लाउड AI का स्कोर काफी गिर गया, कुछ का स्कोर 65% तक नीचे चला गया।
  • यह साबित करता है कि Beam ने वास्तव में सुरक्षा की अवधारणा को सीखा, न कि केवल अभ्यास टेस्ट के विशिष्ट उत्तरों को।

निचोड़ (Bottom Line)

यह पेपर दिखाता है कि आपको एक स्मार्ट AI प्राप्त करने के लिए अपने रहस्यों को क्लाउड पर भेजने की आवश्यकता नहीं है। एक विशाल, सावधानीपूर्वक क्यूरेट किए गए डेटासेट पर एक स्थानीय AI को प्रशिक्षित करके, आप एक ऐसा सिस्टम प्राप्त कर सकते हैं जो है:

  1. अधिक सटीक: यह अधिक वास्तविक खतरों को ढूंढता है।
  2. कम परेशान करने वाला: यह सुरक्षित फ़ाइलों पर बहुत कम गलत चेतावनियाँ देता है।
  3. निजी (प्राइवेट): दस्तावेज़ आपके कंप्यूटर को कभी नहीं छोड़ते।

लेखक ने पूरा सिस्टम (कोड, ट्रेनिंग डेटा और AI मॉडल) मुफ्त में जारी कर दिया है ताकि कोई भी अपना खुद का "सेफ रूम" सुरक्षा गार्ड बना सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →