← नवीनतम पेपर
💻 computer science

Structured Extraction and Standardized Reconstruction of Machining Process Documents Based on Vision Language Model under Low Resource Constraints

यह शोध पत्र कम-संसाधन बाधाओं के तहत विषम मशीनिंग प्रक्रिया दस्तावेजों के उच्च-सटीक संरचित निष्कर्षण और मानकीकृत पुनर्निर्माण को प्राप्त करने के लिए बाधा उदाहरण सत्यापन फीडबैक और आत्मविश्वास मूल्यांकन के साथ एक विजन लैंग्वेज मॉडल-आधारित ढांचे का प्रस्ताव करता है, जो प्रभावी रूप से मतिभ्रम (hallucinations) को कम करता है और बुद्धिमान विनिर्माण में ज्ञान डिजिटलीकरण को सक्षम बनाता है।

मूल लेखक: Li-Xu Mou, Liang Guo, Zhen Yuan, Yi-Qin Xiong

प्रकाशित 2026-06-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Li-Xu Mou, Liang Guo, Zhen Yuan, Yi-Qin Xiong

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: फैक्ट्री के ज्ञान का "बिखरा हुआ अटारी" (Messy Attic)

एक ऐसी फैक्ट्री की कल्पना करें जहाँ हर बार मशीन का कोई पुर्जा बनने पर, उसके निर्देश एक कागज़ के टुकड़े पर लिखे जाते हैं। वर्षों से, ये कागज़ ढेर होते जा रहे हैं। कुछ एकदम साफ़ डिजिटल फाइलें हैं, कुछ फोन से ली गई धुंधली तस्वीरें हैं, और कुछ स्कैन की हुई प्रतियां हैं जो ऐसी दिखती हैं जैसे वे वॉशिंग मशीन में धुल कर आई हों।

समस्या यह है कि हर इंजीनियर इन निर्देशों को अलग तरह से लिखता है। कोई पुर्जे को "ड्राइंग नंबर" कहता है, दूसरा उसे "प्रोडक्ट कोड" कहता है, और तीसरा बस "ID" लिख देता है। लेआउट अस्त-व्यस्त हैं, टेबल बिखरे हुए हैं, और लिखावट अक्सर पढ़ने में कठिन होती है।

चूंकि इन दस्तावेजों में कंपनी के गुप्त रहस्य शामिल हैं, इसलिए फैक्ट्री अपने डेटा को किसी सार्वजनिक AI क्लाउड पर अपलोड नहीं कर सकती। उन्हें इस "बिखरे हुए अटारी" वाले ज्ञान को स्थानीय स्तर पर व्यवस्थित करने के लिए एक तरीके की आवश्यकता है, जिसमें हजारों पहले से लेबल किए गए उदाहरणों की आवश्यकता न हो (क्योंकि उनके पास ऐसे उदाहरण नहीं हैं क्योंकि डेटा गुप्त है)।

समाधान: एक स्मार्ट, स्वयं-जांच करने वाला रोबोट सहायक

लेखक एक विज़न लैंग्वेज मॉडल (VLM) का उपयोग करके एक नई विधि का प्रस्ताव देते हैं। इस VLM को केवल एक साधारण स्कैनर के रूप में नहीं, बल्कि एक अत्यधिक बुद्धिमान रोबोट सहायक के रूप में सोचें जो धुंधली तस्वीरों को "देख" सकता है और साथ ही साथ बिखरे हुए टेक्स्ट को "पढ़" भी सकता है।

हालाँकि, AI सहायकों के बारे में यह जाना जाता है कि वे "हैलुसिनेट" (Hallucinate) करते हैं—यानी वे आत्मविश्वास के साथ ऐसी बातें बना सकते हैं जो वहां मौजूद ही नहीं हैं। इसे ठीक करने के लिए, लेखकों ने अंतर्निहित सुरक्षा जांच के साथ एक तीन-चरणीय प्रणाली बनाई है।

चरण 1: "सख्त साक्षात्कारकर्ता" (स्ट्रक्चर्ड एक्सट्रैक्शन)

AI से केवल "इसे पढ़ो" कहने के बजाय, सिस्टम एक विशेष प्रॉम्प्टिंग विधि का उपयोग करता है जिसे CEVF (कन्स्ट्रेंट एग्जांपल वेरिफिकेशन फीडबैक) कहा जाता है।

  • उपमा (Analogy): कल्पना करें कि आप एक उम्मीदवार का साक्षात्कार ले रहे हैं। केवल यह पूछने के बजाय कि, "अपने अनुभव के बारे में बताएं," आप उन्हें एक सख्त फॉर्म भरने के लिए देते हैं (Constraint), उन्हें यह दिखाने के लिए एक आदर्श उदाहरण देते हैं कि इसे कैसे भरा जाए (Example), और फिर तुरंत एक नियम पुस्तिका के विरुद्ध उनके उत्तरों की जांच करते हैं (Verification)।
  • यह कैसे काम करता है:
    1. प्रतिबंध (Constraints): AI को केवल विशिष्ट फ़ील्ड (जैसे "स्टेप नंबर" या "टूल यूज्ड") आउटपुट करने के लिए मजबूर किया जाता है। वह विषय से भटक नहीं सकता।
    2. वन-शॉट उदाहरण (One-Shot Example): AI शैली की नकल करने के लिए भरे हुए फॉर्म का एक आदर्श उदाहरण देखता है।
    3. फीडबैक लूप (Feedback Loop): यदि AI कोई गलती करता है (जैसे कि ऐसा टूल नाम लिखना जो मौजूद नहीं है), तो सिस्टम उसे पकड़ लेता है, कहता है "फिर से प्रयास करें," और AI खुद को सुधारता है। यह प्रक्रिया तीन बार तक हो सकती है।
    4. कॉन्फिडेंस स्कोर (Confidence Score): सिस्टम निकाले गए प्रत्येक डेटा के लिए एक "कॉन्फिडेंस स्कोर" देता है। यदि AI अनिश्चित है (कम स्कोर), तो वह उस विशिष्ट स्थान को मानव द्वारा दोबारा जांच के लिए पीले रंग से हाइलाइट कर देता है।

परिणाम: AI ने तथ्य बनाना बंद कर दिया और बहुत सटीक हो गया, यहाँ तक कि धुंधले या बिखरे हुए दस्तावेजों के साथ भी।

चरण 2: "अनुवादक" (सिमेंटिक एलाइनमेंट)

एक बार जब AI डेटा निकाल लेता है, तो उसे अभी भी अलग-अलग नामों की समस्या का सामना करना पड़ता है। AI "ड्राइंग नं." और "पार्ट आईडी" को दो अलग-अलग चीजें मान सकता है, जबकि वे वास्तव में एक ही हैं।

  • उपमा: एक ऐसे अनुवादक की कल्पना करें जो जानता है कि अलग-अलग क्षेत्रों में "सोडा", "पॉप" और "कोक" सभी एक ही पेय का अर्थ हैं।
  • यह कैसे काम करता है: सिस्टम यह समझने के लिए कि अलग-अलग शब्दों का अर्थ एक ही है, एक "सिमेंटिक ब्रेन" (Sentence-BERT) का उपयोग करता है। यह फैक्ट्री के शब्दों के एक छोटे, आंतरिक शब्दकोश (डोमेन नॉलेज बेस) की भी जांच करता है। यदि AI अभी भी अनिश्चित है, तो वह अंतिम निर्णय के लिए एक मानव विशेषज्ञ से पूछता है, और फिर वह उस नियम को अगली बार के लिए याद रखता है।

परिणाम: सभी बिखरे हुए, अलग-अलग नाम एक मानक, साफ सूची में बदल दिए जाते हैं।

चरण 3: "आर्किटेक्ट" (स्टैंडर्डाइज्ड रिकंस्ट्रक्शन)

अब जब डेटा साफ हो गया है, तो सिस्टम को इसे एक आदर्श, पेशेवर दिखने वाले दस्तावेज़ में वापस रखने की आवश्यकता है।

  • उपमा: कल्पना करें कि आपके पास ढीली ईंटों का ढेर (डेटा) है। आप एक आदर्श घर (मानक दस्तावेज़) बनाना चाहते हैं। सिस्टम एक आर्किटेक्ट के रूप में कार्य करता है जिसे पता है कि हर ईंट कहाँ जाएगी, भले ही ईंटों का ढेर बहुत बड़ा हो या घर सामान्य से अधिक ऊंचा होने वाला हो।
  • यह कैसे काम करता है: सिस्टम साफ डेटा लेता है और उसे एक पूर्व-अनुमोदित टेम्पलेट में फिट करता है। यदि स्टेप्स की सूची टेम्पलेट से लंबी है, तो सिस्टम स्वचालित रूप से टेबल में और पंक्तियाँ जोड़ देता है, ठीक वैसे ही जैसे एक स्मार्ट स्प्रेडशीट करती है। यह पुर्जों की तस्वीरों को भी सही जगह पर पेस्ट करना जानता है, और उन्हें पूरी तरह से फिट होने के लिए रीसाइज भी करता है।

परिणाम: फैक्ट्री को एक नया, पूरी तरह से फॉर्मेट किया गया, पेशेवर दस्तावेज़ मिलता है जो ऐसा दिखता है जैसे इसे किसी शीर्ष डिजाइनर द्वारा बनाया गया हो, और जो फैक्ट्री फ्लोर पर उपयोग के लिए तैयार है।

यह क्यों महत्वपूर्ण है ("लो रिसोर्स" का जादू)

आमतौर पर, AI को यह सिखाने के लिए, आपको हजारों उदाहरणों की आवश्यकता होती है जहाँ मनुष्यों ने पहले से ही हर एक शब्द को हाइलाइट किया हो। लेकिन चूंकि ये फैक्ट्री दस्तावेज़ गुप्त हैं, इसलिए लेखक ऐसा नहीं कर सके।

  • नवाचार (Innovation): यह विधि बहुत कम उदाहरणों (लो रिसोर्स) के साथ काम करती है। इसे विशाल डेटासेट पर "री-ट्रेन" करने की आवश्यकता नहीं है। यह ऑन-द-फ्लाई सीखने के लिए स्मार्ट प्रॉम्प्टिंग और वेरिफिकेशन नियमों का उपयोग करता है।
  • सुरक्षा जाल (Safety Net): चूंकि डेटा गुप्त है, इसलिए पूरी प्रक्रिया स्थानीय स्तर पर होती है। "ह्यूमन-इन-द-लूप" फीचर यह सुनिश्चित करता है कि यदि AI भ्रमित है, तो एक मानव हस्तक्षेप करे, लेकिन केवल कठिन हिस्सों के लिए, जिससे प्रक्रिया तेज़ बनी रहती है।

परिणामों का सारांश

लेखकों ने वास्तविक फैक्ट्री दस्तावेजों पर इसका परीक्षण किया, जिसमें धुंधली तस्वीरें और बहु-पृष्ठ टेबल शामिल थे।

  • सटीकता (Accuracy): उन्हें लगभग 89% बार सही जानकारी मिली।
  • गलतियाँ: उन्होंने "चीजें बनाने" (हैलुसिनेशन) की दर को घटाकर केवल 6.5% कर दिया।
  • गति (Speed): इसने जटिल दस्तावेजों को लगभग एक मिनट में प्रोसेस किया, जो इसे मैन्युअल रूप से करने की तुलना में बहुत तेज़ बनाता है।

संक्षेप में, यह पेपर एक स्मार्ट, स्वयं-जांच करने वाले रोबोट को प्रस्तुत करता है जो फैक्ट्री के बिखरे हुए, गुप्त निर्देश मैनुअल को बिना किसी बड़े प्री-लेबल वाले डेटा लाइब्रेरी की आवश्यकता के, साफ, मानक डिजिटल फाइलों में व्यवस्थित कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →