← नवीनतम पेपर
💻 computer science

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models

यह शोध पत्र एक एंड-टू-एंड पाइपलाइन प्रस्तुत करता है जो पहले उनके संरचनात्मक प्रकारों को वर्गीकृत करके और फिर उच्च गुणवत्ता वाला JSON डेटा उत्पन्न करने के लिए DeepSeek R1 लार्ज लैंग्वेज मॉडल का उपयोग करके, 2,781 विषम रियल एस्टेट प्रश्नावली दस्तावेजों से संरचित संपत्ति मेटाडेटा को सफलतापूर्वक निकालता है, जिसे निरंतरता स्कोरिंग और मार्केट सेगमेंटेशन क्लस्टरिंग के माध्यम से सत्यापित किया गया था।

मूल लेखक: Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक घर खरीदने की तलाश में हैं। आप एक रियल एस्टेट वेबसाइट देखते हैं जहाँ एक अच्छी फोटो, कीमत और कितने बेडरूम हैं, यह सब लिखा है। यह "आसान डेटा" है—यह अनाज के डिब्बे पर लगे साफ, छपे हुए लेबल की तरह है।

लेकिन उस लिस्टिंग के भीतर एक बहुत ही विस्तृत, उलझा हुआ दस्तावेज़ छिपा है जिसे "प्रॉपर्टी प्रश्नावली" (property questionnaire) कहा जाता है। यह उस डिब्बे के पीछे लिखे बारीक अक्षरों की तरह है, लेकिन यह सफाई से छपा हुआ नहीं है, बल्कि इसमें टाइप किए गए फॉर्म, हाथ से लिखे नोट्स, स्कैन की गई फोटोकॉपी और अजीब चेकमार्क वाले दस्तावेज़ों का मिश्रण है। यह दस्तावेज़ असली रहस्य रखता है: क्या इसमें एस्बेस्टस है? गैस की आपूर्ति कौन करता है? क्या कोई कानूनी विवाद है?

समस्या:
वर्तमान में, कंप्यूटर इन बिखरे हुए दस्तावेज़ों को पढ़ने में बहुत खराब हैं। वे "अनाज के डिब्बे" वाले साफ डेटा को आसानी से पढ़ सकते हैं, लेकिन जब वे इन "बारीक अक्षरों" वाले PDF को पढ़ने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं। कुछ टाइप किए हुए हैं, कुछ धुंधले स्कैन हैं, और कुछ में अजीब प्रतीक हैं जो मानक रीडिंग टूल्स को बाधित करते हैं। इस कारण से, यह समृद्ध जानकारी अनदेखी रह जाती है और डिजिटल कचरे के ढेर में पड़ी रहती है।

समाधान (द "स्मार्ट पाइपलाइन"):
इस शोध के लेखकों ने इसे ठीक करने के लिए एक रोबोटिक असेंबली लाइन बनाई। उन्होंने इसे स्कॉटलैंड के एबरडीन में एक रियल एस्टेट प्लेटफॉर्म के लगभग 4,000 घर की लिस्टिंग पर परखा। यहाँ बताया गया है कि उनकी मशीन कैसे काम करती है, चरण-दर-चरण:

1. सॉर्टिंग हैट (वर्गीकरण - Classification)

सबसे पहले, रोबोट हर PDF दस्तावेज़ को देखता है और उसे तीन ढेरों में वर्गीकृत करता है:

  • "टाइपराइटर" ढेर: साफ, डिजिटल टेक्स्ट जिसे कंप्यूटर आसानी से पढ़ सकता है।
  • "फोटोकॉपी" ढेर: कागज के फॉर्म की स्कैन की गई छवियां। कंप्यूटर अभी टेक्स्ट नहीं पढ़ सकता क्योंकि यह सिर्फ एक तस्वीर है।
  • "अजीब प्रतीक" ढेर: दस्तावेज़ जिनमें चेकबॉक्स या अजीब निशान हैं जो मानक रीडर्स को भ्रमित कर देते हैं।

परिणाम: रोबोट ने दस्तावेज़ों को सफलतापूर्वक वर्गीकृत किया। उसने "टाइपराइटर" ढेर (लगभग 70%) को अगले चरण के लिए रखा और बाकी दो ढेरों को अभी के लिए अलग रख दिया।

2. सुपर-रीडर (LLM एक्सट्रैक्शन)

"टाइपराइटर" ढेर के लिए, रोबोट ने किसी उबाऊ नियम पुस्तिका का उपयोग नहीं किया (जैसे कि "यदि आप 'गैस' शब्द देखें, तो 'गैस' लिखें")। इसके बजाय, इसने एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग किया जिसे DeepSeek R1 कहा जाता है। इस AI को एक अत्यंत बुद्धिमान, अथक लाइब्रेरियन के रूप में समझें जो किसी भी भाषा या शैली को पढ़ सकता है।

शोधकर्ताओं ने AI को एक विशिष्ट निर्देश दिया: "इस बिखरे हुए दस्तावेज़ को पढ़ें, घर के बारे में 35 विशिष्ट तथ्य खोजें (जैसे हीटिंग का प्रकार या कानूनी स्थिति), और उन्हें एक साफ, व्यवस्थित सूची (JSON फॉर्मेट) में लिखें।"

जादू: भले ही विक्रेताओं ने चीजों को अलग-अलग तरीके से लिखा था (किसी ने "गैस सेंट्रल हीटिंग" कहा, किसी ने "GCH", किसी ने "मईन्स गैस" कहा), AI समझ गया कि उन सभी का अर्थ एक ही है और उसने उन्हें सुसंगत रूप से लिखा। इसने 2,781 दस्तावेज़ों के लिए 100% सफलता दर के साथ यह कार्य किया।

3. गुणवत्ता जांच (वैलिडेशन - Validation)

अब, टीम के पास घरों के तथ्यों का एक विशाल डेटाबेस था। लेकिन क्या AI अपनी मर्जी से चीजें बना रहा था? इसकी जांच करने के लिए, उन्होंने तीन परीक्षण किए:

  • "ट्विन टेस्ट" (समानता - Similarity): उन्होंने कंप्यूटर से पूछा, "इस घर के सबसे समान घर कौन से हैं?" उन्होंने उत्तर खोजने के लिए तीन अलग-अलग गणितीय विधियों का उपयोग किया। परिणाम बहुत अच्छी तरह मेल खाए (82% निरंतरता)। इससे यह साबित हुआ कि AI केवल अनुमान नहीं लगा रहा था; वह घरों के बीच वास्तविक संबंधों को समझता था।
  • "ग्रुपिंग टेस्ट" (क्लस्टरिंग - Clustering): उन्होंने कंप्यूटर से बिना यह बताए कि उसे क्या खोजना है, घरों को प्राकृतिक श्रेणियों में समूहबद्ध करने के लिए कहा। कंप्यूटर ने स्वाभाविक रूप से उन्हें "किफायती/छोटे" घरों और "प्रीमियम/बड़े" घरों में विभाजित किया। इससे पता चला कि डेटा सार्थक था और वास्तविक दुनिया के अंतरों को दर्शाता था।
  • "रैंकिंग टेस्ट" (Ranking Test): उन्होंने कंप्यूटर से विभिन्न प्राथमिकताओं (जैसे, "सबसे सस्ता" बनाम "सबसे अधिक सुविधाएं") के आधार पर घरों को रैंक करने के लिए कहा। रैंकिंग अलग और तार्किक थी, जिससे सिद्ध हुआ कि डेटा में जटिल निर्णय लेने के लिए पर्याप्त विवरण मौजूद थे।

निचोड़

यह शोध पत्र यह सिद्ध करता है कि आप एक ऐसा सिस्टम बना सकते हैं जो स्वचालित रूप से हजारों बिखरे हुए रियल एस्टेट दस्तावेजों को पढ़ सकता है और उन्हें साफ, उपयोगी डेटा में बदल सकता है।

उन्होंने अभी तक क्या नहीं किया (अभी तक):

  • उन्होंने अभी तक "फोटोकॉपी" या "अजीब प्रतीक" वाले ढेरों (लगभग 30% दस्तावेज़) को पढ़ने की कोशिश नहीं की है। उन्होंने उन्हें भविष्य के काम के लिए छोड़ दिया है।
  • उन्होंने चिकित्सा रिकॉर्ड या कानूनी अनुबंधों जैसे अन्य प्रकार के दस्तावेजों पर इसका परीक्षण नहीं किया, हालांकि उनका सुझाव है कि उनका सिस्टम वहां भी काम कर सकता है।
  • उन्होंने मानव खरीदारों से परिणामों के बारे में नहीं पूछा; उन्होंने केवल यह जांचा कि कंप्यूटर का गणित काम कर रहा है या नहीं।

संक्षेप में, उन्होंने एक ऐसी मशीन बनाई है जो कागज के रूपों के एक अराजक ढेर को एक साफ, व्यवस्थित स्प्रेडशीट में बदल सकती है, जिससे छिपे हुए घर के विवरण पहली बार दृश्यमान हो गए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →