BEMEval-Doc2Schema: Benchmarking Large Language Models for Structured Data Extraction in Building Energy Modeling
यह शोध पत्र BEMEval-Doc2Schema प्रस्तुत करता है, जो कि पहला समुदाय-संचालित बेंचमार्क फ्रेमवर्क है जिसमें की-वैल्यू ओवरलैप रेट (KVOR) मेट्रिक शामिल है, ताकि स्वचालित ऊर्जा मॉडलिंग के लिए बिल्डिंग दस्तावेज़ीकरण से संरचित डेटा निकालने में लार्ज लैंग्वेज मॉडल्स के प्रदर्शन का व्यवस्थित रूप से मूल्यांकन और तुलना की जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: रोबोट्स को ब्लूप्रिंट पढ़ना सिखाना
कल्पना कीजिए कि आप एक मास्टर आर्किटेक्ट हैं। आपके पास एक घर का वर्णन करने वाले बिखरे हुए हाथ से लिखे नोट्स, पुराने PDFs और इधर-उधर बिखरे हुए एक्सेल शीट्स का ढेर है। आपका काम उस बिखराव को एक सटीक, डिजिटल 3D मॉडल में बदलना है जिसका उपयोग कंप्यूटर यह गणना करने के लिए कर सके कि वह घर कितनी ऊर्जा का उपयोग करेगा।
अभी, इंसानों को यह अनुवाद मैन्युअल रूप से करना पड़ता है। यह धीमा, उबाऊ और गलतियों से भरा होता है।
यहाँ आते हैं लार्ज लैंग्वेज मॉडल्स (LLMs) जैसे कि ChatGPT या Gemini के पीछे के "स्मार्ट दिमाग"। इस शोध पत्र के शोधकर्ताओं ने पूछा: "क्या हम इन AI दिमागों को उन बिखरे हुए नोट्स को पढ़ने और हमारे लिए स्वचालित रूप से एक आदर्श डिजिटल मॉडल बनाने के लिए सिखा सकते हैं?"
जवाब है: हाँ, वे इसे करना शुरू कर सकते हैं, लेकिन वे अभी भी पूर्ण नहीं हैं। और यह जानने के लिए कि वे कितने अच्छे हैं, लेखकों ने AI के लिए एक "ड्राइविंग टेस्ट" बनाया।
1. समस्या: "अनुवाद में खो जाने" की समस्या (Lost in Translation)
बिल्डिंग एनर्जी मॉडलिंग (BEM) एक इंजीनियर की बोली में लिखे उपन्यास को कंप्यूटर की भाषा में अनुवाद करने जैसा है।
- इनपुट: असंरचित दस्तावेज़ (PDFs, स्प्रेडशीट्स, ड्राइंग्स)।
- आउटपुट: एक सख्त, संरचित प्रारूप (जैसे एक डिजिटल फाइलिंग कैबिनेट) जिसे सिमुलेशन सॉफ़्टवेयर पढ़ सके।
वर्तमान में, इस बात को मापने का कोई मानक तरीका नहीं है कि AI इस अनुवाद को कितनी अच्छी तरह करता है। यह एक छात्र को बिना उत्तर कुंजी के परीक्षा देने जैसा है। शोधकर्ताओं ने महसूस किया कि उन्हें एक मानकीकृत "ड्राइविंग टेस्ट" की आवश्यकता है ताकि यह देखा जा सके कि क्या AI वास्तव में निर्माण की सड़क पर चलाने के लिए सुरक्षित है।
2. समाधान: "BEMEval" (AI ड्राइविंग स्कूल)
लेखकों ने BEMEval नामक एक फ्रेमवर्क बनाया। इसे एक AI के लिए ड्राइविंग स्कूल समझें।
- पहला टेस्ट (BEMEval-Doc2Schema): ड्राइविंग स्कूल के पहले टेस्ट का नाम "Doc2Schema" है। यह एक सरल कार्य है: एक बिखरे हुए दस्तावेज़ को लें और उसे एक व्यवस्थित सूची में बदल दें।
- टेस्ट ट्रैक: उन्होंने तीन प्रसिद्ध "अभ्यास कारें" (वास्तविक बिल्डिंग डेटा सेट्स) का उपयोग किया:
- L100: एक मानक, बुनियादी घर (जैसे टोयोटा कोरोला)।
- NZERTF: एक सुपर-हाई-टेक, नेट-जीरो एनर्जी घर (जैसे टेस्ला)।
- iUnit: एक छोटा, मॉड्यूलर अपार्टमेंट (जैसे एक स्मार्ट कैंपर)।
- उत्तर कुंजियाँ (Answer Keys): उन्होंने यह देखने के लिए दो अलग-अलग "नियमों की किताबें" (schemas) का उपयोग किया कि AI ने डेटा को कैसे व्यवस्थित किया:
- HPXML: एक बहुत ही विस्तृत, जटिल नियम पुस्तिका (जैसे लग्जरी कार के लिए 500 पन्नों का मैनुअल)।
- EPC: एक सरल, सपाट नियम पुस्तिका (जैसे एक त्वरित चेकलिस्ट)।
3. ग्रेडिंग सिस्टम: "KVOR" स्कोर
आप एक AI को ग्रेड कैसे देते हैं? आप केवल यह नहीं पूछ सकते, "क्या आपने इसे सही किया?" क्योंकि AI सही नंबर तो दे सकता है लेकिन उसे गलत बॉक्स में रख सकता है।
लेखकों ने KVOR (Key-Value Overlap Rate) नामक एक मीट्रिक का आविष्कार किया।
- उपमा (Analogy): "साइमन सेज़" (Simon Says) के खेल की कल्पना करें। शिक्षक (ग्राउंड ट्रुथ) कहता है, "लाल गेंद को बाएं बॉक्स में रखें।"
- यदि AI लाल गेंद को बाएं बॉक्स में रखता है, तो उसे एक अंक मिलता है।
- यदि AI लाल गेंद को दाएं बॉक्स में रखता है, या नीली गेंद को बाएं बॉक्स में रखता है, तो उसे शून्य अंक मिलते हैं।
- KVOR स्कोर बस उन गेंदों का प्रतिशत है जिन्हें AI ने सही बॉक्स में रखा है। 1.0 का स्कोर पूर्णता है; 0.0 पूरी तरह से आपदा है।
4. रेस: कौन जीता?
शोधकर्ताओं ने दो AI दिग्गजों को एक-दूसरे के खिलाफ खड़ा किया: GPT-5 (OpenAI से) और Gemini 2.5 (Google से)। उन्होंने उनका दो तरीकों से परीक्षण किया:
- Zero-Shot: "यह कार्य है। जाओ!" (बिना किसी मदद के)।
- Few-Shot: "यह कार्य है, और यहाँ तीन उदाहरण दिए गए हैं कि इसे पूरी तरह से कैसे किया जाए। अब तुम कोशिश करो।"
परिणाम:
- Gemini 2.5 जीत गया। इसने लगातार GPT-5 से बेहतर स्कोर प्राप्त किया। यह नियमों को समझने और डेटा को व्यवस्थित रखने में बेहतर था।
- "Few-Shot" का लाभ: जब AI को सीखने के लिए उदाहरण दिए गए, तो दोनों मॉडल बहुत बेहतर हो गए। यह एक छात्र को वास्तविक परीक्षा से पहले अभ्यास क्विज़ देने जैसा है।
- कठिनाई का कारक: AI को सरल "EPC" चेकलिस्ट की तुलना में जटिल "HPXML" नियम पुस्तिका के साथ अधिक संघर्ष करना पड़ा। नियम जितने जटिल होते, AI उतना ही भ्रमित होता जाता।
- "Hallucination" का जाल: कभी-कभी, AI खाली स्थान भरने के लिए टेक्स्ट में मौजूद न होने वाली संख्या का अनुमान लगा लेता है। इस परीक्षण ने इसके लिए भारी दंड दिया।
5. ट्विस्ट: AI नकल कर रहा है (एक तरह से)
शोधकर्ताओं ने कुछ मजेदार देखा। डेटा निकालने के लिए पूछे जाने पर, AI अक्सर अपने काम को करने के लिए खुद एक कंप्यूटर प्रोग्राम लिखने की कोशिश करता था, बजाय इसके कि वह केवल टेक्स्ट को पढ़े और उत्तर लिखे।
- रूपक (Metaphor): कल्पना कीजिए कि आपने एक रोबोट से कहा, "इन 100 मोजों को रंग के आधार पर छाँटो।" मोजों को उठाने और छाँटने के बजाय, रोबोट मोजे छाँटने वाली मशीन बनाने के लिए कोड लिखना शुरू कर देता है।
- हालांकि यह चतुर है, लेकिन यह दिखाता है कि AI शब्दों के अर्थ को वास्तव में समझने के बजाय एक शॉर्टकट खोजने की कोशिश कर रहा है।
6. यह क्यों महत्वपूर्ण है
यह शोध पत्र केवल एक परीक्षण के बारे में नहीं है; यह एक सामुदायिक मानक बनाने के बारे में है।
- इससे पहले, हर कोई अपने स्वयं के परीक्षण बना रहा था। अब, हमारे पास एक साझा "ड्राइविंग स्कूल" है जहाँ हम सभी देख सकते हैं कि कौन सा AI वास्तव में सड़क के लिए तैयार है।
- यह हमें बताता है कि AI सरल कार्यों में अच्छा हो रहा है, लेकिन जटिल कार्यों के लिए उसे अभी भी मदद (जैसे उदाहरण) की आवश्यकता है।
- यह यह भी सुझाव देता है कि शायद हमें अपने "नियमों की किताबों" (schemas) को सरल और अधिक "AI-अनुकूल" बनाने की आवश्यकता है ताकि रोबोट अपना काम बेहतर ढंग से कर सकें।
निष्कर्ष (The Bottom Line)
पेपर कहता है: "हमने यह मापने के लिए एक स्कोरबोर्ड बनाया है कि AI कितनी अच्छी तरह बिखरे हुए बिल्डिंग दस्तावेजों को साफ डेटा में बदल सकता है। AI बेहतर हो रहा है, विशेष रूप से जब हम इसे उदाहरण देते हैं, लेकिन यह अभी भी जटिल कार्यों पर गलतियाँ करता है। हमें यह सुनिश्चित करने के लिए परीक्षण जारी रखने की आवश्यकता है कि यह वास्तविक निर्माण परियोजनाओं में उपयोग के लिए सुरक्षित है।"
यह एक ऐसे भविष्य की ओर पहला कदम है जहाँ आप अपने घर के नक्शों का PDF अपलोड कर सकते हैं, और एक AI तुरंत आपका एनर्जी मॉडल बना देगा, जिससे इंजीनियरों के घंटों का उबाऊ काम बच जाएगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।