Designing large language model prompts to extract scores from messy text: A shared dataset and challenge
यह शोध पत्र 1,446 अव्यवस्थित अनुसंधान ग्रंथों के एक साझा डेटासेट को यूके (UK) गुणवत्ता स्कोर के साथ और एक संबंधित चुनौती को प्रस्तुत करता है, जिसका उद्देश्य सटीक स्कोर निकालने या लुप्त मानों की पहचान करने के लिए इष्टतम लार्ज लैंग्वेज मॉडल (LLM) प्रॉम्प्ट्स को डिजाइन करना है, ताकि 72.6% सटीकता के प्रारंभिक बेसलाइन से आगे बढ़कर जटिल संख्यात्मक कार्यों के लिए प्रॉम्प्ट इंजीनियरिंग की समझ को उन्नत किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप पत्रों के एक विशाल ढेर को व्यवस्थित करने की कोशिश कर रहे हैं एक लाइब्रेरियन (पुस्तकालयाध्यक्ष) हैं। प्रत्येक पत्र एक अलग रोबोट (एक AI) द्वारा लिखा गया था ताकि यह बताया जा सके कि एक शोध लेख कितना अच्छा है। रोबोट्स को एक सरल रेटिंग देनी थी, जैसे 1 से 4 तक का स्टार स्कोर।
हालाँकि, रोबोट बहुत ही अव्यवस्थित लेखक हैं। कुछ पत्र स्कोर से शुरू होते हैं, कुछ स्कोर को पैराग्राफ के बीच में छिपा देते हैं, कुछ तीन अलग-अलग स्कोर देते हैं और उन्हें जोड़ना भूल जाते हैं, और कुछ तो बिना कोई स्कोर दिए बस बड़बड़ाते रहते हैं। इससे भी बुरा यह है कि कुछ रोबोट्स "95%" या "4/5" जैसे नकली स्कोर भी बना लेते हैं, जबकि नियमों के अनुसार केवल 1 से 4 स्टार ही मान्य हैं।
समस्या
माइक थेलवॉल (Mike Thelwall), जो इस पेपर के लेखक हैं, ने ऐसे 1,446 अव्यवस्थित पत्र एकत्र किए हैं। वे इसे एक "साझा डेटासेट" (shared dataset) कहते हैं। उनका लक्ष्य अन्य शोधकर्ताओं को एक बेहतर "जादुई निर्देश पुस्तिका" (जिसे प्रॉम्ट कहा जाता है) बनाने की चुनौती देना है, जो एक नए, अधिक स्मार्ट रोबोट के लिए हो।
इस नए रोबोट का काम इन अव्यवस्थित पत्रों को पढ़ना और सही संख्या निकालना है। लेकिन इसे दो सख्त नियमों का पालन करना होगा:
- एक जासूस बनें: इसे सही स्कोर का पता लगाना चाहिए, भले ही पत्र भ्रमित करने वाला हो। यदि पत्र में "मौलिकता" (Originality), "महत्व" (Significance) और "कठोरता" (Rigour) का अलग-अलग उल्लेख किया गया है, तो रोबोट को यह जानना होगा कि उन्हें औसत निकालना है। यदि पत्र में कोई स्कोर नहीं है, तो इसे "-1" कहना चाहिए (जिसका अर्थ है "मुझे नहीं पता")।
- एक रोबोट बनें, बातूनी नहीं: रोबोट को केवल वही संख्या उगलन लेनी चाहिए (जैसे "3*" या "-1")। वह यह नहीं कह सकता कि, "मुझे लगता है कि स्कोर 3 है क्योंकि..." यदि वह कोई अतिरिक्त शब्द जोड़ता है, तो उत्तर गलत है।
चुनौती
इसे "साइमन सेज़" (Simon Says) के खेल की तरह समझें जो एक बहुत ही शाब्दिक लेकिन थोड़े भ्रमित रोबोट के साथ खेला जा रहा है।
- वर्तमान स्कोर: लेखक ने एक सरल निर्देश पुस्तिका का प्रयास किया, और रोबोट लगभग 73% बार सही रहा।
- लक्ष्य: चुनौती यह है कि कोई भी बेहतर निर्देश पुस्तिका डिज़ाइन करे जो उच्च स्कोर प्राप्त कर सके।
यह क्यों करें?
यह पेपर अभी वास्तविक छात्र निबंधों को ग्रेड करने या चिकित्सा निदान को ठीक करने के बारे में नहीं है। इसके बजाय, यह एक प्रशिक्षण अभ्यास है। यह हमें यह सीखने के लिए मजबूर करके कि कैसे निर्देश दिए जाएं ताकि शोधकर्ता यह जान सकें कि रोबमाटों से विशिष्ट नंबर निकालने के लिए निर्देश कैसे दिए जाते हैं, हम सीखते हैं:
- रोबोट्स से बात करने का तरीका ताकि वे बेहतर तरीके से सुनें (प्रॉम्ट डिज़ाइन)।
- रोबोट्स कहाँ भ्रमित होते हैं और उन निर्देशों को कैसे ठीक किया जाए।
- उन स्थितियों को कैसे संभालें जहाँ रोबोट अनिश्चित हो (अनुमान लगाने के बजाय "-1" कब कहना है, यह जानना)।
मुख्य बात
यह पेपर एक प्रतियोगिता का निमंत्रण है। यह कहता है, "यहाँ अव्यवस्थित रोबोट नोट्स का एक ढेर और सही उत्तरों की एक सूची है। क्या आप एकदम सही निर्देश सेट लिख सकते हैं जिससे एक रोबोट इन नोट्स को पढ़े और आपको हर बार बिल्कुल सही संख्या दे सके?" विजेता वह व्यक्ति है जो सही उत्तरों का उच्चतम प्रतिशत प्राप्त कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।