Researchers waste 80% of LLM annotation costs by classifying one text at a time
यह अध्ययन प्रदर्शित करता है कि शोधकर्ता बैचिंग और वेरिएबल स्टैकिंग के माध्यम से एलएलएम (LLM) एनोटेशन लागत को 80% से अधिक कम कर सकते हैं, बशर्ते कि बैच का आकार और प्रॉम्प्ट की जटिलता विशिष्ट सुरक्षित परिचालन सीमाओं के भीतर रहे जहाँ मापन त्रुटि सामान्य इंटर-कोडर असहमति से कम रहती है, जिससे कोडिंग सटीकता से महत्वपूर्ण समझौता नहीं होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शिक्षक हैं जिसे 100,000 छात्रों के निबंधों का एक ढेर जांचना है। आपको प्रत्येक निबंध के लिए चार चीजें जांचनी होंगी: क्या यह विषय पर है? क्या इसमें एक स्पष्ट तर्क है? क्या लहजा सकारात्मक या नकारात्मक है? मुख्य विषय क्या है?
पुराना तरीका (द "वन-बाय-वन" विधि):
वर्तमान में, अधिकांश शोधकर्ता जो यह काम करने के लिए AI का उपयोग करते हैं, वे एक बहुत ही सख्त और धीमे शिक्षक की तरह कार्य करते हैं। वे एक निबंध चुनते हैं, AI से पूछते हैं, "क्या यह विषय पर है?" AI उत्तर देता है। फिर, वे उसी निबंध को वापस रखते हैं, उसी निबंध को फिर से उठाते हैं, और AI से पूछते हैं, "क्या इसका लहजा सकारात्मक है?" AI फिर से उत्तर देता है। फिर वे प्रत्येक निबंध के लिए प्रत्येक वेरिएबल (variable) को दोहराते हैं। यह प्रक्रिया हर एक निबंध और हर एक सवाल के लिए चलती है।
शोध पत्र का तर्क है कि यह एक टैक्सी ड्राइवर को एक ब्लॉक तक गाड़ी चलाने, आपको छोड़ने, और फिर आपके बैग को उठाने के लिए वापस उसी जगह लाने के लिए भुगतान करने जैसा है, ताकि वह आपको एक ब्लॉक और आगे ले जा सके। आप बार-बार "पिकअप और ड्रॉप-ऑफ" (API कॉल) के लिए भुगतान कर रहे हैं। यदि आपके पास 100,000 निबंध और 4 प्रश्न हैं, तो आप 400,000 यात्राएं कर रहे हैं। यह अविश्वसनीय रूप से महंगा और अपव्ययी है।
नया तरीका (द "बैचिंग एंड स्टैकिंग" विधि):
शोधकर्ताओं ने पाया कि आप बहुत अधिक स्मार्ट हो सकते हैं। एक निबंध के बारे में एक प्रश्न पूछने के बजाय, आप:
- बैच (Batch): AI को एक बार में 25 निबंधों का पूरा ढेर थमा दें।
- स्टैक (Stack): AI से एक ही बार में सभी 25 निबंधों के लिए सभी 4 प्रश्नों की जांच करने को कहें।
उपमा: सुपर-स्कैनर
AI को एक किताब पढ़ने वाले व्यक्ति के रूप में नहीं, बल्कि किराने की दुकान पर एक अति-तेज बारकोड स्कैनर के रूप में सोचें।
- पुराना तरीका: आप काउंटर पर जाते हैं, एक सेब स्कैन करते हैं। फिर आप वजन की जांच करने के लिए फिर से उसी सेब को स्कैन करते हैं। फिर आप रंग की जांच करने के लिए फिर से आते हैं। आप अपनी टोकरी के हर सेब के लिए ऐसा करते हैं।
- नया तरीका: आप पूरे कार्ट को कन्वेयर बेल्ट पर रखते हैं। आप स्कैनर को बताते हैं, "इन सभी 25 वस्तुओं की कीमत, वजन और रंग अभी चेक करें।" स्कैनर पलक झपकते ही उनके माध्यम से तेजी से निकल जाता है।
उन्होंने क्या पाया?
शोधकर्ता चिंतित थे: "यदि हम AI को एक साथ बहुत अधिक काम करने के लिए कहते हैं, तो क्या वह भ्रमित हो जाएगा और गलतियां करेगा?" उन्होंने 8 अलग-अलग "मस्तिष्क" (AI मॉडल) और लगभग 4,000 वास्तविक ट्वीट्स के साथ इसका परीक्षण किया।
यहाँ परिणाम दिए गए हैं, जिन्हें सरल भाषा में अनुवादित किया गया है:
- "स्वीट स्पॉट" (बैच साइज 25–100):
आप सुरक्षित रूप से AI को एक बार में 25 से 100 आइटम दे सकते हैं। AI भ्रमित नहीं होता है। यह उतना ही सटीक रहता है जितना कि यदि आप इसे एक-एक करके पूछते।
- रूपक: यह एक ऐसे शेफ की तरह है जो एक बार में 25 प्याज को उतनी ही सटीकता से काट सकता है जैसे कि एक प्याज को। वे तब तक थकते या लापरवाह नहीं होते जब तक कि आप उन्हें 1,000 प्याज का पहाड़ न दे दें।
- "मल्टी-टास्क" जादू (स्टैकिंग वेरिएबल्स):
आप गुणवत्ता खोए बिना एक ही प्रॉम्प्ट में 10 अलग-अलग चीजों (वेरिएबल्स) की जांच करने के लिए AI से कह सकते हैं।
- रूपक: यह एक सुरक्षा गार्ड की तरह है जो आपके आईडी, आपके बैग और आपके जूतों को एक ही समय में चेक कर सकता है, बजाय इसके कि आपको तीन अलग-अलग लाइनों में खड़ा होना पड़े।
- लागत की बचत:
इस तरीके का उपयोग करके, शोधकर्ता अपनी लागत को 80% से अधिक कम कर सकते हैं।
- रूपक: यदि पुराने तरीके में एक विशाल डेटासेट का विश्लेषण करने में आपको 50 से भी कम लागत वाला है। यह एक शानदार डिनर खरीदने और मुफ्त में डेज़र्ट पाने जैसा है, या एक सिंगल मूवी टिकट खरीदने और पूरे सीजन का शो पाने जैसा है।
- केवल एक कमी:
कुछ विशिष्ट AI मॉडल (OpenAI के "रीजनिंग" वाले मॉडल) भ्रमित हो जाते थे यदि ढेर बहुत बड़ा (250 आइटम से अधिक) हो जाता था। लेकिन अधिकांश मानक मॉडलों के लिए, "स्वीट स्पॉट" बहुत बड़ा है। साथ भी, AI थोड़ा "थक" जाता है यदि प्रश्न बहुत जटिल हों, लेकिन यह इसलिए नहीं है कि प्रॉम्प्ट लंबा है—बल्कि इसलिए क्योंकि काम कठिन है।
मुख्य निष्कर्ष:
लंबे समय तक, शोधकर्ता अत्यधिक सतर्क रहे हैं, AI के साथ एक नाजुक इंसान की तरह व्यवहार करते रहे हैं जिसे हर एक कार्य के बाद ब्रेक की आवश्यकता होती है। यह पेपर सिद्ध करता है कि AI वास्तव में एक हाई-स्पीड मशीन है जो थोक में काम करना पसंद करती है।
सिर्फ यह बदलकर कि हम सवाल कैसे पूछते हैं (सवालों को एक साथ समूहबद्ध करना), हम जवाबों की गुणवत्ता से समझौता किए बिना भारी मात्रा में पैसा और समय बचा सकते हैं। इससे उत्पन्न होने वाली "त्रुटि" इतनी कम है कि यह उस असहमति से भी छोटी है जो आपको दो अलग-अलग मानव विशेषज्ञों को एक ही काम करने के लिए नियुक्त करने से प्राप्त होती।
संक्षेप में: AI को एक समय में एक काम करने के लिए कहना बंद करें। उसे काम का एक पूरा ढेर दें, और उसे कुशलतापूर्वक इसे खत्म करने दें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।