← नवीनतम पेपर
💻 computer science

A Benchmark and Framework for Evaluating Next Action Predictions in Spreadsheets

यह शोध पत्र स्प्रेडशीट्स में अगले-एक्शन (next-action) की भविष्यवाणी के लिए एक नवीन बेंचमार्क और ऑनलाइन मूल्यांकन ढांचा प्रस्तुत करता है, जो संपादन इतिहास (edit histories) की कमी और जटिल एक्शन स्पेस को संबोधित करने के लिए 52 मैन्युअल रूप से परिष्कृत एक्शन अनुक्रमों को क्यूरेट करता है और विभिन्न बेसलाइन मॉडलों का विश्लेषण करता है।

मूल लेखक: Tejas Agrawal, Vu Le, Sumit Gulwani, Gust Verbruggen

प्रकाशित 2026-06-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tejas Agrawal, Vu Le, Sumit Gulwani, Gust Verbruggen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल स्प्रेडशीट बना रहे हैं—जैसे कि कोई बजट या प्रोजेक्ट ट्रैकर। आप बटन क्लिक करने, नंबर टाइप करने, सेल्स को हरा रंग देने, बॉर्डर जोड़ने और बॉक्स मर्ज करने में घंटों बिताते हैं। यह उबाऊ काम है।

अब, कल्पना कीजिए कि आपका कंप्यूटर आपके काम को देख रहा है और कहता है, "मैं देख रहा हूँ कि आप इस टेबल को फॉर्मेट कर रहे हैं। मुझे अगले तीन स्टेप्स आपके लिए करने दें।" अगर यह सही है, तो आपका समय बचता है। अगर यह गलत है, तो आपको इसकी गलतियों को ठीक करना होगा, जिसमें वास्तव में अधिक समय लग सकता है।

यह पेपर इन "स्प्रेडशीट ऑटोपायलटों" का परीक्षण और तुलना करने का पहला मानकीकृत तरीका पेश करता है। इससे पहले, यह मापने का कोई अच्छा तरीका नहीं था कि एक AI स्प्रेडशीट में आपके अगले क्लिक की कितनी अच्छी तरह भविष्यवाणी कर सकता है।

यहाँ बताया गया है कि उन्होंने क्या किया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: स्प्रेडशीट के लिए कोई "इतिहास की किताबें" नहीं हैं

कोडिंग में, यदि आप किसी AI को कोड लिखना सिखाना चाहते हैं, तो आप GitHub को देख सकते हैं। आप प्रोग्रामर द्वारा किए गए हर एक बदलाव को, लाइन दर लाइन, वर्षों से देख सकते हैं। इसे "एडिट हिस्ट्री" (संपादन इतिहास) कहा जाता है।

स्प्रेडशीट्स के पास यह नहीं है। जब आप एक एक्सेल फ़ाइल सेव करते हैं, तो आप केवल अंतिम चित्र सेव करते हैं। आप उस "कहानी" को सेव नहीं करते हैं कि आप वहाँ कैसे पहुँचे। आप आसानी से नहीं देख सकते कि उपयोगकर्ता ने पहले सेल A1 टाइप किया था, या पहले पूरी रो (row) को रंग दिया था। इस इतिहास के बिना, आप AI को अगला कदम अनुमान लगाने के लिए प्रशिक्षित नहीं कर सकते।

समाधान: शोधकर्ताओं ने 52 अलग-अलग स्प्रेडशीट्स के लिए एक "नकली इतिहास" बनाया। उन्होंने यह अनुमान लगाने के लिए कि एक इंसान उन स्प्रेडशीट्स को स्टेप-दर-स्टेप कैसे बनाता, कंप्यूटर के नियमों और लार्ज लैंग्वेज मॉडल्स (LLMs) के मिश्रण का उपयोग किया। फिर, इंसानों ने इन अनुमानों की समीक्षा की ताकि यह सुनिश्चित हो सके कि वे स्वाभाविक दिखें। इसने उन्हें 12,000 विशिष्ट कार्यों (जैसे "इस सेल को बोल्ड करें," "वहाँ एक बॉर्डर जोड़ें") का एक डेटासेट दिया जो AI के परीक्षण के लिए "ट्रेनिंग व्हील्स" के रूप में काम करते हैं।

2. परीक्षण: "ऑनलाइन" गेम

अधिकांश AI परीक्षण "ऑफलाइन" होते हैं। आप AI को एक तस्वीर दिखाते हैं और पूछते हैं, "आगे क्या होगा?" यदि वह सही है, तो आप उसे एक अंक देते हैं। लेकिन यह वास्तविक जीवन को नहीं दर्शाता है। वास्तविक जीवन में, यदि AI कुछ गलत सुझाव देता है, तो आपको उसे अनडू (undo) करना पड़ता है, जो अगले स्टेप के लिए स्थिति को बदल देता है।

लेखकों ने एक "ऑनलाइन इवैल्यूएशन" फ्रेमवर्क बनाया। इसे एक वीडियो गेम की तरह समझें जहाँ AI आपका को-पायलट है:

  • AI आपके पिछले कुछ मूव्स को देखता है।
  • यह अगले कुछ मूव्स की भविष्यवाणी करता है।
  • यदि आप भविष्यवाणी को स्वीकार करते हैं: स्प्रेडशीट बदल जाती है। AI के भविष्य के अनुमानों को अब इस नए स्टेट (स्थिति) को ध्यान में रखना होगा। यदि AI ने एक छोटी सी गलती की (जैसे गलत सेल को रंग दिया), तो सिस्टम स्वचालित रूप से भविष्य की सूची में एक "अनडू" स्टेप जोड़ देता है ताकि अंतिम स्प्रेडशीट अभी भी सही दिखे।
  • यदि आप भविष्यवाणी को अस्वीकार करते हैं: आप अगला स्टेप खुद करते हैं, और AI फिर से कोशिश करता है।

यह AI के लिए बहुत कठिन है क्योंकि उसकी गलतियाँ जुड़ती जाती हैं। यदि वह स्टेप 5 में गलती करता है, तो वह स्टेप 6 को भी गलत कर सकता है क्योंकि संदर्भ (context) बदल गया है।

3. परिणाम: कौन जीता?

उन्होंने कई प्रकार के AI "सॉल्वर्स" का परीक्षण किया:

  • बड़े LLMs (जैसे GPT-5): ये स्मार्ट, सामान्य उद्देश्य वाले मॉडल हैं।
  • छोटे फाइन-ट्यून्ड मॉडल्स (SLMs): विशेष रूप से स्प्रेडशीट कार्यों पर प्रशिक्षित छोटे मॉडल।
  • पुराने ज़माने के एल्गोरिदम: सरल सांख्यिकीय मॉडल जो केवल दोहराते हुए पैटर्न को देखते हैं (जैसे "हर बार जब मैं हेडर को बोल्ड करता हूँ, तो मैं एक बॉर्डर भी जोड़ता हूँ")।

मुख्य निष्कर्ष:

  • यह सीखने योग्य है: यह कार्य कोई जादू नहीं है; यह सीखने योग्य है। मजबूत मॉडल उपयोगकर्ता के अधिक एक्शन बचाते हैं। सबसे अच्छे बड़े मॉडल (रीज़निंग के साथ GPT-5) ने उपयोगकर्ता के लगभग 33% क्लिक बचाए।
  • छोटा भी बड़ा हो सकता है: एक छोटा, विशिष्ट मॉडल (360 मिलियन पैरामीटर्स) बड़े GPT-5 मॉडल के लगभग बराबर प्रदर्शन करता है (क्लिक्स को 27% बचाना)। यह बहुत बड़ी बात है क्योंकि छोटे मॉडल चलाने में सस्ते और तेज़ होते हैं।
  • सटीकता मायने रखती है: यदि AI बहुत अधिक उत्सुक है और ऐसी चीज़ें सुझाता है जिनके बारे में वह आश्वस्त नहीं है, तो यह वास्तव में उत्पादकता को नुकसान पहुँचाता है। एक परीक्षण जहाँ AI ने हर सुझाव को स्वीकार कर लिया, उसमें नेगेटिव सेविंग्स (Negative Savings) देखी गईं (इसने उपयोगकर्ता से अधिक काम करवाया)। AI को यह जानने की ज़रूरत है कि कब चुप रहना है।
  • संदर्भ (Context) ही राजा है: जैसे-जैसे आप काम करते हैं, AI बेहतर होता जाता है। स्प्रेडशीट की शुरुआत में, वह अंधेरे में अनुमान लगा रहा होता है। अंत तक, जब वह पैटर्न देखता है (जैसे "ओह, यह एक टेबल हेडर है"), तो वह बहुत सटीक हो जाता है।

4. यह क्यों महत्वपूर्ण है

यह पेपर अगली पीढ़ी के स्प्रेडशीट टूल्स के लिए "स्पीड बम्प" और "मापने वाले टेप" (measuring tape) प्रदान करता है। यह सिद्ध करता है कि:

  1. हम इन सिस्टमों को प्रशिक्षित करने के लिए यथार्थवादी डेटा बना सकते हैं।
  2. हम उन्हें इस तरह से टेस्ट कर सकते हैं जो वास्तविक मानवीय हताशा (गलतियों को अनडू करना) की नकल करता है।
  3. अच्छे परिणाम प्राप्त करने के लिए हमें हमेशा सबसे बड़े, सबसे महंगे AI की आवश्यकता नहीं होती; छोटे, विशिष्ट मॉडल भी बहुत प्रभावी हो सकते हैं।

संक्षेप में, यह पेपर उस भविष्य के लिए खेल का मैदान और नियम पुस्तिका बनाता है जहाँ आपका स्प्रेडशीट सॉफ्टवेयर आपकी ज़रूरतों को पहले से भांप लेगा, जिससे आप अपने काम को तेज़ी से पूरा कर सकेंगे बिना आपके काम में बाधा डाले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →