← नवीनतम पेपर
🤖 AI

TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models

TACIT बेंचमार्क 6 डोमेन में 10 कार्यों वाले एक प्रोग्रामेटिक विजुअल रीजनिंग मूल्यांकन ढांचे को पेश करता है, जिसमें मौजूदा भाषा-निर्भर और व्यक्तिपरक बेंचमार्क की सीमाओं को दूर करने के लिए नियत कंप्यूटर-विज़न सत्यापन और संरचनात्मक रूप से कठोर विकर्षणों (distractors) का उपयोग करते हुए दोहरी-ट्रैक जनरेटिव और डिस्क्रिमिनेटिव मूल्यांकन शामिल हैं।

मूल लेखक: Daniel Nobrega Medeiros

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniel Nobrega Medeiros

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सोचना सिखाने की कोशिश कर रहे हैं। लंबे समय से, हम रोबोटों का परीक्षण करने के लिए उनसे ऐसे प्रश्न पूछते आए हैं जैसे, "इस चित्र में आपको क्या दिख रहा है?" या "इस गणित की समस्या को हल करें।" लेकिन यहाँ एक पेंच है: रोबोट केवल शब्दों को पढ़कर और वाक्य के लहजे के आधार पर उत्तर का अनुमान लगा सकता है, बजाय इसके कि वह वास्तव में चित्र को "देख" और समझ सके। यह उस छात्र की तरह है जिसने गणित सीखे बिना ही परीक्षा के उत्तर रट लिए हों।

TACIT बेंचमार्क यह परीक्षण करने का एक नया, अधिक स्मार्ट तरीका है कि क्या कोई रोबोट (या AI) वास्तव में "देख" और तर्क कर सकता है, बिना भाषा के छल-कपट (language tricks) पर निर्भर हुए।

यहाँ इसका सरल विवरण दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है:

1. "बिना बोले" वाला नियम (भाषा की न्यूनतमता - Language Minimality)

अधिकांश परीक्षण आपको एक चित्र देते हैं और एक वाक्य देते हैं जैसे, "रास्ता खोजें।" TACIT बेंचमार्क उस वाक्य को पूरी तरह हटा देता है।

  • उपमा: "साइमन सेज़" (Simon Says) के खेल की कल्पना करें जहाँ शिक्षक कभी बोलता नहीं है। इसके बजाय, वे बस इशारा करते हैं। यदि वे चाहते हैं कि आप बाईं ओर जाएँ, तो वे एक तीर खींचते हैं। यदि वे चाहते हैं कि आप एक पहेली सुलझाएं, तो वे बस पहेली दिखाते हैं।
  • क्यों? यह AI को पढ़ना बंद करने और देखना शुरू करने के लिए मजबूर करता है। यदि यह सही उत्तर प्राप्त करता है, तो यह सिद्ध होता है कि यह दृश्य तर्क (visual logic) को समझता है, न कि केवल अंग्रेजी भाषा को।

2. दो-स्तरीय परीक्षण (जनरेटिव बनाम डिस्क्रिमिनेटिव - Generative vs. Discriminative)

यह बेंचमार्क AI का दो अलग-अलग तरीकों से परीक्षण करता है, जैसे एक शेफ का दो अलग-अलग स्थितियों में परीक्षण करना:

  • ट्रैक 1: "शून्य से बनाने" वाला परीक्षण (जनरेटिव - Generative)
    • कार्य: आप AI को एक पहेली (जैसे एक भूलभुलैया) देते हैं और कहते हैं, "समाधान का चित्र बनाओ।" AI को शून्य से एक बिल्कुल नया चित्र बनाना होगा।
    • उपमा: यह एक शेफ को सामग्री की सूची देने और उनसे एक विशिष्ट व्यंजन बनाने के लिए कहने जैसा है। यदि वे इसे नहीं बना पाते, तो वे असफल हो जाते हैं। यह परीक्षण करता है कि क्या वे वास्तव में समाधान बना सकते हैं।
  • ट्रैक 2: "बहुविकल्पीय" परीक्षण (डिस्क्रीमिनेटिव - Discriminative)
    • कार्य: आप AI को पहेली और पाँच संभावित उत्तर दिखाते हैं (एक सही, चार गलत)। AI को बस सही वाले की ओर इशारा करना होता है।
    • उपमा: यह एक बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) की तरह है। यह आसान है क्योंकि उत्तर पहले से ही वहाँ मौजूद है; AI को बस उसे पहचानना है।
  • बड़ी अंतर्दृष्टि: यदि कोई AI ट्रैक 2 में सही है लेकिन ट्रैक 1 में विफल रहता है, तो यह उस छात्र की तरह है जो एक टेस्ट में सही उत्तर तो चुन सकता है लेकिन खाली कागज पर समस्या हल नहीं कर सकता। TACIT इस अंतर को मापता है ताकि यह देखा जा सके कि AI की सोच कितनी "गहरी" है।

3. "रोबोट जज" (नियतता सत्यापन - Deterministic Verification)

आमतौर पर, जब हम AI का मूल्यांकन करते हैं, तो हम दूसरे AI (या इंसान) से पूछते हैं कि "हाँ, यह ठीक लग रहा है।" यह व्यक्तिपरक (subjective) है और गलत भी हो सकता है।

  • TACIT का तरीका: यह बेंचमार्क एक सख्त, गणितीय "रोबोट जज" का उपयोग करता है।
  • उपमा: एक भूलभुलैया की कल्पना करें। एक इंसान द्वारा ड्राइंग को देखकर यह कहने के बजाय कि "हम्म, वह रास्ता ठीक लग रहा है," रोबोट जज एक कंप्यूटर प्रोग्राम चलाता है जो पिक्सेल-दर-पिक्सेल रेखा का पता लगाता है। वह जाँच करता है: क्या आपने हरे बिंदु से शुरुआत की? क्या आप लाल बिंदु पर समाप्त हुए? क्या आप किसी दीवार से टकराए?
  • परिणाम: इसमें कोई बहस नहीं है। उत्तर या तो गणितीय रूप रूप से सही है या नहीं है। कोई मानवीय पूर्वाग्रह नहीं, कोई "LLM-as-judge" का अनुमान नहीं।

4. "लगभग-सही" के जाल (नियर-मिस डिस्ट्रैक्टर्स - Near-Miss Distractors)

बहुविकल्पीय ट्रैक में, गलत उत्तर केवल साधारण गलतियाँ नहीं हैं। वे "लगभग-सही" (near-misses) हैं।

  • उपमा: एक भूलभुलैया की कल्पना करें जहाँ सही रास्ता एक दीवार के चारों ओर जाता है। एक "नियर-मिस" गलत उत्तर बिल्कुल सही रास्ते जैसा दिखता है, सिवाय इसके कि वह एक बहुत छोटे स्थान पर दीवार के बीच से निकल जाता है।
  • क्यों? यह AI को केवल "पैटर्न" देखकर नकल करने से रोकता है। यह उसे सूक्ष्म, विशिष्ट विवरणों पर ध्यान देने के लिए मजबूर करता है। यदि AI गलत चुनता है, तो हमें पता चल जाता है कि उसने कौन सा नियम तोड़ा (जैसे, "वह दीवार के बारे में भूल गया")।

5. छह "जिम्नास्टिक" स्पर्धाएँ

यह बेंचमार्क केवल एक प्रकार की पहेली नहीं है। इसमें मस्तिष्क की विभिन्न मांसपेशियों का परीक्षण करने के लिए 6 श्रेणियों में 10 अलग-अलग कार्य हैं:

  • स्थानिक (Spatial): कई मंजिलों वाली भूलभुलैया में नेविगेट करना।
  • पैटर्न (Pattern): आकृतियों के ग्रिड को पूरा करना (जैसे रेवेन्स टेस्ट)।
  • कारण (Causal): यह अनुमान लगाना कि समय के साथ कोशिकाओं का ग्रिड कैसे बदलता है (जैसे वीडियो गेम सिमुलेशन)।
  • तार्किक (Logical): शब्दों के बजाय प्रतीकों के साथ लॉजिक ग्रिड को हल करना।
  • ग्राफ थ्योरी (Graph Theory): मानचित्रों को इस तरह रंगना कि कोई भी सटे हुए क्षेत्र एक ही रंग के न हों।
  • टोपोलॉजी (Topology): यह पता लगाना कि एक उलझी हुई गांठ को एक साधारण वृत्त में बदला जा सकता है या नहीं।

यह क्यों महत्वपूर्ण है?

TACIT बेंचमार्क को AI के लिए ड्राइविंग लाइसेंस टेस्ट की तरह समझें।

  • पुराने परीक्षण सड़क के नियमों के बारे में ड्राइवर से पूछने जैसे थे (वे केवल किताब रट सकते थे)।
  • TACIT उन्हें बिना रेडियो, बिना जीपीएस और बिना बातचीत के, वास्तविक कार में स्टीयरिंग के पीछे बैठाने जैसा है। यह उन्हें वास्तव में "ड्राइव" करने और सड़क पर नेविगेट करने के लिए मजबूर करता है।

इन 6,000 पहेलियों को मुफ्त में जारी करके, निर्माता चाहते हैं कि शोधकर्ता ऐसे AI का निर्माण करें जो केवल मानव भाषा की नकल न करे, बल्कि हमारे आसपास की दृश्य दुनिया को वास्तव में समझ सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →