← नवीनतम पेपर
💻 computer science

A11YRepair: Bridging Web Accessibility Barriers via Knowledge-Enhanced Divide-and-Conquer Repair

यह शोध पत्र A11YRepair प्रस्तुत करता है, जो एक LLM-आधारित फ्रेमवर्क है जो संबंधित मुद्दों को क्लस्टर करने और समन्वित, WCAG-अनुपालन पैच उत्पन्न करने के लिए ज्ञान-संवर्धित डिवाइड-एंड-कॉन्कर रणनीति का उपयोग करके जटिल, बहु-दोष वाली वेब एक्सेसिबिलिटी उल्लंघनों को संभालने में मौजूदा स्वचालित मरम्मत उपकरणों की सीमाओं को संबोधित करता है, एक समाधान जिसे नए A11YBench बेंचमार्क द्वारा मान्य किया गया है और प्रमुख ओपन-सोर्स परियोजनाओं में सफल एकीकरण द्वारा सिद्ध किया गया है।

मूल लेखक: Kai Huang, Ling Zhu, Jian Zhang, Xiaofei Xie, Chunyang Chen

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kai Huang, Ling Zhu, Jian Zhang, Xiaofei Xie, Chunyang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे शहर की तरह है। अधिकांश लोगों के लिए, इस शहर में घूमना आसान है। लेकिन विकलांग लोगों के लिए, अक्सर टूटे हुए फुटपाथ, गायब सड़क संकेत और ऐसे दरवाजे होते हैं जो खुलते नहीं हैं। वेब की भाषा में, इन्हें एक्सेसिबिलिटी उल्लंघन (accessibility violations) कहा जाता है।

लंबे समय तक, हमारे पास ऐसे उपकरण थे जो शहर के निरीक्षकों (city inspectors) की तरह काम करते थे। वे घूम सकते थे, टूटे हुए फुटपाथ की ओर इशारा कर सकते थे और रिपोर्ट लिख सकते थे कि, "हे, यह टूटा हुआ है!" लेकिन वे इसे ठीक नहीं कर सकते थे। मानव डेवलपर्स को वह रिपोर्ट पढ़नी पड़ती थी, समझना पड़ता था कि इसे कैसे ठीक किया जाए, और खुद काम करना पड़ता था। यह धीमा, महंगा था और अक्सर गलतियों का कारण बनता था।

हाल ही में, हमारे पास AI "फिक्सर्स" (AI "fixers") (लार्ज लैंग्वेज मॉडल्स) के रूप में एक बड़ी सफलता मिली है जो कोड लिख सकते हैं। लेकिन जब शोधकर्ताओं ने इन AI फिक्सर्स का उपयोग वेब एक्सेसिबिलिटी समस्याओं को ठीक करने के लिए करने की कोशिश की, तो वे विफल रहे। क्यों? क्योंकि उन्होंने एक ही बार में पूरे शहर को ठीक करने की कोशिश की या बिना यह सोचे कि वे एक-दूसरे में कैसे फिट होते हैं, हर एक टूटी हुई ईंट को अलग-अलग ठीक करने की कोशिश की।

यह पेपर A11YRepair पेश करता है, जो एक नया, स्मार्ट AI सिस्टम है जिसे विशेष रूप से इन वेब एक्सेसिबिलिटी मुद्दों को ठीक करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. समस्या: "परेशान शेफ" बनाम "रोबोट चींटी"

शोधकर्ताओं ने पाया कि मौजूदा AI उपकरण मुख्य रूप से दो तरीकों से विफल होते हैं:

  • "परेशान शेफ" (बुनियादी रणनीति): यदि आप AI को एक ही बार में एक वेबपेज पर 100 टूटी हुई चीजें दे देते हैं, तो वह भ्रमित हो जाता है। वह एक ही बड़े बैच में सब कुछ ठीक करने की कोशिश करता है और अंत में कुछ चीजें छोड़ देता है या एक अस्त-व्यस्त, असंगत पैच बना देता है।
  • "रोबोट चींटी" (पुनरावृत्ति रणनीति): यदि आप AI को एक चीज़ ठीक करने के लिए कहते हैं, फिर दूसरी, फिर तीसरी, तो यह विशिष्ट स्थान खोजने में बेहतर काम करता है। लेकिन यह अक्षम है। यह एक ही टूटे हुए दरवाजे को अलग-अलग तरीकों से तीन बार ठीक कर सकता है, या किसी दरवाजे को इस तरह ठीक कर सकता है जिससे उसके बगल वाली खिड़की टूट जाए क्योंकि उसने पूरी तस्वीर नहीं देखी। यह समय और पैसा बर्बाद करता है।

2. समाधान: A11YRepair की "विभाजित-और-जीतें" (Divide-and-Conquer) रणनीति

A11YRepair एक स्मार्ट निर्माण फोरमैन (construction foreman) की तरह कार्य करता है। पूरी इमारत को देखने या केवल एक ईंट को देखने के बजाय, यह "विभाजित-और-जीतें" दृष्टिकोण का उपयोग करता है:

  • चरण 1: सुरागों को समूहबद्ध करना ("पड़ोस" की रणनीति)
    सिस्टम वेबपेज को देखता है और संबंधित समस्याओं को एक साथ समूहबद्ध करता है। यदि समान आइकनों की एक पंक्ति पर 10 गायब "ऑल्ट टैग्स" (छवियों के विवरण) हैं, तो इसे एहसास होता है, "ये 10 अलग-अलग समस्याएं नहीं हैं; यह एक ही समस्या है जिसमें एक ही कोड फ़ाइल है।" यह उन्हें इस तरह समूहबद्ध करता है कि AI एक ही समन्वित संपादन (coordinated edit) के साथ उन सभी को एक साथ ठीक कर सके। यह "रोबोट चींटी" को दोहराव वाला काम करने से रोकता है।

  • चरण 2: स्रोत का पता लगाना ("जासूस" की रणनीति)
    एक बार जब इसे पता चल जाता है कि क्या ठीक करना है, तो इसे जानना होता है कि कोड कहाँ रहता है। यह दो विधियों का उपयोग करता है:

    1. दृश्य जासूस (Visual Detective): यह वेबसाइट का स्क्रीनशॉट देखकर देखता है कि समस्या दृश्य रूप से कहाँ है।
    2. कोड जासूस (Code Detective): यह विशिष्ट कीवर्ड्स (जैसे किसी बटन का नाम या ID) के लिए कोड फाइलों को खोजता है।
      इसके बाद यह अपने काम की दोबारा जांच करता है। यदि इसे लगता है कि इसने सही फ़ाइल ढूंढ ली है लेकिन यह सुनिश्चित नहीं है, तो यह खुद से पूछता है, "क्या मैं कुछ मिस कर रहा हूँ?" और फिर से खोज करता है। यह सुनिश्चित करता है कि यह मूल कारण (root cause) को न छोड़े।
  • चरण 3: नियम पुस्तिका का उपयोग करना ("लाइब्रेरियन" की रणनीति)
    वेब एक्सेसिबिलिटी एक सख्त नियम पुस्तिका का पालन करती है जिसे WCAG कहा जाता है (जैसे कि बिल्डिंग कोड)।

    • सरल समस्याओं के लिए (जैसे कि एक गायब लेबल), AI उत्तर जानता है और उसे नियम पुस्तिका देखने की आवश्यकता नहीं होती है।
    • जटिल समस्याओं के लिए (जैसे कि "क्या यह बटन उंगली से दबाने के लिए पर्याप्त बड़ा है?"), AI जानता है कि उसे विशिष्ट नियम की जांच करने की आवश्यकता है।
      A11YRepair स्मार्ट है कि वह जानता है कि कब किताब खोलनी है और कब अपने ज्ञान पर भरोसा करना है। यह समय बचाता है और बहुत अधिक जानकारी से AI को भ्रमित होने से रोकता है।

3. परिणाम: वास्तविक दुनिया की सफलता

शोधकर्ताओं ने A11YBench नामक एक परीक्षण मैदान बनाया, जिसमें 60 वास्तविक दुनिया की वेबसाइटें (जैसे Google, Microsoft और Facebook जैसे लोकप्रिय ओपन-सोर्स प्रोजेक्ट्स) शामिल हैं जिनमें हजारों एक्सेसिबिलिटी त्रुटियां हैं।

  • बेहतर सुधार: A11YRepair ने मौजूदा सर्वोत्तम उपकरणों की तुलना में अधिक त्रुटियों (लगभग 77%) को ठीक किया।
  • कम गलतियाँ: इसने बहुत कम "साइड इफेक्ट्स" (अनजाने में साइट के अन्य हिस्सों को तोड़ना) पैदा किए।
  • सस्ता: इसने काम करने के लिए काफी कम कंप्यूटिंग पावर (और पैसा) का उपयोग किया।
  • वास्तविक अपनाना: सबसे प्रभावशाली बात? शोधकर्ताओं ने वास्तव में A11YRepair द्वारा उत्पन्न सुधारों को वास्तविक कंपनियों को भेजा। 61 सुधारों को स्वीकार किया गया और प्रमुख प्रोजेक्ट्स जैसे Angular, React Native और Docker में मर्ज किया गया।

सारांश

A11YRepair को एक सामान्य ठेकेदार के बजाय विशेषज्ञ आर्किटेक्ट्स की एक टीम के रूप में समझें। यह एक बार में पूरे शहर को फिर से बनाने की कोशिश नहीं करता, न ही यह हर दरार को व्यक्तिगत रूप से ठीक करता है। इसके बजाय, यह:

  1. संबंधित समस्याओं को पड़ोसों (neighborhoods) में समूहबद्ध करता है।
  2. समस्या का कारण बनने वाली सटीक ब्लूप्रिंट फ़ाइल का पता लगाता है।
  3. केवल आवश्यकता होने पर बिल्डिंग कोड का परामर्श लेता है।
  4. सोर्स कोड को ठीक करता है ताकि वेबसाइट स्थायी रूप से सुलभ (accessible) हो जाए, न कि केवल अस्थायी रूप से पैच की गई हो।

यह पेपर साबित करता है कि काम को स्मार्ट तरीके से व्यवस्थित करके और सही समय पर सही नियमों का उपयोग करके, AI अंततः सभी के लिए वेब को सुलभ बनाने में एक विश्वसनीय साथी बन सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →