← नवीनतम पेपर
🤖 AI

See Through the Noise: Improving Domain Generalization in Gaze Estimation

यह शोध पत्र सी-थ्रू-नॉइज़ (SeeTN) फ्रेमवर्क प्रस्तुत करता है, जो एक सिमेंटिक एम्बेडिंग स्पेस का निर्माण करके और नॉइज़ी सैंपल्स को अलग करने के लिए एफिनिटी रेगुलराइजेशन को लागू करके गेज़ एस्टीमेशन में लेबल नॉइज़ को व्यापक रूप से संबोधित करने वाला पहला है, जिससे सोर्स-डोमेन सटीकता से समझौता किए बिना क्रॉस-डोमेन सामान्यीकरण को महत्वपूर्ण रूप से बढ़ाया गया है।

मूल लेखक: Yanming Peng, Shijing Wang, Yaping Huang, Yi Tian

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanming Peng, Shijing Wang, Yaping Huang, Yi Tian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि इंसानों की तरह चीजों को कैसे देखा जाता है। इसे गेज़ एस्टिमेशन (gaze estimation) कहा जाता है। रोबोट को यह सीखने की जरूरत है कि कोई व्यक्ति कहाँ देख रहा है, इसके लिए उसे आँखों की तस्वीरों की आवश्यकता होती है।

समस्या यह है कि इस रोबोट को सिखाना एक ऐसी नई भाषा सीखने जैसा है जिसका डिक्शनरी (शब्दकोश) गलतियों (typos) से भरा हुआ है।

समस्या: "शोर वाले" शिक्षक (Noisy Teachers)

वास्तविक दुनिया में, एकदम सटीक डेटा प्राप्त करना कठिन है। कभी-कभी, फोटो लेने वाला व्यक्ति ठीक उसी दिशा में नहीं देख रहा होता जहाँ लेबल बताता है। शायद उसने पलक झपकाई हो, या रोशनी अजीब रही हो, या फोटो को लेबल करने वाले व्यक्ति ने कोई गलती की हो।

इस शोध पत्र में, लेखक इन गलतियों को "लेबल नॉइज़" (label noise) कहते हैं।

  • उपमा: कल्पना कीजिए कि एक शिक्षक एक छात्र को वृत्त (circle) बनाना सिखाने की कोशिश कर रहा है। लेकिन शिक्षक के अपने चित्र टेढ़े-मेढ़े और अपूर्ण हैं। यदि छात्र उन टेढ़े-मेढ़े रेखाओं को पूरी तरह से याद करने की कोशिश करता है, तो वह खराब वृत्त बनाना सीख जाएगा। जब वह छात्र एक नए कक्षा (नए वातावरण) में जाता है, तो वह असफल हो जाता है क्योंकि उसने 'वृत्त' की अवधारणा के बजाय 'गलतियों' को रट लिया था।

वर्तमान AI मॉडल अक्सर वातावरण (जैसे अलग कैमरे या लाइटिंग) को अनदेखा करने की कोशिश करते हैं, लेकिन वे यह जांचना भूल जाते हैं कि क्या "शिक्षक" (डेटा लेबल) वास्तव में उन्हें झूठ बोल रहा है। यह उन्हें एक नई जगह पर जाने पर विफल बना देता है।

समाधान: "शोर के पार देखना" (SeeTN)

लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे SeeTN (See Through the Noise) कहा जाता है। इसे एक स्मार्ट फिल्टर के रूप में समझें जो रोबोट को एक "अच्छे सबक" और एक "बुरे सबक" के बीच अंतर करने में मदद करता है।

यह कैसे काम करता है, यहाँ चरण-दर-चरण दिया गया है:

1. "सिमेंटिक मैप" बनाना (पड़ोस)

आमतौर पर, AI केवल तस्वीर को देखता है और कोण का अनुमान लगाता है। SeeTN कुछ अधिक स्मार्ट करता है। यह एक सिमेंटिक मैप (Semantic Map) बनाता है।

  • उपमा: एक विशाल पड़ोस की कल्पना करें जहाँ हर घर दृष्टि की एक विशिष्ट दिशा (जैसे, "बाईं ओर देखना," "ऊपर देखना") का प्रतिनिधित्व करता है।
  • एक सामान्य AI में, वे घर जो पड़ोसी होने चाहिए (जैसे "थोड़ा बाईं ओर देखना" और "बहुत बाईं ओर देखना"), दूर हो सकते हैं।
  • SeeTN की तरकीब: यह AI को इन घरों को इस तरह व्यवस्थित करने के लिए मजबूर करता है ताकि उनकी स्थिति मानचित्र पर इस तरह हो कि वे दृष्टि की समानता से पूरी तरह मेल खाएं। यदि दो लोग लगभग एक ही दिशा में देख रहे हैं, तो उनके "घर" उनके बिल्कुल बगल में होने चाहिए। यह आँखों के काम करने के तरीके का एक सुचारू और तार्किक मानचित्र बनाता है।

2. "स्निफ टेस्ट" (झूठ बोलने वालों को ढूँढना)

एक बार मानचित्र बन जाने के बाद, सिस्टम हर छात्र (डेटासेट में प्रत्येक फोटो) की जाँच करता है।

  • उपमा: सिस्टम पूछता है, "क्या इस छात्र का उत्तर उसके पड़ोसियों से मेल खाता है?"
  • यदि एक छात्र कहता है, "मैं चंद्रमा की ओर देख रहा हूँ!" लेकिन उसके सभी पड़ोसी (समान आंखों की बनावट वाले लोग) जमीन की ओर देख रहे हैं, तो सिस्टम जानता है कि कुछ गलत है।
  • यह इंडिकेटर (η\eta) है। यह "बेमेल" (mismatch) को मापता है। यदि बेमेल बहुत बड़ा है, तो सिस्टम उस फोटो को नोइज़ी (Noisy) (एक बुरा शिक्षक) के रूप में चिह्नित करता है। यदि बेमेल कम है, तो यह क्लीन (Clean) (एक अच्छा शिक्षक) है।

3. "स्मार्ट ट्यूटर" रणनीति (शोर को संभालना)

अब, AI दोनों समूहों के साथ अलग तरह से व्यवहार करता है:

  • क्लीन ग्रुप के लिए: यह उन्हें ध्यान से सुनता है। यह कहता है, "आप सही हैं, जो कर रहे हैं उसे करते रहें।"
  • नोइज़ी ग्रुप के लिए: यह उन्हें फेंक नहीं देता! ऐसा करना बर्बादी होगी। इसके बजाय, यह कहता है, "आपका लेबल शायद गलत है, लेकिन आप अभी भी एक अच्छे छात्र हैं। इसके बजाय अपने पड़ोसियों (साफ-सुथरे छात्रों) को देखें कि आपको वास्तव में क्या सीखना चाहिए।"
  • उपमा: एक छात्र की कल्पना करें जो गलत उत्तर दे रहा है क्योंकि उसकी पाठ्यपुस्तक में टाइपो (गलती) है। छात्र को कक्षा से बाहर निकालने के बजाय, शिक्षक कहता है, "अपनी किताब के उस पन्ने को अनदेखा करो। अपने बगल में बैठे स्मार्ट बच्चों को देखो, और उनसे सीखो।"

यह क्यों महत्वपूर्ण है

पिछले अधिकांश तरीकों ने AI के मस्तिष्क को वातावरण को अनदेखा करने के लिए ठीक करने की कोशिश की। यह पेपर कहता है, "पहले डेटा को ठीक करें।"

डेटा के शोर को साफ करके और AI को विभिन्न दृष्टियों के बीच के संबंधों (मैप) को सीखने में मदद करके, रोबोट बहुत अधिक मजबूत हो जाता है।

  • परिणाम: जब इस रोबोट को एक नए शहर में नए कैमरे, नई लाइटिंग और नए लोगों के साथ भेजा जाता है, तो यह भ्रमित नहीं होता है। इसने "देखने" की वास्तविक अवधारणा सीखी है, न कि केवल अपने पहले शिक्षक की विशिष्ट गलतियों को।

सारांश

  • समस्या: आई-ट्रैकिंग के लिए AI विफल हो जाता है क्योंकि प्रशिक्षण डेटा छिपी हुई गलतियों (शोर) से भरा होता है।
  • समाधान: SeeTN नामक एक नया सिस्टम दृष्टि दिशाओं का एक तार्किक मानचित्र बनाता है।
  • जादुई प्रक्रिया: यह पहचानता है कि कौन सा डेटा "टूटा हुआ" है और AI को "अच्छे" डेटा से सीखने में मदद करता है ताकि "बुरे" डेटा को ठीक किया जा सके, न कि केवल बुरे डेटा को अनदेखा करने में।
  • परिणाम: एक ऐसा AI जो दुनिया को देख सकता है और जान सकता है कि लोग कहाँ देख रहे हैं, चाहे वह कहीं भी हो या उसका डेटा कितना भी अव्यवस्थित क्यों न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →