← नवीनतम पेपर
💬 NLP

fog: Expressing Motion and Emotion through Function Composition of AI-Generated Code

यह शोध पत्र "fog" प्रस्तुत करता है, जो एक फंक्शन कंपोजिशन फ्रेमवर्क है जो AI-जनित कोड और एक इंटरैक्टिव एनिमेशन एडिटर का लाभ उठाता है ताकि उपयोगकर्ताओं को अभिव्यंजक, हाइडर-सिमेल-शैली की गति और भावना बनाने में सक्षम बनाया जा सके, जिसे धारणा संबंधी अध्ययनों के माध्यम से मान्य किया गया है जिन्होंने 68% अर्थपूर्ण पहचान सटीकता और बेहतर उपयोगकर्ता नियंत्रण प्रदर्शित किया।

मूल लेखक: Vivian Liu, Lydia Chilton

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vivian Liu, Lydia Chilton

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप स्क्रीन पर तैरते हुए आकारों—एक त्रिकोण, एक वृत्त, एक वर्ग—का उपयोग करके एक कहानी सुनाने की कोशिश कर रहे हैं। आप चाहते हैं कि वृत्त त्रिकोण का पीछा करते हुए क्रोधित दिखे, या त्रिकोण भागते हुए डरा हुआ दिखे। यह सुनने में सरल लगता है, है ना? लेकिन यदि आप एक AI को "वृत्त को क्रोधित दिखाओ" कहते हैं, तो आपको एक ऐसा वृत्त मिल सकता है जो बस एक ही जगह घूमता रहता है या बहुत तेज़ गति से चलता है, जिससे वह उस भावना को पूरी तरह से मिस कर देता है।

यही वह समस्या है जिसे fog (शोधकर्ता विवियन लिउ और लिडिया चिल्टन द्वारा विकसित एक नया टूल) हल करने की कोशिश कर रहा है। केवल कंप्यूटर को अस्पष्ट निर्देश देने के बजाय, fog गति और भावना को कोड से बनी एक विशाल, 'मिक्स-एंड-मैच' लेगो (LEGO) सेट की तरह मानता है।

बड़ा विचार: गति एक रेसिपी है, कोई जादुई मंत्र नहीं

शोधकर्ताओं का सुझाव है कि गति और भावना केवल यादृच्छिक अराजकता नहीं हैं; वे विशिष्ट सामग्रियों से बने होते हैं। इसे खाना पकाने की तरह समझें। यदि आप चाहते हैं कि कोई व्यंजन तीखा हो, तो आप शेफ को केवल यह नहीं कहते, "इसे तीखा बनाओ।" आप उसमें मिर्च, काली मिर्च और गर्मी की विशिष्ट मात्रा मिलाते हैं।

fog में, "सामग्रियां" क्रियाएं (Verbs) (जैसे पीछा करना या भागना), क्रिया विशेषण (Adverbs) (जैसे हिचकिचाते हुए या आक्रामक रूप से), हाव-भाव (Gestures) (जैसे लहराना या कांपना), और भावनाएं (Emotions) (जैसे क्रोध या डर) हैं। जादू तब होता है जब आप इन कोड-ब्लॉक्स को एक साथ जोड़ते हैं।

उदाहरण के लिए, आप AI को दूसरे आकार को हिचकिचाते हुए (पीछा करने) के लिए कह सकते हैं। सिस्टम केवल अनुमान नहीं लगाता; यह एक विशिष्ट रेसिपी बनाता है जहाँ आकार आगे बढ़ता है लेकिन घबराहट में रुकता और शुरू होता है, शायद थोड़ा कांपता भी है। या, आप क्रोध को एक झपट्टे (lunge) के साथ मिला सकते हैं, जिससे एक ऐसी गति बनती है जो ऊर्जा बनाती है, ज़ोर से प्रहार करती है, और फिर पीछे हटती है।

"जादुई" परीक्षण: क्या लोग वास्तव में भावना को देख सकते हैं?

टीम ने केवल इसे बनाया और उम्मीद नहीं की। उन्होंने 452 अलग-अलग एनिमेशन के साथ एक बड़ा टेस्ट किया। उन्होंने सैकड़ों लोगों को ये चलते हुए आकार दिखाए और पूछा, "यह आकार क्या कर रहा है? क्या यह पीछा कर रहा है, बच रहा है, या लड़ रहा है?"

परिणाम काफी शानदार थे। लोग 68% समय सही अर्थ बताने में सक्षम थे। यह सुनने में स्कूल में मिले C+ ग्रेड जैसा लग सकता है, लेकिन याद रखें, यदि वे केवल चार विकल्पों में से यादृच्छिक रूप से अनुमान लगा रहे होते, तो वे केवल 25% समय ही सही होते। इसलिए, fog के एनिमेशन एक भाग्यशाली अनुमान की तुलना में 2.68 गुना बेहतर थे।

हालाँकि, पेपर सावधानी से यह भी बताता है कि यह एक पूर्ण समाधान नहीं है। जब उन्होंने दो चीजों को मिलाने की कोशिश की—जैसे किसी आकार को हिचकिचाते हुए और पीछा करते हुए दिखाना—तो सटीकता थोड़ी कम हो गई (लगभग 58% तक)। कभी-कभी "सामग्रियां" आपस में टकरा जाती हैं, जैसे तेल और पानी को मिलाने की कोशिश करना। शोधकर्ताओं ने पाया कि यदि "हिचकिचाहट" का कोड और "पीछा करने" का कोड गति के एक ही हिस्से को नियंत्रित करने की कोशिश करता है, तो वे कभी-कभी एक-दूसरे को रद्द कर देते हैं। यह एक याद दिलाता है कि हालांकि यह प्रणाली शक्तिशाली है, लेकिन यह अभी तक मन पढ़ने वाली मशीन नहीं है।

रचनाकारों के लिए एक "खेल का मैदान"

शोधकर्ताओं ने यह देखने के लिए एक प्लेग्राउंड (एक एनिमेशन एडिटर) भी बनाया कि वास्तविक लोग इसका उपयोग कैसे करेंगे। उन्होंने 10 लोगों को आमंत्रित किया—कुछ जो एनिमेशन को बहुत अच्छी तरह जानते हैं, और कुछ जिन्होंने कभी कोडिंग नहीं की है।

उन्होंने fog की तुलना एक मानक "जो आप चाहते हैं उसे टाइप करें" वाले AI टूल से की। अंतर बहुत बड़ा था।

  • पुराना तरीका: उपयोगकर्ताओं को एक प्रॉम्प्ट टाइप करना पड़ता था, AI द्वारा पूरा नया दृश्य बनाने का इंतज़ार करना पड़ता था, और यदि उन्हें वह पसंद नहीं आता, तो फिर से इंतज़ार करना पड़ता था। एक नए एनिमेशन संस्करण को देखने में लगभग 1.75 मिनट लग जाते थे।
  • fog का तरीका: उपयोगकर्ता तुरंत गति में बदलाव कर सकते थे। वे एक आकार को तेज़ चलाने के लिए स्लाइडर खींच सकते थे, उसके अनुसरण के लिए एक पथ बना सकते थे, या ऑन-द-फ्लाई भावनाओं को मिला सकते थे। एक नए संस्करण को देखने का समय घटकर केवल 0.36 मिनट रह गया।

विशेषज्ञों को नियंत्रण पसंद आया, उनका कहना था कि यह हर विवरण को सूक्ष्मता से ट्यून करने के लिए "एटॉमिक" बिल्डिंग ब्लॉक्स की तरह महसूस होता है। शुरुआती लोगों को सुरक्षा कवच पसंद आया; एक खाली स्क्रीन को देखकर यह सोचने के बजाय कि क्या टाइप किया जाए, वे पहले से बने "क्रियाओं" और "क्रिया विशेषणों" के ग्रिड से शुरुआत कर सकते थे। एक शुरुआती व्यक्ति ने एक ऐसे वृत्त को एनिमेट किया जो चिंतित दिखता था और फिर शांत हो गया, उसने कहा, "मैं वृत्तों में भावना देख सकता हूँ।"

यह क्या नहीं है (और यह अभी क्या नहीं कर सकता)

यह जानना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं करता है।

  • यह कोई मूवी मेकर नहीं है: एनिमेशन अभी भी केवल साधारण आकार (वृत्त और त्रिकोण) हैं जो इधर-उधर घूम रहे हैं। पेपर स्पष्ट रूप से कहता है कि भले ही 68% सटीकता अच्छी है, लेकिन आप 100% पूर्णता की उम्मीद नहीं कर सकते। एक साधारण वृत्त हर संभव मानवीय भावना या जटिल कहानी को व्यक्त नहीं कर सकता।
  • यह AI के लिए "सब कुछ ठीक करने वाला" नहीं है: शोधकर्ताओं ने AI को अपने स्वयं के कोड को ठीक करने के लिए "स्व-परिष्कृत" (self-refine) करने की कोशिश की, लेकिन इससे बहुत अधिक मदद नहीं मिली। सटीकता में बहुत कम बदलाव आया।
  • यह जटिल रोबोट के लिए नहीं है (अभी नहीं): यह प्रणाली अमूर्त आकार की कहानियों के लिए सबसे अच्छा काम करती है। पेपर नोट करता है कि यदि आप जोड़ों और लाइटिंग वाले वास्तविक रोबोट, या चेहरे वाले चरित्र को एनिमेट करना चाहते हैं, तो fog अभी उस स्तर के विवरण के लिए तैयार नहीं है।

निष्कर्ष

fog यह सुझाव देता है कि हम कंप्यूटर को भावनाओं को समझने के लिए कोड फंक्शन में तोड़कर सिखा सकते हैं, जैसे भावनाओं की एक रेसिपी बुक। यह कोई जादुई छड़ी नहीं है जो हर एनिमेशन समस्या को हल कर देती है, लेकिन यह खेलने का एक शक्तिशाली नया तरीका है। यह "AI को क्या करना है यह बताने" की डरावनी, अस्पष्ट प्रक्रिया को गति की सामग्रियों को मिलाने और मिलाने के एक मजेदार, व्यावहारिक खेल में बदल देता है, जिससे विशेषज्ञ और शुरुआती दोनों ही ऐसे आकार के साथ कहानियाँ सुना सकते हैं जो वास्तव में जीवित महसूस होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →