← नवीनतम पेपर
🤖 AI

WetRobo: A Reproducible Robot Kit for Coding Agents in Biological Laboratories

यह शोधपत्र WetRobo को प्रस्तुत करता है, जो एक पुनरुत्पादक (reproducible) रोबोट किट है जो एक कोडिंग एजेंट को कोड लिखकर और निष्पादित करके विभिन्न प्रयोगशालाओं में प्राकृतिक भाषा वाले जैविक कार्यों को स्वायत्त रूप से अनुकूलित करने और निष्पादित करने में सक्षम बनाता है, जिससे पारंपरिक विजन-लैंग्वेज-एक्शन नीतियों की स्थानांतरण सीमाओं को दूर किया जा सके।

मूल लेखक: Yuna Oikawa, Kei Endo, Takanori Uzawa, Yunzhe Zhang, Manan Anjaria, Lerrel Pinto, Sherry Yang, Koji Tsuda

प्रकाशित 2026-09-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuna Oikawa, Kei Endo, Takanori Uzawa, Yunzhe Zhang, Manan Anjaria, Lerrel Pinto, Sherry Yang, Koji Tsuda

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक जैविक प्रयोगशाला की शांत गुनगुनाहट में, बहुत सारा काम मानव शोधकर्ताओं के स्थिर, दोहराव वाले हाथों पर निर्भर करता है। वे कोशिकाओं को खिलाते हैं, नाजुक कांच के पात्रों को इधर-उधर करते हैं, और इनक्यूबेटरों के भारी दरवाजे खोलते हैं, ऐसे कार्य जिन्हें दिन-दर-दिन सटीकता के साथ किया जाना चाहिए। दशकों से, वैज्ञानिक इन कर्तव्यों को रोबोटों को सौंपने की आशा कर रहे थे, ताकि मानव विशेषज्ञ मैन्युअल श्रम के बजाय खोज पर ध्यान केंद्रित कर सकें। सबसे आशाजनक हालिया दृष्टिकोण एक आर्टिफिशियल इंटेलिजेंस सिस्टम पर निर्भर रहा है जिसे दुनिया को देखने और उसके भीतर कार्य करने के लिए प्रशिक्षित किया गया है, ठीक वैसे ही जैसे कोई व्यक्ति वीडियो देखकर एक नया कौशल सीखता है। इन प्रणालियों को, जिन्हें अक्सर विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है, एक रोबोटिक हाथ द्वारा बोतल हिलाने या ढक्कन उठाने के हजारों उदाहरण दिखाकर सिखाया जाता है। उम्मीद यह है कि एक बार प्रशिक्षित होने के बाद, रोबोट बस एक नई स्थिति को देख सकता है और जान सकता है कि क्या करना है। हालांकि, एक कामकाजी लैब की अव्यवस्थित वास्तविकता में, जहाँ प्रकाश बदलता है, उपकरण भिन्न होते हैं, और वस्तुओं को थोड़ा अलग तरह से रखा जाता है, ये प्रशिक्षित सिस्टम अक्सर लड़खड़ा जाते हैं। एक रोबate जो एक कमरे में कार्य में महारत हासिल कर लेता है, वह दूसरे कमरे में जाने पर पूरी तरह विफल हो सकता है, क्योंकि सूक्ष्म परिवर्तन उन पैटर्न को भ्रमित कर देते हैं जिन्हें उसने सीखा था। इस नाजुकता ने कई प्रयोगशालाओं को एक अधिक अनुकूलन योग्य समाधान की प्रतीक्षा करने पर छोड़ दिया है।

शोधकर्ताओं की एक टीम ने अब एक अलग मार्ग पेश किया है जिसे वे 'वेटरोबो' (WetRobo) कहते हैं। एक विशिष्ट सेट आंदोलनों को याद करने के लिए रोबोट को प्रशिक्षित करने के बजाय, उन्होंने एक किट बनाई है जो एक कंप्यूटर प्रोग्राम को मौके पर ही अपने स्वयं के निर्देश लिखने की अनुमति देती है। इस किट में एक मानक रोबोटिक हाथ, सामान्य प्रयोगशाला उपकरण जैसे इनक्यूबेटर और रिएजेंट बोतलें, और वीडियो का एक सेट शामिल है जो दिखाता है कि एक इंसान किसी कार्य को कैसे कर सकता है। महत्वपूर्ण रूप से, इसमें एक साधारण भाषा में लिखा गया मार्गदर्शिका भी शामिल है जो एक कोडिंग एजेंट को काम के प्रति दृष्टिकोण बताने के लिए है। यह एजेंट एक प्रकार का आर्टिफिशियल इंटेलिजेंस है जो कंप्यूटर कोड लिखने में सक्षम है। जब एक शोधकर्ता रोबोट को प्राकृतिक भाषा में एक सरल कमांड देता है, जैसे कि "बोतल का ढक्कन उठाओ," तो एजेंट स्थानीय वातावरण को देखता है, मार्गदर्शिका का परामर्श करता है, और समस्या को हल करने के लिए एक कस्टम प्रोग्राम लिखता है। यह एक पूर्व-प्रशिक्षित मस्तिष्क पर निर्भर नहीं है जो कैमरा एंगल बदलने या ग्रिपर के अलग ब्रांड से भ्रमित हो सकता है। इसके बजाय, यह दृश्य का अवलोकन करता है, दूरियों को मापता है, और कार्य पूरा होने तक अपने स्वयं के कोड को समायोजित करता है।

शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण दो अलग-अलग प्रयोगशालाओं में किया, जिन्हें उन्होंने लैब X और लैब Y कहा। ये कमरे एक जैसे नहीं थे; उनमें अलग-अलग लाइटिंग, कैमरों की अलग-अलग संख्या और यहाँ तक कि रोबोट ग्रिपर्स के अलग-अलग प्रकार भी थे। एक प्रयोग में, रोबलेट को एक रिएजेंट बोतल से स्क्रू कैप हटाने के लिए कहा गया था। कोडिंग एजेंट ने, वेटरोबो किट का उपयोग करते हुए, दोनों प्रयोगशालाओं में कैप को पकड़ने और घुमाने का तरीका सफलतापूर्वक ढूंढ लिया। इसने एक ऐसा कोड लिखा जिसका उपयोग कैमरों द्वारा सफेद कैप का पता लगाने, उसकी दूरी मापने और फिर जो उसने देखा उसके आधार पर अपनी गतिविधियों को समायोजित करने के लिए किया गया। लैब Y में, जहाँ रोबोट ने एक मानक ग्रिपर का उपयोग किया, एजेंट ने एक ऐसा प्रोग्राम लिखा जो हाथ द्वारा बहुत अधिक प्रतिरोध महसूस होने पर रुक जाता। लैब X में, जहाँ रोबोट के पास एक अलग, कस्टम-मेड ग्रिपर था जो उसी तरह से बल (force) को नहीं माप सकता था, एजेंट ने एक अलग प्रोग्राम लिखा जो त्रुटियों से बचने के लिए विजुअल चेक और सिम्युलेटेड कोलिजन (टकराव) पर निर्भर था। परिणाम एक ऐसा रोबोट था जो जिस भी कमरे में वह था, उसके अनुसार अपने निर्देशों को अनुकूलित कर सकता था।

यह देखने के लिए कि यह विधि कितनी प्रभावी थी, शोधकर्ताओं ने पारंपरिक दृष्टिकोण यानी विजन-आधारित मॉडल को प्रशिक्षित करने के मुकाबले इसकी तुलना की। उन्होंने एक सिस्टम लिया जिसे लैब X से हजारों वीडियो प्रदर्शनों पर फाइन-ट्यून किया गया था और उसे उसी बोतल-कैप कार्य को करने के लिए कहा। लैब X में, जहाँ इसे प्रशिक्षित किया गया था, सिस्टम ने पूरी तरह से काम किया। लेकिन जब उसी सिस्टम को लैब Y में ले जाया गया, जिसमें अलग लाइटिंग और उपकरण थे, तो यह पूरी तरह विफल हो गया। यह नए परिवेश में अपने ज्ञान को स्थानांतरित करने में असमर्थ रहा। इसके विपरीत, कोडिंग एजेंट दोनों स्थानों पर सफल रहा। इसे पुन: प्रशिक्षित करने या नए वीडियो दिखाने की आवश्यकता नहीं थी; इसने बस नए कमरे का अवलोकन किया और निर्देशों का एक नया सेट लिखा जो काम आया। शोधकर्ताओं ने अन्य कार्यों पर भी सिस्टम का परीक्षण किया, जैसे कि पेट्री डिश से ढक्कन उठाना और इनक्यूबेटर का भारी दरवाजा खोलना। प्रत्येक मामले में, एजेंट ने स्थानीय स्थितियों का अवलोकन किया, दरवाजे या डिश की विशिष्ट ज्यामिति (geometry) को संभालने के लिए कोड लिखा, और कार्य को सफलतापूर्वक निष्पादित किया।

अनुकूलन की प्रक्रिया एजेंट द्वारा बनाए गए कोड में दिखाई दे रही थी। जब रोबोट बोतल के ढक्कन के साथ ग्रिपर को संरेखित करने में संघर्ष करता, तो एजेंट एक छोटा प्रोग्राम लिखता जो गति का परीक्षण करता, कैमरा इमेज की जांच करता और फिर दृष्टिकोण को समायोजित करता। यदि रोबोट फिसलता, तो एजेंट कोड को फिर से लिखता ताकि उसमें एक धीमा, अधिक सावधानीपूर्वक खिंचाव शामिल किया जा सके। एक उदाहरण में, एजेंट ने महसूस किया कि इनक्यूबेटर के दरवाजे पर छाया उसकी दृष्टि को गुमराह कर रही है, इसलिए उसने प्रकाश के बजाय डेप्थ डेटा का उपयोग करके दरवाजे के कोण को मापने के लिए एक नया प्रोग्राम लिखा। अपनी गलतियों का निरीक्षण करने और अपने तर्क को फिर से लिखने की इस क्षमता ने रोबोट को उन चुनौतियों से पार पाने में मदद की जो एक पूर्व-प्रशिक्षित सिस्टम को उलझा सकती थीं। शोधकर्ताओं ने नोट किया कि एजेंट अक्सर नए समस्याओं को हल करने के लिए पिछले कार्यों के लिए लिखे गए कोड के हिस्सों का पुन: उपयोग करता था, जैसे कि एक पतली वस्तु को पकड़ने का तर्क। इसका मतलब था कि जैसे-जैसे रोबोट लैब में काम करता है, वह उपयोगी निर्देशों का एक पुस्तकालय बनाता है जिसे अन्य लैब के साथ साझा किया जा सकता है, जिससे भविष्य के सेटअप तेज़ और आसान हो जाते हैं।

यह कार्य जैविक अनुसंधान में रोबोटिक्स लाने के लिए एक व्यावहारिक मार्ग का सुझाव देता है। हर प्रयोगशाला को हर नए रोबोट के लिए घंटों का वीडियो डेटा एकत्र करने और महंगे न्यूरल नेटवर्क को प्रशिक्षित करने की आवश्यकता के बजाय, वैज्ञानिक एक किट वितरित कर सकते हैं और एक कोडिंग एजेंट को स्थानीय वातावरण के अनुकूल बनाने दे सकते हैं। शोधकर्ताओं ने प्रदर्शित किया कि यह विधि रोबोट को उपकरणों और लाइटिंग के वास्तविक दुनिया के विविधताओं को संभालने की अनुमति देती है जो पारंपरिक सिस्टम को तोड़ देती हैं। हालाँकि अध्ययन कुछ विशिष्ट कार्यों और एक ही प्रकार के कोडिंग एजेंट तक सीमित था, परिणाम एक ऐसे भविष्य की ओर संकेत करते हैं जहाँ रोबोट को व्यापक पुन: प्रशिक्षण की आवश्यकता के बिना विविध सेटिंग्स में तैनात किया जा सकता है। मुख्य निष्कर्ष यह है कि रोबोट को जो वह देखता है उसके आधार पर अपने स्वयं के निर्देश लिखने की क्षमता देना, उसे निश्चित सेट आंदोलनों को सिखाने की तुलना में प्रयोगशाला की अनिश्चित प्रकृति को संभालने का एक अधिक मजबूत तरीका है। अनुकूलन के बोझ को मानव प्रशिक्षकों से सॉफ्टवेयर की ओर स्थानांतरित करके, वेटरोबो प्रयोगशाला स्वचालन को अधिक लचीला, सुलभ और वास्तविक दुनिया के लिए तैयार बनाने का एक तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →