iPack: Intuitive Bin Packing with Large Language Models
यह शोध पत्र LLM-Pack को प्रस्तुत करता है, जो एक नवीन, मॉड्यूलर दृष्टिकोण है जो नए आइटम्स के लिए समर्पित प्रशिक्षण की आवश्यकता के बिना, मानव-समान ग्रोसरी पैकिंग अनुक्रम उत्पन्न करने के लिए भाषा और विजन फाउंडेशन मॉडल्स का लाभ उठाता है, जिससे रिटेल ऑटोमेशन में उत्पाद क्षति को रोकने की महत्वपूर्ण चुनौती का समाधान होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने एक दोस्त को सामान पैक करने में मदद कर रहे हैं। आपके पास अलग-अलग चीजों का ढेर है: एक भारी कास्ट-आयरन कड़ाही, कांच के नाजुक बर्तनों का एक डिब्बा, फ्रोजन मटर की एक थैली और ब्रेड का एक लोफ। अगर आप उन्हें बस बेतरतीब ढंग से फेंक देंगे, तो कांच टूट जाएगा, ब्रेड दब जाएगी और मटर पिघल जाएगी। आपको एक ऐसी योजना की आवश्यकता है जो प्रत्येक वस्तु के "व्यक्तित्व" का सम्मान करे।
यह बिल्कुल वही समस्या है जिसे पेपर iPack हल करने की कोशिश करता है, लेकिन रोबोट्स के लिए।
समस्या: रोबोट्स में "कॉमन सेंस" (सामान्य समझ) की कमी होती है
रोबोट कारखानों में चीजें ले जाने में बहुत अच्छे होते हैं जहाँ सब कुछ एक परफेक्ट बॉक्स की तरह होता है। लेकिन वास्तविक दुनिया में—जैसे कि किराने की दुकान या रसोई में—चीजें अजीब होती हैं। कुछ भारी होती हैं, कुछ नाजुक होती हैं, और कुछ चिपचिपी होती हैं। पारंपरिक रोबोट्स में "कॉमन सेंस" नहीं होता। वे यह नहीं जानते कि आपको अंडे के कार्टन के ऊपर एक भारी तरबूज नहीं रखना चाहिए। आमतौर पर, रोबोट को यह सिखाने के लिए, आपको हर एक प्रकार की वस्तु के लिए नियमों को मैन्युअल रूप से प्रोग्राम करने में महीनों बिताने पड़ते हैं, जो कि असंभव है क्योंकि दुनिया में बहुत सारी चीजें हैं।
समाधान: iPack (एक दिमाग वाला रोबोट)
लेखकों ने iPack बनाया है, एक ऐसा सिस्टम जो रोबोट को हर नई वस्तु के लिए फिर से प्रशिक्षित किए बिना बुद्धिमानी से चीजें पैक करने की अनुमति देता है। iPack को एक ऐसे रोबोट के रूप में सोचें जिसके पास दो सुपरपावर हैं: आंखें और कॉमन सेंस।
यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:
1. "आंखें" (परसेप्शन/समझ)
सबसे पहले, रोबोट उस मेज को देखता है जहाँ चीजें बिखरी हुई हैं। यह हर वस्तु को खोजने के लिए उन्नत कैमरों और AI का उपयोग करता है।
- जादुई ट्रिक: केवल "एक बॉक्स" देखने के बजाय, रोब besteht एक स्मार्ट AI (विज़न लैंग्वेज मॉडल) से वस्तु को पहचानने के लिए पूछता है। क्या यह सूप का एक कैन है? चिप्स का एक बैग?
- अनुमान: रोबोट को यह भी जानने की आवश्यकता है कि वस्तुएं कितनी भारी या बड़ी हैं। चूंकि वह कैमरे से उन्हें पूरी तरह से नहीं तौल सकता, इसलिए वह वस्तु के मानक वजन और आकार को प्राप्त करने के लिए ऑनलाइन (जैसे किसी रेसिपी या उत्पाद पृष्ठ को देखकर) वस्तु को "खोजने" के लिए AI का उपयोग करता है। यदि यह कोई अजीब फल है, तो AI इसके दिखने के आधार पर अनुमान लगाता है।
2. "कॉमन सेंस" (प्लानिंग/योजना)
यह सबसे महत्वपूर्ण हिस्सा है। रोबोट एक लार्ज लैंग्वेज मॉडल (LLM)—जो मूल रूप से एक सुपर-स्मार्ट चैटबॉट है जिसे मानव ज्ञान के सभी स्रोतों पर प्रशिक्षित किया गया है—से एक सरल प्रश्न पूछता है: "यदि मेरे पास ये विशिष्ट वस्तुएं हैं, तो सबसे सुरक्षित तरीका क्या है जिससे मैं उन्हें इस तरह से स्टैक (एक के ऊपर एक रख) सकूँ कि कुछ भी टूटे नहीं?"
AI इन नियमों के साथ उत्तर देता है:
- "फ्रोजन पालक को ब्रेड के बगल में न रखें (इससे ब्रेड गीली हो जाएगी)।"
- "भारी जार को नीचे रखें।"
- "केले को एक नरम जगह चाहिए, सीरियल बॉक्स के नीचे नहीं।"
रोबोट फिर इन "मानव जैसी" नियमों को एक गणितीय पहेली सॉल्वर (जिसे मिक्स्ड-इंटीजर लीनियर प्रोग्रामिंग कहा जाता है) में फीड करता है। यह सॉल्वर एक 3D टेट्रिस मास्टर की तरह कार्य करता है, जो सभी सुरक्षा नियमों का पालन करते हुए और सब कुछ फिट होने के लिए एक आदर्श व्यवस्था की गणना करता है।
3. "हाथ" (एक्जीक्यूशन/क्रियान्वयन)
एक बार जब योजना तैयार हो जाती है, तो रोबोट एक-एक करके वस्तुओं को उठाता है, स्टैक के निचले हिस्से से शुरू करता है और ऊपर की ओर बढ़ता है। यह एक विशेष, सॉफ्ट ग्रिपर (एक कोमल हाथ की तरह) का उपयोग करता है जो महसूस कर सकता है कि वह कितना जोर से दबा रहा है। वह प्रत्येक वस्तु को ठीक वहीं रखता है जहाँ गणित ने उसे जाने के लिए कहा था।
यह विशेष क्यों है?
- कोई ट्रेनिंग की आवश्यकता नहीं: आपको रोबोट को यह सिखाने की जरूरत नहीं है कि "अनानास" क्या है। यदि आप उसे पहली बार अनानास दिखाते हैं, तो AI जानता है कि वह क्या है और उसे कैसे पैक करना है। यह किसी भी वस्तु (ओपन-वोकेबुलरी) के साथ काम करता है।
- सही बॉक्स ढूंढना: यह केवल एक बॉक्स पैक नहीं करता है; यह अलग-अलग आकार के बक्सों की एक शेल्फ को देख सकता है और वह सबसे छोटा बॉक्स चुन सकता है जिसमें सब कुछ फिट हो जाए, जिससे जगह बचती है।
- मानव जैसा: शोधकर्ताओं ने इसका परीक्षण करने के लिए वास्तविक मनुष्यों से पूछा कि वे वस्तुओं को कैसे पैक करेंगे। उन्होंने एक "कंसिस्टेंसी स्कोर" बनाया यह मापने के लिए कि रोबोट की पैकिंग मानव अंतर्ज्ञान से कितनी मेल खाती है। iPack ने बहुत उच्च स्कोर प्राप्त किया, जिसका अर्थ है कि इसने चीजों को उसी तरह से पैक किया जैसे एक सावधान इंसान करता है।
परिणाम
टीम ने कंप्यूटर सिमुलेशन और एक वास्तविक रोबोटिक आर्म के साथ iPack का परीक्षण किया।
- सफलता दर: रोबोट लगभग 93% बार वस्तुओं को सफलतापूर्वक पैक करता है।
- दक्षता (एफिशिएंसी): इसने उन पुराने तरीकों की तुलना में अधिक घनत्व (टाइट) से चीजें पैक कीं जिन्हें सुरक्षा नियमों की परवाह नहीं थी।
- गलतियां: जब यह विफल हुआ, तो यह आमतौर पर इसलिए था क्योंकि कैमरा थोड़ा धुंधला हो गया था (जिससे रोबोट पकड़ने में चूक गया) या रोबोट ने बॉक्स के किनारे से टक्कर मारी।
संक्षेप में
iPack एक रोबोट सिस्टम है जो वस्तुओं को समझने और उनके साथ व्यवहार करने के लिए एक चैटबॉट के "दिमाग" का और उन्हें पूरी तरह से व्यवस्थित करने के लिए एक पहेली सॉल्वर के "गणित" का उपयोग करता है। यह रोबोट को किराने का सामान या मूविंग बॉक्स को उसी सावधानी और कॉमन सेंस के साथ पैक करने की अनुमति देता है जो एक इंसान इस्तेमाल करता है, बिना स्टोर की हर एक वस्तु के लिए मैन्युअल रूप से प्रोग्राम किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।