← नवीनतम पेपर
🤖 machine learning

Hard Rules, Soft Preferences: Bridging Reasoning, Learning, and Optimization for Personalized Packing Checklist Generation

यह शोध पत्र एक तीन-चरणीय रीजनिंग-गाइडेड लर्निंग फ्रेमवर्क प्रस्तावित करता है जो एक सिम्बोलिक इंजन, एक प्रेफरेंस लर्नर और एक CP-SAT ऑप्टिमाइज़र को एकीकृत करता है ताकि व्यक्तिगत, नियम-अनुपालन वाली पैकिंग चेकलिस्ट जेनरेट की जा सके, जो सटीकता और बाधा संतुष्टि (कन्स्ट्रेंट सैटिस्फेक्शन) में मौजूदा LLMs और ग्रीडी मेथड्स से काफी बेहतर प्रदर्शन करते हुए एक प्रोडक्शन ट्रैवल ऐप में वास्तविक दुनिया की प्रभावकारिता प्रदर्शित करता है।

मूल लेखक: Himel Dev, Madhusudan Basak, Tanmoy Sen, Paromita Shome, Bashima Islam

प्रकाशित 2026-07-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Himel Dev, Madhusudan Basak, Tanmoy Sen, Paromita Shome, Bashima Islam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोड ट्रिप के लिए एक बेहतरीन प्लेलिस्ट बनाने की कोशिश कर रहे हैं। आप चाहते हैं कि गाने मूड के अनुकूल हों, लेकिन आपकी एक सख्त सीमा है: यदि आप बहुत अधिक स्ट्रीमिंग करते हैं तो आपके फोन की बैटरी खत्म हो सकती है, और आप हेवी मेटल गाना नहीं बजा सकते यदि आपकी दादी कार में बैठी हैं। यह "कन्स्ट्रेंड पर्सनलाइजेशन" (constrained personalization) का दैनिक संघर्ष है। कंप्यूटर विज्ञान की दुनिया में, यह एक पेचीदा पहेली है जहाँ एक मशीन को यह सीखना होता है कि आप क्या पसंद करते हैं (आपकी सॉफ्ट प्राथमिकताएं) जबकि वह सख्त नियमों (हार्ड रूल्स) का पालन करती है (जैसे सुरक्षा नियम या भौतिक स्थान की सीमाएं)। आमतौर पर, कंप्यूटर यह अनुमान लगाने में बहुत अच्छे होते हैं कि आपको क्या पसंद है, लेकिन सख्त नियमों का पालन करने में या तो बहुत अच्छे होते हैं या बहुत खराब। वे शायद वह गाना सुझा सकते हैं जो आपको पसंद है, लेकिन वे यह भूल सकते हैं कि वह आपकी बैटरी के लिए बहुत लंबा है, या वे नियमों का इतनी सख्ती से पालन कर सकते हैं कि प्लेलिस्ट उबाऊ हो जाए। बड़ा सवाल यह है कि वैज्ञानिक यह पूछ रहे हैं: हम एक ऐसा सिस्टम कैसे बनाएं जो एक मजेदार, व्यक्तिगत डीजे और एक सख्त, नियम मानने वाला बाउंसर दोनों हो?

यह पेपर ठीक इसी समस्या को हल करने के लिए डिज़ाइन किए गए एक चतुर तीन-चरणीय "मस्तिष्क" का परिचय देता है, विशेष रूप से विमान यात्रा के लिए आपका सूटकेस पैक करने के लिए। लेखकों ने, एक ट्रैवल ऐप 'FlyEnjoy' के साथ काम करते हुए, महसूस किया कि मौजूदा पैकिंग सहायक या तो बहुत सामान्य थे (सबको एक ही सूची देते थे) या बहुत जोखिम भरे थे (ऐसी चीजें सुझाते थे जो आपको सुरक्षा जांच में रोक सकती थीं)। इसे ठीक करने के लिए, उन्होंने एक ऐसा सिस्टम बनाया है जो एक रिले रेस की तरह तीन विशेषज्ञों की एक टीम के रूप में कार्य करता है।

सबसे पहले, 'नियम पुस्तिका रोबोट' (Rulebook Robot) आता है। आपकी पसंद के बारे में सोचने से पहले, यह चरण एक "सीड" (seed) चेकलिस्ट बनाने के लिए मानव द्वारा लिखित 226 नियमों की एक विशाल सूची का उपयोग करता है। यह एक अत्यधिक सतर्क मित्र की तरह है जो हर TSA नियम, सुरक्षा नियम और यात्रा संबंधी निर्भरता (जैसे "यदि आप कैमरा पैक करते हैं, तो आपको चार्जर भी पैक करना चाहिए") को जानता है। यह रोबोट आपकी व्यक्तिगत शैली की चिंता नहीं करता; यह बस यह सुनिश्चित करता है कि सूची सुरक्षित, कानूनी और पूर्ण हो। यह औसतन 49 वस्तुओं की एक बड़ी सूची बनाता है, यह सुनिश्चित करते हुए कि कोई भी आवश्यक चीज़ छूटे नहीं, भले ही आपने पहले कभी यात्रा न की हो।

इसके बाद, 'टेस्ट-मेकर' (Taste-Maker) की बारी आती है। यहीं पर मशीन लर्निंग होती है। सिस्टम देखता है कि वास्तविक लोग उन बड़ी, सुरक्षित सूचियों को कैसे संपादित (edit) करते हैं। क्या उन्होंने समुद्र तट की यात्रा के लिए भारी विंटर कोट को हटा दिया? क्या उन्होंने एक विशिष्ट प्रकार के हाइकिंग बूट जोड़े? सिस्टम दो चीजों को अलग-अलग सीखता है: पहला, कि कोई वस्तु बैग में होनी चाहिए या नहीं (समावेशन/inclusion), और दूसरा, अन्य वस्तुओं की तुलना में उसकी कितनी महत्ता है (रैंकिंग)। इन कार्यों को अलग करके, सिस्टम एक आम जाल से बचता है जिसे "सर्वाइवरशिप बायस" (survivorship bias) कहा जाता है, जहाँ वह किसी वस्तु को केवल इसलिए बेहतरीन मान सकता है क्योंकि वह संपादन प्रक्रिया में बची रही, इस तथ्य को नजरअंदाज करते हुए कि कई लोगों ने उसे पूरी तरह से हटा दिया होगा। यह चरण उच्च सटीकता के साथ आपकी व्यक्तिगत शैली को सीखता है, एक स्मार्ट स्टाइलिस्ट की तरह जो जानता है कि आप वास्तव में क्या पसंद करते हैं।

अंत में, 'ऑप्टिमाइज़र' (Optimizer) मंच संभालता है। यह गणित का जादूगर है। यह टेस्ट-मेकर से व्यक्तिगत सूची और रूलबुक रोबोट से सख्त नियम लेता है और एक जटिल पहेली को हल करता है। इसे आपके पसंदीदा सामानों को आपके बैग में इस तरह फिट करना होता है कि वजन की सीमा न टूटे, तरल पदार्थ के नियम न टूटें, या उन वस्तुओं के बीच अलगाव न हो जिन्हें साथ रहना चाहिए (जैसे कैमरा और उसका लेंस)। यह एक पूर्ण संयोजन खोजने के लिए CP-SAT नामक एक शक्तिशाली गणितीय उपकरण का उपयोग करता है। अन्य तरीकों के विपरीत जो केवल अनुमान और परीक्षण (guess and check) करते हैं (जो अक्सर विफल हो जाते हैं), यह ऑप्टिमाइज़र गारंटी देता है कि 100% समय, अंतिम सूची शारीरिक रूप से संभव और कानूनी रूप से अनुपालन योग्य है।

परिणाम प्रभावशाली हैं। 604 विभिन्न यात्रा परिदृश्यों पर परीक्षण किए जाने पर, रूलबुक रोबोट ने उन वस्तुओं को 99.7% याद रखा जो लोग वास्तव में चाहते थे। टेस्ट-मेकर ने 94.3% सटीकता के साथ यह अनुमान लगाने में महारत हासिल की कि लोग क्या रखेंगे। सबसे महत्वपूर्ण बात यह है कि ऑप्टिमाइज़र हर बार नियमों का पालन करते हुए सब कुछ पैक करने में सफल रहा, जबकि सरल तरीके 72% बार नियमों का पालन करने में विफल रहे। जब इस सिस्टम को एक वास्तविक ट्रैवल ऐप में तैनात किया गया, तो उपयोगकर्ताओं ने अपनी पैकिंग लिस्ट दोगुनी तेजी से पूरी की और कम बदलाव किए, जिससे साबित हुआ कि सख्त नियमों और स्मार्ट लर्निंग का यह मिश्रण वास्तव में वास्तविक दुनिया में काम करता है। यह पेपर सुझाव देता है कि इस तीन-भाग वाली टीम पद्धति का उपयोग अन्य कठिन समस्याओं के लिए किया जा सकता है जहाँ सुरक्षा और व्यक्तिगत पसंद आपस में टकराते हैं, जैसे कि अस्पताल से छुट्टी की योजना बनाना या आव्रजन (immigration) के कागजात व्यवस्थित करना, लेकिन फिलहाल, यह सिर्फ यह सुनिश्चित कर रहा है कि आप अपना टूथब्रश भूल न जाएं या सुरक्षा जांच में न फंसें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →