← नवीनतम पेपर
🤖 AI

Aligning Compound AI Systems via System-level DPO

यह शोधपत्र SysDPO प्रस्तुत करता है, जो एक ऐसा ढांचा है जो जटिल, बहु-घटक कंपाउंड AI सिस्टम को डैरेक्टेड एसाइक्लिक ग्राफ (Directed Acyclic Graphs) के रूप में मॉडल करके और नॉन-डिफरेंशिएबल इंटरैक्शन की चुनौतियों तथा सिस्टम-स्तरीय प्राथमिकताओं को घटक स्तरों तक अनुवादित करने की कठिनाई को दूर करने के लिए डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (Direct Preference Optimization) का विस्तार करके उन्हें मानवीय प्राथमिकताओं के अनुरूप बनाता है।

मूल लेखक: Xiangwen Wang, Yibo Jacky Zhang, Zhoujie Ding, Katherine Tsai, Haolun Wu, Sanmi Koyejo

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiangwen Wang, Yibo Jacky Zhang, Zhoujie Ding, Katherine Tsai, Haolun Wu, Sanmi Koyejo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-दांव वाले फिल्म निर्माण के निर्देशक हैं। आपके पास केवल एक अभिनेता नहीं है; आपके पास पूरी क्रू है: एक पटकथा लेखक (screenwriter), एक वेशभूषा डिजाइनर (costume designer), एक विशेष प्रभाव टीम (special effects team), और एक निर्देशक।

AI की दुनिया में, ये कंपाउंड AI सिस्टम (Compound AI Systems) हैं। एक विशाल दिमाग द्वारा सब कुछ करने के बजाय, हमारे पास विशेषज्ञ AI मॉडलों की एक टीम है जो मिलकर काम करती है। एक मॉडल कहानी लिखता है, दूसरा चित्र बनाता है, और तीसरा तथ्यों की जांच करता है।

समस्या: "गलतफहमी" वाली क्रू
यह पेपर एक मजेदार लेकिन निराशाजनक समस्या की ओर इशारा करता है। कल्पना कीजिए कि आप अपनी क्रू से एक ऐसी फिल्म बनाने के लिए कहते हैं जहाँ एक बिल्ली धीरे-धीरे अधिक क्रोधित होती जाती है।

  • पटकथा लेखक (LLM) तीन स्क्रिप्ट लिखता है: "शांत बिल्ली," "थोड़ी परेशान बिल्ली," और "गुस्सैल बिल्ली।"
  • कलाकार (Image Generator) तीन चित्र बनाता है।

एक आदर्श दुनिया में, चित्र स्क्रिप्ट के साथ पूरी तरह मेल खाने चाहिए, जो शांत से गुस्से की ओर एक स्पष्ट विकास दिखाते हों। लेकिन वास्तव में, क्रू अक्सर तालमेल बिठाने में विफल रहता है। पटकथा लेखक एक "गुस्सैल" बिल्ली के लिए स्क्रिप्ट लिख सकता है, लेकिन कलाकार एक "सोती हुई" बिल्ली बना देता है क्योंकि वह उस वाइब (vibe) को पूरी तरह नहीं समझ पाया जिसे पटकथा लेखक दर्शाना चाह रहा था। या, पटकथा लेखक तीन ऐसी स्क्रिप्ट लिख सकता है जो मूल रूप से लगभग एक जैसी ही हैं, जिससे कलाकार के पास काम करने के लिए कुछ भी नहीं बचता।

जब आप केवल पटकथा लेखक को प्रशिक्षित करके इसे ठीक करने की कोशिश करते हैं, तो कलाकार अभी भी गलती करता है। यदि आप केवल कलाकार को प्रशिक्षित करते हैं, तो पटकथा लेखक अभी भी खराब निर्देश देता है। वे दो ऐसे लोगों की तरह हैं जो संगीत सुने बिना एक साथ नृत्य करने की कोशिश कर रहे हैं; उन्हें संगीत के साथ साथ मिलकर नृत्य करना सीखना होगा, न कि केवल अपने व्यक्तिगत कदम।

पुराना तरीका बनाम नया तरीका

  • पुराना तरीका (मानक AI प्रशिक्षण): आमतौर पर, हम AI मॉडलों को एक-एक करके प्रशिक्षित करते हैं। हम पटकथा लेखक को बेहतर लिखना सिखाते हैं, फिर हम कलाकार को बेहतर चित्र बनाना सिखाते हैं। लेकिन एक कंपाउंड सिस्टम में, "स्कोर" (क्या फिल्म अच्छी बनी?) केवल अंत में दिया जाता है। यह पटकथा लेखक को केवल अंतिम फिल्म के आधार पर ग्रेड देने जैसा है, बिना उसे यह बताए कि संवाद की कौन सी पंक्ति ने समस्या पैदा की थी।
  • पेपर का समाधान (SysDPO): लेखकों ने एक नया प्रशिक्षण तरीका बनाया है जिसे SysDPO कहा जाता है। इसे एक "सिस्टम-लेवल कोच" के रूप में सोचें।

SysDPO कैसे काम करता है (रूपक/Metaphor)
कल्पना कीजिए कि क्रू एक रिले रेस टीम है।

  1. मैप (DAG): सबसे पहले, लेखक दौड़ का एक नक्शा बनाते हैं। वे दिखाते हैं कि डेटा (baton) पटकथा लेखक से कलाकार तक कैसे पहुँचता है। यह मैप उन्हें यह देखने में मदद करता है कि हैंडऑफ (handoff) कहाँ होता है।
  2. कोच का फीडबैक: केवल फिनिश लाइन पर "अच्छा काम किया" या "बुरा काम किया" कहने के बजाय, कोच (SysDPO) पूरी दौड़ को देखता है।
    • यदि टीम विफल होती है, तो कोच केवल उस धावक पर नहीं चिल्लाता जिसने बैटन गिरा दिया। कोच पूरी श्रृंखला का विश्लेषण करता है।
    • क्या पहले धावक ने बैटन बहुत जल्दी पकड़ा? क्या दूसरे धावक ने बहुत देर से दौड़ना शुरू किया?
    • कोच दोनों धावकों के लिए एक साथ प्रशिक्षण को समायोजित करता है ताकि वे अगली बार बैटन को सुचारू रूप से पास करना सीख सकें।

दो विविधताएं
पेपर के पास इस कोचिंग सत्र को चलाने के दो तरीके हैं, जो इस बात पर निर्भर करते हैं कि आपके पास क्या डेटा है:

  1. SysDPO-Direct (द "फुल रीप्ले" विधि):

    • परिदृश्य: आपके पास पूरे दौड़ का वीडियो रिकॉर्डिंग है, जिसमें बैटन का पास भी शामिल है।
    • कैसे काम करता है: आप देख सकते हैं कि पटकथा लेखक ने क्या लिखा और कलाकार ने क्या बनाया। आप हर एक चरण के लिए स्कोर की गणना कर सकते हैं। यह प्रशिक्षित करने का सबसे सटीक तरीका है, लेकिन इसके लिए आपको सभी मध्यवर्ती डेटा (ड्राफ्ट, स्केच) को सहेजना आवश्यक है।
  2. SysDPO-Sampling (द "अनुमान और जांच" विधि):

    • परिदृश्य: आपके पास केवल अंतिम फिल्म है, लेकिन आपके पास ड्राफ्ट या स्केच नहीं हैं। आप यह नहीं जानते कि कलाकार के शुरू करने से पहले पटकथा लेखक ने वास्तव में क्या लिखा था।
    • कैसे काम करता है: कोच को रचनात्मक होना पड़ता है। वे कहते हैं, "ठीक है, आइए कल्पना करें कि पटकथा लेखक ने 5 अलग-अलग चीजें लिखी होंगी।" वे इन "क्या-होता-अगर" वाले परिदृश्यों को उत्पन्न करते हैं, उन्हें कलाकार के माध्यम से चलाते हैं, और देखते हैं कि कौन सा संयोजन सबसे अच्छा अंतिम परिणाम देता है। वे इसका उपयोग यह अनुमान लगाने के लिए करते हैं कि टीम को कैसे सुधारा जाए। यह एक पहेली को हल करने जैसा है जहाँ आप तब तक अलग-अलग टुकड़ों को आजमाते हैं जब तक कि तस्वीर फिट न हो जाए।

यह क्यों मायने रखता है
लेखकों ने इसे दो वास्तविक दुनिया की टीमों पर परखा:

  1. Text-to-Image: एक AI जो चित्र बनाने वाले AI के लिए प्रॉम्प्ट लिखता है।
  2. AI Debate: दो AI जो किसी समस्या को हल करने के लिए एक-दूसरे से बात कर रहे हैं।

परिणाम:

  • इस नए प्रशिक्षण से पहले, टीमें अनाड़ी थीं। "गुस्सैल बिल्ली" के चित्र अक्सर सोती हुई बिल्लियों जैसे दिखते थे।
  • SysDPO का उपयोग करने के बाद, टीमों ने समन्वय करना सीख लिया। पटकथा लेखक ने ऐसे प्रॉम्प्ट लिखना सीखा जिन्हें कलाकार वास्तव में समझ सके, और कलाकार ने लेखक के इरादे को बेहतर ढंग से समझना सीख लिया।
  • सफलता दर में उल्लेखनीय वृद्धि हुई। "गुस्सैल बिल्ली" का विकास स्पष्ट और सुसंगत हो गया।

मुख्य निष्कर्ष (Bottom Line)
यह पेपर AI टीमों को अकेले काम करने के बजाय एक साथ काम करना सिखाने के बारे में है। यह एक कमरे में एक साथ बजने वाले प्रतिभाशाली एकल कलाकारों के समूह और एक पूर्ण सामंजस्य के साथ बजने वाले सिम्फनी ऑर्केस्ट्रा के बीच का अंतर है। SysDPO (एक "सिस्टम-लेवल कोच") का उपयोग करके, हम इन जटिल AI क्रू को ऐसे परिणाम बनाने के लिए संरेखित कर सकते हैं जो मनुष्यों के लिए बहुत अधिक स्मार्ट, सुरक्षित और उपयोगी हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →