OrgForge: A Multi-Agent Simulation Framework for Verifiable Synthetic Corporate Corpora
OrgForge एक ओपन-सोर्स मल्टी-एजेंट सिमुलेशन फ्रेमवर्क है जो भ्रम (hallucinations) और टाइमलाइन की विसंगतियों को समाप्त करने के लिए एक नियत (deterministic) इवेंट-ग्राउंड-ट्रुथ इंजन को LLM-आधारित सरफेस प्रोस जनरेशन से अलग करके, सत्यापन योग्य और कालानुक्रमिक रूप से सुसंगत सिंथेटिक कॉर्पोरेट कॉर्पोरा उत्पन्न करता है ताकि मजबूत RAG पाइपलाइन मूल्यांकन किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक मददगार ऑफिस असिस्टेंट बनना सिखाने की कोशिश कर रहे हैं। आप यह परीक्षण करना चाहते हैं कि क्या वह कंपनी के ईमेल, चैट संदेशों और प्रोजेक्ट टिकट्स के विशाल ढेर में से सही जानकारी ढूंढ सकता है जब कुछ गलत हो जाता है।
समस्या क्या है? वास्तविक कंपनी का डेटा अव्यवस्थित, निजी और अक्सर विरोधाभासी होता है। यदि आप एक मानक AI का उपयोग करके नकली डेटा बनाते हैं, तो AI अनजाने में खुद से झूठ बोल सकता है—जैसे कि एक ईमेल में कह देना कि सर्वर रात 3 बजे क्रैश हुआ था लेकिन एक प्रोजेक्ट टिकट में कहना कि यह सुबह 9 बजे हुआ था। यदि रोबोट इससे सीखता है, तो वह वास्तविक दुनिया में विफल हो जाएगा।
OrgForge एक नया टूल है जिसे शोधकर्ता जेफरी फ्लाइंट ने इसे हल करने के लिए बनाया है। इसे कॉर्पोरेट अराजकता के लिए एक "डिजिटल मूवी स्टूडियो" के रूप में समझें, लेकिन इसमें एक बहुत ही सख्त निर्देशक है जो कभी भी अभिनेताओं को कहानी में अपनी ओर से बदलाव (इम्प्रोवाइज़) करने नहीं देता।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. सख्त निर्देशक बनाम अभिनेता
अधिकांश AI सिस्टम में, AI कहानी भी लिखता है और तथ्यों का निर्णय भी लेता है। OrgForge में, वे अलग-अलग हैं:
- द इंजन (निर्देशक): एक कठोर, गणित-आधारित कंप्यूटर प्रोग्राम कंपनी के "भौतिकी" (physics) को चलाता है। यह तय करता है कि सर्वर ठीक कब क्रैश हुआ, ऑन-कॉल कौन है, कर्मचारी कितना तनावग्रस्त है, और सटीक समय क्या है। यह हर एक तथ्य का एक सटीक, अपरिवर्तनीय लॉग रखता है।
- LLMs (अभिनेता): लार्ज लैंग्वेज मॉडल्स (LLMs) को केवल संवाद लिखने के लिए काम पर रखा जाता है। वे निर्देशक के तथ्यों ("सर्वर रात 3 बजे क्रैश हुआ, और बॉब तनाव में है") को लेते हैं और उन्हें एक वास्तविक स्लैक (Slack) संदेश या ईमेल के रूप में लिखते हैं। वे तथ्यों को बदल नहीं सकते; वे केवल उन्हें शब्दों का रूप दे सकते हैं।
उपमा: एक अदालत की कल्पना करें। जज (इंजन) टाइमलाइन और सबूतों का निर्धारण करता है। वकील (LLMs) मामले पर बहस करते हैं और भाषण लिखते हैं। वकील नाटकीय हो सकते हैं, लेकिन वे उस चीज़ के बारे में झूठ नहीं बोल सकते जो जज ने पहले ही आधिकारिक लॉग में दर्ज कर दी है।
2. "सोशल स्ट्रेस" (सामाजिक तनाव) का खेल
OrgForge केवल यादृच्छिक शोर (random noise) पैदा नहीं करता है; यह सिम्युलेट करता है कि लोग दबाव में कैसे प्रतिक्रिया देते हैं।
- स्ट्रेस बैटरी: प्रत्येक कर्मचारी के पास एक छिपी हुई "तनाव बैटरी" होती है। जब संकट आता है, तो यह बैटरी खत्म होने लगती है।
- रिपल इफेक्ट (लहर प्रभाव): यदि कोई मुख्य व्यक्ति (जैसे टीम लीड) अत्यधिक तनाव में आता है, तो उनका तनाव उनके साथियों पर भी "रिसने" लगता है, ठीक वैसे ही जैसे एक भारी बैकपैक हाइकिंग ग्रुप के सभी लोगों को धीमा कर देता है।
- फ्रेंडशिप मैप (मित्रता मानचित्र): सिस्टम ट्रैक करता है कि कौन किससे बात करता है। यदि दो लोग संकट के दौरान एक साथ काम करते हैं, तो उनका "मित्रता बंधन" मजबूत हो जाता है। यदि वे एक सप्ताह तक एक-दूसरे को अनदेखा करते हैं, तो बंधन कमजोर हो जाता है। यह बिना AI के अनुमान लगाए, स्वचालित रूप से होता है।
3. "टाइम ट्रैवल" (समय यात्रा) का समाधान
नकली डेटा के साथ सबसे बड़ी समस्याओं में से एक है 'टाइम ट्रैवल'। एक नकली ईमेल कह सकता है, "मैंने त्रुटि देखी," लेकिन एरर लॉग कहता है कि त्रुटि ईमेल भेजे जाने के बाद हुई थी।
OrgForge प्रत्येक कर्मचारी के लिए एक "पर्सनल क्लॉक" का उपयोग करता है।
- यदि बॉब एक बग को ठीक कर रहा है, तो उसकी घड़ी आगे बढ़ती है।
- यदि एलिस बॉब को जवाब देती है, तो उसकी घड़ी बॉब की घड़ी से आगे होनी चाहिए।
- सिस्टम टाइमलाइन को तार्किक रूप से आगे की ओर बहने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि कारण हमेशा प्रभाव से पहले आए। कोई टाइम ट्रैवल नहीं!
4. "खोया हुआ ईमेल" परीक्षण
वास्तविक कार्यालय शोर से भरे होते हैं। कभी-कभी एक ईमेल खो जाता है, या एक मैनेजर शिकायत को अनदेखा कर देता है।
OrgForge जानबूझकर ऐसा सिम्युलेट करता है। यह एक ग्राहक शिकायत ईमेल उत्पन्न कर सकता है जिसका उत्तर कभी नहीं दिया गया।
- क्यों? रोबोट का परीक्षण करने के लिए। यदि रोबोट से पूछा जाता है, "क्या हमने ग्राहक की शिकायत को ठीक किया?" और उत्तर यह है कि "नहीं, क्योंकि ईमेल ड्रॉप हो गया था," तो रोबोट को यह समझना होगा कि जवाब का अनुपलब्ध होना भी एक वैध उत्तर है। अधिकांश AI सिस्टम भ्रमित हो जाते हैं जब उत्तर "कुछ नहीं हुआ" होता है।
5. अंतिम परीक्षा
एक बार जब सिमुलेशन 30 दिनों तक चलता है, तो OrgForge नकली लेकिन पूरी तरह से सुसंगत कंपनी दस्तावेजों का एक विशाल डेटासेट तैयार करता है। इसके बाद यह स्वतः ही एक टेस्ट जेनरेट करता है:
- प्रश्न: "मंगलवार को डेटाबेस क्रैश के बारे में सबसे पहले व्यक्ति को कैसे पता चला?"
- उत्तर: सिस्टम को सटीक उत्तर पता है क्योंकि इसने लॉग लिखा है।
- स्कोर: यह जांचता है कि क्या रोबोट ने सही ईमेल, सही टिकट और सही टाइमलाइन को खोजा।
यह क्यों महत्वपूर्ण है
Orgifeore से पहले, कॉर्पोरेट डेटा पर AI का परीक्षण करना अदृश्य दीवारों वाले ट्रैक पर ड्राइवर का परीक्षण करने जैसा था। आपको पता नहीं चलता था कि वे खराब ड्राइवर थे या ट्रैक टूटा हुआ था।
Orgifeore पूरी तरह से चिह्नित दीवारों वाला ट्रैक बनाता है। यह हमें स्पष्ट रूप से देखने की अनुमति देता है कि AI कहाँ विफल होता है:
- क्या उसने ईमेल मिस कर दिया?
- क्या उसने टाइमलाइन गलत समझ ली?
- क्या उसने किसी ऐसे व्यक्ति की कल्पना की (hallucinate) जो अस्तित्व में ही नहीं है?
"तथ्यों" को "शब्दों" से अलग करके, OrgForge हमें ऐसे AI असिस्टेंट बनाने का तरीका देता है जो वास्तव में आधुनिक कार्यालय की जटिल और अव्यवस्थित वास्तविकता के लिए तैयार हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।