AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace
يقدم AgentRoom مساحة عمل تعاونية في الوقت الفعلي مدعومة بتقنية CRDT، تتيح البرمجة المتزامنة لمتعدد الوكلاء من خلال التنسيق على مستوى الملفات، مما يثبت أن التنسيق الفعال بين الوكلاء يتفوق بشكل كبير على كل من التنفيذ المنفرد والنهج المتوازي غير المنسق في تقليل هجر المهام وتحسين موثوقية البرمجة.
في مجال الذكاء الاصطنا-عي المتطور بسرعة، يقوم الباحثون بتعليم الحواسيب كتابة البرمجيات من خلال تقسيم المهام المعقدة إلى أجزاء أصغر وتكليف عدة عمال رقميين بها. يعتمد هذا النهج، المعروف باسم "البرمجة متعددة الوكلاء"، على فكرة أن فريقًا من البرامج المتخصصة يمكنه حل المشكلات بشكل أسرع وأكثر موثوقية من برنامج واحد يعمل بمفرده. ومع ذلك، لا تزال هناك عقبة كبيرة قائمة: فعندما يحاول عدة عمال تعديل الملفات الرقمية نفسها في نفس الوقت، فإنهم غالبًا ما يتداخلون مع بعضهم البعض، مما يسبب ارتباكًا أو يؤدي إلى استسلام أحد العمال تمامًا. ولحل هذه المشكلة، طور العلماء أنظمة تسمح لهؤلاء العمال بمشاركة مساحة عمل، على غرار كيفية استخدام الفرق البشرية للمستندات المشتركة التي تُحدث فورًا للجميع. والسؤال الذي يطرحه الباحثون الآن هو ما إذا كان مجرد السماح لهؤلاء الوكلاء بالعمل جنبًا إلى جنب كافيًا، أم أنهم بحاجة إلى طريقة أكثر هيكلية للتواصل والمطالبة بملكية مهامهم لتحقيق النجاح حقًا.
قام فريق من الباحثين ببناء نظام جديد يسمى "AgentRoom" للإجابة على هذا السؤال. لقد أنشأوا مساحة عمل رقمية مشتركة حيث يمكن لعدة وكلاء برمجة العمل في وقت واحد، ولكن مع إضافة حاسمة: مجموعة من الأدوات الرقمية التي تسمح للوكلاء بالمطالبة رسميًا بملكية ملفات محددة قبل البدء في الكتابة. تخيل مجموعة من الأشخاص يحاولون بناء منزل معًا؛ فبدون خطة، قد يحاول شخصان وضع الطوب على نفس الجدار في نفس الوقت، أو قد يبدأ شخص ما في بناء جدار ثم يبتعد، تاركًا المهمة غير مكتملة. في "AgentRoom"، وقبل أن يلمس الوكيل ملفًا ما، فإنه يعلن عن نيته وينتظر التأكيد من عدم وجود شخص آخر يعمل عليه. يعمل هذا النظام على نوع خاص من التخزين المشترك الذي يدمج التغييرات التي يجريها الوكلاء المختلفون تلقائيًا، مما يضمن توافق تعديلاتهم دون فقدان للبيانات. وقد اختبر الباحثون هذا الإعداد مقابل طرق أخرى، بما في ذلك الأنظمة التي يعمل فيها الوكلاء في صمت تام أو الأنظمة التي يتبادلون فيها الأدوار واحدًا تلو الآخر.
أظهرت النتائج أن التنسيق الهيكلي الذي وفره "AgentRoom" أحدث فرقًا عميقًا في جودة العمل. فعندما عمل وكيلان معًا في تلك الغرفة المنسقة، كانت احتمالية تخليهما عن المهام الصعبة أقل بكثير مقارنة بوكيل واحد يعمل بمفرده. في كثير من الحالات، كان الوكيل المنفرد يبدأ مشروعًا، ويكتب ملفًا واحدًا فقط، ثم يتوقف، مقررًا أن المهمة صعبة للغاية. ومع ذلك، استمر الفريق المنسق في العمل. وعندما قارن الباحثون جودة الكود النهائي، أنتج الفريق المنسق نتائج أفضل بكثير من الفريق الذي عمل بالتوازي ولكن دون أي تواصل، وأفضل أيضًا من الفريق الذي يتبادل الأدوار في تسلسل صارم. ووجدت الدراسة أن الوكلاء في الغرفة المنسقة كانوا أقل عرضة للاستسلام في المهمة بمقدار ثلاثة عشر ضعفًا مقارنة بوكيل واحد يعمل بمفرده. وهذا يشير إلى أن مفتاح النجاح ليس مجرد امتلاك المزيد من العمال، بل في امتلاك نظام يساعدهم على التفاوض بشأن من يفعل ماذا ويمنعهم من التداخل في عمل بعضهم البعض.
اكتشف الباحثون أيضًا أن مجرد إضافة المزيد من الوكلاء لم يؤدِ دائمًا إلى نتائج أفضل. فعندما زادوا حجم الفريق من اثنين إلى ثلاثة أو أربعة وكلاء، بدأت جودة الكود في الانخفاض فعليًا. حدث هذا لأن الوكلاء بدأوا في عرقلة بعضهم البعض، وأصبح النظام مثقلًا بحجم الرسائل الهائل التي يرسلونها لتنسيق عملهم. كانت "نقطة التوازن المثالية" لإعدادهم هي وجود وكيلين يعملان معًا. علاوة على على ذلك، استبعدت الدراسة فكرة أن التحسن جاء ببساطة من وجود مساحة عمل مشتركة أو من قراءة الوكلاء لرسائل بعضهم البعض. فعندما أزالوا أدوات المطالبة الرسمية مع الإبقاء على مساحة العمل المشتركة، تحسن الأداء بشكل طفيف فقط. لقد كان نظام المطالبة بالملفات وبث تحديثات الحالة هو ما وفر الدفعة الكبيرة في الأداء.
يسلط هذا العمل الضوء على تحول جوهري في كيفية تفكيرنا في فرق الذكاء الاصطناعي. فلا يكفي مجرد منح عدة وكلاء ذكاء اصطناعي إمكانية الوصول إلى نفس الملفات والأمل في أن يجدوا طريقة للتعاون. فبدون بروتوكول واضح للمطالبة بالملكية وتوضيح النوايا، فإنهم عرضة للفشل، وغالبًا ما يستسلمون أمام المهام المعقدة أو ينتجون كودًا معطلًا. ومن خلال تقديم طبقة تنسيق بسيطة وهيكلية، أظهر الباحثون أن وكيلين يمكنهما العمل معًا بشكل أكثر فعالية من وكيل واحد، مما ينتج برمجيات ذات جودة أعلى وموثوقية أكبر. وتشير النتائج إلى أن مستقبل التعاون في مجال الذكاء الاصطناعي لا يكمن في جعل الوكلاء أكثر ذكاءً بشكل فردي، بل في بناء أنظمة أفضل لعملهم معًا، لضمان أن تؤدي جهودهم المشتركة إلى منتج نهائي بدلاً من مجرد مجموعة من المسودات المهجورة.
ملخص تقني: AgentRoom: البرمجة المتزامنة متعددة الوكلاء في مساحة عمل مشتركة مدعومة بـ CRDT
1. بيان المشكلة
تهدف أنظمة البرمجة متعددة الوكلاء المتزامنة إلى الاستفيد من تقسيم العمل، والوفرة، والاستكشاف المتوازي عبر المشاريع متعددة الملفات. ومع ذلك، تواجه النهج الحالية عائق تنسيق جوهري. تعتمد الأنظمة الحالية عادةً على تبادل الأدوار التسلسلي (مثل: التصميم ← التنفيذ ← المراجعة)، حيث ينتظر الوكلاء من سبقهم، أو التوازي غير المنسق، حيث يولد الوكلاء عينات مستقلة يتم دمجها لاحقاً.
تحدد الورقة نمط فشل محدد في الأنظمة المتزامنة غير المنسقة، وهو ظاهرة "الإنشاء الهيكلي والانسحاب" (stub-and-exit)، حيث يقوم وكيل واحد بإنشاء هيكل ملف واحد ثم يتخلى عن المهمة، غالباً لأنه حكم عليها بأنها صعبة للغاية. علاوة على ذلك، يؤدي التوازي غير المنسق غالباً إلى عمليات تجاوز صامتة للملفات أو صراعات دلالية (semantic conflicts) عند قيام عدة وكلاء بتعديل نفس الملفات دون تنسيق صريح. وبينما تحل أنواع البيانات المتكررة المتوافقة مع الصراعات (CRDTs) مشكلة اتساق البيانات للفرق البشرية، فإنها تضمن التقارب على مستوى البايت فقط، وليس التوافق الدلالي؛ إذ إن إدخال توقيعات دوال غير متوافقة من قبل وكيلين في نفس الموقع سيؤدي إلى دمج ناجح على مستوى البايت ولكنه سيكسر عملية التجميع (compilation).
السؤال البحثي الجوهري هو ما إذا كان التنسيق الصريح على مساحة عمل مشتركة مدمجة بواسطة CRDT يمكن أن يتفوق على كل من خطوط العمل التسلسلية والتوازي غير المنسق عند مستويات متساوية من القدرة الحوسبية.
2. المنهجية
بنية النظام: AgentRoom
AgentRoom هو بيئة تشغيل لوكلاء البرمجة المتزامنين مبنية على ثلاثة مكونات مصممة معاً:
مساحة العمل المشتركة (ركيزة CRDT): نظام ملفات مشترك يتوسطه pycrdt (نسخة من Y.js بلغة Rust). يقوم بدمج التعديلات المتزامنة على مستوى الحروف خلال زمن Δcrdt≈2 ثانية، مما يضمن الاتساق النهائي القوي (SEC).
واجهة التنسيق (أدوات MCP): يتفاعل الوكلاء عبر أدوات بروتوكول سياق النموذج (MCP) بدلاً من الدردشة غير المهيكلة. تشمل الأدوات الرئيسية:
room_claim(path): يخصص ملكية الملف بشكل ذري (atomically). يرفض الطلب إذا كان وكيل آخر يمتلك المسار.
room_release(path): يحرر الملكية.
room_broadcast/read: يحافظ على سجل رسائل JSONL مضاف فقط (append-only) لتحديثات الحالة.
room_state: يكشف عن الحالة الحالية للمطالبات ونشاط الأقران.
البروتوكول الاستشاري: يتبع الوكلاء سير عمل مكون من ست خطوات (قراءة الحالة، المطالبة بالملفات، المراجعة عند حدوث صراع، الكتابة، الاستطلاع، الإبلاغ عن الاكتمال). البروتوكول "استشاري" عند طبقة التوجيه (prompt layer)؛ فالنظام يفرض الملكية عبر أداة claim (المطالبة)، ولكن يُتوقع من الوكلاء التعاون. يحاكي هذا التصميم القفل الاستشاري بأسلوب Chubby، مما يسمح بإصلاح الأخطاء عبر الوكلاء (مثل قيام وكيل بتصحيح خطأ في التوجيه ارتكبه وكيل آخر) دون حظر صارم على مستوى النواة.
الإعداد التجريبي
النماذج: خمسة من نماذج البرمجة الرائدة (Anthropic Claude Sonnet 4.6, Haiku 4.5; OpenAI GPT-5.4, GPT-5.4-mini; Google Gemini 3 Flash).
المهام: أربع مهام في Express.js/TypeScript (T1–T5) تتراوح مستويات صعوبتها من توثيق JWT (6 ملفات) إلى سجل مالي مزدخل القيد مع كشف الاحتيال (أكثر من 15 ملفاً).
المقارنات المرجعية (Baselines):
Solo: وكيل واحد.
Shared-only: عدة وكلاء في مساحة عمل CRDT بدون أدوات MCP أو مطالبات تعاون.
Parallel-merge: عدة وكلاء في مساحات عمل منفصلة، يتم دمجها لاحقاً.
ChatDev-style: خط عمل تسلسلي قائم على الأدوار (المتطلبات ← التصميم ← التنفيذ).
المقاييس:
درجة الجودة (Quality Score): درجة مركبة [0, 1] يحددها نموذج حكم (Sonnet 4.6) بناءً على تغطية المواصفات، الصحة، جودة الكود، وصرامة الاختبارات. يتم التحقق منها تقاطعياً باستخدام مقاييس regex وAST.
معدل التخلي (Abandonment Rate): تصنيف ثنائي لـ "الانسحاب بملف واحد" (الإنشاء الهيكلي والانسحاب).
درجة الظهور (Emergence Score - ES): نسبة متوسط جودة الوكلاء المتعددين إلى متوسط جودة الوكيل المنفرد.
3. النتائج الرئيسية
الفئة الأولى: تقليل التباين والتخلي
النتيجة الأكثر قوة إحصائياً هي كبح نمط الفشل "الإنشاء الهيكلي والانسحاب".
احتمالات التخلي: عبر 12 طبقة من (النموذج × المهمة)، يظهر تقدير Cochran-Mantel-Haenszel المجمع (CMH) أن الوكلاء المنفردين (Solo) أكثر عرضة بـ 13.7 مرة للتخلي عن مهمة (الإنشاء الهيكلي بملف واحد) مقارقة بالوكلاء في AgentRoom (بفاصل ثقة 95% [3.9, 48]، p<10−5).
تقليل التباين: يقلل AgentRoom من الانحراف المعياري بين التشغيلات بنسبة 30–45% مقارنة بـ Solo. على سبيل المثال، في المهمة T4 مع Sonnet 4.6، انخفض σ من 0.23 (Solo) إلى 0.14 (AgentRoom ×2).
الآلية: تمنع بروتوكولات claim الصريحة الوكلاء من التجاوز الصامت لعمل بعضهم البعض أو التخلي عن المهام بسبب التعقيد المتصور، حيث يمكنهم تنسيق ملكية الملفات وطلب المساعدة.
الفئة الثانية: تحليل جودة وتنسيق المكونات
التنسيق مقابل التوازي: عند تساوي القدرة الحوسبية، يتفوق AgentRoom (×2) بشكل كبير على Parallel-merge (التوازي بدون تنسيق).
متوسط جودة AgentRoom: 0.669
متوسط جودة Parallel-merge: 0.456
الفرق: +0.213 (Welch t=3.35,p=0.003).
الاستنتاج: التوازي غير المنسق يؤدي لنتائج أقل من الوكيل المنفرد لأن الوكيل الثاني غالباً ما يكتب فوق عمل الأول. التنسيق هو المحرك الرئيسي للجودة، وليس مجرد التوازي.
التنسيق مقابل التسلسل: يتفوق AgentRoom على خط العمل التسلسلي ChatDev-style (0.333) بفارق كبير (0.669). الخطوط التسلسلية تضخم نمط فشل التخلي عند كل حدود مرحلة.
تحليل المكونات:
CRDT + Prompt (بدون MCP): 0.588 (أفضل قليلاً من Shared-only عند 0.575).
Full AgentRoom (CRDT + Prompt + MCP): 0.669.
الاستنتاج: أكبر مكسب في الأداء يأتي من قناة التنسيق الصريحة (أدوات MCP)، وليس مجرد الركيزة المشتركة أو مطالبات التعاون. الترتيب هو: Shared-only < Prompt-only < AgentRoom.
التوسع وعدم التجانس
عدد الوكلاء: تصل الجودة إلى ذروتها عند N=2 وكيل. زيادة العدد إلى N=3 أو $4$ تؤدي إلى عوائد متناقصة أو تدهور في الجودة، ويرجع ذلك على الأرجح إلى تشبع قناة البث الوحيدة وزيادة عبء التنسيق.
الأزواج غير المتجانسة: إن الجمع بين نموذج قوي (Sonnet) وآخر أضعف (Codex) يعطي درجات عالية (0.721)، لكن الجمع مع نموذج أضعف (Gemini) يعطي درجات أقل (0.542)، مما يشير إلى أن قدرة الوكيل الثاني مهمة وأن التنسيق لا يمحو الفجوات في قدرات النماذج.
عبر المجالات: تظل النتائج صالحة في فحوصات اللغات المختلفة (Rust+axum, Python DevBench)، وإن كانت أحجام العينات أصغر.
4. الأهمية والادعاءات
تدعي الورقة أن التنسيق الصريح، وليس التزامن أو ركيزة CRDT نفسها، هو المساهم الرئيسي في نجاح أنظمة البرمجة متعددة الوكلاء.
تحول في النموذج المعرفي: على عكس CodeCRDT (الذي يستخدم تنسيقاً ضمنياً قائماً على الملاحظة وأدواراً محددة مسبقاً)، يستخدم AgentRoom دلالات مطالبة صريحة على مستوى الملف عبر أدوات MCP. هذا ينقل السؤال التجريبي من "السرعة مقارنة بالخطوط التسلسلية" إلى "كبح أنماط الفشل".
كثافة المعلومات: يجادل المؤلفون بأن التنسيق يمنع انهيار الإنتروبيا المشتركة للمعلومات. بدون تنسيق، يصطدم الوكلاء في نفس الملفات، مما يهدر القدرة الحوسبية في تعديلات مكررة. مع المطالبات، يعمل الوكلاء على ملفات منفصلة، مما يرفع كثافة المعلومات بشكل شبه خطي مع N.
القفل الاستشاري: ينفذ النظام قفلاً استشارياً موزعاً عند طبقة التوجيه. هذا يسمح بالمرونة (مثل إصلاح الأخطاء عبر حدود الملفات) مع منع حالات الفشل الكارثية المتمثلة في "التجاوز الصامت" التي تعاني منها الأنظمة غير المنسقة.
القيود: يقر المؤلفون بأن النتائج محددة بالإعداد الحالي (Express.js/TypeScript، نماذج معينة)، وأن مقياس "الجودة" هو مركب من حكم LLM وليس أداة تنفيذ (execution oracle). تظل فوائد التوسع لما بعد N=2 سؤالاً مفتوحاً.
باختصار، يثبت AgentRoom أنه بالنسبة للبرمجة متعددة الوكلاء، فإن إدارة الحالة والإشارات الصريحة أكثر أهمية من التوازي الخام لعدة وكلاء أو قدرات الدمج التي توفرها ركيزة CRDT.