UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems
Autori originali: Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan Feng, Biqing Qi, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao
Autori originali: Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan Feng, Biqing Qi, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Riepilogo Tecnico: UnityMAS-O
Enunciato del Problema
I sistemi multi-agente basati su Modelli Linguistici di Grande Dimensione (LLM) attuali decompongono tipicamente compiti complessi in ruoli interagenti (ad esempio, pianificatori, recuperatori, programmatori), ma si affidano a flussi di lavoro orchestrati manualmente definiti da prompt, strumenti e regole di controllo. Sebbene questi sistemi siano efficaci nell'inferenza, gli agenti stessi sono raramente ottimizzati attraverso un'interfaccia unificata di apprendimento per rinforzo (RL). I framework esistenti di post-addestramento RL (ad esempio, TRL, OpenRLHF, verl) mirano principalmente all'ottimizzazione di una singola politica. Manca loro l'astrazione necessaria per ottimizzare sistemi multi-agente definiti dall'utente arbitrari che richiedono interazione strutturata, assegnazione del credito specifica per ruolo e condivisione configurabile dei parametri. Di conseguenza, l'addestramento di pipeline multi-agente spesso porta a implementazioni specifiche per il compito che non possono confrontare facilmente diversi regimi di condivisione dei parametri o riutilizzare l'infrastruttura tra flussi di lavoro.
Metodologia: UnityMAS-O
UnityMAS-O è un framework generale di ottimizzazione RL progettato per trattare un flusso di lavoro multi-agente completo come unità di ottimizzazione, piuttosto che una singola risposta o una traiettoria di politica. Costruito estendendo il framework verl con un runtime a topologia a stella basato su Ray, introduce quattro astrazioni di primo livello per disaccoppiare la progettazione logica dell'agente dai parametri fisici del modello:
- Ruoli Logici degli Agenti: Gli utenti definiscono ruoli (ad esempio, pianificatore, verificatore) con prompt specifici, schemi di I/O e accesso agli strumenti. Questi sono oggetti a livello di flusso di lavoro, non legati a set di parametri unici.
- Mappature Agente–Modello (ϕ): Una mappatura configurabile dai ruoli logici alle istanze fisiche LLM. Questo supporta tre regimi:
- Condivisione Completa: Tutti i ruoli mappano su un singolo modello.
- Separazione Completa: Ogni ruolo mappa su un modello indipendente.
- Condivisione Parziale: Gruppi di ruoli correlati condividono i parametri mentre altri utilizzano modelli distinti.
- Grafici di Flusso di Lavoro (G): Grafi di calcolo diretti che rappresentano il flusso di esecuzione (sequenziale, parallelo, iterativo o ibrido). L'esecuzione produce traiettorie strutturate contenenti stati, azioni e dipendenze di controllo.
- Funzioni di Ricompensa Specifiche per Ruolo: Le ricompense sono definite a livello di nodo, turno e traiettoria. Il framework supporta ricompense ritardate e segnali di miglioramento marginale (ad esempio, ΔF1 o Δscore), assegnando il credito agli agenti specifici responsabili degli stati intermedi o dei risultati finali.
Architettura di Sistema:
Il sistema impiega un controller centrale e gruppi di worker locali al modello.
- Controller Centrale: Esegue il flusso di lavoro definito dall'utente, instrada le invocazioni degli agenti logici al gruppo di worker appropriato in base a ϕ, registra traiettorie strutturate e assembla le ricompense.
- Gruppi di Worker: Associati a istanze fisiche LLM specifiche, questi gruppi gestiscono l'inferenza asincrona, bufferizzano i tensori di rollout (log-probabilità, valori), calcolano i vantaggi ed eseguono aggiornamenti della politica distribuiti in stile PPO.
- Separazione dei Dati: I metadati di controllo del flusso di lavoro rimangono "sottili" e centrali, mentre i tensori di addestramento pesanti rimangono "spessi" e locali ai gruppi di worker, minimizzando l'overhead di comunicazione.
Contributi Chiave
Il paper presenta i seguenti contributi:
- Astrazione Unificata: Un framework che rappresenta congiuntamente i grafi di flusso di lavoro definiti dall'utente, i ruoli logici degli agenti, le mappature agente-modello e le traiettorie multi-agente strutturate.
- Condivisione Configurabile dei Parametri: Supporto nativo per condivisione completa, separazione completa e condivisione parziale, consentendo uno studio controllato della specializzazione, del costo delle risorse e del comportamento di ottimizzazione senza riscrivere la pipeline di addestramento.
- Runtime Distribuito: Un'architettura basata su Ray e
verlcaratterizzata da controllo centrale del flusso di lavoro, rollout asincrono, buffering locale al modello e aggiornamenti della politica per modello. - Interfaccia di Ottimizzazione Generale: Un'interfaccia che permette agli utenti di definire flussi di lavoro, agenti, mappature di modelli e ricompense per sistemi diversi senza modificare l'infrastruttura di ottimizzazione sottostante.
- Implementazione Open-Source: Rilascio del framework all'indirizzo
https://github.com/chenyiqun/UnityMAS-O.
Risultati Sperimentali
Gli autori istanziano UnityMAS-O su due famiglie di compiti verificabili: Question Answering (QA) potenziato dal recupero e generazione di codice riflessiva.
QA e Ricerca Agente:
Gli esperimenti sono stati condotti su Natural Questions (NQ) e HotpotQA utilizzando flussi di lavoro che vanno dal recupero parallelo a loop di ricerca iterativa (M-ASK).
- Miglioramenti delle Prestazioni: L'addestramento RL multi-agente (MARL) ha migliorato le prestazioni in tutti i flussi di lavoro valutati e nelle scale dei modelli (da 0.5B a 14B).
- Impatto sui Modelli Piccoli: I guadagni sono stati particolarmente pronunciati per i modelli più piccoli (ad esempio, gli agenti da 0.5B sono migliorati da ~0.02 a ~0.44 F1 su NQ), suggerendo che il MARL aiuta gli agenti specializzati per ruolo a soddisfare i protocolli di flusso di lavoro e a coordinarsi efficacemente.
- Condivisione dei Parametri: Gli esperimenti che confrontavano modelli condivisi rispetto a modelli indipendenti (ad esempio, 3B condivisi contro 4x3B indipendenti) hanno mostrato che i modelli condivisi convergono leggermente più lentamente ma raggiungono livelli di prestazioni finali simili, dimostrando la fattibilità dell'addestramento di flussi di lavoro multi-agente logici con parametri fisici condivisi.
Generazione di Codice Riflessiva:
Un flusso di lavoro a tre round di pianificazione–codifica–verifica–riflessione è stato testato su compiti di codice tenuti da parte.
- Metriche Rigide: Sotto la metrica rigorosa "tutti superati", il flusso di lavoro 3xQwen3-4B è migliorato da 0.255 a 0.686, e il 3xQwen3-8B da 0.290 a 0.738.
- Efficienza: L'addestramento MARL ha ridotto il numero medio di turni di verifica necessari per risolvere un problema (da ~2.5 a ~1.7), indicando un miglioramento del comportamento di arresto interno e dell'efficienza di esecuzione.
Significato e Affermazioni
Il paper afferma che il collo di bottiglia principale in molti sistemi multi-agente basati su LLM non è la progettazione del flusso di lavoro stesso, ma la mancanza di un'interfaccia di ottimizzazione principiale per il flusso di lavoro post-progettazione. UnityMAS-O affronta questo convertendo sistemi multi-agente specificati manualmente in politiche multi-agente addestrabili.
Gli autori posizionano UnityMAS-O come un substrato di ottimizzazione riutilizzabile che abilita:
- Ottimizzazione Sistematica: Convertire flussi di lavoro diversi in sistemi RL addestrabili con assegnazione esplicita del credito.
- Flessibilità: Studiare i compromessi tra specializzazione ed efficienza delle risorse attraverso la condivisione configurabile dei parametri.
- Efficienza: Migliorare non solo la correttezza finale, ma anche il coordinamento e l'efficienza di esecuzione delle interazioni multi-agente.
Il lavoro è presentato come un substrato pratico di sistemi per l'addestramento di sistemi multi-agente complessi e come una piattaforma per studiare il coordinamento, la specializzazione e la scalabilità in tali sistemi, piuttosto che come uno strumento di benchmarking per compiti specifici. Gli autori notano che sono in corso esperimenti in agenti incarnati e ingegneria del software per validare ulteriormente la generalità del framework.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.
Ricevi i migliori articoli di AI ogni settimana.
Scelto da ricercatori di Stanford, Cambridge e dell'Accademia francese delle scienze.
Controlla la tua casella di posta per confermare l'iscrizione.
Qualcosa è andato storto. Riprovare?
Niente spam, cancellati quando vuoi.