← Ultimi articoli
💬 NLP

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

Il documento introduce DR Tulu, un modello di ricerca profonda open-source addestrato tramite Apprendimento per Rinforzo con Rubriche in Evoluzione (RLER) che co-evolve i criteri di valutazione con la politica, consentendogli di superare gli agenti open esistenti e competere con i sistemi proprietari nelle attività di ricerca estesa, risultando al contempo significativamente più conveniente.

Autori originali: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca So
Pubblicato 2026-05-18
📖 5 min di lettura🧠 Approfondimento

Autori originali: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Il quadro generale: insegnare a un robot a fare il ricercatore

Immagina di voler insegnare a un robot a scrivere un lungo e dettagliato rapporto di ricerca su un argomento complesso, come "Come le mutazioni genetiche causano malattie rare?" o "Qual è la storia delle energie rinnovabili?".

La maggior parte dei modelli di intelligenza artificiale odierni sono come studenti che studiano solo per brevi verifiche. Sono eccellenti nel rispondere a domande semplici come "Qual è la capitale della Francia?", ma faticano quando viene chiesto loro di scrivere un rapporto di 20 pagine che richiede di setacciare centinaia di siti web, verificare i fatti e citare le fonti.

Gli autori di questo documento hanno creato una nuova intelligenza artificiale chiamata DR Tulu. È il primo modello open-source specificamente addestrato per essere un "Ricercatore Approfondito". Non si limita a indovinare; pianifica, cerca sul web, legge articoli e scrive un rapporto lungo e ben documentato.

Il problema: come si valuta un lungo rapporto?

Per insegnare a un'intelligenza artificiale a migliorare, solitamente si utilizza un metodo chiamato Apprendimento per Rinforzo. Pensa a questo come all'addestramento di un cane:

  1. Il cane (l'IA) esegue un trucco.
  2. Se lo fa bene, riceve un premio (una ricompensa).
  3. Se lo fa male, non riceve alcun premio.

Il problema con i lunghi rapporti di ricerca è che è difficile sapere come appare un "buon" rapporto.

  • Rubriche statiche (il vecchio modo): Immagina un insegnante che dà al cane un elenco di controllo fisso: "Deve avere 5 paragrafi. Deve menzionare l'anno 1990". Se il cane scrive un rapporto brillante su 1991, l'insegnante lo bocchia perché non ha seguito l'elenco di controllo rigido. L'elenco di controllo non sa cosa il cane ha effettivamente scoperto.
  • Il problema del "libro chiuso": Se chiedi a un'intelligenza artificiale di scrivere l'elenco di controllo basandosi solo su ciò che sa già, potrebbe perdere fatti nuovi che ha appena scoperto su Internet.

La soluzione: "Rubriche evolutive" (l'insegnante intelligente)

Il documento introduce un nuovo metodo chiamato RLER (Reinforcement Learning with Evolving Rubrics - Apprendimento per Rinforzo con Rubriche Evolutive).

Immagina un Insegnante Intelligente che non utilizza un elenco di controllo fisso. Invece, l'insegnante osserva lo studente (l'IA) fare la sua ricerca in tempo reale.

  1. Lo studente cerca: Lo studente esce, trova nuovi fatti e scrive una bozza.
  2. L'insegnante si adatta: L'Insegnante Intelligente guarda cosa ha trovato lo studente. "Oh, non sapevo che quel fatto esistesse! Dovrei aggiungere una nuova regola al mio elenco: 'Deve spiegare questo nuovo fatto'."
  3. Il ciclo di feedback: L'insegnante aggiorna l'elenco di controllo mentre lo studente sta imparando. Se lo studente prova a imbrogliare (come copiare testo senza leggerlo), l'insegnante aggiunge immediatamente una regola: "Nessun imbroglio consentito".

In termini tecnici, il documento chiama queste Rubriche Evolutive. Sono criteri di valutazione che cambiano e diventano più intelligenti man mano che l'intelligenza artificiale esplora più informazioni. Questo permette all'IA di imparare dalle proprie scoperte invece di rimanere bloccata con un insieme statico di regole.

Il risultato: un super-ricercatore a basso costo

Gli autori hanno addestrato DR Tulu utilizzando questo metodo dell'"Insegnante Intelligente". Ecco cosa è successo:

  • È più intelligente: DR Tulu ha superato di gran lunga altri modelli di ricerca open-source. Ha scritto rapporti migliori, trovato fatti più accurati e citato le fonti correttamente.
  • Rivalizza i giganti: Ha funzionato tanto bene quanto (e talvolta meglio di) sistemi proprietari costosi di grandi aziende come OpenAI e Google.
  • È economico: Questa è la vittoria più grande. I sistemi costosi costano circa 1,80 dollari per domanda. DR Tulu costa circa 0,002 dollari per domanda. Questo è circa 1.000 volte più economico.

Il test della "malattia genetica"

Per dimostrare che funziona davvero, il team ha dato a DR Tulu un compito molto difficile: analizzare le mutazioni genetiche per vedere se potevano essere trattate con farmaci specifici. Questo è un compito solitamente riservato a esperti medici umani.

  • DR Tulu ha cercato con successo nei database medici, ha trovato articoli pertinenti e ha sintetizzato un rapporto.
  • È stato in grado di competere con i sistemi di intelligenza artificiale proprietari più costosi su questo compito.
  • Altri modelli open-source hanno fallito perché non riuscivano a trovare le citazioni giuste o a verificare i fatti.

La cassetta degli attrezzi: "dr-agent-lib"

Il documento ha rilasciato anche una "cassetta degli attrezzi" chiamata dr-agent-lib.

  • Pensa a questo come a un coltellino svizzero per i ricercatori di intelligenza artificiale.
  • Permette all'IA di utilizzare diversi strumenti: Ricerca Google, lettura di pagine web specifiche e ricerca di articoli accademici.
  • Crucialmente, l'IA impara a scegliere lo strumento giusto per il lavoro. Se la domanda riguarda la scienza, utilizza lo strumento "Ricerca Articoli". Se riguarda notizie generali, utilizza "Ricerca Web". Non si limita a usare un solo strumento alla cieca.

Riepilogo

Il documento presenta DR Tulu, un'intelligenza artificiale open-source che impara a svolgere ricerche approfondite e di lunga durata. Utilizza un metodo di addestramento speciale (Rubriche Evolutive) in cui le "regole di valutazione" dell'IA si aggiornano in tempo reale in base a ciò che l'IA scopre. Questo rende l'IA molto più intelligente, più accurata e significativamente più economica rispetto agli attuali strumenti di ricerca all'avanguardia. Gli autori hanno condiviso il codice, i dati e il modello in modo che chiunque possa utilizzarli.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →