← Últimos artículos
💻 computer science

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

Este artículo presenta OpenRM, un modelo de recompensa aumentado con herramientas entrenado mediante Optimización de Política Relativa de Grupo para aprovechar la evidencia externa para evaluar con precisión tareas agénticas de formato largo, mejorando así significativamente el alineamiento y el rendimiento de la evaluación de los LLM descendentes.

Autores originales: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

Publicado 2026-07-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes a un bibliotecario muy inteligente (la IA) que es excelente escribiendo informes largos y detallados. Pero, a veces, este bibliotecario inventa cosas o se equivoca en los hechos porque solo confía en lo que tiene dentro de su propia cabeza, sin consultar los libros reales en los estantes.

Para solucionar esto, necesitamos a un Juez que califique los informes del bibliotecario. En el pasado, estos Jueces eran como estudiantes que tenían que memorizar toda la biblioteca en sus cabezas. Si la pregunta era sobre un hecho específico y oscuro o un descubrimiento médico de última hora, el Juez solía equivocarse porque no tenía el "libro" adecuado abierto frente a él.

OPENREWARD es un nuevo tipo de Juez que no solo depende de la memoria. Es como un Detective con un Teléfono Mágico.

Así es como funciona, desglosado de forma sencilla:

1. El Problema: El Juez de "Solo Memoria"

Imagina que le pides a un Juez que compare dos guías de viaje largas. Una guía dice: "Visite la Torre Eiffel en París", y la otra dice: "Visite la Torre Eiffel en Londres".

  • Los Jueces Antiguos: Podrían simplemente adivinar basándose en lo que creen saber. Si están cansados o la pregunta es complicada, podrían fallar al no detectar que no hay una Torre Eiffel en Londres.
  • El Problema: Para respuestas largas y compleicas (como consejos médicos o investigación científica), adivinar no es suficiente. Se necesita una prueba.

2. La Solución: El Juez "Detective" (OPENREWARD)

OPENREWARD es diferente. Cuando ve dos respuestas, no elige una inmediatamente. En su lugar, dice: "Espera, primero necesito verificar los hechos".

  • El Teléfono Mágico (Herramientas): Tiene un teléfono que puede llamar instantáneamente a Wikipedia, buscar artículos científicos o consultar bases de datos médicas.
  • La Investigación: Utiliza activamente estas herramientas para reunir evidencia. Puede buscar "clasificador Balanced Winnow" o "síntomas médicos" para ver qué dicen los datos reales.
  • El Veredicto: Solo después de reunir esta evidencia decide qué respuesta es mejor. Es como un juez que se niega a dar un veredicto hasta que ha leído el informe policial real.

3. Cómo Enseñamos al Detective (Entrenamiento)

No puedes simplemente decirle a una computadora: "Ve a ser un detective". Tienes que enseñarle cómo usar sus herramientas sin distraerse.

  • La "Biblioteca Falsa": Los investigadores no pudieron encontrar suficientes ejemplos del mundo real de "Respuesta Buena vs. Respuesta Mala" para estas tareas complejas. Así que construyeron una biblioteca simulada.
    • Tomaron un documento real (como una página de Wikipedia).
    • Le pidieron a una IA que escribiera una pregunta sobre él.
    • Luego, le pidieron a la IA que escribiera dos respuestas:
      1. La Respuesta Buena: A la IA se le permitió leer el documento.
      2. La Respuesta Mala: A la IA no se le permitió leer el documento (así que tuvo que adivinar o alucinar).
  • La Lección: Le mostraron al Juez Detective estos pares (Buena vs. Mala) y le enseñaron: "Si usas tu teléfono para verificar los hechos, recibes una estrella dorada. Si solo adivinas, recibes una penalización".
  • El Sistema de Recompensa: El Juez aprendió que para obtener la mejor puntuación, debe usar sus herramientas correctamente para encontrar la verdad, no solo hacer una suposición rápida.

4. Los Resultados: Por Qué Importa

Los investigadores probaron este nuevo Juez Detective contra otros Jueces famosos (como GPT-4 o jueces de IA especializados).

  • Mejor Precisión: OPENREWARD fue mucho mejor detectando la verdad en respuestas largas y complejas, especialmente en ciencia, medicina y conocimientos generales.
  • Mejor Maestro: También utilizaron a OPENREWARD para ayudar a entrenar otras IA. Al usar a OPENREWARD para elegir las mejores respuestas de un montón de datos desordenados, crearon un "libro de texto más limpio" para que otras IA aprendieran. Las IA entrenadas con estos datos "limpios" se volvieron más inteligentes y confiables.

Resumen de la Analogía

Piensa en los antiguos jueces de IA como estudiantes tomando un examen sin permitirles usar libros de texto. Tienen que adivinar.
OPENREWARD es un estudiante al que se le permite usar la biblioteca y el internet durante el examen. Debido a que puede buscar las respuestas, obtiene una puntuación mucho más alta y ayuda a que toda la clase aprenda mejor.

El artículo afirma que este método hace que la evaluación de la IA sea más confiable para tareas complejas y ayuda a entrenar mejores modelos de IA, pero evita decir que esté listo para el diagnóstico clínico real u otras aplicaciones específicas futuras más allá de lo que se probó en el estudio.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →