Train, Retrieve, or Both? A Four-Arm Head-to-Head for Correct Statutory Citation on the Ontario Residential Tenancies Act
Este artículo presenta una evaluación de cuatro brazos que demuestra que un modelo Qwen2.5-7B ajustado mediante SFT y combinado con recuperación (SFT+RAG) logra la mayor precisión al citar la Ley de Arrendamientos Residenciales de Ontario al tiempo que elimina las alucinaciones, superando tanto al ajuste fino independiente como a los enfoques de solo recuperación sin requerir modelos de recuperación especializados ni conjuntos de datos más grandes.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás tratando de encontrar la regla exacta en un enorme libro de reglas de 300 páginas (la Ley de Arrendamientos Residenciales de Ontario) que responda a una pregunta específica, como "¿Cuánto aviso debe dar un propietario antes de entrar en mi apartamento?".
El objetivo no es escribir un ensayo hermoso; es señalar con el dedo la página y el número de párrafo exactos (la cita) para que una persona común pueda consultarlo por su cuenta.
Este documento es una "prueba de sabor" para determinar la mejor manera de enseñar a una computadora a hacer esto. Los investigadores organizaron una carrera entre cuatro estrategias utilizando un modelo de IA inteligente (un cerebro digital) para ver cuál encuentra la regla correcta sin inventar cosas.
Así es como se desempeñaron los cuatro corredores en la carrera:
Los Cuatro Corredores
El "Cerebro en Bruto" (Modelo Base):
*La Analogía: Esto es como preguntarle a un estudiante muy inteligente que ha leído el libro de reglas una vez pero no lo ha memorizado. Intenta adivinar el número de página de memoria.
*El Resultado: Falló por completo. No pudo encontrar la página correcta y, el 81% de las veces, inventó un número de página falso que no existía. Son demasiado poco fiables para este trabajo.El "Memorizador" (Solo Ajuste Fino/Fine-Tuning):
*La Analogía: Es el mismo estudiante, pero pasó semanas practicando con fichas de estudio de "Pregunta → Número de Página". Conoce el formato e intenta memorizar las respuestas.
*El Resultado: Dejó de inventar páginas falsas, pero seguía equivocándose en los números específicos. Recordaba la idea de la regla, pero confundía los números de sección exactos. Es como saber que la regla trata sobre el "ruido", pero suponer que está en la página 50 en lugar de la 52.El "Bibliotecario" (Solo Recuperación/Retrieval):
*La Analogía: Este estudiante no intenta memorizar nada. En su lugar, tiene un bibliotecario superrápido que busca el libro por él. Al estudiante solo se le permite responder usando las páginas que el bibliotecario le entrega.
*El Resultado: Esta fue una mejora enorme. Debido a que el estudiante se ve obligado a mirar el texto real, nunca inventa números de página falsos (0% de alucinaciones). Sin embargo, a veces el bibliotecario le entrega una pila de 10 páginas y el estudiante se confunde sobre cuál es la página exacta correcta.El "Súper Equipo" (Híbrido: Memorizador + Bibliotecario):
*La Analogía: Este es el estudiante que hizo los ejercicios de las fichas de estudio Y ADEMÁS tiene al bibliotecario. Los ejercicios le enseñaron a ser un mejor juez cuando el bibliotecario le entrega una pila de páginas desordenada.
*El Resultado: Este equipo ganó la carrera. Encontraron el número de página exacto con más frecuencia que cualquier otro. Los "ejercicios" les ayudaron a elegir la página correcta de la pila del bibliotecario, incluso cuando la pila era grande.
Las Grandes Sorpresas
- Más grande no siempre es mejor: Los investigadores intentaron usar un "súper-bibliotecario" (una herramienta de búsqueda más compleja y costosa) para ayudar a los estudiantes. No ayudó. El bibliotecario simple y barato funcionó igual de bien. Esto es una excelente noticia, ya que significa que no necesitas maquinaria pesada y costosa para resolver este problema.
- Estudiar más no ayudó: Intentaron darle al "Memorizador" más fichas de estudio. No lo hicieron mejores. El cuello de botella no era cuánto estudiaban; era que necesitaban al bibliotecario para encontrar el texto en primer lugar.
- El truco de "Cero Alucinaciones": La razón por la que el "Bibliotecario" y el "Súper Equipo" nunca inventaron reglas falsas es por diseño. El sistema tiene una puerta de seguridad: si el número de página no está en el libro que el bibliotecario sostiene, el sistema se niega a decirlo. Es una regla estricta, no una habilidad aprendida.
La Hoja de Puntuación Final
El "Súper Equipo" (Híbrido) obtuvo la mejor puntuación, pero aún no ganó la medalla de oro.
- La Meta: Los investigadores querían obtener una puntuación de 0.70 (acertar la respuesta el 70% de las veces).
- La Realidad: Obtuvieron 0.48 (acertar aproximadamente la mitad de las veces).
¿Por qué no obtuvieron el 100%?
- El Bibliotecario perdió el libro: A veces el bibliotecario no podía encontrar la página correcta en absoluto (aproximadamente el 11% de las veces). Si la página correcta no está en la pila, el estudiante no puede elegirla.
- El problema de la "Letra Pequeña": El estudiante a menudo encontraba la Sección (Capítulo) correcta, pero fallaba en el Subapartado (párrafo) específico. Es como encontrar el capítulo correcto pero el párrafo equivocado. Esto cuenta como una respuesta "medio correcta".
- Grupo de Prueba Diminuto: La prueba final solo tuvo 27 preguntas. Es como juzgar toda una temporada de un equipo deportivo basándose en un solo juego. Los resultados son prometedores, pero el tamaño de la muestra es demasiado pequeño para estar 100% seguros.
La Conclusión
Si quieres que una computadora señale a las personas la ley correcta:
- No le pidas simplemente que memorice la ley (inventará respuestas incorrectas).
- No le pidas simplemente que lea la ley (se confundirá con demasiado texto).
- Haz una combinación de un modelo que haya sido entrenado para entender el formato con una herramienta que busque la ley por ti.
Este enfoque es el más preciso, nunca miente sobre dónde está una regla y funciona bien sin necesidad de tecnología pesada y costosa. Sin embargo, todavía necesita trabajo para pasar de "bueno" (48% de precisión) a "excelente" (70% de precisión).
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.