Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs
Este artículo presenta SciFactCheck, un referente de múltiples dominios que revela que el ajuste fino científico aumenta paradójicamente las alucinaciones y la asertividad en los modelos de lenguaje de gran tamaño mientras disminuye su confianza interna, desafiando así los enfoques actuales de ajuste fino específicos de dominio para mejorar la veracidad.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un bibliotecario brillante y muy culto que sabe un poco de todo. Este bibliotecario es tu Modelo de Lenguaje Extenso (LLM) estándar. Es excelente para charlar, pero a veces inventa cosas cuando no está seguro de los hechos. Esto se llama "alucinación".
Ahora, imagina que tomas a ese bibliotecario y lo envías a una universidad especializada para que estudie solo ciencia. Le entregas miles de libros de texto, artículos de investigación y revistas. Esperas que regrese como un "Experto Científico" que sea incluso más confiable que antes.
Este documento es una boleta de calificaciones de ese experimento, y las noticias son sorprendentemente malas.
Aquí está lo que los investigadores encontraron, utilizando analogías simples:
1. El "Especialista" empeoró en la verdad
Los investigadores crearon una prueba masiva llamada SCIFACTCHECK. Les pidieron a 18 modelos de IA diferentes (algunos generales, otros "entrenados científicamente") que escribieran párrafos cortos sobre 2,500 temas científicos diferentes, desde la ingeniería hasta la filosofía.
El Resultado: Los modelos "científicos" cometieron más errores que los generales.
- La Analogía: Es como llevar a un chef general a una escuela culinaria para aprender solo sobre especias. Esperarías que fueran mejores cocinando, pero en su lugar, empezaron a olvidar cómo hervir agua y sazonaron demasiado cada plato. El entrenamiento especializado pareció confundir a los modelos, haciéndolos menos confiables en hechos básicos que sus primos de propósito general.
2. Los tres tipos de "mentiras"
El estudio no solo analizó las respuestas "erróneas"; analizó cómo eran erróneas. Encontraron tres formas específicas en las que los modelos alucinaban:
- La mentira "Inverificable" (Inverifiability): El modelo inventa un hecho que suena real pero que no se puede encontrar en ningún libro o artículo.
- Analogía: El bibliotecario dice: "En 1995, una sociedad secreta de gatos gobernó el internet". Suena específico, pero no existe registro de esto.
- La mentira "Exagerada" (Overclaim): El modelo toma una pequeña verdad y la convierte en una gran certeza absoluta.
- Analogía: Un estudio dice: "Este fármaco podría ayudar a algunos pacientes". El modelo dice: "Este fármaco cura a todo el mundo". Exagera el alcance y la certeza.
- La mentira de "Cita Falsa" (Attribution): El modelo inventa una fuente para respaldar su afirmación.
- Analogía: El bibliotecario dice: "Según el famoso artículo del 'Journal of Space Physics' por el Dr. Smith...", pero ese artículo y ese doctor nunca existieron.
3. La paradoja del "Seguro de sí mismo pero Ignorante"
Uno de los hallazgos más extraños fue sobre cómo los modelos "sentían" sus propias respuestas.
- El Hallazgo: Los modelos entrenados científicamente utilizaron un lenguaje más seguro (palabras como "definitivamente", "probado", "siempre") pero eran en realidad menos seguros internamente (su "instinto" computacional era dudoso).
- La Analogía: Imagina a un estudiante que no sabe la respuesta a un problema de matemáticas. En lugar de decir "no estoy seguro", se pone de pie, levanta la mano y grita la respuesta con 100% de convicción. Han aprendido el estilo de un científico seguro de sí mismo, pero no han aprendido la sustancia. Son "ruidosamente erróneos".
4. El problema del "Verificador de Hechos"
Finalmente, los investigadores intentaron usar computadoras para calificar a estos modelos, y luego pidieron a expertos humanos que también los calificaran.
- El Resultado: Los calificadores computacionales y los expertos humanos no siempre estuvieron de acuerdo. Incluso los humanos tuvieron dificultades para ponerse de acuerdo sobre qué contaba como un "hecho científico" que pudiera ser verificado.
- La Analogía: Es como tener a un grupo de jueces tratando de calificar una rutina de gimnasia, pero ni siquiera pueden ponerse de acuerdo en las reglas del deporte. En algunos campos (como las matemáticas), todos están de acuerdo con las reglas. En otros (como la filosofía o las ciencias sociales), es muy difícil definir qué es "verificable".
La Conclusión Final
El documento concluye que simplemente entrenar a una IA con libros científicos no la convierte en un experto científico confiable. De hecho, podría hacerla más peligosa porque suena más segura de sí misma mientras es menos precisa. Necesitamos mejores herramientas para verificar las afirmaciones científicas, y no podemos asumir que una IA "especializada" es automáticamente mejor que una IA "general".
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.