← Últimos artículos
💬 NLP

D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models

Este artículo identifica un compromiso fundamental entre diversidad y estabilidad en los modelos de lenguaje de gran escala al distinguir entre los "modelos-D" con probabilidades de muestreo variables y desalineadas con la tarea y los "modelos-E" con probabilidades estables y alineadas con la tarea, ofreciendo perspectivas críticas para optimizar la selección de modelos en aplicaciones a escala web.

Autores originales: Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

Publicado 2026-01-30
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le pides a un grupo de asistentes de IA que jueguen a un juego de "Adivina el número". Les das una regla específica: "Elige números entre 1 y 4, pero asegúrate de elegir el número '2' aproximadamente el 70% de las veces, y los otros (1, 3 y 4) aproximadamente un 10% cada uno".

Este artículo investiga cómo diferentes Modelos de Lenguaje de Gran Escala (LLM) manejan este juego. Los investigadores descubrieron que los modelos caen en dos tipos de personalidad distintos, que llaman D-Models y E-Models.

Aquí está el desglose de lo que encontraron, utilizando analogías sencillas:

1. Las dos personalidades

El Modelo "Decisivo" (D-Model)

  • Ejemplos: Qwen-2.5, Llama-3.1.
  • La analogía: Imagina a un jefe de cocina estricto que tiene una opinión muy fuerte. Cuando se le pide que haga una ensalada, este chef decide: "Voy a usar solo lechuga para el 99% del tazón, y tal vez un poquito de tomate más tarde".
  • Cómo funcionan: Cada vez que eligen una palabra (o número), son extremadamente confiados. Casi siempre eligen una opción específica con una certeza cercana al 100%, ignorando las otras opciones.
  • El resultado: Aunque son muy seguros paso a paso, a veces tienen dificultades para cumplir la regla general que les diste (como la regla del 70%). Son "deterministas", lo que significa que se aferran a un plan rígido.

El Modelo "Explorador" (E-Model)

  • Ejemplos: Mistral-Small, GPT-4o.
  • La analogía: Imagina a un jardinero curioso. Cuando se le pide que plante semillas, piensa: "Está bien, plantaré principalmente tulipanes, pero también esparciré algunas margaritas y rosas desde el principio para que coincida con el plan del jardín".
  • Cómo funcionan: Estos modelos son más flexibles. Cuando eligen una palabra, mantienen las probabilidades de las diferentes opciones más cercanas a las reglas que les diste. No se bloquean en una elección inmediatamente; "exploran" las opciones de manera más equilibrada.
  • El resultado: Sus elecciones paso a paso se alinean mucho mejor con las reglas que estableciste. Son más "estables" al seguir instrucciones.

2. El gran compromiso: Variedad vs. Fiabilidad

El artículo encontró que ningún tipo es perfecto; tienen un compromiso, como elegir entre un funambulista y un músico de jazz.

  • D-Models (El Funambulista):

    • Buenos en: Tareas donde necesitas una única respuesta sólida y correcta, como escribir código o resolver problemas matemáticos. Debido a que son tan decisivos, pueden refinar una solución una y otra vez sin confundirse.
    • Malos en: Tareas en las que necesitas elegir de una lista de opciones (como recomendar películas). Debido a que son tan rígidos, podrían elegir con total confianza una película que ni siquiera estaba en tu lista, ignorando las restricciones.
  • E-Models (El Músico de Jazz):

    • Buenos en: Tareas en las que necesitas seguir una lista de candidatos o equilibrar diferentes necesidades, como resultados de búsqueda o recomendaciones. Son mejores para ceñirse al "menú" que les diste.
    • Malos en: A veces son demasiado flexibles. En tareas de programación, su constante "exploración" podría hacer que cambien el código demasiado, introduciendo errores donde un enfoque más simple y rígido habría funcionado mejor.

3. ¿Qué sucede dentro de la máquina?

Los investigadores miraron "bajo el capó" para ver por qué los modelos actúan de forma diferente:

  • Control de Temperatura: Piensa en la "temperatura" como un control de volumen para la aleatoriedad.
    • Los E-Models son como un micrófono sensible; girar el control cambia significamente su comportamiento. Puedes hacerlos más aleatorios o más estrictos fácilmente.
    • Los D-Models son como una piedra pesada; girar el control apenas los mueve. Se mantienen extremadamente confiados y rígidos sin importar cómo ajustes la configuración.
  • El mito del "Cupo": Los investigadores se preguntaron si los D-Models estaban llevando secretamente una tarjeta de puntuación (por ejemplo, "He elegido el '2' demasiadas veces, así que elegiré el '1' la próxima vez para equilibrar"). Lo probaron y no encontraron evidencia de esto. Los D-Models no están equilibrando una tarjeta de puntuación; simplemente están siguiendo un camino predeterminado y rígido.

Resumen

El artículo concluye que cuando usas una IA, necesitas saber con qué "personalidad" estás tratando:

  • Si necesitas fiabilidad y un cumplimiento estricto de una lista (como elegir de un menú de productos), elige un E-Model.
  • Si necesitas un razonamiento fuerte y consistente para tareas complejas como la programación, un D-Model podría ser mejor, incluso si es menos flexible.

El objetivo no es decir que uno sea "mejor", sino entender que tienen diferentes fortalezas y debilidades cuando se trata de seguir reglas de probabilidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →