← Últimos artículos
💻 computer science

VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?

El estudio VIBEPASS revela que, aunque los modelos de lenguaje avanzados pueden generar pruebas sintácticamente válidas, su capacidad para razonar sobre fallos específicos y reparar código de forma autónoma sigue siendo deficiente, ya que la generación de hipótesis de error, y no la validación de la salida, constituye el principal cuello de botella en el proceso de depuración.

Autores originales: Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

Publicado 2026-03-18
📖 4 min de lectura☕ Lectura para el café

Autores originales: Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que los modelos de inteligencia artificial (como los que escriben código) son como aprendices de cocineros muy talentosos.

Aquí tienes la explicación del paper "VIBEPASS" traducida a un lenguaje sencillo, usando analogías de la vida real:

🍳 El Problema: El Chef que "Casi" lo hace perfecto

Imagina que tienes un chef de IA (un modelo de lenguaje) al que le pides que cocine un plato complejo (escribir un programa).

  • Lo que pasa normalmente: El chef sigue la receta a la perfección. Si le pides que haga una tortilla, la hace. Si le pides que la pruebe con los ingredientes básicos, le sale bien. ¡Parece un genio!
  • El problema real: En el mundo real, la comida no solo se prueba con ingredientes básicos. A veces, si pones un poco más de sal, o si el huevo está frío, la tortilla se rompe. El chef de IA suele fallar en estos casos extraños y sutiles (los "bordes" o edge cases).
  • La situación actual: Los chefs de IA son tan buenos que pasan el 90% de las pruebas básicas. Pero cuando el plato falla silenciosamente en situaciones raras, nadie se da cuenta hasta que es tarde.

🔍 La Prueba: "VIBEPASS" (El Control de Vibe)

Los autores crearon un nuevo examen llamado VIBEPASS. No es un examen para ver si el chef sabe cocinar lo básico, sino para ver si tiene "sentido común" y puede encontrar sus propios errores.

El examen tiene dos partes principales:

1. El Detective (Generar la prueba perfecta)

Imagina que el chef ha cocinado un plato que casi está perfecto, pero tiene un defecto oculto.

  • La tarea: El chef debe inventar una situación específica (un "ingrediente raro") que haga que su propio plato falle, pero que funcione perfectamente si lo hiciera un chef humano experto.
  • El hallazgo: Los chefs de IA son muy buenos siguiendo la receta (escriben el ingrediente correcto), pero son terribles adivinando qué ingrediente hará que el plato se arruine.
    • Analogía: Pueden escribir la palabra "huevo" correctamente, pero no saben que si el huevo está podrido, la tortilla se echa a perder. Les falta la capacidad de pensar: "¿Qué podría salir mal?".

2. El Reparador (Arreglar el plato)

Una vez que el chef encuentra el ingrediente que arruina el plato, debe arreglar la receta.

  • La sorpresa:
    • Si el chef inventa su propia prueba (dice: "¡Ah! Si uso un huevo podrido, el plato falla") y luego lo arregla, lo hace muy bien.
    • Si alguien de fuera le da la prueba ("Usa un huevo podrido"), a veces lo arregla igual de bien, pero si la prueba de fuera no es la correcta, lo arregla peor que si no le hubieran dado ninguna pista.
  • La lección: Es más útil que el chef piense por sí mismo y descubra el error, en lugar de que alguien le diga "arregla esto" sin explicarle por qué.

📉 Lo que descubrieron (Los resultados)

  1. Más inteligente no significa mejor detective: Los modelos más avanzados y potentes (los "chefs" más famosos) no son necesariamente mejores encontrando sus propios errores sutiles. A veces, son tan buenos siguiendo instrucciones que se vuelven "ciegos" a los detalles extraños.
  2. El cuello de botella no es escribir, es pensar: El problema no es que no sepan escribir el código (la receta), sino que no saben razonar sobre por qué el código falla. Es como tener un escritor que escribe oraciones perfectas, pero no entiende la lógica de la historia.
  3. La auto-diagnóstico es clave: Cuando el modelo logra encontrar el error por sí mismo, es mucho más capaz de arreglarlo. Si falla en encontrar el error, intentar arreglarlo suele empeorar las cosas.

🎯 En resumen

El paper nos dice que, aunque las IAs son geniales escribiendo código, todavía no son buenos "auto-correctores".

  • Lo que hacen bien: Escribir recetas que funcionan en la cocina estándar.
  • Lo que les falta: La capacidad de decir: "Oye, si el cliente es alérgico a los cacahuetes, esta receta es un desastre, y aquí está cómo cambiarla".

VIBEPASS es la herramienta que usamos para medir si una IA tiene ese "sentido común" para encontrar y arreglar sus propios errores sutiles, y la conclusión es que, por ahora, todavía nos falta mucho camino por recorrer para que las IAs sean verdaderos ingenieros de software autónomos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →