← Últimos artículos
🤖 machine learning

Towards Code-Oriented LM Embeddings for Surrogate-Assisted Neural Architecture Search

Este artículo propone COLE (Representaciones de Modelos de Lenguaje Orientadas a Código), una estrategia de bajo costo que aprovecha modelos de lenguaje disponibles para representar arquitecturas neuronales como código PyTorch, permitiendo una Búsqueda de Arquitectura Neuronal asistida por sustitutos competitiva sin ajuste especializado y reduciendo significativamente el presupuesto de evaluación necesario para encontrar modelos óptimos.

Autores originales: Pranav Somu, Advay Balakrishnan, Stepan Kravtsov, Aaron McDaniel, Jason Zutty

Publicado 2026-05-18
📖 4 min de lectura☕ Lectura para el café

Autores originales: Pranav Somu, Advay Balakrishnan, Stepan Kravtsov, Aaron McDaniel, Jason Zutty

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: Encontrar la Mejor Receta es Costoso

Imagina que eres un chef tratando de encontrar la receta absoluta mejor para un pastel. Tienes un libro de cocina masivo con millones de combinaciones posibles de ingredientes (harina, azúcar, huevos, especias) y métodos (tiempo de horneado, temperatura).

En el mundo de la Inteligencia Artificial, esto se llama Búsqueda de Arquitectura Neuronal (NAS). Las "recetas" son diseños de redes neuronales, y la "prueba de sabor" es entrenar la IA para ver qué tan bien funciona. El problema es que "probar" cada receta individual toma una eternidad y cuesta una fortuna en potencia de computación. No puedes hornear cada pastel del libro.

Para resolver esto, los científicos utilizan un Surrogado (o un "predicador de sabor"). Esto es como un crítico gastronómico que mira una receta en papel y adivina qué tan bueno sabrá el pastel, para que no tengas que hornearlo realmente. El objetivo es encontrar un crítico que sea rápido, barato y muy preciso.

La Vieja Forma: Traducir Recetas a un Idioma Extranjero

Anteriormente, para lograr que un crítico entendiera una receta, los científicos tenían que traducir el código complejo de la red neuronal a un formato de texto extraño y simplificado (como convertir una receta en una lista de fórmulas químicas o un diagrama extraño).

Piénsalo así: Tienes a un chef maestro (un Modelo de Lenguaje Grande, o LM) que sabe cocinar porque ha leído millones de libros de cocina y recetas reales. Pero en lugar de mostrarles la receta real, les entregas una traducción escrita en un idioma que nunca han visto (como "ONNX-a-texto" o "árboles de derivación").

Para hacer que el chef entienda este nuevo idioma, tienes que pasar semanas ajustando finamente su entrenamiento (fine-tuning)—esencialmente reeducándolos desde cero. Esto es lento, costoso y derrota el propósito de tener un "predicador de sabor" rápido.

La Nueva Idea: Solo Muéstrales la Receta Real

Los autores de este artículo, Pranav Somu y su equipo, tuvieron una idea simple: Las redes neuronales ya están escritas en código. Se ven como scripts de programación en Python.

Dado que los "chef maestros" (Modelos de Lenguaje Grandes como CodeLlama) ya fueron entrenados en billones de líneas de código de computadora real, ya saben leer estas recetas perfectamente. No necesitan ser reeducados.

La Solución (COLE):
En lugar de traducir la receta a un formato extraño, simplemente alimentan el código Python crudo directamente a la IA preentrenada.

  1. Sin Ajuste Fino: Utilizan la IA "tal cual" (congelada). Es como contratar a un chef que ya sabe leer tu libro de cocina específico sin necesidad de un seminario de capacitación.
  2. El Embedding: La IA lee el código y lo convierte en una "huella digital" matemática (un embedding) que captura la esencia de la receta.
  3. El Predictor: Una pequeña calculadora simple (una cabeza de regresión) mira esa huella digital y predice qué tan bien funcionará la arquitectura.

Lo Que Encontraron

El equipo probó esta idea utilizando dos "libros de cocina" diferentes (espacios de búsqueda) y encontró algunos resultados sorprendentes:

  • El Código Crudo Gana: Cuando alimentaron a la IA con el código Python real, predijo el rendimiento mucho mejor que cuando le alimentaron formatos de texto extraños y traducidos. Es como si el chef dijera: "Entiendo la receta real; no necesito que la traduzcas a fórmulas químicas para mí".
  • Sin Entrenamiento Necesario: Demostraron que no necesitas pasar semanas ajustando finamente la IA. Los modelos "de estantería" (off-the-shelf) funcionaron genial inmediatamente.
  • Búsqueda Más Rápida: Cuando usaron este método para buscar la mejor arquitectura de IA (usando un algoritmo llamado BANANAS), encontraron los mejores diseños mucho más rápido.
    • Para una tarea (CIFAR-100), alcanzaron el 1% superior de los mejores diseños posibles utilizando 34% menos evaluaciones de computadora que el método antiguo. Es como encontrar la mejor receta de pastel probando solo 66 pasteles en lugar de 100.

Por Qué Esto Importa

Este enfoque es como darle un traductor universal a un motor de búsqueda. Debido que cada red neuronal puede escribirse como código, y el código es un lenguaje universal que estos modelos de IA ya hablan con fluidez, este método funciona para casi cualquier tipo de arquitectura sin necesidad de ingeniería personalizada.

En resumen: En lugar de forzar a una IA inteligente a aprender un nuevo idioma extraño para entender las redes neuronales, los autores simplemente le hablaron en el idioma que ya conoce: Código. Esto ahorra tiempo, dinero y obtiene mejores resultados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →