← Últimos artículos
💻 computer science

Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images

Este artículo presenta un estudio de caso reproducible entre distintos proveedores que mide cómo las API comerciales (Anthropic, OpenAI y Google Vertex AI) cuentan los tokens de entrada para el código fuente renderizado como imágenes frente al texto sin procesar, revelando variaciones significativas en los ratios de reducción de tokens y los puntos de equilibrio a través de diferentes modelos y longitudes de código.

Autores originales: Ronak Bhalgami

Publicado 2026-07-27
📖 1 min de lectura☕ Lectura para el café

Autores originales: Ronak Bhalgami

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: ¿Píxeles para Programas? Un Estudio de Caso Inter-Proveedor sobre la Contabilidad de Tokens de Entrada para Código Fuente como Texto e Imágenes

Planteamiento del Problema
Los contextos de código fuente prolongados suelen exceder los límites de tokens de los modelos de lenguaje, lo que motiva propuestas para representar el código como imágenes para los modelos de lenguaje de visión (VLM). Si bien investigaciones recientes investigan si los modelos pueden resolver tareas de codificación tras esta transformación, una pregunta crítica de sistemas permanece sin respuesta: ¿cómo contabilizan las solicitudes resultantes los proveedores de API comerciales? Específicamente, no está claro cómo cambia la contabilidad de tokens de entrada cuando el código se transmite como texto bruto frente a imágenes renderizadas compactas, cómo escala esta relación con la longitud de la fuente y si la "compresión visual" ofrece una reducción neta de los tokens reportados entre diferentes proveedores y alias de modelos.

Metodología
El estudio emplea un protocolo de medición de caja negra reproducible para comparar la contabilidad de tokens de entrada a través de tres proveedores principales: Anthropic, OpenAI y Google Vertex AI.

  • Corpus: El conjunto de datos consiste en cinco archivos de código fuente con versiones fijadas (Python, JavaScript, Rust, Go y Java) de proyectos de código abierto prominentes. Estos archivos se dividen en nueve prefijos anidados que van desde las 20 hasta las 2,000 líneas.
  • Tratamiento (Imagen Compacta): El brazo de imagen aplica una transformación de dos etapas:
    1. Compresión de Indentación: Los espacios iniciales se reemplazan con marcadores compactos (por ejemplo, > para sangrías de 4 espacios, ^N para secuencias irregulares).
    2. Renderizado: El texto transformado se renderiza como páginas PNG.
  • Diseño Experimental: Para cada tamaño de fuente y lenguaje, se envían solicitudes emparejadas a 15 alias de modelos disponibles (4 de Anthropic, 6 de OpenAI, 5 de Gemini). Ambos brazos incluyen una instrucción de resumen de una sola frase ("Resume qué hace este código en una oración").
  • Métricas: La métrica principal es la relación entre los tokens de entrada de imagen reportados por el proveedor (II) y los tokens de texto (TT). El estudio reporta relaciones agregadas ponderadas (sumando todos los tokens a través del conjunto de datos) y relaciones estratificadas por tamaño para identificar puntos de equilibrio.
  • Restricciones: El estudio aisla explícitamente la contabilidad de tokens de la fidelidad semántica, la precisión de la tarea, la latencia, el costo monetario o la eficiencia del agente de codificación. No afirma que los tokens de imagen sean computacionalmente equivalentes a los tokens de texto.

Contribuciones Clave

  1. Artefacto Reproducible: Un conjunto de datos de ,1350 llamadas exitosas a la API y 675 pares completos de texto/imagen, incluyendo registros de uso brutos, validadores y scripts de análisis deterministas.
  2. Mediciones Estratificadas por Tamaño: Evidencia empírica que muestra que la reducción de tokens no es uniforme; varía significativamente según la longitud de la fuente y el proveedor.
  3. Auditoría de Modalidad: Una investigación dirigida que revela un comportamiento no monotónico en la contabilidad de imágenes, específicamente en los límites de página.
  4. Límite de Validez: Una demarcación clara entre las métricas de conteo de tokens y la preservación de la información, evitando la confusión de "menos tokens" con "mejor rendimiento" o "menor costo".

Resultados

  • Reducciones Agregadas: A través de todo el benchmark, las imágenes compactas reciben significativamente menos tokens de entrada reportados que el texto bruto:
    • Anthric: 0.135 de relación (reducción del 86.5%).
    • OpenAI: 0.194 de relación (reducción del 80.6%).
    • Gemini: 0.242 de relación (reducción del 75.8%).
  • Comportamiento de Punto de Equilibrio: Las relaciones agregadas ocultan diferencias críticas de escalabilidad:
    • Anthropic y OpenAI: Las entradas de imagen reciben recuentos de tokens menores que el texto en todos los tamaños probados (de 20 a 2,000 líneas).
    • Gemini: Las imágenes incurren en un sobrecosto masivo para contextos cortos. A las 20 líneas, las imágenes de Gemini requieren 6.95 veces más tokens que el texto. El enfoque de imagen solo resulta ventajoso (cruzando por debajo de la paridad) a las 200 líneas.
  • Alias de Modelos: Dentro de los proveedores, muchos alias de modelos comparten firmas de contabilidad idénticas (por ejemplo, los seis modelos de OpenAI en el estudio devolvieron relaciones agregadas idénticas), lo que sugiere reglas de contabilidad internas compartidas en lugar de comportamientos de modelos independientes.
  • No Monotonicidad: Una auditoría dirigida de Gemini reveló que los recuentos de tokens de imagen pueden cambiar de forma no monotónica en los límites de página. Por ejemplo, aumentar la fuente de 800 a 1,200 líneas (añadiendo una segunda página) resultó en una disminución de los tokens de imagen reportados para un modelo, contradiciendo la expectativa de que los recuentos de tokens escalan linealmente con el contenido.

Significancia y Reivindicaciones
El artículo sostiene que, si bien el renderizado de imágenes compactas puede reducir drásticamente los tokens de entrada reportados para contextos largos, el beneficio es altamente condicional:

  1. Especificidad del Proveedor: No existe una ventaja universal de "compresión visual". Proveedores como Gemini exhiben altos costos fijos que hacen que las imágenes sean contraproducentes para contextos cortos.
  2. Implicaciones de Enrutamiento: Un sistema de codificación (coding harness) no puede confiar en una política global de "enviar código como imágenes". En su lugar, la lógica de enrutamiento debe calibrarse por proveedor y tamaño de fuente, potencialmente recurriendo al texto para contextos cortos o cuando los límites de página introducen discontinuidades.
  3. Limitaciones de los Recuentos de Tokens: El estudio enfatiza que una reducción en los tokens reportados no implica un contenido de información equivalente, menor costo monetario o menor cómputo. Los marcadores de indentación pueden ser mal decodificados, y la rasterización puede oscurecer la puntuación o la estructura.
  4. Trabajo Futuro: Los autores posicionan este estudio como una "superficie de medición" sobre la cual la investigación futura puede construir. Argumentan que el siguiente paso necesario es cruzar la representación con la calidad de la tarea (por ejemplo, transcripción exacta, localización de defectos) para determinar si los ahorros de tokens se traducen en utilidad real de codificación.

El artículo concluye que el código renderizado compacto es una estrategia viable para la contabilidad de tokens en regímenes específicos (contextos largos, proveedores específicos), pero requiere una calibración cuidadosa y específica por proveedor, así como una validación adicional respecto a la fidelidad de la información.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →