← Últimos artículos
💻 computer science

Pixel-Translation-Equivariant Quantum Convolutional Neural Networks via Fourier Multiplexers

Este artículo introduce las Redes Neuronales Convolucionales Cuánticas con Equivarianza de Traslación de Píxeles (PCS-QCNNs), las cuales resuelven el desajuste entre las simetrías de codificación de imágenes y las permutaciones estándar de cúbits mediante la construcción de capas multiplexadas por Fourier que conmutan exactamente con los desplazamientos cíclicos de píxeles, demostrando un rendimiento superior sobre controles cuánticos no equivariantes en evaluaciones de MNIST trasladadas, al tiempo que resaltan los desajustes críticos entre entrenamiento y despliegue derivados de los costos de muestreo de disparos finitos.

Autores originales: Dmitry Chirkov, Igor Lobanov

Publicado 2026-08-14
📖 9 min de lectura🧠 Análisis profundo

Autores originales: Dmitry Chirkov, Igor Lobanov

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a reconocer un gato en una foto. Si le muestras al robot la imagen de un gato a la izquierda, y luego le muestras exactamente el mismo gato a la derecha, un robot inteligente debería darse cuenta de: "¡Oye, sigue siendo un gato!". Esta capacidad de entender que un objeto es el mismo incluso cuando se mueve por ahí se llama simetría de traslación. En el mundo de las computadoras clásicas, hemos construido herramientas especiales llamadas Redes Neuronales Convolucionales (CNN) que están programadas para respetar esta regla, lo que las hace increíblemente buenas para detectar cosas en las imágenes.

Ahora, imagina que queremos construir estas herramientas inteligentes usando computadoras cuánticas. Las computadoras cuánticas son como dados mágicos que pueden estar en muchos estados a la vez, ofreciendo un potencial enorme de velocidad. Pero hay un inconveniente: en el mundo cuántico, la forma en que introduces la imagen en la computadora (llamada codificación) cambia las reglas del juego. Si codificas una imagen asignando cada píxel a un "asiento" específico (como un asiento en un teatro), mover la imagen significa desplazar los asientos. Pero si codificas una imagen asignándola a una "lista de direcciones" (como el catálogo de una biblioteca), mover la imagen significa cambiar los números en las fichas del catálogo. El artículo que estamos explorando hoy aborda un rompecabezas complicado: muchos diseños cuánticos existentes fueron construidos para manejar la regla de "desplazamiento de asientos", pero para el método de la "ficha de catálogo", esa regla no funciona. Los autores se dieron cuenta de que, si quieres que tu computadora cuántica sea verdaderamente buena reconociendo objetos en movimiento, tienes que construirla para que respete la forma específica en que tus datos están codificados, no solo las reglas genéricas de la mecánica cuántica.


El Gran Desajuste Cuántico

Los autores, Dmitry Chirkov e Igor Lobanov de la Universidad ITMO, notaron una desconexión curiosa en cómo las computadoras cuánticas manejan las imágenes. Ellos lo llaman el desajuste "Píxel vs. Qubit".

Imagina que tienes una fila de interruptores de luz (estos son los qubits, las unidades básicas de información cuántica). En muchos diseños cuánticos, los ingenieros asumieron que si deslizas toda la fila de interruptores un lugar hacia la derecha, la computadora debería tratar el nuevo arreglo como la misma imagen, solo que desplazada. Esto es como deslizar una fila de dominós; si el patrón se mueve, el patrón sigue ahí. Esto se llama Desplazamiento Cíclico de Qubits (QCS).

Sin embargo, los autores analizaron una forma popular de introducir imágenes en computadoras cuánticas llamada FRQI (Representación Flexible de Imágenes Cuánticas). En este método, la imagen no se almacena en los interruptores mismos, sino en las direcciones de los interruptores. Piensa en ello como una biblioteca donde los libros (píxeles) no están en los estantes (qubits) en orden; en su lugar, los estantes tienen etiquetas (direcciones), y los libros están listados en un catálogo de fichas. Si mueves un libro del estante 1 al estante 2, no estás simplemente deslizando el estante; estás cambiando el número en la ficha.

El artículo demuestra que la regla de "deslizar los interruptores" (QCS) no coincide con la regla de "cambiar la dirección" (Desplazamiento Cíclico de Píxeles, o PCS) utilizada por FRQI. Es como intentar abrir una puerta con una llave que encaja en la cerradura pero tiene la forma incorrecta para la manija. Si construyes una red cuántica que solo respeta la regla de "deslizar los interruptores", fallará al reconocer que una imagen desplazada es la misma imagen cuando se usa este método de codificación específico. Los autores argumentan que, para crear una verdadera "Red Neuronal Convolucional Cuántica" (QCNN) para estas imágenes, debes construirla para que respete la regla de la "dirección", no la regla del "interruptor".

El Truco Mágico de Fourier

Entonces, ¿cómo se arregla una red que está mirando la regla equivocada? Los autores idearon una solución ingeniosa utilizando una herramienta matemática llamada Transformada de Fourier.

En el mundo clásico, si quieres analizar una onda sonora, puedes descomponerla en diferentes notas musicales (frecuencias). En el mundo cuántico, los autores se dieron cuenta de que la regla de "desplazamiento de direcciones" se vuelve muy simple cuando miras la imagen a través del lente de estas "notas". Ellos lo llaman la base de Fourier.

Diseñaron un nuevo tipo de capa cuántica que funciona como un truco de magia de tres pasos:

  1. Traducir a Notas: Primero, la computadora cuántica utiliza una compuerta especial (la Transformada de Fourier Cuántica) para convertir la imagen de "direcciones de píxeles" a "notas de Fourier".
  2. El Multiplexor: Luego, aplica un filtro especial llamado Multiplexor de Fourier. Este es el protagonista. Imagina una mesa de mezclas gigante donde cada "nota" (frecuencia) recibe su propio control de volumen y efectos únicos. La computadora puede ajustar cada nota de forma independiente sin alterar las demás. Debido a que la regla de "desplazamiento" es simplemente un cambio simple en estas notas, ajustar de esta manera garantiza que la computadora respete la simetría de traslación.
  3. Traducir de Vuelta: Finalmente, convierte las notas de nuevo a direcciones de píxeles para que la computadora pueda leer el resultado.

Al construir la red de esta manera, los autores crearon una QCNN Equivariante a la Traslación de Píxeles (PCS-QCNN). Esto significa que la red está matemáticamente garantizada para entender que una imagen desplazada es la misma imagen, específicamente para el método de codificación FRQI.

Probando la Teoría: El Juego de MNIST Desplazado

Para ver si su nuevo diseño realmente funciona, los autores realizaron una serie de experimentos utilizando el famoso conjunto de datos MNIST, que contiene dígitos escritos a mano (del 0 al 9).

Crearon un desafío especial llamado MNIST Trasladado. En lugar de mostrar los dígitos en el centro de la página, los movieron aleatoriamente (los desplazaron) hasta 8 píxeles. Esto hace que la tarea sea mucho más difícil para una computadora que no entiende el movimiento.

Compararon cuatro "jugadores" diferentes:

  1. CNN Clásica: El estándar de oro para las computadoras clásicas, diseñado para manejar desplazamientos.
  2. MLP Clásica: Una red neuronal estándar, "densa", que no conoce los desplazamientos (como un estudiante que memorizó la clave de respuestas pero no entiende el concepto).
  3. PCS-QCNN: El nuevo modelo cuántico de los autores, que respeta la regla de desplazamiento de direcciones.
  4. RBC-QCNN: Un modelo cuántico de "Control de Base Aleatoria". Este es un modelo cuántico que es exactamente igual al nuevo modelo de los autores, pero utiliza reglas aleatorias que no respetan la simetría en lugar del Multiplexor de Fourier. Es el "grupo de control" para demostrar que la simetría es lo que importa.

Los Resultados:

  • Duelo Clásico: Como era de esperar, la CNN Clásica aplastó la tarea con un 97.68% de precisión, mientras que la MLP densa tropezó con un 48.93%. Esto demostró que la tarea era, de hecho, sensible a la simetría de traslación.
  • Duelo Cuántico: El nuevo PCS-QCNN de los autores obtuvo un 75.89%. El RBC-QCNN aleatorio (que ignoró la simetría) solo obtuvo un 40.82%.
  • La Brecha: El nuevo diseño fue 35.08 puntos porcentuales mejor que la versión aleatoria. Esta es una gran victoria, lo que sugiere que respetar la simetría específica de la codificación de los datos es crucial para el reconocimiento de imágenes cuánticas.

Sin embargo, los modelos cuánticos no alcanzaron del todo el nivel de la CNN clásica (que era casi perfecta). Los autores señalan que esto se debe probablemente a que su modelo cuántico es todavía una simulación "idealizada" y aún no se ha optimizado para las restricciones de hardware de las computadoras cuánticas reales.

El Problema de los "Shots": Cuando la Realidad Ataca

Hay un giro más. Las computadoras cuánticas no solo te dan una respuesta; te dan una probabilidad. Para obtener una respuesta clara, tienes que hacerle la misma pregunta muchas veces (llamado shots o disparos).

Los autores simularon qué sucede cuando no tienes tiempo infinito para hacer preguntas. Descubrieron que si solo usas un número pequeño de shots (como 128 o 256), la precisión cae. Peor aún, descubrieron un "desajuste de entrenamiento-despliegue". Un modelo que parece perfecto cuando se entrena con shots infinitos (información perfecta) puede, de hecho, funcionar peor cuando se prueba con un número limitado de shots. Es como un estudiante que estudia con un libro de texto perfecto pero se confunde al tomar un examen con una fotocopia borrosa.

Esto sugiere que cuando construyamos estos modelos cuánticos para la realidad, no podemos limitarnos a ver qué tan bien aprenden; tenemos que diseñarlos para que sean robustos incluso cuando no podamos permitirnos realizar millones de mediciones.

La Conclusión

Este artículo no pretende haber resuelto el reconocimiento de imágenes cuánticas o haber construido una computadora cuántica que supere a las mejores clásicas. En su lugar, resolvió un rompecabezas lógico fundamental. Demostró que la simetría no es de talla única. No puedes simplemente copiar y pegar las reglas de la convolución clásica o de la simetría cuántica genérica sobre un codificador de imágenes cuánticas.

Los autores demostraron que, para el popular método de codificación FRQI, debes construir tu red cuántica para que respete la regla de "desplazamiento de direcciones" (PCS) utilizando su nueva técnica de Multiplexor de Fourier. Sus experimentos mostraron que hacer esto marca una diferencia masiva, aumentando la precisión en más de un 35% en comparación con un modelo que ignora esta regla. Aunque todavía existen obstáculos como el costo de los shots y las limitaciones de hardware, este trabajo proporciona una receta clara y constructiva para construir redes cuánticas que realmente entienden cómo se mueven las imágenes. Es un paso vital para hacer que las computadoras cuánticas no solo sean más rápidas, sino también más inteligentes sobre el mundo que intentan ver.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →