← Últimos artículos
⚡ electrical engineering

Comparative Field Deployment of Reinforcement Learning and Model Predictive Control for Residential HVAC

Este artículo presenta un despliegue de campo de un mes comparando el Control Predictivo basado en Modelos (MPC) y el Aprendizaje por Refuerzo basado en Modelos (RL) para HVAC residencial, demostrando que si bien ambos lograron ahorros de energía similares (18.1% y 20.9% respectivamente) con necesidades de datos comparables, el RL requirió significativamente menos esfuerzo de ingeniería pero comprometió inicialmente el confort del ocupante debido a desafíos de seguridad e inicialización.

Autores originales: Ozan Baris Mulayim, Elias N. Pergantis, Levi D. Reyes Premer, Bingqing Chen, Guannan Qu, Kevin J. Kircher, Mario Bergés

Publicado 2026-07-20
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Ozan Baris Mulayim, Elias N. Pergantis, Levi D. Reyes Premer, Bingqing Chen, Guannan Qu, Kevin J. Kircher, Mario Bergés

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el sistema de calefacción y aire acondicionado de tu hogar como un mayordomo robot muy entusiasta, pero un poco torpe. Su único trabajo es mantener la casa a la temperatura que tú fijas en un dial. Si le dices que se mantenga a 20 °C, encenderá la calefacción a toda potencia hasta alcanzar los 20 °C, luego se apagará, solo para volver a encenderse cuando la casa se enfríe. Este método de "configúralo y olvídate" funciona, pero es un desperdicio. Es como conducir un coche con el pie pegado al acelerador, solo tocando el freno cuando estás a punto de chocar, en lugar de frenar suavemente antes de la señal de alto.

Para solucionar esto, los científicos han intentado enseñar al robot a ser más inteligente. Hay dos formas principales de hacerlo. La primera es como darle al robot un mapa detallado y un libro de texto de física. Esto se llama Control Predictivo basado en Modelos (MPC). El robot utiliza el mapa para calcular exactamente cómo se calentará o enfriará la casa durante el día siguiente, planificando sus movimientos perfectamente para ahorrar energía mientras te mantiene cómodo. La segunda forma es el Aprendizaje por Refuerzo (RL). En lugar de un mapa, le das al robot un sistema de recompensas: "Buen trabajo si ahorras energía, mal trabajo si haces que la casa sea demasiado fría". El robot aprende mediante ensayo y error, descubriendo los mejores movimientos al observar lo que sucede, de forma muy similar a un personaje de un videojuego que aprende a superar un nivel muriendo repetidamente hasta que capta el patrón.

La gran pregunta es: ¿Qué método es mejor para una casa real? El método del libro de texto (MPC) está probado, pero requiere que un ingeniero humano construya el mapa y ajuste las reglas, lo que lleva mucho tiempo y esfuerzo. El método de aprendizaje (RL) promete hacer el trabajo automáticamente, pero no se estaba seguro de si podría aprender lo suficientemente rápido sin que la casa se quedara helada o se desperdiciara energía mientras "descubre las cosas". Este artículo toma estos dos enfoques fuera del laboratorio de simulación por computadora y los lanza a una casa real, ocupada, en un clima frío para ver cuál de ellos funciona realmente en el mundo real.


El Gran Duelo de los Termostatos: Mapas vs. Aprendizaje

En una acogedora casa de la era de 1920 en West Lafayette, Indiana, dos cerebros digitales se enfrentaron durante un mes. Un cerebro era el sistema de Control Predictivo basado en Modelos (MPC), el "planificador" que depende de un modelo preconstruido de cómo reacciona la casa al calor. El otro era Ibex-RL, un sistema de Aprendizaje por Refuerzo (RL), el "aprendiz" que intenta descubrir el comportamiento de la casa sobre la marcha mientras está en funcionamiento. Ambos tenían la tarea de controlar una bomba de calor —el corazón del sistema de calefacción del hogar— para ahorrar electricidad mientras mantenían la comodidad de los residentes.

El Marcador: ¿Quién ahorró más energía?
Los resultados fueron sorprendentemente cercanos, como dos corredores terminando una carrera por un margen mínimo.

  • El planificador MPC logró ahorrar un 18,1% de la energía en comparación con la configuración estándar de temperatura constante.
  • El aprendiz RL incluso lo superó ligeramente, ahorrando un 20,9% de la energía.

Ambos métodos demostraron estadísticamente ser mejores que no hacer nada, pero la diferencia entre los dos robots no fue lo suficientemente significativa como para declarar un ganador claro en términos de puro ahorro de energía.

El Factor de la Comodidad: El Problema del "Demasiado Frío"
Aquí es donde los dos robots tuvieron personalidades muy diferentes.
El planificador MPC era el tipo cauteloso y que sigue las reglas. Se mantuvo muy cerca de la temperatura que los residentes deseaban (18 °C por la noche, 20 °C durante el día). Los residentes estaban contentos y el sistema mantuvo niveles de confort "aceptables" todo el tiempo.

El aprendiz RL, sin embargo, era un poco más arriesgado. Aprendió que mantener la casa un poco más fresca ahorraba más energía. Como resultado, mantuvo la casa más fría de lo que los residentes preferían, especialmente durante los primeros días mientras aún estaba "aprendiendo". Esto provocó tres reportes de incomodidad por parte de las personas que vivían allí. La casa se enfrió lo suficiente como para que los residentes realmente se quejaran. Aunque el sistema RL finalmente se ajustó, pasó más tiempo en la zona de "demasiado frío" que el sistema MPC.

El Esfuerzo: ¿Qué tan difícil fue la configuración?
Aquí es donde la historia se pone interesante para cualquiera que intente construir estos sistemas.

  • MPC es como construir un traje a medida. Requiere un sastre (un ingeniero) que tome medidas, ajuste la tela y corrija las costuras. Los investigadores estimaron que configurar el MPC para una nueva casa tomaría unos cinco días del tiempo de un ingeniero solo para la lógica de control, más cuatro días para la configuración física.
  • RL es como comprar una chaqueta inteligente que se ajusta sola. Una vez que la estructura básica está ahí, se adapta al usuario. Los investigadores estimaron que configurar el RL para una nueva casa tomaría solo unos dos días de trabajo de control.

En resumen, el sistema RL requirió aproximadamente un tercio menos de esfuerzo de ingeniería para su despliegue que el sistema MPC. Fue más rápido para ponerse en marcha, pero vino con la "curva de aprendizaje" inicial de hacer que los residentes sintieran un poco de frío.

Los Fallos y la "Caja Negra"
El experimento no estuvo exento de contratiempos. El sistema RL tuvo un poco de crisis de identidad. Se suponía que debía aprender la física de la casa (qué tan rápido se enfrían las paredes, cuánta luz solar entra por las ventanas), pero debido a que estaba aprendiendo de datos del mundo real sin un "simulador" perfecto para practicar primero, algunos de sus números aprendidos se volvieron extraños. Por ejemplo, brevemente pensó que la luz solar enfriaba la casa (un área solar negativa), lo cual es físicamente imposible. Sin embargo, el sistema fue construido con rieles de seguridad (restricciones) que evitaron que estas ideas extrañas causaran que la calefacción se descontrolara. Mantuvo la casa segura, incluso si su mapa interno estaba un poco distorsionado.

El Veredicto
Este estudio sugiere que el Aprendizaje por Ref Reinforcement Learning es una vía viable para hacer las casas más inteligentes y ahorrar energía, potencialmente ahorrando mucho tiempo a los ingenieros en el proceso. Sin embargo, también destaca que el RL aún no es una varita mágica. Puede ser un poco "tosco" al principio, arriesgando el confort del ocupante mientras descubre cómo funciona.

El artículo concluye que, si bien el RL ofrece una forma más rápida y automatizada de desplegar controles inteligentes, todavía enfrenta desafíos para garantizar la seguridad y el confort durante su fase de aprendizaje. El futuro ideal podría no ser una elección entre los dos, sino un híbrido: usar la seguridad y la estructura del "planificador" (MPC) para guiar al "aprendiz" (RL), creando un sistema que sea tanto fácil de configurar como amable con el confort de los residentes. Por ahora, si quieres la apuesta más segura para una casa nueva, el planificador (MPC) sigue siendo la opción confiable. Si quieres probar el futuro de la automatización y estás dispuesto a tolerar algunas noches frías mientras aprende, el aprendiz (RL) está listo para que le des una oportunidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →