← 최신 논문
🤖 machine learning

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

FlashRT는 중간 표현, 정적 분석, 그리고 반복적인 벤치마킹을 포함하는 새로운 체인 오브 프로그램(chain-of-program) 패러다임을 통해, 단순한 참조 구현물을 다양한 하드웨어 플랫폼에 걸쳐 고도로 최적화된 실시간 멀티모달 배포로 자동 변환하여 상당한 지연 시간 감소와 처리량 향상을 달성하도록 코딩 에이전트를 안내하는 에이전트 하네스입니다.

원저자: Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 실시간으로 대화하고, 듣고, 즉각적으로 반응할 수 있는 초고속 실시간 비디오 게임을 만들려고 한다고 상상해 보세요. 이를 구현하려면 여러 가지 서로 다른 "두뇌"(AI 모델)를 하나로 연결해야 합니다. 하나는 당신의 목소리를 듣고, 다른 하나는 답변을 생각하며, 세 번째는 그 답변을 음성으로 바꾸고, 네 번째는 말하는 얼굴을 애니메이션화합니다. 컴퓨터 과학의 세계에서 이것은 "멀티모달 애플리케이션(multimodal application)"이라고 불립니다. 까다로운 점은 단순히 이 두뇌들을 갖추는 것이 아니라, 이들이 서로 방해하지 않고 함께 작동하도록 만드는 방법입니다. 이 모든 것을 하나의 작은 프로세서에 넣으면 너무 느리게 움직입니다. 그렇다고 너무 멀리 떨어뜨려 놓으면 서로 데이터를 주고받느라 시간을 너무 많이 소비하게 됩니다. 오랫동안 전문가들은 매번 새로운 앱이 나올 때마다 수동으로 맞춤형 "교통 제어 시스템"을 구축해야 했으며, 이 과정은 느리고 비용이 많이 들며 반복하기 어렵습니다.

여기 "AI 에이전트"라는 개념이 등장합니다. 이것을 아주 똑똑하고 지치지 않는 디지털 인턴이라고 생각해 보세요. 이 인턴은 코드를 읽고 더 빠르게 실행되도록 코드를 다시 작성할 수 있습니다. 하지만 여기에는 함정이 있습니다. 만약 당신이 이 인턴에게 단순히 "더 빠르게 만들어줘"라고 요청한다면, 인턴은 종종 혼란에 빠지거나, 무작ful한 시도를 하거나, 최선의 기법을 놓칠 수 있습니다. 왜냐하면 문제는 믿기 힘들 정도로 복잡하기 때문입니다. 이는 마치 인간에게 조각들을 종이에 적어두지도 않은 채 머릿속으로 거대하고 움직이는 퍼즐을 재배치하라고 요구하는 것과 같습니다. 바로 이 지점에서 FlashRT라는 새로운 시스템이 등장합니다. FlashRT는 단순히 AI에게 추측하라고 시키는 것이 아닙니다. 대신 AI에게 구조화된 게임 플랜과 도구 세트, 그리고 자신의 아이디어를 테스트할 방법을 제공하여, 혼란스러운 추측 게임을 정밀한 공학적 성취로 탈바꿈시킵니다.

문제점: AI의 교통 체증

이 논문의 저자들은 실시간 애플리케이션(음성 비서나 라이브 비디오 생성기 등)이 점점 더 인기를 얻고 있지만, 이를 효율적으로 실행하는 것이 매우 어렵다는 점에 주목했습니다. 이러한 앱들은 서로 다른 모델들이 각기 다른 작업을 수행하는 조립 라인과 같습니다. 때로는 전체 라인이 최대한 빠르게 움직이기를 원할 수도 있고(높은 처리량/throughput), 때로는 첫 번째 결과물이 최대한 빨리 나오기를 원할 수도 있습니다(낮은 지연 시간/latency).

문제는 이러한 기계들을 배치하는 "최적의" 방법이 무엇을 원하는지에 따라 달라진다는 것입니다. 속도를 원한다면 기계들을 서로 다른 컴퓨터에 나누어 배치하여 병렬로 작업하게 할 수 있습니다. 반면 지연 시간을 줄이고 싶다면, 데이터를 주고받는 데 시간을 낭비하지 않도록 기계들을 가깝게 배치해야 합니다. 기존 시스템들은 너무 경직되어 있어서, 하나의 고정된 배치 방식만을 강요합니다. 다른 도구들도 자동화를 시도하지만, 단순한 단일 작업에만 작동할 뿐, 이렇게 복잡한 다단계 파이프라인에는 적용되지 못합니다. 그 결과, 개발자들은 매번 새로운 앱을 위해 맞춤형 솔루션을 직접 손으로 만들어야 하는 상황에 처해 있으며, 이는 확장성이 없습니다.

해결책: FlashRT와 "프로그램 체인(Chain-of-Program)"

연구진은 어떤 멀티모달 앱에도 완벽한 배포 설계를 자동으로 수행하는 AI 코딩 에이전트를 사용하는 시스템인 FlashRT를 구축했습니다. 하지만 그들은 단순히 AI에게 "가서 해결해"라고 말하지 않았습니다. 그들은 AI에게 곧바로 해결책을 찾으라고 하면 자주 실패한다는 점을 깨달았습니다. AI는 하나의 좋은 기술은 찾아낼지 몰라도 다른 기술들을 놓칠 수 있고, 혹은 서류상으로는 좋아 보이지만 실제로 실행했을 때 작동하지 않는 해결책을 만들어낼 수도 있습니다.

이를 해결하기 위해 FlashRT는 "프로그램 체인(Chain-of-Program)" 패러다임이라는 영리한 전략을 사용합니다. 당신이 미스터리를 풀려는 탐정이라고 상상해 보세요. 결론으로 바로 뛰어드는 대신, 먼저 범죄 현장의 지도를 그려서 누가 어디에 있었고 무엇을 하고 있었는지 기록합니다. 그런 다음 그 지도를 분석하여 단서를 찾습니다. 마지막으로 당신의 이론을 테스트합니다.

FlashRT도 코드에 대해 똑같은 과정을 거칩니다:

  1. 지도 (중간 표현식, Intermediate Representation): 먼저, AI 에이전트는 개발자의 단순하고 느린 코드를 구조화된 "지도"(중간 표현식 또는 IR이라 불림)로 변환합니다. 이 지도는 데이터가 서로 다른 모델 사이에서 어떻게 흐르는지, 그리고 메모리를 어디서 공유하는지를 명확하게 보여줍니다. 이는 AI가 구조를 변경하려고 시도하기 전에 먼저 천천히 이해하도록 강제합니다.
  2. 분석: AI는 이 지도를 살펴보고 기회를 포착합니다. 예를 들어, 모델 A가 모델 B가 완전히 끝날 때까지 기다릴 필요 없이, 모델 B가 작은 데이터 조각이라도 생성하는 즉시 작업을 시작할 수 있다는 점을 발견할 수 있습니다. 이는 마치 요리사가 물이 끓을 때까지 기다렸다가 칼을 잡는 것이 아니라, 물이 끓는 동안 채소를 먼저 썰기 시작하는 것과 같습니다.
  3. 테스트 드라이브 (검증 루프, Validation Loop): 이 부분이 가장 결정적인 부분입니다. AI는 단순히 추측하는 것이 아니라 "테스트 하네스(test harness)"를 구축합니다. 실제 사용자가 앱과 상호작용하는 것을 시뮬레이션하여 가짜 입력을 넣고, 출력이 돌아오는 데 정확히 얼마나 걸리는지 측정합니다. 만약 AI의 새로운 설계가 더 느리거나 잘못된 답을 내놓는다면, AI는 즉시 이를 알 수 있습니다. 그러면 다른 전략을 시도하고, 다시 테스트하며, 최적의 설정을 찾을 때까지 이 과정을 반복합니다.

결과: 미래를 가속화하다

연구팀은 대면 대화형 에이전트, 비디오 배경 편집기, 비디오 월드 모델을 포함한 여러 실제 애플리케이션에 대해 FlashRT를 테스트했습니다. 결과는 인상적이었습니다.

NVIDIA B200 GPU에서 FlashRT는 기본적인 느린 구현체를 가져와 첫 번째 응답이 돌아오는 시간(지연 시간)을 최대 70배까지 줄이는 고속 배포 모델로 탈바꿈시켰습니다. 또한 연속적인 스트림을 처리하는 속도(처리량)를 2.8배 개선했습니다.

더 흥미롭게도, 전문가들이 아직 최적화를 많이 하지 않은 다른 유형의 하드웨어인 AMD MI355X GPU에서도 테스트를 진행했습니다. FlashRT는 단순히 작동하는 수준을 넘어 번창했습니다. 지연 시간 개선 효과를 유지하면서도 처리량을 3.6배 높였습니다. 특히 Qwen3-Omni 모델을 사용한 특정 테스트에서는, FlashRT가 인간 전문가가 만든 시스템보다 응답 시간을 65% 단축했습니다.

이것이 중요한 이유

이 논문은 우리가 새로운 AI 앱마다 인간 전문가가 수동으로 튜닝하기를 기다릴 필요가 없음을 보여줍니다. AI 에이전트에게 구조화된 사고 방식(지도)과 자신의 아이디어를 테스트할 방법(검증 루프)을 제공함으로써, 우리는 다양한 하드웨어와 다양한 목표에 적응할 수 있는 매우 효율적인 시스템을 자동으로 생성할 수 있습니다.

저자들은 이것이 엄청난 진전이지만, 모든 것을 해결하는 마법 지팡이는 아니라는 점을 주의 깊게 언급했습니다. 그들은 아직 모델 내부의 아주 낮은 수준의 수학적 연산을 최적화하는 AI의 능력을 통합하지 않았으며, 오직 한 종류의 특정 AI 에이전트만을 테스트했습니다. 그러나 핵심적인 발견은 명확합니다. 적절한 가이드가 있다면, AI 에이전트는 오늘날 우리가 손으로 직접 만드는 것보다 더 빠르고 유연한 실시간 시스템을 설계하는 법을 배울 수 있습니다. 이는 "수동으로 제작하는" 미래에서 "가이드하는" 미래로의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →