← 최신 논문
💻 computer science

AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications

이 논문은 LLM 제공업체 간의 차이를 유향 스트리밍 그래프 내의 타입화된 이벤트로 정규화하고, 제한된 백프레셔와 로컬 동시성을 강제하기 위해 노드 가디언(Node Guardian)을 활용함으로써, 기존의 집계 기반 방식에 비해 애플리케이션의 첫 부분 토큰 생성 시간(time-to-first-partial-token)과 큐 깊이를 크게 줄이는 토큰 네이티브 반응형 오케스트레이션 프레임워크인 AiFlow를 소개한다.

원저자: Qunhui Zhang

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Qunhui Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 요리를 단어 하나하나씩 만들어내는 마법의 셰프(대규모 언어 모델)가 있는 바쁘고 첨단 기술을 갖춘 주방을 운영하고 있다고 상상해 보십시오. 옛날에는 주방 직원들이 요리 전체가 완성될 때까지 기다렸다가 접시에 담거나, 맛을 보거나, 알레르기 성분을 확인했습니다. 이 방식은 고객이 첫 입을 떼기까지 너무 오래 기다리게 만들었습니다. 하지만 이제는 셰프가 요리를 하는 즉시, 한 단어씩 음식을 내놓습니다. 문제는 주방 직원들(앱의 다른 부분들)이 이 빠른 속도를 따라갈 준비가 되어 있지 않다는 것입니다. 어떤 직원들은 매우 빠르지만, 매운 재료를 확인하거나 음식을 목소리로 바꾸는 것과 같은 업무를 수행하는 직원들은 훨씬 느립니다. 만약 빠른 직원들이 느린 직원들이 처리하는 속도보다 더 빠르게 접시를 카운터에 쌓아 올린다면, 카운터는 넘쳐나고 주방은 혼란에 빠지며 시스템 전체가 다운될 것입니다. 이것이 바로 "스트리밍(streaming)" AI 애플리케이션의 세계이며, 여기서의 목표는 정보가 도착하는 즉시 처리하되, 주방이 폭발하지 않도록 흐름을 조직적으로 유지하는 것입니다.

여기에, 이 마법의 셰프들을 위한 궁극적인 주방 매니저로 설계된 새로운 시스템인 AiFlow가 등장했습니다. AiFlow는 정리되지 않은 임시방편의 규칙으로 직원들이 혼란을 해결하게 두는 대신, 처음부터 엄격하고 스마트한 컨베이어 벨트 시스템을 구축합니다. 이 시스템은 셰프가 내뱉는 모든 단어(또는 "토큰")를 지정된 경로를 따라 이동하는 특별하고 라벨이 붙은 패키지로 취급합니다. 논문에서는 벨트의 각 스테이션마다 "노드 가디언(Node Guardian)"을 배치했습니다. 이는 대기 줄에 얼마나 많은 패키지가 머물 수 있는지, 한 번에 얼마나 많은 작업자가 이를 처리할 수 있는지, 그리고 줄이 너무 길어질 경우 어떻게 할 것인지(예: 가장 오래된 항목을 버리거나 셰프를 잠시 멈추는 것)를 결정하는 작고 매우 엄격한 문지기입니다. 연구진은 이 시스템을 사용함으로써 첫 번째 처리된 단어가 고객에게 도달하는 시간이 기존의 "끝날 때까지 기다리는" 방식에 비해 약 71%에서 95%까지 극적으로 감소한다는 것을 발견했습니다. 하지만 그들은 AiFlow가 셰프를 더 빨리 요리하게 만드는 것이 아니라, 단지 주방을 매우 원활하게 운영하여 음식이 테이블에 훨씬 더 빨리 도착하게 만드는 것임을 분명히 하고 있습니다.

문제점: 주방의 혼란

당신이 당신에게 말을 거는 로봇 비서를 만들고 있다고 상상해 보십시오. 당신이 질문을 하면, 로봇은 단순히 최종 답변을 주는 것이 아니라 단어를 하나씩 생성하며 자신의 생각을 밖으로 내뱉습니다. 현대적인 앱에서는 이러한 단어들이 나타나는 동안 다음과 같은 여러 가지 일을 하고 싶을 수 있습니다:

  1. 분류하기: 이것이 로봇의 추론 과정인가, 아니면 최종 답변인가?
  2. 필터링하기: 이 단어에 위험한 내용이 포함되어 있는가?
  3. 스피커로 보내기: 텍스트를 즉시 음성으로 변환한다.
  4. 로그 남기기: 나중에 확인하기 위해 추론 과정을 저장한다.

과거에는 개발자들이 이러한 단계들을 연결하기 위해 지저도하고 맞춤화된 코드를 직접 작성해야 했습니다. 그들은 각 단계 사이에 "대기 줄(큐, queues)"을 수동으로 만들어야 했고, 각 단계에 몇 명의 작업자를 고용할지 결정해야 했으며, 스피커가 너무 느려 따라오지 못할 경우 어떻게 할지도 고민해야 했습니다. 만약 실수를 한다면, 대기 줄은 무한히 늘어나 컴퓨터의 메모리를 모두 잡아먹거나 단어들의 순서가 뒤섞일 수 있었습니다. 그것은 마치 중앙 계획 없이 서로에게 소리만 지르는 혼란스러운 주방을 관리하려는 것과 같았습니다.

해결책: AiFlow와 "노드 가디언"

이 논문의 저자는 혼돈을 잘 조직된 조립 라인으로 바꾸는 시스템인 AiFlow를 만들었습니다. AiFlow를 모든 기계가 특정 규칙 책을 가지고 있는 공장의 청사진이라고 생각하십시오.

1. 토큰 네이티브 오케스트레이션 (Token-Native Orchestration):
문장이 끝날 때까지 기다리는 대신, AiFlow는 모든 단어를 "일등 시민"으로 취급합니다. 셰프가 단어를 생성하자마자, 그 단어에는 라벨(예: "추론" 또는 "답변")이 붙고 즉시 올바른 경로로 보내집니다. 이는 셰프가 50번째 단어를 생성하고 있는 동안에도 "답변" 브랜치가 첫 번째 단어에 대해 작업을 시작할 수 있음을 의미합니다.

2. 노드 가디언 (The Node Guardian):
이것이 핵심입니다. 조립 라인의 모든 스테이션에는 "노드 가디언"이 있습니다. 이 가디언은 설계자가 선언한 규칙을 집행하는 엄격한 관리자입니다:

  • 큐 경계 (Queue Bounds): "여기에는 8개의 아이템만 대기할 수 있다." 만약 줄이 가득 차면, 가디언은 상류의 기계가 더 이상 보내지 못하도록 차단합니다. 이를 **백프레셔(backpressure)**라고 합니다. 이는 메모리 과부하로 인한 시스템 충돌을 방지합니다.
  • 작업자 수 (Worker Count): "이 스테이션에는 3명의 작업자가 있다."
  • 오버플로우 정책 (Overflow Policy): "줄이 가득 차면 가장 오래된 항목을 버린다" 또는 "멈춰서 기다린다."
  • 순서 (Ordering): "단어들이 만들어진 정확한 순서대로 나오도록 보장한다."

논문은 이러한 규칙을 설정하면 시스템이 사용하는 메모리 양이 절대 폭발하지 않는다는 것을 수학적으로 증명합니다. 메모리는 안전하고 예측 가능한 범위 내에 머뭅니다.

결과: 연구 결과

연구진은 시뮬레이션 테스트와 DeepSeek 모델의 실제 데이터를 혼합하여 AiFlow를 테스트했습니다. 그들은 AiFlow를 다음 세 가지 방식과 비교했습니다:

  • Aggregate (집계): 아무것도 하기 전에 전체 답변이 나올 때까지 기다리는 방식 (기존의 느린 방식).
  • Stream Callback (스트림 콜백): 규칙 없이 단어가 들어오는 대로 처리하는 방식 (정리되지 않은 방식).
  • LangGraph: 스트리밍을 처리하지만 개발자가 수동으로 큐를 관리해야 하는 인기 있는 기존 도구.

수치는 다음과 같이 나타났습니다:

  • 속도: AiFlow는 모델의 단어 생성 속도 자체를 빠르게 만들지는 않았습니다 (테스트에서 "모델 TTFT"는 약 101ms로 동일하게 유지됨). 그러나 AiFlow는 애플리케이션이 첫 번째 처리된 결과를 전달하는 속도를 훨씬 빠르게 만들었습니다. "Aggregate" 방식과 비교했을 때, AiFlow는 첫 번째 처리된 토큰을 얻는 시간을 70.9%에서 94.7%까지 단축했습니다. 예를 들어, 한 테스트에서 시간은 10초 이상에서 단 210밀리초로 줄어들었습니다.
  • 메모리 안전성: 이것이 큰 승리입니다. "느린" 부분(예: 텍스트를 음성으로 변환하는 작업)이 따라오지 못할 때, "백프레셔가 없는(No Backpressure)" 시스템들은 대기 줄이 231개 이상으로 늘어나 충돌 위험을 초래했습니다. 반면, 노드 가디언을 가진 AiFlow는 줄을 엄격하게 8개로 유지하여 메모리 오버플로우를 방지했습니다.
  • 신뢰성: 인터넷 속도가 불규칙하고 Ollama와 같은 다양한 모델을 사용하는 실제 환경에서도 테스트했을 때, AiFlow는 낮은 메모리 사용량과 높은 속도를 유지했습니다.

이것이 당신에게 의미하는 것

이 논문은 더 빠른 컴퓨터 칩이나 더 똑똑한 AI 두뇌를 발명했다고 주장하는 것이 아닙니다. 대신, "교통 체증" 문제를 해결했습니다. 프로그램이 실행되기 에 데이터가 어떻게 흐를지에 대한 규칙을 선언(간단한 언어나 JSON 파일 사용)함으로써, 개발자들이 더 빠르고 안전하며 수정하기 쉬운 AI 앱을 구축할 수 있음을 보여주었습니다.

만약 당신이 개발자라면, 더 이상 큐와 작업자를 관리하기 위해 복잡한 코드를 작성할 필요가 없습니다. 그저 규칙을 선언하기만 하면 "노드 가디언"이 나머지를 처리합니다. 만약 당신이 사용자라면, 당신의 AI 챗봇이 대화를 나누는 동안 자신의 단어를 필터링하고 목소리로 내뱉는 과정이 거의 즉각적으로 이루어지며, 대화가 길어져도 앱이 멈추거나 메모리가 부족해지는 일 없이 사용할 수 있음을 의미합니다. 이 시스템은 AI가 말이 많고 사용자가 읽는 속도가 느리더라도 주방이 깨끗하게 유지되고 음식이 계속 제공되도록 견고하게 설계되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →