← 最新の論文
🤖 AI

HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization

HeraSysは、構造的なノードの統合を通じてワークフロー間の計算上の冗長性を排除し、負荷を考慮した共同スケジューリング・ポリシーを採用することで、テールレイテンシを大幅に削減しながらスループットを向上させ、並行するマルチテナント・ワークフローのエンドツーエンドのパフォーマンスを最適化するLLMサービングシステムである。

原著者: Size Li, Zhiqing Tang, Hongrui Liang, Jianxiong Guo, Jiong Lou, Tian Wang, Weijia Jia

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Size Li, Zhiqing Tang, Hongrui Liang, Jianxiong Guo, Jiong Lou, Tian Wang, Weijia Jia

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

活気あふれる厨房を想像してみてください。そこではシェフのチームが、一度に数百もの複雑な料理を作ろうとしています。人工知能の世界において、これらの「料理」とは、物語を書いたり、質問に答えたり、問題を解決したりする超スマートなコンピューターの脳である「大規模言語モデル(LLM)」が行うタスクのことです。通常、AIに何かを依頼すると、それは単一の、孤立した注文として扱われます。しかし、現実の世界におけるアプリケーションは、より精巧な宴会のようなものになりつつあります。一つのリクエストの中に、情報の検索、データベースのチェック、そして要約の作成といった工程がすべて含まれているのです。これらは「ワークフロー」と呼ばれます。

問題は、多くの人々が同時にこれらの複雑な宴会を注文したとき、厨房が混乱してしまうことです。もし二人の顧客が同じ食材の刻み作業を求めた場合、厨房はそれを二度刻んでしまい、時間とエネルギーを無駄にするかもしれません。さらに悪いことに、もし一人の顧客が大量で調理に時間がかかるシチューを注文した場合、シェフたちがその作業に釘付けになってしまい、他の全員が簡単なサラダの提供を待ち続けることになるかもしれません。これがAIを「サービング(提供)」することの課題です。つまり、複雑で重なり合うリクエストの奔流を、システムを停止させたり、誰かを永遠に待たせたりすることなく、どのように管理するかという課題です。

ここで、HeraSysと呼ばれる新しいシステムが登場します。HeraSysを、単に一つひとつの注文を見るだけでなく、異なる注文同士がどのように助け合えるかを厨房全体を見渡して判断する、革命的なキッチンマネージャーだと考えてみてください。HeraSysは、すべてのリクエストを別々の島として扱うのではなく、重複している部分を探し出します。もし二人の異なる顧客が、同じ文書の分析や同じツールの使用を必要としているなら、HeraSysは「おい、それは一度だけやって、結果を共有しよう!」と言います。また、HeraSysは交通整理の警官のように振る舞い、素早く単純な注文が、遅くて重い注文の後ろで立ち往生しないように、また、重い注文が注意を向けられずに飢餓状態に陥らないように調整します。

HeraSysの開発者たちは、これらの複雑なAIタスクを非常に細かく、粒度の細かい断片へと分解するシステムを構築しました。彼らは、重複するステップを統合し、誰に厨房のリソース(強力なコンピューターチップなど)を割り当てるかを賢くスケジューリングすることで、システム全体を大幅に高速化できることを見出しました。テストにおいて、彼らはHeraSysが、最も遅いリクエストが完了するまでの時間を最大2.17倍短縮し(つまり、2倍以上速くなった)、既存の最高のシステムと比較して、システムが処理できる総タスク数を最大1.85倍増加させたことを示しました。

この論文は、システムがすべてのリクエストを独立した、孤立したジョブとして扱うという従来の手法に対して異議を唱えています。彼らは、この「孤立」が不必要な無駄とボトルネックを生み出すことを示しています。代わりに、彼らはシステムが共有された作業を積極的に探す、協調的なアプローチを提案しています。また、「先着順」のような単純なスケジューリング・ルールについても、長いタスクが全員をブロックしてしまう可能性があるため、あるいは「最短ジョブ優先」についても、長いタスクが永遠に待ち続けることになる可能性があるため、反対しています。HeraSysは、重いタスクのために一部のリソースを確保しつつ、素早いタスクを優先するという、バランスの取れた「負荷を考慮した(load-aware)」戦略を提案しており、これにより、すべての人に対して公平性とスピードを確保します。

実際のハードウェアを用いた広範な実験を通じて測定された結果は、この細粒度で協調的なアプローチが、大きな前進であることを示唆しています。冗長なステップを融合させ、タスクのグループ化と実行方法を動的に調整することで、HeraSysは平均待ち時間を低く抑えつつ、複雑なAIシステムによく見られる「テール(極端に遅い待ち時間)」によるフラストレーションを防止しています。これは、友人たちに家の掃除を頼む際、単に各人に部屋を割り当てるのではなく、二人が同じ廊下を掃除しようとしていることに気づいて二人で一緒にやらせ、同時に、窓拭きをしている人が掃除機の使用を待って立ち往生しないように調整する、ということに似ています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →