Towards smart and adaptive agents for active sensing on edge devices
本論文は、従来のTinyMLのアプローチにおける限界を克服するために、リソース制約のあるエッジデバイス上でカメラの動きを動的に計画および制御することを可能にし、リアルタイムかつ適応的な能動的センシングを実現する、コンパクトな能動的推論ベースのエージェント・システムを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
単に世界を記録するだけでなく、人間の目が細部に目を向け、完全な絵を作り上げるように、何を見るべきかを能動的に選択するカメラを想像してみてください。これは「能動的センシング(アクティブ・センシング)」という領域であり、機械がデータを受動的に待つのではなく、最も有用な情報を集めるために自らのセンサーを動かすという概念です。長年、このようなスマートで適応的な振る舞いを、セキュリティカメラやロボットのように、現場のすぐそばにある小型でバッテリー駆動のデバイスに搭載し、遠くのクラウドサーバーにデータを送ることなく実現することが夢でした。課題は、これを可能にする強力な人工知能システムは通常、膨大な計算能力とメモリを必要とするため、こうした小型でローカルなデバイスで実行することが不可能であるという点でした。
研究チームは現在、この溝を埋めるシステムを構築し、小さなコンピュータボードほどのサイズのデバイス上で、リアルタイムに見て、計画を立て、カメラを動かすことができるスマートなエージェントを生み出しました。最近の論文で発表されたこの研究は、物体を認識することに優れたAIと、不確実性の中で意思決定を行うことに優れたAIという、2つの異なるアプローチを組み合わせることが可能であることを示しています。その結果、人間が細部に焦点を合わせる際に行う素早い、ぎこちない目の動き(サッカード)にちなんで名付けられた「サッカード・エージェント」が誕生しました。これは、人を追跡したり、部屋を自律的に探索したりするためにカメラを制御できます。このシステムは完全にエッジデバイス上で動作するため、すべてをローカルで処理でき、迅速な反応とデータのプライバシー確保を実現しています。
研究者たちは特定の課題に直面していました。標準的なディープラーニングモデルは、ビデオフィード内の人物や車などの物体を見つけることには非常に長けていますが、硬直的です。一度学習すると、環境が変化したり、新しいものを見つけるために次にどこを見るべきかを判断したりすることに苦労します。これらは膨大なデータと計算能力に依存しており、それは小型で低電力のデバイスが求めるものとは正反対です。この問題を解決するために、チームはディープラーニングモデルをより大きく、あるいはより賢くしようとしたわけではありません。代わりに、その上に「能動的推論(アクティブ・インファレンス)」と呼ばれる原理に基づいた、もう一つの知性の層を追加しました。このアプローチでは、エージェントを、常に世界についての信念を更新し続ける「科学者」として扱います。エージェントは、「自分は何を見ることを期待しているか?」そして「何が自分を驚かせるか?」と問いかけます。もしカメラが新しいものを見つけられなければ、エージェントはもっと学ぶために別の場所へ移動することを決定します。もし人などの興味深いものを見つけたら、そこに焦点を合わせます。この意思決定プロセスは非常に軽量であり、メモリをほとんど必要としないため、より重い物体検出ソフトウェアと並行して動作させることができます。
このアイデアをテストするために、チームはAIタスク用に設計された強力なコンピュータであるNVIDIA Jetsonデバイスを使用して、物理的なプロトタイプを製作しました。彼らはこのデバイスを、多くの建物で見られるセキュリティカメラのような、パン(首振り)およびチルト(上下動)が可能なカメラに接続しました。システムには、シーンを監視し、レンズを向けるべき方向を決定するという、単純ながらも強力な任務が与えられました。システムの第一部分である知覚モジュールは、YOLOと呼ばれる有名な物体検出ツールを使用してビデオフィードをスキャンし、人物や物体を見つけ出します。このツールは、デバイスのハードウェア上で高速に動作するように最適化されています。第二の部分である計画モジュールは、カメラが見たもののリストを受け取り、能動的推論を用いて次の動きを決定します。それは、人物を注視し続けるか、あるいは新しいものが現れないかを確認するために空のエリアをスキャンするか、どちらの方向にカメラを向けるべきかを計算します。
結果として、この組み合わせはハードウェアの厳しい制限の中で極めてうまく機能することが示されました。ソフトウェアを含むシステム全体は、わずか304メガバイトのメモリ占有量に収まりました。これは人工知能システムとしては非常に小さいものです。ある構成では、カメラはビデオを処理し、次にどこを見るべきかの決定を毎秒108回行うことができ、これは人間にとって瞬時に感じられるほど速いスピードです。別の設定では、メモリよりも速度を優先し、毎秒45フレームのビデオ分析を行いながら、毎秒250回の意思決定を行いました。研究者たちは、意思決定にかかる時間が非常に短いため、システムがビデオフィードに容易に追従でき、ラグなしで動く対象物をスムーズに追跡したり、部屋を掃引したりできることを発見しました。
この成果が重要なのは、単にカメラが動いたことではなく、その「動き方」にあります。エージェントはあらかじめプログラムされた経路を辿るのではなく、リアルタイムで環境に反応しました。もし人がフレーム内に入ってくれば、カメラはその人にロックオンします。もし人が動けば、カメラもそれに続きます。もし人が去って部屋が空になれば、エージェントは他に何かが起きていないかを確認するために、部屋の残りの部分をスキャンすることを決定します。この振る舞いは、重要なものに焦点を当てる必要性と、全体の状況を把握し続ける必要性のバランスを取りながら、人間が自然に周囲を探索する方法を模倣しています。研究者たちは、カメラを小型ロボットに取り付けることで、このシステムが人間の介入なしに、効率的に新しい環境を探索し、情報を収集できることを実証しました。
研究ではまた、速度とメモリ使用量の最適なバランスを見つけるために、ハードウェア上でソフトウェアを実行するさまざまな方法を慎重にテストしました。その結果、デバイスのグラフィックスプロセッサ用に設計された特定のツールを使用することで、標準的な方法よりもはるかに高速に動作させられることがわかりました。しかし同時に、非常に小規模な意思決定部分については、強力なグラフィックスプロセッサ上で実行しようとすると、タスクを管理するためのオーバーヘッドが追加のパワーによるメリットを上回ってしまい、かえって動作が遅くなることも発見しました。この発見は、適切なソフトウェアツールを適切なハードウェアに適合させることが、これらのシステムを実用化する上で極めて重要であることを強調しています。
この研究は、スマートデバイスの未来が必ずしも巨大なクラウドベースのスーパーコンピュータを必要としないことを示唆しています。堅牢な「見る」能力と、軽量な「計画する」能力を組み合わせることで、賢く、かつ効率的なエージェントを作ることが可能です。研究者たちは、これらのシステムが独立して動作し、複雑で変化する環境の中で、情報を収集するために瞬時の判断を下せることを示しました。現在のシステムはカメラの制御に焦点を当てていますが、同じ原理を、混雑した部屋をナビゲートするロボットや、行方不明者を探すドローンなどの他のタスクに応用することもできます。本研究は、能動的推論が、予測不可能な現実世界に対処できる、適応力が高くリソース効率の良い機械を生み出すための有望な道であることを結論付けており、インテリジェントなセンシングの力をエッジへと直接もたらしています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。