Self-Supervised Auxiliary Task Discovery for Stable Reinforcement Learning in Stock Trading
本論文は、多様な相場環境における株式取引のための表現学習を強化し、強化学習のポリシーを安定させるために、メタ勾配メカニズムを介して汎用価値関数に基づく補助タスクを自動的に発見する自己教師あり学習フレームワークを提案するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
株式取引の世界は、長らく人間の直感と、混沌として変化し続ける市場との戦いの場となってきました。何十年もの間、トレーダーは価格が上がるか下がるかを予測するパターンを見つけ出そうと、膨大なデータの山を精査するためにアルゴリズムに頼ってきました。近年では、強化学習として知られる強力な人工知能の一種が、この任務における主要なツールとして台頭しています。デジタルエージェントが、正解を教えられるのではなく、行動を試し、間違いを犯し、経験した利益と損失から徐々に学んでいくことで、取引を学ぶ様子を想像してみてください。このアプローチが有望である理由は、市場が昨日と同じように今日振る舞うと仮定する古い手法とは異なり、変化する状況に適応できるからです。しかし、これらのエージェントに、利益を生み出しつつ安定させることを教えるのは非常に困難です。金融市場はノイズが多く予測不可能であり、特定の決定が良かったのか悪かったのかについて、かなり後になるまでエージェントにほとんどフィードバックを与えないことがよくあります。明確なガイダンスがないと、エージェントは学習に苦しみ、不安定になったり、新しい市場環境にスキルを汎用化できなかったりすることがあります。
これらのエージェントがより速く、より確実に学習できるようにするために、研究者たちはしばしば、金銭を稼ぐという主要な目標に加えて、解決すべき追加の小さなタスクを与えます。これらは補助タスクと呼ばれます。従来、専門家は、次の価格変動を予測したり、市場のボラティリティ(変動性)がどの程度になるかを推定したりするなど、エージェントが市場をより良く理解するのに役立つと思われることを手動で設計しなければなりませんでした。しかし、この手動のアプローチの問題点は、市場が絶えず変化していることです。穏やかな時期にはうまく機能するタスクも、激動の時期には役に立たなかったり、あるいは有害になったりすることがあります。もし補助タスクが固定されてしまえば、それらは変化する株式市場の景観に適応できず、トレーディングエージェントに時代遅れ、あるいは無関係な情報をもたらすことになります。
インド工科大学マンディの研究チームは、この問題を解決するための新しい方法を開発しました。人間がどの補助タスクが役立つかを推測させる代わりに、彼らはこれらのタスクを自動的に発見するシステムを作成しました。彼らはこの新しいフレームワークを「QUESTrader」と呼んでいます。核心となるアイデアは、人工知能自身に、自身が何を学ぶべきかを判断させることです。このシステムは、デュアルネットワーク設計を使用しています。一つのネットワークであるメインのトレーダーは、利益を最大化するために株の売買を学びます。二つ目のネットワークは、質問生成器として機能します。これは、本研究で使用された日次終値データとテクニカル指標に基づき、「今後数日間で価格はどうなるか?」や「市場はどの程度動くか?」といった、メインのトレーダーが答えるべき新しく単純な質問を絶えず提案します。これらの質問は固定されたものではなく、システムが現在経験している内容に基づいて動的に生成されます。システムは、トレードを行いながら、これらの質問に答えるようにメインのトレーダーを訓練します。
このアプローチの素晴らしさは、システムがどの質問に答える価値があるかを判断する方法にあります。研究者たちは、長期的な結果を見る洗練された学習メカニズムを使用しています。それはこう問いかけます。「この特定の質問に答えることは、後にトレーダーがより良い意思決定を行う助けとなっただろうか?」もしある質問がより優れた取引パフォーマンスにつながった場合、システムはパラメータを調整して、その質問を継続して生成するようにします。もし質問が邪魔なものだと判明した場合、システムはパラメータを微調整して、その生成を停止します。このプロセスにより、補助タスクは常に現在の市場状況に関連したものになります。研究者たちは、米国のダウ・ジョーンズ工業株30種平均、英国のFTSE 100、インドのセンセックス、そして台湾のTAIEXという、4つの主要なグローバル株式市場でこの手法をテストしました。彼らは、伝統的な投資手法、標準的な人工知能モデル、および手動で設計された補助タスクを使用する他のシステムを含む、幅広い既存の戦略と比較しました。
結果は驚くべきものでした。4つの市場すべてにおいて、QUESTraderシステムは一貫して他の手法を上回りました。米国市場では、年間リターン21.785パーセントを達成し、これは次に優れた手法が達成した18.176パーセントを大幅に上回っています。より重要なことに、このシステムは単に多くの利益を上げているだけでなく、より高い安定性を持っていました。システムは最も高いリスク調整後スコアを達成しており、これは、取ったリスクの単位に対してより多くの利益を生み出したことを意味します。市場が下落した際、QUESTraderエージェントは競合他社よりも損失を少なく抑えました。例えば、インド市場では、最大損失を10.584パーセントに抑え、これは他の高度なモデルで見られた17.783パーセントの損失よりも大幅に低い数値でした。また、システムは非常にボラティリティの高い台湾市場でも効果を発揮し、他のあらゆるアプローチを大きく引き離す30.279パーセントの年間リターンを届けました。
研究者たちは、この成功の鍵は、システムが補助タスクをリアルタイムで適応させる能力にあることを見出しました。適切な質問を自動的に発見することで、トレーディングエージェントはより豊かで正確な市場理解を構築しました。エージェントは、人間が設計したタスクが見逃してしまうかもしれないパターンを認識することを学んだのです。研究ではまた、システムが一度にいくつの質問を行うべきか、そして質問の価値を判断するためにどれくらい先まで見るべきかについても調査しました。彼らは、適度な数の質問、すなわち16から64個程度が最適であること、そして学習プロセスにおいて約10ステップ先を見ることが、将来の成功に対して正しい質問に適切に功績を帰する(クレジットを与える)ことを可能にすることを見出しました。このバランスによって、システムが多すぎる情報に圧倒されたり、先を見すぎることによって混乱したりすることを防いでいます。
この研究は、自動取引の未来は、より優れたルールを設計するより賢い人間にあるのではなく、自分自身が何に注意を払うべきかを教えることができる、より賢い機械にあることを示唆しています。システムに自身の学習目標を発見させることで、研究者たちは、静的な人間による指示に依存するものよりも、より堅牢で、適応力があり、最終的にはより収益性の高いトレーディングエージェントを作り上げました。この知見は、複雑で変化し続ける金融の世界においては、「何を学ぶべきかを学ぶ能力」が、「どのようにトレードするかを学ぶ能力」と同じくらい重要であることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。