Context and Symmetry in Auditing: A Case Study of Skeleton Inference in Motion Capture
本論文は「コンテクスト的監査(contextual auditing)」を導入し、グラウンドトゥルース(正解)が未知であるか、あるいは論争の的となっている状況下でのAIシステムの検証における課題に対処するために、科学技術社会論における「対称性(symmetry)」の概念を活用するものであり、モーションキャプチャにおけるスケルトン推論に関するケーススタディを通じてその手法を実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたはロボットに人間の体を理解させる方法を教えようとしていると想像してください。腕がどれくらいの長さか、肩の幅がどれくらいか、あるいは膝がどのように曲がるかといったことを、ロボットに正確に理解させたいと考えています。しかし、ここには落とし穴があります。ロボットは体の内部を見ることができないのです。ロボットが見ることができるのは、外側だけです。では、ロボットが真実を語っているかどうかを、どうやって判断すればよいのでしょうか?これは、「AI監査(AI auditing)」と呼ばれる分野における大きな問いです。通常、ロボットが正しいかどうかを確認するには、その答えを「グラウンドトゥルース(ground truth)」、つまり決して嘘をつかない定規のような、完璧で否定しようのない事実と比較します。しかし、そこに「完璧な定規」が存在しない場合はどうなるでしょうか?もし、測定対象(例えば、皮膚の下に隠れた骨の正確な長さなど)が、直接見ることは不可能なものだとしたら?ここで事態は複雑になります。科学者たちは、そもそも何が「真実」であるべきかを決定しなければならず、時には専門家同士で意見が分かれることもあります。この論文は、完璧な答え合わせができない状況下で、私たちの体を測定するAIシステムを監査しようとする、この混沌としていて、混乱に満ちた、しかし非常に興味深い世界へと踏み込んでいきます。
この論文の著者たち(コーネル・テックやバージニア大学などの研究チーム)は、特定の種類のAI、すなわち「モーションキャプチャ・システム(mocap)」に着目することで、この問題に取り組むことにしました。あなたは、映画やビデオゲームで見かけることがあるでしょう。俳優が小さな反射マーカーの付いたスーツを着用し、カメラがそれらのドットを追跡して、俳優と同じように動くデジタルスケルトン(デジタル骨格)を作り出すものです。この論文は、これらのシステムが行う特定のタスクである「スケルトン・インファレンス(骨格推論)」に焦点を当てています。これは、コンピューターが皮膚の上のドットに基づいて、骨の位置を推測する作業です。
研究者たちは、これらのシステムを検証する従来の方法――コンピューターの推測を「完璧な」測定値と比較するだけのやり方――は、ここではうまく機能しないと主張しています。なぜなら、多くの身体部位については、そもそも単一の「完璧な」測定値というものが存在しないからです。前腕の長さとは、二つの骨の間の距離のことでしょうか、それとも皮膚上の二つの点の間の距離のことでしょうか?これらは異なります!この問題を解決するために、チームは「コンテクスト・オーディット(文脈的監査)」と呼ばれる新しい監査手法を導入しました。単に数字を見るのではなく、測定がどのように行われるかという「物語(ストーリー)」全体、つまり、誰がそれを行い、どのような道具を使い、何を真実だと信じているのかを見るのです。また、彼らは「対称性(symmetry)」という概念も用いています。これは探偵のルールのようなものです。あらゆる測定方法(たとえそれが間違っている可能性があっても)に対して、同じレベルの疑念と敬意を持って接することです。自分の持っている定規が正しく、コンピューターが間違っていると決めつけるのではなく、両者が異なる方法で欠陥を持っている可能性があると仮定し、その上で「なぜ」意見が食い違うのかを突き止めるのです。
このアイデアをテストするために、チームはニューヨーク大学で現実世界の実証実験を行いました。彼らは、クリエイティブなデザイン(ビデオゲーム制作など)のためにこれらのシステムを使用しているモーションキャプチャの専門家たちと協力しました。24人の被験者を募り、二通りの方法で身体測定を行いました。第一に、カメラと41個の反射マーカーを用いたハイテクなモーションキャプチャ・システムを使用しました。第二に、標準的な健康ガイドラインに従って、同じ身体部位を測定する、素朴で伝統的なメジャー(巻尺)を使用しました。
ここにひねりがあります。研究者たちは、メジャーを「真実」とし、コンピューターを「嘘つき」として扱うことはしませんでした。代わりに、両者を「同じ何かを推測するための異なる方法」として扱いました。その結果、コンピューターのシステムはある人々に対しては非常によく機能しましたが、特に、その人の体型が(歴史的に、主に痩身の男性を対象としてきた)システムが元々学習した「平均的な体型」と一致しない場合には、苦戦することが分かりました。メジャーにも、測定者が身体のランドマーク(指標となる部位)をどのように解釈するかによって、独自の課題がありました。
この「対称性」のアプローチを用いることで、チームは、完璧なグラウンドトゥルースがなくても、これらのシステムを効果的に監査できることを示しました。彼らは、コンピューターの誤差がランダムなものではないことを発見しました。それらの誤差は、システムが「人間の体とはどのようなものか」について抱いている特定の前提条件と結びついていました。例えば、もしある人がシステムが想定していたよりも多くの軟部組織(脂肪や筋肉)を持っていた場合、骨の長さに関するコンピューターの推測はズレが生じます。この論文は、これらの隠れた前提条件や、測定が行われる文脈を理解することで、たとえ一つの「正しい」数値を指し示すことができなくても、AIがどこで私たちを欺いているのかを見つけ出すことができると示唆しています。
結局のところ、この論文はモーションキャプチャを修正したり、完璧な身体測定の謎を解いたりすることを主張しているわけではありません。むしろ、より良い「問いの立て方」を提案しているのです。AIが私たちの体を測定している場面においては、魔法のような「真実」を探すのではなく、そのシステムに組み込まれた慣行、道具、そしてバイアス(偏り)に目を向ける必要があることを示しています。これは、職場での安全性や医療診断などのためにロボットが私たちの体を測定することを信頼する前に、そのロボットがそもそもどのようにして測定方法を学んだのかという、複雑で人間臭い物語を理解する必要があるのだという、重要な教訓を伝えています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。