An Evaluation of Chat Safety Moderations in Roblox
本研究は 200 万件のメッセージのコーパスを分析して Roblox の自動チャットモデレーションを評価し、現在のシステムがストーキング、ハラスメント、暴力など広範な有害コンテンツを効果的にブロックできておらず、かつユーザーが検出を回避するためにさまざまな手法を積極的に用いていることを明らかにした。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
Robloxを、毎日何百万人もの子供たちが集まる巨大で賑やかなデジタル遊び場だと想像してみてください。それは何千もの異なるゲームルームを持つ巨大なバーチャルモールのようなものです。楽しい場所ではありますが、あなたが尋ねている論文は、その遊び場の「行動規範」に対するセキュリティ監査のようなものです。
研究者たちはこう疑問に思いました:セキュリティガード(チャットモデレーションシステム)は実際にその役割を果たしているのでしょうか?
以下に、彼らの発見をわかりやすく解説します。
1. 任務:「悪者」を捕まえる
研究者たちは、Roblox が悪質な言葉や危険なメッセージを自動的にブロックするシステムを持っていることを知っていました。しかし、彼らは「悪者」(子供をいじめ、嫌がらせ、または誘拐しようとする人々)がガードをすり抜けていると疑っていました。
それを確かめるために、彼らは Roblox に悪いメッセージのリストを請求することはできませんでした(Roblox はそれを共有していません)。代わりに、彼らは潜入記者のように振る舞いました。彼らは数週間、ゲームの画面を録画するカメラを設置し、人気のある 4 つのゲームから200 万件以上のチャットメッセージを記録しました。その後、特別なソフトウェア(ハイテクスキャナーのようなもの)を使用して、それらの動画録画をテキストに変換し、読むことができるようにしました。
2. 問題:ガードは運転席で眠っている
テキストが揃うと、彼らは憂慮すべき現実を発見しました。ガードは、すべて大文字で罵声を浴びせるような明白なものを捕まえるのは得意ですが、ゆっくりと進行する危険を捕まえるのはひどく下手です。
これは、赤いシャツを着た人を止めるクラブのボーダンですが、青いジャケットの下に赤いシャツを着た人や、叫ぶ代わりにささやく脅しを放つ人を中に入らせてしまうようなものです。
研究者たちは、システムが以下の有害なコンテンツの膨大な量を見逃していることを発見しました。
- グルーミング: 子供と信頼関係を築き、実際に会うように仕向けたり、プライベートな写真を共有させたりする捕食者。
- いじめとヘイト: 人種差別的な罵倒や卑劣な侮辱。
- 性的コンテンツ: 露骨な会話やロールプレイ。
- 自傷行為: 子供たちが自分を傷つけることについて話すこと。
- 個人情報漏洩: 子供たちが誤って実際の住所や電話番号を共有すること。
比喩: ガードは剣を持って入ろうとすればあなたを止めますが、剣をピザの箱の中に隠して建物に入ってから引き抜けば、入れてしまいます。
3. 「猫とネズミ」のゲーム:子供たち(と悪者)がガードを回避する方法
研究者たちは、ガードが実際にメッセージをブロックしたときに何が起こるかも調べました。彼らは、悪いメッセージを送る人々が諦めるのではなく、創意工夫を凝らすことを発見しました。彼らはモデレーションシステムを、倒さなければならないビデオゲームのボスのように扱います。
彼らはコンピューターをだますための巧妙なトリックを使います。
- 「文を分割する」トリック: ガードが「die(死ね)」という単語をブロックする場合、ユーザーは最初のメッセージで「I just want to...(私はただ~したい)」と入力し、次のメッセージで「die」と入力します。ガードは 2 つの安全なメッセージを見ていますが、読む人は恐ろしい文全体を見ています。
- 「コードワード」トリック: 「bitch(ばか)」と言う代わりに、「b」や「btc」と入力します。コンピューターには意味不明なように見えますが、他のプレイヤーはそれが何を意味するか正確に理解しています。
- 「リーツ・スピーク」トリック: 文字を数字や記号に置き換えます。例えば、「hacker」を「h4ck3r」と書くようにします。
- 「探り」トリック: 水際を試します。「[ブロックされた単語] は持っていますか?」と尋ねます。それがブロックされると、「'D'で始まり'rd'で終わるアプリは持っていますか?」と試します。彼らは文字通りガードの盲点をテストし、何をやり過ごせるかを確認しています。
4. 大きな教訓
この論文は、現在のシステムが反応的であり、先見的ではないと結論付けています。特定の悪い単語が現れるのを待っていますが、会話の背後にある物語や意図を理解していません。
- ガードが見ているもの: 「Hello(こんにちは)」(安全)+「How old are you?(何歳?)」(安全)+「Where do you live?(どこに住んでいる?)」(安全)。
- 現実: これは捕食者が子供の住所を見つけようとしていることです。
研究者たちは、これを修正するには、システムがメッセージを一つずつ(レンガを一つずつチェックするように)見るのをやめ、会話全体(壁全体を見るように)を見る必要があると提案しています。また、ユーザーがルールを破ろうとし続ける場合、システムは個々の単語を何度もブロックするのではなく、その人物を特定して警告するべきだと提案しています。
要約すると: デジタル遊び場にはセキュリティガードがいますが、悪者たちは賢すぎ、ガードは間違ったことに集中しすぎています。子供たちは、隙間をすり抜ける方法を正確に知っている捕食者に対して無防備なまま置かれています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。