A Secure Multimodal Voice-Based Email System for Visually Impaired Users
本論文は、生体認証のためのFaceNet、高精度な音声認識のためのWhisper、そしてGmail APIを介したメールの要約および翻訳のためのトランスフォーマーモデルを統合することで、グラフィカルインターフェースを排除し、視覚障害者のために設計された、安全でAI駆動型の音声ベースのメールシステムを提案するものである。
1017 件の論文
本論文は、生体認証のためのFaceNet、高精度な音声認識のためのWhisper、そしてGmail APIを介したメールの要約および翻訳のためのトランスフォーマーモデルを統合することで、グラフィカルインターフェースを排除し、視覚障害者のために設計された、安全でAI駆動型の音声ベースのメールシステムを提案するものである。
本研究は、3D Swin Transformerが海馬セグメンテーションにおけるクロススキャナー汎用性において畳み込みニューラルネットワークを大幅に上回り、ファインチューニングなしで多様なマルチセンターデータセット間でほぼ不変の性能を達成し、臨床展開の新たな標準を確立することを実証している。
本論文は、意見の類似性と構造的類似性の双方がソーシャルネットワークにおける分極化を促進する一方で、リンク推奨アルゴリズムにおいてこれらのメカニズムを戦略的に組み合わせることで、ネットワークの断片化を防ぎ、穏当な意見の共存を促進できることを示している。
本論文は、高度な特徴量エンジニアリングとアテンションメカニズムを活用することで、睡眠の不規則性、活動量の低下、社会的引きこもり、および夜間のスマートフォン使用の増加といった主要な行動指標を特定し、スマートフォンとウェアラブルセンサーのデータを統合して高精度なうつ病の早期検出を実現する、説明可能なマルチモーダル・ハイブリッド深層学習フレームワークを提案するものである。
本論文は、wav2vec 2.0 XLS-Rアーキテクチャに基づいたカラカルパク語の自動音声認識システムを提示するものであり、新たに作成された50時間のカラカルパク音声コーパスを活用することで21.10%の単語誤り率を達成し、ラベル付きデータの量が低リソース言語の認識性能に与える影響を実証している。
本論文は、静的なマニュアルに代わるものとして、リアルタイムかつコンテキストに応じた指示を製品設計に直接組み込むAIガイド付き組立フレームワークを提案し、ユーザー調査を通じて、このアプローチが従来の操作マニュアルによる指導と比較して、組立時間、エラー、躊躇、および認知負荷を大幅に減少させることを実証するものである。
本研究は、生の臨床値を保持するために時間的減衰を隠れ状態に限定したTime-Decay Gated Recurrent Unit (TD-GRU) モデルを提案しており、疎で不規則にサンプリングされたICUの軌跡における早期Sepsis-3予測において、統計的に信頼できる純臨床的利益と、いくつかのベースラインに対する優れた性能を実証している。
本論文は、既存のヒューリスティック手法の限界を克服するために、局所的な経路コスト評価モデルと適応的な二重ガイド摂動戦略を利用する完全被覆経路計画アルゴリズムであるCCPP-LPCを提案し、それにより複雑な環境における優れた計算効率と経路最適化を実現する。
本論文は、ソーシャルメディアデータにおける最小合意努力量(Minimum Effort to Consensus: MEC)指標を用いた分極化に基づく異常検知手法を提案しており、2024年のコロンビアにおける年金改革論争に関するXでのケーススタディを通じて、公衆の意見不一致の推移を監視することが、重要な事象を特定する上で従来のボリュームベースのアプローチよりも優れていることを実証している。
本研究は、変分モード分解(VMD)、時間畳み込みネットワーク(TCN)、および双方向ゲート付き回帰ユニット(BiGRU)を組み合わせた新しいハイブリッド深層学習モデルを提案しており、このモデルはNASA POWERのトルコのデータを用いた長期的な月間日射量の予測において、他の9つの機械学習アルゴリズムを大幅に上回る性能を示している。