d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation
本論文は、論理および数学的ベンチマークにおいて推論能力を大幅に向上させ、新たな最先端の性能を達成する、特殊な軌跡尤度推定器(d2-AnyOrderおよびd2-StepMerge)を採用したマスク型拡散言語モデルのための新しい強化学習フレームワークであるd2を導入するものである。
原著者が当サイトのやさしい解説を確認した論文。
このページに掲載されている各論文については、少なくとも一人の原著者が当サイトのやさしい解説を確認し、内容の正確性を認めるか、または修正を依頼しその修正を私たちが反映しています。確認は各文への正式な承認を意味するものではありませんが、論文を書いた本人たちの目を通ったことを意味します。
1287 件の論文を著者が確認済み · 811–820 / 1287
本論文は、論理および数学的ベンチマークにおいて推論能力を大幅に向上させ、新たな最先端の性能を達成する、特殊な軌跡尤度推定器(d2-AnyOrderおよびd2-StepMerge)を採用したマスク型拡散言語モデルのための新しい強化学習フレームワークであるd2を導入するものである。
本論文は、量子状態の対数とする従来のボルツマンによるエントロピーの定義を批判し、代わりにエントロピーはサブクォンタム(準量子)過程から生じるものであり、ある観測期間における量子状態の出現頻度に対するマクロな系の最大状態実現数の対数の比として数学的に表現されるものであると提唱している。
本論文は、テキサス電力市場におけるコスト上昇に対するビットコインマイナーの電力需要の応答が経済的に状態依存的であることを示しており、ハッシュプライス(予想マイニング収益)の上昇に伴って、電力削減の閾値が高価格側へとシフトすることで需要応答が弱まることから、これらの負荷を信頼性の高いグリッド柔軟性リソースとして扱うことは、その実際の可用性を過大評価する可能性があることを示唆している。
本論文は、AIによる意思決定速度下における制度的調整をモデル化するためにメタマテリアルから着想を得た形式的な工学フレームワークを提案し、検証コストが効用を上回る際に破滅的な「凍結平衡(Freezing Equilibrium)」を予測する構成則を導入するとともに、最適化されたプロベナンス(由来)および検証構造を通じてこの相転移を防止するための検証可能な仮説を提示するものである。
本論文は、相対論的重イオン衝突における回転対称性の回復が、有効な変形モードを指数関数的に抑制する幾何学的なローパスフィルタとして機能することを示す微視的な枠組みを確立し、それによって、古典的に変形した幾何学的構造の使用と、偶数偶核の回転不変な量子基底状態との整合性を図るものである。
Site4Drugは、多様な生物学的エビデンスを統合することで、特に膜タンパク質に関連する、作用可能な介入領域の選択に伴う曖昧さや失敗率を克服し、モダリティを考慮した、ランキング付けされた薬物結合標的部位をタンパク質上で予測するAIエージェントです。
本論文は、連続的な表情の変化をモデリングすることでリアルタイムの顔表情認識を実現するために、マルチスケールネットワークと教師あり対照学習を活用したディープラーニングベースのシステムを提案しており、心理カウンセリングなどの用途に向けて標準的なデータセット上で満足のいく性能を示している。
本論文は、ジェイムズ=シュタイン推定や経験ベイズ法といった従来の手法に内在する「多数派の専制」を克服するために、横断的な情報ではなく個人の履歴を活用することで、集団全体のパフォーマンスよりも個体レベルの正確性を優先する、マイクロパネルデータのための個別重み(Individual Weight: IW)収縮推定量のクラスを提案するものである。
本論文は、戦術的自律防衛車両ネットワーク向けに、エッジ支援型大規模言語モデルと6Gセマンティック通信を統合した通信中心の階層型アーキテクチャを提案し、シミュレーションを通じて、このアプローチが30台規模の車両において、従来の5GベースのAIベースラインと比較して、レイテンシを75.2%削減し、ミッション成功率を68.7パーセントポイント向上させ、通信オーバーヘッドを88.6%削減することで、大幅に優れていることを実証している。
本論文は、自然言語による問題を決定論的な計算代数システム(Computer-Algebra-System)のパイプラインへと正規化するために言語モデルをのみ活用する、信頼性重視のニューロ・シンボリック・アーキテクチャであるAXIOMを紹介しており、これは数学的ベンチマークにおいて94.36%の正確性と100%の信頼性(確信を持った誤りがゼロ)を達成しつつ、システムの改善によって以前に検証された結果が退行しないことを保証している。