Automated auditing of statistical quality in university theses: why lexical rules fail and what a language layer adds
本研究は、大学の学位論文における統計的品質のルールベースによる自動監査が、根本的な語彙的限界により偶然よりも低い性能を示す一方で、言語モデル層を統合することで、高い再現率と低コストを維持しながら専門家の判断との一致度を大幅に向上させることを実証している。
257 件の論文
本研究は、大学の学位論文における統計的品質のルールベースによる自動監査が、根本的な語彙的限界により偶然よりも低い性能を示す一方で、言語モデル層を統合することで、高い再現率と低コストを維持しながら専門家の判断との一致度を大幅に向上させることを実証している。
本研究は、9つの教育システムにおけるTIMSS 2023の縦断的データを利用して、数学および科学の両方のベンチマークを下から上へと移行する生徒の結合確率を推定および標準化しており、それによって顕著なシステム固有の差異を明らかにし、共通の深刻度による標準化がターゲットへの依存関係を明確にする一方で、結果は因果的ではなく記述的なものであることを示している。
本論文は、欧州の公式統計が、調査設計の限界によって障害やコストといった決定的な障壁を捉えきれていないために、生成AIの非利用を「ニーズの欠如」と誤って帰属させており、測定上のアーティファクトを真の公衆の無関心と取り違えていると論じている。
本論文は、PISAのカバー率調整済み上位25パーセントの傾向が、人口分母の選択に対して極めて敏感であることを示しており、報告されたデータと世界人口推計(World Population Prospects)の推定値との間の重大な相違を明らかにするとともに、透明性のあるプロベナンス・レポーティングの必要性と、合成ウェイトが調整を誘発する際の注意喚起を強調している。
本研究は、PISA 2022のプラウジブル・バリュー(妥当な値)に内在する測定精度の天井が、到達可能な予測精度を根本的に制限し、領域や教育システム間での予測因子の順位を不安定化させていることを示しており、パフォーマンスの比較およびモデルの解釈は、これら計算可能な測定限界に基づいたものである必要があることを示唆している。
本論文は、非局所拡散、趨向性回避、および免疫減衰を組み込んだ新規な二段階感染年齢流行モデルを構築し、平衡状態のグローバルな安定性を証明するとともに、ベルリンのデータによって検証された、一律のアプローチよりも空間的に標的を絞った介入の優位性を示す間欠的戦略を伴うバイレベル最適制御フレームワークを開発するものである。
本論文は、高次元の密な信号設定においてリッジ回帰が従来好まれてきたことに異を唱え、Lassoの性能不足は固有の欠陥ではなく不適切なチューニングに起因するものであることを示し、Lassoがその極めて重要な変数選択能力を維持しつつ、リッジ回帰に匹敵またはそれを上回る予測精度を達成することを可能にする、新たな事後予測的ペナルティ選択手法を導入するものである。
このモンテカルロ・シミュレーション研究は、国際的な大規模調査におけるBRR、JK2、およびブートストラップ分散推定量の性能を評価しており、JK2は平均値のような平滑な統計量に対して優れた精度を提供する一方で、ブートストラップ法とBRRは非平滑な統計量に対してより正確であり、さらにFayによる調整と無回答処理が推定量の信頼性に大きく影響することを明らかにしている。
本論文は、ランダム化比較試験のデータから、交絡および時間に関連するバイアスを系統的に誘発することによって現実的な観察データセットを生成するベイズ統計学的枠組みであるInverse Target Trial Emulation(ITTE)を導入するものであり、これにより、非ランダム化健康研究におけるこれらのバイアスを調整するための分析戦略の厳密な評価および比較を可能にする。
9,161件の撤回論文に関するこのメタデータ分析は、Retraction Watchにおける「コンピュータ生成コンテンツ」という理由が特定の出版社に集中しており、ペーパーミルと強く関連していることを明らかにしているが、これらのパターンは共同コーディングの実態を反映したものであり、撤回された論文内に実際に生成AIが存在していたことの決定的な証拠を与えるものではない。