💻 computer science

Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions

本研究评估了五种大语言模型在 OKAP 式眼科学问题上的表现,结果显示通用型模型(尤其是 Gemini-Pro-3)在准确性和校准度方面优于专门的临床 AI 工具 OpenEvidence,同时也凸显了所有系统都存在的显著性能异质性以及共同的推理失败问题。

Alon Moore Galindo, Amit Ginsberg, Razan Saadi, Tomer Kerman, David Schwartzman, Anat Loewenstein, Igal Leibovitch2026-07-08
💻 computer science

From Head Yaw to HMD Pose: A Reproducible Benchmark of Subjective VR Outcome Recoverability

本文建立了一个可复现的基准,证明虽然全头显(HMD)姿态数据可以有效地模拟某些主观虚拟现实(VR)结果(如空间临场感),但其最理想的角色是作为传统问卷调查的补充性行为信号,而非完全替代品,且其在可用性、工作量和晕动症等不同构念上的可恢复性存在显著差异。

Fabiana Peres, Leonardo Brito, João Marcelo Teixeira, Fatima Nunes2026-07-08
💻 computer science

A Queryable Knowledge Graph of MITRE ATLAS: Cross-Linking Adversarial AI Taxonomies for Grounded Threat Reasoning

本文提出了一种基于 Neo4j 的知识图谱,该图谱将静态的 MITRE ATLAS 文档转化为一个可查询且以大语言模型(LLM)为基础的系统,并将其与 OWASP LLM 应用十大风险进行交叉链接,从而使从业人员能够进行威胁推理、识别 40 个未缓解的生成式 AI 技术,并证明 ATLAS 战术与 OWASP 风险类别之间的正交特性。

Salwa MAKNI2026-07-08