💻 computer science

From Programs to Predictions: A Scalable, Multilingual Platform for Automated Evaluation of Machine-Learning Olympiads

本文介绍了 MLCompete,这是一个可扩展、多语言的 Web 平台,旨在通过异步、与指标无关的流水线以及安全的两层执行环境来评估机器学习奥林匹克竞赛,并通过在罗马尼亚国家人工智能奥林匹克竞赛中的成功部署及国际参与,证明了其鲁棒性和可靠性。

Robert-Mihai Colca, Rusu Dinu-Stefan, Mihai Nan2026-07-14
💻 computer science

Trustworthy AI for Marketing Measurement: A Systematic Review of Attribution, Media Mix Modeling, and Privacy-Preserving Methods

这项针对108项研究(2010–2026)的系统综述通过提出一个“测量—验证—保护”框架,分析了人工智能如何重塑营销度量,该框架旨在平衡深度学习与神经媒体组合模型所带来的增强预测能力,以及隐私保护技术所带来的因果局限性与准确性成本。

Longying Lai, Zhiyuan Cheng, Yue Liu2026-07-14
💻 computer science

Automated Fracture Image Captioning Using Multimodal Vision-Language Models: A Comprehensive Comparative Study on a Clinically Curated Dataset

本文针对临床策划的数据集上的自动骨折放射影像描述任务,对九种编码器-解码器架构进行了全面的基准测试,结果表明,视觉-语言预训练的 BLIP-Base 模型在不同视觉编码器与 GPT-2 解码器的组合中表现最优,同时为低资源医学成像任务中的失效模式分析和架构选择提供了关键见解。

Nikosi2026-07-14
💻 computer science

Foresight Is Not Enough: Sentence-Level Future Signals, Self-Loop Hard Negatives, and the Calibration Gap in Small Language Models

本文表明,尽管 ForesightLM-v2 模型成功学习到了稳定的句子级未来预测信号,但这种表示形式无法直接控制生成行为,从而揭示了其表象上的益处主要源于语义重排序而非学习到的未来术语本身,并凸显了小型语言模型在学习到的表示与校准后的行为结果之间存在的关键差距。

Ahmet Rıfat Öztürk, Yağız Ekrem Dalar, Ömer Faruk Aksoy, Nedim Mutlu Sezer, Feyzi Arda Salihoğlu2026-07-14
💻 computer science

From Telemetry to Techniques: Behavior-Centric MITRE ATT&CK Technique Classification Through Sysmon Event Correlation

本文提出了一种以行为为中心的框架,该框架将 Sysmon 事件重构为基于 GUID 相关联的序列,以改进 MITRE ATT&CK 技术分类,并证明了保留进程级上下文的效果优于时间分组,且基准 SecureBERT 模型在没有进行显式类别不平衡缓解的情况下仍取得了卓越的结果。

Amir Hossein Hemmati, Babak Sadeghiyan, Mahsa Saeidi2026-07-14