Testing the capability and performance of Claude Sonnet 4 on the GRE physics test
本文表明,Claude Sonnet 4 在一份 70 道题的 GRE 物理模拟考试中取得了 990 分的满分标化成绩,显著超过了作者 90% 正确率的假设,凸显了该模型在复杂科学问题解决方面的强大能力。
2404 篇论文
本文表明,Claude Sonnet 4 在一份 70 道题的 GRE 物理模拟考试中取得了 990 分的满分标化成绩,显著超过了作者 90% 正确率的假设,凸显了该模型在复杂科学问题解决方面的强大能力。
本文提出了一种利用 Google BigQuery 和 Apache Airflow 的工作流编排自适应生存率评分(WOASS)方法,旨在实现企业级 CRM 系统中低延迟、高可靠性的记录链接,并通过加权生存率评分和治理监控,证明了在数据质量和处理速度方面的显著提升。
为了解决由低光照、遮挡和热干扰引起的可见光-红外目标跟踪中的模态可靠性问题,作者提出了一种基于孪生 Transformer 的漂移早期预警系统,该系统利用跨模态注意力机制和时间一致性约束来动态评估跟踪可靠性,并能以高精度提前约 8.4 帧预测失败。
本文提出了一种两阶段的合成到真实迁移学习框架,该框架利用 400 份经过临床验证的合成报告来预训练视觉-语言模型,与现有的最先进方法相比,显著提高了自动乳腺 X 线摄影报告生成的性能和数据效率,并减少了幻觉现象。
本文提出了一种任务自适应解码器特化框架,该框架利用共享编码器和潜表示,通过动态重构的解码器侧适配器,在统一图像编码中(特别是在低比特率下),同时增强用于机器分类的语义判别性和用于人类感知的高频纹理保真度。
本文提出了一个基于 Docker 的框架,该框架将 SeQUeNCe、QuNetSim 和 SimQN 集成到一个统一、可扩展的环境中,并通过 API 驱动的通信和交互式可视化,来简化量子密钥分发(QKD)网络的模拟、分析与部署。
本研究表明,通过在超过 21,000 张眼底照片上进行微调的领域预训练 Vision Transformer(RETFound),在预测四分类视力方面实现了显著的一致性,同时发展出了解剖结构有序的注意力模式——从低视力眼睛中的视网膜血管转向正常视力眼睛中的黄斑区——这些模式与分类正确性相关联,并为不确定预测提供了可解释性。
通过在十个文献语料库上应用严格的缓解泄漏框架,本研究证明了时间距离是引文形成的主导预测因子,在时间严格限制的条件下,其预测能力始终优于语义对齐和引用网络显著性。
本文提出了一种名为 CAMSF-ADAS 的鲁棒性目标检测框架,用于高级驾驶辅助系统,该框架通过时空校准和交叉注意力融合整合了摄像头、激光雷达和雷达数据,并利用 YOLOv12 进行定位,以及通过改进的河马优化算法调优的时空融合 Transformer 来增强分类。
本文通过在 Arm TrustZone-M 上的真实硅片验证表明,针对常数时间执行对加密算法进行重新设计优于后期补救,因为后者不仅会产生高出约两个数量级的成本,而且还存在保留可被利用的控制流泄漏的风险,而这类泄漏只有通过逐指令验证才能检测出来。