How Portable Are LLM-Serving Scheduler Rankings Across Workloads, Operating Regions, and Metrics?
本文引入了 LLM 服务调度器可移植性基准测试(LSSP),旨在证明虽然调度策略的排名在某些工作负载来源之间表现出强一致性,但在不同的运行区域和评估指标上却表现出显著的变异性和有限的可移植性,因此必须将调度器的比较解释为取决于其特定的实验上下文。
2305 篇论文
本文引入了 LLM 服务调度器可移植性基准测试(LSSP),旨在证明虽然调度策略的排名在某些工作负载来源之间表现出强一致性,但在不同的运行区域和评估指标上却表现出显著的变异性和有限的可移植性,因此必须将调度器的比较解释为取决于其特定的实验上下文。
本研究评估了用于植物保护的土耳其小型语言模型系统 BitkiKormacı,结果表明,尽管检索增强生成显著提升了在特定开发基准上的性能,但该系统在安全性与抗性任务方面仍表现出关键性的失效,这强调了在实际部署前进行严格独立专家评审的必要性。
本文介绍了代理企业架构框架(Agentic Enterprise Architecture Framework, AEAF),这是一种对传统企业架构元模型的正式扩展,它通过引入一个具有分层 Datalog 语义的专用代理层,旨在通过定义非人类 AI 智能体在企业结构中的权限、问责制和协调约束,对其进行系统化的建模、分析与治理。
本文提出了 GAT-MAPPO-EIG,这是一种图注意力多智能体近端策略优化框架,它利用深度强化学习来高效解决大规模、动态的逃逸拦截博弈问题,通过学习协同拦截策略,而不依赖于计算成本高昂的传统优化方法。
本文介绍了 Qaamuuska-NLP,这是一个包含 46,314 条条目的结构化、机器可读的索马里语词典,它是通过确定性的基于规则的流水线从 2012 年单语词典《Qaamuuska Af-Soomaaliga》中提取而成的,在保留详细语法和词汇信息的同时,也保留了原始条目文本以供验证。
本文介绍了 Mirage Mesh,这是一个针对 Linux 环境的轻量级多层网络欺骗框架,它通过统一的事件模式和自动化流水线,集成了网络层、系统层、软件层和数据层的诱饵,用以检测并分析类似于合法管理行为的恶意活动,同时提出了一种新的指标来评估其在网络杀伤链中的有效性。
这项针对十项高偏倚风险研究的系统综述表明,临床医学中的大型多模态模型容易受到跨越四个不同失效类别的基于输入的破坏,这种威胁无论模型特征或测试防御如何均会持续存在,且并不需要对抗性攻击者即可破坏输出完整性。
本文建立了一个与表示无关的权衡定理,证明了在不受限的确定性下推栈实现中,擦除在低阶固定后保留的高阶语义信息,必然需要以源栈暴露深度和规范化债务量化的物理代价,且该代价的锐利下界源于保留信息与有限观测能力之间的相互作用。
本范围综述通过按任务和评估类型对现有的大语言模型医疗验证方法进行分类,旨在为利益相关者在临床实施前选择合适的策略提供一个结构化框架。
这项系统性映射研究通过回顾35篇初级研究,分析了人工智能如何将口述历史从静态档案转变为动态、互动的领域,在强调转录与分析方面取得显著进展的同时,也强调了关键的伦理挑战以及对创伤知情、以人为本方法的必要性。