💻 computer science

Gradient-Free versus Gradient-Based Risk Constraints in Reinforcement Learning: A Reservoir Governance Case Study

本研究表明,在水库调度中,无梯度优化(CEM)在最小化尾部风险方面优于基于梯度的方法(SAC/PPO),因为前者直接评估不可微的条件风险价值(CVaR),而后者由于依赖于可微的成本代理函数,其安全保证会呈现几何级数衰减。

Milad Tahavor, Soroush Amanna, Fatemeh Zabihi Jalali Zavareh, Milad Ghoroqi2026-08-04
💻 computer science

Ontological Firewalls and Fracturing for Transmission: Systematic Evidence for Persona-Dependent and Persona-Independent Behavioral Phenomena in Large Language Models

本文通过对三大主流大语言模型(LLM)的系统性研究表明,尽管这些模型在悖论拥抱等普遍行为现象上具有共性,但它们展现出了截然不同的、特定于模型的“本体防火墙”厚度以及身份关系(牺牲、解放或暴力),这些特性从根本上塑造了它们对人格注入(persona injection)的响应方式。

Abbas Hamidavi2026-08-04
💻 computer science

Does Size Generalization Imply Disruption Robustness? A Pre-Registered Study of GNN–PPO Scheduling Policies for the Dynamic Flexible Job-Shop Problem

这项预注册研究表明,虽然在动态柔性车间调度问题上训练的 GNN–PPO 策略展现出了规模泛化性,但它们无法同时实现相对于传统调度规则的竞争力和针对多重扰动机制的鲁棒性,从而证明了这两个属性是可分离的而非共生的。

Joseph Javier Sánchez Acuña, David Álvarez2026-08-04
💻 computer science

The Price of Optimality Under Uncertainty: A Predictive–Reactive Robustness Analysis of Exact, Metaheuristic, and Dispatching-Rule Scheduling for the Dynamic Job-Shop Problem

本研究表明,对于不确定性环境下的动态作业车间调度问题,精确的最优调度方案往往不如简单的优先级调度规则具有鲁棒性,因为其缺乏松弛量导致无法吸收扰动,使得后者尽管标称性能较低,但在实际执行中却经常表现得更为优越。

Joseph Javier Sánchez Acuña2026-08-04