近日,自动化学院(人工智能学院)智能物联与协同控制实验室在复杂产品供应链变更控制领域取得又一重要进展。研究团队针对模型完全未知的两时间尺度供应链变更控制问题,提出了离轨强化学习新方法,从二人零和博弈的角度对牛鞭效应加以抑制。利用奇异扰动理论将原双时间尺度零和博弈问题分解为针对快速子系统的LQR问题和针对慢速子系统的零和博弈问题。这将传统的奇异扰动方法扩展到了具有外部扰动和变更未知时变的双时标动态系统。该研究成果以长文发表于控制领域权威刊物IEEE Transactions on Systems, Man, and Cybernetics: Systems (DOI: 10.1109/TSMC.2026.3705358,论文网址链接地址为:https://doi.org/10.1109/TSMC.2026.3705358)。
论文题目为《Off-Policy Reinforcement Learning H ∞ Control for Two-Time-Scale Supply Chain Systems Subject to Design Change》,该成果为复杂产品供应链系统的变更控制提供了坚实的控制理论基础。
该论文由自动化学院(人工智能学院)李庆奎教授团队与美国圣母大学(Notre Dame University)林海教授团队合作完成。
提出“离轨强化学习 H∞ 控制方法”,将奇异扰动理论应用于多时间尺度供应链系统因变更设计导致的模型未知控制问题
针对产品供应链系统在外部事件如网络攻击导致的设计变更,进而引起模型未知的控制问题,提出一种离轨强化学习H∞ 控制方法,从二人零和博弈的角度对牛鞭效应加以抑制。利用奇异扰动理论将原双时间尺度零和博弈问题分解为针对快速子系统的LQR问题和针对慢速子系统的零和博弈问题。这将传统的奇异扰动方法扩展到了具有外部扰动和变更未知时变的双时标动态系统,为供应链系统变更控制设计提供又一重要理论基础。

图1 具有两时间尺度的汽油加工供应链系统结构示意
典型工业过程应用场景仿真验证,研究成果应用未来可期
为验证算法的实际性能,研究团队以原油加工(图1示)为中心的供应链为典型案例开展研究。考虑生产过程的两时间尺度特性及当系统因变更导致的模型未知控制问题,生产库存水平受不同控制机制影响。仿真结果表明,采用离轨强化学习 H∞ 控制方法,生产库存水平跟踪期望值(如图2、图3所示)。

该成果有望推动智能制造过程复杂产品供应链系统向更高效、更智能方向发展。自动化学院(人工智能学院)智能物联与协同控制研究团队的这一理论突破,为产品供应链的管理决策提供又一强有力的控制理论工具。同时,随着研究成果的进一步应用转化,将为国家的战略科技领域做出更大贡献。
IEEE Transactions on Systems, Man, and Cybernetics: Systems 期刊简介
IEEE Transactions on Systems, Man, and Cybernetics: Systems 是美国电气与电子工程师协会(IEEE)下的系统、人与控制论学会 (IEEE SMC Society)旗下的旗舰期刊,被公认为系统科学与工程领域的顶级国际学术出版物。该期刊的研究重点涵盖复杂系统的理论构建、设计策略、分析方法与工程实现,并深入探讨人与系统之间的交互机制与控制范式。在自动化与控制系统、电气与电子工程、运筹学与管理科学等多个学术子领域中,《IEEE Transactions on Systems, Man, and Cybernetics: Systems》均位于前10%,为一区TOP期刊。