管理智慧大讲堂第12期
主 题:Transfer Reinforcement Learning for Mixed Observability Markov Decision Processes with Time-Varying Interval-Valued Parameters and Its Application in Pandemic Control
主 讲 人:大连理工大学 都牧 副教授
主 持 人:陈威 研究员
主办单位:成都理工大学 管理科学学院
协办单位:能源环境碳中和创新研究中心
时 间:2024年10月9日(星期三) 20:00-21:00
参会地点:#腾讯会议:615-141-802

都牧,大连理工大学经济管理学院副教授。大连理工大学数学与应用数学专业学士、管理科学与工程专业博士,美国普渡大学联合培养博士,东南大学博士后。长期致力于研究数据驱动的智能决策方法,融合大数据、人工智能技术和运筹优化理论方法,解决复杂不确定动态系统的在线建模和优化问题,研究领域包括:共享数据驱动的无人车在线调度、疾病精准筛查与干预决策。主持国家自然科学基金面上项目和青年项目各1项、国家自然科学基金国际重点合作项目1项(合作单位负责人)、省部级纵向项目2项。研究成果发表在INFORMS Journal on Computing(UTD24),European Journal of Operational Research、《管理科学学报》、《中国管理科学》、《系统工程理论与实践》等领域内国内外顶级学术期刊,出版论著1部,授权专利1项,公开发明专利2项,授权软件著作权3项。
主讲内容:本研究探讨了一种新的不确定性在线序列决策问题,即具有时变区间值参数的混合可观测马尔可夫决策过程(MOMDP-TVIVP,Mixed Observability Markov Decision Processes with Time-Varying Interval-Valued Parameters)。此类数据驱动的优化问题在现实世界中有广泛应用,例如在公共卫生管理中有限资源条件下的疫情监测和控制、物种保护中有限预算下监测和管理受威胁的物种保护区、无限传感网络优化中节点能源有限情况下的电源管理。MOMDP-TVIVP的求解面临巨大挑战:首先,需要基于新的观测数据进行在线系统识别和重新优化,且要考虑未观测到的状态和时变参数;其次,MOMDP-TVIVP动作和状态空间巨大,很难实现在线优化。为应对这一挑战,研究团队提出了一种基于迁移强化学习(TRL,Transfer Reinforcement Learning)的新算法,通过够造了一种离线训练-在线微调的框架,将迁移学习(TL,Transfer Learning)与深度强化学习(DRL,Deep Reinforcement Learning)整合,并设计了一种基于群体的网络训练方法。该方法通过离线预训练得到一系列有潜力的网络,存入缓存区,并在在线阶段基于新获取的系统观测数据进行微调,加速在线重新优化。