跳到正文
原文
arXiv · AI×医药交叉论文· Wenbin Zhou·· 2 天前AI 评分28

带风险控制的安全元策略设计

Safe Meta-Policy Design with Risk Control

AI 导读

该研究提出一种离线元策略方法,在训练新候选策略前规划更新计划,在预算约束下限制预期出现"更新后性能变差"的次数,以此在策略改进收益与退化风险之间权衡。方法将更新计划表示为有向无环图中的路径,并用动态规划求解;分析指出策略改进的信噪比是决定更新频率、等待时间和风险分配的关键因素。研究在合成数据和临床试验数据上验证了该方法的性能-风险权衡效果。

来源:arXiv · AI×医药交叉论文 · arxiv.org