CMU 等团队 AI Ataraxos 以 15 比 1 击败最强 Stratego 人类选手
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI Ataraxos 以 15 胜 1 负 4 平击败被视为史上最强 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI Ataraxos 以 15 胜 1 负 4 平击败被视为史上最强 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。
一项新研究提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹一分为二、组合两段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。该方法在 goal-conditioned RL 中实现了可扩展的分治价值学习,作者称这是首个将分治价值学习扩展到高复杂度任务的工作。相比 n-step TD,它无需调 n 超参,也不必然带来高方差或次优性。