跳到正文

#数据/训练

今日 1 条
今天10月4日周日
11月1日周六
  1. Berkeley AI Research34

    无需 TD 学习的强化学习:分治法实现长时程任务的可扩展 off-policy RL

    一项新研究提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹一分为二、组合两段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。该方法在 goal-conditioned RL 中实现了可扩展的分治价值学习,作者称这是首个将分治价值学习扩展到高复杂度任务的工作。相比 n-step TD,它无需调 n 超参,也不必然带来高方差或次优性。

9月1日周一
  1. Berkeley AI Research26

    word2vec 究竟学到了什么?伯克利研究给出闭式理论解释

    伯克利 AI 研究团队证明,在初始化接近零、梯度步长极小等温和近似条件下,word2vec 的学习问题可化简为无权重最小二乘矩阵分解,其梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。训练中模型按离散步骤逐个学习正交线性子空间,每步提升嵌入矩阵的秩并降低损失,这些特征即 M* 的顶部特征向量,可由语料统计和超参数预先算出。