强化学习

长程 Agent 为什么会失效:数据、训练与评估
长程 Agent 为什么会失效:数据、训练与评估

Agent 单步很强,任务一长却容易迷路。本文以代码 Agent 为例,分析误差累积、上下文膨胀和奖励稀疏,并梳理轨迹数据、后训练、安全与评估中的关键方法。

Apr 11, 2026

Code Agent 的中控系统:搜索、验证与长期运行
Code Agent 的中控系统:搜索、验证与长期运行

Code Agent 的能力不只来自模型,也来自规划、工具、验证、上下文和权限组成的控制闭环。本文从搜索、反馈、RLVR 与长期运行四个角度拆解这套中控系统。

Jan 2, 2026

深度强化学习方法-PG系列
深度强化学习方法-PG系列

基于policy gradient的强化学习方法的梳理总结,从经典的策略梯度算法开始,讨论A3C,DDPG,PPO,以及IMPALA等系列算法的基本思想和实现。

Jun 13, 2019

深度强化学习方法-DQN系列
深度强化学习方法-DQN系列

基于dqn 的强化学习方法的梳理总结,从经典的DQN算法开始,总结不同方法的改进策略,到集大成者Rainbow算法。

May 13, 2019

强化学习系统库及仿真环境
强化学习系统库及仿真环境

梳理当前经典的强化学习开源库, 以及一些经典的仿真环境。

Apr 23, 2019

强化学习基本问题回顾总结
强化学习基本问题回顾总结

强化学习问题的概述,从问题定义,到分类,以及传统强化学习算法(主要覆盖DQN之前的RL经典算法,包括:动态规划、蒙特卡洛、时序差分q-learning和sarsa 等)。

Apr 13, 2019

PyBrain库的example之NFQ流程图分析
PyBrain库的example之NFQ流程图分析

有关PyBrain 库中NFQ算法的流程图分析,包括数据处理和策略的优化pipeline.

May 27, 2016