暂无搜索历史
第 21 篇解释了 EngineRegistry和 BaseEngine如何把不同训练后端收进同一组 worker 合同。接下来最容易混淆的不是后端名字,而是 ...
第 19 篇和第 20 篇分别拆了 FSDP/FSDP2 与 Megatron/MCore。读到这里,很容易产生一个反问:既然两个后端差异这么大,为什么上层 t...
第 19 篇讲 FSDP/FSDP2:当一次 RL update 进入 worker 内部,训练状态怎样被参数、梯度和 optimizer state 的 sh...
上一篇:腾讯开源 CubeSandbox:当 AI 开始替你动手,Sandbox 就不再是可选项,从 AI Agent 进入办公和研发场景讲起,解释了 Cube...
第三组解释了 rollout 如何把 response 生产出来,第四组导读把问题推进到 worker 内部。本文从最常用的 FSDP/FSDP2 后端切入:当...
如果你第一次接触 AI Agent,可以先把 sandbox 理解成“给模型临时分配的一台隔离小电脑”。模型可以在里面运行 Python、Shell、测试命令,...
第三组把推理嵌入训练:response 不是训练脚本里顺手调用的一次生成,而是由 rollout service、backend adapter、KV cach...
上一篇把工具、sandbox 和环境反馈接回了训练信号。本文继续看这个设计的代价:一旦 rollout 不再是单轮补全,而是长 prompt、长 respons...
上一篇说明了 agent loop 为什么必须坚持 token-in/token-out:多轮轨迹里既有模型生成 token,也有工具 observation ...
当我们进入 RLHF、GRPO、Agent RL、多轮工具调用这些场景时,系统里同时出现了训练目标、数据流、controller、worker、reward、r...
上一篇说明了 rollout 不只是调用后端生成,而是在训推共卡时管理显存状态。本文继续往上看一个更容易被低估的变化:当 rollout 从单轮补全变成 age...
上一篇把 vLLM、SGLang、TRT-LLM 放进了 rollout backend 抽象。本文继续往下看:当 rollout engine 和训练 eng...
上一篇说明了 rollout 是训练系统里的推理服务边界。这一篇继续向下看:如果 rollout 是服务,那么 vLLM、SGLang、TRT-LLM 这些后端...
上一篇导读把第三组的问题定住了:当数据、reward 和算法合同都成立后,下一步要看 response 是怎么被生产出来的。本文先回答最基础的问题:rollou...
第二组把算法从名字翻译成了工程合同:数据入口给出 raw_prompt、reward_model和 extra_info,reward 形成 token 级训练...
上一篇把 reward 从“一个分数函数”拆成了系统接口。这一篇继续往上游走:reward manager 为什么能拿到 data_source、reward_...
上一篇写 KL、clip、entropy,说明 actor 更新需要限速器。但限速器限制的是 reward 和 advantage 驱动出来的更新方向。继续往前...
上一篇写 DAPO、Dr. GRPO 和长度偏置,说明 reward、advantage 和 loss 聚合会把 response 长度变成训练变量。这一篇继续...
上一篇解释了 GRPO 为什么能省掉 critic:它用同一 prompt 的多条 response 做组内相对 baseline,而不是训练一个 value ...
上一篇拆清了 PPO 后训练里的四个角色:actor 才是被 policy loss 更新的主策略,critic 只是给 PPO/GAE 提供 value ba...
暂未填写公司和职称
暂未填写个人简介
暂未填写技能专长
暂未填写学校和专业
暂未填写个人网址
暂未填写所在城市