问题与职责
vLLM rollout 与 Megatron 训练侧的自然路由存在偏差,需要对齐路由数据、response mask 和概率漂移指标。
完成 route 采集、传输与回放链路,建立 response-mask 对齐及 mismatch / fτ² / KL 监控;随后将 rollout 系统扩展到更大模型与多卡规模。
验证结果
| 条件 / 指标 | 结果 |
|---|---|
| 8×H200 · Qwen3-30B-A3B · 20-step 路由不一致率 | 17–19% → 0 |
| 同一对照中的概率漂移指标 | fτ² ↓36–145× · KL ↓4–7× |
| 独立的大规模研发验证 | 128 GPUs · 300B-class · 200-step rollout |
打通 RL 训练与 rollout 的数据和验证闭环。
来源:本人 2026 年 9 月简历与工程记录摘要;以下为所述实验条件下的结果。
20-step 小模型指标与 128 卡、300B 级模型的 200-step rollout 是两项不同验证。路由一致不等于最终 reward、收敛或模型质量提升。