rl / Engineering

R3:MoE 训推路由一致性

打通 vLLM 路由采集、传输与 Megatron 回放,扩展到 128 卡研发验证。

问题与职责

vLLM rollout 与 Megatron 训练侧的自然路由存在偏差,需要对齐路由数据、response mask 和概率漂移指标。

完成 route 采集、传输与回放链路,建立 response-mask 对齐及 mismatch / fτ² / KL 监控;随后将 rollout 系统扩展到更大模型与多卡规模。

验证结果

条件 / 指标结果
8×H200 · Qwen3-30B-A3B · 20-step 路由不一致率17–19% → 0
同一对照中的概率漂移指标fτ² ↓36–145× · KL ↓4–7×
独立的大规模研发验证128 GPUs · 300B-class · 200-step rollout

打通 RL 训练与 rollout 的数据和验证闭环。

来源:本人 2026 年 9 月简历与工程记录摘要;以下为所述实验条件下的结果。

20-step 小模型指标与 128 卡、300B 级模型的 200-step rollout 是两项不同验证。路由一致不等于最终 reward、收敛或模型质量提升。