问题与职责
跨 stream 通信与 FC1 计算竞争 GPU 资源,导致原本较快的计算路径在并发时退化。
搭建 4×H200 双 stream 代理,联合控制 NCCL CTA 预算和 DeepGEMM SM budget。完成 121 组粗扫、89 组细扫及复验,并在相同通信配置下隔离控核收益。
验证结果
| 条件 / 指标 | 结果 |
|---|---|
| AllGatherV 代理联合耗时 | −12.80% |
| 相同通信设置下的控核独立贡献 | 7.58% |
| 配置扫描 | 121 + 89 |
形成联合预算选择与复验方法。
来源:本人 2026 年 9 月简历与工程记录摘要;以下为所述实验条件下的结果。
这里是双 stream 代理测试,而非完整模型训练吞吐结果;联合收益与控核独立贡献采用不同对照,不能直接相加。