training / Engineering

FC1:计算与通信竞争优化

在 4×H200 双 stream 代理上联合调整 NCCL CTA 与 DeepGEMM SM 预算。

问题与职责

跨 stream 通信与 FC1 计算竞争 GPU 资源,导致原本较快的计算路径在并发时退化。

搭建 4×H200 双 stream 代理,联合控制 NCCL CTA 预算和 DeepGEMM SM budget。完成 121 组粗扫、89 组细扫及复验,并在相同通信配置下隔离控核收益。

验证结果

条件 / 指标结果
AllGatherV 代理联合耗时−12.80%
相同通信设置下的控核独立贡献7.58%
配置扫描121 + 89

形成联合预算选择与复验方法。

来源:本人 2026 年 9 月简历与工程记录摘要;以下为所述实验条件下的结果。

这里是双 stream 代理测试,而非完整模型训练吞吐结果;联合收益与控核独立贡献采用不同对照,不能直接相加。