framework / Engineering

TensorFlow MUSA Extension

摩尔线程实习:算子与优化器适配、GELU 融合、性能分析和长跑稳定性。

问题与职责

国产 GPU 后端需要同时对齐 TensorFlow 算子语义、HostMemory、资源变量及 Device Kernel 生命周期。

2026.01—2026.04,算子与编译器优化实习生。接入 muDNN 并修复 GELU 融合链路,优化 Logical_Or,补充 Adam / AdaMax / GradientDescent 实现或修复及测试。针对随机崩溃重构 HostMemory,修复资源变量更新和 Session 关闭问题。

验证结果

条件 / 指标结果
整网 GELU 融合11 / 11
真实 shape GELU 耗时−36.6%
Logical_Or 算子耗时21.2 μs → 10.7 μs
稳定性阶段验证500 rounds ≈30% success → 1,000 rounds 100%
长跑轮数40,000 / 400,000 / 800,000

公开 PR 作为实习产出的可核验记录,计入含实习贡献的总数,但不重复计算。

来源:本人 2026 年 9 月简历与工程记录摘要;以下为所述实验条件下的结果。

GELU 与 Logical_Or 数字是算子级结果,不等于整网吞吐提升。长跑结果反映所测环境和轮数,不表示无限期稳定。

实习期间的公开 PR

2026-09-29
PR已合入内容状态
#163 ↗AdaMax 算子、资源变量支持与测试覆盖。Merged
#144 ↗长跑稳定性、OOM 与 GradientDescent locking 修复。Merged
#138 ↗GradientDescent 普通变量与资源变量算子。Merged
#135 ↗调试计时与 shape 同步稳定性。Merged
#129 ↗Logical_Or 标量广播优化及逻辑算子测试。Merged
#113 ↗AddV2 热路径优化与性能分析降噪。Merged
#101 ↗muDNN GELU、融合链路与真实 shape benchmark。Merged
#78 ↗ResourceApplyAdam 更新与 Session 关闭修复。Merged
#72 ↗GELU 图融合实现与正确性验证。Merged
#57 ↗Kernel Timing 性能分析工具。Merged