问题与职责
国产 GPU 后端需要同时对齐 TensorFlow 算子语义、HostMemory、资源变量及 Device Kernel 生命周期。
2026.01—2026.04,算子与编译器优化实习生。接入 muDNN 并修复 GELU 融合链路,优化 Logical_Or,补充 Adam / AdaMax / GradientDescent 实现或修复及测试。针对随机崩溃重构 HostMemory,修复资源变量更新和 Session 关闭问题。
验证结果
| 条件 / 指标 | 结果 |
|---|---|
| 整网 GELU 融合 | 11 / 11 |
| 真实 shape GELU 耗时 | −36.6% |
| Logical_Or 算子耗时 | 21.2 μs → 10.7 μs |
| 稳定性阶段验证 | 500 rounds ≈30% success → 1,000 rounds 100% |
| 长跑轮数 | 40,000 / 400,000 / 800,000 |
公开 PR 作为实习产出的可核验记录,计入含实习贡献的总数,但不重复计算。
来源:本人 2026 年 9 月简历与工程记录摘要;以下为所述实验条件下的结果。
GELU 与 Logical_Or 数字是算子级结果,不等于整网吞吐提升。长跑结果反映所测环境和轮数,不表示无限期稳定。
实习期间的公开 PR
2026-09-29| PR | 已合入内容 | 状态 |
|---|---|---|
| #163 ↗ | AdaMax 算子、资源变量支持与测试覆盖。 | Merged |
| #144 ↗ | 长跑稳定性、OOM 与 GradientDescent locking 修复。 | Merged |
| #138 ↗ | GradientDescent 普通变量与资源变量算子。 | Merged |
| #135 ↗ | 调试计时与 shape 同步稳定性。 | Merged |
| #129 ↗ | Logical_Or 标量广播优化及逻辑算子测试。 | Merged |
| #113 ↗ | AddV2 热路径优化与性能分析降噪。 | Merged |
| #101 ↗ | muDNN GELU、融合链路与真实 shape benchmark。 | Merged |
| #78 ↗ | ResourceApplyAdam 更新与 Session 关闭修复。 | Merged |
| #72 ↗ | GELU 图融合实现与正确性验证。 | Merged |
| #57 ↗ | Kernel Timing 性能分析工具。 | Merged |