IQuest-Q1 · 实习工程
01FA3:确定性 SWA 反向调度缩短 dQ semaphore 依赖链,在原 fused kernel 内调整 ticket 与 reverse scheduler。完整 backward · 3.98×02FC1:计算与通信竞争优化在 4×H200 双 stream 代理上联合调整 NCCL CTA 与 DeepGEMM SM 预算。代理联合耗时 −12.80%03确定性 MoE Router GEMM为小 M decode 接入三级后端,兼顾选核、CUDA Graph 和逐位一致性。Router 耗时 −73.39%04OE:异步 GPU 状态算子将历史 token 状态留在 GPU,以 Triton fused-hash 减少同步与回传。TP1 吞吐 +4.99%05R3:MoE 训推路由一致性打通 vLLM 路由采集、传输与 Megatron 回放,扩展到 128 卡研发验证。路由不一致率 → 006FlashInfer:CUDA Graph hang 排障两卡最小复现定位 Lamport sentinel 的 FTZ 误判,回移上游修复。模型级 Graph 回归
其他工程记录
| 项目 | 内容 |
|---|---|
| H200 Grouped GEMM | 工作量口径重建、shape replay 与调优。 |
| DeepGEMM 离线交付 | 离线 cubin、完整性校验与部署。 |
| 无人机检测实验流水线 | 数据工程、多 GPU 调度与训练恢复。 |