九坤投资—至知创新研究院
大模型与高性能计算实习生
IQuest-Q1 · 参与已发布的 IQuest-Q1(320B-A15B)MoE 模型的训练、推理与 RL rollout 基础设施开发。
- FA3 确定性 SWA backward · 定位 dQ semaphore 依赖链,实现 contributor-relative ticket 并对齐 reverse scheduler;代表 packed shape 完整 backward 6.755 → 1.699 ms(3.98×),3,601 项回归与 1,000 次逐位确定性测试,交付 wheel。
- FC1 计算与通信 · 4×H200 双 stream 代理,联合控制 NCCL CTA / DeepGEMM SM budget;121 组粗扫、89 组细扫与复验;AllGatherV 代理联合耗时 −12.80%,固定通信设置下控核贡献 7.58%。
- 确定性 Router GEMM · 接入三级后端、Graph preflight、cache / fallback 与 workspace 管理;48 层测试工作负载中位耗时 −73.39%,135/135 kernel 与 20/20 模型场景逐位一致;prefix-cache hit 下 TP1 / TP2 整请求处理性能 +3.81% / +4.36%。
- OE 异步状态 · GPU token history 与 Triton fused-hash;TP1 28/28 case,吞吐 +4.99%;TP2 / TP4 安全路径各 84/84、0 mismatch,decode 吞吐 +4.6% / +3.0%。
- R3 Router Replay · 打通 vLLM / Megatron 路由采集、传输、回放与监控。8×H200、Qwen3-30B-A3B、20-step 对照:mismatch 17–19% → 0,fτ² / KL 降低 36–145× / 4–7×;另完成 128 卡、300B 级研发模型的 200-step rollout。
- CUDA Graph 稳定性 · 两卡最小复现定位 Lamport sentinel 的 FTZ 误判,回移上游位级判断修复;模型级重复 Graph replay 未再观察到 hang / timeout。