九坤投资—至知创新研究院 · 2026.04—至今
IQuest-Q1:模型基础设施
参与 IQuest-Q1 的训练、推理与 RL rollout 基础设施开发,负责算子优化、训推一致性、稳定性排障与多卡验证。
团队发布
320B / 15B总参数 / 每 token 激活参数
88 layers公开模型层数
512K公开上下文长度
官方将 IQuest-Q1 定位为面向 agentic coding、推理与多步工具使用的 MoE 模型,采用 3 SWA + 1 FA 的混合注意力。上面的模型规模属于团队发布成果。
我的工作范围
01
训练算子
确定性 SWA backward;FC1 计算与通信竞争。
02
推理 Runtime
确定性 Router GEMM;异步 GPU token 状态。
03
RL 基础设施
Router Replay;多卡 rollout 与 CUDA Graph 稳定性。
01FA3:确定性 SWA 反向调度缩短 dQ semaphore 依赖链,在原 fused kernel 内调整 ticket 与 reverse scheduler。完整 backward · 3.98×02FC1:计算与通信竞争优化在 4×H200 双 stream 代理上联合调整 NCCL CTA 与 DeepGEMM SM 预算。代理联合耗时 −12.80%03确定性 MoE Router GEMM为小 M decode 接入三级后端,兼顾选核、CUDA Graph 和逐位一致性。Router 耗时 −73.39%04OE:异步 GPU 状态算子将历史 token 状态留在 GPU,以 Triton fused-hash 减少同步与回传。TP1 吞吐 +4.99%05R3:MoE 训推路由一致性打通 vLLM 路由采集、传输与 Megatron 回放,扩展到 128 卡研发验证。路由不一致率 → 006FlashInfer:CUDA Graph hang 排障两卡最小复现定位 Lamport sentinel 的 FTZ 误判,回移上游修复。模型级 Graph 回归