inference / Engineering

确定性 MoE Router GEMM

为小 M decode 接入三级后端,兼顾选核、CUDA Graph 和逐位一致性。

问题与职责

小 M decode 中存在无效 GEMM 计算;同时,选核与 CUDA Graph 路径必须满足确定性约束。

在 vLLM 接入 DeepGEMM / Triton Full-K / persistent 三级后端,负责选核、Graph preflight、cache / fallback 与 workspace 管理,并开展 kernel 和模型场景回归。

验证结果

条件 / 指标结果
48 层 Router 测量工作负载的中位耗时−73.39%
Kernel 逐位一致135 / 135
模型场景逐位一致20 / 20
Prefix-cache hit 下整请求处理性能TP1 +3.81% · TP2 +4.36%

覆盖 Kernel dispatch 到推理 Runtime 的完整接入。

来源:本人 2026 年 9 月简历与工程记录摘要;以下为所述实验条件下的结果。

48 层是此项优化的测量工作负载,并非对已发布 IQuest-Q1 层数的描述。Router 局部耗时降幅不等同于整请求收益;后者仅适用于已测 prefix-cache hit 配置。