问题与职责
小 M decode 中存在无效 GEMM 计算;同时,选核与 CUDA Graph 路径必须满足确定性约束。
在 vLLM 接入 DeepGEMM / Triton Full-K / persistent 三级后端,负责选核、Graph preflight、cache / fallback 与 workspace 管理,并开展 kernel 和模型场景回归。
验证结果
| 条件 / 指标 | 结果 |
|---|---|
| 48 层 Router 测量工作负载的中位耗时 | −73.39% |
| Kernel 逐位一致 | 135 / 135 |
| 模型场景逐位一致 | 20 / 20 |
| Prefix-cache hit 下整请求处理性能 | TP1 +3.81% · TP2 +4.36% |
覆盖 Kernel dispatch 到推理 Runtime 的完整接入。
来源:本人 2026 年 9 月简历与工程记录摘要;以下为所述实验条件下的结果。
48 层是此项优化的测量工作负载,并非对已发布 IQuest-Q1 层数的描述。Router 局部耗时降幅不等同于整请求收益;后者仅适用于已测 prefix-cache hit 配置。