runtime / Engineering
LLMQRT:量化推理 Runtime
基于 PyTorch Extension,为 H200 双卡交付 32B 量化推理与 Tensor Parallel。
问题与职责
面向 H200 双卡上的 32B 量化推理,需要打通量化后端、Attention、KV Cache 与多卡通信,并排除尾组越界。
负责 W4A16 / W8A8 / FP8 后端适配,接入 FlashAttention-2/4、GQA、softcap 与 SDPA。使用 Compute Sanitizer 定位 gemv_kernel_g128 尾组越界并补充保护;实现 Qwen2 packed-AWQ TP=2 列 / 行切分及 NCCL all-reduce。
验证结果
| 条件 / 指标 | 结果 |
|---|---|
| Qwen2.5-Coder-32B W4A16 checkpoint 体积 | −70.5% |
| 峰值显存 | −66.8% |
| 端到端输出吞吐 | +76.8% |
| 代表 shape 的四类 Sanitizer 检查 | 0 error / 0 hazard |
2025.12—至今。通过数值、跨 rank token 与交互验收,完成 H200 双卡部署验证。
来源:本人 2026 年 9 月简历与工程记录摘要;以下为所述实验条件下的结果。
百分比来自项目中 Qwen2.5-Coder-32B 的对照部署,基线、模型、量化和 batch 配置相关;不推广为所有模型或 FA4 后端的通用收益。