runtime / Engineering

LLMQRT:量化推理 Runtime

基于 PyTorch Extension,为 H200 双卡交付 32B 量化推理与 Tensor Parallel。

问题与职责

面向 H200 双卡上的 32B 量化推理,需要打通量化后端、Attention、KV Cache 与多卡通信,并排除尾组越界。

负责 W4A16 / W8A8 / FP8 后端适配,接入 FlashAttention-2/4、GQA、softcap 与 SDPA。使用 Compute Sanitizer 定位 gemv_kernel_g128 尾组越界并补充保护;实现 Qwen2 packed-AWQ TP=2 列 / 行切分及 NCCL all-reduce。

验证结果

条件 / 指标结果
Qwen2.5-Coder-32B W4A16 checkpoint 体积−70.5%
峰值显存−66.8%
端到端输出吞吐+76.8%
代表 shape 的四类 Sanitizer 检查0 error / 0 hazard

2025.12—至今。通过数值、跨 rank token 与交互验收,完成 H200 双卡部署验证。

来源:本人 2026 年 9 月简历与工程记录摘要;以下为所述实验条件下的结果。

百分比来自项目中 Qwen2.5-Coder-32B 的对照部署,基线、模型、量化和 batch 配置相关;不推广为所有模型或 FA4 后端的通用收益。