Research · Chain-of-Thought Distillation
From Structure to Preference: Token Weighting for Chain-of-Thought Distillation in Large Language Models
AAAI 2027 submission · revised manuscript posted on OpenReview · currently under review.
3 stagesStructure → Weighting → Preference
94.01%Qwen2.5-7B · GSM8K
94.00%Qwen2.5-7B · SVAMP
Under reviewAAAI 2027
Paper
OpenReview ↗Authors: Shankui Han, Zhaoyu Li, Weiwen Yuan, Yuyuan Yang, Haoran Feng, Jinke Ren
现有 CoT 蒸馏通常对所有推理 token 采用近似相同的监督强度,难以区分关键计算与冗余解释。本文使用干预式 token 重要性估计:扰动某个推理 token,并测量教师模型生成参考答案的似然下降,以此识别对正确答案最关键的位置。
Method
Three-stage frameworkStructure recovery从打乱或遮蔽输入中恢复 Decomposition、Solving、Verification、Summary 四段式推理结构。
Token-weighted SFT根据干预式重要性分数提高答案关键 token 的监督权重,并对高重要性位置加入辅助损失。
Preference optimization从学生模型输出构造正确 / 错误偏好对,通过 DPO 偏向正确且结构完整的回答。
Reported results
GSM8K / SVAMP| Student model | GSM8K | SVAMP | Interpretation |
|---|---|---|---|
| Qwen2.5-7B-Instruct | 94.01% | 94.00% | 相对最强 baseline 提升 5.51 / 10.10 个百分点 |
| Qwen2.5-0.5B-Instruct | 38.51% | 50.33% | 结果表明收益受到学生模型容量影响 |
Status boundary. 该论文目前处于 AAAI 2027 审稿流程中;以上数字来自在投稿件,不应表述为已录用或已完成同行评审的结论。