干货!大模型后训练的“剂量”学,什么剂量才能让 Qwen3.8-27B 想得少、不掉能力,还能用 XH 档?

青稞AI · 人工智能

青稞AI 2026-09-06 00:00 河北 这种已经被后训练得很充分的模型,不能再拿一大桶数据往里灌。它更像一个已经吃了很多药的病人,要精细的针对病灶每一条数据都对症治疗。 主页: http://qingkeai.online/ 作者: Lynn https://zhuanlan.zhihu.com/p/2079282516771587155 青稞社区为科研人员提供成果宣传支持,如有优秀研究成果分享推广,欢迎投稿联系: aiFreeCode 先放最终后训练完成的模型地址: https://modelscope.cn/models/Merkyor/Qwen3.8-27B-EfficientThink-K3-Opus5-Grok4.6-GPT5.6Sol-SFT-SimPO-DFlash2 这件事一开始看起来挺简单。Qwen 3.8 27B本质不是不会做题,而是后训练过度,HF上闻XH档色变,只要遇到不会的题这货特别容易一直想。 这个判断不是凭感觉而是有铁证的:原版 Qwen3.8-27B 的正式 GPQA 里,答对的 164 题 reasoning 中位数是 3,627 tokens 基本属于会的就超快回答,答错的 34 题中位数直接顶到 32,768——但凡遇到个不会的就给你思考人生了;关键是26 个 32K 截断还里有 22 个答错——纯属思考半天也白搭。 哪怕第三周 SFT 和最终 SimPO 也有同样的形状——答对题中位数都在 4K 左右,答错题中位数仍是 32K。模型有时答案已经写出来,又突然反悔,重新开一轮推理,最后连正式答案都没提交。 可谓名副其实雷霆思考! 图里三组都是同一套 GPQA 198 题、动态 FP8 + DFlash2、双卡 C24、XH 和 32K 输出上限。右图也能看出:原版有 26 个 32K 截断,第三周 SFT 有 27 个,最终 SimPO 降到 21 个;剩下的超长截断几乎都集中在最后没有做对的题上。 所以我的第一目标一直是把这种没收益的思考压下来。能力当然不能掉,但顺序上确实是先让它变得能用,再确认 GPQA、LCB、MMLU 没被我治坏。我不想做一个每道题只会短答的模型,也不想守着一个分数不错、实际用起来却经常想到超时的模型。 万万没想到,这一下居然就整整折腾了三周。前两周我基本把“剂量不够”和“剂量过量”都试了一遍,第三周才真正弄明白: 这种已经被后训练得很充分的模型,不能再拿一大桶数据往里灌。它更像一个已经吃了很多药的病人,要精细的针对病灶每一条数据都对症治疗。 第一周:小剂量 SFT,几乎没推动它 第一周我先做了小剂量 SFT测试,想法原本很朴素:模型能力既然还在,那我就轻轻推一下,把过度思考收一下。 训练确实剂量很轻,模型也确实没怎么被破坏,可问题是模型的病灶也同样没怎么变化。一周回顾发现这一周主要是 32–130 条规模的测试各种小型SFT,RL 也只推进到 5/24 个题组,没有形成一套能和 198 题 GPQA 正面对比的完整结果。小 样本里偶尔能看到输出局部变干净,但没有任何节点同时做到能力不掉、思考下降和提交改善,所以当时的结论只能是“没有稳定 Pareto”,而不是硬报一个提升百分比。 现在回头看,不能简单说“小剂量没用”。真正的问题是数据没有把病说清楚。模型只看见了一些更短的答案,却没有同时看见:自己原来哪些推理必须留下,哪些错误搜索才是要改掉的东西。药量小,再加上没打中位置,结果自然就不明显。 第二周:终于有效了,能力却跟着掉了 第二周我把 SFT 剂量加大。效果非常明显,结果也非常尴尬:同一套 XH GPQA 上,官方母模是 166/198,大 SFT 后变成 148/198,少了 18 题;与此同时 reasoning 均值从 10,301 降到 4,123,中位数从 6,330 降到 1,576。 也就是说,思考量确实压掉了约六成,但能力也掉了 9.09 个百分点。方向不是完全错,剂量和数据配比却明显过头了。 之后做 RLVR、SimPO 也是类似的感觉。RLVR 把 GPQA 从 148/198 拉回 158/198,无 final 从 15 降到 11,说明它确实有用;但它仍比母模少 8 题,而且 reasoning P95 反而从 16,626 增到 20,912。 病灶还更严重了,原来的能力分布和坏的长尾一起动。直觉这个 27B 已经经历过很多轮后训练,剂量稍微大一点,或者短链、长链、代码、科学的比例偏一点,就很容易顾此失彼。 第三周:不再凑数量,开始一条一条看数据 第三周我换了思路,既然病灶集中那就先彻底定位一下病得不轻的是什么——先让 27B 自己做题,让它把问题充分暴露出来。它自己答对的轨迹留下来护住基座;科学、hard code 里

查看原文