Qwen 团队发布 Qwen3.8-Flash-Next 架构报告 125B 总参、6B 激活,外加 51B 放在主机内存的 n-gram 嵌入表 以 1/3 激活参数、1/3 训练 token、...
meng shao(@shao__meng) · 人工智能
Qwen 团队发布 Qwen3.8-Flash-Next 架构报告 125B 总参、6B 激活,外加 51B 放在主机内存的 n-gram 嵌入表 以 1/3 激活参数、1/3 训练 token、约 1/9 训练算力,在 14 项基准中 8 项超越上一代 397B-A17B 旗舰 x.com/i/article/2096… 💬 1 🔄 0 ❤️ 0 👀 449 📊 1 ⚡ Powered by xgo.ing