发生了什么
昨晚阿里深夜放了个大招,Qwen 团队正式开放了 Qwen3.8-2.4T-A95B 的模型权重。这可不是普通开源,这是 Qwen-Max 级别模型首次开源,意味着你终于能自己部署一个接近旗舰性能的大家伙了。
简单说,这个模型:
- 总参数 2.4 万亿,但每个 Token 只激活 95B 参数(MoE 架构)
- 原生支持 256K 上下文,还能扩展到 100 万 Token
- 每个 MoE 层有 512 个专家,每次路由 10 个,外加 1 个共享专家
- 还做了多步 Token 预测(MTP)训练,推理引擎支持的话可以一次预测多个后续 Token
值得注意的点
这次开源的重点明显不在聊天,而是编程、办公、科研和长周期 Agent 任务。官方博客里提到,后训练阶段他们搞了一套组合拳:
- 持续扩展真实环境——任务从单任务到多任务再到跨天任务,工作空间从多文件到复杂目录,还解耦了不同维度的 Harness
- 统一奖励系统——把基于执行的校验、文本/视觉 rubric 评估、agentic 检查全部统一到一个奖励系统里,消除任务专用 verifier 的不一致性
- 在线数据均衡器——每个 batch 都重新平衡任务、难度、工作区和 harness 的分布,降低梯度方差,让 RL 训练更稳定
这套思路挺务实的,感觉阿里是真想把 Agent 落地,而不是只刷榜。
我的看法
说实话,看到 2.4T 参数我第一反应是“这谁能跑得动?”但 MoE 激活只有 95B,意味着推理成本其实可控,单卡 80G 显存可能就能跑起来(量化后)。
评测数据跟 Opus 4.8、Fable 5、GPT 5.6 Sol 互有高低,不是全面碾压,但 PaperBench、IFBench 上表现亮眼。这很合理——开源模型追平闭源旗舰本来就不是一蹴而就的事。
不过我更关心的是生态:ModelScope 上直接下权重,Qwen Studio 也能玩,阿里这次把链路铺得很全。对于想搞私有化部署或者深度定制的团队,这绝对是个好消息。
最后提醒一句:虽然开源了,但 2.4T 的模型不是随便一台机器能伺候的,先评估好你的算力预算再动手。
评论 (0)