智谱 GLM-5.3 发布、阿里 Qwen3.8 开源:国产大模型集体转向「后训练 Scaling」,开源从价格战变成能力证明

智谱 GLM-5.3 和阿里 Qwen3.8 开源封面图,包含后训练 Scaling、开源权重、能力证明、国产大模型和价格战终结等中文关键词

8 月 14 日这一天,国产大模型圈几乎同时亮了两记重拳:智谱发布新一代基座模型 GLM-5.3,总参数没变、全靠后训练把能力拉高 50%;阿里千问正式开源 Qwen3.8 系列,从 27B 的小模型到 2.4 万亿的旗舰权重一起开放。加上此前 DeepSeek、Kimi 的动作,一个清晰的信号浮出水面:国产大模型的竞争,正在从「堆参数、打价格」转向「拼后训练、比开源」。

这一轮变化值得单独拎出来看,因为它同时牵动了三条线:技术路线(后训练 Scaling)、商业策略(开源权重)和竞争逻辑(从价格战到能力证明)。

事实梳理:GLM-5.3 参数没变,能力涨了 50%

智谱 GLM-5.3 最抓人的点,是它和上一代 GLM-5.2 共用同一个 7430 亿参数的基座,参数量完全没动,所有提升都来自后训练。据智谱披露,编程能力体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 从 4.6 拉到 28.3(开源最佳),DeepSWE v1.1 从 46.2 到 66.9,网络安全方向的 CyberGym 达到 84.5%,略高于 GPT-5.6 Sol 的 83.6%。完整权重将在两周内开源。

支撑这套提升的是智谱的技术组合:IndexShare 架构、SAO(单轨迹异步优化)和新一代强化学习框架 slime。说白了就是——课本没换,换的是更狠的训练方法和数据策略。这和 DeepSeek 此前的 V4-Flash 用后训练把 Agent 基准拉高一大截,是同一条技术路线。

事实梳理:阿里开源 Qwen3.8,两档权重两种许可证

阿里的动作同样是双箭齐发。Qwen3.8-27B 是 270 亿参数的原生多模态稠密模型,Apache 2.0 协议,原生 262K 上下文、可外推至 1M,官方称编程和办公表现超过更大的 Qwen3.7-Plus,量化后消费级显卡就能跑。同时开放的 Qwen3.8-2.4T-A95B 是 2.4 万亿参数的旗舰,激活 95B,这是 Qwen 首次开放 Max 级权重。

但有个细节值得注意:旗舰 2.4T 用的不是 Apache 2.0,而是自定义的 Qwen3.8-Max License——年收入超 5000 万美元的模型服务或 AI 工作助手业务,需要单独向千问申请授权。这个许可证分化,说明开源不是无脑白送,商业上开始留了闸门。

影响分析:后训练 Scaling 正在成为新范式

GLM-5.3 和 DeepSeek 这两波,传递的是同一个判断:预训练堆参数的红利在变薄,后训练 Scaling 的收益正在被验证。这意味着团队不一定非得等下一代更贵的基座,在现有模型上把数据、强化学习和评测做好,本身就能挤出可观的能力提升。这对做 OpenClaw 模型版本管理 的团队尤其重要——模型会越来越频繁地靠后训练更新,切换和验证的流程必须跟上,变更后验证清单 那套也得常备。

影响分析:开源从「低价」变成「能力证明」

更宏观的变化在商业层面。过去国产模型开源的叙事是「便宜、够用」,现在开始变成「能力可信的证明」。Kimi K3 的 API 定价已经和 GPT-5.4 同档,DeepSeek 反而涨价,智谱把安全攻防能力也放进开源——一个越来越明显的共识是:能力撑得住的,才敢把权重放出来。

尤其智谱的开源逻辑值得琢磨:既然强大的攻击能力在扩散,防守能力就不能只攥在少数闭源公司手里。把 CyberGym 拉到 84.5% 的模型开源,等于把「找漏洞」的能力交给更广的防守方。这跟站里反复写的 AI Agent 安全七道防线 是同一件事的两面——能力越强,越要靠开源和协作来补防线。

老达点评

我的判断就一句:国产大模型终于开始「卷对地方」了。过去卷价格,本质是卷谁更能烧钱;现在卷后训练和开源,卷的是谁更会用有限的算力挤出真本事。GLM-5.3 参数不变能力涨 50%,比任何「我们参数又翻倍了」的新闻都更值得鼓掌。

对普通开发者和团队,这轮变化真正该做的动作是:把「模型会快速迭代、且越来越靠后训练」当成前提来设计系统。别再为某一个模型写死 prompt 和流程,而是把 Model + Harness 那套分离做好,让底座可以随时换,评测和回放随时能跑。谁先把这套验证体系建起来,谁就能在后训练时代吃到最多的红利。

总结

智谱 GLM-5.3 和阿里 Qwen3.8 的发布,标志国产大模型进入新阶段:后训练 Scaling 被验证、开源权重成为能力证明、竞争从价格战转向能力战。对开发者而言,真正要补的不是「追上哪个新模型」,而是把模型迭代的验证和切换流程建起来,让每一次升级都可测、可回滚、可复盘。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *