8 月 12 日和 13 日,AI Agent 赛道迎来了一个罕见的”同日撞车”:DeepSeek 正式发布旗舰模型 V4 Pro,马斯克旗下 SpaceXAI 同步推出 Grok 4.6,两款模型都把宣传重心压在了”面向 AI Agent 的能力”上。一边是国产模型用极致性价比打”降本”牌,一边是 SpaceXAI 用长程任务能力打”持久”牌。本文综合 IT 之家、澎湃新闻、经济观察报、华尔街见闻等多家媒体报道,梳理两款模型的核心参数、定价策略和行业影响。
前沿模型的密集发布,和站内一直跟踪的 Agent 经济学拐点、a16z 的 Agent 经济学判断 形成了直接呼应——当模型的成本降下来、长程能力提上去,Agent 规模化部署的经济账才算真正算得过来。
DeepSeek V4 Pro:把 Agent 推理成本打到顶级模型的 1/60
据 IT 之家 8 月 13 日报道,DeepSeek 在凌晨正式发布 DeepSeek-V4-Pro,大幅增强了 Agent 能力,在多项测试中表现接近甚至超越 Claude Opus 4.8 和 Fable 5 等顶级模型。核心规格:支持 100 万 Token 上下文和 384K 最大输出;定价每百万 Token 输入 3 元、输出 6 元。
经济观察报的测算把这个价格差讲得很直白:V4 Pro 缓存未命中的输入价格仅为 Claude Fable 5(约 360 元)的 1/60,是国内竞品 Kimi K3(约 100 元)的零头;输出成本仅为输入的 2 倍,远低于 ChatGPT/Claude 的 4-5 倍。在 Terminal Bench 2.1 上,V4 Pro 拿到 87.9 分,距离 Fable 5 仅差 0.1 分。
这意味着什么?长期运行的 Agent 场景里,Token 成本是实打实的可变成本。一个每小时调用几十次工具、每次都要大段上下文的 Agent,模型单价从 360 元降到 3 元,是数量级的差距。站内之前聊过 AI Agent 电脑操作每小时 6 美元 的经济账,如果底层模型成本砍到 1/60,很多原本”算不过账”的 Agent 场景会突然变得划算。
Grok 4.6:主攻长程智能体,重新杀回第一梯队
据华尔街见闻 8 月 13 日报道,SpaceXAI 发布 Grok 4.6,重点强化长时间运行的智能体能力。在 GDPVal-AA v2 基准上达到 1753 Elo,超过 GPT-5.6 Sol Max 的 1728 分;API 起价 2 美元/百万输入 Token,约为竞品的一半,已接入 Cursor、OpenRouter 等平台。
第三方评测机构 Artificial Analysis 的 Intelligence Index 显示,Grok 4.6 得 61 分,与 GPT-5.6 Sol 处于同一水平,相比上一代 Grok 4.5 提升 5 分,重新回到前沿模型行列。不过它对比 Anthropic 的 Fable 5 并没有形成碾压——在部分软件工程、终端操作测试中 Fable 5 仍然领先。
Grok 4.6 的定位非常清晰:不追求通用问答榜单,而是”能够独立承接连续复杂任务”的模型。比如让用户提出开发一个软件的需求,模型自己理解需求、写代码、跑测试、发现问题、再改代码,而不是每一步都等新指令。这和 SpaceXAI 此前发布的 Grok Bot 产品是一套组合拳——Grok Bot 是”永远在线的云端同事”,Grok 4.6 就是驱动这些同事干长活的大脑。
同台竞技背后:从”回答问题”转向”完成任务”
两款模型同日发布、同时押注 Agent,不是巧合。它标志着一个行业共识正在形成:大模型的下一轮竞争,不再是”谁更能聊天”,而是”谁更能长时间、连续地完成任务”。DeepSeek 用 100 万上下文和 384K 输出解决”长任务放不下”,Grok 用长程智能体优化解决”长任务中途掉链子”,一个从容量维度、一个从稳定性维度,分别切入了 Agent 的两大痛点。
腾讯也在同期透露,其更大参数规模的 Hy4 模型计划近期发布;阿里此前已上线 千问办公 并推进 Agent 能力。这意味着国产模型在 Agent 赛道的竞争正在全面升温,价格战和技术战会同时开打。
对开发者的实际意义
对做 Agent 的团队来说,这两款模型提供了两条互补的选择路径:追求极致成本、跑批量和长任务,DeepSeek V4 Pro 的 1/60 定价是硬吸引力;追求复杂长流程的稳定执行,Grok 4.6 的长程优化值得试。但要注意,模型能力强不等于 Agent 强——变更后验证清单 和 质量门禁 这类治理层工作,换任何模型都省不掉。
老达点评
DeepSeek 和 Grok 这一撞,撞出了 Agent 赛道的两个真问题:成本和持久。前者决定你能不能规模化,后者决定你规模化了之后会不会崩。DeepSeek 的 1/60 定价是杀手锏,但价格战打到最后,比的还是”便宜之外还能不能稳定跑长活”;Grok 的长程优化是差异化,但 2 美元的定价在 DeepSeek 面前不算便宜。我的判断是:2026 下半年的 Agent 模型格局,会是”便宜、能跑长活、生态工具全”三者的平衡,谁先补上短板谁先吃到规模化红利。对普通开发者,眼下最实在的动作是把这两款都接进你的 Agent 框架里,用真实长任务各跑一遍,数据说话。
总结
8 月 12-13 日,DeepSeek V4 Pro 正式版与 Grok 4.6 同日发布,共同押注 AI Agent 赛道。DeepSeek 以 100 万上下文、384K 输出和顶级模型 1/60 的定价主打降本,Grok 4.6 以长程智能体优化和 1753 Elo 主打持久执行。两大前沿模型的交锋,标志着大模型竞争从”回答问题”全面转向”完成任务”,也把 Agent 规模化落地的成本和稳定性两大瓶颈同时推到了台前。