DeepSeek V4.1-Flash 发布:Agent 任务成本降到 0.07 美元,自部署为何反而更贵

DeepSeek V4.1-Flash 发布解读封面图,包含 552B MoE、KV Cache 压缩、Agent 任务成本、API 降价、自部署门槛等中文关键词

9 月 10 日,DeepSeek 正式发布 V4.1-Flash。这是一次在中文圈讨论度不算高、但对 Agent 落地影响很直接的发布:它是 DeepSeek 全新架构系列里尺寸最小的模型,却在多项基准上超过了自家旗舰 V4 Pro,同时把 API 价格又砍了一刀。更罕见的动作是——它顺手把 V4 Pro 安排下线了

这篇按「事实梳理 → 影响分析 → 老达点评」的结构讲,重点放在一个很多人没注意到的反直觉结论上:这一轮 API 变便宜了,但你如果自己部署,成本反而更高了。

一、事实梳理:发布了什么

架构。V4.1-Flash 是一个 552B 参数的 MoE 模型,采用新的 Causal-Encoder-Decoder(因果编码器-解码器)结构,输入和输出非对称激活:输入端每 token 只激活约 8B 参数,输出端约 16B。官方说法是成本显著低于同尺寸模型。同时它原生支持多模态视觉理解,支持 100 万 token 上下文,通过 API 最高可输出约 384K token。

能力。官方称新模型采用了新的预训练方式并经过更大规模的强化学习后训练,在基准测试中超越了包括 V4 Pro 在内的一众旗舰模型,生成速度提升近两倍。第三方方面,国金证券的横评把七项公开测试分成科学知识与推理、代码生成、智能体任务三类,结论是 V4.1-Flash 七项全部优于上一代 V4 Flash,其中代码生成和智能体任务的五项还超过了参数规模更大的 V4 Pro,只有科学知识与推理两项仍低于 Pro 版本——也就是说,这一轮提升集中在代码和智能体方向。

成本优化的技术来源。新一代注意力机制把 KV Cache 压到 约 890 字节每 token:对 HBM 的需求降到上一代的 1/4,对 SSD 的需求降到 1/8;官方称相对初代模型,KV Cache 累计已缩小 437 倍。这一点很关键,下面会展开。

价格与迁移。API 模型名改为 deepseek-flash。闲时价格(每百万 token)为:缓存命中 0.02 元、缓存未命中 1 元、输出 4 元;高峰时段(工作日 9:00-12:00、14:00-18:00)翻倍。相比 V4 Pro,缓存命中、输入、输出三项价格分别下降约 86.4%、77.3% 和 69.7%。旧的 V4 Flash 与 V4 Flash Vision Exp 已下线;自北京时间 9 月 14 日 12:00 起,所有访问 v4-pro 的请求被路由到 V4.1-Flash 并按 Flash 单价计费,直到未来的 V4.1-Pro 上线。

第三方实测数字。Fireworks 在 DeepSWE(自主编码)上的结论是:与 GPT-6 Astra 精度相当,单任务成本约为其 1/15,Fireworks 口径下约 0.43 美元/任务;Terminal-Bench 2.1 上落后 Astra 一分,成本约 1/12。Agent Arena 榜单上它位列开源模型第三,任务中位成本约 0.07 美元。Artificial Analysis 智能指数 v4.3 得分 40,输出速度约 214 tokens/s。

生态与背景。模型以 MIT 许可开源,权重在 Hugging Face 提供;腾讯 WorkBuddy/CodeBuddy、OpenCode 等作为官方合作方同步接入;阿里云百炼与 vLLM 社区完成适配,并在通义千问平台上架了 API 与 Token Plan。另有报道称 DeepSeek 已启动科创板 IPO 筹备,由中信证券担任保荐机构,第二轮投前估值约 5000 亿元。

二、影响分析:四件事值得琢磨

1. 便宜不是因为降价,是因为架构对着 Agent 的负载改的

这是最关键的一条。很多人看到「降价 86%」会理解成商业策略,但真正的技术原因藏在一个负载特征里。

Fireworks 在评测中给了一个很说明问题的数字:在自主编码任务上,输入与输出的 token 比例大约是 174 : 1——单任务约 3690 万输入 token,对应约 21 万输出 token。原因不难理解:Agent 干活的过程就是反复读——读文件、读工具返回、读自己的历史、再读一遍,最后只吐出很小的一段补丁或一段结论。

所以 V4.1-Flash 的「输入 8B / 输出 16B」并不是随便设的:它把更多算力留给了输出侧,同时用极小的激活量去扛体量巨大的输入侧,正好对上 Agent 的真实负载形状。再加上 KV Cache 压到 1/4,长循环里最贵的那部分——反复重读同一段上下文——成本被直接按下去了。

结论是:降价是架构的结果,不是补贴。这个区别很重要,因为它意味着这个价格是可持续的,而不是等补贴退坡就反弹的临时优惠。

2. 「反向升级」:旗舰被自己的小模型取代

模型圈通常是「更大的版本顶掉小的」。这次反过来:一个系列里尺寸最小的成员,能力超过了自家旗舰,然后旗舰被计划下线。这背后是一个判断——在给定架构下,更好的训练方法带来的收益已经超过了继续堆参数

这和站内此前记录的国产模型集体转向「后训练 Scaling」是同一条线:参数规模不再是唯一战场,智谱 GLM-5.3 与阿里 Qwen3.8 开源 那一波已经在往这个方向走。真正的竞争指标正在从「参数多大」变成「每美元能买到多少智能」。

顺带回顾一下价格线的变化:8 月中旬 DeepSeek 曾因 V4 Pro 正式版上线而下调/调整定价体系(当时峰谷定价落地,部分档位调整幅度很大,见 DeepSeek API 涨价最高 350% 那次的记录),而这次 V4.1-Flash 是把价格重新往下压,并且压的对象是自家的旗舰档。节奏很清楚:用新一代架构把上一代的旗舰价格打下来,而不是让老旗舰体面地降一点。

3. 便宜之后,Agent 的产品形态会变

这一点对做产品的人最有实际意义。任务中位成本 0.07 美元、单次编码任务 0.43 美元这个量级意味着:「让 Agent 长期挂着跑」从奢侈变成了日常。

以前很多 Agent 场景做不起来,不是因为技术上做不到,而是因为算不过来账——持续巡检、定时比对、批量整理,一天跑几千次,成本很快就到不可接受的程度。现在这个成本结构下,后台常驻型 Agent 的经济性成立了。站内讲过的 自动跑批与无人值守定时盯网页变化 这类场景,恰好是最大的受益者。

另外,成本下降会改变模型分工的策略。以前为了省钱常用「便宜模型先筛、贵模型兜底」的分层调用;现在中档模型本身已经便宜到可以承担更多工作,分层策略的收益变小了,流程可以做得更简单。模型怎么选、分层怎么划,可以参考 AI Agent 怎么选模型

4. 被忽略的代价:自部署更贵了、峰谷定价、硬下线

三个需要提前准备的点:

(1)自部署的总拥有成本上升了。国金证券指出,V4.1-Flash 的权重增到约 510GB,本地部署门槛从两张卡升到一个 8 卡节点。也就是说,对 API 用户是降本,对自部署用户是增本。这是一个很值得记住的反差:「自己部署更省钱」这个假设,在这一档模型上已经不成立了。

(2)峰谷定价要求你排任务。高峰时段价格是闲时两倍。对可以延迟的任务——批量整理、离线抽取、素材处理——把它挪到闲时跑,等于直接省一半。这个动作几乎零成本,但很多团队根本没做。

(3)V4 Pro 是被「路由式下线」的,不是简单废弃。请求会自动转到新模型并按新单价计费,好处是不用改代码就享受降价;风险是你的行为可能悄悄变了——同一个提示词在新模型上的输出风格、长度、格式偏好都可能不同。上线前跑一遍回归是必须的,做法见 模型版本管理:切换模型时自动跑回放验证

同时别忘了供应商依赖的问题。单一模型 API 占到成本的大头之后,它的定价、可用性、合规条款都会直接影响你的业务持续性。多来源准备这套思路,和 英伟达收购 Hugging Face 之后开源底座换东家 引发的讨论是同一条:便宜好用和自主可控,需要同时想。国内可用替代的接入方式,参考 OpenClaw 怎么接 DeepSeek 等国产大模型

三、老达点评

这次发布最值得记住的不是价格数字,而是一个方法论信号:DeepSeek 是照着「Agent 怎么花钱」来设计架构的,而不是照着榜单设计架构的。

174 : 1 这个输入输出比,是所有做 Agent 的人都该记住的一个数。它说明白了一件事——Agent 的成本大头从来不是「想」,而是「反复读」。理解了这一点,你就能自己推导出很多优化方向:能少读就少读(上下文管理)、重复读的部分要能命中缓存(缓存怎么用)、该固化的别每次重新喂(记忆怎么设计)。模型厂商在架构层面替你降了一半,另一半得靠你自己的工程设计去拿。

第二点想说的是「自部署更贵」这个反差。过去一年很多人被「开源 = 免费 = 自己部署省钱」说服,买卡、搭集群、招人维护。这次的数据说明:当模型迭代速度是季度级、而硬件采购是年级的,自部署在经济上越来越像一场输给时间的赌注——你今年买的卡,明年可能跑不动新模型的权重。真正值得自部署的理由只剩两个:数据绝对不能出网,或者用量大到 API 成本超过自建的折旧与人力。如果你的理由只是「省 API 费用」,那这个账大概率算错了。

第三点,提醒大家注意「路由式下线」这种迁移方式的隐性成本。不用改代码确实舒服,但它把「模型变了」这件事从显性变成了隐性——你以为系统没动,其实底层已经换了。所以真正该做的动作不是庆祝降价,而是把模型名和版本号写进配置、跑一遍回归、再决定要不要全量切

四、对普通用户和团队的三条具体建议

(1)如果你在用 V4 系列,先跑回归再上线。用一批生产环境里的真实任务做样本,对比新旧模型的输出质量、格式稳定性和总耗时。这一步大概半小时,能挡住大部分意外。

(2)把可延迟任务挪到闲时。峰谷两倍差价是白送的节省,批量任务、离线处理、素材整理全都应该挪到闲时。

(3)重新算一次「自部署 vs API」的账。把 8 卡节点的成本、运维人力、以及「明年可能跑不动新权重」的折旧风险一起算进去,再对比 API 单价。算完之后大概率会发现,该省的力气在别处。

总结

DeepSeek V4.1-Flash,一条主线:9 月 10 日发布的 552B MoE 模型,用 Causal-Encoder-Decoder 非对称激活(输入 8B / 输出 16B)和 KV Cache 压缩(HBM 1/4、SSD 1/8)把 Agent 任务的成本结构改了;能力上七项测试全超上一代、五项代码与智能体指标超自家旗舰;价格上对 V4 Pro 最高降 86%,V4 Pro 自 9 月 14 日起被路由下线;第三方测得 Agent 任务中位成本约 0.07 美元。真正的含义有三层——便宜的根因是架构对着 Agent 负载改的、便宜让常驻型 Agent 变得经济可行、但「自部署更省钱」这个假设在这一档模型上已经失效。一句心法:模型厂商替你砍掉的是算力的钱,剩下那一半在哪省钱,得靠你对自己流程的理解。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *