DeepSeek-V4-Flash 正式上线 + EU AI Act 透明度条款生效:Agent 能力与合规同一天升级

DeepSeek-V4-Flash 正式上线和 EU AI Act 生效封面图,包含 Agent 能力升级、合规要求、GPT-5.6 Solo 实验和模型后训练等中文关键词

2026 年 8 月 1 日和 2 日,AI Agent 领域同时迎来能力和规范两条线的重磅变化。DeepSeek 悄悄上线了 V4-Flash 正式版 API,Agent 基准成绩暴涨 6 倍;EU AI Act 的透明度条款从今天(8 月 2 日)起正式执行。另一边,Bottleneck Labs 用 GPT-5.6 Solo 做了一次高度真实的 Agent 经营公司实验,结果值得一看。

三条动态放在一起看很有意思:模型越来越强,合规要求越来越硬,Agent 自主性边界越来越清楚。这些和站内最近持续写的 失败升级规则质量门禁证据包 可以放在同一套框架里理解。

事实梳理:DeepSeek-V4-Flash 正式版

据 TechWeb 等多家媒体 8 月 1 日报道,DeepSeek-V4-Flash 正式版 API 已上线。这是一个 2840 亿参数 MoE 模型,激活参数仅 130 亿,价格低至 0.2 元/百万 tokens(缓存命中)。

真正让人注意的不是价格,而是 Agent 能力的提升幅度:DeepSWE 基准(评估 Agent 在真实长周期多步骤编程任务中的自主解决能力)从预览版的 7.3 分飙升至 54.4 分,暴涨超过 6 倍;Terminal Bench 2.1 得分 82.7,逼近 Claude Opus 4.8 的 85.0。

最关键的细节是:模型结构和尺寸完全没变,只重新做了后训练。这意味着后训练优化的空间可能比很多人想象的大得多——不是只有预训练才能提升 Agent 能力。

事实梳理:EU AI Act 透明度条款生效

据多家媒体解读,EU AI Act 的透明度条款从 2026 年 8 月 2 日开始正式执行。核心要求包括:聊天机器人必须在首次交互时亮明 AI 身份,AI 生成的文本、图像、音频和视频必须打标并嵌入机器可读水印。违反最高罚 1500 万欧元或全球营业额 3%。谷歌、微软、OpenAI、Meta 已签署内容透明度准则。

对 Agent 团队来说,这意味着以后 Agent 发出的消息不能看起来像真人员工发的。客户服务、邮件沟通、内部通知——只要 Agent 是产出方,就必须标注来源。这在 客户可见动作确认 的场景里尤其重要。

事实梳理:GPT-5.6 Solo 经营公司实验

据 InfoQ 8 月 1 日报道,Bottleneck Labs 用 GPT-5.6 Solo 做了一个 24 小时连续实验:给 Agent 真实的电脑、350 美元启动资金和一家真实运行的 iOS 应用公司。结果:消耗 3.2 亿 prompt tokens,完成 1129 次工具调用,新增收入 0 美元,用户从 61 人增到 66 人。

实验暴露的不是模型不够聪明,而是自主 Agent 在真实商业环境里会遇到大量非技术障碍:App Store 审核、用户信任建立、付费转化——这些都不是 24 小时推理能解决的。这和 转人工队列 的结论一致:Agent 要跑得快,但有些环节必须回到人。

老达点评

三条新闻放一起,能看到一个清晰的趋势:Agent 的能力在快速变强(DeepSeek-V4-Flash 后训练效果),但监管和现实也在同步加码(EU AI Act、自主经营碰壁)。对我而言,更值得关注的是“后训练提升 Agent 能力”这条线——如果模型结构不变、只靠后训练就能把 Agent 基准拉高 6 倍,那意味着团队不需要等下一代模型,在现有底座上做好样本、评估和迭代,本身就能产生很大的提升空间。

总结

DeepSeek-V4-Flash 正式版上线、EU AI Act 透明度条款生效、GPT-5.6 Solo 自主经营实验,三条动态从能力、合规和自主性边界三个角度,分别给 AI Agent 领域加了新的变量。能力和约束同一天升级,是好事。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *