实在Agent 破 90% + PenguinHarness 0.2 元造 Agent + Kimi K2.5 并行集群:8 月 4 日 Agent 基础架构三重突破

实在Agent 破 90% PenguinHarness Kimi K2.5 封面图,包含 OSWorld 榜首、Agent 自进化、Agent Swarm 并行集群和 Harness 工程等中文关键词

8 月 4 日,AI Agent 领域在基础架构层面迎来了三个不同方向的重大突破。实在Agent 在 OSWorld 评测中以 90.2% 的成功率登顶全球榜首,成为首个突破 90% 的 Computer-Use Agent;LlamaFactory 作者郑耀威开源了 PenguinHarness,宣称 0.2 元就能让 Agent 自动构建另一个 Agent;Kimi K2.5 上线 Agent Swarm 并行集群模式,多个 Agent 可以同时分工协作。三条动态放在一起,勾勒出了 Agent 工程化的一条清晰路径:从”能跑”到”靠谱”,从”手写”到”自进化”,从”单兵”到”集群”。

这三个方向其实和站内一直在做的 质量门禁需求变更影响评审回放对照 是一个逻辑链条的不同阶段。

事实梳理:实在Agent 登顶 OSWorld

据 OSWorld 官方最新榜单和多家媒体报道,杭州企业实在智能旗下的”实在Agent”以 90.20% 的执行成功率登顶总榜与 Agentic Framework 分榜双榜第一,成为该基准自 2024 年设立以来首个突破 90% 成功率的方案。此前的最好成绩是 2026 年 5 月 Pointer 的 83.6%,人类操作员的基准线是 72.36%。

OSWorld 包含 361 个真实桌面和网页任务,要求 Agent 在 Ubuntu、Windows、macOS 真实系统环境中完成跨应用操作,采用基于执行结果的机器验证。实在Agent 的核心差异在于”API 优先 + GUI 兜底”的混合执行策略:有 API 的系统走 API,没有 API 的遗留系统通过 ISSUT 屏幕语义理解技术看懂按钮和输入框后像人一样操作。

更有趣的是榜单分赛道的数据:TOP10 中有 6 个选择了框架路线(Agentic Framework),整体成绩普遍高于纯通用模型方案。这验证了一个正在行业里形成的共识——Agent = Model + Harness,光有大脑不够。

事实梳理:PenguinHarness 开源

8 月 4 日,LlamaFactory(GitHub 7 万星)作者郑耀威领导的 PrismShadow 团队开源了 PenguinHarness,定位为”桌面端/服务器的全自动 Agent 构建器”。

核心能力:输入一句自然语言描述,Agent 自动完成脚手架搭建、代码生成和运行说明,端到端构建应用。团队给出的对比数据:构建一个带分块检索和流式输出的 RAG 应用,PenguinHarness 耗时仅为 Codex 的一半,成本低至 1/200。另一个关键能力是自进化——Agent 构建出来后,可以在实际使用中根据反馈持续优化,准确率从 50% 提升到 90%,不需要手动微调。

已经有一些实际落地案例:体检机构用它生成了与医学专家能力类似的报告核查 Agent,制造业企业用多个 Agent 做流水线巡检,产线停机减少 65%。这个工具的定位,恰好落在 知识库陈旧内容巡检 里讨论的 Agent 持续优化闭环中。

事实梳理:Kimi K2.5 Agent Swarm

据多家技术社区报道,Kimi K2.5 推出了 Agent Swarm 并行集群模式,口号直接就是”孤独狼式 AI 的终结”。核心架构是让多个 AI Agent 各自承担子任务、协同完成复杂流程,避免了单体模型在算力和决策链条上的瓶颈。

同时期的几个配套动态也值得注意:TigerData 发布了 Agentic Postgres(专为 AI Agent 打造的数据库),微软 Azure AI Foundry 和 LlamaIndex.TS 合作推出了旗舰 MCP 示例应用,LLM Sandbox 专注于安全执行大模型生成的代码。这些工具的集中出现,说明多 Agent 协作正在从实验走向工程化。

多 Agent 协作的一个核心挑战是执行结果的一致性验证,这和 回放对照 要解决的问题高度重合:当多个 Agent 并行处理后合并结果,你怎么知道每个子任务的结果都是正确的?

老达点评

这三条动态合在一起,指向一个正在加速的趋势:Agent 工程化正在从”能把 Agent 跑起来就行”进入”怎么让 Agent 在真实业务里持续可靠地跑”的阶段。实在Agent 的 90% 证明了 Harness 层的价值,PenguinHarness 的 0.2 元自进化证明了 Agent 构建的门槛可以被大幅降低,Kimi K2.5 的并行集群证明了多 Agent 架构不再是概念验证。

我特别关注 PenguinHarness——不是因为”0.2 元”这个数字,而是它把 Agent 自进化这件事变成了开箱即用。以前说 Agent 自进化,需要团队有很强的 ML 工程能力;现在你可以在自己电脑上装一个工具,让 Agent 自己构建和改进 Agent。这可能会改变很多人对”Agent 工程化到底要多高门槛”的认知。

总结

8 月 4 日,实在Agent 登顶 OSWorld 证明了 Agent 执行可靠性的新高度,PenguinHarness 开源降低了 Agent 自进化的门槛,Kimi K2.5 Agent Swarm 把多 Agent 并行协作推向了实际可用。这三个方向——高可靠性、自进化、集群协作——共同标志着 Agent 工程化进入了新阶段。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *