搭 Agent 的人迟早会撞上同一个问题:模型到底怎么选?同样一套 Agent 框架,换个大模型,效果能差出几个档次——有的模型工具调用稳如老狗,有的十次里错三次;有的写代码飞快,有的推理一深就翻车。模型是 Agent 能力的天花板,选错了,后面工程做得再细,都像是在给地基打补丁。
这篇给出一套完整的选型框架:先讲清模型到底决定 Agent 的哪几项能力,再按六个维度拆解,最后附上主流模型对比和常见误区,照着选就行。
先搞清楚:模型选择影响 Agent 的哪几项能力
Agent 的核心链路是「理解任务 → 规划步骤 → 调用工具 → 汇总结果」,模型在其中承担三件最关键的事:
第一,任务理解与拆解。模型能不能读懂用户意图、把大任务拆成可执行的小步骤,决定了 Agent 是「指哪打哪」还是「理解跑偏」。第二,推理质量。数据分析、代码调试、多步决策这类复杂任务,需要模型在中间环节不犯逻辑错误——这是推理增强模型和普通模型的差距所在。第三,工具调用稳定性。Agent 要频繁调用函数、解析返回结果,模型在格式遵循上的稳定性直接决定调用成功率,结构化输出 能不能跑得顺,一半看模型。
一句话:模型决定 Agent 的理解上限、推理上限和执行上限,剩下的才轮到工程优化。所以选模型是 Agent 项目里性价比最高的决策,没有之一。
维度一:按任务类型对号入座
先别急着比参数和跑分,先想清楚你的 Agent 主要干什么活:
偏代码:写代码、修 bug、做代码审查,重点看编码类评测(SWE-bench 一类),Claude 系和 GPT 系是主流选择,DeepSeek 在性价比上也很能打。
偏推理:数据分析、逻辑判断、复杂规划,优先选带推理增强档位的模型,这类任务开不开推理模式,结果差很多。
偏长文:读长文档、写长报告、做知识库问答,重点看上下文窗口和长文处理质量——别只盯窗口数字,上下文管理 做得再好,模型长文能力不行也白搭。
偏多模态:要看图、听语音、处理视频,只有原生多模态模型才接得住。
偏工具调用:做自动化、接 API、写 RPA,重点考察 function calling 的稳定性,建议先拿你的真实场景跑 50 次工具调用看成功率再定。
维度二:推理能力——复杂任务的分水岭
推理能力决定 Agent 能不能处理「不能一步到位」的任务。简单问答和复杂规划的区别,就在于模型能不能在中间步骤保持逻辑一致、自我纠错。
判断方法别只看厂商宣传:一是看推理类评测(GPQA、ARC 一类的分数),二是自己拿 10 个真实任务做对比测试——同一个任务用不同模型跑,把失败案例摊开看,比任何榜单都直观。评测到底怎么做,可以参考 AI Agent 评测怎么做 里的思路,选型阶段的对比测试就是一次小型评测。
维度三:成本——别只看单价,要看实际消耗
模型成本要算总账:单价(每百万 token 的价格)× 实际消耗量。实际消耗量取决于三个因素:
一是 Agent 的调用次数。Agent 是循环调用模型的,一个任务可能来回几十次,token 消耗是普通聊天的几十倍,AI Agent 成本控制 里详细算过这笔账。二是输出长度。规划、推理、工具参数都吃输出 token,而输出往往比输入贵。三是缓存。支持 prompt 缓存的模型,重复上下文能省一半以上成本。
务实的做法是混合路由:简单任务用便宜模型,复杂任务用强模型;主力模型一个、备用模型一个,高峰期切换。OpenClaw 接 DeepSeek 这类国产模型,核心动力之一就是成本——国产模型的定价普遍是国际旗舰的十分之一上下,中文场景效果差距还在缩小。
维度四:上下文窗口——够用比大更重要
上下文窗口不是越大越好,而是「匹配你的任务」。窗口大但处理质量差,等于给 Agent 塞了一堆它看不太懂的背景材料。
关键判断:你的 Agent 单次任务最长会用到多长的上下文?知识库问答可能要吃几十万 token,短任务一万以内就够。窗口越大的模型通常越贵,为用不上的窗口付钱不划算。实践中更常见的解法是做好 上下文裁剪与检索,把「喂得多」变成「喂得准」,比一味买大窗口省钱得多。
维度五:工具调用与生态
这是最容易被忽视、却最影响 Agent 落地的一维。模型强不强是一回事,能不能稳定输出工具调用参数是另一回事——参数格式错一次,Agent 就得重试一次,链条一长效率全没了。
看三点:function calling 的格式遵循成功率;对 MCP 等工具协议的支持;配套生态(框架、文档、社区)。OpenClaw 接 MCP 工具 时你会发现,不同模型在工具调用上的表现差异极大——有的模型天生适合当「工具型 Agent」的大脑。
维度六:数据安全与合规
数据能不能出网、能不能出境,常常一票否决。企业数据和客户信息敏感的场景,要么选支持私有化部署的模型,要么选数据合规有保障的服务。
选项有三条:托管 API 但签数据协议;本地部署开源模型(Ollama、LM Studio 这类);走国产模型(数据留在境内)。权限管理 和模型选择是两回事,但边界意识要一致:能力越强,越要先想清楚数据和权限的边界。
主流模型一张表
截至 2026 年 8 月,选型池大致是这样的格局:
Claude(Anthropic):编码和长文强项,Agent 生态完善,适合编程 Agent、深度写作与复杂推理,价格偏高端。
GPT 系列(OpenAI):综合最均衡,工具调用生态最成熟,框架配套最多,从轻量到旗舰分档清晰,适合大多数 Agent 场景。
DeepSeek V4 系列:性价比标杆、开源可选,V4-Flash 等轻量档位便宜到可以随便跑,适合成本敏感的中文场景和批量任务。
Qwen 系列(阿里):新一代 3.8-Flash 用 Next 架构把激活参数压到极小、成本大降,Agent 场景的性价比新选择,中文强。
GLM 系列(智谱):国产全栈,推理流量可跑在国产芯片上,数据合规敏感场景的优先项。
Kimi(月之暗面):长上下文强项,适合超长文档处理和深度阅读类任务。
常见误区
唯跑分论:榜单分数和你的真实场景是两回事,你的任务类型、语言、工具链都会改变结果,跑分只能当参考线。
唯参数论:参数大小和效果不完全挂钩,架构、训练数据、对齐方式同样重要,模型切换后实测 才是最可靠的。
一个模型走天下:复杂任务和简单任务用同一个旗舰模型,是最大的浪费;混合路由能省一半以上成本。
忽略格式遵循:只比「回答问题」能力、不比「工具调用」能力,是 Agent 选型最常见的翻车点。
适合人群与总结
这份框架适合所有正在搭 Agent 的人:开发者在选型阶段照六维过一遍,运维在模型升级时对照检查,产品经理和预算决策者用来理解「贵在哪里、省在哪里」。
总结成一句话:先定任务类型,再比推理能力,然后算成本总账,最后查工具调用和合规边界。模型选对,Agent 项目成功一半;选错,后面所有优化都在填坑。磨刀不误砍柴工,选型这一步值得花时间。