7 月
2026 国产模型 Agent 工具调用选型:Qwen 3.7、Kimi K 3、GLM 5.2、MiniMax M 2.7 怎么选
结论先行:如果你希望尽量少搭工具执行服务,优先评估 Qwen 3.7 的 Responses API;如果任务依赖超长上下文、动态工具加载与完整思考历史,可把 Kimi K 3 放进候选;如果团队已有自建工具网关并看重长程编码,GLM 5.2 更容易按标准 Function Calling 接入;如果现有系统以 Anthropic 协议和编程 Agent 为主,MiniMax M 2.7 的迁移路径更直接。这里比较的是官方接口与产品边界,不是统一环境的性能排名。最终决策仍应通过统一工具集验收。
选 Agent 模型最常见的误区,是看到“能联网搜索”或“能改代码”,就认定模型 API 自带这些能力。实际上,模型、工具服务和 Agent 运行框架是三层系统。若采购时不拆开,PoC 很容易把产品演示能力错算成 API 能力。
先分清三种“工具调用”
Function Calling 是模型读取函数定义后返回函数名和参数。模型负责“决定调用什么”,你的应用通常负责鉴权、执行、重试和回传结果。
内置官方工具 是厂商托管的搜索、代码执行等服务。开发者不必自己实现底层工具,但仍要确认接口、计费、地区和可用性。
Agent harness/产品 是负责循环执行、上下文压缩、文件操作、终端权限和记忆的 CLI、框架或 SaaS。Qwen-Agent、Kimi Code、GLM Coding Plan、Mini-Agent 属于这一层;它们能完成任务,不代表裸模型接口拥有同样的工具。
想先了解模型、上下文与代码能力的宽口径差异,可看2026 国产大模型横向比较;本文只处理工具调用选型。
2026 国产模型 Agent 工具调用选型矩阵
| 候选 | Function Calling | 内置官方工具 | Agent harness/产品 | 选型提示 |
|---|---|---|---|---|
| Qwen 3.7 | qwen3.7-max、qwen3.7-plus 支持 | Responses API 可用搜索、代码解释器、网页抓取、反向图片搜索、文生图搜索 | Qwen-Agent、Qwen Code、百炼 Agent 应用独立提供执行层 | 托管工具覆盖最清晰;先确认具体模型 ID 与 API 类型 |
| Kimi K 3 | 支持自定义工具、tool_choice 与动态加载 | 通过 Formula 接入官方工具;官方文档提示 Web Search 正在更新,近期不建议用于生产 | Kimi Code、Kimi Work、Kimi Agent 属于产品层 | 需完整回传 assistant 消息,不能只保留文本 |
| GLM 5.2 | 支持 tools,tool_choice 当前以 auto 为核心 | 核心 Chat Completions 文档未把搜索列为模型内置;另有 Web Search API、MCP、Search Agent | GLM Coding Plan 可接 Claude Code、Cline 等 | 适合自建工具执行层;流式工具参数需验证 tool_stream |
| MiniMax M 2.7 | Anthropic 兼容接口完整支持 tools 与 tool_choice | 文本 API 与 Token Plan MCP 要分开;后者提供搜索、图片理解,官方 MCP 另提供多模态工具 | Mini-Agent 提供循环、文件、Shell、记忆与 MCP | Anthropic 生态接入友好,但不能把 MCP 工具写成模型内置 |
矩阵依据均来自官方资料:阿里云的文本模型表与Function Calling 文档,Moonshot AI 的Kimi K 3 API 文档,智谱的GLM-5.2 工具调用文档,以及 MiniMax 的Anthropic API 兼容文档。
四款模型分别适合什么,不适合什么
Qwen 3.7:适合希望平台托管常用工具的团队
适合搜索、抓取、代码执行等需求明确,又不想分别维护工具服务的项目。Qwen 3.7 还是系列名,生产配置必须落到 qwen3.7-max、qwen3.7-plus 或快照版本,并确认使用 Chat Completions 还是 Responses API。
不适合把数据流和工具执行完全锁在自有网络、且不能接受平台托管工具的项目。此时它仍可做 Function Calling,但“内置工具多”不再构成优势。
Kimi K 3:适合长任务与动态工具目录
K 3 官方接口支持自定义工具、强制首轮调用和动态加载工具定义,适合工具数量多、需要按阶段暴露能力的长任务。官方还要求多轮与工具调用时回传完整 assistant 消息,这会影响你现有的消息存储设计。
不适合当前就把官方 Web Search 作为关键生产依赖:K 3 文档明确提示该工具正在更新。Kimi Code 或 Kimi Work 的表现也不能直接代替 API 验收,因为它们包含额外 harness。
GLM 5.2:适合已有工具网关的工程团队
GLM 5.2 官方文档给出了标准的工具定义、执行和结果回传循环;另有独立的联网搜索 API、MCP 与 Search Agent。这种分层对已有 API 网关、权限系统和审计链的团队反而清楚。
不适合期待只传一个“搜索开关”就获得完整 Agent 产品的项目。使用流式工具调用时,还要把 stream=true 与 tool_stream=true 纳入兼容性测试。
MiniMax M 2.7:适合 Anthropic 协议与轻量 Agent
M 2.7 的 Anthropic 兼容文档明确支持工具定义、工具选择、tool_use 和 tool_result;官方 Mini-Agent 又提供可读的执行循环、记忆、文件与 Shell 工具,适合从现有编程 Agent 迁移。
不适合把 Token Plan MCP 的网络搜索、图片理解理解为 M 2.7 文本 API 自动内置。兼容接口还要求多轮 Function Call 回传完整响应内容,消息裁剪策略必须同步调整。
生产验收清单
不要用一次成功的天气查询决定上线。至少固定 30—50 条覆盖正常、歧义和失败路径的用例,并逐项记录:
- [ ] 协议正确性:必填参数、枚举、嵌套 JSON、中文参数、空值和超长参数能否稳定生成。
- [ ] 工具选择:该调用时的召回率、不该调用时的误调用率,以及多工具同名或描述相近时的选择准确率。
- [ ] 循环可靠性:多轮调用、并行调用、完整消息回传、流式参数拼接和达到步数上限时能否安全停止。
- [ ] 失败恢复:超时、限流、工具报错、无结果和重复回调是否支持重试、退避与幂等。
- [ ] 安全边界:工具白名单、最小权限、参数校验、人工审批、提示注入隔离和敏感结果脱敏是否生效。
- [ ] 可观测性:保存请求 ID、工具调用 ID、耗时、token、错误类型和最终完成状态,且不记录密钥。
- [ ] 成本与版本:分别统计模型 token、官方工具、MCP 和外部 API 成本;锁定模型快照并准备回滚。
- [ ] 业务结果:用任务完成率和人工接管率判断,不用单一 benchmark 替代生产结论。
推荐的决策顺序
先决定工具由谁执行:必须自托管,就重点比较 Function Calling;希望少运维,再比较官方工具。然后确定现有系统更接近 OpenAI 还是 Anthropic 协议,最后用同一套工具描述、超时、重试和安全策略跑四个候选。只有这样,差异才来自模型与接口,而不是不同 harness。
这也意味着没有脱离业务的“国产 Agent 最强模型”。搜索型 Agent、代码 Agent、企业流程 Agent 的失败成本不同,选择标准也应不同。
常见问题
支持 Function Calling,就等于模型会执行工具吗?
不等于。多数情况下,模型只返回工具名和参数;你的应用负责真正执行,并把结果作为工具消息回传。
Qwen 3.7 的内置工具和 Qwen-Agent 是一回事吗?
不是。内置工具由百炼 Responses API 提供执行服务;Qwen-Agent是独立框架,负责 Agent 循环、工具注册和上下文管理。
Kimi K 3、GLM 5.2、MiniMax M 2.7 都能直接联网吗?
不能这样概括。Kimi 有 Formula 官方工具但搜索处于更新期;智谱提供独立搜索 API、MCP 和 Search Agent;MiniMax 的搜索位于 Token Plan MCP。它们都不能无条件写成“裸模型自带联网”。
OpenAI 或 Anthropic 兼容是否意味着可以无测试迁移?
不意味着。字段兼容不保证工具选择、思考历史、并行调用、流式增量和错误码完全一致,仍需回归测试。
选型时最重要的单一指标是什么?
优先看你自己的端到端任务完成率;同时记录误调用率、人工接管率、P 95 延迟和单次成功任务成本,避免只优化某一个数字。
来源与透明度
本文事实核验截止于 2026 年 7 月 25 日。模型别名、工具状态、价格和限流可能变化,上线前请复核各厂商官方文档。智盒的内容定位见关于智盒,来源与更正原则见编辑政策。
本文由 AI(Codex)基于公开来源整理并完成结构化核验,发布由智盒运营流程执行。







评论 (1)
[…] 但速度不会修复错误工具调用、提示注入或错误结论。生产选型仍应把任务完成率、人工接管率和单次成功任务成本放在首位。关于模型与工具层的拆分,可读国产模型 Agent 工具调用选型。 […]
评论被关闭。