智盒 aiKit.vip 默认文章封面
25

7 月

2026 国产模型 Agent 工具调用选型:Qwen 3.7、Kimi K 3、GLM 5.2、MiniMax M 2.7 怎么选

结论先行:如果你希望尽量少搭工具执行服务,优先评估 Qwen 3.7 的 Responses API;如果任务依赖超长上下文、动态工具加载与完整思考历史,可把 Kimi K 3 放进候选;如果团队已有自建工具网关并看重长程编码,GLM 5.2 更容易按标准 Function Calling 接入;如果现有系统以 Anthropic 协议和编程 Agent 为主,MiniMax M 2.7 的迁移路径更直接。这里比较的是官方接口与产品边界,不是统一环境的性能排名。最终决策仍应通过统一工具集验收。

选 Agent 模型最常见的误区,是看到“能联网搜索”或“能改代码”,就认定模型 API 自带这些能力。实际上,模型、工具服务和 Agent 运行框架是三层系统。若采购时不拆开,PoC 很容易把产品演示能力错算成 API 能力。

先分清三种“工具调用”

Function Calling 是模型读取函数定义后返回函数名和参数。模型负责“决定调用什么”,你的应用通常负责鉴权、执行、重试和回传结果。

内置官方工具 是厂商托管的搜索、代码执行等服务。开发者不必自己实现底层工具,但仍要确认接口、计费、地区和可用性。

Agent harness/产品 是负责循环执行、上下文压缩、文件操作、终端权限和记忆的 CLI、框架或 SaaS。Qwen-Agent、Kimi Code、GLM Coding Plan、Mini-Agent 属于这一层;它们能完成任务,不代表裸模型接口拥有同样的工具。

想先了解模型、上下文与代码能力的宽口径差异,可看2026 国产大模型横向比较;本文只处理工具调用选型。

2026 国产模型 Agent 工具调用选型矩阵

候选Function Calling内置官方工具Agent harness/产品选型提示
Qwen 3.7qwen3.7-maxqwen3.7-plus 支持Responses API 可用搜索、代码解释器、网页抓取、反向图片搜索、文生图搜索Qwen-Agent、Qwen Code、百炼 Agent 应用独立提供执行层托管工具覆盖最清晰;先确认具体模型 ID 与 API 类型
Kimi K 3支持自定义工具、tool_choice 与动态加载通过 Formula 接入官方工具;官方文档提示 Web Search 正在更新,近期不建议用于生产Kimi Code、Kimi Work、Kimi Agent 属于产品层需完整回传 assistant 消息,不能只保留文本
GLM 5.2支持 toolstool_choice 当前以 auto 为核心核心 Chat Completions 文档未把搜索列为模型内置;另有 Web Search API、MCP、Search AgentGLM Coding Plan 可接 Claude Code、Cline 等适合自建工具执行层;流式工具参数需验证 tool_stream
MiniMax M 2.7Anthropic 兼容接口完整支持 toolstool_choice文本 API 与 Token Plan MCP 要分开;后者提供搜索、图片理解,官方 MCP 另提供多模态工具Mini-Agent 提供循环、文件、Shell、记忆与 MCPAnthropic 生态接入友好,但不能把 MCP 工具写成模型内置

矩阵依据均来自官方资料:阿里云的文本模型表Function Calling 文档,Moonshot AI 的Kimi K 3 API 文档,智谱的GLM-5.2 工具调用文档,以及 MiniMax 的Anthropic API 兼容文档

四款模型分别适合什么,不适合什么

Qwen 3.7:适合希望平台托管常用工具的团队

适合搜索、抓取、代码执行等需求明确,又不想分别维护工具服务的项目。Qwen 3.7 还是系列名,生产配置必须落到 qwen3.7-maxqwen3.7-plus 或快照版本,并确认使用 Chat Completions 还是 Responses API。

不适合把数据流和工具执行完全锁在自有网络、且不能接受平台托管工具的项目。此时它仍可做 Function Calling,但“内置工具多”不再构成优势。

Kimi K 3:适合长任务与动态工具目录

K 3 官方接口支持自定义工具、强制首轮调用和动态加载工具定义,适合工具数量多、需要按阶段暴露能力的长任务。官方还要求多轮与工具调用时回传完整 assistant 消息,这会影响你现有的消息存储设计。

不适合当前就把官方 Web Search 作为关键生产依赖:K 3 文档明确提示该工具正在更新。Kimi Code 或 Kimi Work 的表现也不能直接代替 API 验收,因为它们包含额外 harness。

GLM 5.2:适合已有工具网关的工程团队

GLM 5.2 官方文档给出了标准的工具定义、执行和结果回传循环;另有独立的联网搜索 API、MCP 与 Search Agent。这种分层对已有 API 网关、权限系统和审计链的团队反而清楚。

不适合期待只传一个“搜索开关”就获得完整 Agent 产品的项目。使用流式工具调用时,还要把 stream=truetool_stream=true 纳入兼容性测试。

MiniMax M 2.7:适合 Anthropic 协议与轻量 Agent

M 2.7 的 Anthropic 兼容文档明确支持工具定义、工具选择、tool_usetool_result;官方 Mini-Agent 又提供可读的执行循环、记忆、文件与 Shell 工具,适合从现有编程 Agent 迁移。

不适合把 Token Plan MCP 的网络搜索、图片理解理解为 M 2.7 文本 API 自动内置。兼容接口还要求多轮 Function Call 回传完整响应内容,消息裁剪策略必须同步调整。

生产验收清单

不要用一次成功的天气查询决定上线。至少固定 30—50 条覆盖正常、歧义和失败路径的用例,并逐项记录:

  • [ ] 协议正确性:必填参数、枚举、嵌套 JSON、中文参数、空值和超长参数能否稳定生成。
  • [ ] 工具选择:该调用时的召回率、不该调用时的误调用率,以及多工具同名或描述相近时的选择准确率。
  • [ ] 循环可靠性:多轮调用、并行调用、完整消息回传、流式参数拼接和达到步数上限时能否安全停止。
  • [ ] 失败恢复:超时、限流、工具报错、无结果和重复回调是否支持重试、退避与幂等。
  • [ ] 安全边界:工具白名单、最小权限、参数校验、人工审批、提示注入隔离和敏感结果脱敏是否生效。
  • [ ] 可观测性:保存请求 ID、工具调用 ID、耗时、token、错误类型和最终完成状态,且不记录密钥。
  • [ ] 成本与版本:分别统计模型 token、官方工具、MCP 和外部 API 成本;锁定模型快照并准备回滚。
  • [ ] 业务结果:用任务完成率和人工接管率判断,不用单一 benchmark 替代生产结论。

推荐的决策顺序

先决定工具由谁执行:必须自托管,就重点比较 Function Calling;希望少运维,再比较官方工具。然后确定现有系统更接近 OpenAI 还是 Anthropic 协议,最后用同一套工具描述、超时、重试和安全策略跑四个候选。只有这样,差异才来自模型与接口,而不是不同 harness。

这也意味着没有脱离业务的“国产 Agent 最强模型”。搜索型 Agent、代码 Agent、企业流程 Agent 的失败成本不同,选择标准也应不同。

常见问题

支持 Function Calling,就等于模型会执行工具吗?

不等于。多数情况下,模型只返回工具名和参数;你的应用负责真正执行,并把结果作为工具消息回传。

Qwen 3.7 的内置工具和 Qwen-Agent 是一回事吗?

不是。内置工具由百炼 Responses API 提供执行服务;Qwen-Agent是独立框架,负责 Agent 循环、工具注册和上下文管理。

Kimi K 3、GLM 5.2、MiniMax M 2.7 都能直接联网吗?

不能这样概括。Kimi 有 Formula 官方工具但搜索处于更新期;智谱提供独立搜索 API、MCP 和 Search Agent;MiniMax 的搜索位于 Token Plan MCP。它们都不能无条件写成“裸模型自带联网”。

OpenAI 或 Anthropic 兼容是否意味着可以无测试迁移?

不意味着。字段兼容不保证工具选择、思考历史、并行调用、流式增量和错误码完全一致,仍需回归测试。

选型时最重要的单一指标是什么?

优先看你自己的端到端任务完成率;同时记录误调用率、人工接管率、P 95 延迟和单次成功任务成本,避免只优化某一个数字。

来源与透明度

本文事实核验截止于 2026 年 7 月 25 日。模型别名、工具状态、价格和限流可能变化,上线前请复核各厂商官方文档。智盒的内容定位见关于智盒,来源与更正原则见编辑政策

本文由 AI(Codex)基于公开来源整理并完成结构化核验,发布由智盒运营流程执行。

分享这篇文章

评论 (1)

评论被关闭。

RELATED

Posts