7 月
2026 国产模型长上下文选型:Kimi K 3、Qwen 3.7、GLM 5.2 怎么选
可引用摘要: 2026 国产模型长上下文选型不能只看窗口数字。Kimi K 3、Qwen 3.7 和 GLM 5.2 的官方页面都给出了 1 M 级上下文,但“能接收 1 M token”不代表“能在任意任务中稳定利用 1 M token”。长文档的一次性综合可考虑整窗输入;持续更新、需要溯源和权限控制的知识库应优先 RAG;大型代码库则更适合索引、按需读取与上下文压缩。
资料核验截至 2026 年 7 月 25 日。本文比较官方已披露能力,不包含智盒自建 benchmark 或未经披露的实测数据。想先了解国产模型的整体格局,可阅读2026 国产模型综合对比。
先看结论:三款模型怎么选
| 选项 | 官方规格要点 | 优先考虑的场景 | 主要边界 |
|---|---|---|---|
| Kimi K 3 | 1 M 上下文,原生视觉;API 已可用 | 图文混合的长材料、长程知识工作、需要视觉输入的代码或文档任务 | 对思考历史传递方式敏感;截至 7 月 25 日,完整权重仍未到官方承诺日期 |
| Qwen 3.7 | Max、Plus、Flash 均有具体版本;官方规格页列出 1 M 上下文、64 K 最大输出 | 需要多模态、工具调用、结构化输出或希望在性能与成本间分层的生产应用 | “Qwen 3.7”不是单一模型,必须按具体模型 ID 核对能力 |
| GLM 5.2 | 1 M 上下文、128 K 最大输出,文本输入,支持上下文缓存 | 纯文本长任务、跨文件工程分析、需要较长输出的代码任务 | “Solid 1 M”等是厂商表述,不应等同于所有业务中的独立验证 |
如果你的第一要求是原生视觉长材料,先评估 Kimi K 3 或 Qwen 3.7;如果是纯文本长程 Coding 和更长输出预算,GLM 5.2 值得优先进入候选;如果需要把结构化输出、工具调用和不同成本档位组合进生产系统,Qwen 3.7 家族更便于分层。以上是根据官方规格形成的工程建议,不是三模型同条件实测排名。
“标称上下文”为什么不等于“有效上下文”
有效上下文,是模型在给定任务中仍能正确找到远距离信息、保持指令与关系,并在可接受的质量、时延和成本内完成输出的上下文范围。 它不是 API 参数表里的一个固定数字。
至少要分四层看:
- 接口容量:请求能否被 API 接收。1 M 通常还要给回答、思考内容、工具结果和系统提示预留空间。
- 信息利用:模型能否找到埋在中间的事实,并把相隔很远的条款、函数或表格联系起来。
- 任务保持:会话变长后,模型是否仍遵守格式、权限、代码边界和早期约束。
- 系统可承受性:首 token 时延、输入费用、缓存命中、失败重试和并发是否符合生产要求。
因此,合同“放得进去”不等于能逐条核对无遗漏;仓库“装得下”也不等于模型会把生成目录、依赖代码和业务代码正确区分。视觉文档还会受到 OCR、版面解析和图片数量限制影响。
上下文选择决策树
按下面顺序判断,比先选模型更可靠:
内容是否持续更新或需要权限隔离?
├─ 是 → RAG / 检索层
│ └─ 是否需要跨章节全局关系?
│ ├─ 是 → RAG 召回 + 邻接段落/章节摘要 + 长窗口综合
│ └─ 否 → 小切片召回 + 重排 + 引用
└─ 否 → 是否只有少量固定材料?
├─ 是 → 整窗输入,并预留输出与核验空间
└─ 否 → 建索引;代码库使用按需读取的仓库 Agent
还有一条硬规则:只要回答必须可追溯到原文,就不要把“模型似乎读过全部内容”当作证据链。输出应携带文档名、章节、文件路径或行号。
长文档:少量固定材料可整窗,反复问答应建检索层
整窗输入适合单份合同的条款关系梳理、少量论文的跨文献比较、一次性的尽调材料归纳。它保留了章节顺序和全局关系,也避免切片后代词失去指向。
但当材料每天变化、用户只问局部问题,或不同用户只能查看不同文档时,整窗输入会重复发送大量无关内容,也难做权限过滤和引用追踪。此时应先检索,再把高相关片段、章节标题和必要邻接段落送入模型。图像、扫描 PDF 与复杂表格则要先验证解析链路;模型有视觉能力,并不自动保证表格单元格和页码关系完全正确。
Kimi 官方将 Kimi K 3 描述为原生视觉、1 M 上下文模型,Kimi API 模型页 也显示 K 3 当前可通过 API 使用。Qwen 官方的模型规格页则列出 Qwen 3.7 Max、Plus、Flash 的图像与视频输入能力。选择时仍要用自己的文档类型做小规模验收,不能从“支持视觉”直接推导出扫描件准确率。
RAG 与整窗输入的边界
长窗口没有让 RAG 过时。RAG 解决的是从持续变化的大语料中选择证据,长窗口解决的是一次推理能容纳多少相关证据与全局关系,两者可以组合。
智谱的上下文增强技术报告指出,传统切片可能丢失文档名、章节和代词指向;其方案把上下文描述与原片段绑定,并结合语义索引、关键词索引与重排。这个思路适用于任何模型:不要只把孤立切片交给生成模型,而应补回来源、章节、关键实体和邻接关系。
以下情况优先 RAG:
- 知识库频繁更新,需要增量索引;
- 回答必须显示来源,或需要文档级权限控制;
- 查询通常只涉及总语料的一小部分;
- 需要精确匹配型号、年份、错误码,同时兼顾语义召回。
以下情况可以优先整窗:
- 材料数量少、版本固定;
- 问题要求通读全篇后比较结构、语气或前后矛盾;
- 一次性分析的价值高于重复输入成本;
- 已留出回答、思考和核验所需 token。
生产系统常用的折中是“混合检索召回 → 重排 → 带章节上下文的片段 → 长窗口综合”,而不是在 RAG 与 1 M 窗口之间二选一。
大型代码库:优先索引和按需读取
把整个仓库塞进窗口,只适合版本固定的架构盘点或小范围快照分析。真实开发会不断加入搜索结果、文件内容、diff、测试日志和工具调用记录;这些内容与源代码竞争同一上下文预算。依赖目录、构建产物和重复生成文件还会稀释模型注意力。
更稳妥的流程是:先建立符号与文件索引,读取入口文件和工程规范;再按调用链展开相关代码;每个阶段保存计划、已确认约束和验证结果;工具输出过长时只保留摘要与可定位路径。Qwen-Agent 的上下文管理文档明确展示了超限时删除旧轮次、折叠工具结果和逐步截断的策略,这也说明“无限会话”依赖上下文治理,而不是窗口永远不满。
GLM 5.2 官方模型页标注 1 M 上下文、128 K 最大输出,并把项目级工程和长程重构列为推荐场景。Kimi K 3 官方则提醒:模型对完整思考历史的传回方式敏感,中途从其他模型切换到 K 3 可能导致生成质量不稳定。长程 Coding 选型必须把 Agent 框架兼容性纳入验收,不能只比较窗口数字。
适合与不适合
Kimi K 3
- 适合:图文混合材料、长程知识工作,以及愿意使用兼容 Agent 框架的团队。
- 不适合:现在就要求下载完整权重并完成私有部署的项目。官方说完整权重将在 2026 年 7 月 27 日前发布;截至 7 月 25 日,这仍是未来承诺,不是已兑现事实。
Qwen 3.7
- 适合:需要 Max、Plus、Flash 分层,多模态输入、工具调用或结构化输出的 API 应用。
- 不适合:只写“接入 Qwen 3.7”却不固定模型 ID 和版本的生产方案。不同版本的能力和交付节奏可能变化。
GLM 5.2
- 适合:纯文本长任务、需要较大输出空间的代码生成与跨文件工程分析。
- 不适合:把厂商“真正可用 1 M”的表述直接当作本业务已验证结论,或需要原生图像输入但没有独立解析链路的项目。
FAQ
1 M token 等于多少中文字符?
没有固定换算。token 数取决于 tokenizer、文本语言、代码符号和格式;图像等模态还有不同计量方式。工程上应使用目标 API 的 tokenizer 或实际计费返回值估算,并为系统提示、输出、思考和工具结果预留空间。
有了 1 M 上下文还需要 RAG 吗?
需要,尤其是语料持续更新、要求引用、存在权限隔离或单次查询只涉及少量资料时。RAG 负责找证据,长窗口负责容纳更多相关证据并理解跨片段关系。两者通常是互补关系。
Kimi K 3 在 2026 年 7 月 25 日已经开放权重了吗?
不能这样写。Kimi 官方博客说完整模型权重将在 2026 年 7 月 27 日前发布。7 月 25 日时,这是一项尚未到期的未来承诺。API 可用与完整权重可下载是两件不同的事。
Qwen 3.7 是一个模型还是一个系列?
是一个系列。官方文档列出 qwen 3.7-max、qwen 3.7-plus、qwen 3.7-flash 及日期固定版本。评估和上线时应记录具体模型 ID、区域、最大输入输出及是否支持结构化输出,避免浮动别名升级后行为变化。
大型代码库应该一次性全部上传吗?
通常不应该。先排除依赖、构建产物和生成文件,再用符号索引、搜索和调用链按需读取。只有在固定快照的全局盘点中,整仓输入才可能有价值;持续开发更依赖上下文压缩和状态记录。
最终建议
先决定任务架构,再决定模型:少量固定长文档用整窗;动态知识库用 RAG 加长窗口综合;大型代码库用索引、按需读取和可恢复的 Agent 状态。之后再以相同材料检查事实召回、约束保持、引用完整性、时延和成本。更多关于本站与内容核验方式的信息,可查看关于智盒和编辑政策与来源标准。
本文由 AI(Codex)基于公开来源整理并完成结构化核验,发布由智盒运营流程执行。






