01 · 先说结论
2026 年的选型,不再是“谁最聪明”
这五款模型都已经跨过了“能不能写代码”的门槛。真正拉开差距的,是它们能否持续工作、能否调用工具、长上下文是否稳定、部署边界是否清晰,以及做完同一件事到底要花多少钱。
我的总建议:闭源平台优先比较 GPT-5.6 Sol、Fable 5 与 Opus 4.8;需要开放权重或本地化时,优先看 Kimi K3 与 GLM-5.2。不要用一次问答决定生产选型,用你自己的真实任务集跑一轮。
02 · 核心规格
先把五款模型放到一张表里
以下是截至 2026 年 7 月 24 日的公开信息。价格按官方 API 每百万 token 的基础输入 / 输出价列示;不同平台、缓存、批处理和区域会改变实际账单。
| 模型 | 开放性 | 上下文 | 基础价格 | 最值得关注 |
|---|---|---|---|---|
| Kimi K3 | 开放权重 | 1M | $3 / $15 | 2.8T 参数、原生视觉、中文与开放生态 |
| GPT-5.6 Sol | 闭源 API | 1M 级 | $5 / $30 | 工具、计算机操作、设计与完整交付 |
| Claude Fable 5 | 闭源 API | 1M | $10 / $50 | 高难度、超长周期的智能体任务 |
| Claude Opus 4.8 | 闭源 API | 1M | $5 / $25 | 成熟的编码、代理和企业工作流 |
| GLM-5.2 | MIT 开源 | 1M | 按平台 / 自部署 | 长周期编码、低门槛自部署 |
注:模型厂商的榜单采用不同脚手架、推理预算和评测版本,不能把各家宣传页上的数字直接横向相减。
03 · 逐个看模型
每一款,都有自己的“主场”
Kimi K3
开放旗舰Kimi K3 是五款里最醒目的开放模型之一:2.8T 总参数、1M 上下文、原生视觉,同时面向长周期编码和知识工作。它的价值不只是“便宜”,而是给团队留下了 API、开放权重和中文产品生态三条路线。
- 适合:中文内容与知识库、开放模型研究、需要更强部署控制的团队。
- 留意:3T 级模型的本地部署门槛依然很高;开放权重不等于普通服务器能轻松跑满。
GPT-5.6 Sol
交付型全能选手GPT-5.6 的强项是把推理、工具调用、计算机操作、代码和设计判断连成一条工作流。Sol 是旗舰档,Terra 和 Luna 则把同一代能力下放到更低成本区间。对“从分析到成品”的复合任务,它通常是最省组织成本的选择。
- 适合:全栈开发、复杂知识工作、需要浏览器或桌面操作的自动化、直接交付成品。
- 留意:闭源托管意味着数据边界、区域可用性和平台依赖都要提前评估。
Claude Fable 5
长任务上限Fable 5 是 Anthropic 面向最高难度工作的第五代产品,强调持续数天的复杂、异步任务。它会规划阶段、拆分工作、检查自己的结果,特别适合大型迁移、复杂实现和多阶段专业交付。
- 适合:高价值、低频但很难的任务;可接受更高预算的长周期智能体。
- 留意:$10 / $50 的基础价格最高;其安全分类器、30 天数据保留要求也需要集成方专门处理。
Claude Opus 4.8
成熟工程主力Opus 4.8 仍然是很有竞争力的生产级选择:1M 上下文、最高 128K 输出、自适应思考和完整的工具能力。它的基础价格正好是 Fable 5 的一半,因此在“能力已经够用”的项目里,往往更容易形成稳定成本模型。
- 适合:大型代码库、代理式编码、文档密集型企业任务、重视稳定性的团队。
- 留意:如果任务真的需要跨天自治,Fable 5 是更高上限;如果更看重完整工具闭环,也要与 GPT-5.6 实测。
GLM-5.2
开放工程派GLM-5.2 把重点放在“稳定做完长任务”上:1M 上下文、可调思考强度,并通过 IndexShare 等架构优化降低超长上下文成本。官方公开了 MIT 许可权重,本地部署和二次开发边界更清楚。
- 适合:长代码轨迹、自建推理服务、需要 MIT 许可的产品、对中文与工程部署都有要求的团队。
- 留意:自部署的真实成本不只有显卡,还包括推理优化、并发、监控与升级维护。
04 · 按场景选型
别追“总冠军”,按工作负载选
我要最快做出完整产品
首选 GPT-5.6 Sol
工具链完整,适合从需求、代码、浏览器验证一路做到交付。
我要攻克超难、跨天任务
首选 Claude Fable 5
预算允许时,把它用在真正高价值、长周期的任务上。
我要稳定的编码主力
首选 Claude Opus 4.8
成熟、稳健,价格只有 Fable 5 的一半。
我要开放权重与中文生态
Kimi K3 / GLM-5.2
Kimi 偏多模态与产品生态;GLM 偏开源部署与长周期工程。
真正靠谱的内部评测,只要四步
- 从团队最近三个月的工作中,抽取 20 个真实任务。
- 统一输入材料、工具权限、超时和最大预算。
- 同时记录一次通过率、人工返工时间、总成本与完成时间。
- 按业务价值加权,而不是把所有榜单分数简单平均。
05 · 小高的看法
下一轮竞争,是“谁能可靠地做完”
上下文窗口已经集体进入 1M 时代,但“装得下”不等于“用得好”。模型在数小时乃至数天的轨迹里,能不能记住目标、正确调用工具、发现自己走偏并收回来,才是工程价值。
模型能力越来越像云计算:最好的方案通常不是押注一家,而是建立一层可切换、可评测、可核算成本的模型路由。
所以,如果我是今天开始一个新项目:我会用 GPT-5.6 或 Opus 4.8 做默认生产主力,用 Fable 5 处理少数高价值难题,同时保留 Kimi K3 / GLM-5.2 作为开放模型路线。这样既拿到当前能力,也保留未来的议价权和部署自由。
06 · 资料来源
官方资料与继续阅读
本文是基于公开资料的独立技术分享,不代表任何模型厂商。模型、价格和服务可用性会持续变化,生产采购前请再次核对官方页面。