摘要
本报告对 Kimi K3、DeepSeek-V4-Pro、GPT-5.6 Sol 与 Claude Fable 5 进行证据综合比较。研究以厂商官方文档、模型卡、技术报告、API 定价与隐私条款为第一层证据,以 Artificial Analysis 等具备公开方法的第三方评测为第二层证据,并将厂商自测、不同代理框架和不同推理预算的结果分开解释。研究发现:GPT-5.6 Sol 与 Claude Fable 5 在现有综合证据中构成能力第一梯队,但两者差距小于评测误差和任务差异,不能据此认定存在普适冠军;GPT-5.6 Sol 在工程生态、工具编排、文档与表格工作、成本效率方面更均衡,Claude Fable 5 在长程代理、复杂研究与写作质量方面更具优势倾向。Kimi K3 是目前值得重点关注的开放权重前沿模型,中文、原生多模态、长上下文和代理能力突出,但发布时间短、许可证包含商业附加条件,稳定性和合规结论仍需更多时间验证。DeepSeek-V4-Pro 的价格优势非常显著,但它仍被官方标注为 Preview,且 2026 年 7 月 31 日发布的 V4-Flash-0731 已在官方列出的多项代理基准中超过 V4-Pro,因此不宜将 V4-Pro直接视为 DeepSeek 当前最成熟的默认模型。报告最终给出按任务路由的多模型组合方案,并提供一套可复现的统一实测协议。
关键词:大语言模型评测;AI Agent;软件工程;长上下文;模型路由;API 成本;数据安全
证据标签:【事实】官方可核验信息;【厂商结果】厂商在特定设置下报告的成绩;【第三方结果】独立机构特定版本与设置的结果;【分析判断】本报告基于证据的推论;【证据不足】尚不能可靠下结论。
研究准备与核验
A. 型号核验结果
| 模型 | 核验结论 | 比较时的关键限制 |
|---|---|---|
| Kimi K3 | 正式发布;旗舰;2026-07-27 发布权重与技术报告 | 发布极新,长期稳定性证据有限 |
| DeepSeek-V4-Pro | 官方型号存在;2026-04-24 发布 Preview | 仍为 Preview;V4-Flash-0731 已在多项官方代理基准中超过它 |
| GPT-5.6 Sol | 正式发布;GPT-5.6 家族旗舰;gpt-5.6 默认指向 Sol |
Sol、Terra、Luna 为不同档位,不能混算 |
| Claude Fable 5 | 正式发布;2026-06-09 起 GA;Anthropic 最高能力公开档 | 始终开启自适应思考;要求 30 天留存,不支持 ZDR |
【结论】四个名称均为真实官方型号,但发布阶段、开放程度、代理框架和数据保留条件并不对称。若忽略这些差异,任何总排名都会产生误导。
B. 研究计划
先核对型号、版本、上下文、模态、推理模式、开放许可证和官方可用状态。
分别整理厂商自测与第三方结果,检查推理预算、工具权限、代理框架、版本号和发布日期。
将能力评价拆为推理、编程、Agent、长上下文、中文、写作、研究、多模态、数据分析、稳定性与效率等维度。
基于公开价格建立统一 Token 成本模型;对无法获得失败率和重试率的数据,不虚构“实际成本”。
最后给出场景化选型、模型组合、风险条件和可复现实测协议,并进行独立自查。
C. 信息来源清单
主要证据来源包括:Moonshot/Kimi 开放平台、Kimi K3 GitHub 与技术报告;DeepSeek 官方 API 文档、Hugging Face 模型卡与隐私政策;OpenAI 模型文档、GPT-5.6 发布页、API 定价与企业隐私政策;Anthropic 模型、定价、迁移、上下文和数据保留文档;Artificial Analysis 的 Intelligence Index、速度、成本和 AA-Briefcase 等公开评测。参考资料详见第 41 节。
D. 测试方案
本报告没有跨四家 API 的同环境调用权限,因此未声称完成受控统一实验。第 10 节与附录 A 给出 76 项统一测试协议,包括复杂推理、数学、编程、多文件工程、工具调用、长上下文、双语写作、事实核查、错误前提、多模态、数据分析、研究与项目规划。执行时应固定版本、推理强度、工具权限、温度、重试次数和评分器。
E. 评分标准
用户给定的 19 项权重合计为 102 分。为避免总分失真,本报告保持各项相对比例并归一化到 100 分。评分为“证据综合决策分”,融合官方规格、第三方评测、产品成熟度、成本、生态和风险,不等同于统一实验正确率。
| 维度 | 原权重 | 归一化权重 |
|---|---|---|
| 综合推理 | 10 | 9.80 |
| 编程与软件工程 | 12 | 11.76 |
| Agent与工具调用 | 10 | 9.80 |
| 指令遵循 | 8 | 7.84 |
| 长上下文 | 8 | 7.84 |
| 中文能力 | 7 | 6.86 |
| 英文及多语言 | 4 | 3.92 |
| 写作能力 | 5 | 4.90 |
| 学术研究 | 5 | 4.90 |
| 事实准确性 | 8 | 7.84 |
| 多模态 | 4 | 3.92 |
| 数据分析 | 4 | 3.92 |
| 稳定性 | 4 | 3.92 |
| 响应速度 | 2 | 1.96 |
| Token效率 | 3 | 2.94 |
| API成本 | 3 | 2.94 |
| 生态与部署 | 2 | 1.96 |
| 隐私与企业能力 | 2 | 1.96 |
| 安全边界与可用性 | 1 | 0.98 |
F. 当前无法获得或无法公平比较的数据
四模型在同一 API 地区、同一时间、相同硬件与相同网络下的首字延迟、吞吐、错误率和峰值稳定性。
四模型以完全相同代理框架执行同一代码库任务的真实成功率;Codex、Claude Code、Kimi Code 与 DeepSeek Harness 会显著改变结果。
一致的 1M 长上下文中英文联合测试、统一多模态测试和三次以上重复实验。
厂商未公开的总参数、激活参数、训练数据或知识截止日期;报告一律标记“官方未公开”。
在缺乏受控失败率与重试率时的精确“每个成功任务成本”;报告仅提供理论单次成本和敏感性范围。
1. 报告标题
《前沿大语言模型横向评估:Kimi K3、DeepSeek-V4-Pro、GPT-5.6 Sol 与 Claude Fable 5——基于官方文档、模型卡、独立基准与成本建模的证据综合研究》。
2. 研究日期与版本说明
本报告资料与价格查询截至 2026 年 8 月 2 日 23:30(UTC+8)。模型更新速度很快,尤其 Kimi K3 发布仅数日、DeepSeek-V4-Pro 仍是 Preview,任何结论都应与具体日期绑定。GPT-5.6 Sol 于 2026 年 7 月 9 日正式发布;Claude Fable 5 自 2026 年 6 月 9 日起一般可用;DeepSeek-V4-Pro 于 2026 年 4 月 24 日以 Preview 形式发布;Kimi K3 权重与技术报告于 2026 年 7 月 27 日公开。[1][4][8][11]
版本区分:GPT-5.6 的 Sol、Terra、Luna 是不同成本与能力档位,本报告只评 Sol;Claude Fable 5 与 Opus 5 是不同型号,本报告不以更便宜的 Opus 5 成绩替换 Fable;DeepSeek-V4-Flash-0731 仅用于说明 V4-Pro 的当前产品位置变化,不作为第五个主评对象。
3. 执行摘要
| 问题 | 执行摘要 |
|---|---|
| 综合能力上限 | GPT-5.6 Sol 与 Claude Fable 5 同属第一梯队;现有差异不足以支持普适冠军。 |
| 软件工程 | GPT-5.6 Sol 更适合作为通用生产主模型;Fable 5 适合高难度长程代理;Kimi K3 是开放权重强替代。 |
| 中文与本地语境 | Kimi K3 具有最强倾向;DeepSeek 次之,但中文优势不等于所有专业任务均领先。 |
| API 成本 | DeepSeek-V4-Pro 最低,Kimi K3 次之;GPT-5.6 Sol 与 Fable 5 明显更贵。 |
| 企业敏感数据 | 严格 ZDR 更倾向 OpenAI 合格端点;Fable 5 明确不支持 ZDR;开放权重可通过自托管降低外发风险。 |
| 关键风险 | Kimi 新、DeepSeek Pro 为 Preview、Fable 贵且留存 30 天、GPT 长上下文分段加价。 |
决策原则不是寻找单一“最强”,而是按任务复杂度、可验证性、成本、数据敏感度和代理框架进行路由。
4. 核心结论
【高置信度】四模型都支持约 1M 上下文;但“标称窗口相同”不代表有效检索、长链推理或成本相同。
【中高置信度】第三方 Intelligence Index v4.1 为 Fable 5 约 60、GPT-5.6 Sol 约 59、Kimi K3 约 57、DeepSeek-V4-Pro 约 44;1-3 分差距不应解释为绝对能力等级差。[16][17][18]
【高置信度】DeepSeek-V4-Pro 的标准 API 单价最低;但其 Preview 状态和当前代理基准位置降低了其作为关键生产主模型的确定性。[4][6]
【中等置信度】GPT-5.6 Sol 是最均衡的工程默认选项;Claude Fable 5 更偏向昂贵的长程高难任务;Kimi K3 更适合中文、开放权重和可控部署。
【证据不足】无法可靠断言哪一款“幻觉最低”“1M 上下文最稳”或“任何地区都最快”,因为缺少统一版本、统一工具和多次重复实验。