Claude Opus 5、GPT-5.6、Gemini 3、Kimi K3、DeepSeek V4——一次讲清它们的差别,以及一个比「谁第一」重要得多的分岔口
2026-07-26
一句话:到 2026 年 7 月,最前面的位置仍被美国几家公司占着,但差距已经很小,而且中国这几家走了一条完全不同的路——把模型本身发给你。这篇文章讲清各家现在有什么、强在哪,以及为什么「开放权重」这件事比排名更值得关注。
反幻觉声明:这是一篇时效性极强的文章,所有信息的核验日期为 2026 年 7 月 26 日,几个月后必然过时。分数取自独立评测机构 Artificial Analysis 的公开排行榜(非厂商自报);模型的发布日期取自各公司官方页面;中国模型的开放权重情况取自 Hugging Face 官方账号实况。凡是我没能从一手来源核实的,文中都会明确说「未核实」,不会含糊带过。
这是独立评测机构 Artificial Analysis 的智能指数排名,它同时评估 250 多个模型,用的是统一标准,不是各家自己报的成绩1。
看完这张表,你可能第一反应是「美国还是领先」。没错,但请注意第四名——
这才是 2026 年最重要的一件事,而且很多报道不讲。
闭源路线(Claude、GPT、Gemini 走的路):模型养在他们的机房里,你通过网络调用。你只能租,拿不走。他们随时可以涨价、改规则、或者停掉你的服务。
开放权重路线(中国这几家主打的路):把模型文件本身公开发布,你可以下载到自己的电脑或服务器上跑。拿走了就是你的,断网也能用,没人能收回。
注意用词:业内更准确的说法是 open-weight(开放权重),不是「开源」。因为通常只公开了模型文件,训练代码和训练数据并不公开。
这个区别对普通人可能没感觉,但对学校、医院、企业是决定性的——数据不能外传的场合,只有能拿走的模型可用。
Anthropic(Claude) —— 目前排名最前。Claude Opus 5 于 2026 年 7 月 24 日发布,官方称它「接近 Claude Fable 5 的前沿智能,价格只要一半」,定价为每百万输入 token 5 美元、输出 25 美元2。这家公司的模型在编程和长任务上口碑最好。
OpenAI(GPT) —— GPT-5.6 于 2026 年 7 月 9 日发布,分 Sol、Terra、Luna 三个版本,其中 Sol 是主力,官方定位是「最强的编程模型」。
Google(Gemini) —— 目前公开的主线是 Gemini 3.x:3.1 Pro(复杂任务)、3.6 Flash(讲究省 token)、3.1 Deep Think(科研工程)。官网上 Gemini 3.5 Pro 标着「即将推出」3。Gemini 一贯的强项是多模态和性价比。
Kimi(月之暗面) —— K3 于 2026 年 7 月 16 日发布,在上面那张排行榜上排第四、分数 57,是中国模型里最靠前的。它被称为迄今参数量最大的开放权重模型。
⚠️ 但这里要说清楚一件事:「已发布」和「已开源」是两回事。截至我核验的 7 月 26 日,Moonshot 在 Hugging Face 上的官方账号里,最新的还是 Kimi K2.7-Code(1.1 万亿参数),K3 的权重尚未上架4。官方此前宣布的开放时间是 7 月 27 日——也就是说,你读到这篇文章时可能已经放出来了。
DeepSeek(深度求索) —— 官方 Hugging Face 账号上已有 DeepSeek-V4-Pro-DSpark(8890 亿参数) 和 V4-Flash-DSpark(1650 亿参数),约三周前更新5。
⚠️ 网上很多文章说 V4-Pro 是「1.6 万亿参数」——这个数字和官方账号上的实际标注对不上。我采用官方页面的数字,并建议你也养成这个习惯:参数量这类数字,只信模型发布方自己的页面。
Qwen(阿里通义千问)、GLM(智谱) —— 这两家的特点是型号覆盖最全:从能塞进笔记本的小模型到几千亿参数的大模型都有,而且工具链支持最快。如果你想在自己电脑上跑一个中文能力不错的模型,这两家往往是首选。
Hugging Face(全球最大的模型分享平台)在 2026 年春季的开源生态报告中提到:中国实验室的模型占该平台全部模型下载量的约 41%,已经超过美国实验室,成为下载量最大的来源。
这个数字比排行榜名次更能说明问题:排行榜比的是「最强的那一个」,下载量比的是「大家实际在用哪个」。
给你一个不用记名字的判断框架——因为具体型号每隔几个月就会变,但这几条不会:
| 你的情况 | 该看什么 | 为什么 |
|---|---|---|
| 就是想找个最聪明的用 | 看独立评测的最新排名 | 别看厂商自己发的对比图 |
| 要写代码 / 跑长任务 | 看编程和智能体类评测 | 综合分高不代表这项强 |
| 数据不能外传 | 只能选开放权重模型 | 这是硬约束,跟聪不聪明无关 |
| 想在自己电脑上跑 | 看参数量和显存要求 | 几千亿参数的家用机跑不动 |
| 要控制成本 | 看每次任务的价格,不只看单价 | 有的模型便宜但要想很久,总价反而高 |
这篇文章会很快过时。
我写下这行字的时候(2026 年 7 月 26 日),Claude Opus 5 发布才两天,Kimi K3 发布才十天,Gemini 3.5 Pro 还挂着「即将推出」。你读到它的时候,排名很可能已经变了。
所以真正该带走的不是名次,而是这两条:
Artificial Analysis 智能指数排行榜,覆盖 250 余个模型的综合评测。分数与价格核验于 2026-07-26。https://artificialanalysis.ai/leaderboards/models↩︎
Anthropic 官方公告《Claude Opus 5》,2026 年 7 月 24 日发布;定价为每百万输入 token 5 美元、每百万输出 token 25 美元。https://www.anthropic.com/news/claude-opus-5↩︎
Google DeepMind 官方 Gemini 模型页,列出 Gemini 3.1 Pro、3.6 Flash、3.5 Flash-Lite、3.1 Deep Think,其中 3.5 Pro 标注为「即将推出」。核验于 2026-07-26。https://deepmind.google/models/gemini/↩︎
Moonshot AI 在 Hugging Face 的官方账号,核验于 2026-07-26,最新模型为 Kimi-K2.7-Code(1.1T 参数),K3 权重当时尚未上架。https://huggingface.co/moonshotai↩︎
DeepSeek 在 Hugging Face 的官方账号,核验于 2026-07-26,列有 DeepSeek-V4-Pro-DSpark(889B)与 DeepSeek-V4-Flash-DSpark(165B)。https://huggingface.co/deepseek-ai↩︎