近 30 天 · 大模型对比报告 · 2026-07-09 → 08-08

「斩杀线」之下
Kimi K3 · GLM-5.2 · 千问 3.8 Max

网传「除 GPT、Claude 外全部进入 DeepSeek V4 Flash 斩杀线」——我们用有出处的公开数据重画这张图: 斩杀线在性价比维度成立,但三个国产新旗舰的绝对能力反而全部略高于 V4 Flash

DATA: OFFICIAL PRICING + SWE-BENCH VERIFIED + TERMINAL-BENCH 2.3 | AS OF 2026-08-08

0×
千问 3.8 Max 输出价相对 V4 Flash 的倍数($5.76 vs $0.42 / 百万 tokens)
0%
千问 3.8 Max 的 SWE-bench Verified——本文六款模型中的国产最高分
0
GLM-5.2 的 Terminal-Bench 2.3 得分,全场最高(V4 Flash 为 58.1)
01

最近 30 天发生了什么

三个模型在 10 天内接连发布,「Token 战争」开打;两周后,「斩杀线」图刷屏。

07-17
Kimi K3 发布
1T/35B MoE,2M 上下文,开源。K2 流量单日暴跌 60%,「Token 战争」成话题。
07-22
GLM-5.2 发布
主打 Agentic Engineering;「高达测评泄露」事件称其真实任务首胜 Claude。
07-26
千问 3.8 Max 发布
SWE-bench 82.3%、Terminal-Bench 2.3 67.5%;发布当日阿里股价涨 6.8%。
07-31
DeepSeek 注水争议
被曝 API 对话默认注入 Codex 环境上下文,benchmark 口径引讨论。
08-03
「斩杀线」图刷屏
多个 AI 生成变体流传:「除 GPT/Claude 外,全部进入 V4 Flash 斩杀线」。
08-06
涨价公告 · Pro 临近
DeepSeek 官宣 API 大幅涨价;灰度中的 V4 Pro 正式版预计 8 月内发布。
02

网传原图(高清版),以及它的三个问题

「斩杀线」叙事的数据原型是 Artificial Analysis Intelligence Index 散点图(下为 2048×1008 官方高清版,点击可放大拖动、逐一看清模型名);自媒体刷屏的「斩杀线」图是它的 AI 改写示意(见下方存档)。

Artificial Analysis Intelligence Index v4.1 高清原图
高清原图 · Artificial Analysis Intelligence Index v4.1(2026-07-31 提取)· 网传斩杀线图的数据原型点击放大
DeepSeek is back amongst the frontier 高清图
同系列精简版:「DeepSeek is back amongst the frontier」(2400×1123)点击放大
自媒体斩杀线示意图
自媒体 AI 示意图(低清存档)· 新浪新闻配图 2026-08-03 · 横轴「加权分」无出处
自媒体变体一
示意图变体 ①
自媒体变体二
示意图变体 ②(千问 3.8 Max 压线版)
自媒体变体三
示意图变体 ③(条形图版)
问题 01
它不是官方榜单
多个 AI 生成变体彼此矛盾:V4 Flash 输入价有的写 $0.28、有的写 $0.14;横轴「综合能力加权分」没有任何出处
问题 02
SKU 对不上
图里放的是 Kimi K3 Pro、GLM-5.2 Air、千问 3.7 Max——全是各家族另一档。你关心的 K3 / 5.2 / 3.8 Max 是更新的旗舰档,需要重新放点。
问题 03
「斩杀」被误读
斩杀的准确含义是「同能力下价格被碾压」,不是「能力被淘汰」。几乎所有标题都不讲这一点。
03

同一坐标系,换真实数据重画

横轴换成有出处的 SWE-bench Verified,纵轴为官方输出刊例价(对数刻度)。红色虚线是过 V4 Flash 的「L 形斩杀边界」;绿色虚线是 V4 Pro 正式版的预测斩杀边界(灰度爆料 + 8/6 涨价公告推演,官方数据未发布)——注意左上方两块斩杀区:红色经典斩杀区在真实数据下是空的,而绿色预测区会装下三旗舰和 GPT-5.5

能力 × 价格:六个模型的真实落点
X: SWE-BENCH VERIFIED (%) | Y: OUTPUT PRICE $/M TOKENS (LOG) | GPT-5.5 / CLAUDE 为官方口径约数 | 绿色 = V4 PRO 正式版预测层
0.2 0.5 1 2 5 10 20 78 80 82 84 86 88 90 能力 →(SWE-bench Verified,%) 输出价格($/百万 tokens,对数) 经典斩杀区(红) 能力 ≤ V4 Flash 且更贵 真实数据下:空的 斩杀边界(过 V4 Flash) V4 Pro 正式版·预测斩杀区(绿) 若爆料成立:三旗舰 + GPT-5.5 全部进线,仅剩 Opus 级能力溢出 预测区间:能力 85–88 · 输出 $1.5–4 能力溢出区 贵,但有只有它们能做的事 国产三旗舰:能力 +0.8 ~ +1.7 分 但价格贵 6.1 – 13.7 倍 → 性价比被斩杀 DeepSeek V4 Flash 80.6 / $0.42 · 斩杀线本体 GLM-5.2 81.4 / $2.56 Kimi K3 81.5 / $4.00 千问 3.8 Max 82.3 / $5.76 GPT-5.5(约) ~85 / $8.00 Claude Opus 4.6(约) ~88 / $15.00 DeepSeek V4 Pro 正式版(预测) ~86.5 / ~$2.5 · 涨价后预估
斩杀线本体 GLM-5.2 Kimi K3 千问 3.8 Max 海外旗舰(官方口径约数) V4 Pro 正式版·预测斩杀区(绿)
反转点网传图里「V4 Flash 58 分、别人 50 分」的排布与公开基准不符:真实数据里三家国产新旗舰能力全部略高,但都站在红色斩杀边界的右上方——能力略高、价格贵一个数量级。被斩杀的是性价比,不是能力。
绿色叠层V4 Pro 正式版(灰度测试中,预计 8 月内发布)的预测斩杀边界。依据:① 4 月 API 版已上线(OpenRouter 输出 $0.87/M);② 7/31 Flash 正式版公测,官方称 Pro 正式版「尽快发布」;③ 8/6 官方公告 API 大幅涨价,硅基流动已把 V4 Pro 缓存命中价上调 10 倍;④ 灰度测试爆料称能力「微微落后于最新 Opus」。若爆料成立,千问 3.8 Max、Kimi K3、GLM-5.2 乃至 GPT-5.5 全部进入绿色斩杀区,只剩 Opus 级「能力溢出」豁免。注意:4 月 API 版 V4 Pro 在 AA 指数上仅 46 分档,与正式版爆料不是同一口径——官方数据发布后此层需按真值重画。
04

斩杀线的量化:性价比指数

性价比指数 = SWE-bench 分数 ÷ 输出价,以 V4 Flash = 100 归一化。注意:按这个口径,连 GPT-5.5 和 Claude 也在线内——它们靠「能力溢出」豁免,而非性价比。

DeepSeek V4 Flash$0.42 / 80.6 分
100
GLM-5.2$2.56 / 81.4 分
16.6
Kimi K3$4.00 / 81.5 分
10.6
千问 3.8 Max$5.76 / 82.3 分
7.4
GPT-5.5(约)$8.00 / ~85 分
5.5
Claude Opus 4.6(约)$15.00 / ~88 分
3.1
讲法每 1 美元买到的能力分:V4 Flash 是 Kimi K3 的 9.4 倍、千问 3.8 Max 的 13.4 倍、Claude Opus 4.6 的 32.8 倍。批量 API 场景选谁,一目了然;但「只有它能做的题」不在这张表的度量范围内。
05

三个主角,各自的优劣势

没有「最好的模型」,只有「某个场景下性价比最高的模型」。

Kimi K307-17 · 开源
审美与长上下文的内容旗舰 · 月之暗面
输出 $4.00/M上下文 2MSWE 81.5%速度 48–62 t/s
  • 前端/网页审美全场第一档,官方主打 high-aesthetic webdev
  • 2M 上下文四家最长;支持视觉多模态
  • 开源可自部署;订阅套餐额度慷慨
  • :48–62 tok/s,官方定位「慢而省」,约为 GLM-5.2 一半
  • 输出价在国产三家里偏贵,是 V4 Flash 的 9.5 倍
适合日常内容创作 / 前端页面 / 长文档 —— 你已有套餐,继续当主力
GLM-5.207-22 · 开源
Coding Agent 性价比之王(国产旗舰档)· 智谱
输出 $2.56/M上下文 200KTB 2.3 69.7速度 81–97 t/s
  • Terminal-Bench 2.3 全场最高(69.7),Agentic 编程实测最强
  • 速度快 + 价格居中 + 开源,工程体验最均衡
  • Coding Plan 约 ¥20/月起:3 倍 Claude Pro 用量、1/7 价格
  • 上下文 200K 偏短;多模态以文本/代码为主
  • 内容创作与审美口碑弱于 K3
适合编程 Agent / 自动化脚本 —— 个人开发者最划算的编程订阅
千问 3.8 Max07-26 · 闭源
推理与知识准确性的闭源旗舰 · 阿里
输出 $5.76/M(国际刊例)上下文 256KSWE 82.3%AIME 95.8
  • 数学/复杂推理全场最强:AIME 26 95.8(第一)、HLE 53.6(最高)、GPQA 89.4
  • 幻觉最少:AA omniscience 指数 12,知识型回答最可靠
  • SWE-bench 82.3% 代码第一梯队;阿里云企业级生态与 SLA
  • 闭源:不能本地部署、不能私有微调(其余三家全开源)
  • 上下文 256K 最短(K3 的 1/8);国产阵营 API 最贵
  • C 端通义 App 体验平庸——但免费额度够你试
适合数学/推理/知识密集型内容、阿里云生态团队、To B 交付
DeepSeek V4 Flash2026-05 · 开源
斩杀线本体 · 深度求索
输出 $0.42/M上下文 1MSWE 80.6%速度 69–112 t/s
  • 价格屠夫:输出 $0.42/M,缓存命中输入仅 $0.028/M
  • 开源 + 1M 上下文 + 速度不慢;数学意外不错(AIME 93.5)
  • 绝对能力比三家新旗舰低 0.8–1.7 SWE 分,复杂 Agent 任务翻车率更高
  • 7 月底「默认注入 Codex 上下文」争议,部分复测分数低于官方口径
适合批量 API / 成本敏感的后台任务 —— $0.42 的斩杀线本体
06

你的体感 × 公开数据对照

你的三条 Kimi K3 体感,全部被公开数据印证;千问 3.8 Max「贵不贵」要分场景回答。

你的体感 / 问题
公开数据验证
结论
K3 套餐用量完全够用
Kimi 订阅额度在同档产品中偏慷慨;K3 开源 + 2M 上下文
✓ 成立
K3 响应非常慢
实测 48–62 tok/s,官方定位「慢而省」,约为 GLM-5.2 的一半
✓ 成立 · 是设计取向
K3 前端审美不错
官方主打 high-aesthetic frontend/webdev,多篇第三方实测认可
✓ 成立
千问 3.8 Max 是不是很贵?
API 国产最贵($5.76/M),但只是 Claude 的 38%;C 端通义 App 免费额度可用
分场景 · 先用免费额度
07

给学员的讲解要点

五条,可直接照讲。

1
先讲概念
斩杀线 = 「同等能力下,价格被碾压即死亡」的性价比线,不是能力线。自媒体标题几乎都不讲这个区别。
2
再讲反转
近 30 天的真实数据里,国产三个新旗舰能力全部略高于 V4 Flash,但价格贵 6–14 倍——所以它们在性价比维度确实「进线」了。
3
GPT/Claude 为什么例外
不是性价比高(按口径它们更差),而是能力溢出:仍存在只有它们能完成的任务。这是「按值论价」,不是「按价论价」。
4
顺手讲媒介素养
网传图是 AI 生成的自媒体示意图:多个版本数据互相矛盾、坐标轴无出处。看到刷屏结论,先问一句「数据口径是什么」
5
最后讲怎么选
内容/审美/长文档 → Kimi K3;编程 Agent → GLM-5.2;数学推理/知识准确 → 千问 3.8 Max;批量 API → V4 Flash。按场景分工,而不是二选一。