网传「除 GPT、Claude 外全部进入 DeepSeek V4 Flash 斩杀线」——我们用有出处的公开数据重画这张图: 斩杀线在性价比维度成立,但三个国产新旗舰的绝对能力反而全部略高于 V4 Flash。
三个模型在 10 天内接连发布,「Token 战争」开打;两周后,「斩杀线」图刷屏。
「斩杀线」叙事的数据原型是 Artificial Analysis Intelligence Index 散点图(下为 2048×1008 官方高清版,点击可放大拖动、逐一看清模型名);自媒体刷屏的「斩杀线」图是它的 AI 改写示意(见下方存档)。
横轴换成有出处的 SWE-bench Verified,纵轴为官方输出刊例价(对数刻度)。红色虚线是过 V4 Flash 的「L 形斩杀边界」;绿色虚线是 V4 Pro 正式版的预测斩杀边界(灰度爆料 + 8/6 涨价公告推演,官方数据未发布)——注意左上方两块斩杀区:红色经典斩杀区在真实数据下是空的,而绿色预测区会装下三旗舰和 GPT-5.5。
性价比指数 = SWE-bench 分数 ÷ 输出价,以 V4 Flash = 100 归一化。注意:按这个口径,连 GPT-5.5 和 Claude 也在线内——它们靠「能力溢出」豁免,而非性价比。
没有「最好的模型」,只有「某个场景下性价比最高的模型」。
你的三条 Kimi K3 体感,全部被公开数据印证;千问 3.8 Max「贵不贵」要分场景回答。
五条,可直接照讲。