今年夏天用 AI 干活的人,桌上都摆着两个名字:8 月 14 日带着开放权重到来的 Z.ai GLM 5.3,以及 6 月发布、被许多独立基准测试排在第一位的 Anthropic 推理模型 Claude Fable 5。它们是当下最热门的两个文本模型,而我问自己的问题,也是所有用这些工具做东西的人问的问题:值得多花十倍的钱吗?我的答案是不值得,而且说这话的数据全部公开。我们一起来看。
三十秒了解 GLM 5.3
GLM 5.3 是 Z.ai 的旗舰模型。这个实验室从北京清华大学孵化出来,前身为智谱 AI,如今在香港交易所上市。它于 2026 年 8 月 14 日发布,有一个技术特点:引擎盖下是和 GLM-5.2 相同的 7430 亿参数基座模型,仅靠后训练加以提升。上下文窗口达到一百万 token,推理始终开启并分三档强度,而且模型只处理文本:没有图片,没有视频。
对掏钱的人来说有两件事要紧。第一:权重开放,许可证允许年收入低于 100 亿美元的公司免费商用,这基本上涵盖了所有公司。第二:更轻量的 Flash 版本以促销价运行,每百万 token 输入 0.075 美元、输出 0.25 美元,采用 MIT 许可证。
真正关键的对比表
来看正面对比。这张表让两个模型在七个基准测试上交锋:真实项目上的软件开发(FrontierSWE)、进攻性安全(ExploitBench)、高难度的带工具 Humanity’s Last Exam、两代 Terminal Bench、防御性网络安全(CyberGym)以及 Z.ai 的编码套件。
结果是 Fable 5 比 2 获胜。但分数讲不出距离:在 Humanity’s Last Exam 上两个模型相差 1.4 分,在 Terminal Bench 2.1 上只差 0.2 分,而且 GLM 领先。Fable 真正拉开差距的地方,我们马上会看到。但做内容的人关心的问题是另一个:这几分值得账单贵十倍吗?
Fable 5 仍然领先的地方
Fable 5 赢在最艰难的软件开发工作上。FrontierSWE,带代码仓库和测试的真实项目,它领先十分:88.2 对 78.1。Terminal Bench 3.0,终端测试的最新版本,33.7 对 28.3。Z.ai 的编码套件,39.5 对 31.4。
然后是 ExploitBench,全表最大的差距:78.0 对 54.4,接近二十四分。这个基准衡量发现并利用安全漏洞的能力:那是安全研究的领域,不是日常使用。如果你的工作就是长时间泡在庞大的代码仓库里,靠必须自己扛的智能体干活,这个差距真实存在:Fable 5 是这个级别的冠军。
GLM 5.3 赢和平手的领域
GLM 5.3 赢下两场安全领域的对决。CyberGym,防御性网络安全基准,它拿到 84.5 对 83.8:所有开放模型中的最高分。而且这不是给幻灯片看的数字:在公开审计中,Z.ai 记录了 2436 个在真实软件中发现的漏洞,每一个都经过验证,登记在任何人都能查的公开台账里。
在 Terminal Bench 2.1 上它反超:88.2 对 88.0。在带工具的 Humanity’s Last Exam 上它离榜首只差 1.4 分。在同一份发布材料里,GLM 5.3 还在七项测试中的三项上击败 Claude Opus 4.8:Terminal Bench 2.1、Terminal Bench 3.0 和 CyberGym。整体画面是一个第一梯队模型,并且在安全上有自己的高峰。
价格:输入便宜七倍,输出便宜十一倍
现在说对我而言一锤定音的部分。Fable 5 每百万输入 token 10 美元、输出 50 美元:是 5 和 25 美元的 Opus 4.8 的两倍,和 Opus 5 同价。GLM 5.3 是 1.40 和 4.40。输入便宜七倍,输出便宜十一倍。
举个具体的例子:一个月的智能体工作,消耗 2000 万输入 token 和 1000 万输出 token,用 Fable 5 花费 700 美元,用 GLM 5.3 只花 72 美元。这不是利润率的问题,这是数量级的差距。
两句诚实的说明。Anthropic 对提示缓存(prompt caching)的输入打九折,所以反复使用同一段上下文的人会看到输入端的差距大幅缩小;但输出端,也就是随着长时间推理的智能体不断增长的那项开支,仍然贵十一倍。另外从 7 月起,Fable 5 已不再包含在 Anthropic 的 Max 和 Pro 套餐里:只能在 API 上按额度使用。
Ox Alpha 的故事
如果你觉得价格无关紧要,我来讲讲这个夏天议论最多的那场赌局是怎么收场的。8 月初,在按用量使用模型的平台 OpenRouter 上,出现了一个没有名字的模型,代号 Ox Alpha,价格极低。
三天之内它消耗了 11 万亿 token,成为平台上使用最多的模型之一。8 月 26 日,Z.ai 揭晓它是自家模型:化名背后就是 GLM 5.3。当天集团股价大涨 12 个百分点,而 Artificial Analysis 把这个模型与 Kimi K3 并列,归入当前最好的开放模型。
这个故事的寓意不是 GLM 5.3 不可战胜:而是同一梯队里,定对价格的一方赢。这正是我挑选工作室工具时做的计算。
为什么我更推荐 GLM 5.3
我的偏好,一句话:比起 Fable 5 我更推荐 GLM 5.3,因为它的成本低得多,而结果非常接近。这不是站队,这是制作人的算术。在我的工作里,短片、广告和视觉项目,大预算都花在视频模型和生成平台上;文字和推理那部分用于剧本、制作文档、复杂提示词和自动化流程。负载是真实的,但为几分的基准差距去付十倍的账单,不划算。
还有一个独立性的理由。开放权重意味着可以把模型带到需要的地方,在划算的地方运行,不必依赖任何人的定价决策。7 月的教训,Fable 5 一夜之间退出订阅套餐,对所有人都成立:当供应商改变条件时,手里握着权重的人依然拥有一个模型。
如果你想深入了解 Fable 5,我在这篇文章里讲过它的故事。最后的建议和我对视频工具的建议一样:用你自己的提示词、自己的负载,在自己的真实场景里把两个都试一遍。基准测试告诉你档次,价目表告诉你能用多久。如果你的品牌需要天天使用这些工具的人,这就是我的本职工作。
发表评论
评论会经过审核后才会公开显示。