
马斯克又当预言家了。
只不过这一次,他被打脸的速度可能比自己发射火箭还快。
6月18号晚上,X上一条看似普通的回复,直接把中美AI竞争这个话题炸上了全球热搜。一个网友@马斯克,问了一个所有人都想知道答案的问题,中国的大模型,什么时候能追上美国最顶尖的Fable水平。
马斯克没怎么犹豫。
他敲下了一行字,probably Q1,大概2027年一季度吧。
紧接着,被点名的那个人出现了。智谱AI创始人唐杰,只回了四个字,won't take that long,用不了那么久。
就这一句话,整个AI圈都疯了。
image
事情得从几天前说起。
6月9号,Anthropic发布了当时号称地表最强的两款模型,Claude Fable 5和Claude Mythos 5。硅谷一片欢腾,开发者们排着队等API权限,各大科技媒体的头版都已经留好了位置。
然后呢。
四天后,这两款模型没了。
不是被竞品干掉的,是被美国政府一纸禁令直接掐断的。6月12号下午5点21分,美国商务部以国家安全为由,要求Anthropic立即停止向任何外国公民提供Fable 5和Mythos 5的访问权限。注意,是任何外国公民,不管你在美国境内还是境外。
Anthropic没办法,只能全球下线。
从巅峰到消失,只活了96个小时。
image
就在Fable 5下线的第二天,6月13号,智谱出手了。
GLM-5.2正式上线。MIT协议,全量开源,允许免费商用。100万token的上下文窗口,比上一代直接翻了五倍。更狠的是,它的API接口和Anthropic完全兼容。
这意味着什么。
意味着那些前一天还在用Fable 5做开发的企业,几乎不用改一行代码,就能把 pipeline 切到GLM-5.2上。
智谱选的这个时间点,巧合得让人浮想联翩。他们自己倒是没多说什么,只是发了一段话,在一些前沿模型突然变得不可用的时刻,我们选择相信另一条路,前沿智能不应只属于少数人,也不应被少数规则随时收回。
这话什么意思,懂的人都懂。
然后就有了马斯克和唐杰那场隔空对话。
一个做技术的KOL叫Teortaxes,先是给GLM-5.2做了详细的技术分析。他说这个模型目前大概在Claude Opus 4.7到4.8的水平,算下来中美之间大概存在7个月的时间差。
马斯克看到了,他觉得还要再保守一点,就回复了那句probably Q1。
坦白说,从马斯克的视角看,这个判断不算离谱。毕竟他是AGI将在2026年到来、2030年AI总智力超越全人类的人,2027年Q1对他来说已经是相当谨慎的估计了。
但唐杰不同意。
他的回应只有四个字,won't take that long。没有具体时间表,没有技术细节,没有长篇大论的解释。就是那种,你懂的,高手过招时的云淡风轻。
很快,这个话题在X上刷屏了。
image
网友们的反应分成了两派。
一派是兴奋派。他们觉得GLM这个体量能做到现在这个水平已经很离谱了,何况智谱的迭代速度快得吓人。举个例子,GLM-5.1在全球Harvey法律Agent测试里还是零分,到了GLM-5.2,直接冲进前三。这种进步速度,年底出个GLM-6,真的追平Fable不是没可能。
另一派是冷静派。他们的质疑也很直接,GLM-5.2现在连跨对话的记忆能力都没有,光在 benchmark 上追平意义不大。模型不是考试机器,真实场景里的智能才是硬通货。
马斯克其实部分认同这个观点。
他在后面又补了一句,基准测试的追赶或许年底前就能做到,但按真正的实用性来衡量,即使2027年Q1达到也已经很惊人了。他还特意强调,Anthropic一直把重心放在最大化有用的智能上,这件事不会体现在 benchmark 分数里,但一定会体现在收入上。
这话里有话。
马斯克其实在说两件事。第一,他认可中国模型在跑分上的追赶速度。第二,他也暗示了,跑分和真实能力之间,还有一段不短的距离。
但有一个细节,很多人可能忽略了。
就在马斯克和唐杰对话的同一天,全球最大AI开源社区Hugging Face做了一个史无前例的决定。他们自掏腰包,为GLM-5.2提供连续6小时的全球免费算力。不用申请,不限地区,谁都能用,抱抱脸替你买单。
这是Hugging Face第一次真金白银地为一个中国模型做这种事。
为什么。
因为GLM-5.2在Code Arena的全球盲测里,拿了可用模型的第一名。在Artificial Analysis综合榜单上,它以51分跻身全球前三,开源模型里的SOTA。在FrontierSWE、Terminal-Bench这些代码和长程任务权威基准上,它和Claude Opus 4.8的差距已经收窄到1%到4%。
换句话说,开源模型的代码能力,第一次达到了行业认可的顶尖闭源模型水平。
image
唐杰凭什么敢说用不了那么久。
除了GLM-5.2本身的进展,他手里还捏着一张牌,原生多模态。上个月他就预告过,智谱的原生多模态模型将在数月内上线。而多模态这件事,恰恰是当前头部模型拉开差距的最关键维度。
感知环境是完成长任务的基础。多模态不是功能附加,而是Agent真正落地的前提。唐杰的原话。
Kimi今年1月发布的K2.5已经是原生多模态架构。阿里Qwen3.5-Omni 3月上线,基于超过1亿小时音视频数据端到端预训练。GPT-4o更是在去年4月就完成了原生多模态架构落地。智谱在这个维度上,确实还差一个明确的答案。
但这个答案,可能比我们想的来得更快。
现在再把镜头拉远一点,看看整个格局。
Fable 5被强制下线这件事,给全球企业上了一堂生动的风险教育课。你花大价钱搭好的AI pipeline,说没就没,只给你90分钟的预警时间。那些曾经把Claude当作唯一选择的CTO们,现在不得不重新思考一个问题,把公司的核心能力绑定在单一闭源模型上,真的安全吗。
GLM-5.2的MIT开源协议,在这个时候显得异常珍贵。
它无法被政府一纸令下就关掉。因为它的权重已经发布,代码已经公开,任何人都可以下载、部署、修改。Z.ai的MIT许可证不只是一个开发者友好的选择,它是一种关于前沿模型应该成为什么样资产的治理声明。
这是TechFastForward的原话,一家国外科技媒体的评价。
不过,我们也得清醒地看到现实。
GLM-5.1在SWE-bench Pro上的得分是58.4%,而Fable 5在被下线前大约是95%。这个差距,不是一朝一夕就能抹平的。GLM-5.2发布时甚至没有公布任何 benchmark 数据,这让外界无法做精确的能力对比。
马斯克说的那个真实实用性,恰恰是中国模型目前最难量化的部分。
Anthropic的Claude为什么能在企业级市场站稳脚跟。不是因为它在跑分上遥遥领先,而是因为它在长程任务、代码理解、多轮对话这些真实场景里,表现出了稳定的可靠性。这种东西,benchmark 测不出来,但企业用户用一次就知道。
所以唐杰那句won't take that long,与其说是一个技术判断,不如说是一个态度宣言。
他在告诉全世界,中国AI的追赶速度,已经不按你们熟悉的剧本走了。
科技竞争
还有一个数字很有意思。
智谱的股价,在马斯克和唐杰对话后的五个工作日里,累计上涨了99.81%,几乎翻倍。
资本市场用真金白银投票,说明他们相信这个故事。但资本市场的信心,和真实的技术能力,从来都是两回事。
真正值得关注的,是接下来的30天。
GLM-5.2承诺在一周内发布开源权重,届时独立研究社区可以运行SWE-bench Pro评估,验证它的真实能力。如果结果接近甚至达到Fable 5的水平,那唐杰的底气就有了硬核支撑。如果差距仍然明显,那这场对话就更多是一场精彩的公关秀。
写到这里,我想回到最初的那个问题。
马斯克说2027年Q1,唐杰说用不了那么久。谁对谁错。
说实话,这个问题本身可能就是个伪命题。
因为追平这个概念,在不同人眼里完全不是一个意思。跑分追平,实用性追平,商业收入追平,生态影响力追平,这些是完全不同的维度。
中美AI竞争的叙事,在过去一年里发生了微妙的变化。从DeepSeek开始,中国模型不再只是便宜替代或者单项能力很强的追赶者。GLM-5.2的出现,让这种趋势变得更加清晰,中国变量正在进入那些曾经由Claude、GPT牢牢占据的核心地带。
但要说已经追平,还为时过早。
真正的反转,可能不在于某个模型的某次发布,而在于一个更深层的问题,当闭源模型随时可能被政府掐断,当开源模型的能力不断逼近前沿,企业会选择什么样的AI战略。
马斯克和唐杰的这场对话,表面上是两个人在预测时间线。实际上,它折射出的是整个AI产业正在经历的一场价值观地震。
前沿智能,到底应该属于谁。
这个问题,比任何 benchmark 都更难回答。