eviso's thinking

免费午餐结束

CONTENTS

8 月 6 日,两条新闻同时落地,方向截然相反,底层逻辑却是同一件事。

DeepSeek 宣布将大幅上调 API 定价,预计涨幅较大。V4 Flash 目前输入 $0.14/百万 token、输出 $0.28/百万 token,相比 OpenAI GPT-4o 的 $2.50/百万 token 便宜近 18 倍(来源:Bloomberg/36kr 快讯),这个价格已经是中国大模型里最低一档。涨价公告出来当天,DeepSeek 重启融资的消息同时传出,投前估值 5000 亿元(来源:36kr 快讯)。

几乎同一时刻,字节跳动内部下了一道死命令。张一鸣罕见发声,原话大意是“不用别人的输出换榜单排名”,内部严禁对开源模型做蒸馏。ithome 的标题更直白:“就算模型暂时落后,字节跳动也不会依赖 AI 蒸馏技术”。

一条是开源模型涨价的信号。一条是下游公司被禁止白嫖开源模型的信号。两条新闻合在一起,画的是同一个画面:AI 的免费午餐正在收摊。

蒸馏这门生意

先把“蒸馏”这件事说清楚。

大模型蒸馏,本质是用一个强大模型(教师)的输出,来训练一个较小模型(学生)。学生模型通过模仿教师的回答分布,学到接近教师的推理能力,但训练成本只是教师的一个零头。这不是什么秘密技术,是 2015 年 Hinton 的经典论文里的方法。

过去两年,大量中国 AI 创业公司的操作路径是这样的:拿 DeepSeek 开源模型的 API 跑海量 prompt,把输出收集起来做训练数据,训练自己的“自研模型”,然后宣称“性能接近 GPT-4 但成本十分之一”。这条路的底层,不是技术突破,是价格套利。

有业内估算称 DeepSeek V3 的训练成本约 557 万美元(来源:DeepSeek 技术报告),但 API 定价远低于这个成本的分摊。等于在补贴整个行业。有人算过一笔账:按 V4 Flash 的定价,跑一百万次推理的成本不到一杯咖啡钱。这意味着任何愿意写脚本的人,都能用极低的价格获取高质量训练数据。

张一鸣禁蒸馏,不是道德选择,是竞争策略。字节自己有豆包,有大量自有用户数据,不需要蒸馏别人的模型。禁止内部团队蒸馏,等于堵死了“偷懒路径”,逼团队在自有数据飞轮上做真功夫。换句话说,这恰恰说明字节判断:靠蒸馏建立的优势不可持续,模型的护城河必须长在数据上,不是长在别人 API 的价格上。

涨价的底层不是贪心

DeepSeek 涨价,也不是贪心。要理解这件事,得回到布莱恩·阿瑟在《复杂经济学》里提出的“收益递增”框架。阿瑟论证了一个反直觉的结论:在知识密集型产业里,先发者不是靠规模取胜,而是靠网络效应锁定市场。一旦用户围绕你的产品建立了工具链和工作流,迁移成本就构成了天然壁垒。

DeepSeek 过去两年的定价策略,完全符合阿瑟的逻辑:用低于成本的价格铺量,吸引用户围绕 DeepSeek 的 API 建立生态,等迁移成本足够高的时候,再回头收租。涨价不是一个孤立决策,是收益递增锁定完成后的必然动作。

投前估值 5000 亿元的融资,是这盘棋的另一面。投资人愿意给这个估值,不是看 DeepSeek 现在赚多少钱,是看它锁定用户之后能赚多少钱。涨价的时机和融资的节奏咬合在一起,说明 DeepSeek 自己也认为:锁定阶段已经完成,可以开始变现了。

明斯基时刻的先声

这里得把时间线拉长一点。昨天那篇《AI 债务的明斯基时刻》里提到,七月 AI 板块抛售重创了对冲基金,有基金因重仓 AI 概念股爆仓清盘(来源:Horizon 8/6 快讯,原报道来自 Situational Awareness)。Citadel 旗舰基金在同一个月逆向买入 AI 股票后大涨 6%(来源:Horizon 同日快讯,原报道 CNBC)。聪明钱在分歧,但分歧本身说明一件事:AI 的定价共识正在瓦解。

DeepSeek 涨价是这个瓦解过程的一个具体切面。当最便宜的供给方开始提价,整个行业的成本曲线都在重构。那些靠蒸馏建立“自研模型”的公司,面临双重打击:上游 API 涨价,训练成本飙升;下游竞争者(字节这类有数据飞轮的公司)主动切断蒸馏路径,护城河一夜归零。

这不是明斯基时刻本身。明斯基时刻是信贷收缩引发资产崩盘。但它是先声:当补贴方开始退出,依赖补贴生存的商业模式就要开始暴露真实成本结构了。

纳西姆·塔勒布在《反脆弱》里有个概念叫“脆弱推手”,指那些通过隐藏风险来制造稳定假象的人。过去两年的 AI 开源生态里,DeepSeek 扮演的恰好是这个角色:用极低价格制造了“AI 成本趋近于零”的幻觉,让整个行业在补贴基础上搭建商业模型。补贴退出,幻觉破灭。

真正值得看的信号

判断这件事会不会引发更大范围的 AI 公司洗牌,有三个信号值得盯。

第一是涨价后 DeepSeek 的 API 调用量变化。如果调用量在涨价后显著下降,说明大量需求是价格敏感型的“白嫖需求”,不是真实业务需求。调用量下降的幅度,直接反映蒸馏产业链的规模。

第二是其他大模型公司的跟进速度。如果通义千问、智谱、月之暗面在短期内同步涨价,说明行业层面的补贴共识正在瓦解,不是 DeepSeek 一家的独立决策。如果其他家不跟,说明 DeepSeek 可能是在融资压力下提前变现,行业格局没有根本变化。

第三是“自研模型”创业公司的融资数据。如果下一轮融资中,投资人开始追问“你们的模型有多少比例的训练数据来自自有数据飞轮”,而不是只看跑分排名,说明市场已经用脚投票了。

定价正常化不等于行业衰退

末了得说清楚一件事:AI 模型涨价,不等于 AI 行业衰退。

恰恰相反。一个行业从“烧钱抢量”进入“定价正常化”,是成熟的标志。DeepSeek 涨价说明它认为自己已经过了需要补贴用户的阶段,可以开始用价格反映真实成本了。字节禁蒸馏说明头部公司判断蒸馏红利已尽,必须回归自有数据竞争。

这两件事指向同一个结论:AI 行业的竞争正在从“谁的 API 更便宜”转向“谁的数据飞轮更厚”。价格战结束的时候,才是真正比拼内功的时候。

那些过去两年靠蒸馏加跑分排名建立估值的“AI 模型公司”,该紧张了。

参考资料

  • DeepSeek 计划近期整体上调 API 服务定价,预计涨幅较大。来源:Bloomberg 转引 ithome/36kr 快讯,8 月 6 日。
  • DeepSeek 重启融资,投前估值 5000 亿元。来源:36kr 快讯,8 月 6 日。
  • 张一鸣内部下死命令:就算模型暂时落后,字节跳动也不会依赖 AI 蒸馏技术。来源:ithome/微博热搜,8 月 6 日。
  • 字节跳动内部严禁蒸馏开源模型。来源:微博热搜第 5,知乎热榜第 14,8 月 6 日。
  • 七月 AI 抛售重创对冲基金,Situational Awareness 爆仓清盘。来源:Horizon 8/6 每日速递,原报道 Situational Awareness。
  • Citadel 旗舰基金在收购 AI 股票后大涨 6%。来源:Horizon 8/6 每日速递,原报道 CNBC。
  • 布莱恩·阿瑟,《复杂经济学》“收益递增与经济中的路径依赖”。
  • 纳西姆·塔勒布,《反脆弱》“脆弱推手”概念。