8 月 7 日,三条关于中国大模型的消息同时浮出水面。字节跳动正在训练一个约 8.4 万亿参数的新模型,规模约为月之暗面 Kimi K3 的三倍(来源:Financial Times)。DeepSeek 重启融资,投前估值 5000 亿元人民币(来源:36kr 快讯)。月之暗面在同一天被曝出已将公司实体从有限责任改制为股份公司,这是赴港 IPO 的第一步(来源:Financial Times)。
同一天,DeepSeek 发布了 V4 Flash 模型。在双 RTX Pro 6000 上实现了约 8000 tokens/s 的预填充速度和约 250 tokens/s 的生成速度,每天运行成本不到 5 美元(来源:Hacker News 社区讨论)。
一边是参数膨胀到 8.4 万亿,一边是成本压缩到每天 5 美元。中国大模型的资本叙事,正在同时走向两个方向。
回过头来看,这种分裂不是偶然的。它反映了一个行业从「野蛮生长」进入「资本博弈」阶段的典型特征:有人赌规模,有人赌效率,有人赌流动性。
钱从哪来:三条路
把三家公司摆在一起,资本的路径差异比参数的差异更值得看。
字节跳动用的是自有现金流。作为 TikTok 和抖音的母公司,字节 2025 年营收超过 1500 亿美元(来源:Bloomberg),训练 8.4 万亿参数模型的 GPU 集群成本,对它来说不是生存问题,是战略选择。字节不是在融资,是在花钱。
月之暗面走的是 IPO 路径。估值 180 亿美元,但商业化收入远未覆盖训练成本。改制为股份公司的动作,本质是向监管层递交合规承诺,换取港交所的入场券。这条路的终点不是技术突破,是公开市场的流动性。
DeepSeek 的路径最特殊。5000 亿元人民币的投前估值,约合 700 亿美元,接近全球一线 AI 公司的估值水平。但 DeepSeek 的策略不是砸钱堆参数,是用工程效率把成本压到极限。V4 Flash 的策略是:不是做最大的模型,是做性价比最高的模型。
三条路指向同一个问题:钱投进去了,回报从哪来。这是资本运行的底层之道:没有回报的投入不是投资,是消耗。大模型的资本投入也逃不开这个铁律。
参数膨胀的边际收益
Kimi K3 有 2.8 万亿参数,Qwen 3.8-Max 有 2.4 万亿。字节的新模型如果达到 8.4 万亿,将成为全球最大的非美国模型。但参数规模和模型能力之间的关系,不是线性的。
Scaling Law(规模定律)的核心发现是:模型能力随着参数量、数据量和计算量的增长而提升,但提升的幅度在递减。从 2 万亿到 8 万亿参数,需要的算力是四倍以上(训练不是线性的,还有通信开销和优化难度),但模型在大多数基准测试上的提升可能只有几个百分点。
说到底,参数膨胀不是目的,是手段。但对于前沿能力(长链推理、多模态融合、复杂工具调用),更大的参数量确实打开新的能力空间。但「更大 = 更好」的叙事,正在模糊一个关键区别:能力提升是一回事,商业回报是另一回事。
用《资本论》的框架看,大模型训练是典型的资本有机构成提高的过程。不变资本(GPU 集群、数据中心、电力)在总投入中的占比越来越高,可变资本(研究员的工资)的占比越来越低。
马克思在分析机器和大工业时指出,机器的使用界限在于:机器的价值必须低于它所替代的劳动力的价值。资本不是为了使用机器而使用机器,是为了削减有酬劳动。
把这套逻辑放到大模型上:训练 8.4 万亿参数模型的投入,必须通过模型商业化后节省的人力成本来回收。如果模型带来的效率提升无法覆盖训练成本,这笔资本投入在财务上就是无效的。
但这里需要承认解释力的边界。马克思分析的是 19 世纪英国的棉纺织厂,产品是实物商品,边际成本不为零。大模型训练完之后,推理的边际成本趋近于零(尤其是像 DeepSeek V4 Flash 这样优化过的模型),这意味着利润率下降的规律在数字商品上可能表现不同。模型可以同时被千万人使用,不消耗额外的「原材料」。固定资本的使用强度,比工厂时代的机器高得多。
风险优于安全
《爆裂》里讲了一个故事。朱莉娅·胡想做一个睡眠监测手环,需要 500 万美元才能进入苹果零售店。她没有这笔钱,但 PCH 国际的凯西给了她更好的东西:不是资金,是供应链的使用权。结论是:小型机构在复杂时代反而有优势,因为它们不需要囤积资源,可以在需要时才调用。
说白了,同样是花钱,怎么花决定了你是恐龙还是青蛙。这个原则在大模型领域表现为两种策略的分野。字节走的是规模路线:囤积 GPU,自建数据中心,用资本密度换取技术确定性。这是大公司的本能,也是《爆裂》里那些被颠覆的恐龙的做法。DeepSeek 走的是效率路线:不囤最多的卡,用工程优化把每张卡的效率榨到极限。V4 Flash 在双卡上跑出 8000 tokens/s 的预填充速度,不是因为它有最多的算力,是因为它把 MoE(混合专家)架构的稀疏激活做到了极致。一个是恐龙的路线,一个是青蛙的路线。
但这个类比也有边界。伊藤穰一的原则源于互联网和软件行业,那里资本门槛低,试错成本小。大模型训练不一样,一次训练动辄需要数千张 H100,硬件投入接近重工业。在这个语境下,「风险优于安全」不是说不需要资本,是说资本的用法不同:不是囤积,是精准投放。
什么信号出现说明判断错了
判断一:参数规模竞赛在 2026 年底前见顶。
基准情景:各家在 2026 年 Q4 前后推出万亿级模型,但基准测试的提升趋于平坦,行业开始转向推理效率和 Agent 能力的竞争。触发条件:GPT-5 级模型的 API 调用量增速超过训练成本增速。
上行情景:万亿级模型在复杂推理任务上出现质变(如自主完成端到端科研任务),参数竞赛加速。触发条件:某家公司的模型在 ARC-AGI 或类似基准上突破 80%。
下行情景:商业化收入持续低于训练成本,资本退出,参数竞赛戛然而止。触发条件:两家以上头部公司缩减训练预算或裁员。
判断二:DeepSeek 的低成本路线比字节的参数路线更具可持续性。
基准情景:DeepSeek 以工程效率优势占据 API 市场主流,字节在自有生态(抖音、TikTok)内消化模型成本。两条路并行不悖。
上行情景:DeepSeek 开源策略吸引全球开发者生态,形成类似 Linux 的护城河。触发条件:基于 DeepSeek 的衍生模型在 Hugging Face 下载量进入前十。
下行情景:DeepSeek 因算力受限无法迭代下一代模型,低成本路线触及天花板。触发条件:V5 训练因 GPU 不足延迟超过 6 个月。
参考资料
- 字节跳动训练 8.4 万亿参数模型: Financial Times, Horizon item-77, 8 月 7 日
- DeepSeek 重启融资投前估值 5000 亿元: 36kr 快讯, 8 月 8 日
- 月之暗面改制赴港 IPO 估值 180 亿美元: Financial Times, Horizon item-68, 8 月 7 日
- DeepSeek V4 Flash 0731 发布: Hacker News / arcprize.org, Horizon item-22, 8 月 7 日
- Kimi K3 开源模型 2.8 万亿参数: Hugging Face moonshotai/Kimi-K3
- Qwen 3.8-Max 2.4 万亿参数: 知乎 / 晚点 LatePost
- 《资本论》第十三章「机器和大工业」: 资本论 resources/029-第十三章_机器和大工业.md
- 《爆裂》第四章「风险优于安全」: 爆裂 resources/3-4_风险优于安全.md