年底决战?字节和 OpenAI 到底在训练什么超大模型?前两天从 Financial Times 上看到消息,字节跳动正在训练一个最多可能达到 10 万亿参数的模型;据知情人士透露,字节的项目尚处于早期预训练阶段,这一过程通常需要三到六个月,之后还要经历微调、安全评估和产品化。10 万亿是可能达到的规模,最终数字仍会随训练方案调整。我个人判断 5 - 10 万亿是可能的。作为参照,月之暗面的 Kimi K3 拥有 2.8 万亿总参数,字节新模型在纸面上接近它的三倍,非常吓人。不过 K3 采用混合专家架构,每个 token 激活约 1040 亿参数,因此总参数不能直接换算成模型能力。把规模做到这个级别,考验的不只是 GPU 集群、综合算力等。数据质量、集群通信、训练稳定性和故障恢复,都需要。字节的优势在于拥有豆包、抖音和 TikTok 等大规模产品,可以持续获得真实反馈,也有能力把模型迅速送到海量用户面前。它最终是否开放权重、推理成本能否压下来,目前都没有确定答案。 OpenAI 同样马不停蹄,他们在训练的模型信息比较确定,一个是 Astra 系列,一个是 Doug。 Astra 是已经对外披露能力的下一代模型家族,OpenAI 称其内部版本在数学和理论计算机科学上取得十项新结果,相关论证随后被整理成人类可读的论文,并给出了形式化证书。 OpenAI 在内部评估后“尚不能排除” Astra 达到了 Critical 级网络安全能力,因此得扩大测试并放慢开发。也就是说,虽然 Astra 还没有被正式判定为首个 Critical 模型,但它已经触发了更严格的隔离、监控和安全措施。在中国开源模型的追赶下,海外报道称 OpenAI 需要通过尽快发布 Astra(GPT 6 级别模型)保持优势。时机至关重要——他们越是拖延,中国的开源模型就会被采用得越多 Doug 则更接近字节正在做的事情。外部消息将 Doug 描述成 OpenAI 迄今规模最大的一次预训练项目,而且它与 GPT-6 并不是同一个模型。OpenAI 尚未正式公布其规模和发布时间。过去两年,OpenAI 通过强化学习和后训练不断挖掘现有的模型底座,能力增长很快,但边际收益也在逐渐变小。 Doug 释放的信号,是它准备重新训练一个更强的基础,再叠加已经成熟的推理与 Agent 训练体系。字节这个事情如果确定,那就证明中国团队能够独立完成世界级超大预训练,并把能力稳定交付给产品,毕竟 Kimi K3 已经突破了;OpenAI 要做的是,证明大规模预训练仍能带来足够大的跃迁,并处理随之而来的安全成本。还有 4 个月,年底的大模型又要天翻地覆了。