24小时热文
大模型竞赛,将再往上抬一个量级。就在刚刚,据《金融时报》报道,字节跳动目前正在训练一款超大规模基础模型,最高可能达到 10 万亿参数。项目仍处于预训练早期,完整训练周期预计需要数月,最终采用多大规模,目前还没有完全确定。(信源链接放在评论区)如果最终接近这一数字,它将成为中国目前已知体量最大的模型。但无论消息是否为真,不断膨胀的模型参数已经是大势所趋。作为参照,月之暗面的 Kimi K3 参数规模约 2.8 万亿,Anthropic 新一代模型 Mythos 5 约 8 万亿。字节的目标已进入全球头部实验室的同一量级。《晚点 LatePost》此前也提到,字节内部在推进一个超过 5 万亿参数的新模型计划。不过参数只是能力的一部分。模型表现还取决于数据、架构、后训练与算力效率。但选择冲击数万亿乃至 10 万亿参数,本身说明字节仍在押注基础模型的规模化上限。过去几年,字节在 AI 上持续重投入。《金融时报》称,Seed 团队约 2000 人,覆盖模型、训练与数据等全链路,同时扩建数据中心、加码火山引擎,并探索自研芯片。产品侧同样具备优势:豆包月活达 3.24 亿,已是国内头部 AI 应用;Seedance 也进入全球领先梯队。依托云、办公与内容生态,字节能将模型快速嵌入真实场景迭代。但在基础大模型层面,字节近一段时间的外部声量相对有限。一个重要原因,可能与 Seed 选择的训练路线有关。过去一年多,Seed 更多依靠自主训练建立能力,而非蒸馏其他领先模型。所谓蒸馏,本质上是让自己的模型学习更强模型已经产生的答案和行为,以较低成本快速获得相近能力。但字节内部则更谨慎对待这种追赶策略。据 The Information 报道,字节跳动创始人张一鸣在上个月的一次员工会议上也表示,字节跳动不会把「蒸馏」当作提升 AI 模型能力的捷径。想做到世界领先,最终还是需要在数据、训练方法和模型能力上形成自己的路线。与此同时,中国大模型的竞争也正在发生变化。过去两年,国内模型最核心的目标之一,是以更低成本、更快速度缩小与全球最强模型之间的差距。如今,当差距逐渐缩小时,真正决定下一阶段竞争的,依旧是能否探索出自己的训练路线,并触碰到此前没人抵达的能力边界。而目前最有成效的策略,可能就是力大飞砖的 Scaling。 资金“追光”,涌入光模块龙头 部分银行房贷利率,降至“2字头” 美债跌幅扩大 证券从业人员,结构新变化:投顾扩容 资金流出宽基ETF 华尔街大行,对中际旭创多头比例增加 多只磷化铟牛股,集体提示风险 黄金,大涨!反弹还是反转?机构最新研判 传闻突袭,铜价拉升!上市公司回应
年费限时8折
所有数据均采集于网络,如有侵权请联系站长删除
粤ICP备18050166号-1