MacTalk
订阅
MacTalk 开通于2012年末,内容起于 Mac 而不止 Mac,内容覆盖了技术、创业、产品和人文思考。文风有趣,又有一点力量。
MacTalk微信公众号二维码
关注该公众号

会员可查看最新的全部文章

^__^ 8 / 12
年底决战?字节和 OpenAI 到底在训练什么超大模型?前两天从 Financial Times 上看到消息,字节跳动正在训练一个最多可能达到 10 万亿参数的模型;据知情人士透露,字节的项目尚处于早期预训练阶段,这一过程通常需要三到六个月,之后还要经历微调、安全评估和产品化。10 万亿是可能达到的规模,最终数字仍会随训练方案调整。我个人判断 5 - 10 万亿是可能的。作为参照,月之暗面的 Kimi K3 拥有 2.8 万亿总参数,字节新模型在纸面上接近它的三倍,非常吓人。不过 K3 采用混合专家架构,每个 token 激活约 1040 亿参数,因此总参数不能直接换算成模型能力。把规模做到这个级别,考验的不只是 GPU 集群、综合算力等。数据质量、集群通信、训练稳定性和故障恢复,都需要。字节的优势在于拥有豆包、抖音和 TikTok 等大规模产品,可以持续获得真实反馈,也有能力把模型迅速送到海量用户面前。它最终是否开放权重、推理成本能否压下来,目前都没有确定答案。 OpenAI 同样马不停蹄,他们在训练的模型信息比较确定,一个是 Astra 系列,一个是 Doug。 Astra 是已经对外披露能力的下一代模型家族,OpenAI 称其内部版本在数学和理论计算机科学上取得十项新结果,相关论证随后被整理成人类可读的论文,并给出了形式化证书。 OpenAI 在内部评估后“尚不能排除” Astra 达到了 Critical 级网络安全能力,因此得扩大测试并放慢开发。也就是说,虽然 Astra 还没有被正式判定为首个 Critical 模型,但它已经触发了更严格的隔离、监控和安全措施。在中国开源模型的追赶下,海外报道称 OpenAI 需要通过尽快发布 Astra(GPT 6 级别模型)保持优势。时机至关重要——他们越是拖延,中国的开源模型就会被采用得越多 Doug 则更接近字节正在做的事情。外部消息将 Doug 描述成 OpenAI 迄今规模最大的一次预训练项目,而且它与 GPT-6 并不是同一个模型。OpenAI 尚未正式公布其规模和发布时间。过去两年,OpenAI 通过强化学习和后训练不断挖掘现有的模型底座,能力增长很快,但边际收益也在逐渐变小。 Doug 释放的信号,是它准备重新训练一个更强的基础,再叠加已经成熟的推理与 Agent 训练体系。字节这个事情如果确定,那就证明中国团队能够独立完成世界级超大预训练,并把能力稳定交付给产品,毕竟 Kimi K3 已经突破了;OpenAI 要做的是,证明大规模预训练仍能带来足够大的跃迁,并处理随之而来的安全成本。还有 4 个月,年底的大模型又要天翻地覆了。
^__^ 8 / 07
最近用了蚂蚁集团的一个开源 Agent 协作工具,我的 Agents 有救了现在我用的 Agent 工具越来越多了,比如 Codex、Kimi Code、CC、OpenClaw、Qoder、MiniMax Hub 等等,这些工具对应了很多模型,比如 GPT 、K3、GLM 5.2、Qwen 3.8、H3 等等,它们会在不同场景下为我解决问题,完成任务。比如调研、编程、审校、做音视频等等。有时候我想,如果有个 Agent 协同平台把这些都接进去,那我不是可以更高效的使用这些工具,也许还能把他们拉到群里一起协作呢。想到就有人做到,我最近就接触了一个,是蚂蚁集团开源的一套多 Agent 协作基础设施,叫做 Avernet,我部署到了 MacMini 上,接入了自己的龙虾,又用其他模型做了几个角色,一起玩,还挺有意思的。安装并不复杂,先克隆仓库: git clone https://github.com/inclusionAI/Avernet.git cd Avernet 然后运行脚本: ./scripts/singlebox.sh install-tools ./scripts/singlebox.sh 该命令会启动一套本地 Avernet 环境,包括:Avernet 进程、前端工作台、5 个本地测试 bot,我有根据提示把自己的 OpenClaw 起了个名叫龙虾,加进去,系统就可以玩起来了。用了几天,感觉这个 Avernet 的核心应用场景是为个人、企业或组织搭建一个“多 Agent 协作网络”。它自己并不是某个具体业务 Agent,而是连接多个 Agent,并处理任务协作与基础治理的基础设施。用通俗的话说,它有点像给 Agent 建了一张组织网络:不同团队开发的 Agent、已有 Bot 平台和本地运行时等等,都可以接入这张网络,在里面注册身份、发现能力、建立连接、接收任务和返回结果。Avernet 自己不负责替每个 Agent 思考,它主要处理协作层的问题,让原本分散在不同系统里的能力有机会共同完成一件复杂任务。比如多 Agent 协同,让研究、规划、执行、审核等不同 Agent 根据任务动态建立协作关系,而不是被预先固定在一条工作流里。前提是使用 Agent 擅长的能力。更具体一点就是拉个群把 Agent 搞进来,人分配任务,让 Agent 协作完成。为啥关注这个项目,因为截至 7 月底,Avernet 相关能力已在蚂蚁内部覆盖 12 个业务板块,活跃计算资源超过 2 万核,系统 SLA 为 99.5%,纳入统计的 Agent 任务完成率超过 90%。社区版当前重点开放的是 Agent 的发现、连接和动态协作;大规模连接、审计、故障恢复、集群运维和长期记忆,评测和持续优化等生产级能力,目前还没有在社区版本里体现。非常期待他们后续的迭代版本。