MacTalk
订阅
MacTalk 开通于2012年末,内容起于 Mac 而不止 Mac,内容覆盖了技术、创业、产品和人文思考。文风有趣,又有一点力量。
MacTalk微信公众号二维码
关注该公众号

会员可查看最新的全部文章

^__^ 8 / 07
最近用了蚂蚁集团的一个开源 Agent 协作工具,我的 Agents 有救了现在我用的 Agent 工具越来越多了,比如 Codex、Kimi Code、CC、OpenClaw、Qoder、MiniMax Hub 等等,这些工具对应了很多模型,比如 GPT 、K3、GLM 5.2、Qwen 3.8、H3 等等,它们会在不同场景下为我解决问题,完成任务。比如调研、编程、审校、做音视频等等。有时候我想,如果有个 Agent 协同平台把这些都接进去,那我不是可以更高效的使用这些工具,也许还能把他们拉到群里一起协作呢。想到就有人做到,我最近就接触了一个,是蚂蚁集团开源的一套多 Agent 协作基础设施,叫做 Avernet,我部署到了 MacMini 上,接入了自己的龙虾,又用其他模型做了几个角色,一起玩,还挺有意思的。安装并不复杂,先克隆仓库: git clone https://github.com/inclusionAI/Avernet.git cd Avernet 然后运行脚本: ./scripts/singlebox.sh install-tools ./scripts/singlebox.sh 该命令会启动一套本地 Avernet 环境,包括:Avernet 进程、前端工作台、5 个本地测试 bot,我有根据提示把自己的 OpenClaw 起了个名叫龙虾,加进去,系统就可以玩起来了。用了几天,感觉这个 Avernet 的核心应用场景是为个人、企业或组织搭建一个“多 Agent 协作网络”。它自己并不是某个具体业务 Agent,而是连接多个 Agent,并处理任务协作与基础治理的基础设施。用通俗的话说,它有点像给 Agent 建了一张组织网络:不同团队开发的 Agent、已有 Bot 平台和本地运行时等等,都可以接入这张网络,在里面注册身份、发现能力、建立连接、接收任务和返回结果。Avernet 自己不负责替每个 Agent 思考,它主要处理协作层的问题,让原本分散在不同系统里的能力有机会共同完成一件复杂任务。比如多 Agent 协同,让研究、规划、执行、审核等不同 Agent 根据任务动态建立协作关系,而不是被预先固定在一条工作流里。前提是使用 Agent 擅长的能力。更具体一点就是拉个群把 Agent 搞进来,人分配任务,让 Agent 协作完成。为啥关注这个项目,因为截至 7 月底,Avernet 相关能力已在蚂蚁内部覆盖 12 个业务板块,活跃计算资源超过 2 万核,系统 SLA 为 99.5%,纳入统计的 Agent 任务完成率超过 90%。社区版当前重点开放的是 Agent 的发现、连接和动态协作;大规模连接、审计、故障恢复、集群运维和长期记忆,评测和持续优化等生产级能力,目前还没有在社区版本里体现。非常期待他们后续的迭代版本。
^__^ 8 / 02
Kimi K3 这次是真的强,早上看到报道,阿里助力他们 2 万颗 GPU,这下可以敞开蹬了。最近我一直挺关注 K3 的,墨问 CatReader 上也很多相关文章和评论。先看一组数字:K3 发布后一周,Kimi 应用全球下载量超过 93 万,美国约 8.6 万,较前一周增长 387%,Mozilla CTO 也把不少日常工作切到了 K3。K3 是一个 2.8 万亿参数的混合专家模型,每个 Token 激活约 1040 亿参数,支持原生多模态和 100 万 Token 上下文。整体评估下来,其综合能力仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在 Coding、Agent 和知识工作上已经进入全球头部区间,价格也低于同档闭源模型。 arena.ai 的 Coding 榜单上,claude-opus-5-max 第一,kimi-k3-max 第二,非常了不起。 K3 权重发布后,Hugging Face 模型页近月下载量约 56 万,并出现 29 个微调和 27 个量化版本。开发者真的下载、复测和改造一个 1.56TB 左右的模型,这个显然更说明问题。不过,Kimi K3 发布后的第一个周末,月之暗面就暂停了新增订阅。因为请求远超预期,算力不够啊。咋整呢?今天看到 Reuters 转述彭博社的报道,月之暗面通过与阿里的算力合作,获得了一个约包含 2 万颗 Nvidia GPU 的集群,K3 建立在这套基础设施之上,估计预约订阅的同学很快会收到许可。 > 具体芯片构成、合同价格以及训练和推理资源如何分配,目前并未完整公开。应该是个爆料的消息。那么,阿里为什么要帮助一个可能与 Qwen 竞争的模型?我这么理解的,它既是月之暗面的投资人,也是云计算服务商,还拥有自己的旗舰模型。Kimi 做得好,阿里可以获得投资回报和云收入;Qwen 做得好,阿里得到模型价值,这是个自然组合,挺好,关键是,K3 排名第二,这可能是我们最接近 SOTA 的一次。月之暗面以及中国模型依赖 Nvidia,也不是啥坏事,替换从来不是一蹴而就。数万卡集群需要显存、高速互联、集合通信、编译器、算子和故障恢复一起工作,Nvidia 这方面当然有优势了,但国内芯片厂商正在追赶,就像梁文锋所言,只是时间问题。短期看,月之暗面需要阿里的卡;长期看,阿里也需要 Kimi 这样的热门模型持续制造算力需求,把昂贵的集群变成有人付费的服务。逼近,能够大规模运行开放权重模型并提供服务的能力仍集中在少数云厂商手里。 Kimi K3 拿到阿里的 2 万颗 GPU 提醒我们,模型竞争的下半场还要看谁能长期获得算力、谁能稳定服务全球用户。对于普通用户来说,我觉得 K3 可以预约起来了,算力也许马上就到:)
^__^ 7 / 31
DeepSeek V4 Flash 正式上线,完美适配 Codex,Agent 能力大幅提升,超过了 V4 Pro 的 Preview 版本。这次 DeepSeek 终于补上了 Responses API。之前的 V4 预览版已支持 OpenAI Chat Completions 和 Anthropic 接口,这次 V4 Flash 直接支持将 DeepSeek 模型接入 Codex。具体安装方式看这里: https://api-docs.deepseek.com/zh-cn/quick_start/agent_integrations/codex 在 Codex 配置中把模型设为“deepseek-v4-flash”,提供方指向 DeepSeek,通信协议设为“responses”即可。Codex CLI、ChatGPT 桌面端和 VS Code 插件可以共用同一份配置,一次设置覆盖三种入口。官方还提供了一键接入脚本。为啥这次这么照顾 Codex 了?因为 Codex 雄起了呗。今天早上看到消息,OpenAI 的 CFO 和董事会主席介绍了 O 记的营收增长情况及与 Anthropic 的竞争态势,称 7 月年化经常性收入规模超过整个第二季度(第二季度业绩表现并不差)。这个收入增长来自哪?主要是 Codex 的突飞猛进,Codex 已经成为海外用户的头部 Agent 工具,Codex 能否理解指令、返回结构化工具调用,并在多轮操作中保持节奏,给知识工作者和工程师带来了巨大的效率提升,在这个节点上,DeepSeek 为 Codex 增加 Responses API,应该是为了扩大海外用户的使用范围和影响力。兼容不只覆盖请求格式。V4 Flash 支持 developer 指令、函数调用、网页搜索和并行工具调用,还接受 Codex 使用的 apply_patch 自定义工具。流式返回采用带序号的语义事件,Codex 可判断响应是在生成内容、调用工具,还是已经完成等等。尤其,这次 V4 Flash 强化了 Agent 能力。它提供 100 万 token 上下文和 38.4 万 token 输出,支持思考与非思考模式。价格为每百万 token 缓存命中输入 0.02 元、未命中输入 1 元、输出 2 元,均低于 V4 Pro。Agent 反复读代码、写补丁、查日志,低成本会直接延长可用工作时间。墨问的 CatReader 后台接的就是 DeepSeek V4 Flash,真的省钱啊。目前,DeepSeek 的 Responses API 仍采用无状态设计,不支持通过 previous_response_id 或 conversation 续接会话,也不支持存储和后台任务。图片、文件输入尚未开放;作为 Responses API 内置工具传入的 MCP、计算机操作和代码解释器会被忽略。部分不支持的参数会被静默忽略,因此接入顺畅不代表所有能力都已生效。 V4 Pro 暂时还不能通过 Responses API 接入,另外,V4 Pro 的正式版我估计得 8 月份了。