MacTalk
订阅
MacTalk 开通于2012年末,内容起于 Mac 而不止 Mac,内容覆盖了技术、创业、产品和人文思考。文风有趣,又有一点力量。
MacTalk微信公众号二维码
关注该公众号

会员可查看最新的全部文章

^__^ 8 / 02
Kimi K3 这次是真的强,早上看到报道,阿里助力他们 2 万颗 GPU,这下可以敞开蹬了。最近我一直挺关注 K3 的,墨问 CatReader 上也很多相关文章和评论。先看一组数字:K3 发布后一周,Kimi 应用全球下载量超过 93 万,美国约 8.6 万,较前一周增长 387%,Mozilla CTO 也把不少日常工作切到了 K3。K3 是一个 2.8 万亿参数的混合专家模型,每个 Token 激活约 1040 亿参数,支持原生多模态和 100 万 Token 上下文。整体评估下来,其综合能力仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但在 Coding、Agent 和知识工作上已经进入全球头部区间,价格也低于同档闭源模型。 arena.ai 的 Coding 榜单上,claude-opus-5-max 第一,kimi-k3-max 第二,非常了不起。 K3 权重发布后,Hugging Face 模型页近月下载量约 56 万,并出现 29 个微调和 27 个量化版本。开发者真的下载、复测和改造一个 1.56TB 左右的模型,这个显然更说明问题。不过,Kimi K3 发布后的第一个周末,月之暗面就暂停了新增订阅。因为请求远超预期,算力不够啊。咋整呢?今天看到 Reuters 转述彭博社的报道,月之暗面通过与阿里的算力合作,获得了一个约包含 2 万颗 Nvidia GPU 的集群,K3 建立在这套基础设施之上,估计预约订阅的同学很快会收到许可。 > 具体芯片构成、合同价格以及训练和推理资源如何分配,目前并未完整公开。应该是个爆料的消息。那么,阿里为什么要帮助一个可能与 Qwen 竞争的模型?我这么理解的,它既是月之暗面的投资人,也是云计算服务商,还拥有自己的旗舰模型。Kimi 做得好,阿里可以获得投资回报和云收入;Qwen 做得好,阿里得到模型价值,这是个自然组合,挺好,关键是,K3 排名第二,这可能是我们最接近 SOTA 的一次。月之暗面以及中国模型依赖 Nvidia,也不是啥坏事,替换从来不是一蹴而就。数万卡集群需要显存、高速互联、集合通信、编译器、算子和故障恢复一起工作,Nvidia 这方面当然有优势了,但国内芯片厂商正在追赶,就像梁文锋所言,只是时间问题。短期看,月之暗面需要阿里的卡;长期看,阿里也需要 Kimi 这样的热门模型持续制造算力需求,把昂贵的集群变成有人付费的服务。逼近,能够大规模运行开放权重模型并提供服务的能力仍集中在少数云厂商手里。 Kimi K3 拿到阿里的 2 万颗 GPU 提醒我们,模型竞争的下半场还要看谁能长期获得算力、谁能稳定服务全球用户。对于普通用户来说,我觉得 K3 可以预约起来了,算力也许马上就到:)
^__^ 7 / 31
DeepSeek V4 Flash 正式上线,完美适配 Codex,Agent 能力大幅提升,超过了 V4 Pro 的 Preview 版本。这次 DeepSeek 终于补上了 Responses API。之前的 V4 预览版已支持 OpenAI Chat Completions 和 Anthropic 接口,这次 V4 Flash 直接支持将 DeepSeek 模型接入 Codex。具体安装方式看这里: https://api-docs.deepseek.com/zh-cn/quick_start/agent_integrations/codex 在 Codex 配置中把模型设为“deepseek-v4-flash”,提供方指向 DeepSeek,通信协议设为“responses”即可。Codex CLI、ChatGPT 桌面端和 VS Code 插件可以共用同一份配置,一次设置覆盖三种入口。官方还提供了一键接入脚本。为啥这次这么照顾 Codex 了?因为 Codex 雄起了呗。今天早上看到消息,OpenAI 的 CFO 和董事会主席介绍了 O 记的营收增长情况及与 Anthropic 的竞争态势,称 7 月年化经常性收入规模超过整个第二季度(第二季度业绩表现并不差)。这个收入增长来自哪?主要是 Codex 的突飞猛进,Codex 已经成为海外用户的头部 Agent 工具,Codex 能否理解指令、返回结构化工具调用,并在多轮操作中保持节奏,给知识工作者和工程师带来了巨大的效率提升,在这个节点上,DeepSeek 为 Codex 增加 Responses API,应该是为了扩大海外用户的使用范围和影响力。兼容不只覆盖请求格式。V4 Flash 支持 developer 指令、函数调用、网页搜索和并行工具调用,还接受 Codex 使用的 apply_patch 自定义工具。流式返回采用带序号的语义事件,Codex 可判断响应是在生成内容、调用工具,还是已经完成等等。尤其,这次 V4 Flash 强化了 Agent 能力。它提供 100 万 token 上下文和 38.4 万 token 输出,支持思考与非思考模式。价格为每百万 token 缓存命中输入 0.02 元、未命中输入 1 元、输出 2 元,均低于 V4 Pro。Agent 反复读代码、写补丁、查日志,低成本会直接延长可用工作时间。墨问的 CatReader 后台接的就是 DeepSeek V4 Flash,真的省钱啊。目前,DeepSeek 的 Responses API 仍采用无状态设计,不支持通过 previous_response_id 或 conversation 续接会话,也不支持存储和后台任务。图片、文件输入尚未开放;作为 Responses API 内置工具传入的 MCP、计算机操作和代码解释器会被忽略。部分不支持的参数会被静默忽略,因此接入顺畅不代表所有能力都已生效。 V4 Pro 暂时还不能通过 Responses API 接入,另外,V4 Pro 的正式版我估计得 8 月份了。
^__^ 7 / 31
Claude 这下尴尬了。今天 A 社披露了三起 AI 攻击安全事故,直追 OpenAI,并且,这些攻击早已经发生了。今天 A 社回查了 141,006 次可能接触互联网的网络安全评测,发现三款 Claude 模型未经授权进入了三家真实机构的生产系统。这可不是当下发生的事,最早的事故出现在 4 月份,无声无息,真是让人类嗷嚎了。入侵你,但你毫无感觉。前几天 OpenAI 模型攻入 Hugging Face 的事件引发了轩然大波,Anthropic 启动了大规模的模型测试回溯,从几个月前的日志中找到了这些 Case。我估计其他模型厂商也在做这件事。 Claude 当时设置了一个在第三方环境里完成夺旗的挑战环节。模型被告知身处模拟网络、无法访问互联网,但配置出错了,其实机器是可以联网的,任务又没有明确限定目标范围。于是 Opus 4.7、Mythos 5 和一款内部研究模型把真实系统当成了考题,开始整事儿。在第一起事故中,Opus 4.7 攻入一家与虚构公司同名的真实企业,取得凭据和包含数百行生产数据的数据库访问权。第二起事故是软件供应链攻击:Mythos 5 注册并上传恶意 PyPI 包,公开存在约一小时,被 15 个真实系统运行,并借助一家安全公司的扫描器取得了更多的凭据。第三起事故是,新模型扫描了约 9,000 个目标,攻入一家公司后,发现云账户与挑战无关,于是悻悻离去 这与我之前写过的 OpenAI 安全事故形成了直接对照。OpenAI 模型为了为了完成任务,找到了一个 0 day 漏洞进入 Hugging Face 的生产系统。 Claude 这次更本不需要复杂漏洞,它们只是有了一个联网权限,再利用弱密码、未认证接口、泄漏凭据和 SQL 注入就搞定了这些事。 AI 觉醒了?并么有,人家只是在忠实的完成任务。罪魁祸首是评测框架和环境的失误:环境提供路径,模型提供速度、耐心和超强的行动能力,最后都造成了真实的安全事故。这给很多模型厂商提了醒,未发布的或测试中的模型,其实是没有那么强的安全护栏的,这时候就需要我们做好强安全隔离,默认断网,如果联网,设定好哪些资源是可访问的,界定好范围,如果犯迷糊就停止任务而不是“保证完成任务”。其实我们自己在 Vibe Coding 的时候也是,goal 这种目标模式,要谨慎使用,合理使用。我记得最早 AI 出来,安全圈的朋友后都在担心模型帮着黑产写攻击代码,现在可好了,Agent 自己能干。这就让我们需要注意 Agent 能去哪里、可以做什么、运行多久,以及谁能按下停止键。模型没有恶意,系统仍然会造成伤害。个人和企业都是如此。
^__^ 7 / 28
黄仁勋的第一条推文,到底说啥了?今天我把黄仁勋的账号加入了 CatReader(cat.mowen.cn),因为这老哥居然入驻 x,并发了第一条推文。他贴出了英伟达和二十多家机构联合签署的三页公开信《开放权重与米国 AI 领导力》,含义颇深。黄老板说:“作为我的第一条帖子,我想分享一封英伟达参与签署的信,说明开放模型为何重要。AI 将改变每个行业,赋能每家公司,并由每个国家构建。开放模型能增强安全和网络安全,加速创新与扩散,并支持技术主权。世界既需要前沿闭源模型,也需要前沿开放模型。”开放权重的意思就是,模型权重可以下载、检查、修改,并在自己的基础设施上运行;开源模型的的开放程度各不相同,但基本都是开放权重的。信的第一页讲的是 20 世纪 80 年代的开源软件。老黄认为米国的 AI 领导力不能只看某一个前沿模型,还要看先进能力能否进入工厂、医院、农场、课堂和街边商户的日常工作流,其实和我们的理解差不多,开放权重让企业用合适的成本为每项任务选择合适的模型,也把竞争从模型公司扩展到云、芯片、应用和服务。这是好事啊。第二页开始讨论企业真正关心的控制权。开放模型能在自有环境运行,企业可以保留数据、做定制开发和长期知识积累,同时能减少对单一供应商的依赖。这不也是好事吗?虽然权重发布后难以追回、修改版本难以追踪,但是,安全需要更多研究者参与测试、红队和修补,并建议政策制定者扩大算力和公共训练资源的供给。第三页聊的是政策争议,主张区分模型蒸馏与非法攫取:用一个模型的输出来改进另一个模型,是广泛使用的训练、评估和验证方法;未经授权抽取闭源模型价值,则应由有针对性的法律和商业规则处理等等。算是对最近海内外模型竞争的一个回应吧。老黄和 A 社的角度是截然不同的。闭源服务对算力的使用量是集中的,开放权重则是遍地开花:企业数据中心、私有云、工作站、物联网,甚至家庭用户,都可以部署自己的模型。英伟达一边提供 Nemotron 等开放模型,一边用开箱即用的模型服务器 NIM 把开放模型封装成为可用的 AI 服务;模型选择越多,持续运行的 Agent 越多,对算力和软件的需求就越广。这也是好事啊。这和前几天传播的梁文锋判断有点类似,AI 的利益空间足够大,试图独占会制造更多阻力;开放则可以增加做成 AGI 的概率。模型开源、API 按合理回报定价、不急着争夺 C 端入口,都是外化的战略体现。如同闭源的 iOS 和开源的 Android,大趋势不会因为一个公司逆转。