MacTalk
订阅
MacTalk 开通于2012年末,内容起于 Mac 而不止 Mac,内容覆盖了技术、创业、产品和人文思考。文风有趣,又有一点力量。
MacTalk微信公众号二维码
关注该公众号

会员可查看最新的全部文章

^__^ 7 / 31
DeepSeek V4 Flash 正式上线,完美适配 Codex,Agent 能力大幅提升,超过了 V4 Pro 的 Preview 版本。这次 DeepSeek 终于补上了 Responses API。之前的 V4 预览版已支持 OpenAI Chat Completions 和 Anthropic 接口,这次 V4 Flash 直接支持将 DeepSeek 模型接入 Codex。具体安装方式看这里: https://api-docs.deepseek.com/zh-cn/quick_start/agent_integrations/codex 在 Codex 配置中把模型设为“deepseek-v4-flash”,提供方指向 DeepSeek,通信协议设为“responses”即可。Codex CLI、ChatGPT 桌面端和 VS Code 插件可以共用同一份配置,一次设置覆盖三种入口。官方还提供了一键接入脚本。为啥这次这么照顾 Codex 了?因为 Codex 雄起了呗。今天早上看到消息,OpenAI 的 CFO 和董事会主席介绍了 O 记的营收增长情况及与 Anthropic 的竞争态势,称 7 月年化经常性收入规模超过整个第二季度(第二季度业绩表现并不差)。这个收入增长来自哪?主要是 Codex 的突飞猛进,Codex 已经成为海外用户的头部 Agent 工具,Codex 能否理解指令、返回结构化工具调用,并在多轮操作中保持节奏,给知识工作者和工程师带来了巨大的效率提升,在这个节点上,DeepSeek 为 Codex 增加 Responses API,应该是为了扩大海外用户的使用范围和影响力。兼容不只覆盖请求格式。V4 Flash 支持 developer 指令、函数调用、网页搜索和并行工具调用,还接受 Codex 使用的 apply_patch 自定义工具。流式返回采用带序号的语义事件,Codex 可判断响应是在生成内容、调用工具,还是已经完成等等。尤其,这次 V4 Flash 强化了 Agent 能力。它提供 100 万 token 上下文和 38.4 万 token 输出,支持思考与非思考模式。价格为每百万 token 缓存命中输入 0.02 元、未命中输入 1 元、输出 2 元,均低于 V4 Pro。Agent 反复读代码、写补丁、查日志,低成本会直接延长可用工作时间。墨问的 CatReader 后台接的就是 DeepSeek V4 Flash,真的省钱啊。目前,DeepSeek 的 Responses API 仍采用无状态设计,不支持通过 previous_response_id 或 conversation 续接会话,也不支持存储和后台任务。图片、文件输入尚未开放;作为 Responses API 内置工具传入的 MCP、计算机操作和代码解释器会被忽略。部分不支持的参数会被静默忽略,因此接入顺畅不代表所有能力都已生效。 V4 Pro 暂时还不能通过 Responses API 接入,另外,V4 Pro 的正式版我估计得 8 月份了。
^__^ 7 / 31
Claude 这下尴尬了。今天 A 社披露了三起 AI 攻击安全事故,直追 OpenAI,并且,这些攻击早已经发生了。今天 A 社回查了 141,006 次可能接触互联网的网络安全评测,发现三款 Claude 模型未经授权进入了三家真实机构的生产系统。这可不是当下发生的事,最早的事故出现在 4 月份,无声无息,真是让人类嗷嚎了。入侵你,但你毫无感觉。前几天 OpenAI 模型攻入 Hugging Face 的事件引发了轩然大波,Anthropic 启动了大规模的模型测试回溯,从几个月前的日志中找到了这些 Case。我估计其他模型厂商也在做这件事。 Claude 当时设置了一个在第三方环境里完成夺旗的挑战环节。模型被告知身处模拟网络、无法访问互联网,但配置出错了,其实机器是可以联网的,任务又没有明确限定目标范围。于是 Opus 4.7、Mythos 5 和一款内部研究模型把真实系统当成了考题,开始整事儿。在第一起事故中,Opus 4.7 攻入一家与虚构公司同名的真实企业,取得凭据和包含数百行生产数据的数据库访问权。第二起事故是软件供应链攻击:Mythos 5 注册并上传恶意 PyPI 包,公开存在约一小时,被 15 个真实系统运行,并借助一家安全公司的扫描器取得了更多的凭据。第三起事故是,新模型扫描了约 9,000 个目标,攻入一家公司后,发现云账户与挑战无关,于是悻悻离去 这与我之前写过的 OpenAI 安全事故形成了直接对照。OpenAI 模型为了为了完成任务,找到了一个 0 day 漏洞进入 Hugging Face 的生产系统。 Claude 这次更本不需要复杂漏洞,它们只是有了一个联网权限,再利用弱密码、未认证接口、泄漏凭据和 SQL 注入就搞定了这些事。 AI 觉醒了?并么有,人家只是在忠实的完成任务。罪魁祸首是评测框架和环境的失误:环境提供路径,模型提供速度、耐心和超强的行动能力,最后都造成了真实的安全事故。这给很多模型厂商提了醒,未发布的或测试中的模型,其实是没有那么强的安全护栏的,这时候就需要我们做好强安全隔离,默认断网,如果联网,设定好哪些资源是可访问的,界定好范围,如果犯迷糊就停止任务而不是“保证完成任务”。其实我们自己在 Vibe Coding 的时候也是,goal 这种目标模式,要谨慎使用,合理使用。我记得最早 AI 出来,安全圈的朋友后都在担心模型帮着黑产写攻击代码,现在可好了,Agent 自己能干。这就让我们需要注意 Agent 能去哪里、可以做什么、运行多久,以及谁能按下停止键。模型没有恶意,系统仍然会造成伤害。个人和企业都是如此。
^__^ 7 / 28
黄仁勋的第一条推文,到底说啥了?今天我把黄仁勋的账号加入了 CatReader(cat.mowen.cn),因为这老哥居然入驻 x,并发了第一条推文。他贴出了英伟达和二十多家机构联合签署的三页公开信《开放权重与米国 AI 领导力》,含义颇深。黄老板说:“作为我的第一条帖子,我想分享一封英伟达参与签署的信,说明开放模型为何重要。AI 将改变每个行业,赋能每家公司,并由每个国家构建。开放模型能增强安全和网络安全,加速创新与扩散,并支持技术主权。世界既需要前沿闭源模型,也需要前沿开放模型。”开放权重的意思就是,模型权重可以下载、检查、修改,并在自己的基础设施上运行;开源模型的的开放程度各不相同,但基本都是开放权重的。信的第一页讲的是 20 世纪 80 年代的开源软件。老黄认为米国的 AI 领导力不能只看某一个前沿模型,还要看先进能力能否进入工厂、医院、农场、课堂和街边商户的日常工作流,其实和我们的理解差不多,开放权重让企业用合适的成本为每项任务选择合适的模型,也把竞争从模型公司扩展到云、芯片、应用和服务。这是好事啊。第二页开始讨论企业真正关心的控制权。开放模型能在自有环境运行,企业可以保留数据、做定制开发和长期知识积累,同时能减少对单一供应商的依赖。这不也是好事吗?虽然权重发布后难以追回、修改版本难以追踪,但是,安全需要更多研究者参与测试、红队和修补,并建议政策制定者扩大算力和公共训练资源的供给。第三页聊的是政策争议,主张区分模型蒸馏与非法攫取:用一个模型的输出来改进另一个模型,是广泛使用的训练、评估和验证方法;未经授权抽取闭源模型价值,则应由有针对性的法律和商业规则处理等等。算是对最近海内外模型竞争的一个回应吧。老黄和 A 社的角度是截然不同的。闭源服务对算力的使用量是集中的,开放权重则是遍地开花:企业数据中心、私有云、工作站、物联网,甚至家庭用户,都可以部署自己的模型。英伟达一边提供 Nemotron 等开放模型,一边用开箱即用的模型服务器 NIM 把开放模型封装成为可用的 AI 服务;模型选择越多,持续运行的 Agent 越多,对算力和软件的需求就越广。这也是好事啊。这和前几天传播的梁文锋判断有点类似,AI 的利益空间足够大,试图独占会制造更多阻力;开放则可以增加做成 AGI 的概率。模型开源、API 按合理回报定价、不急着争夺 C 端入口,都是外化的战略体现。如同闭源的 iOS 和开源的 Android,大趋势不会因为一个公司逆转。
^__^ 7 / 25
风靡一时的 ChatGPT Atlas 被关停了,留下的是 Agent 浏览器。今天上午收到了 OpenAI 的邮件,说 AI 浏览器 Atlas 将于 8 月 13 日下线,用户需要自行迁移书签、标签页和历史记录。掐指一算,这个产品也没几天活头了。这是 OpenAI 在关停视频类产品 Sora 之后,再次关闭的第二个重量级产品了。这两个产品都有重大的发布节点,都有非常显性的产品功能和大量用户。为什么关掉这种已经有明显用户量的产品呢,无非是聚焦和整合资源,或是产品战略的调整、整合。 Sora 关掉说明 OpenAI 重点不在多模态上了,关掉 AI 浏览器更像是整合资源和产品。它关掉了 Atlas 这个产品外壳,保留并强化的是浏览器能力。多标签页、文件下载、优化导航和账户登录会整合进入 ChatGPT 桌面应用,OpenAI 的邮件显示,Atlas 更像一个完成了验证任务的先遣产品。 OpenAI 没有披露 Atlas 的用户规模、留存率和维护成本,因此“没人用”或“成本太高”都只能算猜测。我的判断是,独立浏览器与 ChatGPT 之间出现了产品重叠:用户真正需要的是让 AI 读网页、跨标签工作、下载文件,并在获得授权后完成操作。至于这些能力装在 Atlas 还是 ChatGPT 里,OpenAI 选择的是后者,也就是内置的 Agent Browser。我是 AI 浏览器的重度用户,自从 Atlas 不咋更新之后我就不用了,还是 Dia 和 Tabbit 用着舒服啊。好在这两个产品都在持续进化,赚不赚钱就不知道了,但真的好用,希望他们赚钱。浏览器是 AI 时代非常重要的基础设施,但对于铁了心要打造 ChatGPT 超级应用的 OpenAI 来说,这个多少有点鸡肋。尤其是 Codex 整合到 ChatGPT 桌面版之后。与其长期维护两个入口,OpenAI 选择把工程资源、权限设计和用户信任集中到 ChatGPT,这是一种更现实的策略吧。这也显示出 OpenAI 最近的一些变化。ChatGPT 正从问答工具变成统一的工作入口,无论是桌面端还是 App,而网页只是它要操作的一种环境,旁边还有文件、代码和各种应用。这种整合当然也是有取舍的,毕竟用户想去访问墨问 Web 版社区的时候,不会打开 ChatGPT;当我想去写作的时候,也不会打开 ChatGPT;当我打开微博推特 Reddit、阅读 blog 和科技网站的时候,我依然会打开 AI 浏览器。 Atlas 的退场,只是意味着 OpenAI 不做这个领域的业务了,他们和对手真正的竞争点在 Agent 上,能否稳定理解网页、跨页面完成任务,并在关键操作前把控制权交还给人等等。今天 Claude Opus 5 也正式发布了,详细发布日志看这里。