MacTalk
订阅
MacTalk 开通于2012年末,内容起于 Mac 而不止 Mac,内容覆盖了技术、创业、产品和人文思考。文风有趣,又有一点力量。
MacTalk微信公众号二维码
关注该公众号

会员可查看最新的全部文章

^__^ 9 / 02
最近中国开源模型真是有点杀疯了的感觉。今天看到千问刚发布的后训练模型 Qwen3.8-Max-0902 登上了 Code Arena 榜首,我记忆中这是第一次。 Qwen3.8-Max-0902 2.4T 参数,1M 上下文令牌,为真实世界的复杂性而生。在编码与协作方面进一步后训练之后,Qwen3.8-Max-0902 直接站到了世界前沿。竞争非常激烈,仅中国基模有千问、Kimi、DeepSeek、腾讯混元和 GLM 站在第一梯队。Qwen Kimi 等我之前都写过,混元 Hy 没聊过,因为之前它在 Coding Agent 领域确实差点事,这次混元后来居上了。过去两年,开发者讨论 Coding 模型时,第一排通常是 Claude、GPT,以及后来追上来的 DeepSeek、Kimi 和 GLM。腾讯场景很多,混元却很少成为这类讨论的主角,直到 Hy4 preview 发布。我这周订了腾讯云 Token Plan,在 DSH 里跑 Hy4 preview,做了两个功能特性,可以说又快又好。 Hy4 preview 是一款 770B 总参数、每个 Token 激活 49B 参数的 MoE 模型,上下文长度达到 1M。现在的重点都是长程软件工程、文档型办公和科学研究上,Hy4 全方位提升了 Coding Agent 理解任务、制定计划、调试、验证,以及前端界面的视觉和交互质量。腾讯公布了一组内部盲测:163 名内部专家评估了 203 个真实工程任务,Hy4 preview 平均得分 2.99,略高于 GLM 5.3 的 2.92 和 Kimi K3 的 2.94。与两者相比,Hy4 的胜率分别为 46.8% 和 51.2%。内部测试当参考就好,能不能打,一个是去看 https://arena.ai,另一个就是上手做个功能,是骡子是马,拉出来溜溜。看技术报告,Hy4 preview 的 Agent 协作能力似乎很强,同时管理多个 Codex 会话,根据实验结果调整研究方向,协调它们优化一个小模型的后训练任务,Hy4 作为研究负责人,在 8 项评测上都超过了让 Codex 独立探索的结果。这个我后续准备在 DSH 里用用,正好集成了 Codex Agent,如果可行,倒是个突破。我最近试了好几个 Agent 协作的产品,比如引入 Codex、K3(kimi code)和 GLM5.3(CC),让他们其中之一牵头带着另外两个 Agent 一起干活,效果都很一般,还很耗费 Token。比如 raft.build、Codeg 等,如果 Hy4 在这方面能让其他 Agent 干得又快又好又省钱,那我还是很期待的。腾讯的另一个优势来自产品协同。Hy4 可以和 WorkBuddy 等共同训练和评测,也已进入元宝、腾讯云和 OpenRouter。大厂这个优势明显,真实任务与产品反馈形成的循环很重要,内部循环效率也更高。飞轮一旦形成,会越跑越快。
^__^ 9 / 02
A 社有点慌,向你投出了 Fable 5.1 和 Mythos 5.1 以前 Anthropic 发模型,还挺扭捏的,跟古代新媳妇上轿似的:新能力先给小范围测试,公告写得像论文,您要是普通付费用户,不好意,等着。这次痛快了,Claude Fable 5.1 发布当天不仅自己的产品可用,而且已经在所有平台上线,AWS、Google Cloud、Azure 一个不落,API 直接用,还降了价。过去半年,国内开源模型突飞猛进,DeepSeek、GLM、Kimi、混元一路猛追,榜单差距以月为单位缩小,现在 Kimi 的 K3 和 Qwen 3.8 Max 在编程领域是和 Opus 5 掰手腕的级别 。闭源阵营再端架子,市场也不会等人啊。A 社这次直接把压箱底的东西摆上了货架。澄清一下,Fable 5.1 和 Mythos 5.1 属于同一代模型,底层能力相近,主要区别在于安全防护和开放策略。Fable 5.1 面向所有用户全面开放,今天就能用,安全防护足足的;Mythos 5.1 只通过可信访问计划提供,主要服务网络安全和生命科学领域的专业团队。 A 社给出的定位是“最先进的编程与知识工作模型”。Agent 编程基准 Terminal-Bench 4.0 拿到 55.8%(Mythos 5.1 为 60.9%),上一代 Fable 5 是 42.0%;科研 Agent 基准 Terminal-Bench-Science 上,52.6% 对 24.7%,直接翻倍。Millennium 的测试里,它找到了内部系统一个罕见崩溃的根因,工程师团队和其他模型数年都没能解释。科研部分最有想象力。Mythos 5.1 设计的蛋白质结合分子,在三个靶点上亲和力比公开竞赛最佳投稿高 10 倍,命中率接近 50%,行业典型水平是 10–15%。Fable 5.1 用 NASA 麦哲伦号 30 多年前的雷达数据,给金星三分之一的表面画出了新高程地图,细节从 10–20 公里级提升到 2–3 公里级。它还把七个开源深度学习模型的推理提速了 2.5 倍,这类活儿通常要性能工程师团队干好几周。在咄咄逼人的竞争面前,A 社的模型价格也算是勉强让了步,命中缓存的 token 降价 75%,至每百万 token 0.25 美元;典型工作负载成本比 Fable 5 低了约 25%,Agent 任务最高省 45%。输入输出价格不变。企业端也有两动作: 1、新的企业前沿防护体系(EFS)把数据存在客户自己的云基础设施里,实现等同零数据留存的隐私;2、网络安全防护误报减少 60%,现在可以用 Fable 5.1 发现软件漏洞,但不能用它开发漏洞利用工具。另外,Anthropic 还加了反蒸馏机制,堵上了通过公开记录思维链蒸馏的手法——这条针对谁,不言自明。是的,窗口期在缩短,无人敢再藏拙,魔盒打开就关不上了。
^__^ 8 / 29
OpenAI 悍然宣布断供 Cursor 上午翻看 CatReader 时看到一条消息:OpenAI 宣布终止与 Cursor 的合作,因为啥呢?Cursor 被 SpaceX 收购了嘛,不知道是马斯克和奥特曼一直以来的恩怨还是其他安全考虑,咔就断了。这多少有点黑色幽默。按照时间表,Cursor 对 OpenAI 模型的直接访问将在 11 月 12 日结束。OpenAI 把解约归结为“信任问题”,表示无法确信 SpaceX 会依照条款使用其技术,就这么回事。额度充值教父 Tibo 感觉多少有些不好意思,补充了迁移路径,说: - 我们将继续允许使用您自己的 OpenAI API 密钥,并且同样会继续通过我们的 IDE 扩展为 Cursor 提供访问。 - 我们将继续与最广泛的工具和框架合作,其中一些是开源的,但也有许多闭源的。意思是,用户以后可以在 Cursor 中使用自己的 OpenAI API Key ,也可安装 OpenAI 的 IDE 扩展。但没法买了 Cursor 额度直接用 GPT 了,这也是个大损失啊,你得买两份 之前有读者给我评论,说难道不知道 Cursor 的额度里包含着各种顶级模型的访问吗?现在没了。A 社会不会跟进,不好说。模型公司现在身份可多了,啥都想要。它们一边做基础模型,希望能力进入更多工具;一边做 Codex 这类产品,与下游争夺开发者。当合作伙伴被竞争对手收购,模型接口就成了渠道、安全和商业控制权的一部分。今年海外模型公司的动作很分裂。能力弱时,大家欢迎生态,希望尽快进入下游的工具链里;能力变强后,安全、合规和竞争关系,开始来劲了。等对手——比如国内开源模型和 Grok——追上来,又强调开放和开发者选择。今天欢迎所有工具,明天工具站到对手阵营,欢迎词就可能变成终止合作通知,变脸之迅捷,无与伦比。所以呢,开发者也得长点心眼,问题不在于今天要从 GPT 换到哪个模型,咱得保留替换能力,重要工作流要有清晰的数据边界,也要减少对专有接口的依赖,自己多备几家模型才是正道,能够做到迁移技能、上下文和自动化流程,就更好了。我想,这也是开源模型必须承担的责任,能力越来越强了,同时可以为行业保留一条不会被单家公司关闭的通道。开放协议、可替换模型和本地部署能力,共同构成开发者面对商业世界冲击的盾牌。 OpenAI 与 Cursor 分手,谁损失,还不是普通开发者吗。顶级模型公司可以今天结盟、明天解约。开发者只有代码、数据、工作流,以及随时换个车继续蹬的能力,也得有很多条路才行。好在国内开源模型越来越强,我们用顶级 Agent 能力,也越来越不需要海外模型了。