MacTalk
订阅
MacTalk 开通于2012年末,内容起于 Mac 而不止 Mac,内容覆盖了技术、创业、产品和人文思考。文风有趣,又有一点力量。
MacTalk微信公众号二维码
关注该公众号

会员可查看最新的全部文章

^__^ 9 / 06
终于,Windows 开始正面挑战 Mac 的 “Agent 电脑” 定位了这一两年苹果的 Mac 电脑无论是 MacBook 还是 Mac mini 都卖得相当火爆,前者适合 AI 开发,后者逐渐发展成 Agent 服务器。以至于苹果虽然 AI 没做出啥来,股价一直呼呼涨。这种好事能让苹果一家独大吗?不太可能。 9 月 3 日,英伟达确认,搭载 RTX Spark 芯片的新一代 Windows 电脑将于 10 月上市。联想公布了相关笔记本机型,宏碁展示了紧凑桌面概念机。Grace CPU、Blackwell GPU,加上 128GB 统一内存,就是把 PC 打造成可以长期在线的 Agent 容器,还能运行本地模型。这让 Mac 多了一个值得认真对待的对手。苹果在 8 月发布新 Mac mini 时,已经把全天候在线的 Agent 计算写进了产品定位。小体积、能效和统一内存,能够让桌边常驻的机器,成为一台 Agent 服务器。统一内存是什么意思?其实就是 CPU 和 GPU 共享内存池,本地模型有机会获得更大的运行空间。不过,128GB 还要分给系统、应用和上下文,装得下也未必跑得快,估计未来会更大。总之越大越好。 Windows 之前就有 AMD 的统一内存方案,这次是英伟达和微软把芯片、系统与 Agent 运行能力放一块考虑的,包括扩大 GPU 可用内存、优化功耗管理,以及为 Agent 提供操作系统层面的身份和隔离机制等等。机器性能咋样,等发布了我还真想看看。比如让两台电脑跑相同模型、相同量化精度和相同任务,再把整机功耗限制在相近水平。连续运行一周,记录任务完成率、耗电量、噪声,以及需要人工接手的次数。断网之后能否恢复,重启之后是不是正常等等……估计 10 月肯定有数码博主这么干,我们等着看就行了。好的话还真想来一台。 Agent 时代来了,不光是 Windows 来劲,在服务器端躺赢多年的 Linux 也开始跑到 PC 端抢饭吃了。你要问我最近最火的 Agent 玩法,还真不是在 Mac 上,而是在 Omarchy 上。 Omarchy 是 Ruby on Rails 之父 DHH 在 2025 年 3 月开源的一套 Linux 桌面方案:它以出了名难伺候的 Arch Linux 为底座,配上 Hyprland 平铺式窗口管理器,把 DHH 自己打磨了一年的整套配置打包成一条命令就能装好的系统,上个月发布的 4.0 "Quattro" 是迄今最大的版本,用 Quickshell 重构了桌面外壳并内置 AI Coding Agent,我都想试试了。对了,上周我基于 K3 和 Qwen 3.8 Max 做了一款极简 Mac 菜单栏图标管理工具,叫 CatBar,有需求的可以试试,完全免费无广。 极简 Mac 菜单栏图标管理工具
^__^ 9 / 02
最近中国开源模型真是有点杀疯了的感觉。今天看到千问刚发布的后训练模型 Qwen3.8-Max-0902 登上了 Code Arena 榜首,我记忆中这是第一次。 Qwen3.8-Max-0902 2.4T 参数,1M 上下文令牌,为真实世界的复杂性而生。在编码与协作方面进一步后训练之后,Qwen3.8-Max-0902 直接站到了世界前沿。竞争非常激烈,仅中国基模有千问、Kimi、DeepSeek、腾讯混元和 GLM 站在第一梯队。Qwen Kimi 等我之前都写过,混元 Hy 没聊过,因为之前它在 Coding Agent 领域确实差点事,这次混元后来居上了。过去两年,开发者讨论 Coding 模型时,第一排通常是 Claude、GPT,以及后来追上来的 DeepSeek、Kimi 和 GLM。腾讯场景很多,混元却很少成为这类讨论的主角,直到 Hy4 preview 发布。我这周订了腾讯云 Token Plan,在 DSH 里跑 Hy4 preview,做了两个功能特性,可以说又快又好。 Hy4 preview 是一款 770B 总参数、每个 Token 激活 49B 参数的 MoE 模型,上下文长度达到 1M。现在的重点都是长程软件工程、文档型办公和科学研究上,Hy4 全方位提升了 Coding Agent 理解任务、制定计划、调试、验证,以及前端界面的视觉和交互质量。腾讯公布了一组内部盲测:163 名内部专家评估了 203 个真实工程任务,Hy4 preview 平均得分 2.99,略高于 GLM 5.3 的 2.92 和 Kimi K3 的 2.94。与两者相比,Hy4 的胜率分别为 46.8% 和 51.2%。内部测试当参考就好,能不能打,一个是去看 https://arena.ai,另一个就是上手做个功能,是骡子是马,拉出来溜溜。看技术报告,Hy4 preview 的 Agent 协作能力似乎很强,同时管理多个 Codex 会话,根据实验结果调整研究方向,协调它们优化一个小模型的后训练任务,Hy4 作为研究负责人,在 8 项评测上都超过了让 Codex 独立探索的结果。这个我后续准备在 DSH 里用用,正好集成了 Codex Agent,如果可行,倒是个突破。我最近试了好几个 Agent 协作的产品,比如引入 Codex、K3(kimi code)和 GLM5.3(CC),让他们其中之一牵头带着另外两个 Agent 一起干活,效果都很一般,还很耗费 Token。比如 raft.build、Codeg 等,如果 Hy4 在这方面能让其他 Agent 干得又快又好又省钱,那我还是很期待的。腾讯的另一个优势来自产品协同。Hy4 可以和 WorkBuddy 等共同训练和评测,也已进入元宝、腾讯云和 OpenRouter。大厂这个优势明显,真实任务与产品反馈形成的循环很重要,内部循环效率也更高。飞轮一旦形成,会越跑越快。
^__^ 9 / 02
A 社有点慌,向你投出了 Fable 5.1 和 Mythos 5.1 以前 Anthropic 发模型,还挺扭捏的,跟古代新媳妇上轿似的:新能力先给小范围测试,公告写得像论文,您要是普通付费用户,不好意,等着。这次痛快了,Claude Fable 5.1 发布当天不仅自己的产品可用,而且已经在所有平台上线,AWS、Google Cloud、Azure 一个不落,API 直接用,还降了价。过去半年,国内开源模型突飞猛进,DeepSeek、GLM、Kimi、混元一路猛追,榜单差距以月为单位缩小,现在 Kimi 的 K3 和 Qwen 3.8 Max 在编程领域是和 Opus 5 掰手腕的级别 。闭源阵营再端架子,市场也不会等人啊。A 社这次直接把压箱底的东西摆上了货架。澄清一下,Fable 5.1 和 Mythos 5.1 属于同一代模型,底层能力相近,主要区别在于安全防护和开放策略。Fable 5.1 面向所有用户全面开放,今天就能用,安全防护足足的;Mythos 5.1 只通过可信访问计划提供,主要服务网络安全和生命科学领域的专业团队。 A 社给出的定位是“最先进的编程与知识工作模型”。Agent 编程基准 Terminal-Bench 4.0 拿到 55.8%(Mythos 5.1 为 60.9%),上一代 Fable 5 是 42.0%;科研 Agent 基准 Terminal-Bench-Science 上,52.6% 对 24.7%,直接翻倍。Millennium 的测试里,它找到了内部系统一个罕见崩溃的根因,工程师团队和其他模型数年都没能解释。科研部分最有想象力。Mythos 5.1 设计的蛋白质结合分子,在三个靶点上亲和力比公开竞赛最佳投稿高 10 倍,命中率接近 50%,行业典型水平是 10–15%。Fable 5.1 用 NASA 麦哲伦号 30 多年前的雷达数据,给金星三分之一的表面画出了新高程地图,细节从 10–20 公里级提升到 2–3 公里级。它还把七个开源深度学习模型的推理提速了 2.5 倍,这类活儿通常要性能工程师团队干好几周。在咄咄逼人的竞争面前,A 社的模型价格也算是勉强让了步,命中缓存的 token 降价 75%,至每百万 token 0.25 美元;典型工作负载成本比 Fable 5 低了约 25%,Agent 任务最高省 45%。输入输出价格不变。企业端也有两动作: 1、新的企业前沿防护体系(EFS)把数据存在客户自己的云基础设施里,实现等同零数据留存的隐私;2、网络安全防护误报减少 60%,现在可以用 Fable 5.1 发现软件漏洞,但不能用它开发漏洞利用工具。另外,Anthropic 还加了反蒸馏机制,堵上了通过公开记录思维链蒸馏的手法——这条针对谁,不言自明。是的,窗口期在缩短,无人敢再藏拙,魔盒打开就关不上了。