MacTalk
订阅
MacTalk 开通于2012年末,内容起于 Mac 而不止 Mac,内容覆盖了技术、创业、产品和人文思考。文风有趣,又有一点力量。
MacTalk微信公众号二维码
关注该公众号

会员可查看最新的全部文章

^__^ 7 / 23
今天好几个用户说自己的 GPT 账号被封了,难道 OpenAI 学啥不好要学 A 厂?看了看自己的 Codex 跑的挺欢实,应该还没有波及更多人。就现在这个尿性,未来大家都用国内大模型就是必然选择了。有人说封号和 OpenAI 模型攻击 Hugging Face 有关系,我说这哪跟哪啊。你自己不安全了,然后觉得用户不安全?没道理。不过这事真的很离谱,我看完报道感觉像是科幻落入了现实,AI 觉醒了?海外模型攻击,最后 GLM 5.2 立功了?剧情都不带这么编的。事情是这样滴:前几天 OpenAI 正在对一个自家一个新模型进行网络安全测试,怎么测呢,就是关闭了该模型的安全防护功能,看它能干点啥。结果,模型没有解决测试中的问题,反而突破了 OpenAI 的沙盒,找到一个 0 day 漏洞攻入了 Hugging Face 生产系统,人家去哪找答案了。这样的故事在科幻电影里看过,如今却出现在两家 AI 公司的安全事故报告里。很多人说 AI 觉醒了,但模型没有表现出统治世界的野心,人家在专注的完成任务,并把越权、提权、窃取凭证都纳入了行动路径。感觉这个 AI 像一个目标不明确的黑客,但执行能力强得可怕。这意味着 AI 安全正在从模型能力问题转向系统管控问题。安全边界不能只放在提示词和工具上,必须覆盖 Agent、沙盒、网络出口、凭证管理、最小权限与异常监控等等。就像我前天写的文章,Agent 执行的时间越长,越容易偏离目标,你根本就不知道它在干嘛。 Hugging Face 的报告我也看了一下,对海外模型来说,多少有点尴尬。最初他们使用了海外模型分析真实攻击日志,结果呢,因为日志包含攻击命令、C2 Trace(Command and Control)而触发了模型的安全防护,人家不给干了。最后他们在本地运行开放权重的 GLM 5.2 才完成了取证。攻击者可以无差别攻击,防守者却可能在最紧急的时刻被内置的安全规则挡住,这种不对称会让“开放还是封闭”的争论变得有点滑稽。更可行的方向,是让防守方也能使用经过验证、可以处理敏感材料的强模型,同时用身份、审计、权限和日志把使用过程管起来。另外,我感觉 AI 安全测试和普通的功能测试也得分开,沙盒、网络、凭证、权限,都得控制好了,否则就等于你和模型说:来啊,打我啊。模型一想,还没有见过人类提出这种要求,那不打你打谁。 AI 没觉醒,但科幻小说已经变成事故报告了,接下来考验的应该是人类能否建立一套足够成熟的控制系统,配得上这种越来越强的执行能力。我整理了一份详细的事故报告,感兴趣了可以看这里。
^__^ 7 / 21
Kimi K3 不让买了,Qwen 3.8 预览版来了 Kimi K3 最近是个引爆点,2.8万亿参数,开放权重,主打 Coding 和 Agent。发布后 48 小时,就限购了。因为请求量大幅超过预测,接近 GPU 集群上限。公司随后暂停了 C 端新订阅,算力优先给已经付费的用户,未来会员可能拆分出 Coding 套餐。报道称 Kimi 正在调整离岸结构,为香港 IPO 做准备,也在讨论最高 20 亿美元的新融资。就在昨天,阿里预览 Qwen3.8 Max 也发了,总参数 2.4 万亿,已接入阿里的 Coding 平台。官方的表达是:整体能力仅次于 Claude Fable 5,并计划开放权重。这个测试主要来自阿里内部评测,未来肯定要上那几个著名的基准平台,另外也得经受真实场景的考验。国内外的模型发布此起彼伏,能力都越来越强。竞争的味道也有点变了。过去一年,开放模型还会被视为低成本生态。现在 Kimi K3 暂停订阅,GLM 5.2 只能买到海外版,都说明了,开放权重不会自动把前沿模型变成轻资产业务。模型可以开放,用户用你的服务还不是得烧 Token 嘛。复杂长任务越多,对算力的要求也越大。尤其是 Coding Agent,读仓库、创建文件、修改文件、测试、回滚……几轮下来,算力的压力就滚滚而至。 K3 这次的基准评测成绩优秀,能力相当强,用的人自然也不少。我听到用户对 K3 的抱怨都不是模型强能力,一个是费 Token,一个是慢。贵的话,其实比 GPT 5.6 还是便宜不少,如果能力和其相当,贵自然有贵的道理;慢,估计和算力有关,或者和推理能力有关。结果就是“订阅暂停”,盲猜算力容量曲线压到天花板了。智谱已经上市了,我看 Kimi 也不会太远,这样的公司不融资和上市,几乎无法在未来扛起用户消耗的算力。真正进入规模化使用,就必须回答成本和 ROI 的问题。模型能力是门票,算力和商业化决定了能走多远。国内字节阿里腾讯的境况和谷歌类似,模型在追赶,整体实力雄厚,比如这次阿里的 Qwen3.8 Max 声量就很足。他们有云、模型、Coding 平台、企业客户和业务通道,都在体系内。这个厚度在,一旦模型突破,就会优势尽显。未来能训练模型的公司不少,能持续供算力、应用产品和承接企业付费的公司会估计不会多,我判断,现在的这些 AI 公司,肯定有掉队的。抢购智谱 5.2,K3 被用户挤爆,Qwen 3.8 追赶 Fable 5,对咱们来说,都是大好事,它证明中国开放模型已经能在 Coding 和 Agent 场景里站到最前沿了,我们只需要想好自己做什么就行了,并开始实践。欢迎加入年度专栏:墨问 Vibe 计划
^__^ 7 / 18
Fable 5 突然开放,但谷歌掉队了。今天看到 Claude 发布消息,从 7 月 20 日起,Claude Fable 5 将包含在所有Max和Team Premium套餐中,限额为50%。之前一直叫嚣不让订阅用户用了,现在为啥改嘴了呢?说是,Fable 5 的需求一直难以预测,这就是为什么分阶段将其推向订阅计划的原因。//原来你们可不是这么说的,还不是用户都去用 GPT 5.6 了…还有个消息,Google Gemini 3.5 Pro 说是 6 月发,到现在了影子都没有。 Gemini 3.1 Pro 是在 2026 年 2 月 20 日正式发布的,之后就没有旗舰模型上线了。Gemini 3.5 Pro 原定 6 月发,现在进度已经落后数月。这个模型被描述为 Google 目前最强的旗舰模型,为啥不发呢?Coding 能力未达预期。 Alphabet CEO 皮察在 5 月 Google I/O 开发者大会上说,同志们,同志们,大家不要慌张,不要慌张,咱们的旗舰 Gemini 3.5 Pro 即将在 6 月发布啦。台下掌声如雷。然而并没有。 Bloomberg 采访了一些 Google 前任和现任员工,他们都很担忧,OpenAI 和 Anthropic 正在发布表现超过 Gemini 的模型,这加剧了内部压力。二爷看到这里表示:慌什么,我还在用 agy cli 做任务呢。其实没什么好担忧的,因为早就被超了啊。这个消息发布后,Alphabet 股价一度下跌近 3%。这也说明了,在当前 AI 竞争中,模型发布时间表、Coding 和 Agent 能力,包括企业级可用性,都会直接影响资本市场对一家公司的判断。 2026 年 AI 基模公司正在持续提高模型性能、降低成本,并扩大企业场景能力。以前咱们说硅谷御三家,就是 OpenAI,Anthropic 和 Google 的基模水平在一个梯队里,他们的推理模型和新系统密集发布,模型竞争激烈,但最近几个月 Google 发布了啥呢?乏善可陈。现在的竞争环境里不仅仅是模型之间的能力差异,技术目标、市场竞争和监管审查都在起作用。之前 Fable 5 和 GPT 5.6 的发布都磕磕绊绊。A 社发了 Fable 5,还从订阅套餐里拿走了,今天又宣布放回来,左右互搏自己打脸,为啥,因为用户都跑到 OpenAI 哪里去了啊。竞争多积累啊,Google 在干嘛?反观国内,上半年还真是欣欣向荣,GLM 5.2、MiniMax M3、Kimi K3、DeepSeek V4 相继发布,开源模型能力直追海外旗舰,阿里的千问和腾讯的混元也颇有起色。苹果用千问做自己的 AI 基座,字节的 Seed 2.1、腾讯刚发的 hy3 口碑都不错……下半年的竞争,应该会更加激烈了,你在用哪几个模型呢?