MacTalk
订阅
MacTalk 开通于2012年末,内容起于 Mac 而不止 Mac,内容覆盖了技术、创业、产品和人文思考。文风有趣,又有一点力量。
MacTalk微信公众号二维码
关注该公众号

会员可查看最新的全部文章

^__^ • 10 / 02
沉寂两个月后 AK 终于发声:理解 LLM 输出比以往更重要。 Andrej Karpathy 自从加入 Claude 就很少公开分享了,看来去哪个大厂规则尿性都差不多。国内十一长假,AK 时隔两个月写了篇长文,讲述自己理解和消化 LLM 输出的的方式方法。写作:要求 LLM 用 ASD-STE100(航空航天控制语言规范)来解释概念。这种严格规范化的语言比自然语言更清晰易读。Karpathy 有时还会要求"80% 符合规范"来保留一点灵活性。图表:让 LLM 生成图表或图片。相比文字,视觉形式更直观、解析更快。网页:要求输出 HTML,生成可交互的精美页面。比静态文档更具表现力。视频(最看好):生成定制化的解释视频,如 3b1b 风格,并加入语音旁白。这一形式已开始真正可用。以下是原文译文:我们将花越来越多的时间,去努力理解语言模型的输出。以下是我的一些想法、技巧和窍门:写作:有一个我屡试不爽的方法:让 LLM 用 ASD-STE100 来解释某个东西。这是一种受控语言规范,最初为航空航天维修文档而开发。LLM 对这门语言掌握得很好,它带有大量对干净写作风格的硬性约束,我经常觉得这种输出可读性强得多。有时我会试着让它稍微柔和一点,比如要求“做到 ASD-STE100 的八成”,因为这套规范相当严苛。但还有更好的:图表 / 图像:与其让 LLM 写文字,不如让它画一张图。图表往往更容易消化、解析和理解。但还有更好的:网页:要求输出“用 HTML”,就能得到漂亮的、可交互的网页。LLM 的前端能力越来越强,能做出漂亮的体验、动画等等。但还有更好的:讲解视频:我最看好的输出格式,是针对任意主题完全定制的讲解视频。可以试试这样的提示:“做一个 3Blue1Brown 风格的视频来讲解 X,用我的 ElevenLabs API Key 配音。”(后者需要你有 API Key,或者让 LLM 帮你找一些使用本地算力的靠谱免费替代方案。)这真的已经开始跑通了!总结一下随着 LLM 变得更强,它们会自主完成越来越多的基础工作,而我们工作中更多的部分会沿着抽象层向上移动,变成监督和理解。幸运的是,LLM 在这方面也能帮上忙。当智能和代码变得越来越廉价易得,你可以要求生成大型的、定制化的、用完即弃的软件制品(比如网页应用、讲解视频)——这些东西在以前根本没有造出来的道理。在这个方向上多做尝试,你会惊讶地获得一些有趣的成果。
^__^ • 9 / 27
Codex 突发最高级别宕机,然后扔过来一个重置 Codex 又送额度重置了。这次理由多少有点尴尬:服务宕机。对于那些等着它干活的人来说,假期福利来得有点戏剧性。周六早上 7 点,墨问 Vibe 群里已经有小伙伴爆出来,Codex 出现 unexpected status 401 Unauthorized,完全不可用,很快陆续发现是大范围故障。官方状态页标记为“Full outage”,即全面宕机,涉及网页版、API、命令行和 VS Code 扩展。基本是最高级别的故障。从第一条官方通报到恢复,间隔约 56 分钟。对国内用户来说,这是周六早晨的一次工作中断。说起来,谁周六早上蹬 Codex 啊,我也是服了这帮 Vibe 用户。截至目前,官方并未解释具体根因。随后,OpenAI 产品负责人,赛博义父 Tibo 发帖道歉,宣布为 Codex 和 ChatGPT Work 的所有付费用户重置使用额度。结合上次重置的时间点,这次重置算是不疼不痒,本来我的自然重置也是在周六下午五点,只不过提前了几小时,而我正在徒步摄影,可以说毫无关系。额度重置现在都被大模型厂商玩成了基操。这东西之所以这么吸睛,是因为额度已经成了开发者安排工作的一个重要变量。我看社区里不少用户,看到故障乐呵呵,已经开始等补偿了;网上还有专门的重置追踪站,这几乎成了一种赛博文化。还有看热闹不嫌事大的用户开始玩梗,之前 Codex 团队号称超过九成代码由它自己编写,那么 Codex 挂了,谁来修 Codex?推上群众说了:Codex 挂了,让 Claude Code 抢修啊 同一天还有个披露分享给大家,OpenAI 表示研究环境中的智能体曾向第三方服务传输训练和评估数据,已发现 53 起用户图片被上传到图床的情况,这种类似事件 Claude Code 发生过,Grok Build 发生过,ZCode 发生过,现在是 Codex。我想这是需要严肃追问的数据使用问题,比宕机和重置更加值得人们关注。随着 AI 产品覆盖的人群基数越来越大,故障频发。只看 OpenAI,截至 9 月 27 日,官方列出 9 月共发生 36 个事件,涵盖不同产品的错误、延迟乃至客服响应问题。这个数字说明头部 AI 产品的稳定性依然值得关注。为什么会这样呢?感觉还是大模型的不确定性在捣乱。Agent 越来越能干了,人类越容易把自己的各种活丢给 Agent 完成,编程、测试、作图、制作视频和音乐、写文档、查资料,工具越顺手,依赖就越深。用户该何以应对?一方面多备几个 Agent 和模型;另一方面,一让要适时让自己的工作状态持久化,当 A 不灵光的时候,可以无缝切换到另一个 B Agent 上。