数字生命卡兹克
订阅
数字生命卡兹克微信公众号二维码
关注该公众号

会员可查看最新的全部文章

^__^ 8 / 03
今天,Qwen3.8-Max正式版,终于发布了。 2.4T,又一个国产巨无霸,单次激活95B,100万上下文。开源模型,终于全面迈入了2T时代。今天体验了一下,综合能力大概跟Kimi K3在同一个档位,互有胜负,你要硬说谁更好一点吧,我感觉从日常的任务和开发观感上,已经很难进行区分了。但是Qwen3.8-Max的优点就在于,价格低很多,以及推理速度非常的快,$2/百万输入、$6/百万输出,是Opus 5的30%的价格,K3的50%左右。前几天DeepSeek V4 Flash的斩杀线的梗我相信很多人都看过了,在长程Agent这种海量烧Token的场景下,有时候,差不多的性能,我比你便宜,那我就是好。 Qwen的Token Plan目前价格还有优惠,可以随便买,而且这次口碑确实不错,就怕后面也涨价,我自己也买了一个季卡先囤着了。然后呢,这次Qwen3.8-Max的前端很强,网页结构、视觉层级、组件细节和动效都做得不错,在后端和长程任务上也不错。但是最让我意外的,居然是写作能力。这两年,所有模型都在疯狂特化Coding和Agent。然后我们现在就看到一个很奇葩的现象,大家的Coding和Agent能力疯狂进步,然后写作疯狂倒退,甚至现在我做内容创作的白月光,还是很久以前的Claude Opus 4.6,但是可惜的是,Claude把我封了。我的白月光也没有了。但是这一次,Qwen3.8-Max,居然意外地保住了语言上的感觉。让我感觉,写作能力居然出乎意料的还不错?它能理解语气、节奏和留白,在语感上虽然有时候也有黑话,但是比较少,可以通过Skill的限制全部去除掉,居然让我有了一种,用Opus 4.6的感觉。 Qwen3.8-Max,意外的居然是个综合水桶。虽然我也不想天天来回摇摆,但是事实就摆在这,新就是好,新就是棒。现在,对于觉得绝大多数人来说,Qwen3.8-Max,可能就是最近一段时间的首选了。真的是,各家的模型,现在都是独领风骚十几天。。。 Qwen3.8-Max下周正式开源。但是还有一个彩蛋,是我开心的想要跳起来的。除了2.4T的这个大模型,Qwen还会开源一个供开发者们本地部署的小模型Qwen3.8-27B。千问终于想起了,两年前,他们是怎么让整个社区为之沸腾的。旗舰模型,决定一家公司的高度。小模型,决定一个生态的宽度。如果他们只开源那个2.4T的,千问我觉得还是只能叫千问。但是他们居然还要再开源一个27B的,那没啥可说的了。我愿称之为。义父。 2年前的那个曾经的千问。他们好像,又回来了。
^__^ 7 / 31
等了好久,DeepSeek V4的正式版终于来了。可惜,来的还是DeepSeek-V4-Flash,V4 Pro正式版还得继续等。但我看到消息的第一反应,还有很开心的。因为V4 Flash对我现在的生活,反而比V4 Pro还要重要。这次,DeepSeek V4 Flash它的模型结构和参数规模完全没变,只重新做了后训练,但是强了特别多。 Terminal Bench 2.1从61.8涨到了82.7。 DeepSWE从7.3涨到了54.4。 DSBench-FullStack从37.0涨到了68.7。官方列出的九项Agent测试里,它已经全部超过了V4 Pro Preview。同时还原生支持Responses API,专门针对Codex进行了适配。讲真,DeepSeek这次在后训练上,应该是憋了个大的。但如果让我非常坦率地评价,DeepSeek V4 Flash在最顶级的Coding和Agent任务里,跟GPT-5.6 Sol、Claude Opus 5、Kimi K3这些最强模型,依然会有巨大的差距。复杂项目的架构设计、长时间自主执行、充满意外的多步任务,我大概率还是会优先把最强的模型挂上去。这没什么可避讳的。但模型真正进入生产环境以后,能力上限只是一部分。还有一个经常被低估到离谱的指标:你到底用不用得起。这也是我为什么反而更期待Flash。我自己的AIHOT,现在每天差不多要抓一万条新闻。这些新闻进来以后,要做结构化、数据清洗、预筛、标注、实体提取、原子事件分离、聚类、语义合并等等,还有一大堆后续判断。最后才回到真正的精选打分环节那一步。这里面绝大多数环节,都需要AI介入。有些流程复杂到甚至需要Agent自己调用工具、检查结果、决定下一步。一万条新闻,乘上一大串处理链路,最后就是一个极其恐怖的调用量。按照我现在的调用规模,每个月大概API的消耗量在1000多人民币,你要是换成我常用的那些顶级模型,成本至少得翻十倍以上。但DeepSeek V4 Flash就很适合干这个。智能水平在中上等,却又便宜得离谱。 WorkBuddy里也是一样。真正难到天上的任务,大家可以接K3。可绝大多数日常任务,DeepSeek V4 Flash已经完全能处理,而且单次只消耗0.06积分。行业当然需要那些一次跑通世界级难题的顶级模型。可这个世界上更多的真实需求,是每天重复一万次、十万次、上百万次的普通任务。当智能贵得像奢侈品时,大家只能偶尔体验。当智能便宜到像水电一样时,它才会真正流进每一家公司、每一条流水线和每一个普通人的生活里。所以我很多时候,真的挺感谢DeepSeek。这才是真正的,智能平权。