最近中国开源模型真是有点杀疯了的感觉。今天看到千问刚发布的后训练模型 Qwen3.8-Max-0902 登上了 Code Arena 榜首,我记忆中这是第一次。 Qwen3.8-Max-0902 2.4T 参数,1M 上下文令牌,为真实世界的复杂性而生。在编码与协作方面进一步后训练之后,Qwen3.8-Max-0902 直接站到了世界前沿。竞争非常激烈,仅中国基模有千问、Kimi、DeepSeek、腾讯混元和 GLM 站在第一梯队。Qwen Kimi 等我之前都写过,混元 Hy 没聊过,因为之前它在 Coding Agent 领域确实差点事,这次混元后来居上了。过去两年,开发者讨论 Coding 模型时,第一排通常是 Claude、GPT,以及后来追上来的 DeepSeek、Kimi 和 GLM。腾讯场景很多,混元却很少成为这类讨论的主角,直到 Hy4 preview 发布。我这周订了腾讯云 Token Plan,在 DSH 里跑 Hy4 preview,做了两个功能特性,可以说又快又好。 Hy4 preview 是一款 770B 总参数、每个 Token 激活 49B 参数的 MoE 模型,上下文长度达到 1M。现在的重点都是长程软件工程、文档型办公和科学研究上,Hy4 全方位提升了 Coding Agent 理解任务、制定计划、调试、验证,以及前端界面的视觉和交互质量。腾讯公布了一组内部盲测:163 名内部专家评估了 203 个真实工程任务,Hy4 preview 平均得分 2.99,略高于 GLM 5.3 的 2.92 和 Kimi K3 的 2.94。与两者相比,Hy4 的胜率分别为 46.8% 和 51.2%。内部测试当参考就好,能不能打,一个是去看 https://arena.ai,另一个就是上手做个功能,是骡子是马,拉出来溜溜。看技术报告,Hy4 preview 的 Agent 协作能力似乎很强,同时管理多个 Codex 会话,根据实验结果调整研究方向,协调它们优化一个小模型的后训练任务,Hy4 作为研究负责人,在 8 项评测上都超过了让 Codex 独立探索的结果。这个我后续准备在 DSH 里用用,正好集成了 Codex Agent,如果可行,倒是个突破。我最近试了好几个 Agent 协作的产品,比如引入 Codex、K3(kimi code)和 GLM5.3(CC),让他们其中之一牵头带着另外两个 Agent 一起干活,效果都很一般,还很耗费 Token。比如 raft.build、Codeg 等,如果 Hy4 在这方面能让其他 Agent 干得又快又好又省钱,那我还是很期待的。腾讯的另一个优势来自产品协同。Hy4 可以和 WorkBuddy 等共同训练和评测,也已进入元宝、腾讯云和 OpenRouter。大厂这个优势明显,真实任务与产品反馈形成的循环很重要,内部循环效率也更高。飞轮一旦形成,会越跑越快。