24小时热文
DeepSeek 刚刚更新日志,DeepSeek-V4-Flash 正式版 API 上线公测。这次更新的重点是 Agent 能力。新模型在多项测试中远超 V4-Pro-Preview:Terminal Bench 2.1 得分 82.7,Cybergym 为 76.7,Toolathlon Verified 为 70.3;内部全栈开发测试 DSBench-FullStack 和高难度 Coding Agent 测试 DSBench-Hard,则分别达到 68.7 和 59.6。正式版 V4-Flash 还原生支持 Responses API,并针对 Codex 完成适配。配置一次后,即可在 Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 插件中使用。目前仅 V4-Flash 支持接入 Codex,V4-Pro 预计于 8 月初跟进。详细配置方式 https://api-docs.deepseek.com/zh-cn/quick_start/agent_integrations/codex/ 值得注意的是,DeepSeek-V4-Flash-0731 与预览版采用相同的模型结构和尺寸,本次提升主要来自重新后训练。不过,普通用户暂时感受不到这次升级:目前更新仅覆盖 V4-Flash API,DeepSeek-V4-Pro API 以及 App、Web 端模型均未变化。值得期待的是,DeepSeek 也宣布 V4-Pro 正式版将在之后发布。在此之前,如果你想将把DeepSeek接入Codex ,额度自由了,还不用手机号验证|附保姆级指南 昨天的 AI 圈堪比过年。 GPT-5.6 突然大降价、DeepSeek-V4-Flash 上线、Gemini 3.5 Pro 现身竞技场、Seedance 2.5 正式发布、MiniMax 抛出开源多模态视频模型 H3,智谱 GLM Coding 恢复订阅反手涨价……然而,更大的还在后面,OpenAI 新模型刚刚曝光了。据 The Information 报道,OpenAI 正在测试一整个新模型家族,暂定名「Astra」。Sam Altman 本周已经带着它去了华盛顿,当着美国政策制定者和监管人员的面现场演示。它最大的不同,是让一群 AI Agent 拉个群一起干活,而且能连着干很久。面对一个复杂项目,Astra 可以把任务拆开,交给不同 Agent 分头推进。有人查资料,有人写代码,有人验证结果,还有 Agent 负责统筹。它们互相同步进度、互相挑错,一直磨到项目交付,一趟跑下来可能好几个小时,甚至更长。这种思路正在成为 AI 圈的新主线。DeepSeek-V4-Flash 主打低成本、百万 token 上下文和 Agent 执行效率;Google 的 Gemini Robotics 2 已经开始让多个机器人协作完成现实任务。 OpenAI 则想再往前推一步:让 Agent 团队接手法律、金融、招聘、科研等复杂工作。一次对话,慢慢变成一个可以自行推进的项目。 Altman 之前在华盛顿推销的概念,就叫「AI Agent 团队」:不休息,一边协作,一边不停烧算力。 Astra 最终的命名目前还没敲定。它有可能会接棒成为 GPT-6,也可能留在 GPT-5 家族,命名为 GPT-5.7。从产品定位来看,Astra 将成为与 Sol、Terra、Luna 并列的新模型家族。至于发布时间还不确定,除了研发进度,OpenAI 还在等美国政府的新规。消息称,Astra 可能是首批要接受美国政府发布前安全评估的前沿模型。那套框架的意思是,让 AI 公司提前把高能力模型交上去,给联邦机构测。框架一旦落地,OpenAI 发不发布、何时发布,都不完全是自己说了算。随着大模型的榜单和价格战越大越凶,竞争的主线开始变成:谁能带着一群 Agent 连续工作几小时、几天,最后把事情做成。 Astra,可能就是 OpenAI 交出的第一份答卷。 三大运营商将停止第三方互联网渠道办卡 连续5个月降幅收窄!重点房企销售情况持续改善 【财闻联播】机票燃油附加费,将下调!针对“幽灵外卖”,市场监管总局出手 核电,大消息 万科新管理层上任,今年核心经营目标确认 券商8月“金股”来了 事关低龄未成年人严重暴力犯罪,有新规定 国际足联回应欧足联抵制
年费限时8折
所有数据均采集于网络,如有侵权请联系站长删除
粤ICP备18050166号-1