APPSO
订阅
数字生活家,手机新娱乐
APPSO微信公众号二维码
关注该公众号

会员可查看最新的全部文章

^__^ 8 / 31
DeepSeek 的 V4 多模态模型,正式开源了。就在刚刚,DeepSeek 在 Hugging Face 上线 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License 开源。公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。 DeepSeek 将它定义为 V4 家族第一款实验性多模态模型。该模型基于 DeepSeek-V4-Flash,在原有架构中加入视觉模块,并经过持续训练获得图像理解能力,同时保留原来的文本、推理和 Agent 能力。 值得一提的是,早在 8 月 21 日,DeepSeek-V4-Flash-Vision-Exp 就已经率先上线 DeepSeek API,开发者可以通过 API 同时输入文字和图片,DeepSeek Harness 0.1.1 也在当天加入原生支持。 十天之后,DeepSeek 又进一步开源,也让本地部署、研究和二次开发由此成为可能。相比传统多模态模型,DeepSeek 对 Vision 版本的定位明显偏向 Agent。官方介绍中重点强调的也是 Multimodal Agent Capabilities,也就是让 Agent 能直接读取网页截图、软件界面、图表等视觉信息,再结合工具调用继续执行任务。从测试结果来看,加入视觉能力之后,V4-Flash 原有的 Agent 能力基本没有受到影响。Terminal Bench 2.1 得分从 V4-Flash-0731 的 82.7 提升至 83.9,DeepSWE 从 54.4 提升至 59.3,高于 Opus-4.8 的 58.0;Toolathlon-Verified 也从 70.3 提升至 75.9,接近 Opus-4.8 的 76.2。多模态 Agent 测试中的提升更加明显。 ApexBench Pass@1 达到 36.5,Agents' Last Exam 得分 27.3,高于 Opus-4.8 的 25.7;ZeroBench Pass@5 得分 35.0,同样超过 Opus-4.8 的 34.0。从 V4-Flash、DeepSeek Harness,再到如今开源的 V4-Flash-Vision-Exp,DeepSeek 最近几次更新正在逐渐拼出一套更完整的 Agent 技术栈。模型负责推理和工具调用,Harness 负责持续执行任务,Vision 则让 Agent 能够直接读取电脑世界里的视觉信息。十天前,我们已经可以通过 API 调用这双「眼睛」。现在,DeepSeek 又把它真正交到了我们的手里。源神启动!欢迎回看 APPSO 此前文章: DeepSeek 多模态模型发布,鲸鱼终于开「天眼」了 附 Hugging Face 地址: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp