突发!DeepSeek V4 多模态开源,3050 亿参数:部分能力反超 Opus 4.8

2026 年 8 月 31 日,DeepSeek 正式开源 DeepSeek-V4-Flash-Vision-Exp,这是 DeepSeek V4 系列首款实验性多模态视觉模型。 此前,该模型已于 8 月 21 日率先上线 DeepSeek API 平台,但当时仅提供 API 调用,并未开放模型权重。 目前,DeepSeek 已在 Hugging Face 放出 DeepSeek-V4-Flash-Vision-Exp 模型,采用 MIT License。 包括模型权重、Tokenizer、Prompt Encoding 参考实现以及最小化 PyTorch 推理实现,开发者可以下载模型并进行本地部署和二次开发。 DeepSeek-V4-Flash-Vision-Exp 模型规模约为 305B。基于 DeepSeek-V4-Flash 架构,在原有语言模型基础上加入视觉模块,并通过持续训练获得图像理解能力。 DeepSeek-V4-Flash-Vision-Exp 可以同时处理文字和图片输入,可用于图片理解、截图文字识别、图表分析等任务,也可以结合 Agent 工具完成需要视觉理解的自动化操作。 DeepSeek 表示,在 Agent、推理、世界知识等纯文本能力上,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 基本持平;在需要视觉理解的 Agent Benchmark 上,其性能相比 DeepSeek-V4-Flash 大幅提升,多模态 Agent 能力已经接近 Claude Opus 4.8。 从官方公布的测试结果来看,DeepSeek-V4-Flash-Vision-Exp 在 Terminal Bench 2.1 上得分 83.9,Opus 4.8 为 85.0;在 DeepSWE 上得分 59.3,超过 Opus 4.8 的 58.0。 不过,在部分测试中 Opus 4.8 仍保持明显优势。 例如 NL2Repo 测试中,DeepSeek-V4-Flash-Vision-Exp 得分 57.7,Opus 4.8 为 69.7。因此,DeepSeek 官方对其整体定位是多模态 Agent 能力“接近 Opus 4.8”,而非全面超过。 此次开源距离 DeepSeek 首次提供该模型 API 相隔 10 天。 8 月 21 日,DeepSeek 在官方更新日志中宣布 DeepSeek-V4-Flash-Vision-Exp 上线 API 平台,用户可以通过 deepseek-v4-flash-vision-exp 调用模型。与此同时,DeepSeek 为 API 增加了图片输入以及 Files API 等能力,图片会被转换为 Token 计费。 云头条

about image

布鲁诺·费尔南德斯帽子戏法加助攻,曼联英超5球大胜伊普斯维奇

通过快速步伐训练和横向移动练习,增强防守时的移动能力。...

[无下一篇]

通过快速步伐训练和横向移动练习,增强防守时的移动能力。...