DeepSeek在Hugging Face上开源了V4系列的首个视觉模型——DeepSeek-V4-Flash-Vision-Exp,采用MIT License。
这是一款实验性多模态模型,在V4-Flash架构基础上引入视觉模块,新增了图片理解能力。可以识别截图、分析图表,并结合工具完成Agent任务。纯文本任务表现与V4-Flash正式版持平,多模态Agent能力已接近Opus-4.8。
具体来看,ApexBench从26.2提升至36.5,ZeroBench达到35.0,超过了Opus-4.8的34.0。
开源的内容很完整:模型文件、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块。开发者可以通过Transformers、vLLM、SGLang等框架集成使用。
从8月21日上线API到8月31日开源权重,视觉Exp版本走完了和V4-Flash正式版相同的路径。
DeepSeek的思路很明确:视觉能力不是封闭的溢价点,而是Agent生态的基础设施。开源后第三方可以复测、微调、本地部署——这是对闭源对手最直接的截击。

1September 1, 2026 287 4