DeepSeek多模态怎么样?|附带保姆级配置教程(codex、claude)
DeepSeek 多模态终于来了。这次上线的是实验性视觉模型DeepSeek-V4-Flash-Vision-ExpAPI 模型名deepseek-v4-flash-vision-exp它不仅支持文字还加入了图片输入、截图理解、OCR、图表分析等能力并且可以直接接入 Codex。但问题也来了这个多模态模型到底怎么样加入视觉能力后代码和 Agent 能力会不会下降一、DeepSeek 多模态到底怎么样先看这次公布的 Benchmark。1. 文本 Agent基本没有因为多模态而“降智”和DeepSeek-V4-Flash-0731相比Vision-Exp 在 7 项文本 Agent 测试中6 项成绩更高。比较明显的有BenchmarkVision-ExpV4-Flash-0731Opus-4.8Terminal Bench 2.183.982.785.0NL2Repo57.754.269.7DeepSWE59.354.458.0Toolathlon-Verified75.970.376.2DSBench-Hard63.659.671.7其中DeepSWE 59.3甚至超过了 Opus-4.8 的 58.0。Toolathlon-Verified 则达到75.9 vs 76.2已经非常接近 Opus-4.8。也就是说DeepSeek 并没有为了“看图”明显牺牲原本的文本 Agent 能力。2. 多模态 Agent已经摸到 Opus-4.8真正值得看的还是多模态测试。BenchmarkVision-ExpV4-Flash-0731Opus-4.8ApexBench36.526.239.4Agents Last Exam27.325.225.7Chartography64.3-65.0ZeroBench35.0-34.0这里很有意思。Agents Last ExamVision-Exp 27.3 Opus-4.8 25.7ZeroBenchVision-Exp 35.0 Opus-4.8 34.0而 Chartography64.3 vs 65.0几乎已经贴近 Opus-4.8。所以从这张测试表来看我对它的评价是文本 Agent 能力没有明显缩水多模态 Agent 已经进入第一梯队部分项目甚至超过 Opus-4.8。当然这不代表 Vision-Exp 已经“全面超过 Opus-4.8”。毕竟目前还是Exp 实验版本Benchmark 也不能完全代表真实开发体验。但作为 DeepSeek 第一个重点面向视觉 Agent 的模型这个成绩已经相当不错。二、它对 Codex 有什么用以前用 Codex 写代码碰到IDE 报错截图网页截图UI 设计稿数据图表控制台错误很多时候需要自己先整理成文字。现在可以直接图片 / 截图 ↓ DeepSeek-V4-Flash-Vision-Exp ↓ 视觉理解 / OCR / 图表分析 ↓ Codex 分析并执行代码任务这也是我认为这次更新真正有价值的地方AI 不只是读代码还开始能看开发环境。三、Codex 保姆级接入 Vision-Exp整个流程其实很简单安装 Codex → 运行官方脚本 → 选择第 3 项 → 输入 API Key。1. 安装 Codex确保已经安装 Node.js然后执行npm install -g openai/codex检查codex --version2. 运行 DeepSeek 官方脚本Windows 打开 PowerShellirm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iexmacOS / Linuxbash (curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)运行后会出现模型选择菜单1. deepseek-v4-flash 2. deepseek-v4-pro 3. deepseek-v4-flash-vision-exp ... 9. 恢复默认 Codex 配置想使用图片输入直接选择3也就是deepseek-v4-flash-vision-exp第 3 项会额外支持图片输入。首次运行会提示输入 DeepSeek API Keysk-xxxxxxxxxxxxxxxxAPI Key 可以在 DeepSeek Platform 获取。整个配置流程就是安装 Codex ↓ 运行官方脚本 ↓ 选择第 3 项 ↓ deepseek-v4-flash-vision-exp ↓ 输入 API Key ↓ 开始使用如果之后想恢复原来的 Codex 配置重新运行脚本选择第 9 项即可。四、实际可以怎么玩例如直接把报错截图交给 Codex分析这张报错截图找到错误原因 并检查当前项目修改对应代码。或者上传 UI 设计稿根据这张 UI 设计稿检查当前页面 找出样式差异并修改代码。最终工作流就变成看截图 → 理解问题 → 分析代码 → 修改项目 → 验证结果。总结如果只看这次 Benchmark我认为DeepSeek-V4-Flash-Vision-Exp的表现比预期更好。文本 Agent相比 V4-Flash-0731大部分测试继续提升。多模态 Agent已经接近 Opus-4.8Agents Last Exam、ZeroBench 甚至实现反超。再加上现在可以直接通过官方脚本接入 CodexCodex deepseek-v4-flash-vision-exp ↓ 多模态 Coding Agent所以这次并不是简单给 DeepSeek 加了一个“看图”功能。真正值得关注的是DeepSeek 开始把视觉能力和 Coding Agent 正式结合起来了。不过Vision-Exp目前仍然是实验版本适合尝鲜和测试生产环境建议继续观察稳定性。