实测DeepSeek V4 Pro正式版:性能逼近Fable 5,另有隐藏亮点在本次实测中,DeepSeek V4 Pro正式版展现出强劲实力,其综合能力已接近Fable 5,同时内置了一项尚未公开的独特功能以下为详细评测内容
在漫长的等待之后,七月初一的月光终于洒下。
今天凌晨,DeepSeek 官网悄然更新,DeepSeek V4 Pro 0813 正式亮相。按照惯例,用户无需手动操作,API 接入的 deepseek-v4-pro 已自动切换至最新版本。
同时,DeepSeek API 沿用了与 OpenAI/Anthropic 兼容的接口格式,只需粘贴 API Key,便可在 Codex、Claude Code、OpenCode 等第三方工具中将 DeepSeek 设为后端模型。

值得一提的是,尽管官方此前多次预告「API 即将涨价」,但升级至 0813 版本后,DeepSeek V4 Pro 的价格并未上调。每百万 token 输入(缓存未命中)和输出的费用分别为 3 元和 6 元,与预览版持平,恰好是 DeepSeek V4 Flash 的三倍。
事不宜迟,我们这就来看看,在预览版发布 111 天之后,正式版 DeepSeek V4 Pro 究竟带来了哪些升级。
Agent 能力,终于有了质的飞跃。
与以往偏爱白天流量高峰发布新模型的习惯不同,DeepSeek 此次选择在凌晨更新,显得有些匆忙。官网似乎只来得及修改模型参数介绍、API 使用指南等少量文档页面,连更新日志都尚未发布。更详细的解读,可能要等到今天白天才能揭晓。
不过,考虑到 V4 Pro 正式版发布的时间仅比 7 月 31 日更新的 V4 Flash 正式版晚了不到半个月,我们有充分理由相信,两者采用了相近的优化策略(即便不是完全相同)。
因此,参考 V4 Flash 正式版的更新日志来推测 V4 Pro 的变化,不失为一种可行的方法。

在 DeepSeek V4 Flash 0731 的更新日志中,最引人注目的莫过于官方声明:其基模与预览版在模型结构和尺寸上保持一致,仅重新进行了后训练。然而,正是这种针对性的后训练,带来了显著的效果——Agent 能力大幅增强,基准测试成绩远超 V4-Pro-Preview。
如果今晚的 V4 Pro 正式版同样如此,那么我们有望看到它在 Agent 能力上的显著提升。

目前网上流传的首批跑分结果,在很大程度上印证了这一预期。在与 Agent 强相关的评测集中,V4 Pro 的表现相比预览版有了长足进步,部分项目甚至接近或超越了当前的性能标杆 Fable 5:
DeepSeek 自家软件工程基准 DeepSWE 的得分从 12.8 分跃升至 62.7 分;全栈开发基准困难子集 DSBench-Hard 的分数翻了一倍有余,达到 67.2 分;通过自然语言从零生成代码仓库的 NL2Repo 也从 38.5 分提升至 61.5 分……
换言之,同一个 API 名称,昨天还难以胜任的任务,今天就能与全球第一梯队的代码 Agent 一较高下。

当然,有 KIMI K3 珠玉在前,即便是更新后的 DeepSeek V4 Pro 正式版,也尚未坐上开源界的头把交椅(部分测试中与 K3 存在轻微差距)。但众所周知,DeepSeek 的一贯思路是:
比我强的没我便宜,比我便宜的没我强。
在补齐 Agent 能力短板之后,我们的大鲸鱼,再次捍卫了这一秩序。
为了更直观地了解 V4 Pro 的能力,我们将其接入 Workbuddy,进行了一些简单的 Agent 任务实测,看看它能交出怎样的答卷。
5 个实测案例,全程自主规划。
第一个任务相当简单:接入我的微信读书 Skill,利用读取到的数据制作一份简单的数据报表。借助 Skills 开展工作,本就是 Agent 能力的日常体现。
这一点自然难不倒 DeepSeek,更令人惊喜的是,它还主动翻阅了我此前因其他工作存放在文件库中的爱范儿设计规范 Skill,为阅读报告配上了我们的专属配色。

▲ 提示词:从微信读书 Skill 获取 8 月读书数据,制作为 HTML 形式的数据报表。
接下来两个是网页设计任务。由于时间有限,我没有撰写详细的提示词来规定各种约束和指导条件,指令相当模糊。但就结果而言,V4 Pro 都完成得相当出色——
在构建新闻首页的任务中,它找到了过去几天我们在选题会上讨论过的真实新闻,模仿传统媒体风格的版式设计和衬线字体十分到位,还「手绘」了一张看起来颇为逼真的配图。
▲ 提示词:搜集近日科技新闻,以 THE IFANR POST 为标题,制作一个仿照传统新闻媒体的网站首页,并为头条制作一张虚假的渲染配图。
在构思设计风格展示网站时,V4 Pro 更是「自作主张」地采用了 .style 的网站名称后缀和渐变色标题,各种设计风格示例卡片也大体准确,整体观感精致灵动。

▲ 提示词:制作一个现代化的设计风格展示网站,展示极简、斯堪的纳维亚、新拟物等多种设计风格的 Bento 卡片。
将模糊指令重新梳理为清晰需求,并据此自主规划、分步完成项目,DeepSeek V4 Pro 正式版的智能程度可见一斑。
至于更复杂的交互式实例,V4 Pro 同样展现了不俗的实力:
一个是基础的俄罗斯方块游戏,方块的绘制相当精美,还带有一点微妙的伪 3D 效果。

▲ 提示词:以发散式思维,制作包含复杂物理或交互效果的互动式示例组件,包含旋转/碰撞/消行/加速的正确性,自行设计用例设计方向。
另一个案例则从我的读书记录中的《随椋鸟飞行》获得灵感,制作了一个展示简单规则如何涌现出复杂秩序的「椋鸟群模拟器」,动画效果令人惊艳。

▲ 提示词:以发散式思维,制作包含复杂物理或交互效果的互动式示例组件,包含旋转/碰撞/消行/加速的正确性,自行设计用例设计方向。
为什么是模型来「获取灵感」?因为在布置后面几个任务时,我只跟模型说了「我要去睡觉」,至于以什么方向构思示例、又该以何种方式实现,都完全由 DeepSeek 自行斟酌。

你看,只要模型足够聪明,当媒体老师也不必真的熬夜追热点——AI Agent 能够自行替我解决大多数问题。
还有一个「隐藏大招」。
话说回来,DeepSeek V4 Pro 正式版的发布固然是一件大事,但如果把时间线拉长来看,它或许只是另一件大事的前奏。
仔细阅读此前官网关于 V4 Flash 正式版的更新公告,会发现其中隐藏着一条关键信息:
对于公开基准测试集中的 Code Agent 任务,正式版 DeepSeek-V4-Flash 使用 DeepSeek Harness 极简模式(即将发布)作为框架进行测试,并采用 max 档位,topp=0.95,temperature=1.0。
没错,DeepSeek Harness 即将登场。
近一两年来,AI 工程领域的研究者逐渐形成了一种共识:随着各家 AI 模型在推理能力上逼近天花板,未来真正决定 AI Agent 能力的将不再是底层模型,而是 Harness(运行框架)。
如果说 LLM 是数字员工的大脑,那么 Harness 就是它的办公系统,负责分配权限与任务、调取工具、审批流程、检查结果、保存日志等工作。
没有良好的运行框架,再强的智能也无从施展,甚至可能让 AI 变成失控的脱缰野马。反之,一套足够出色的 Harness,则能让平庸的员工发挥出 200% 的实力。
如今,随着 V4 Pro 正式版问世,DeepSeek AI Agent 系统的模型部分已完全就位。那么,Harness 是否也已准备就绪了呢?

答案显然是肯定的。无论是此前 DeepSeek 招聘 Harness 研发工程师的消息,还是前天注册「DeepSeek Harness 团队」公众号的动作,一切迹象都指向:
短则数天、长则数月之内,DeepSeek Harness 就将与我们见面。
或许,新的 DeepSeek 时刻不会太远。
声明:本站所有文章资源内容,如无特殊说明或标注,均为采集网络资源。如若本站内容侵犯了原著者的合法权益,可联系本站删除。