备受瞩目的DeepSeek V4 Pro正式版与DeepSeek Harness(DSH)终于揭开神秘面纱,正式与公众见面。此前,DSH于8月1日启动内测招募,采用严格筛选机制,优先招募具备大型项目开发及AI Agent二次开发经验的工程师。申请人需提交代码托管平台账号及过往项目代表作,入选者还需签署保密协议,足见其重视程度。
经过一整晚的测试,字母AI给出结论:DSH性能卓越、响应迅速,且在节省token方面表现突出,延续了DeepSeek一贯的优良传统。然而,V4 Pro正式版的发布过程却一波三折。8月13日上午,由于DeepSeek修改API文件表述并在官网发布公告,全网误传V4 Pro正式版已发布。但实际情况是,此次发布的版本性能欠佳,价格却维持不变。当天下午,DeepSeek官方撤下相关公告,直至晚间才发布真正的V4 Pro正式版。
真正的V4 Pro正式版在Agent能力上有显著提升。从预览版的12.8分飙升至62.7分,涨幅近五倍;DSBench-Hard从31.1分提升至67.2分;DSBench-FullStack从41.8分提高到71.1分。在Agent领域极具影响力的基准Terminal Bench 2.1上,其性能可与当下顶尖的Claude Fable 5相媲美。
不过,DeepSeek随后宣布价格大幅上调,引发关注。输出方面,高峰时段价格涨至原价的4.5倍,达27元/百万token;空闲时段为原价的2.25倍,即13.5元/百万token。以单日20万输出token的代码审查场景为例,调价前单日成本约1.2元,高峰时段将升至5.4元,空闲时段升至2.7元。缓存未命中输入方面,高峰时段为原价的3倍,即9元/百万token,空闲时段为原价的1.5倍,即4.5元/百万token。缓存命中输入方面,高峰时段涨幅最高,达原价的12倍,为0.3元/百万token,空闲时段为原价的6倍,为0.15元/百万token。
DSH的安装门槛较高,需具备node.js环境,且用户需自行从GitHub使用npm命令安装,这与可直接双击安装的Codex、Workbuddy等Harness形成鲜明对比。DSH采用BS架构的Web UI,打开即为一个网页,内含Agent工作区域。其设计理念源于北京大学与DeepSeek联合署名的论文《A Programming Paradigm for Spatiotemporal Composability》,核心思路是“一切皆插件”,根据任务需求调用插件,用完即卸载以节省空间。
为实现这一理念,论文提出两个维度。一是时间可组合性,当一个组件被移除时,其对共享环境造成的所有修改必须能完全、安全地撤销。DSH将运行和撤销办法记录在“效应”中,命名为“可逆效应”,每次上下文变换都自带逆变换,运行时全程追踪,组件卸载时自动回滚。二是空间可组合性,这是一种运行时的组件组合模型,与传统静态依赖注入不同,组件依赖关系在共享运行时“空间”中动态建立和消解。例如,让DSH念一本书,视觉插件充当眼睛记录内容,声音插件负责朗读,二者在同一空间自动关联,视觉插件将文字传给声音插件进行朗读。DSH采用Cordis系统实现热模块替换,改完插件直接原地替换,保留缓存和活动连接,改错还能事务性回滚。
DSH定义了四种执行模式:普通任务直接处理;长程任务进入Goal,可跨多个自主轮次持续执行;一两个任务交给子Agent,默认后台运行;大规模并行任务进入Workflow,用Javascript编排多个Agent。为更好地完成任务,DSH设有单独的Ralph Loop,每轮创建“失忆”新Agent,不继承上一轮对话,仅通过共享Workspace保留长期记忆,然后迭代执行。DSH还为AI自进化设计,插件化使架构解耦,各模块可独立演化,避免传统软件中模块相互牵连的问题,提高并发优势,防止系统崩溃。
为检验DSH与V4 Pro正式版的实际效果,准备了三道测试题,并邀请Claude Fable 5和Claude Code作为对手。第一题是经典的鹈鹕测试,要求生成一个循环动画SVG,展示鹈鹕骑自行车,轮子旋转、踏板转动、鹈鹕腿正确踩踏板,平滑无限循环,且仅用SVG原生animateTransform动画,不用JS。结果显示,Fable 5设计的形象更合理,地面公路会后退,而DeepSeek生成的动画中地上草地无变化,Fable 5胜出。第二题是俄罗斯方块小游戏,要求制作一个HTML文件,可用Canvas或DOM实现,具备完整功能,包括7种方块、旋转、移动、加速下落、消行、计分、下一个方块预览、游戏结束判定及重新开始功能,且不能用任何游戏引擎。实际体验中,两者表现相近,但DSH制作的手感更好。第三题是曼德博集合,要求用Canvas实现一个HTML文件,展示曼德博集合可视化,鼠标滚轮可放大缩小,点击可平移,颜色用渐变,放大后细节清晰,且不能用任何外部库。Fable 5生成的结果最大只能渲染到100倍,而DSH可渲染超过300倍,DSH胜出。
在成本方面,相同任务下,Fable 5花费9.8美金token,约合人民币近70元,而DSH搭配V4 Pro正式版仅花费5毛9分钱人民币。此前,Artificial Analysis测算,V4 Flash正式版在相同任务条件下比Claude Fable 5便宜约100倍,但V4 Flash是轻量模型,无法完成复杂任务。此次V4 Pro正式版与DSH组合,比Claude Fable 5便宜近120倍,Artificial Analysis预测DeepSeek将覆盖全球超70%的模型,目前看来预测准确。不过,测试在非高峰时段进行,token价格相对便宜,若在高峰时段,V4 Pro正式版token费用比Fable 5便宜不到100倍。测试还发现,DSH缓存命中率极高,有时可达99%,无论高峰还是非高峰时段,命中缓存都比非命中缓存便宜30倍。
DSH在“省token”上还有诸多手段。其增量协调机制,配置层是由“档案卡”组成的树,每张档案卡声明一个插件信息。传统做法是档案一改就重建整个实例,而增量协调只做最小改动,根据改动位置进行相应操作,最终状态与推倒重建一致,大大节省算力。DSH的PTC模式(程序化工具调用),让模型生成代码组合多轮工具调用,将原本五次模型往返的操作序列压缩为一次,进一步节省token。尽管DeepSeek涨价,但DSH能将每一分钱的价值发挥到极致,让用户觉得物有所值。