DeepSeek Harness工具疑似开启内测,该产品是与V4正式版同步发布的AI智能体运行框架,具备毫秒级响应、高可靠性、自动容错、长上下文管理、多Agent协同、动态工具调用及模型-框架深度适配等特性,旨在提升复杂任务执行效率与稳定性。
从2026年3月崔添翼加入
一张截图在各大AI社区流传,内容是

按照截图的说法,Harness计划于本周晚些时候开启内测,首批用户从小范围群组中筛选,入选者需要提交个人资料、签署《保密承诺函》,才能拿到产品访问权限。
并且截图显示,一旦泄密,不只是当次资格取消,还会影响日后
虽然截图真伪无法验证,但结合
然而目前市面上没有任何关于
不过我们还是能通过
先来说第一块,崔添翼不是做AI出身的。他在Jane Street做了九年的量化交易系统。
在量化交易系统里,最值钱的是执行系统。它讲究的是软件能不能在毫秒级别把策略变成交易?能不能在出了异常的时候自动恢复?能不能在每一步都留下可追溯的日志?
如果把这个思维搬到Harness上,那么其大体逻辑可能会是这样的:
量化交易里,慢一毫秒,钱就被别人赚走了。所以系统的每一步都得抠着毫秒级优化,不能有多余的步骤。
所以Agent循环的每一轮推理-执行-反馈都要快,不能有冗余开销。你跟AI说一句话,它不能半天没反应。从它想一下、到调用工具、到拿到结果、到再想下一步,整个循环必须得快。
同时,量化系统必须得非常可靠。如果量化系统崩了,那亏的是真金白银。所以哪怕行情再诡异、数据再离谱,系统本身不能挂,得能自己恢复。

模型可能会犯错,甚至输出一些离谱的东西给你,但Harness这个框架本身不能崩,得能兜住结果,想办法把模型拉回来继续干活。
其实在量化交易里,网络断了、交易所接口挂了、行情数据异常了,这些都是家常便饭。系统不能一遇到问题就死,得有重试、有备用方案、实在不行就降级,比如实时行情拿不到,就先用延迟数据顶着。
模型也是同理,调用工具失败了、文件读不出来、网络超时了,这些都是常事。好的Harness不会因为一个工具调用失败就整个任务废掉,它会自动重试、换个方法、实在不行就降级处理,继续推进任务。
另外,由于量化系统涉及大量的金钱,交易出问题了,得能查到是哪一步出错的,可能是下单的时候错了,也有可能是行情解析错了。每一步都得有日志,这样才能复盘。
Harness也一样,AI把活干砸了,你得能回看它是怎么一步步走到坑里的。是哪一步想错了?哪个工具调用返回了异常结果?它为什么做了那个错误的决定?
在整个量化系统里,订单状态也非常重要。不能出现“我以为下单了但其实没下”或者“重复下单”这种情况,每一步的状态都得是确定的、一致的。
放到Harness上,在所有人都押注长程任务、复杂任务的当下,能否维持模型中间的状态,将决定整个Harness的成功率。不能前面改了A文件,后面改B文件的时候把A的改动忘了。
最后是风控和安全了,量化交易有熔断机制,行情异常的时候自动停止交易,防止一个bug把钱亏光。另外,高风险的操作必须有审批,不能说下单就下单。
那么回到Harness里,在让AI删文件、格式化硬盘、跑sudo rm -rf这种高危操作之前,就必须得停下来进行确认。不能它自己想干啥就干啥,Harness得有个安全闸门。
说完了第一块再说第二块,
JD里提到了KV Cache、长上下文裁剪与压缩算法,说明Harness会做智能的上下文管理。
配合

相当于是把每一份算力都花在刀刃上,小事能省则省,大事算力拉满。
JD里还提到了向量存储方案选型、会话状态持久化与回放,这也就意味着Harness有长期记忆系统,会记住你项目的架构、编码规范、常用模式,下次打开项目自动加载。
会话持久化代表就算你关掉终端后再打开,之前的对话状态、修改记录、执行轨迹依然都在。甚至
JD里提到了Tool Use链式调用、错误回退与自动重试,这是指Harness有完整的工具调用编排能力,能编排多步工具调用的有向无环图。工具调用失败自动重试,重试不行就降级换方案,再不行就回滚到上一个稳定状态。
划重点,
JD里提到了多Agent间通信协议设计、任务分解与结果聚合。这说明Harness有子Agent架构,一个主Agent负责任务规划和协调,多个子Agent负责具体执行。
不同子Agent有不同的系统提示词、工具权限、上下文窗口。主Agent把复杂任务拆成子任务,分发给子Agent,再把结果聚合成最终输出。每个子Agent运行在独立上下文或进程中,互不干扰,出错了不影响主流程。
JD里还提到了任务规划图生成、执行路径在线优化。这意味着Harness有规划与自进化的能力。
规划说的是接到任务后先生成执行计划,分几步、每步用什么工具、预期产出是什么。执行过程中根据实际情况动态调整,不是死板地按原计划走。每完成一步就自我检查,不对就自动修正。
而且,
最有意思的一点在JD最后,
这也就代表了,Harness会利用
其实这也是OpenAI现在的理念。
此前。OpenAI是有两条独立的后训练线。一条是代码专用的Codex线,一条是通用推理的GPT线。到GPT-5.5的时候,两条线合并了,GPT-5.5-Codex将代码能力和通用推理能力整合进了同一个模型。
这就好比汽车,原厂就像汽车厂家自己做发动机+变速箱,知道发动机的扭矩曲线、转速特性,变速箱换挡逻辑可以精准匹配。但是如果把这事交给第三方来做,发动机对他们来说是黑盒,只能凭感觉调变速箱,这就导致永远调不到原厂那么丝滑。
Harness不是一个人来的。崔添翼曾表示,V4正式版和Harness将同步发布。
4月24日,
曾有传闻称,由于7月24日,
可V4正式版依然没有发布。只是两个旧模型名正式停用,所有调用必须换成新的deepseek-v4-flash和deepseek-v4-pro。换句话说,API接口名换了,但模型本身还是预览版那套。
那么正式版比预览版强在哪?
综合多个内测信源的说法,称V4正式版在三个方向上做了升级:
核心推理能力再上一个台阶。
日常对话的响应速度明显优化。
Agent能力针对性迭代。
有参与灰度测试的人总结,V4正式版整体表现接近Opus 4.8级别,编码能力不弱于GPT-5.6 Sol,Agent能力和3D、SVG生成能力大幅提升。同样的任务比Claude Fable 5迭代轮数还少。

不过这些说法都来自非官方渠道,
预览版的问题其实社区里讨论得不少。V4 Preview在编程能力上和
尤其是在那些复杂的任务上。有测试者发现,即便要求模型“不使用外部依赖”,模型依然引用了外部CDN。
遇到真正复杂的任务,需要手动加reasoning_effort=max(推理强度最高)才能拿到更深的思考深度,但变成agent往往会忽略这个提示词,导致模型思考的强度不够。
还有一点,虽然目前
按照
以及V4正式版会加入一些企业功能,但具体如何,
再说价格,这是争议最大的部分。
V4正式版将引入峰谷定价机制,高峰时段(北京时间9:00-12:00和14:00-18:00)API价格直接翻倍。具体来看,V4 Pro缓存命中输入平时0.025元/百万 token,高峰0.05元;缓存未命中平时3元,高峰6元;输出平时6元,高峰12元。V4 Flash 缓存命中平时0.02元,高峰0.04元;缓存未命中平时1元,高峰2元;输出平时2元,高峰4元。
峰谷定价这件事,往好了说是把算力选择权还给用户,不急的任务挪到低谷时段跑,成本更低。可另一方面,在平时的办公时间,跑相同的任务,成本就会增加。
这不是
2025年2月搞过夜间错峰优惠,V3五折、R1二五折。2025年9月 V3.1发布,取消夜间优惠,全天统一价,输出价格还往上抬了50%。
但关键问题不在于价格涨没涨,而在于结合Harness之后,整体使用成本会如何?
第三方测试显示,不同的harness 在完成同样任务时,token消耗差异巨大。测试机构用
此外,同一个任务,在弱Harness(Pi)里失败了,换到强Harness(Claude Code)里居然成功了。
因此,如何去平衡价格与性能,这是
不过有一点我很放心,在省钱这件事上,梁文锋还是太权威了。
本文来自微信公众号“字母AI”,作者:苗正