近期,科技圈内关于DeepSeek新模型V4 Pro正式版的讨论呈现出两极分化的态势。一方面,部分用户对其性能赞不绝口,认为其达到了行业顶尖水平;另一方面,也有不少人对其价格调整和实际表现提出质疑,甚至怀疑是否部署了错误的模型版本。
这种评价的割裂,源于用户对DeepSeek不同版本体验的差异。此前,用户接触到的更多是不完整版本。从V4 Flash正式版开始,官方在模型跑分表格下方标注了一行小字,说明成绩是在DeepSeek Harness(简称DSH)环境下取得的。这引发了行业内外对Harness这一技术的广泛关注。
Harness在大模型领域扮演着关键角色。如果把大模型比作一个极其聪明的“缸中之脑”,那么Harness就是为其装上的“机甲和神经系统”。它负责为模型接入工具、管理运行状态,使模型能够完成写代码、查资料、调用工具等复杂任务。同一模型在不同Harness的支撑下,展现出的能力会有显著差异。因此,DeepSeek Harness如何提升模型跑分,成为行业关注的焦点。
近日,备受期待的DeepSeek Harness工具终于正式发布。这一工具的推出,标志着DeepSeek V4 Pro/Flash能够发挥出真正的实力。参与内测的程序员反馈显示,DSH的性能表现令人惊叹。
从基础使用体验来看,DSH的界面与网页端DeepSeek相似,左侧为记录查看栏,右侧是聊天工作区。聊天框左上角可选择工作区域,右下角可调整模型和推理强度。但DSH的独特之处在于提供了四种工作模式:标准模式、极简模式、PTC模式和创造模式。
标准模式是用户日常使用AI的常见模式。在内测中,DSH仅用1.56元就完成了一个MC风格传送门游戏的开发。极简模式则主要用于模型测试,去除所有非必要功能,让模型能力得到纯粹展现。
PTC模式是DSH的一大创新。它专注于教会AI高效完成任务。在处理重复性问题时,传统方法可能导致模型上下文被塞满。例如点外卖时,若将数百家餐厅信息全部输入模型,上下文很容易超载。而PTC模式通过让AI主动编写代码、设置筛选条件,使进入上下文的内容更加简洁,同时保持模型能力不受影响。
创造模式则赋予了用户更高的自由度。用户可以利用这一模式为DeepSeek Harness编写插件,实现客户端的自我更新。这种设计使得DSH的上限极高,与Claude Code、Codex等工具形成鲜明对比。后者虽然也支持插件开发,但整体架构已固定,用户只能在既定框架内进行修改。而DSH的所有功能均可通过插件实现,用户可以对系统进行全面定制。
在内测中,有用户基于DSH开发了“生存模式”。这一模式不仅在任务执行时节省Token,还在界面左下角通过血条和法力值显示项目剩余上下文长度和账户余额。当资源不足时,系统会自动提醒用户进行压缩或充值,资源耗尽则视为任务失败。
除了这种趣味性的开发,内测用户还在实用功能上进行了探索。有人为DSH设计了全新的皮肤,有人添加了广告插件,还有人从底层入手,为其开发了图片识别能力。这些开发成果展示了DSH的强大扩展性和可玩性。
为了支持这种高度灵活的插件系统,DeepSeek与北京大学合作撰写了论文《时空可组合性的编程范式》。该论文探讨了如何在复杂系统运行时实现安全、自由的组件拼装和拆卸。在AI领域,这一问题尤为重要,因为Agent执行任务或自进化过程中不能频繁重启。
论文提出了两种解决方案:时间可组合性和空间可组合性。时间可组合性通过为每个操作准备逆操作,使模型能够在出错时快速恢复状态,无需重启。空间可组合性则通过自动化监控组件依赖关系,实现插件的动态加载和卸载,确保系统稳定运行。
尽管V4 Pro正式版在价格调整和部分用户预期上引发了一些争议,但DeepSeek在技术创新上的表现依然值得肯定。从R1的突破到V4 Flash的性价比优势,再到如今的DeepSeek Harness,DeepSeek持续为行业带来惊喜。其不按常理出牌的风格,或许正是吸引用户关注的重要原因。
随着DeepSeek Harness的发布,市场上可能会出现各种基于该工具的变种Agent。这一工具或许将推动AI进入Agent普惠的新时代,为行业发展注入新的活力。










