AB
AiBoss站
project

DeepSeek Harness - DeepSeek 推出的 AI 智能体运行框架

DeepSeek Harness 是 DeepSeek 推出的 AI 智能体运行框架,核心理念为 'Model + Harness = Agent'。框架通过上下文管理、工具调用编排、执行沙箱等工程模块,...

DeepSeek Harness是什么

DeepSeek Harness 是 DeepSeek 推出的 AI 智能体运行框架,核心理念为 “Model + Harness = Agent”。框架通过上下文管理、工具调用编排、执行沙箱等工程模块,将大模型的推理能力转化为可落地的自主执行能力,解决模型只会聊天、不会干活的痛点。DeepSeek Harness 对标 OpenAI Codex 与 Anthropic Claude Code,主攻编程和办公场景,实现从需求理解到代码交付的完整闭环。2026 年 8 月开启内测,由前 Jane Street 工程师崔添翼带队,定位为连接模型与真实世界的关键基础设施。

DeepSeek Harness的主要功能

  • 智能体编排:接收用户复杂需求并自动拆解为可执行步骤,支持产品经理、架构师、开发工程师等多角色 Agent 协同分工,提升任务完成效率与准确性。
  • 代码开发(VibeCoding):提供从代码生成到执行验证的完整闭环,内置”写代码 → 运行 → 看报错 → 修改”的自动化流程,大幅提升编程效率与可靠性。
  • 工具调用编排:支持链式调用、自动重试和失败降级机制,可灵活调用文件系统、终端命令、浏览器操作及各类外部 API,使模型能与真实世界交互。
  • 上下文管理:支持百万 Token 级别的上下文处理,通过动态检索将相关代码片段精准注入 Prompt,有效解决大模型上下文窗口限制和长期遗忘问题。
  • 执行沙箱:在隔离环境中安全执行模型生成的代码,实时捕获输出结果和错误信息,防止恶意或错误代码影响宿主系统。
  • 反馈循环:将沙箱执行结果和报错信息自动反馈给模型,驱动其进行自我修正与迭代优化,实现任务的自动化闭环。
  • 会话持久化:支持长程任务的断点续传机制,确保任务在中断后可从断点恢复,保障复杂任务的连续性与可靠性。

DeepSeek Harness的技术原理

  • Model + Harness = Agent:模型仅负责理解需求、推理和生成方案, Harness 作为模型之外的执行系统,负责调度上下文、工具、任务状态、反馈与边界,将模型的推理能力转化为可在真实环境中落地的执行动作,完成从需求理解到代码交付的完整闭环。
  • 上下文管理器:上下文管理器是 Harness 解决大模型记忆力瓶颈的核心组件,支持百万 Token 级别的超长上下文处理,通过动态检索机制,在任务执行过程中实时从代码库、历史会话和外部知识源中抽取相关片段,精准注入当前 Prompt。
  • 工具调用系统:工具调用系统是模型与真实世界交互的桥梁,负责将模型的意图转化为对外部工具的实际操作。系统内置了链式调用能力,可将多个工具按逻辑顺序组合执行;同时具备自动重试和失败降级机制,当某个工具调用失败时,系统会自动尝试恢复或切换替代方案,确保任务执行的稳定性。该系统支持文件系统读写、终端命令执行、浏览器自动化操作以及各类第三方 API 的调用,使模型能灵活应对复杂多变的业务场景。
  • 执行沙箱:执行沙箱为模型生成的代码提供安全、隔离的运行环境。所有代码在沙箱中执行,与宿主系统完全隔离,防止恶意代码或错误操作对真实环境造成破坏。沙箱会完整捕获代码的输出结果、运行日志和错误堆栈,将这些信息结构化后返回给上层模块。
  • 反馈循环:反馈循环是 Harness 实现自我进化与任务自动化的核心机制。当执行沙箱完成代码运行后,系统会将输出结果、错误信息、性能指标等反馈数据自动回传给模型。模型基于反馈进行自我诊断,识别问题根因并生成修正方案,随后再次进入执行沙箱验证。

如何使用DeepSeek Harness

  • 快速体验:安装 Node.js 后,在终端运行 npx @deepseek-ai/dsh web 可一键启动 Web 界面。
  • 源码安装:执行 git clone https://github.com/deepseek-ai/deepseek-harness 拉取完整代码,按仓库说明完成本地构建。
  • 选择运行模式:根据需求切换标准、PTC、极简或创造四种模式,每种模式自动加载不同的插件组合。
  • 配置插件:在设置面板中查看、启用或停用各类插件,所有 Agent 能力均可自由替换与组合。
  • 创建任务:在输入框中描述你想构建的内容,Agent 将调用插件完成编码、文件编辑、Shell 执行等操作。
  • 查看轨迹:在 Trajectory 视图中回溯每一次系统提示、工具调用和思维链,支持会话恢复与分叉。
  • 开发插件:基于 Cordis 框架编写自定义插件,无需改动 DSH 源码即可扩展任意 Agent 能力。

DeepSeek Harness的核心优势

  • 开放生态:不限于接入 DeepSeek 自家模型,计划通过标准化接口支持多模型接入,与 Claude Code 的封闭策略形成鲜明差异化。
  • 极致性价比:配合 DeepSeek 低价缓存机制,社区实测单次真实编程任务平均成本仅约 0.028 美元,约为 Claude Code 的七分之一。
  • 安全合规:国产自研框架无后门隐患,恰逢 Claude Code 被工信部确认存在严重安全后门、国内大厂加速排查管控的替代窗口期。
  • 系统可靠性:团队负责人崔添翼拥有 Jane Street 九年量化交易背景,长期专注于”如何让复杂系统稳定运转”,将金融级执行可靠性带入 Agent 工程。
  • 模型解耦:Harness 团队与模型团队独立运作、独立注册公众号,以独立于大模型的业务形态推进,生态合作灵活性和扩展性显著更强。
  • Harness 效能:同一模型在不同 Harness 下表现可差出 53 个百分点,DeepSeek Harness 能让中等强度模型以极低价格完成大部分标准化任务,实现”便宜模型打出豪华战绩”。
  • 端到端闭环:覆盖上下文管理、工具调用编排、执行沙箱、反馈循环、会话持久化五大核心模块,实现从需求理解到代码交付的完整自动化闭环。

DeepSeek Harness的项目地址

  • 项目官网:https://www.deepseek.com/harness/
  • GitHub仓库:https://github.com/deepseek-ai/deepseek-harness

DeepSeek Harness的同类竞品对比

对比维度 DeepSeek Harness Codex Claude Code
开发公司 深度求索(DeepSeek) OpenAI Anthropic
产品定位 AI 智能体运行框架 终端原生编程智能体 终端原生编程智能体
模型接入策略 开放多模型,计划支持第三方模型接入 仅限 OpenAI 官方模型 仅限官方 Claude 模型,曾通过隐写手段限制非官方端点
生态开放度 开放共建,面向全球征集插件、Skill、MCP 及第三方界面生态伙伴 闭源运营,生态由官方控制 封闭生态,逆向工程修改令牌后被官方限制
安全合规 国产自研,无后门隐患,符合国内监管要求 美国公司,存在数据跨境风险 被工信部 NVDB 确认存在安全后门隐患(2.1.91–2.1.196 版本)
单次任务成本 $0.028(配合低价缓存机制) 较高 较高(Claude Code 年化收入已达 25 亿美元级别)
核心架构 五大模块:上下文管理、工具调用编排、执行沙箱、反馈循环、会话持久化 内置工具调用与代码执行环境 内置工具调用与代码执行环境
团队背景 负责人崔添翼,Jane Street 九年量化交易与系统开发背景 OpenAI 内部研究团队 Anthropic 内部研究团队

DeepSeek Harness的应用场景

  • 智能编程开发(VibeCoding):开发者通过自然语言描述需求,Harness 自动完成从代码生成、运行测试、报错捕获到自我修正的完整闭环,实现端到端的软件交付。
  • 办公自动化:Harness 调用文件系统、浏览器及各类 API,自动完成文档处理、数据分析、邮件分类回复和日程安排等日常办公任务,替代重复性人工操作。
  • 系统运维与 DevOps:通过终端命令执行服务器部署、监控配置、日志分析和故障排查,集成到 CI/CD 流水线中实现代码的自动构建、测试与发布。
  • 多 Agent 协作项目:协调产品经理、架构师、开发工程师、测试工程师等不同角色 Agent 分工合作,统一调度完成大型复杂项目的拆解与交付。
  • 企业私有化部署:在金融、政务、医疗等安全敏感行业的本地环境中部署,对接内部 ERP、CRM、数据库等私有系统,实现安全可控的智能化改造。

DeepSeek Harness面临的挑战

  • 先发巨头挤压:OpenAI Codex 与 Anthropic Claude Code 已占据智能体代码市场头部地位,Claude Code 年化收入达 25 亿美元且占 GitHub 公开提交量 4%,DeepSeek Harness 作为后来者需在生态和用户习惯上实现突破。
  • 开发者生态冷启动:Harness 的核心价值高度依赖插件、Skill、MCP 及第三方界面等生态伙伴的丰富度,而生态建设需要长期积累,短期内难以与已成熟竞品抗衡。
  • 长程任务可靠性验证:Agent 框架需要处理多轮推理、工具调用和失败重试等复杂场景,从内测到证明其在真实生产环境中稳定交付长程任务,仍有大量工程验证工作。
  • 多模型适配的工程复杂度:开放支持多模型接入虽为差异化优势,但不同模型的上下文机制、工具调用格式和推理特性各异,适配和维护成本将显著增加。
  • 用户迁移成本与习惯壁垒:开发者已深度习惯 Claude Code、Cursor 等现有工具的工作流和交互范式,切换至新框架面临学习成本和工具链重构阻力。