xformula
← 首页 / 研究AI Software & Model Layer
AI 软件 · Agent 基建AI 软件 & 模型层 · 跨体系分析已更新 v1.1

DeepSeek Harness 未发先招:一条帖子摸出 Agent 生态家底

截至 88 日,DeepSeek Harness 仍未公开发布。崔添翼的一条招募帖却在社区归档中留下 964 条开发者记录、877 个不重复项目链接和约 136.5 万星标。把这份生态快照与同一 Harness 下的模型评测放在一起看,更准确的结论不是模型竞争结束,而是模型、Harness 与推理档位共同决定 Agent 的最终表现。

本版更新动态榜单、价格和星标均采用带时间的快照,官方来源边界已补齐。
Luke Xu发布 2026-08-08更新 2026-08-0917 分钟
阅读
分享 / SHARE

81 日晚,崔添翼在 X 上发了一条规定格式的帖子:Agent Harness 相关开源项目的开发者,想参加 DeepSeek Harness 内测,回复或私信,附上 GitHub ID 和开源代表作。1

截至 85 日,这条帖子在社区非官方归档里长成了一份生态普查表:1,367 条回复入库,整理出 964 条开发者记录、877 个不重复项目链接,星标合计 1,364,8783 37 评论区的项目从 coding agent 排到 MCP、记忆、编排、客户端、评测、安全。一条招募帖,意外变成了开源 Agent 生态的一次全栈摸底。

1,367
X 回复入库条数(社区归档,约 8/5 快照)
964
开发者记录,其中强报名 781 条
877
不重复项目链接,星标合计约 136.5 万
18
归档划分的赛道数
0
归档全文未检出「fork 官方 Harness」的明确记录
未见发布
截至 8/8 的官方公开状态

公开材料只确认招募

这件事有三条事实边界,划错了,后面所有解读都会跑偏。

第一,公开材料只能确认招募。崔添翼的帖子征集意向参与者,后续又面向 plugin、skill、MCP、orchestrator、aggregator、UI 等方向征集「发布时第一时间接入」的项目。截至 88 日,本文核对的招募帖、官方模型卡与官方 GitHub 组织都未提供内测已经启动或资格已经发放的公开信息。1 11 41

第二,官方 Harness 尚未公开。DeepSeek 官方模型卡写的是相关框架将在后续发布,官方 GitHub 组织截至 88 日也未见同名公开仓库。对归档 1,367 条回复的全文检索没有发现「fork 官方 DeepSeek Harness 并跑通」的明确记录;评论区里的适配与实测,指向公开 API、兼容端点或 Codex、OpenCode 等社区 harness,不是官方 Harness。3 11 14 41

第三,规模数字有两套口径,不能混用84 日媒体报道引用的是早期快照:769 位报名者、712 个去重仓库、120 万+ 星。6 社区归档在 85 日生成的快照记录了 964 条开发者记录、877 个不重复项目链接和约 136.5 万星。发帖约 20 小时时,zensh 的汇总报告收录了 425 条可检索回复,是较早的一份结构化整理。5 37

DeepSeek 为什么现在做 Harness

量子位转述的招聘口径把这件事写成一个公式:Model + Harness = Agent。模型给出能力,harness 负责把工具、上下文、执行与恢复接成可用系统。9

这条线的铺垫从春天就开始了。媒体报道与公开履历显示,崔添翼 3 月加入 DeepSeek 组建 Harness 团队;此前在 Jane Street 香港和纽约办公室做过九年量化交易系统,2022 年又联合创立 TSY Capital。7 8 5 月,DeepSeek 研究员、R1 论文作者陈德里在 X 上表示,团队正从零开始做 DeepSeek Code Harness,并以 Claude Code 为参照。此后公开招聘持续覆盖研究、工程与产品岗位。7 9

731 日,V4-Flash 正式版 API 上线公测,三件事同时发生:10 11

  1. 兼容面形成三种协议。731 日的发布信息列出 Chat Completions、Anthropic 格式与 Responses API;DeepSeek 当前官方文档也分别列出三类接口。10 14 38 39
  2. Harness 此次被明确写进发布物。官方模型卡注明,公开 Code Agent 测试使用了尚未发布的 DeepSeek Harness minimal mode,相关框架「将在后续公布」。11 12
  3. 成绩反超自家旗舰预览版。按 DeepSeek 731 日发布口径,0731 与 Preview 架构、尺寸完全一致(284B 总参数、13B 激活),只重做了后训练;官方称 Agent 基准「远超 V4-Pro-Preview」。10 12
01Terminal-Bench 2.1 得分(0–100):0731 在官方同表排第二
说明 · NOTE

DeepSeek 官方模型卡自测口径:Agent 任务使用未发布的 DeepSeek Harness minimal mode、max reasoning effort、temperature=1.0、top_p=0.95;GLM-5.2 与 Opus 4.8 两行也是 DeepSeek 用自己的 harness 跑出的参照值,不是第三方独立重跑。

DeepSeek 官方文档注明,thinking mode 默认启用,reasoning effort 默认为 high,同时允许调用方设置 low、high 或 max。图 01 使用明确指定的 max 档,因此不能把这项成绩当作默认 high 档的日常体感。40 42

第三方口径能给一个交叉验证:Artificial Analysis 在 88 日的 v4.1.1 智能指数页面给 V4-Flash 0731 的 max effort 版本 52 分。34 这是九项评测的综合分,不等于图 01 的 Terminal-Bench 成绩。模型卡把 NL2Repo、DeepSWE、Cybergym 与 Toolathlon 列为公开基准,但表内结果仍由 DeepSeek 自测;DSBench-FullStack 与 DSBench-Hard 则明确是内部数据集。外部目前无法按同口径复现整张表。11 12 13

三层举手:摸底、抢跑、围观

964 条开发者记录不是一种行为。按归档内容拆开,评论区大致有三层。3 5

第一层,标准报名,占绝大多数。 按帖要求交出 GitHub ID 和代表作。归档按赛道粗分,coding agent 与 agent harness 两个赛道合计 287 仓,是项目最密集的两类:3

02七个代表赛道的仓库数(8/5 同一 stats 快照)
说明 · NOTE

七项均取社区仓库 showcase/data/stats.json 在 2026-08-05 生成的同一份快照。这里只展示 18 类中的七类;分类按 README 与描述粗分,存在噪音,不能按互斥份额解读。仓库数不等于开发者数,提交高星仓库链接的人也未必是作者。

这一层的名单很能说明覆盖面:归档或报名者自述中出现了 LLaMA-Factory 作者 hiyouga 提交的 PenguinHarness、Understand-Anything、字节的 deer-flow、camel-ai 核心开发者、LobeHub,以及 Rust 写的 VTCode。金融量化、EDA/CAE、科研、工业供应链等垂直场景也有项目提交。3 5 这不是一场 coding agent 的独角戏,而是 MCP、SDK、编排、客户端与记忆项目的一次集中点名。

第二层,抢跑对接,人少但信号强。 这层人不说「求内测」,说的是「我已经接上了」或「发布第一天我就能接」。协议中间件 ds2api(约 4.7k 星)先把 DeepSeek 兼容面打通;astral-code 基于 Codex 二开,接 Chat Completions 与 Anthropic Messages 两种协议;deepseek-kit 直接挂「DeepSeek-native」标签;deepseek-v4-for-copilot 把 V4 塞进 IDE 的模型选择器。3 5 个人开发者 zicode 自述用 V4-Flash 跑通 4 个本地 Codex 任务,合计花费 0.044 元人民币;这是单一任务组、单一来源,不能外推平均成本。15 另一位报名者贴出 V4-Flash 高思考强度下 TerminalBench 2.1 跑到 70.8% 的成绩(自报,未见第三方复现)。5

这一层要读准确:他们对接的是公开 API 与兼容协议,不是官方 Harness。崔添翼随后又征集能在发布时第一时间接入的 plugin、skill、MCP 与前端项目;公开动作指向的是 day-1 兼容准备,不是已经完成的适配。1

第三层,评测与安全项目最少。 归档中的 research-evaluation 与 security-governance 两个赛道合计 53 仓,约为 coding-agent 一类的三分之一。另有 pulse、agentsight 等可观测项目,但归档没有独立的 observability 分类,不能把它们计入这 53 仓。案例还包括 micro-eval、OpenBench、skillsbench、benchflow,以及 sandbox、decision-gate 类安全项目。3 5

行为量级观感对 Harness 的含义
一 · 标准报名GitHub ID + 代表作绝大多数有效回复生态覆盖面摸底
二 · 抢跑对接协议适配、二开、自报跑分、day-1 接入姿态少数,信号强发布接口与兼容性的压力测试
三 · 评测与安全research-evaluation + security-governance53生产就绪所需的验证与防护

元讨论也值得留一笔:一名报名者质疑流程为何索要身份证复印件,另有人询问闭源项目、纯用户、海外开发者能否报名;官方在公开线程里没有逐一回复。3 5

四类 Harness 已经各自站位

DeepSeek 要进入的不是空地。截至 89 日,市场上的代表产品可粗分为四种形态。32 33 35 36 43

产品形态模型策略协议与生态面计费口径
Claude CodeCLI、IDE、桌面、Web 与移动端Claude 模型族MCP、skills、hooks、子 agent、Agent SDK随 Claude 订阅方案提供
OpenAI Codex云任务 + CLI / IDEGPT-5.6 模型族GitHub 集成;MCP 支持 stdio 与 Streamable HTTP随 ChatGPT 方案提供,可用 credits 扩展
Qoder(阿里)独立开发桌面 + JetBrains + CLI自动路由,另支持 BYOKSpec 驱动 Quest + Repo Wikicredits 制,Pro $20/月起
opencode 等开源终端或 IDE agentBYOK,多提供商MIT 许可,插件与提供商选择面广软件免费,模型费用自付

评测要分轨看,混在一起会得出假结论。截至 89 日:11 25 26

轨道榜单与来源头部成绩口径边界
第三方同 Harness 重跑Artificial Analysis 用 Terminus 2 跑 Terminal-Bench 2.1GPT-5.6 Sol xhigh 89.5 · Claude Opus 5 max 89.1 · GPT-5.6 Terra max / Sol max / Claude Opus 5 xhigh 并列 88.0同一 Harness,模型与 effort 仍是联合变量
Agent + 模型提交Terminal-Bench 官方榜单Claude Code + Fable 5 83.8 · Codex + GPT-5.5 83.1与上一轨的 Harness、提交方式不同,不能直接排序
DeepSeek 官方自测模型卡,Harness minimal + max effortTerminal-Bench 2.1:V4-Flash 0731 82.7(见 图 01自家 harness 跑自家与友商模型,非独立轨

在 Artificial Analysis 的同一条轨道里,GPT-5.6 Sol xhigh 与 Claude Opus 5 max 只差 0.4 分。这个结果只能说明两套模型配置在 89 个终端任务上的通过率接近,不能外推为整体模型能力已经收敛。产品侧也不能靠一张榜单概括:Qoder 官方 1.0 页面称全球用户超过 500 万,并把 Quest、Repo Wiki 与多 agent 工程流程放在产品中心;这是厂商自报的采用规模,不是独立市场份额。33

生态厚度另有一张牌桌,星标只能看社区热度,不能替代能力评测。28 29 30 31

03四个 Harness 项目的 GitHub 仓库星标(8/8 快照)
说明 · NOTE

星标是社区热度,不是能力分。四个仓库的开放范围不同,不能把仓库星标直接等同于完整产品采用或产品能力。数据取 2026-08-08 北京时间 16:43 的 GitHub API 快照。

价格是 DeepSeek 已经占住的位置。图 04 只比较 88 日同一次 OpenRouter Models API 快照中的标准 prompt 单价;厂商直售价、其他版本和不同路由不在同一口径内。27

04OpenRouter 同渠道输入价与相对倍数(8/8 快照)
模型输入价($/M token)相对 V4 Flash 0731
Fable 5$10.00111.1×
Opus 4.8$5.0055.6×
GPT-5.6 Sol$5.0055.6×
Kimi K3$3.0033.3×
GLM-5.2$0.2522.8×
V4 Flash 0731$0.091.0×
说明 · NOTE

六项均取 2026-08-08 北京时间 16:42 的 OpenRouter /api/v1/models 标准 prompt 单价,按价格从高到低排列。相对倍数以同渠道 V4 Flash 0731 的 $0.09/M 为 1×,直接用价格相除。未计缓存、输出、促销后的加权均价或具体 provider 路由差异,价格会变化。DeepSeek 官方直连接口同期为输入 $0.14/M、输出 $0.28/M,与表中的 OpenRouter 0731 路由价不是同一渠道。

DeepSeek 已经露出的打法

把这些公开材料放在一起,DeepSeek 的打法已经露出轮廓,尽管官方对 Harness 产品本身披露很少。

观点OPINION
  • 协议先行,前端后至。 V4-Flash 同时支持 Chat Completions、Anthropic 格式与 Responses API,先把模型接进兼容前端,再等自己的 Harness 发布。协议覆盖面和低 API 价格共同降低了接入门槛。38 39
  • 招募帖同时在摸生态与接入意愿。 它收集了谁在做哪一层,也筛出了愿意在发布日接入的项目。归档中没有检出 fork 官方 Harness 的明确记录,说明公开样本还不能回答真实兼容性;压力测试要等产品和接口公开后才开始。
  • Harness 已经进入评测口径。 DeepSeek 用 Harness minimal mode 跑 0731,也把友商模型放进同一张表,并写明框架将在后续发布。外界目前无法拆开模型与 Harness 各自贡献了多少。11 24
  • 难点不只在 loop。 归档里 coding-agent 与 agent-harness 合计 287 仓,research-evaluation 与 security-governance 合计 53 仓。Harness 想成为生产级产品,验证、恢复、观测与安全这几层可能比再做一个执行循环更难。
  • 信任成本是真实风险。 报名者对身份证复印件、海外参与和闭源项目资格提出疑问,官方没有在公开线程里逐一作答。一次招募帖攒下的社区好感,会在筛选不透明时快速折旧。
事实 / FACTS
  • 当前可核的官方载体包括招募帖、模型卡与 DeepSeek GitHub 组织;模型卡写明框架将在后续发布,官方 GitHub 组织尚无同名仓库。1 11 41
  • V4-Flash 0731 官方自测 Terminal-Bench 2.182.7,使用未发布的 Harness minimal mode、max effort;DSBench 两项为内部数据集。11 12
  • V4-Flash API 同时支持 Chat Completions、Anthropic 格式与 Responses API;缓存未命中的输入为 $0.14/M,输出为 $0.28/M。38 39
  • Artificial Analysis 用 Terminus 2 独立重跑 Terminal-Bench 2.1,GPT-5.6 Sol xhigh 为 89.5、Claude Opus 5 max 为 89.1;GPT-5.6 Terra max、GPT-5.6 Sol max 与 Claude Opus 5 xhigh 并列 88.025
假设 / ASSUMPTIONS
  • 社区归档与媒体早期快照生成时间不同,不能用两者的差额计算新增报名;归档中的 strong_application 也不是官方筛选结果。3 6 37
  • 归档赛道划分含分类噪音;提交高星仓库链接的人未必是作者本人。3
  • 开发者个人跑分(TerminalBench 70.8%、4 个 Codex 任务合计 0.044 元)均为单一来源,未见第三方复现。5 15
观点OPINION
  • DeepSeek 的顺序像是先用协议兼容把 V4 接进现有前端,再用 Harness 收自己的前端;招募帖是这个顺序里的生态侦察,不是产品发布。
  • 单一榜单上的接近不能证明底模能力整体收敛;它提示读者把模型、Harness 与 effort 当作联合系统来比较。

模型与 Harness 轮流抬高上限

最后判断 · BOTTOM LINE观点OPINION

发布后的三项硬证据是:第三方能否复现官方成绩,失败能否稳定回流评测与后训练,兼容项目能否沉淀为长期采用。只有三项同时成立,110 的工程速度才会变成可靠产品。

  1. Q1DeepSeek Harness 正式发布时的形态是什么——终端 agent、桌面端,还是云沙箱?定价会不会延续 V4-Flash 的低价策略?
  2. Q2第三方用公开的 Harness 重跑 0731,能否复现官方模型卡里的 82.7?max 与默认 high 档的体感差距有多大?
  3. Q3Harness 暴露出来的失败,能不能被稳定送回评测、后训练与基础研究,形成下一轮模型改进?
  4. Q4用户侧表现接近时,有多少来自底模本身,有多少来自工具、上下文、验证与恢复的工程优化?
  5. Q5中国厂商在 1→10 工程化上的速度,能否转成可靠性、生态采用与可持续收入,而不只是更低价格?

参考资料

展开其余 40
  1. 崔添翼 — DeepSeek Harness 内测招募原帖(2026-08-01
  2. 凤凰网科技 — DeepSeek Harness 启动内测,面向开源开发者开放招募(2026-08-02
  3. Octo-o-o-o — deepseek-harness-applicants 社区归档仓库
  4. deepseek-harness-applicants 可读站点
  5. zensh — DeepSeek Harness 内测申请汇总与分析报告(2026-08-02
  6. 智东西 — 开发者排队「投简历」,DeepSeek 一条内测帖变成 Agent 开源大摸底(2026-08-04
  7. 钛媒体 — 梁文锋有了「隆中对」(2026-05-23
  8. 智源社区 — DeepSeek 缺 Agent 人才缺疯了(2026-06-23
  9. 腾讯云开发者 — DeepSeek 缺人缺疯了,崔添翼满世界贴小广告(2026-07-10
  10. AIHub — DeepSeek-V4-Flash 正式版 API 开启公测(2026-07-31
  11. DeepSeek 官方模型卡 — DeepSeek-V4-Flash-0731(Hugging Face)
  12. 36氪 — MiniMax H3、Seedance 2.5、DeepSeek V4 全来了(2026-08-03
  13. alphalab — DeepSeek V4 Flash 0731:后训练把开放权重 Agent 性价比再推一步(2026-08-03
  14. apidog — DeepSeek-V4-Flash Now Supports the Responses API and Codex(2026-07-31
  15. zicode — DeepSeek V4-Flash 跑 Codex 实测:4 个任务全过,花费不到 5 分钱(2026-08-01
  16. cnblogs · sing1ee — Qwen 3.8 Max vs GLM 5.2 vs Kimi K3 vs DeepSeek V4 Flash(2026-08-03
  17. morphllm — Best AI Coding Agent 20262026-08-05 核验)
  18. CatDoes — Claude Code vs OpenAI Codex 20262026-07-31
  19. CodingFleet — FrontierCode v1.1 Main Leaderboard 20262026-07-25
  20. toolcenter.ai — Qoder Review 2026:Alibaba's Agentic Coding IDE Tested(2026-07-22
  21. AI星球 — Qoder 深度评测:阿里 Agentic 编程平台的真实水平(2026-05-03
  22. aitrendtool — Qoder 定价与用户口径(2026-07-15
  23. Spectrum AI Lab — AI Coding Tools Pricing 20262026-07-23
  24. einkcn — DeepSeek 下一张牌(2026-08-02
  25. Artificial Analysis — Terminal-Bench v2.1 独立榜单(2026-08-09 核验)
  26. Terminal-Bench — terminal-bench@2.1 官方提交榜(2026-08-08 核验)
  27. OpenRouter — Models API 动态价格(2026-08-08 快照)
  28. GitHub API — anomalyco/opencode 星标
  29. GitHub API — anthropics/claude-code 星标
  30. GitHub API — google-gemini/gemini-cli 星标
  31. GitHub API — openai/codex 星标
  32. OpenAI Docs — Codex 的 MCP 支持
  33. Qoder — Qoder 1.0 与厂商自报用户口径
  34. Artificial Analysis — DeepSeek V4 Flash 0731 模型页
  35. Anthropic — Claude Code 平台与集成
  36. OpenAI Docs — ChatGPT Work 与 Codex 价格方案
  37. 社区归档 — 2026-08-05 stats.json 快照
  38. DeepSeek API Docs — Responses API
  39. DeepSeek API Docs — Models & Pricing
  40. DeepSeek API Docs — Chat Completions 与 reasoning effort
  41. DeepSeek — 官方 GitHub 组织(2026-08-08 核验)
  42. DeepSeek API Docs — Thinking Mode 与 effort 档位
  43. Qoder Docs — 官方个人方案定价

版本记录v1.0 首发 · v1.12026-08-09 更新 · 动态榜单、价格和星标均采用带时间的快照,官方来源边界已补齐。

数据核验截至 2026-08-09。公开材料只确认 DeepSeek Harness 正在招募意向参与者;本文核对的招募帖、官方模型卡与官方 GitHub 组织未提供内测已经启动、资格已经发放或 Harness 已开源的信息。评论区的协议适配、二开与跑分均不等于接入官方 Harness。生态规模取社区非官方归档在 85 日生成的同一份 stats 快照,媒体早期快照另行标注。DeepSeek 模型卡成绩属于厂商自测;Artificial Analysis 与 Terminal-Bench 官方榜单按各自 Harness 和 effort 口径单列,不直接互比。OpenRouter 价格与 GitHub 星标为 88 日动态快照,Artificial Analysis 榜单为 89 日快照。本文不构成投资建议。

本文包含前瞻性陈述与示意性估算,仅供研究与信息参考,不构成对任何证券的买卖要约或投资建议。所引数据可能与最终披露存在差异,读者应独立核实并自行判断。

分享 / SHARE