DeepSeek Harness 组这次招聘最有信息量的句子是“Model + Harness = Agent”。它把 Agent 的竞争拆成两部分:模型给出能力上限,Harness 负责把能力接到任务、工具、上下文、评测和产品闭环里。
Harness 的边界
JD 的定义很直接:除模型本身以外的所有工作,都属于 Harness。
这句话让讨论从 prompt engineering 进入系统层。Prompt 是入口,Harness 覆盖上下文管理、长期记忆、工具接口、Subagent、Multi-Agent、评测、数据标注、真实任务反馈、用户社群、产品指标,以及通往模型训练团队的反馈链路。
Agent 可以理解为被运行时和反馈系统稳定调度的模型能力。这也是为什么 Learn 主线从 Agent loop、工具、记忆、评测 一路讲到 生产化,再处理 prompt 模板这种局部技巧。
三类岗位的分工
| 角色 | 主要问题 | JD 里的关键词 |
|---|---|---|
| 研究员 | 前沿在哪里 | 上下文、长期记忆、Subagent、Multi-Agent、自进化 Agent、benchmark、标注策略 |
| 工程师 | 怎样产品化 | 桌面端 Agent、技术架构、工具链、内部真实任务、开发者体验、质量保证 |
| 产品经理 | 是否真的有用 | 路线图、用户需求、社群反馈、问卷访谈、A/B 测试、灰度、统计分析 |
这套分工已经超出“研究提出需求、工程实现、产品包装”的传统流水线。三者共同维护一个闭环:真实任务产生 trace 和反馈,Harness 团队调整工具、上下文、评测和产品,模型团队再吸收其中可训练的部分。
技能树
1. Agent 原语
三份 JD 都点名 LLM API、KV Cache、Agent Loop、Tool Use、Reasoning、Planning、Skills、MCP、Memory、Subagent、Multi-Agent。候选人至少要理解 Agent 如何跨步骤持续行动;模型 API 只是底层入口。学习入口是 Agent 基础 和 设计模式。
2. Context Engineering
上下文的重点在信息调度:何时出现、以什么结构出现、由谁压缩、何时写入长期记忆、何时丢弃。长期任务能不能稳定推进,往往取决于这层,比 prompt 再多一段约束更关键。Claude Code 的 Context 和 CLAUDE.md,OpenClaw 的 Memory,都适合从这里切入。
3. 工具和运行时
工程师岗位明确写到桌面端 Agent 产品。桌面端意味着文件、应用、权限、状态恢复、本地上下文和安全边界。工具名、参数、返回结构、错误类型和权限策略,都会影响模型怎么计划。MCP 与 Skills 的价值在这里:把能力封装成可组合、可审查、可复用的接口。参见 MCP 与 Skills,以及 Claude Code 的 MCP、Hooks、Subagents 和 OpenClaw 的 Tools、Workspace、Security。
4. Evaluation 与数据
研究员要设计 benchmark 和标注策略,PM 要做问卷、访谈、A/B 测试和统计分析,工程师要用内部真实任务迭代能力。三条线都在提醒一件事:靠体感调 Agent 不够了。eval 让变化可比较,真实任务让 benchmark 接地,产品指标让研究进展回到用户价值。参见 Evaluation、Production,以及 Claude Code 的 Debugging。
5. Model-Harness 共进化
JD 反复提到和模型训练团队深度合作。Harness 在这里充当模型训练的反馈源和适配层。传统 benchmark 看单题结果;Harness 更关心模型在循环里的表现:是否选对工具,是否根据 observation 修正计划,是否能整合子 Agent 结果,是否在该拒绝时拒绝。再往下走,就是 SFT for Agents 和 LLM Serving 关心的问题。
6. 模型表现判断力
三类岗位都要求候选人是 Agent 产品高强度用户。PM JD 还列出 Claude Code、Cowork、Codex、Cursor、OpenCode、GitHub Copilot、Manus、OpenClaw、Hermes。这里考察的是对模型表现的细微判断:顺从、幻觉、懒调用工具、过早结束、错误自信、上下文漂移。Claude Code 的 Plan Mode 和 OpenClaw 的 Operations,都适合用来观察这些边界。
7. Agent-native 执行
研究员要快速把 idea 变成原型,工程师要在陌生栈里保证质量,PM 也要能 vibe coding 和做原型。Harness 团队默认用 Agent 做 Agent 工作。不会指挥 Agent 的人,很难跟上这种迭代节奏。这里可以直接看 Claude Code 的 Workflows、Automation,以及 OpenClaw 的 Multi-Agent。
对学习者的含义
这份 JD 给出的学习顺序很清楚:
- Agent loop、 tool use、 memory、planning。
- MCP、Skills、工具设计和权限边界。
- Eval 、trace、标注数据和真实任务回放。
- Subagent、Multi-Agent 和任务拆解。
- Production 、成本、安全、用户反馈和产品指标。
这也把两种能力分开了:“会用 Agent”提升个人效率,“会指挥 Agent”要求系统判断。DeepSeek Harness 组要招的,是能在模型、运行时、评测和产品之间来回切换的人。
结论
DeepSeek 这组 JD 的价值,是把 Agent 岗位的能力模型讲清楚了。模型层仍然重要,但 Agent 产品的胜负越来越多发生在模型外:上下文怎么组织,工具怎么设计,trace 怎么回放,eval 怎么定义,真实反馈怎么进入下一轮迭代。
Prompt 是入口。Harness 是复利资产。