# 研究备忘：Spec / Skill / Harness 正在成为代码生产核心资产

日期：2026-05-10

## 一句话结论

判断成立，而且不是单点热词：代码生产正在从“提示词驱动的一次性交付”转向“Spec 定义意图、Skill 复用能力、Harness 验证执行”的资产化生产体系。

真正的壁垒不再是某条 prompt，而是可版本化、可测试、可复用、可审计的结构化上下文。

## 关键证据

### 1. Spec：从文档变成生产约束

- GitHub `spec-kit` 明确把 Spec-Driven Development 定义为：规格不再是一次性脚手架，而是“可执行”的核心资产；开发从 vibe coding 转向 product scenarios + predictable outcomes。
- 公开案例“5 人 7 天干完 20 人数周的活”把 SDD 描述为：以规格说明为唯一真实来源，代码是派生产物。
- 这说明 AI 编程的瓶颈已经不是“会不会生成代码”，而是能不能把 WHAT、边界、验收、约束先结构化。

### 2. Skill：从 SOP 文档变成模型可加载的能力单元

- Anthropic Agent Skills 把 skill 定义为包含 `SKILL.md`、脚本和资源的目录，并用 progressive disclosure 分层加载：启动时只加载 name/description，相关时再加载完整说明和附加资源。
- Perplexity Agent Skills 方向也强调：写 Skill 不是写代码，而是为模型构建上下文。
- 这与我们自己的 OpenClaw/XMate 实践一致：把 X 情报日报从 cron prompt 长规则，迁移为 `x-intel-daily` skill，减少 always-on 噪声，把能力变成可维护资产。

### 3. Harness：从工具调用变成可恢复、可审计的执行环境

- `browser-use/browser-harness` 定位为 thin editable CDP harness，让 LLM 连接真实浏览器；关键不是“点按钮”，而是 agent 可补 helper、自愈、沉淀 domain skills。
- `vercel-labs/deepsec` 是 security harness，用 coding agents 找代码漏洞，说明“写完之后如何验证/审计”正在产品化。
- `CubeSandbox`、`Mirage`、`codeburn` 分别对应沙箱、虚拟文件系统、成本观测，说明 Agent 运行时正在成为新基础设施。

### 4. Artifact 项目证明生产对象也在变

- `open-slide`：agent-native slide framework，内置 `/create-slide`、`/slide-authoring`、`/apply-comments`，把 PPT 变成 React + 技能化工作流。
- `open-design`：本地优先 Claude Design 替代方案，围绕 coding agents、skills、design systems、导出能力构建。
- `DESIGN.md`：为 coding agents 描述视觉身份的格式规范，让设计系统变成持久结构化上下文。

这些项目说明：AI 交付物不止是代码，还包括 PPT、HTML、原型、设计系统、安全报告；它们都需要 Spec / Skill / Harness，而不是 prompt。

## 我们数据源里的信号

来自 2026-05-10 AI 世界日报与 `/tmp/ai-world-daily-test-data.json`：

| 项目 | 类型 | 创建时间 | Stars | 最近更新 | 判断 |
|---|---:|---:|---:|---:|---|
| github/spec-kit | SDD 工具链 | 2025-08-21 | 94.5k | 2026-05 页面可见活跃 | Spec 成为 AI coding 入口资产 |
| nexu-io/open-design | Artifact / Skill | 2026-04-28 | 35,334 | 2026-05-10 | 设计/原型/方案进入 Agent skill 化 |
| 1weiho/open-slide | Artifact / Skill | 2026-04-26 | 2,794 | 2026-05-10 | PPT 生成转为 agent-native runtime |
| google-labs-code/design.md | Spec / Design context | 2026-04-10 | 12,367 | 2026-05-10 | 视觉身份变成 coding agent 可读格式 |
| browser-use/browser-harness | Harness | 2026-04-17 | 11,840 | 2026-05-10 | 浏览器执行需要可恢复 harness |
| vercel-labs/deepsec | Security harness | 2026-04-30 | 2,005 | 2026-05-10 | AI coding 后验验证产品化 |
| jherrodthomas/automotive-skills-suite | 行业 Skill | 2026-05-01 | 1,058 | 2026-05-10 | 汽车行业知识可被打包成 skills |

## 范式变化：旧生产线 vs 新生产线

### 旧范式：Prompt → Code → 人肉验收

- 上下文在聊天窗口里，难复用。
- 质量依赖操作者经验，难规模化。
- 交付后缺少可追踪因果链。
- Prompt 库容易膨胀，但没有执行保证。

### 新范式：Spec → Plan/Tasks → Skill → Harness → Artifact → Wiki/Memory

- Spec 定义业务意图、边界、验收标准。
- Skill 封装领域知识、操作流程、坑点、脚本。
- Harness 负责工具执行、环境隔离、失败恢复、自动验证。
- Artifact 是可交付结果：代码、PPT、HTML、原型、安全报告。
- Wiki/Memory 负责把成功经验再沉淀成下一轮资产。

## 对 ABU9 的含义

### 1. AI 项目交付要升级为 SDD

每个 AI 试点先产出一份 Spec：

- 业务目标：解决哪个经营/交付问题。
- 输入输出：接哪些系统、出什么结果。
- 权限边界：能读什么、能写什么、谁审批。
- 验收标准：准确率、时延、召回、人工确认、回滚。
- 风险清单：隐私、合规、误操作、客户现场限制。

这会减少“先 demo、后返工”的成本。

### 2. 做汽车行业 Skill Graph，而不是 prompt 库

已有记忆里，亮哥认可过 Skill Graph / Pack 2.0：pack 是砖，graph 是建筑结构；适用车间体系、销售体系、交付体系、汽车行业知识库、企业方法论沉淀。

建议第一批沉淀：

- 售后诊断 Skill
- DMS/CRM 流程 Skill
- ISO 26262 / ASPICE / 网络安全审计 Skill
- 售前方案生成 Skill
- 客户汇报 PPT/HTML Artifact Skill

### 3. Harness 是企业客户敢不敢用的关键

车企客户不会只问“模型聪不聪明”，会问：

- 出错能不能复盘？
- 权限能不能限制？
- 数据能不能不出域？
- 执行能不能回滚？
- 每次结果有没有验收证据？

所以 ABU9 的 AI 方案要把 Harness 作为卖点：沙箱、审计、验收、成本、回滚。

## 对 OpenClaw 的含义

OpenClaw 应该把自己定位成“Agent 运行时 + 知识资产操作系统”，而不是聊天机器人壳。

优先能力：

1. Skill 版本化、依赖、质量门。
2. Spec 模板与任务拆解链路。
3. Browser / desktop / shell harness 的可恢复执行。
4. 沙箱隔离与权限审批。
5. token/成本/模型路由观测。
6. Wiki 回写：每次高价值任务后自动沉淀为 Spec/Skill/Harness 资产。

## 建议立刻做的 3 件事

1. **做一个 ABU9 AI 交付 Spec 模板**：用于 Harley、Hyundai、BAIC 三个试点。
2. **做一个“客户方案 Artifact Skill”**：输入客户背景 + 产品能力，输出 Markdown + HTML/PPT 初稿。
3. **做一个汽车售后诊断 Harness POC**：RAG + 工单/故障码 + 验收测试 + 人工确认链路。

## 研究判断

这条主线值得持续跟踪，权重应提升。短期看它影响 AI coding；中期会影响企业交付方法论；长期看，它会决定组织是否能把 AI 产出变成复利资产。

如果 ABU9 只买工具账号，收益是一次性的；如果 ABU9 建 Spec / Skill / Harness 资产库，收益会复利。