Skip to content

Harness Score你的 AI 编码 harness 有多成熟?

一条确定性命令,测量面向 Cursor、Claude Code、Windsurf 等工具的 AI 编码 harness。扫描 AGENTS.md、rules、hooks、测试与 CI。扫描过程不调用大模型、不联网,同一 commit 分数始终一致。

Harness Score

问题

AI 智能体的可靠性取决于其 harness。

两个仓库可以运行同一模型,结果却天差地别。一个有引导智能体的指南、验证工作的传感器、阻止损害的 guardrails — 另一个什么都没有。Harness Score 在几秒内测量该 harness,适用于任何 AI 工具,并指出下一步该改进什么。

工作原理

1

扫描

在仓库中运行 npx harness-score。CLI 只读文件系统 — 36 项 check,零大模型调用,零网络。

2

定级

获得 L0–L4 成熟度等级、六个维度的 108 分细分,以及阻碍下一等级的具体差距。

3

修复

每项失败的 check 都链接到指南中的修复方案 — 或使用编辑器插件的 /harness-audit 命令应用修复。

示例输出

诊断,而非直觉

确定性:同一 commit,同一分数 — 本地或 CI 结果一致。用 --min-level 3 门禁合并,让成熟度只升不降。

运行扫描器 →
  harness-score v1.0.0  ~/my-app

  Maturity: L2 · Guided   Score: 70/108 (65%)
  Detected: Cursor, Claude Code

  Context & Guides     ████████████████░░░░  80%
  Skills & Commands    █████████████░░░░░░░  65%
  Hooks & Guardrails   ░░░░░░░░░░░░░░░░░░░░   0%
  Sensors & Feedback   ████████████████░░░░  80%
  CI Feedback          ██████████████░░░░░░  71%
  Hygiene & Safety     ███████████████░░░░░  74%

  To reach L3: sensors ≥ 60%; ci ≥ 50%

开始

在任何工作环境中安装

成熟度阶梯

五个可测量、可门禁的等级

等级取决于 harness 的形态 — 不仅是分数。文档满分但零测试仍是 L1,不是 L3。

完整成熟度模型 →

兼容

任何 AI 编码工具

一个 harness、一个成熟度模型、多种工具。配置 Cursor、Claude Code、Windsurf 或其他 AI 工具 — Harness Score 以相同方式测量它们。

Cursor旗舰
Claude Code已支持
Windsurf已支持
Cline已支持
Continue已支持
Codex已支持
了解多 harness 支持 →

展示分数

README 品牌徽章

112×20 胶囊形徽章,适合 README shield 行。CI 自动更新,或固定静态 badge-lN.svg。可复制 Markdown、HTML、iframe 与 JSX 嵌入代码。

Harness Score live badge
Harness Score L4 · 自我纠正分享卡片

本仓库包含