扫描
在仓库中运行 npx harness-score。CLI 只读文件系统 — 36 项 check,零大模型调用,零网络。
问题
两个仓库可以运行同一模型,结果却天差地别。一个有引导智能体的指南、验证工作的传感器、阻止损害的 guardrails — 另一个什么都没有。Harness Score 在几秒内测量该 harness,适用于任何 AI 工具,并指出下一步该改进什么。
工作原理
在仓库中运行 npx harness-score。CLI 只读文件系统 — 36 项 check,零大模型调用,零网络。
获得 L0–L4 成熟度等级、六个维度的 108 分细分,以及阻碍下一等级的具体差距。
每项失败的 check 都链接到指南中的修复方案 — 或使用编辑器插件的 /harness-audit 命令应用修复。
harness-score v1.0.0 ~/my-app
Maturity: L2 · Guided Score: 70/108 (65%)
Detected: Cursor, Claude Code
Context & Guides ████████████████░░░░ 80%
Skills & Commands █████████████░░░░░░░ 65%
Hooks & Guardrails ░░░░░░░░░░░░░░░░░░░░ 0%
Sensors & Feedback ████████████████░░░░ 80%
CI Feedback ██████████████░░░░░░ 71%
Hygiene & Safety ███████████████░░░░░ 74%
To reach L3: sensors ≥ 60%; ci ≥ 50%开始
成熟度阶梯
等级取决于 harness 的形态 — 不仅是分数。文档满分但零测试仍是 L1,不是 L3。
兼容
一个 harness、一个成熟度模型、多种工具。配置 Cursor、Claude Code、Windsurf 或其他 AI 工具 — Harness Score 以相同方式测量它们。
展示分数
112×20 胶囊形徽章,适合 README shield 行。CI 自动更新,或固定静态 badge-lN.svg。可复制 Markdown、HTML、iframe 与 JSX 嵌入代码。
本仓库包含