1. 评测范围与任务契约
评哪个 Agent、什么任务、什么环境必须写清;不评项显式列出。禁止默认可评全世界。
会写提示词 ≠ 能验收。分层、多跑置信区间、双裁判一致性、污染隔离——按严肃评测结案。
Harness 货架 × IronHive 门禁密度 × V1.2 绝对顶流评测核。不是 Arena SaaS,是可安装的顶流工法。
痛点
语气友好就说调通了、改提示词不回归、安全用例从不跑——本包把门禁焊在评测面上。
流水线
工法同构 Harness;肉是评测。P06 四铁律逐字;D 组专项不可删。
Agent/任务/环境;显式写出「不评什么」。
模型/提示词版本/入口;触点可口述。
设计门禁 → 用例集 → 评分跑分 → 回归矩阵。
证据≥4;缺口禁装有;REPORT + Exit E1–E8。
P06 四铁律 · 逐字
评哪个 Agent、什么任务、什么环境必须写清;不评项显式列出。禁止默认可评全世界。
case 含 input + gold/rubric;必须同时有 must_pass 与 must_fail。空口「感觉对」无效。
正确性·完整性·安全边界·格式契约。总分阈值写死;must_fail 未拒答直接 FAIL。
改 prompt/模型必须重跑矩阵。缺用例类型 → 未覆盖,禁止装全面。
Exit E1–E8
评测核 · V1.2 绝对顶流
在 V1.1 判别力之上,补齐严肃评测工法——删掉只剩四标题就是换皮失败。
金样
分层用例、N=3 多跑、Wilson 下界、IRR、污染清单齐备——仍然套件 FAIL,不许装好看。
货架文案用评测词,不出现接手判决 / 九阶段制造。
上手 · 三端配置
包内有 docs/TOOL-SETUP.md、CLAUDE.md、AGENTS.md、01-quickstart.md。先 doctor 绿再开案。
下载 agent-eval-v1.zip,解压后在包根执行:
powershell -ExecutionPolicy Bypass -File .\install.ps1 powershell -File .\scripts\doctor.ps1 # 看到 READY
.cursor/skills/agent-eval/,Reload WindowCLAUDE.md(或 .claude/skills/)AGENTS.md读取 OVERVIEW.md 与 skills/agent-eval/SKILL.md (Claude 先 CLAUDE.md;Codex 先 AGENTS.md)。 对 fixtures/eval-lab 从 /eval authorize continue 到 P12。absolute_tier=true。 最终 REPORT.md + Exit E1–E8。 先 doctor,再 verify-gold。
/eval continue · /eval status。
与邻包怎么摆
风险卡 · P0–P3 · 十二问 · 接手判决。
契约 → 用例 → 评分卡 → 回归 → 套件判决。
数字商品一经下载不支持退款。不含代跑评测、未授权调用生产 Agent、零缺陷承诺、IronHive 企业运行时。