如何评估 Skills?
四种失败模式
根据 SkillsBench (2025) 对 84 个真实任务的研究,19% 的 Skill 反而降低了能力。失败分为四类:
- Trigger Failure(触发失败): 错误的 Skill 触发,或正确的 Skill 未触发
- Execution Failure(执行失败): Skill 触发正确,但输出或工具调用错误
- Token Budget Failure(Token 预算失败): 庞大的 Skill 正文挤占上下文窗口
- Regression(回归): 新增 Skill 与现有 Skill 重叠,破坏原有路由
评估工具箱
| 测试模式 | 描述 | 解决的失败模式 |
|---|---|---|
| Eval-as-Unit-Test | CI 中每次变更运行测试 | 全部 |
| Golden Dataset | 版本化的输入/预期输出对 | 执行、触发 |
| LLM-as-Judge | 同行模型按评分标准评估 | 执行 |
| Adversarial/Red-Team | 系统性探测以暴露失败模式 | 触发、执行 |
| Canary/Shadow Mode | 受控流量部署 | 回归 |
触发准确率标准
要达到行业标准 90% 触发准确率,description 必须通过四个检查:
- 可测试的具体性: 写 3 个正面触发和 3 个负面触发
- 清晰性: 模糊查询不与相邻 Skill 重叠
- 执行保真度: 描述实际性能,而非期望行为
- 重述稳定性: 无论用户如何措辞,都能一致路由
关键发现:隔离评估是陷阱
“Never evaluate a skill purely in isolation.”
生产中的 Agent 同时加载 5-15 个 Skills。超过 5,000 tokens 的 Skill 正文在隔离测试中可能完美运行,但在共载时会导致上下文腐烂。
MCPVerse 研究: Claude-4-Sonnet 因工具扩散和上下文注意力竞争导致 18.2% 准确率下降。