如何评估 Skills?

四种失败模式

根据 SkillsBench (2025) 对 84 个真实任务的研究,19% 的 Skill 反而降低了能力。失败分为四类:

  1. Trigger Failure(触发失败): 错误的 Skill 触发,或正确的 Skill 未触发
  2. Execution Failure(执行失败): Skill 触发正确,但输出或工具调用错误
  3. Token Budget Failure(Token 预算失败): 庞大的 Skill 正文挤占上下文窗口
  4. Regression(回归): 新增 Skill 与现有 Skill 重叠,破坏原有路由

评估工具箱

测试模式 描述 解决的失败模式
Eval-as-Unit-Test CI 中每次变更运行测试 全部
Golden Dataset 版本化的输入/预期输出对 执行、触发
LLM-as-Judge 同行模型按评分标准评估 执行
Adversarial/Red-Team 系统性探测以暴露失败模式 触发、执行
Canary/Shadow Mode 受控流量部署 回归

触发准确率标准

要达到行业标准 90% 触发准确率,description 必须通过四个检查:

  1. 可测试的具体性: 写 3 个正面触发和 3 个负面触发
  2. 清晰性: 模糊查询不与相邻 Skill 重叠
  3. 执行保真度: 描述实际性能,而非期望行为
  4. 重述稳定性: 无论用户如何措辞,都能一致路由

关键发现:隔离评估是陷阱

“Never evaluate a skill purely in isolation.”

生产中的 Agent 同时加载 5-15 个 Skills。超过 5,000 tokens 的 Skill 正文在隔离测试中可能完美运行,但在共载时会导致上下文腐烂。

MCPVerse 研究: Claude-4-Sonnet 因工具扩散和上下文注意力竞争导致 18.2% 准确率下降。