从原型到生产
生产就绪的 Skill 分级
| 级别 | 能力 | 审查要求 | 示例 |
|---|---|---|---|
| Read-Only | 只能获取、查询、描述数据 | 领域团队批准 | 评论总结、门店定位 |
| Draft-Only | 生成内容供人工审查,不能发送/提交 | 领域团队 + 格式所有者 | 客户邮件草稿 |
| Action-Allowed | 执行不可逆操作 | 领域团队 + 安全/合规 + 高管签字 | 退款、发送消息 |
pass^k 指标
衡量持续成功而非偶尔成功:运行评估 k 次,要求每次都成功。
- GPT-4o 在 tau-bench 上:pass^1 = 61%,pass^8 < 25%
- 单轮成功是生产可靠性的差预测指标
Token 经济学
┌────────────────────────────────────────────────────────────┐
│ 单一大提示词 (50 workflows) │
│ 每轮: ~15,000 tokens │
│ │
│ vs │
│ │
│ Skills 库 (50 skills) │
│ - 元数据: ~4,000 tokens (始终加载) │
│ - 激活 Skill 正文: ~2,000 tokens │
│ - 总计: ~6,000 tokens │
│ │
│ 减少: > 60% token 消耗 │
│ 可用能力: 同样 50 个,但按需加载 │
└────────────────────────────────────────────────────────────┘
上下文腐烂研究
- Lost in the Middle (Liu et al., TACL 2024): 相关信息位于输入开头或结尾时性能最高,中间最差
- Context Rot (Chroma Research, 2025): 18 个前沿模型都随输入增长而性能下降,即使任务难度不变