从原型到生产

生产就绪的 Skill 分级

级别 能力 审查要求 示例
Read-Only 只能获取、查询、描述数据 领域团队批准 评论总结、门店定位
Draft-Only 生成内容供人工审查,不能发送/提交 领域团队 + 格式所有者 客户邮件草稿
Action-Allowed 执行不可逆操作 领域团队 + 安全/合规 + 高管签字 退款、发送消息

pass^k 指标

衡量持续成功而非偶尔成功:运行评估 k 次,要求每次都成功。

  • GPT-4o 在 tau-bench 上:pass^1 = 61%,pass^8 < 25%
  • 单轮成功是生产可靠性的差预测指标

Token 经济学

┌────────────────────────────────────────────────────────────┐
│  单一大提示词 (50 workflows)                               │
│  每轮: ~15,000 tokens                                      │
│                                                            │
│  vs                                                        │
│                                                            │
│  Skills 库 (50 skills)                                     │
│  - 元数据: ~4,000 tokens (始终加载)                        │
│  - 激活 Skill 正文: ~2,000 tokens                          │
│  - 总计: ~6,000 tokens                                     │
│                                                            │
│  减少: > 60% token 消耗                                    │
│  可用能力: 同样 50 个,但按需加载                          │
└────────────────────────────────────────────────────────────┘

上下文腐烂研究

  • Lost in the Middle (Liu et al., TACL 2024): 相关信息位于输入开头或结尾时性能最高,中间最差
  • Context Rot (Chroma Research, 2025): 18 个前沿模型都随输入增长而性能下降,即使任务难度不变