评估框架:验证 Agent 是否达标
安全 ≠ 有效性
关键区分:
Security(安全):
• Agent 是否在边界内运行
• 无恶意行为
• 无超出授权
Evaluation(评估):
• 边界内行为是否有价值
• 是否理解用户意图
• 输出质量如何
白皮书明确指出:
A vibe-coded agent can pass every security check and still fundamentally misread the developer’s intent, ignore project conventions, or silently degrade user experience.
— Vibe-coded Agent 可以通过所有安全检查,但仍然根本性地误解开发者意图、忽略项目规范或静默降级用户体验。
为什么 Vibe Coding 评估不同
三大独特约束:
| 约束 | 描述 | 影响 |
|---|---|---|
| Underspecification Gap(规格缺口) | 无完整规格;用户自然语言提示天生规格不足 | “Make the dashboard load faster” 不是测试案例;依赖模型潜在知识、审美判断、领域专长填充操作缺口 |
| 用户无法验证输出 | 非技术用户无法逐行审查 600 行代码;技术工程师实时也无法做到 | “Agent 认为成功” 和”代码实际正确”之间的差距比任何其他 Agent 类别都大 |
| Session Iterative + Codebase State(会话迭代 + 代码库状态) | 每轮修改真实文件;早期错误决策复合 | 必须覆盖多轮对话完整弧线,而非单轮决策 |
关键洞察:
The prompt relies entirely on the foundation model’s latent knowledge, aesthetic judgment, and domain expertise to fill in the operational gaps.
— 提示词完全依赖基础模型的潜在知识、审美判断和领域专长来填充操作缺口。
评估框架结构
两个范围外领域(需要专门处理):
- Subjective evaluation of non-verifiable outputs:质量由用户/企业偏好而非地面真理定义
- Feedback loop from user corrections:用户修正反馈回模型、框架或评估套件以驱动改进