评估框架:验证 Agent 是否达标

安全 ≠ 有效性

关键区分

Security(安全):
• Agent 是否在边界内运行
• 无恶意行为
• 无超出授权

Evaluation(评估):
• 边界内行为是否有价值
• 是否理解用户意图
• 输出质量如何

白皮书明确指出

A vibe-coded agent can pass every security check and still fundamentally misread the developer’s intent, ignore project conventions, or silently degrade user experience.

— Vibe-coded Agent 可以通过所有安全检查,但仍然根本性地误解开发者意图、忽略项目规范或静默降级用户体验。

为什么 Vibe Coding 评估不同

三大独特约束

约束 描述 影响
Underspecification Gap(规格缺口) 无完整规格;用户自然语言提示天生规格不足 “Make the dashboard load faster” 不是测试案例;依赖模型潜在知识、审美判断、领域专长填充操作缺口
用户无法验证输出 非技术用户无法逐行审查 600 行代码;技术工程师实时也无法做到 “Agent 认为成功” 和”代码实际正确”之间的差距比任何其他 Agent 类别都大
Session Iterative + Codebase State(会话迭代 + 代码库状态) 每轮修改真实文件;早期错误决策复合 必须覆盖多轮对话完整弧线,而非单轮决策

关键洞察

The prompt relies entirely on the foundation model’s latent knowledge, aesthetic judgment, and domain expertise to fill in the operational gaps.

— 提示词完全依赖基础模型的潜在知识、审美判断和领域专长来填充操作缺口。

评估框架结构

两个范围外领域(需要专门处理):

  1. Subjective evaluation of non-verifiable outputs:质量由用户/企业偏好而非地面真理定义
  2. Feedback loop from user corrections:用户修正反馈回模型、框架或评估套件以驱动改进