附录 B:开发工作流案例研究

案例 1:周末原型项目(Vibe Coding)

场景:个人项目,探索新技术,周末 hackathon

工作流

开发者想法:"我想做一个简单的 URL 缩短服务"
  ↓
在 coding agent 中输入:"Create a URL shortening service with FastAPI"
  ↓
AI 生成代码
  ↓
运行代码,测试基本功能
  ↓
如果出错 → 复制错误信息贴回 prompt:"Fix this error: [error message]"
  ↓
AI 修复
  ↓
重复直到"看起来能工作"
  ↓
提交代码到个人 GitHub

特点: - CapEx: ~0(无系统设计、测试套件、context engineering) - OpEx: 高(token burn rate、未来维护税) - 适用:个人项目、原型、探索 - 不适用:生产系统、团队项目

Applied Tip: > “The right position on this spectrum depends on the stakes. A weekend prototype can be pure vibe coding.”

案例 2:生产 API 特征实现(Agentic Engineering)

场景:公司生产 API,处理金融交易,团队规模开发

工作流

阶段 1: Requirements & Planning
───────────────────────────────
开发者编写规范:
  - API endpoint specification
  - Error handling requirements
  - Security constraints
  - Performance requirements

创建 AGENTS.md:
  - Project stack
  - Conventions
  - Hard rules
  - Workflow

阶段 2: Design & Architecture
───────────────────────────────
开发者做出架构决策:
  - 数据模型设计
  - API schema
  - 分层架构
  - 错误处理策略

文档化架构决策(ADR)

阶段 3: Implementation
───────────────────────────────
启动 coding agent(Terminal Agent):
  "Implement the payment processing endpoint following the spec in payment-api-spec.md"

AI 在 sandbox 中工作:
  - 读取规范和 AGENTS.md
  - 生成代码
  - 运行自动化测试
  - 自我纠正直到测试通过

阶段 4: Testing & QA
───────────────────────────────
运行评估套件:
  - 功能测试(确定性验证)
  - 轨迹评估(Agent 行为验证)
  - 安全测试
  - 性能测试

如果 evals 失败 → orchestration logic 捕获错误 → 路由回 agent → 自动修复

阶段 5: Code Review & Deployment
───────────────────────────────
AI 作为首次审查者:
  - 识别潜在 bug
  - 样式违规
  - 安全漏洞

人类审查者:
  - 上下文依赖决策
  - 设计可维护性
  - 战略对齐

Hooks 检查:
  - 无硬编码密码
  - 所有 imports 是真实包
  - 错误处理覆盖现实失败模式

Observability 追踪:
  - Token 成本
  - 延迟
  - Agent drift

部署:
  - AI 监控部署健康
  - 自动回滚问题发布
  - 预测部署风险

阶段 6: Maintenance
───────────────────────────────
如果 bug 出现:
  - AI Agent 能阅读代码库、理解模式
  - 识别变更相关文件
  - 实现修改同时尊重现有架构
  - 运行测试验证修复

特点: - CapEx: 高(系统设计、测试套件、context engineering、harness 配置) - OpEx: 低(首次成功率高、维护成本可控、安全漏洞早期捕获) - 适用:生产系统、团队规模开发 - 不适用:个人项目、快速原型

Applied Tip: > “A production API handling financial transactions demands agentic engineering.”

案例 3:混合模式(日常工作)

场景:日常开发工作,不同任务需要不同光谱位置

一天的工作流

上午:探索新技术(Vibe Coding)
───────────────────────────────
任务:探索新的机器学习库
光谱位置:Vibe Coding 端
方式:在 Cursor 中随意 prompt,接受 AI 输出,快速实验
验证:基本运行测试,"看起来能工作"

下午:实现已定义特征(Structured AI-Assisted)
───────────────────────────────
任务:实现已规划的用户认证功能
光谱位置:光谱中间
方式:详细 prompt + 示例,选择审查关键路径
验证:手动测试 + 抽查,人类诊断根因

晚上:修复生产 bug(Agentic Engineering)
───────────────────────────────
任务:修复生产环境的支付处理 bug
光谱位置:Agentic Engineering 端
方式:启动 Terminal Agent,提供 bug spec,让 agent 在 sandbox 中工作
验证:自动化测试套件 + 轨迹评估 + 回归测试
审查:AI 首次审查 + 人类审查 + hooks 检查
部署:AI 监控 + observability 追踪

白皮书强调

“Most real work falls somewhere in between, and the skill is knowing where to draw the line for each task.”

翻译:大多数实际工作落在中间,技能在于为每个任务划定边界。