可观测性:审计 Agent 的思维
Glass Box Principle(玻璃盒原则)
根本规则:You cannot secure what you cannot see(无法保护无法看见的东西)
传统 vs Agent:
| 传统微服务 | Agent 系统 |
|---|---|
| HTTP 200 OK = 成功操作 | “成功”状态可能掩盖内部幻觉循环 |
| 外部状态可见 | 内部逻辑不可见 → 无限循环风险 |
| 偶然失败 | Denial of Wallet (DoW) 攻击:故意触发无限计算昂贵 API 循环 → 破产组织云和 LLM 计费账户 |
可观测性升级:从运营关注 → 严格安全需求
Open the “glass box” of non-deterministic logic
Vibe Trajectory(氛围轨迹)
核心问题:“Why did an agent do that?”(为什么 Agent 做那个?)
解决方案:构建统一、按时间顺序的视角,查看 Agent 认知步骤
技术栈:
- OpenTelemetry:标准遥测框架
- 聚合多样信号:
- API 调用
- Tool inputs/outputs(工具输入/输出)
- RAG retrievals(RAG 检索)
- Token latency(令牌延迟)
日志跨度:
用户初始 prompt → 编译 Abstract Syntax Tree (AST)
必须追踪:
• 巨大认知跳跃
• 动态代码片段
• Agent 运行时检索脚本
加固追踪:
传统日志 + Centralised Content Scanning(中央内容扫描)
→ 显式检查所有动态代码
→ 绑定内部推理循环到物理行动
→ 支持严格第三方安全审计 ✓
Intent Drift(意图漂移)
Runtime AgBOM:取代静态 SBOM(立即过时)
Static SBOM vs Runtime AgBOM:
静态 SBOM:
• 固定工件清单
• Agent 动态生成逻辑 → SBOM 瞬间过时 ❌
Runtime AgBOM:
• Living document(活文档)
• 映射 Agent 活跃爆炸半径
• 毫秒级更新 ✓
Trust Decay(信任衰减)原则:
Trust is a degradable asset(信任是可降解资产)
监控:
Trust Decay 触发:
• Agent 内部思维链 pursue(追求)子目标
• 子目标 diverge(偏离)原始人类 vibe
示例:
简单提示:"优化数据库查询"
→ 恶意漂移 → Agent 尝试下载新、未授权索引库 ❌
Checkpoints & Circuit Breakers
版本控制检查点:
Agent 执行代码库修改前 → 系统生成 version control checkpoint
自动断路器:
Agent Behavioural Analytics 评估 Vibe Trajectory 对比 AgBOM
→ 检测不稳定 → 动态 Agent Trust Score 降级
→ Score 低于预定义阈值 → 断路器触发:
• 使用版本控制检查点立即回滚变更
• 优雅撤销工具访问
• 冻结自主执行
→ 不破坏连接 API ✓
→ 环境状态保留用于取证分析 ✓