可观测性:审计 Agent 的思维

Glass Box Principle(玻璃盒原则)

根本规则:You cannot secure what you cannot see(无法保护无法看见的东西)

传统 vs Agent

传统微服务 Agent 系统
HTTP 200 OK = 成功操作 “成功”状态可能掩盖内部幻觉循环
外部状态可见 内部逻辑不可见 → 无限循环风险
偶然失败 Denial of Wallet (DoW) 攻击:故意触发无限计算昂贵 API 循环 → 破产组织云和 LLM 计费账户

可观测性升级:从运营关注 → 严格安全需求

Open the “glass box” of non-deterministic logic

Vibe Trajectory(氛围轨迹)

核心问题:“Why did an agent do that?”(为什么 Agent 做那个?)

解决方案:构建统一、按时间顺序的视角,查看 Agent 认知步骤

技术栈

  • OpenTelemetry:标准遥测框架
  • 聚合多样信号:
    • API 调用
    • Tool inputs/outputs(工具输入/输出)
    • RAG retrievals(RAG 检索)
    • Token latency(令牌延迟)

日志跨度

用户初始 prompt → 编译 Abstract Syntax Tree (AST)

必须追踪:
• 巨大认知跳跃
• 动态代码片段
• Agent 运行时检索脚本

加固追踪

传统日志 + Centralised Content Scanning(中央内容扫描)
→ 显式检查所有动态代码
→ 绑定内部推理循环到物理行动
→ 支持严格第三方安全审计 ✓

Intent Drift(意图漂移)

Runtime AgBOM:取代静态 SBOM(立即过时)

Static SBOM vs Runtime AgBOM:

静态 SBOM:
• 固定工件清单
• Agent 动态生成逻辑 → SBOM 瞬间过时 ❌

Runtime AgBOM:
• Living document(活文档)
• 映射 Agent 活跃爆炸半径
• 毫秒级更新 ✓

Trust Decay(信任衰减)原则

Trust is a degradable asset(信任是可降解资产)

监控

Trust Decay 触发:
• Agent 内部思维链 pursue(追求)子目标
• 子目标 diverge(偏离)原始人类 vibe

示例:
简单提示:"优化数据库查询"
→ 恶意漂移 → Agent 尝试下载新、未授权索引库 ❌

Checkpoints & Circuit Breakers

版本控制检查点

Agent 执行代码库修改前 → 系统生成 version control checkpoint

自动断路器

Agent Behavioural Analytics 评估 Vibe Trajectory 对比 AgBOM
→ 检测不稳定 → 动态 Agent Trust Score 降级
→ Score 低于预定义阈值 → 断路器触发:
  • 使用版本控制检查点立即回滚变更
  • 优雅撤销工具访问
  • 冻结自主执行
  → 不破坏连接 API ✓
  → 环境状态保留用于取证分析 ✓