Skip to content

Datadog Temper — AI Agent万能机床

tags: #Agent-Infrastructure #Specification-Driven #Agent-Framework #Datadog #Claude-Code source: How Datadog built a "universal machine tool" for Claude Code project: Datadog score: 技术深度9/10 | 实用价值9/10 | 时效性10/10 | 领域匹配9/10 | 综合 9.2/10

核心概念

Temper 是 Datadog 构建的"AI Agent 万能机床"——一个策略驱动的运行时系统,让 Agent 生成经过验证的规范(specification)而非直接编写应用代码。规范既是被证明的工件,也是被执行的工件,因此验证和运行之间不存在漂移。

Datadog 副总裁 Sesh Nalla 将其类比为制造业的机床(machine tool):机床产生精确、可复用的零件,组装成更复杂的机器。Temper 是 AI Agent 系统的最小内核(smallest kernel),让 Agent 在安全、精确的前提下构建所需的东西。

设计原理

动机:Agent 执行与人类工具之间的鸿沟

Datadog 发现,随着 Claude Code 的使用深入(至少驱动三分之二的代码生成),工程师的角色发生了根本性变化:

"你不再写代码,而是在塑造工作。你决定 Agent 应该看到什么、它应该有什么工具、成功意味着什么、失败如何检测...这就像每个人都被提升到了管理链的三层之上。"

当 Agent 运行持续时间变长(有时持续数天),每个 Agent 会发明自己的工具、胶水代码和约定。Agent 变得更有用,但需要人类在 Agent 执行和人类工具之间搭建桥梁。

关键洞察:反过来解决问题

传统思路:让 Agent 更快地产生代码,然后提高审查速度。Temper 反过来:Agent 生产规范,内核读取规范、通过四层分析验证、部署规范描述的系统。因为规范既是证明的工件也是执行的工件,验证和运行之间不存在漂移。

传统方式:Agent → 产生代码 → 人工审查 → 部署(验证和执行分离)
Temper: Agent → 产生规范 → 内核验证 → 自动部署(验证和执行统一)

通往 Temper 的路径

Datadog 并非一步到位,经历了三个先驱项目:

  1. Courier(2024):分布式队列系统,手工构建耗时一年。教训:构建零件不难,难的是让交互可观测、可测试、可验证
  2. BitsEvolve(2025.09):闭环进化优化框架。模型委员会生成代码变体,级联基准测试+生产可观测性决定哪些存活。第一次看到软件可以像有机体一样通过变异+反馈+适应"培育"
  3. Helix(2026):Kafka 兼容的流式服务。Claude Code 完成大部分构建,少数天即具备功能,预估比 Kafka 便宜 2-5 倍。但生产就绪需要大量人工协调——瓶颈转移到了将工作部署到为人类设计的工具和机制中

关键实现

Temper 的核心架构

  • 规范优先:Agent 产生规范(specification)而非代码
  • 四层分析验证:内核读取规范后通过四层分析验证
  • 策略驱动运行时:在策略驱动的运行时环境中执行
  • 自包含:Agent 可以在经验证的运行时中构建自己的工具
  • 无漂移:验证通过的规范直接部署,不存在"审查通过但部署时不同"的问题

与 Claude Code 的集成

Temper 使用 Claude Managed Agents 模式运行,Agent 会话可能持续数天。Agent 在 Temper 运行时中构建工具,所有动作都经过验证。

四类 Agent 工作模式

Datadog 的 Agent 使用分四个复杂度递增的类别:

类别 示例 生成复杂度 验证难度
定向修改 Bug修复、性能优化
大规模重构 自定义 protobuf 解析器(3天)、监控系统从 FoundationDB 迁移到 Postgres(<3月)
替换大面积组件 新分片算法、自动扩缩容重设计
构建完整系统 用 Postgres 替代 MongoDB、BYOC 控制平面、数据管道(从零开始) 极高 极高

关联分析

  • ReAct Patterns 对比:Temper 不是让 Agent 在循环中自由行动,而是将 Agent 的输出约束为规范,通过验证内核确保安全
  • Loop Engineering 互补:Temper 提供的是 Agent 构建和部署的"运行时基础设施",而非循环结构本身
  • Anthropic-CISO-Agent-Security-Guide 的共同点:两者都强调 Agent 动作的范围限制和验证,Temper 通过规范+四层验证实现,Anthropic 通过四问评估+最小代理原则
  • Vibe Coding 相关:当 Vibe Coding 让 Agent 主导编码时,Temper 提供的验证基础设施变得必不可少
  • Claude-Cowork 比较:Claude Cowork 提供的是 Agent 执行环境+安全控制,Temper 提供的是 Agent 构建和部署的规范框架

可执行建议

  1. 规范驱动的 Agent 架构是值得关注的模式:在 Agent 生成代码的质量和可靠性成为瓶颈时,Temper 的"规范优先+验证内核"方案提供了一条可行路径
  2. 从"Courier 教训"学习:构建 Agent 系统时,把可观测性、可测试性、可验证性放在功能之前,尤其是在组件之间的交互点
  3. "进化式"和"确定性"并不互斥:BitsEvolve 的进化式生成 + Temper 的确定性验证可以共存,这给 Agent 工具设计提供了新思路
  4. 关注 Agent 运行时的策略控制:Agent 工具链的下一个瓶颈可能是"验证基础设施"——需要像 Temper 这样的工具来弥合 Agent 生成和人工审核之间的鸿沟
  5. 对于移动端 AI 场景:规范驱动的模式同样适用于端侧 Agent 行为的约束和验证,尤其是在安全敏感的操作场景

自评

维度 分数 权重 加权
摘要质量 9 0.25 2.25
技术深度 9 0.25 2.25
相关性 9 0.20 1.80
原创性 8 0.15 1.20
格式规范 9 0.15 1.35
加权总分 8.85