Skip to content

Observability、Testing 与 Evaluation

Observability, Testing & Evaluation

区分 Observability、Testing 与 Evaluation:前者解释系统发生了什么,中者验证契约,后者衡量 Agent 做得好不好。

推荐阅读顺序

1. 日志、指标与 Agent Trace

围绕“日志、指标与 Agent Trace”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

2. Trace Correlation 与敏感数据处理

围绕“Trace Correlation 与敏感数据处理”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

3. 成本、延迟与组件指标

围绕“成本、延迟与组件指标”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

4. 端到端 Eval 与数据集设计

围绕“端到端 Eval 与数据集设计”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

5. Model-as-Judge 与 Trajectory Evaluation

围绕“Model-as-Judge 与 Trajectory Evaluation”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

6. Planner、Context 与 Regression Evaluation

围绕“Planner、Context 与 Regression Evaluation”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

7. Ablation、Benchmark 与 OpenTelemetry

围绕“Ablation、Benchmark 与 OpenTelemetry”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

8. Trace Export 与 Contract Testing

围绕“Trace Export 与 Contract Testing”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

9. Fault Injection 与 Runtime Invariant Tests

围绕“Fault Injection 与 Runtime Invariant Tests”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

10. Replay Tests 与 Golden Trace

围绕“Replay Tests 与 Golden Trace”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

阅读方式

建议按顺序学习本章。中文负责解释概念,英文保留标准技术术语,便于继续查阅官方文档和源码。

AI Engineering · Agent · Harness · Backend Systems