Appearance
Observability、Testing 与 Evaluation
Observability, Testing & Evaluation
区分 Observability、Testing 与 Evaluation:前者解释系统发生了什么,中者验证契约,后者衡量 Agent 做得好不好。
推荐阅读顺序
1. 日志、指标与 Agent Trace
围绕“日志、指标与 Agent Trace”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
2. Trace Correlation 与敏感数据处理
围绕“Trace Correlation 与敏感数据处理”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
3. 成本、延迟与组件指标
围绕“成本、延迟与组件指标”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
4. 端到端 Eval 与数据集设计
围绕“端到端 Eval 与数据集设计”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
5. Model-as-Judge 与 Trajectory Evaluation
围绕“Model-as-Judge 与 Trajectory Evaluation”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
6. Planner、Context 与 Regression Evaluation
围绕“Planner、Context 与 Regression Evaluation”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
7. Ablation、Benchmark 与 OpenTelemetry
围绕“Ablation、Benchmark 与 OpenTelemetry”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
8. Trace Export 与 Contract Testing
围绕“Trace Export 与 Contract Testing”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
9. Fault Injection 与 Runtime Invariant Tests
围绕“Fault Injection 与 Runtime Invariant Tests”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
10. Replay Tests 与 Golden Trace
围绕“Replay Tests 与 Golden Trace”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
阅读方式
建议按顺序学习本章。中文负责解释概念,英文保留标准技术术语,便于继续查阅官方文档和源码。