Skip to content

Performance、Cost 与 Capacity

Performance / Cost / Capacity

把延迟、Token、成本、并发、缓存、队列和容量视为同一个系统问题,而不是上线后的补丁。

推荐阅读顺序

1. Latency 分解与 TTFT

围绕“Latency 分解与 TTFT”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

2. Token、Cost Budget 与 Model Routing

围绕“Token、Cost Budget 与 Model Routing”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

3. 模型分层与 Cache 策略

围绕“模型分层与 Cache 策略”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

4. Tool Cache、Parallelism 与连接池容量

围绕“Tool Cache、Parallelism 与连接池容量”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

5. Queue、Backpressure 与吞吐权衡

围绕“Queue、Backpressure 与吞吐权衡”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

6. Run Budget、Capacity Planning 与 Benchmark

围绕“Run Budget、Capacity Planning 与 Benchmark”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。

开始阅读 →

阅读方式

建议按顺序学习本章。中文负责解释概念,英文保留标准技术术语,便于继续查阅官方文档和源码。

AI Engineering · Agent · Harness · Backend Systems