Appearance
Performance、Cost 与 Capacity
Performance / Cost / Capacity
把延迟、Token、成本、并发、缓存、队列和容量视为同一个系统问题,而不是上线后的补丁。
推荐阅读顺序
1. Latency 分解与 TTFT
围绕“Latency 分解与 TTFT”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
2. Token、Cost Budget 与 Model Routing
围绕“Token、Cost Budget 与 Model Routing”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
3. 模型分层与 Cache 策略
围绕“模型分层与 Cache 策略”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
4. Tool Cache、Parallelism 与连接池容量
围绕“Tool Cache、Parallelism 与连接池容量”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
5. Queue、Backpressure 与吞吐权衡
围绕“Queue、Backpressure 与吞吐权衡”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
6. Run Budget、Capacity Planning 与 Benchmark
围绕“Run Budget、Capacity Planning 与 Benchmark”建立统一心智模型,并落实到 Shadow Harness 的组件边界、失败处理与验证方式。
阅读方式
建议按顺序学习本章。中文负责解释概念,英文保留标准技术术语,便于继续查阅官方文档和源码。