部署性能
独立专题¶
部署性能需要同时描述用户等待、系统吞吐、并发承载和单位成本。单个指标无法完整代表服务质量。
快速开始¶
使用真实输入长度、输出长度和到达率进行压测,分别报告 TTFT、TPOT、端到端延迟、输出吞吐、并发、错误率、显存和成本,并给出 P50、P95、P99 分位数。
核心指标¶
| 指标 | 含义 | 主要影响因素 |
|---|---|---|
| TTFT | 从请求到首个输出 Token 的时间 | 排队、Prefill、调度 |
| TPOT | 首 Token 后平均每个输出 Token 的时间 | Decode、批处理、显存带宽 |
| Throughput | 单位时间完成的请求或 Token 数 | 批处理、硬件利用率、请求分布 |
| Concurrency | 同时在系统中的请求数 | KV Cache、调度和服务目标 |
| Cost | 单请求或每百万 Token 的资源成本 | 硬件、利用率、能耗与运维 |
近似地,一次生成 \(N\) 个输出 Token 的延迟可写为:
\[
T_\text{e2e}\approx T_\text{TTFT}+(N-1)T_\text{TPOT}
\]
压测案例¶
先进行低并发基线测试,再逐步增加请求到达率,直到 P95 延迟或错误率超过服务目标。记录饱和点,而不是只保留系统崩溃前的峰值吞吐。输入输出长度应按业务分布采样,不能全部使用固定短请求。
成本核算¶
成本至少包括 GPU 实例、CPU 与内存、存储和网络、空闲冗余及运维。提高吞吐通常降低单位成本,却可能增加尾延迟。最终配置应在明确的服务等级目标下优化,而不是孤立追求 GPU 利用率。