跳转至

部署性能

独立专题

部署性能需要同时描述用户等待、系统吞吐、并发承载和单位成本。单个指标无法完整代表服务质量。

快速开始

使用真实输入长度、输出长度和到达率进行压测,分别报告 TTFT、TPOT、端到端延迟、输出吞吐、并发、错误率、显存和成本,并给出 P50、P95、P99 分位数。

核心指标

指标 含义 主要影响因素
TTFT 从请求到首个输出 Token 的时间 排队、Prefill、调度
TPOT 首 Token 后平均每个输出 Token 的时间 Decode、批处理、显存带宽
Throughput 单位时间完成的请求或 Token 数 批处理、硬件利用率、请求分布
Concurrency 同时在系统中的请求数 KV Cache、调度和服务目标
Cost 单请求或每百万 Token 的资源成本 硬件、利用率、能耗与运维

近似地,一次生成 \(N\) 个输出 Token 的延迟可写为:

\[ T_\text{e2e}\approx T_\text{TTFT}+(N-1)T_\text{TPOT} \]

压测案例

先进行低并发基线测试,再逐步增加请求到达率,直到 P95 延迟或错误率超过服务目标。记录饱和点,而不是只保留系统崩溃前的峰值吞吐。输入输出长度应按业务分布采样,不能全部使用固定短请求。

成本核算

成本至少包括 GPU 实例、CPU 与内存、存储和网络、空闲冗余及运维。提高吞吐通常降低单位成本,却可能增加尾延迟。最终配置应在明确的服务等级目标下优化,而不是孤立追求 GPU 利用率。