LLM 核心性能指标全景手册(生产可用)
本文汇总大模型线上推理最全核心指标,区分用户体验、服务器性能、可靠性、模型质量四大维度,适用于压测、SLA制定、服务监控、性能调优。
核心原则:生产环境不看平均值,只看 P50 / P95 / P99 分位值(长尾延迟决定真实用户体验)
一、用户体验延迟指标(线上对话核心)
面向 C 端用户体感,流式对话最关键指标,直接决定产品流畅度。
1. TTFT 首 token 时延
全称:Time To First Token
定义:请求发出 → 客户端收到第一个输出 token的耗时(ms)
核心瓶颈:Prefill 预填充(输入 Prompt 编码、KV-Cache 生成)+ 队列调度
业务意义:决定用户会不会觉得“卡住、无响应”
行业标准(P95)
优秀:< 800ms
可接受:800ms ~ 1500ms
卡顿:> 2000ms
2. TPOT / ITL 单 token 生成时延
全称:Time Per Output Token / Inter-Token Latency
定义:第一个 token 后,每相邻两个 token 的输出间隔(ms)
核心瓶颈:Decode 解码阶段、GPU 显存带宽、KV-Cache 命中率
业务意义:决定流式打字“顺滑度”,长回答体验核心
行业标准(P95)
流畅:10~40ms
轻微卡顿:40~80ms
明显卡顿:> 80ms
3. E2E 端到端总时延
定义:请求发出 → 最后一个 token 返回完成的总耗时
计算公式:
E2E = TTFT + TPOT × (输出token数 - 1)适用场景:非流式接口、批量任务、完整回答耗时评估
4. 细分时延
Prefill Latency 预填充时延:纯输入 Prompt 处理耗时,长上下文场景核心瓶颈
Queue Time 排队时延:请求 GPU 调度队列等待时间,高并发下主要劣化项
二、系统吞吐与资源指标(服务器成本 & 承载力)
用于评估 GPU 利用率、服务并发能力、算力成本,是后端运维、压测核心指标。
1. TPS Token 吞吐
定义:Tokens Per Second,每秒模型生成的 token 数量
分类:单请求 TPS、整机总 TPS
适用场景:批量摘要、知识库问答、离线批处理
2. RPS 请求吞吐
定义:Requests Per Second,每秒处理的业务请求数(QPS)
适用场景:线上业务并发承载能力评估
3. Goodput 有效吞吐
定义:满足 SLA(TTFT、E2E、无报错)的有效成功请求数
核心价值:规避“高吞吐但全是超时卡顿请求”的虚假健康
结论:TPS/RPS 再高,Goodput 低=服务过载不可用
4. 硬件资源指标
GPU 利用率:LLM 为显存带宽约束场景,60%~80% 常为性能瓶颈顶点,非越高越好
KV-Cache 占用率:显存核心消耗项,占满会触发内存交换,性能雪崩
Swap 交换率:KV 缓存溢出显存到内存的比例,越高越卡顿
最大稳定并发数:SLA 达标前提下,服务可承载的最大同时会话数
三、可靠性 SLA 指标(生产监控告警)
用于线上稳定性保障、故障告警、服务等级协议制定。
错误率:4xx 限流、5xx 服务异常、模型内部报错占比
超时率:超过最大 E2E 阈值被终止的请求占比
上下文溢出率:输入超长被截断的请求占比
SLO 达成率:同时满足 TTFT、E2E、无报错的请求占比(核心SLA指标)
四、模型质量指标(回答效果,与性能无关)
用于模型选型、微调效果评估,衡量回答“好不好、准不准”。
1. 基础流畅度指标
- PPL 困惑度:数值越低,文本越流畅、逻辑越通顺
2. 业务效果指标
幻觉率:生成虚假、错误事实内容的比例
事实准确率:知识类问答内容正确率
指令遵循率:严格按照用户指令、格式要求输出的比例
格式合规率:JSON/固定格式输出场景专用指标
安全拒绝率:违规提问的合理拒绝比例
3. 通用评测集指标
MMLU(通用知识)、GSM8K(数学推理)、ROUGE/BLEU(文本生成匹配度)
五、不同业务场景指标优先级(落地直接用)
1. 在线流式对话(Chatbot)
优先级:TTFT(P99) > TPOT(P95) > Goodput > E2E > RPS
核心诉求:首字不卡顿、打字流畅,优先保障用户体感
2. 非流式 / 批量任务(摘要、批处理)
优先级:TPS 吞吐 > E2E 总时延 > GPU 利用率
核心诉求:单次慢点无所谓,单位时间处理任务越多越好
3. Agent / 工具调用场景
新增重点指标:工具调用成功率、循环调用次数、单轮 Token 消耗、链路总时延
六、核心记忆口诀
用户体感两件事:TTFT(多久出第一个字)、TPOT(出字后打字快慢)
服务能力两件事:RPS/TPS(承载量)、Goodput(有效可用性)
生产核心原则:不看均值,只看 P95/P99 长尾延迟
(注:部分内容可能由 AI 生成)
评论
评论加载中…