LLM 核心性能指标全景手册(生产可用)

本文汇总大模型线上推理最全核心指标,区分用户体验、服务器性能、可靠性、模型质量四大维度,适用于压测、SLA制定、服务监控、性能调优。

核心原则:生产环境不看平均值,只看 P50 / P95 / P99 分位值(长尾延迟决定真实用户体验)

一、用户体验延迟指标(线上对话核心)

面向 C 端用户体感,流式对话最关键指标,直接决定产品流畅度。

1. TTFT 首 token 时延

  • 全称:Time To First Token

  • 定义:请求发出 → 客户端收到第一个输出 token的耗时(ms)

  • 核心瓶颈:Prefill 预填充(输入 Prompt 编码、KV-Cache 生成)+ 队列调度

  • 业务意义:决定用户会不会觉得“卡住、无响应”

  • 行业标准(P95)

    • 优秀:< 800ms

    • 可接受:800ms ~ 1500ms

    • 卡顿:> 2000ms

2. TPOT / ITL 单 token 生成时延

  • 全称:Time Per Output Token / Inter-Token Latency

  • 定义:第一个 token 后,每相邻两个 token 的输出间隔(ms)

  • 核心瓶颈:Decode 解码阶段、GPU 显存带宽、KV-Cache 命中率

  • 业务意义:决定流式打字“顺滑度”,长回答体验核心

  • 行业标准(P95)

    • 流畅:10~40ms

    • 轻微卡顿:40~80ms

    • 明显卡顿:> 80ms

3. E2E 端到端总时延

  • 定义:请求发出 → 最后一个 token 返回完成的总耗时

  • 计算公式E2E = TTFT + TPOT × (输出token数 - 1)

  • 适用场景:非流式接口、批量任务、完整回答耗时评估

4. 细分时延

  • Prefill Latency 预填充时延:纯输入 Prompt 处理耗时,长上下文场景核心瓶颈

  • Queue Time 排队时延:请求 GPU 调度队列等待时间,高并发下主要劣化项

二、系统吞吐与资源指标(服务器成本 & 承载力)

用于评估 GPU 利用率、服务并发能力、算力成本,是后端运维、压测核心指标。

1. TPS Token 吞吐

  • 定义:Tokens Per Second,每秒模型生成的 token 数量

  • 分类:单请求 TPS、整机总 TPS

  • 适用场景:批量摘要、知识库问答、离线批处理

2. RPS 请求吞吐

  • 定义:Requests Per Second,每秒处理的业务请求数(QPS)

  • 适用场景:线上业务并发承载能力评估

3. Goodput 有效吞吐

  • 定义:满足 SLA(TTFT、E2E、无报错)的有效成功请求数

  • 核心价值:规避“高吞吐但全是超时卡顿请求”的虚假健康

  • 结论:TPS/RPS 再高,Goodput 低=服务过载不可用

4. 硬件资源指标

  • GPU 利用率:LLM 为显存带宽约束场景,60%~80% 常为性能瓶颈顶点,非越高越好

  • KV-Cache 占用率:显存核心消耗项,占满会触发内存交换,性能雪崩

  • Swap 交换率:KV 缓存溢出显存到内存的比例,越高越卡顿

  • 最大稳定并发数:SLA 达标前提下,服务可承载的最大同时会话数

三、可靠性 SLA 指标(生产监控告警)

用于线上稳定性保障、故障告警、服务等级协议制定。

  • 错误率:4xx 限流、5xx 服务异常、模型内部报错占比

  • 超时率:超过最大 E2E 阈值被终止的请求占比

  • 上下文溢出率:输入超长被截断的请求占比

  • SLO 达成率:同时满足 TTFT、E2E、无报错的请求占比(核心SLA指标)

四、模型质量指标(回答效果,与性能无关)

用于模型选型、微调效果评估,衡量回答“好不好、准不准”。

1. 基础流畅度指标

  • PPL 困惑度:数值越低,文本越流畅、逻辑越通顺

2. 业务效果指标

  • 幻觉率:生成虚假、错误事实内容的比例

  • 事实准确率:知识类问答内容正确率

  • 指令遵循率:严格按照用户指令、格式要求输出的比例

  • 格式合规率:JSON/固定格式输出场景专用指标

  • 安全拒绝率:违规提问的合理拒绝比例

3. 通用评测集指标

MMLU(通用知识)、GSM8K(数学推理)、ROUGE/BLEU(文本生成匹配度)

五、不同业务场景指标优先级(落地直接用)

1. 在线流式对话(Chatbot)

优先级:TTFT(P99) > TPOT(P95) > Goodput > E2E > RPS

核心诉求:首字不卡顿、打字流畅,优先保障用户体感

2. 非流式 / 批量任务(摘要、批处理)

优先级:TPS 吞吐 > E2E 总时延 > GPU 利用率

核心诉求:单次慢点无所谓,单位时间处理任务越多越好

3. Agent / 工具调用场景

新增重点指标:工具调用成功率、循环调用次数、单轮 Token 消耗、链路总时延

六、核心记忆口诀

  • 用户体感两件事:TTFT(多久出第一个字)、TPOT(出字后打字快慢)

  • 服务能力两件事:RPS/TPS(承载量)、Goodput(有效可用性)

  • 生产核心原则:不看均值,只看 P95/P99 长尾延迟

(注:部分内容可能由 AI 生成)