Inference Engineering:按系统链路整理的推理工程术语表生成式 AI 应用真正上线之后,问题就不只是“模型能不能回答”,还包括模型如何被加载、请求如何排队、GPU 如何计算和搬运数据,以及服务如何在真实流量下保持稳定。这篇文章整理自 Philip Kiely 的 Inference Engineering。这本书由 Baseten Books 出版,官方提供在线阅读版。下面的术语主要来自书中的 Appendix A: Inference Glossary,原书按字母排列,本文改为按推理系统链路分组,方便写代码、读源码和看性能指标时互相对照。书中覆盖的范围从 CUDA、GPU 和推理引擎,一直延伸到 KV cache、量化、并行、扩散模型、语音、多云部署和生产服务。花了 2 天读完了,附录 B 也是很不错的索引材料一、模型、应用与数据表示这一组回答“模型是什么、应用如何调用模型、文本如何变成模型能处理的表示”。Term中文理解在推理系统里看什么Activation function激活函数:插在线性层之间的大多可微非线性函数,例如 ReLU。没有非线性,多层网络会退化成一次矩阵乘法。Generative AI生成式 AI:学习数据中的模式,并生成新的文本、图像、音频、视频或代码。它强调“生成新内容”,区别于只做分类、预测的传统 ML。Machine learning (ML)机器学习:从数据中学习预测模型,例如分类和趋势预测。在术语表中,它被用来和生成式 AI 做对照。Foundation model基础模型:在广泛数据上训练,可作为多个下游任务基础的模型。可以直接 prompting,也可以 fine-tuning 成领域模型。Open model开放模型:模型权重可以自由获得,例如 Llama、DeepSeek、Whisper。权重可见通常意味着部署、量化和硬件选择更可控。Closed model封闭模型:权重不可获得的专有模型,例如 GPT、Claude、Gemini。通常通过 API 使用,用户控制的是请求、路由和成本,而不是底层权重。TransformerTransformer:生成式 AI 背后的基础网络架构。attention、Q/K/V、KV cache 和大量推理优化都围绕它展开。Causal language model (CLM)因果语言模型:只用已有上下文预测下一个 token 的 decoder-only Transformer。自回归 LLM 推理通常就是在运行 CLM 的 next-token 预测循环。Large Language Model (LLM)大语言模型:接收文本 prompt,生成新的文本序列。典型家族包括 GPT、Claude、Llama、DeepSeek。LLM`Large Language Model` 的缩写。与上一行是同一概念,工程文档中通常直接写 LLM。Generative Pretrained Transformer (GPT)生成式预训练 Transformer:OpenAI 创建的文本生成大语言模型家族。是模型家族名称,不等于所有 LLM 的统称。Agent智能体:不只回答信息,还会调用工具并采取行动的 AI 应用。一次用户请求可能触发多次推理、多个模型和多个模态。AI-native applicationAI 原生应用:核心体验和价值依赖生成模型的产品。模态、延迟预算、单位经济性和使用模式会反过来决定推理架构。Application Programming Interface (API)API:发送请求、接收响应的结构化接口。推理引擎通常通过 API 暴露模型查询能力。Inference推理:在生产环境中提供 AI 模型服务。术语重点在 serving,不只是“跑一次模型前向”。Inference engine推理引擎:支持 batching、caching、quantization、speculation 等优化的高性能运行时。vLLM、SGLang、TensorRT-LLM 都属于这一类。Prompt提示词:给模型的指令;扩散模型还可能包含 negative prompt、步数和 guidance 参数。prompt 长度会直接影响 prefill、TTFT 和 KV cache 占用。Chat template聊天模板:按模型要求,把角色、分隔符和序列起止 token 序列化成输入。同一句对话换模板后,实际 token 序列可能不同。Tokentoken:LLM 处理文本的基本单位,本质上是表示字符串片段的整数。延迟、吞吐、上下文窗口、计费通常都以 token 为单位。Tokenizer分词器:在字符串和 token 序列之间做确定性转换。不同模型的 tokenizer 不同;更高效的 tokenizer 可降低端到端延迟。Vocabulary词汇表:模型用来表示数据的全部 token 集合。词汇表大小影响 logits 向量和 token 化行为。Input sequence输入序列:请求中交给模型、在 prefill 阶段处理的 token。输入越长,prefill 计算和 KV cache 建立成本通常越高。Input Sequence Length (ISL)输入序列长度:一次请求的输入 token 数。和 OSL 一起描述 workload 的长度形状。Output sequence输出序列:模型在 decode 阶段生成的 token。输出长度决定 decode 持续时间和用户看到的流式过程。Output Sequence Length (OSL)输出序列长度:一次请求生成的输出 token 数。长 OSL 往往会放大 decode、KV cache 和队列压力。Context window上下文窗口:单次请求中模型可以处理的输入、推理和输出 token 总上限。它是模型能力上限,也是显存、KV cache 和调度的约束。Function calling函数调用,也叫 tool calling / tool use:模型从给定函数集合中选择函数并返回结构化参数。服务端要校验 schema、执行工具,并把结果重新送回模型。Structured output结构化输出:遵循指定 schema 的模型输出。书中强调用 logit bias 等生成约束实现,而不是只靠 prompt 约定。Logit biasingLogit 偏置:在 sampling 前调整或约束 token 的概率,以引导 JSON、工具调用等输出。它位于 logits 产生之后、最终采样之前。二、请求生命周期、解码与性能指标这组术语是“请求进来之后发生了什么,以及快不快应该怎么量”。Term中文理解在推理系统里看什么Autoregressive token generation自回归 token 生成:每个新 token 依赖之前已经生成的 token。它天然形成逐步 decode 循环,也是 KV cache 和 speculative decoding 的背景。Pretraining预训练:在广泛语料上进行的大规模训练,得到基础模型。发生在 serving 之前;推理工程通常消费其产出的权重。Training训练:通过反向传播和优化从数据学习模型权重。训练偏计算密集,通常依赖大规模 GPU 集群。Prefill预填充:LLM 推理中一次处理输入序列并建立 KV cache 的阶段。通常是 compute-bound,长 ISL 会显著增加 TTFT。Decode解码:自回归循环逐 token 生成的阶段。通常更受内存带宽和 KV 读取影响;每次前向常只新增一个 token。Sampling (decode)采样:根据生成的 logits 选择下一个输出 token。常见策略有 greedy/argmax、temperature、top-k、top-p。Logitslogits:模型每次前向为词汇表中每个 token 生成的未归一化分数向量。sampling、temperature、logit bias 都作用于它或它的变换。Softmaxsoftmax:把 attention 分数转成概率,也把 decode 中的 logits 归一化为概率分布。它连接“打分”和“概率采样”两个阶段。Temperature温度:控制 token 选择的随机性;低值更确定,高值更多样。它改变采样分布,不等于改变模型本身的能力。Batch批处理:同时处理多个输入。能提高设备利用率,但请求长度差异会造成等待或 padding。Batch sizing批大小:延迟和吞吐的核心调节杠杆。批越大通常总吞吐越高,但单用户延迟更差。Dynamic batching动态批处理:批次满了或短计时器到期就启动。兼顾利用率和延迟稳定性;对 LLM 通常被 continuous batching 取代。Continuous batching (in-flight)连续批处理 / 进行中批处理:在 token 级别交错处理请求,让 GPU 槽位持续有工作。对长度不一、持续到达的在线 LLM 请求尤其重要。In-flight batching`Continuous batching` 的另一种叫法。重点是请求可以在 batch 执行过程中加入、完成和退出。Chunked prefill分块预填充:把长输入切块,并和 decode 或其他工作重叠。防止一个超长序列长时间独占资源。Queue (request)请求队列:在 autoscaling 把新副本拉起之前,暂存超出当前容量的流量。队列长度和等待时间是容量不足、冷启动或突发流量的信号。Online inference在线推理:实时服务请求,优先满足严格延迟预算。关注 TTFT、ITL、P99 和可用性。Offline inference离线推理:异步批量处理大任务,优先吞吐和成本。可以牺牲单请求延迟换取更高设备利用率。Local (edge) inference本地 / 边缘推理:在手机、电脑等终端设备上运行推理。减少网络往返,但受端侧算力、内存和能耗约束。Latency percentiles延迟百分位数:用 P50、P90、P95、P99 等观察平均到尾延迟的分布。P99 往往比平均值更接近最差用户体验。Time to first byte (TTFB)首字节时间:从请求开始到收到第一个输出字节的时间。受网络、服务端处理和流式协议共同影响。Time to first token (TTFT)首 token 时间:从请求开始到收到第一个输出 token 的时间。对聊天、代码补全等交互式场景很关键,通常包含 prefill。Inter-token latency (ITL)token 间延迟:decode 中相邻生成 token 的时间间隔。ITL 越小,用户感知的流式输出越顺滑;例如 2 ms 约对应 500 TPS。Perceived TPS感知 TPS:单个用户在流式输出中实际看到的每秒 token 数。它比笼统的吞吐更贴近单用户体验。Tokens per second (TPS)每秒 token 数:每秒向最终用户流式传输的 token 数,术语表中指向 perceived TPS。需要明确是单用户 TPS 还是聚合吞吐。Throughput吞吐量:单位时间完成的总工作量,例如总 token/s。聚合吞吐变高,不代表每个用户的 TPS 或 TTFT 变好。Baselines基线:优化前仔细记录的性能和质量测量。没有 baseline,就无法可靠归因优化收益或回退。Load testing负载测试:持续发送高流量,探测吞吐上限、队列行为和扩缩容。要配合真实的 ISL/OSL 分布,而不是只用均匀合成请求。Jitter traffic (bench)抖动流量:在请求到达时间和序列形状中加入随机性。比整齐的固定间隔流量更接近真实 workload。Real-time factor (RTF)实时因子:ASR 转录速度指标;一小时音频六秒转完时,RTF 为 600。适合表达音频处理相对于原始播放时长的速度。三、Attention、KV cache 与上下文优化Term中文理解在推理系统里看什么Attention注意力:通过 Q/K/V 投影和 softmax,把当前 token 与历史 token 关联起来的 Transformer 机制。计算量和内存流量都大,是推理优化的核心目标。Head (attention)注意力头:一层中的一次独立 attention 计算。多头结构让模型能从不同子空间建模关系。Cross-attention交叉注意力:一个序列的 Q 以另一个序列的 K/V 为条件。常见于文本条件图像、多模态和扩散去噪流水线。KV cacheKV 缓存:保存每个历史 token 的 K/V 张量,避免每一步重新计算历史投影。它用显存换计算;上下文越长,缓存越大、每步读取也越多。Prefix caching前缀缓存:跨请求复用共享前缀的 KV,跳过重复 prefill。对代码补全、多轮对话、agent 系统可显著改善 TTFT。Cache-aware routing缓存感知路由:把请求发到已经持有匹配前缀或所需 LoRA 的副本。路由不只看负载,也看缓存命中和本地状态。PagedAttention分页注意力:把 KV block 存进固定大小的 page,以更好管理长上下文内存。典型收益是减少碎片、提高 KV 利用率;不能把它等同于普通 OS 分页。Rotary positional embeddings (RoPE)旋转位置编码:用可学习的旋转表示位置,帮助长上下文外推。长上下文能力和 attention 内存需求之间存在权衡。Context Parallelism (CP)上下文并行:在 GPU 间复制权重、切分 attention context。适合上下文或视频 latent 空间极大的模型。Ring attention环形注意力:一种 CP 机制,GPU 以环形传递部分 attention 结果。通过降低 all-to-all 压力支持更长上下文。Disaggregation推理分离:把 prefill 和 decode 拆到可独立扩展、使用不同硬件资源的引擎。让两种完全不同的瓶颈分别扩容,但会引入传输和调度复杂度。四、GPU、内存层次与 CUDA 软件栈这组术语解释“模型最终在哪里算、数据如何搬、内核如何执行”。Term中文理解在推理系统里看什么Central Processing Unit (CPU)CPU:适合顺序工作负载的通用处理器。主要负责编排、调度、网络和预处理,通常不直接承担生成式推理主计算。Graphics Processing Unit (GPU)GPU:高度并行的处理器,现广泛用于生成式 AI 训练和推理。关注显存容量、带宽、计算单元和互连,而不只看型号。GPU nodeGPU 节点:通常指包含 8 个、通过 NVLink/NVSwitch 互连的 GPU 的标准机箱。是多 GPU 推理和节点内并行的常见基本单元。Node节点:带 NVLink/NVSwitch 的物理 8-GPU 基础单元;多节点之间再加 InfiniBand。明确“节点内”和“节点间”通信边界。Instance (cloud)云实例:包含 GPU、CPU、RAM、存储、网络和互连的已配置虚拟机。云上计费、部署和扩缩容通常以 instance 为边界。High-Bandwidth Memory (HBM)高带宽内存:数据中心 GPU 用作 VRAM 的高带宽内存,如 HBM3、HBM3e、HBM4。决定权重、激活和 KV 的可容纳量以及数据供给速度。VRAM (device memory)显存:GPU 上存放权重、KV 和激活的设备内存。容量限制模型大小和 KV 余量,带宽影响 decode TPS。Out-of-memory error (OOM)显存不足错误:GPU 没有足够 VRAM 加载权重或执行推理。需要从模型精度、上下文长度、batch、KV cache 和并行方式一起排查。Bandwidth带宽:内存或互连每秒能传输的数据量。decode 常受带宽约束;NVLink、HBM、InfiniBand 是不同层级的带宽。Core (CUDA)CUDA Core:执行标量和逐元素操作的通用算术单元。不是所有算子都由 Tensor Core 完成。Core (Tensor)Tensor Core:针对混合精度矩阵乘累加(MMA)优化的专用单元。GEMM 和多数推理主计算会高度依赖它。Streaming Multiprocessor (SM)SM:包含核心和缓存的 GPU 计算单元。kernel 会被调度到 SM 上,以大量线程实现并行。Thread线程:GPU 上最小的执行单元。一个 kernel 通常启动大量线程来覆盖数据并行工作。Special Function Unit (SFU)SFU:加速正弦、余弦等特定数学运算的专用单元。把特殊函数从 CUDA Core 上分担出去。L0/L1/L2 caches (GPU)GPU 片上缓存层次,用于指令、共享内存和全局缓存等数据。数据是否命中更近的缓存会影响 kernel 的实际性能。CUDANVIDIA 的 GPU 编程模型和平台,覆盖 kernel、graph、内存和执行。推理软件、编译器和库通常通过 CUDA 接触 GPU。CUDA driverCUDA 驱动:应用和 GPU 硬件之间的低层接口,管理内存和执行。处理系统级资源与设备交互。CUDA runtimeCUDA 运行时:面向开发者的 API,用于启动 kernel 和管理内存。比 driver 更接近应用代码和运行时调用。CUDA kernelCUDA kernel:用户定义、在 GPU 上并行执行的函数。算子性能优化最终常常落到 kernel 设计。CUDA graphCUDA graph:把 kernel 和其他 GPU 操作组织成 DAG,以优化重复工作流。减少重复 launch 开销,适合形状和流程较稳定的推理。Basic Linear Algebra Subprograms (BLAS)BLAS:基础线性代数操作的标准接口。GEMM 等核心算子经常通过 BLAS 或其 GPU 实现调用。cuBLASCUDA 的 BLAS 实现,提供高质量 GEMM 等基础原语。是 NVIDIA GPU 上矩阵乘法优化的重要库。cuDNNCUDA 深度神经网络基元库。提供神经网络常用操作的高性能实现。General matrix-matrix multiplication (GEMM)GEMM:通用矩阵乘法,属于 BLAS,也是推理的关键操作。大量线性层最终都可归结为矩阵乘法。Matmul矩阵乘法的简称。口语或代码中常用;GEMM 是更具体、带矩阵形状和实现语境的说法。CuTeNVIDIA 生态中的 C++ 模板库,抽象 tiled tensor 操作,帮助组合精度感知的优化 GEMM 和 fused kernel。更接近编写底层、高性能 kernel 的开发者工具。CUTLASSCUDA C++ 模板库,为高性能、架构调优的 GEMM 和相关 kernel 提供构建块。常用于自己组装或调优矩阵计算。DeepGEMMDeepSeek 团队创建的高效 GEMM kernel 库,在 FP8 上有较强表现。代表针对具体精度和硬件的专用 kernel 优化。FlashAttention一系列减少内存流量的优化 attention kernel。书中举例:FlashAttention 3 面向 Hopper,FlashAttention 4 面向 Blackwell。Kernel fusion内核融合:把多个 kernel 合成一个,减少中间结果的内存往返。经常以更复杂的 kernel 换取更少的读写和 launch 开销。FLOPS每秒浮点运算次数,通常在 Tensor Core 语境下衡量。是峰值计算能力,不等于真实模型吞吐。Arithmetic intensity算术强度:每移动一个字节完成多少运算。和硬件的 ops:byte 比较,可判断 kernel 更偏 compute-bound 还是 memory-bound。Ops:byte ratio (GPU)GPU 在给定精度下,每字节内存带宽对应的峰值操作数。与算法算术强度配合使用,帮助定位瓶颈。Roofline model屋顶线模型:把算术强度和内存带宽、计算上限画在一张图上。用来判断优化应该优先补计算还是补内存带宽。Compute-bound计算受限:性能主要受可用 FLOPS 限制,而不是内存带宽。prefill、图像/视频生成常更接近这一侧。PyTorch compile (torch.compile)面向特定 GPU 的图捕获、kernel 选择和融合机制。缓存编译结果可以减少 cold start。PyTorch Profiler测量每个操作 CPU/GPU 时间和内存的开发者工具。用 profile 证据判断瓶颈,不要只凭直觉调参。五、精度、量化与模型压缩Term中文理解在推理系统里看什么Floating-point data formats浮点格式:FP16、FP8、FP4 等,使用指数-尾数结构,动态范围较高。精度、显存、带宽、Tensor Core 支持和质量损失需要一起看。BF1616 位浮点格式,指数范围比 FP16 大,动态范围更高,更能容纳异常值。常见于训练,也用于部分推理。Integer data formats整数格式:例如 INT8、INT4,动态范围较有限。通常节省存储和带宽,但需要关注量化误差。Dynamic range (quantization)动态范围:某种数字格式能够表示的绝对值范围。浮点格式往往比相同字节数的整数格式有更高动态范围。Microscaling formats微缩放格式:如 MXFP8、MXFP4、NVFP4,按小块使用缩放因子。通过 blockwise scale 在低精度下尽量保留精度。NVFP4NVIDIA 的 4 位浮点微缩放格式,使用双缩放因子和 block size 16 的块级量化。是低精度硬件和格式路线中的一个具体例子。Quantization (post-training)训练后量化:降低权重、激活以及可能的 KV cache 精度。目标是减少计算和带宽,但需要用质量和性能基线验证。Quantization-aware training量化感知训练:联合计算量化 scale 并优化权重,让最终模型适配低精度部署。一般比直接训练后量化更能主动适应量化误差,但需要训练成本。Weights-only quantization仅权重量化:只降低线性层权重精度,KV cache 和 attention 等保持较高精度。质量保持通常更保守,但性能收益也可能更有限。Scale factor (quantization)量化缩放因子:把低精度值映射回原数字范围的乘数。scale 的粒度和计算方式会影响误差与 kernel 实现。Sparsity (FLOPS)稀疏性:例如 2:4 结构化稀疏中一半值为 0,Tensor Core 可跳过零乘法。书中提醒,大多数推理仍是 dense,不要默认稀疏一定生效。Fine-tuning微调:把预训练基础模型适配到具体领域。可能让更小模型达到目标质量,降低部署成本。LoRA低秩适配:一种轻量微调方法,只对模型产生小幅改动。单一基础模型上切换成千上万个 LoRA,会带来缓存和路由问题。Distillation蒸馏:让较小 student 模型模仿较大 teacher 的概率分布,而不只是最终输出。用更少参数保留部分教师行为,是压缩和降本路径之一。六、并行、互连与分布式推理Term中文理解在推理系统里看什么Model parallelism (overview)模型并行总称:通过 TP、EP、PP 等把工作拆到多个 GPU。选择取决于模型大小、拓扑、延迟目标和吞吐目标。Tensor Parallelism (TP)张量并行:把张量运算切到同一节点的多个 GPU。单用户延迟通常较好,但需要频繁 all-reduce 同步。Pipeline Parallelism (PP)流水线并行:把模型层切成多个 stage 分布到 GPU。多节点 dense 模型可用,但 pipeline bubble 会让部分 GPU 等待。Expert Parallelism (EP)专家并行:把 MoE 的专家分片到多个 GPU,每个 GPU 保留多个完整专家。在较低 GPU 间通信开销下提升总吞吐。Mixture of Experts (MoE)专家混合:把线性层权重拆成多个稀疏 expert,由 router 每次只激活部分专家。总参数量可以很大,但单次计算只触发一部分专家。Multi-node inference多节点推理:一个 8-GPU 节点的 VRAM 不够时,扩展到两个或更多节点。要选择合适的并行策略;InfiniBand 上过多 all-to-all 会拖慢 TP。InfiniBand节点间互连,用于跨多节点扩展训练和推理。带宽通常高于 Ethernet,但明显低于节点内 NVLink。NVLinkGPU 之间的一对一高速通信层。书中给出 Blackwell 最高 1800 GB/s、Hopper 最高 900 GB/s 的示例;具体取决于产品和链路配置。NVSwitch建在 NVLink 之上的全对全通信层,协调节点内所有 GPU。改变多 GPU 节点内的通信拓扑和可扩展性。PCIe (GPU form factor)PCIe GPU 形态:通过标准 PCI Express 插槽连接。通常基础规格和互连选项少于同型号 SXM 版本。SXM (GPU form factor)SXM GPU 形态:插槽式模块,支持更高带宽连接和更强供电。推理集群中常用于高规格、强互连的 GPU 配置。Multi-Instance GPU (MIG)多实例 GPU:把较大的 GPU 切成最多八个内存 slice 和七个计算 slice。适合隔离小工作负载,但会牺牲一部分整卡灵活性。Control plane (multi-cloud)多云控制平面:负责部署模型和分配资源的全局编排器。做决策、调度和容量管理,不一定承载实际请求。Workload plane (multi-cloud)多云工作负载平面:真正运行推理、处理请求的独立集群。控制平面把工作放到这里执行。Multi-cloud capacity management多云容量管理:在多个云服务商和区域之间放置工作负载的全局调度。目标是把异构 GPU 池当成可调度资源,同时处理容量和地域约束。Bin packing (multi-cloud)多云装箱:把不同云、区域和集群的 GPU 池看作统一资源来装载任务。需要容量管理基础设施屏蔽硬件异构性。Data sovereignty数据主权:法律对模型输入输出在哪里处理、在哪里存储的约束。可能直接决定区域选择、路由和多云部署方式。Hyperscaler超大规模云服务商,例如 AWS、GCP。资源规模大、产品通用;和专注 GPU 的 neocloud 相对。Neocloud专注 GPU 的专业云服务商,例如 CoreWeave、Nebius。常作为多云 GPU 容量的补充来源。七、生产部署、可靠性与服务治理Term中文理解在推理系统里看什么Active-active双活:多个区域或集群同时承载实时流量,某个平面失败后由其他平面继续服务。可用性高,但需要多地路由、状态和容量协调。Active-passive主备:热备集群或区域保持就绪但平时空闲,主用失败后切换。结构相对简单,但备用资源利用率和切换速度需要权衡。Autoscaling自动扩缩容:根据流量或利用率自动增减模型副本。目标是匹配容量与需求,同时维持延迟 SLA、减少浪费。Autoscaling window自动扩缩容窗口:决定扩容或缩容的滚动时间范围。窗口长更稳定,窗口短对突发峰值反应更快。Cold start冷启动:副本从零扩到第一次成功响应的时间,包括 GPU 配置、容器启动、模型加载和引擎编译。是 scale-to-zero 的主要代价,直接影响队列和首请求延迟。Scale to zero缩容到零:空闲时关闭全部副本,有请求时按需启动。省成本但依赖快速 cold start 和可靠 queueing。Blue-green deployment蓝绿部署:维护两个并行生产环境,在蓝绿之间切流量。支持零停机发布和快速回滚。Canary deployment金丝雀部署:先把小比例实时流量发给新版本,观察稳定性和性能后逐渐放量。用真实流量做渐进式验证。Shadow traffic影子流量:把真实生产请求镜像到候选部署,但不使用候选结果服务用户。可以评估新版本,避免直接影响主路径。Routing (inference)推理路由:根据负载、KV cache、可用 LoRA 和序列形状把请求放到合适副本。好的路由器不仅做 round-robin,还利用模型运行状态。gRPCgRPC:结构化、schema-first 的双向流式协议。适合定义良好的服务间通信;schema 校验带来一些额外开销。WebSocketWebSocket:轻量、双向流式传输协议。适合非结构化音频块和实时用户体验。Service Level Agreement (SLA)SLA:系统对延迟、吞吐、可用性等指标做出的合同承诺。对外承诺,通常需要可观测数据支撑。Service Level Objective (SLO)SLO:系统内部为满足或超过 SLA 设定的目标。内部目标通常应比外部 SLA 留出余量。DockerDocker:用容器把推理服务及其依赖打包成标准化运行单元。保证部署环境更可复现,但不自动解决 GPU 驱动和性能问题。DockerfileDockerfile:创建容器镜像的、人可读且机器可执行的指令文件。把运行时依赖、启动命令和环境固定下来。八、推理引擎、运行时与工程工具Term中文理解在推理系统里看什么vLLM广泛采用的推理引擎,模型和硬件支持面广,默认配置成熟。常见能力包括连续批处理、KV 管理、量化和服务 API。SGLang快速推理引擎,前端/后端灵活,并强化 MoE 支持。适合需要结构化工作流和高性能 serving 的场景。TensorRTNVIDIA 面向高性能推理优化的运行时。组合 fused kernels、quantization 等优化。TensorRT-LLMNVIDIA 构建的 LLM 推理引擎,提供 Python API,并支持 TensorRT engine 和 PyTorch backend。集成融合 kernel、量化和 speculative decoding。Triton Inference ServerNVIDIA 的生产级服务框架,支持多种后端。解决模型服务编排、协议和后端接入,不等于单一 kernel 库。ONNX模型的中间表示和运行时生态。用于在不同框架或运行时之间交换模型表示。NIMNVIDIA 为具体模型提供的预打包、容器化微服务。降低模型服务打包门槛,但仍需看底层硬件和运行时行为。NVIDIA DynamoNVIDIA 的开源分布式 serving 平台,面向 KV 复用、推理分离和多 GPU/多节点编排。处在服务编排层,连接模型执行和集群资源。Transformers (library)面向 LLM 和其他 Transformer 模型的参考实现库。常用于模型加载、配置、推理逻辑和研究原型。Diffusers (library)图像和视频生成流水线的参考实现库。把文本编码、去噪、VAE 等组件串成生成 pipeline。ComfyUI组装图像生成 pipeline 的工作流工具。用节点组合 base model、refiner、LoRA、ControlNet 等组件。九、扩散、多模态、视觉与语音推理Term中文理解在推理系统里看什么Image generation pipeline图像生成流水线:通常由 text encoder、迭代 denoiser 和 VAE 等多个模型组成。不是“一个模型一次前向”这么简单,而是多个阶段串接。Denoising model去噪模型:扩散流水线的核心,反复把 latent noise 精炼成图像或视频。推理步数、latent 尺寸和 kernel 直接影响时延。Iterative denoising (diffusion)迭代去噪:从噪声出发,在 latent space 中逐步生成图像或视频。每一步都要执行去噪计算,步数是重要性能杠杆。Latent space (images/videos)图像/视频的低维潜在空间,去噪通常发生在这里,例如 128x128 的表示。在 latent 空间计算比直接对像素计算更省资源。VAE (variational autoencoder)变分自编码器:把 latent 解码到 pixel space;训练中也可反向把像素编码到 latent。是扩散 pipeline 中从 latent 到最终图像的重要边界。CLIP (text encoder)CLIP 文本/图像编码器,早期图像 pipeline(如 SDXL)常用。现代系统常用更强的完整 LLM 替代或增强 prompt 理解。Classifier-free guidance无分类器引导:每一步平衡 unconditional 和 prompt-conditioned 去噪。guidance 低更有创造性,guidance 高更服从提示,但可能影响质量和速度。Few-step image generation少步图像生成:八步或更少生成可用图像。速度可快 80%-90%,但通常伴随明显质量权衡,适合实时场景。Latent consistency潜在一致性:直接预测目标 latent 的少步策略,可重复细化。很快,但保真度通常低于完整扩散。SDXL一个有代表性的早期扩散图像 pipeline:base + refiner + CLIP。现代系统通常保留多阶段结构,但替换成更强组件。Omni-modal全模态:接受文本、图像、视频、音频等多种输入,也产生多种输出。重点是输入输出模态都不局限于文本。Vision-language model (VLM)视觉语言模型:接收图像/视频和文本 prompt,输出文本。推理时要考虑视觉编码、跨模态 attention 和文本 decode。Encoder编码器:把原始输入转换成内部表示的网络,例如 Whisper 的音频特征编码器。在 encoder-decoder 模型中与 decoder 配对,可能成为多模态流水线的前置阶段。Automatic Speech Recognition (ASR)自动语音识别:音频输入、文本输出的转录模型,例如 Whisper。decoder 工作常主导运行时,可受益于 LLM 式优化和 in-flight batching。Voice activity detection (VAD)语音活动检测:把音频流或文件切成包含语音的片段。ASR 前处理中的轻量模型,减少无语音片段的无效计算。Diarization说话人分离:回答“谁在什么时候说话”,把音频按 speaker 切分。常与 VAD 配合使用,为 ASR 结果加说话人边界。Neural audio codec神经音频编解码器:把音频压缩成 token,再由配套 decoder 还原音频。把音频生成变成 token 级建模问题。SNAC (audio decoder)一条高性能音频 decoder 路径,常与 TTS token 流配合。负责把音频 token 流还原成可播放音频。十、投机解码与采样加速这一组的共同目标是:一次昂贵的 target-model forward,尽量确认多个 token。Term中文理解在推理系统里看什么Speculative decoding投机解码:先生成 draft tokens,再由目标模型批量验证,以便一次前向接受多个 token。关键指标是 draft 成本、接受率和最终每步接受 token 数。EAGLE (speculation)EAGLE:专门训练的小型 draft model,消费 hidden states 并提出多个 token。目标是让 draft 更贴近 target,提高 acceptance rate。Medusa (speculation)Medusa:通过微调增加额外 decoder heads,每次 forward 产生多个 draft token。不一定需要独立 draft model,但会引入额外训练或模型结构改动。Lookahead decoding前瞻解码:在推理中构造 n-gram,不依赖独立模型也能预测 draft token。利用已有生成模式换取更少的串行依赖。N-gram speculationN-gram 投机:利用 prefill 观察到的 n-gram,在 decode 中提出较长 draft 序列。对代码补全尤其有效,因为代码常有重复和稳定局部模式。十一、检索、嵌入与模型质量评估Term中文理解在推理系统里看什么Embedding model嵌入模型:把文本或图像编码成固定维度向量,用于语义相似度。常服务于 RAG、搜索和 agent memory;现代版本常使用 LLM backbone。Matryoshka representations (embeddings)Matryoshka 表示:嵌套向量表示,向量前部承载更多语义,可按需截断维度。在向量大小、检索成本和质量之间做可调权衡。Vector database向量数据库:存储和查询 embedding 产生的语义向量。RAG 的检索层,性能取决于索引、召回、过滤和存储。Vector similarity向量相似度:用余弦相似度等公式判断两个向量是否接近。相似向量通常代表相近语义,但相似度不是事实正确性。Retrieval-augmented generation (RAG)检索增强生成:在 prompt 之外,为 LLM 获取额外上下文的应用模式。端到端延迟要加上检索、重排、拼接上下文和额外 prefill。Benchmark (intelligence)智能基准:测量模型答对问题或采取适当行动的能力,例如 MMLU。衡量模型能力,不等于真实产品质量。Benchmark (performance)性能基准:在指定模型和 workload 下测量推理服务的延迟与吞吐。必须固定硬件、ISL/OSL、并发、batch 和测量口径。Evals评估:模拟真实用例的任务特定测试,用来测产品场景下的模型智能。比通用 benchmark 更接近业务,但也更需要自己维护数据和标准。Elo (quality meta-metric)Elo 质量元指标:用两两对决胜率比较模型质量。是方向性信号,不应单独代替任务指标或人工检查。Goodhart's Law古德哈特定律:当一个指标变成目标,它就不再是好的指标。优化 TPS、TTFT 或 benchmark 时,要同步观察质量、成本和真实体验。十二、GPU 架构、芯片和系统型号这一节专门收纳“名字很多、但不应和算法概念混在一起”的硬件术语。书中的数字和路线是该书版本的快照。Term中文理解在推理系统里看什么Ada Lovelace (architecture)NVIDIA 面向图形的 GPU 架构,与 Hopper 同期发布;适合小模型和成本敏感 workload。书中认为它不适合大规模 LLM 推理。Ampere (architecture)较早的 NVIDIA GPU 架构,仍用于遗留或小规模部署。与 Hopper、Blackwell 对比时关注成本、带宽和规模效率。Hopper (architecture)NVIDIA 2022 GPU 架构,支持 FP8 和异步编程特性。FlashAttention 3 的目标架构之一。Blackwell (architecture)NVIDIA 2024 年末的 GPU 代际,支持 FP4、MXFP8、MXFP4、NVFP4 和高内存带宽。低精度格式、带宽和大模型 serving 是其推理语境的重点。Rubin (architecture)书中描述的 NVIDIA 下一代架构,引入 HBM4 和面向 compute-bound workload 的 CPX。属于书中时间点的未来/路线术语,使用时应核对最新官方规格。Feynman (architecture)书中描述的 Rubin 之后的未来 NVIDIA 架构,细节有限。只适合当作路线名,不宜据此推断已落地能力。B200Blackwell 数据中心 GPU;书中给出 192 GB VRAM、8 TB/s 带宽和 5 petaFLOPS FP8 的规格描述。这些是书中快照,实际 SKU 和测量口径需要单独核验。B300Blackwell 数据中心 GPU;书中给出 288 GB VRAM、8 TB/s 带宽和 5 petaFLOPS FP8 的规格描述。主要用于理解显存、带宽和精度对推理的影响。Grace CPUNVIDIA 的 ARM CPU,通过高带宽芯片间互连与 GPU 配合。适合需要 CPU/GPU 高速交换的系统,例如 KV offload。Vera CPU书中描述的 NVIDIA ARM CPU,在 Rubin GPU 代际中接替 Grace。这是架构路线名,具体产品能力需要按版本核验。GB200Grace CPU + B200 GPU 的 NVIDIA superchip,通过高带宽 NVLink chip-to-chip 连接。适合 KV cache offload、LoRA swapping 等受益于 NVLink-C2C 的技术。GH200Grace CPU + H200 GPU 的 NVIDIA superchip,通过高带宽 NVLink chip-to-chip 连接。与 GB200 类似,重点是 CPU/GPU 间高带宽协作。NVL72机架级 Blackwell 系统,书中描述为互连 72 个 GPU 和 36 个 CPU。面向超大模型和极高吞吐 serving;系统级拓扑比单卡规格更重要。参考来源Baseten 官网Inference Engineering - Baseten Books在线阅读:Inference EngineeringAppendix A: Inference Glossary纸质书:Inference Engineering本文整理的是 Philip Kiely 所著、Baseten Books 出版的 Inference Engineering 中 Appendix A 的术语。原书按字母排列,本文按推理系统链路重排;硬件型号、软件版本和未来架构路线应以书中版本及官方资料为准。
Inference Engineering:按系统链路整理的推理工程术语表
生成式 AI 应用真正上线之后,问题就不只是“模型能不能回答”,还包括模型如何被加载、请求如何排队、GPU 如何计算和搬运数据,以及服务如何在真实流量下保持稳定。
这篇文章整理自 Philip Kiely 的
Inference Engineering。这本书由
Baseten Books 出版,官方提供
在线阅读版。下面的术语主要来自书中的
Appendix A: Inference Glossary,原书按字母排列,本文改为按推理系统链路分组,方便写代码、读源码和看性能指标时互相对照。
书中覆盖的范围从 CUDA、GPU 和推理引擎,一直延伸到 KV cache、量化、并行、扩散模型、语音、多云部署和生产服务。花了 2 天读完了,附录 B 也是很不错的索引材料
一、模型、应用与数据表示
这一组回答“模型是什么、应用如何调用模型、文本如何变成模型能处理的表示”。
Term
中文理解
在推理系统里看什么
Activation function
激活函数:插在线性层之间的大多可微非线性函数,例如 ReLU。
没有非线性,多层网络会退化成一次矩阵乘法。
Generative AI
生成式 AI:学习数据中的模式,并生成新的文本、图像、音频、视频或代码。
它强调“生成新内容”,区别于只做分类、预测的传统 ML。
Machine learning (ML)
机器学习:从数据中学习预测模型,例如分类和趋势预测。
在术语表中,它被用来和生成式 AI 做对照。
Foundation model
基础模型:在广泛数据上训练,可作为多个下游任务基础的模型。
可以直接 prompting,也可以 fine-tuning 成领域模型。
Open model
开放模型:模型权重可以自由获得,例如 Llama、DeepSeek、Whisper。
权重可见通常意味着部署、量化和硬件选择更可控。
Closed model
封闭模型:权重不可获得的专有模型,例如 GPT、Claude、Gemini。
通常通过 API 使用,用户控制的是请求、路由和成本,而不是底层权重。
Transformer
Transformer:生成式 AI 背后的基础网络架构。
attention、Q/K/V、KV cache 和大量推理优化都围绕它展开。
Causal language model (CLM)
因果语言模型:只用已有上下文预测下一个 token 的 decoder-only Transformer。
自回归 LLM 推理通常就是在运行 CLM 的 next-token 预测循环。
Large Language Model (LLM)
大语言模型:接收文本 prompt,生成新的文本序列。
典型家族包括 GPT、Claude、Llama、DeepSeek。
LLM
`Large Language Model` 的缩写。
与上一行是同一概念,工程文档中通常直接写 LLM。
Generative Pretrained Transformer (GPT)
生成式预训练 Transformer:OpenAI 创建的文本生成大语言模型家族。
是模型家族名称,不等于所有 LLM 的统称。
Agent
智能体:不只回答信息,还会调用工具并采取行动的 AI 应用。
一次用户请求可能触发多次推理、多个模型和多个模态。
AI-native application
AI 原生应用:核心体验和价值依赖生成模型的产品。
模态、延迟预算、单位经济性和使用模式会反过来决定推理架构。
Application Programming Interface (API)
API:发送请求、接收响应的结构化接口。
推理引擎通常通过 API 暴露模型查询能力。
Inference
推理:在生产环境中提供 AI 模型服务。
术语重点在 serving,不只是“跑一次模型前向”。
Inference engine
推理引擎:支持 batching、caching、quantization、speculation 等优化的高性能运行时。
vLLM、SGLang、TensorRT-LLM 都属于这一类。
Prompt
提示词:给模型的指令;扩散模型还可能包含 negative prompt、步数和 guidance 参数。
prompt 长度会直接影响 prefill、TTFT 和 KV cache 占用。
Chat template
聊天模板:按模型要求,把角色、分隔符和序列起止 token 序列化成输入。
同一句对话换模板后,实际 token 序列可能不同。
Token
token:LLM 处理文本的基本单位,本质上是表示字符串片段的整数。
延迟、吞吐、上下文窗口、计费通常都以 token 为单位。
Tokenizer
分词器:在字符串和 token 序列之间做确定性转换。
不同模型的 tokenizer 不同;更高效的 tokenizer 可降低端到端延迟。
Vocabulary
词汇表:模型用来表示数据的全部 token 集合。
词汇表大小影响 logits 向量和 token 化行为。
Input sequence
输入序列:请求中交给模型、在 prefill 阶段处理的 token。
输入越长,prefill 计算和 KV cache 建立成本通常越高。
Input Sequence Length (ISL)
输入序列长度:一次请求的输入 token 数。
和 OSL 一起描述 workload 的长度形状。
Output sequence
输出序列:模型在 decode 阶段生成的 token。
输出长度决定 decode 持续时间和用户看到的流式过程。
Output Sequence Length (OSL)
输出序列长度:一次请求生成的输出 token 数。
长 OSL 往往会放大 decode、KV cache 和队列压力。
Context window
上下文窗口:单次请求中模型可以处理的输入、推理和输出 token 总上限。
它是模型能力上限,也是显存、KV cache 和调度的约束。
Function calling
函数调用,也叫 tool calling / tool use:模型从给定函数集合中选择函数并返回结构化参数。
服务端要校验 schema、执行工具,并把结果重新送回模型。
Structured output
结构化输出:遵循指定 schema 的模型输出。
书中强调用 logit bias 等生成约束实现,而不是只靠 prompt 约定。
Logit biasing
Logit 偏置:在 sampling 前调整或约束 token 的概率,以引导 JSON、工具调用等输出。
它位于 logits 产生之后、最终采样之前。
二、请求生命周期、解码与性能指标
这组术语是“请求进来之后发生了什么,以及快不快应该怎么量”。
Term
中文理解
在推理系统里看什么
Autoregressive token generation
自回归 token 生成:每个新 token 依赖之前已经生成的 token。
它天然形成逐步 decode 循环,也是 KV cache 和 speculative decoding 的背景。
Pretraining
预训练:在广泛语料上进行的大规模训练,得到基础模型。
发生在 serving 之前;推理工程通常消费其产出的权重。
Training
训练:通过反向传播和优化从数据学习模型权重。
训练偏计算密集,通常依赖大规模 GPU 集群。
Prefill
预填充:LLM 推理中一次处理输入序列并建立 KV cache 的阶段。
通常是 compute-bound,长 ISL 会显著增加 TTFT。
Decode
解码:自回归循环逐 token 生成的阶段。
通常更受内存带宽和 KV 读取影响;每次前向常只新增一个 token。
Sampling (decode)
采样:根据生成的 logits 选择下一个输出 token。
常见策略有 greedy/argmax、temperature、top-k、top-p。
Logits
logits:模型每次前向为词汇表中每个 token 生成的未归一化分数向量。
sampling、temperature、logit bias 都作用于它或它的变换。
Softmax
softmax:把 attention 分数转成概率,也把 decode 中的 logits 归一化为概率分布。
它连接“打分”和“概率采样”两个阶段。
Temperature
温度:控制 token 选择的随机性;低值更确定,高值更多样。
它改变采样分布,不等于改变模型本身的能力。
Batch
批处理:同时处理多个输入。
能提高设备利用率,但请求长度差异会造成等待或 padding。
Batch sizing
批大小:延迟和吞吐的核心调节杠杆。
批越大通常总吞吐越高,但单用户延迟更差。
Dynamic batching
动态批处理:批次满了或短计时器到期就启动。
兼顾利用率和延迟稳定性;对 LLM 通常被 continuous batching 取代。
Continuous batching (in-flight)
连续批处理 / 进行中批处理:在 token 级别交错处理请求,让 GPU 槽位持续有工作。
对长度不一、持续到达的在线 LLM 请求尤其重要。
In-flight batching
`Continuous batching` 的另一种叫法。
重点是请求可以在 batch 执行过程中加入、完成和退出。
Chunked prefill
分块预填充:把长输入切块,并和 decode 或其他工作重叠。
防止一个超长序列长时间独占资源。
Queue (request)
请求队列:在 autoscaling 把新副本拉起之前,暂存超出当前容量的流量。
队列长度和等待时间是容量不足、冷启动或突发流量的信号。
Online inference
在线推理:实时服务请求,优先满足严格延迟预算。
关注 TTFT、ITL、P99 和可用性。
Offline inference
离线推理:异步批量处理大任务,优先吞吐和成本。
可以牺牲单请求延迟换取更高设备利用率。
Local (edge) inference
本地 / 边缘推理:在手机、电脑等终端设备上运行推理。
减少网络往返,但受端侧算力、内存和能耗约束。
Latency percentiles
延迟百分位数:用 P50、P90、P95、P99 等观察平均到尾延迟的分布。
P99 往往比平均值更接近最差用户体验。
Time to first byte (TTFB)
首字节时间:从请求开始到收到第一个输出字节的时间。
受网络、服务端处理和流式协议共同影响。
Time to first token (TTFT)
首 token 时间:从请求开始到收到第一个输出 token 的时间。
对聊天、代码补全等交互式场景很关键,通常包含 prefill。
Inter-token latency (ITL)
token 间延迟:decode 中相邻生成 token 的时间间隔。
ITL 越小,用户感知的流式输出越顺滑;例如 2 ms 约对应 500 TPS。
Perceived TPS
感知 TPS:单个用户在流式输出中实际看到的每秒 token 数。
它比笼统的吞吐更贴近单用户体验。
Tokens per second (TPS)
每秒 token 数:每秒向最终用户流式传输的 token 数,术语表中指向 perceived TPS。
需要明确是单用户 TPS 还是聚合吞吐。
Throughput
吞吐量:单位时间完成的总工作量,例如总 token/s。
聚合吞吐变高,不代表每个用户的 TPS 或 TTFT 变好。
Baselines
基线:优化前仔细记录的性能和质量测量。
没有 baseline,就无法可靠归因优化收益或回退。
Load testing
负载测试:持续发送高流量,探测吞吐上限、队列行为和扩缩容。
要配合真实的 ISL/OSL 分布,而不是只用均匀合成请求。
Jitter traffic (bench)
抖动流量:在请求到达时间和序列形状中加入随机性。
比整齐的固定间隔流量更接近真实 workload。
Real-time factor (RTF)
实时因子:ASR 转录速度指标;一小时音频六秒转完时,RTF 为 600。
适合表达音频处理相对于原始播放时长的速度。
三、Attention、KV cache 与上下文优化
Term
中文理解
在推理系统里看什么
Attention
注意力:通过 Q/K/V 投影和 softmax,把当前 token 与历史 token 关联起来的 Transformer 机制。
计算量和内存流量都大,是推理优化的核心目标。
Head (attention)
注意力头:一层中的一次独立 attention 计算。
多头结构让模型能从不同子空间建模关系。
Cross-attention
交叉注意力:一个序列的 Q 以另一个序列的 K/V 为条件。
常见于文本条件图像、多模态和扩散去噪流水线。
KV cache
KV 缓存:保存每个历史 token 的 K/V 张量,避免每一步重新计算历史投影。
它用显存换计算;上下文越长,缓存越大、每步读取也越多。
Prefix caching
前缀缓存:跨请求复用共享前缀的 KV,跳过重复 prefill。
对代码补全、多轮对话、agent 系统可显著改善 TTFT。
Cache-aware routing
缓存感知路由:把请求发到已经持有匹配前缀或所需 LoRA 的副本。
路由不只看负载,也看缓存命中和本地状态。
PagedAttention
分页注意力:把 KV block 存进固定大小的 page,以更好管理长上下文内存。
典型收益是减少碎片、提高 KV 利用率;不能把它等同于普通 OS 分页。
Rotary positional embeddings (RoPE)
旋转位置编码:用可学习的旋转表示位置,帮助长上下文外推。
长上下文能力和 attention 内存需求之间存在权衡。
Context Parallelism (CP)
上下文并行:在 GPU 间复制权重、切分 attention context。
适合上下文或视频 latent 空间极大的模型。
Ring attention
环形注意力:一种 CP 机制,GPU 以环形传递部分 attention 结果。
通过降低 all-to-all 压力支持更长上下文。
Disaggregation
推理分离:把 prefill 和 decode 拆到可独立扩展、使用不同硬件资源的引擎。
让两种完全不同的瓶颈分别扩容,但会引入传输和调度复杂度。
四、GPU、内存层次与 CUDA 软件栈
这组术语解释“模型最终在哪里算、数据如何搬、内核如何执行”。
Term
中文理解
在推理系统里看什么
Central Processing Unit (CPU)
CPU:适合顺序工作负载的通用处理器。
主要负责编排、调度、网络和预处理,通常不直接承担生成式推理主计算。
Graphics Processing Unit (GPU)
GPU:高度并行的处理器,现广泛用于生成式 AI 训练和推理。
关注显存容量、带宽、计算单元和互连,而不只看型号。
GPU node
GPU 节点:通常指包含 8 个、通过 NVLink/NVSwitch 互连的 GPU 的标准机箱。
是多 GPU 推理和节点内并行的常见基本单元。
Node
节点:带 NVLink/NVSwitch 的物理 8-GPU 基础单元;多节点之间再加 InfiniBand。
明确“节点内”和“节点间”通信边界。
Instance (cloud)
云实例:包含 GPU、CPU、RAM、存储、网络和互连的已配置虚拟机。
云上计费、部署和扩缩容通常以 instance 为边界。
High-Bandwidth Memory (HBM)
高带宽内存:数据中心 GPU 用作 VRAM 的高带宽内存,如 HBM3、HBM3e、HBM4。
决定权重、激活和 KV 的可容纳量以及数据供给速度。
VRAM (device memory)
显存:GPU 上存放权重、KV 和激活的设备内存。
容量限制模型大小和 KV 余量,带宽影响 decode TPS。
Out-of-memory error (OOM)
显存不足错误:GPU 没有足够 VRAM 加载权重或执行推理。
需要从模型精度、上下文长度、batch、KV cache 和并行方式一起排查。
Bandwidth
带宽:内存或互连每秒能传输的数据量。
decode 常受带宽约束;NVLink、HBM、InfiniBand 是不同层级的带宽。
Core (CUDA)
CUDA Core:执行标量和逐元素操作的通用算术单元。
不是所有算子都由 Tensor Core 完成。
Core (Tensor)
Tensor Core:针对混合精度矩阵乘累加(MMA)优化的专用单元。
GEMM 和多数推理主计算会高度依赖它。
Streaming Multiprocessor (SM)
SM:包含核心和缓存的 GPU 计算单元。
kernel 会被调度到 SM 上,以大量线程实现并行。
Thread
线程:GPU 上最小的执行单元。
一个 kernel 通常启动大量线程来覆盖数据并行工作。
Special Function Unit (SFU)
SFU:加速正弦、余弦等特定数学运算的专用单元。
把特殊函数从 CUDA Core 上分担出去。
L0/L1/L2 caches (GPU)
GPU 片上缓存层次,用于指令、共享内存和全局缓存等数据。
数据是否命中更近的缓存会影响 kernel 的实际性能。
CUDA
NVIDIA 的 GPU 编程模型和平台,覆盖 kernel、graph、内存和执行。
推理软件、编译器和库通常通过 CUDA 接触 GPU。
CUDA driver
CUDA 驱动:应用和 GPU 硬件之间的低层接口,管理内存和执行。
处理系统级资源与设备交互。
CUDA runtime
CUDA 运行时:面向开发者的 API,用于启动 kernel 和管理内存。
比 driver 更接近应用代码和运行时调用。
CUDA kernel
CUDA kernel:用户定义、在 GPU 上并行执行的函数。
算子性能优化最终常常落到 kernel 设计。
CUDA graph
CUDA graph:把 kernel 和其他 GPU 操作组织成 DAG,以优化重复工作流。
减少重复 launch 开销,适合形状和流程较稳定的推理。
Basic Linear Algebra Subprograms (BLAS)
BLAS:基础线性代数操作的标准接口。
GEMM 等核心算子经常通过 BLAS 或其 GPU 实现调用。
cuBLAS
CUDA 的 BLAS 实现,提供高质量 GEMM 等基础原语。
是 NVIDIA GPU 上矩阵乘法优化的重要库。
cuDNN
CUDA 深度神经网络基元库。
提供神经网络常用操作的高性能实现。
General matrix-matrix multiplication (GEMM)
GEMM:通用矩阵乘法,属于 BLAS,也是推理的关键操作。
大量线性层最终都可归结为矩阵乘法。
Matmul
矩阵乘法的简称。
口语或代码中常用;GEMM 是更具体、带矩阵形状和实现语境的说法。
CuTe
NVIDIA 生态中的 C++ 模板库,抽象 tiled tensor 操作,帮助组合精度感知的优化 GEMM 和 fused kernel。
更接近编写底层、高性能 kernel 的开发者工具。
CUTLASS
CUDA C++ 模板库,为高性能、架构调优的 GEMM 和相关 kernel 提供构建块。
常用于自己组装或调优矩阵计算。
DeepGEMM
DeepSeek 团队创建的高效 GEMM kernel 库,在 FP8 上有较强表现。
代表针对具体精度和硬件的专用 kernel 优化。
FlashAttention
一系列减少内存流量的优化 attention kernel。
书中举例:FlashAttention 3 面向 Hopper,FlashAttention 4 面向 Blackwell。
Kernel fusion
内核融合:把多个 kernel 合成一个,减少中间结果的内存往返。
经常以更复杂的 kernel 换取更少的读写和 launch 开销。
FLOPS
每秒浮点运算次数,通常在 Tensor Core 语境下衡量。
是峰值计算能力,不等于真实模型吞吐。
Arithmetic intensity
算术强度:每移动一个字节完成多少运算。
和硬件的 ops:byte 比较,可判断 kernel 更偏 compute-bound 还是 memory-bound。
Ops:byte ratio (GPU)
GPU 在给定精度下,每字节内存带宽对应的峰值操作数。
与算法算术强度配合使用,帮助定位瓶颈。
Roofline model
屋顶线模型:把算术强度和内存带宽、计算上限画在一张图上。
用来判断优化应该优先补计算还是补内存带宽。
Compute-bound
计算受限:性能主要受可用 FLOPS 限制,而不是内存带宽。
prefill、图像/视频生成常更接近这一侧。
PyTorch compile (torch.compile)
面向特定 GPU 的图捕获、kernel 选择和融合机制。
缓存编译结果可以减少 cold start。
PyTorch Profiler
测量每个操作 CPU/GPU 时间和内存的开发者工具。
用 profile 证据判断瓶颈,不要只凭直觉调参。
五、精度、量化与模型压缩
Term
中文理解
在推理系统里看什么
Floating-point data formats
浮点格式:FP16、FP8、FP4 等,使用指数-尾数结构,动态范围较高。
精度、显存、带宽、Tensor Core 支持和质量损失需要一起看。
BF16
16 位浮点格式,指数范围比 FP16 大,动态范围更高,更能容纳异常值。
常见于训练,也用于部分推理。
Integer data formats
整数格式:例如 INT8、INT4,动态范围较有限。
通常节省存储和带宽,但需要关注量化误差。
Dynamic range (quantization)
动态范围:某种数字格式能够表示的绝对值范围。
浮点格式往往比相同字节数的整数格式有更高动态范围。
Microscaling formats
微缩放格式:如 MXFP8、MXFP4、NVFP4,按小块使用缩放因子。
通过 blockwise scale 在低精度下尽量保留精度。
NVFP4
NVIDIA 的 4 位浮点微缩放格式,使用双缩放因子和 block size 16 的块级量化。
是低精度硬件和格式路线中的一个具体例子。
Quantization (post-training)
训练后量化:降低权重、激活以及可能的 KV cache 精度。
目标是减少计算和带宽,但需要用质量和性能基线验证。
Quantization-aware training
量化感知训练:联合计算量化 scale 并优化权重,让最终模型适配低精度部署。
一般比直接训练后量化更能主动适应量化误差,但需要训练成本。
Weights-only quantization
仅权重量化:只降低线性层权重精度,KV cache 和 attention 等保持较高精度。
质量保持通常更保守,但性能收益也可能更有限。
Scale factor (quantization)
量化缩放因子:把低精度值映射回原数字范围的乘数。
scale 的粒度和计算方式会影响误差与 kernel 实现。
Sparsity (FLOPS)
稀疏性:例如 2:4 结构化稀疏中一半值为 0,Tensor Core 可跳过零乘法。
书中提醒,大多数推理仍是 dense,不要默认稀疏一定生效。
Fine-tuning
微调:把预训练基础模型适配到具体领域。
可能让更小模型达到目标质量,降低部署成本。
LoRA
低秩适配:一种轻量微调方法,只对模型产生小幅改动。
单一基础模型上切换成千上万个 LoRA,会带来缓存和路由问题。
Distillation
蒸馏:让较小 student 模型模仿较大 teacher 的概率分布,而不只是最终输出。
用更少参数保留部分教师行为,是压缩和降本路径之一。
六、并行、互连与分布式推理
Term
中文理解
在推理系统里看什么
Model parallelism (overview)
模型并行总称:通过 TP、EP、PP 等把工作拆到多个 GPU。
选择取决于模型大小、拓扑、延迟目标和吞吐目标。
Tensor Parallelism (TP)
张量并行:把张量运算切到同一节点的多个 GPU。
单用户延迟通常较好,但需要频繁 all-reduce 同步。
Pipeline Parallelism (PP)
流水线并行:把模型层切成多个 stage 分布到 GPU。
多节点 dense 模型可用,但 pipeline bubble 会让部分 GPU 等待。
Expert Parallelism (EP)
专家并行:把 MoE 的专家分片到多个 GPU,每个 GPU 保留多个完整专家。
在较低 GPU 间通信开销下提升总吞吐。
Mixture of Experts (MoE)
专家混合:把线性层权重拆成多个稀疏 expert,由 router 每次只激活部分专家。
总参数量可以很大,但单次计算只触发一部分专家。
Multi-node inference
多节点推理:一个 8-GPU 节点的 VRAM 不够时,扩展到两个或更多节点。
要选择合适的并行策略;InfiniBand 上过多 all-to-all 会拖慢 TP。
InfiniBand
节点间互连,用于跨多节点扩展训练和推理。
带宽通常高于 Ethernet,但明显低于节点内 NVLink。
NVLink
GPU 之间的一对一高速通信层。
书中给出 Blackwell 最高 1800 GB/s、Hopper 最高 900 GB/s 的示例;具体取决于产品和链路配置。
NVSwitch
建在 NVLink 之上的全对全通信层,协调节点内所有 GPU。
改变多 GPU 节点内的通信拓扑和可扩展性。
PCIe (GPU form factor)
PCIe GPU 形态:通过标准 PCI Express 插槽连接。
通常基础规格和互连选项少于同型号 SXM 版本。
SXM (GPU form factor)
SXM GPU 形态:插槽式模块,支持更高带宽连接和更强供电。
推理集群中常用于高规格、强互连的 GPU 配置。
Multi-Instance GPU (MIG)
多实例 GPU:把较大的 GPU 切成最多八个内存 slice 和七个计算 slice。
适合隔离小工作负载,但会牺牲一部分整卡灵活性。
Control plane (multi-cloud)
多云控制平面:负责部署模型和分配资源的全局编排器。
做决策、调度和容量管理,不一定承载实际请求。
Workload plane (multi-cloud)
多云工作负载平面:真正运行推理、处理请求的独立集群。
控制平面把工作放到这里执行。
Multi-cloud capacity management
多云容量管理:在多个云服务商和区域之间放置工作负载的全局调度。
目标是把异构 GPU 池当成可调度资源,同时处理容量和地域约束。
Bin packing (multi-cloud)
多云装箱:把不同云、区域和集群的 GPU 池看作统一资源来装载任务。
需要容量管理基础设施屏蔽硬件异构性。
Data sovereignty
数据主权:法律对模型输入输出在哪里处理、在哪里存储的约束。
可能直接决定区域选择、路由和多云部署方式。
Hyperscaler
超大规模云服务商,例如 AWS、GCP。
资源规模大、产品通用;和专注 GPU 的 neocloud 相对。
Neocloud
专注 GPU 的专业云服务商,例如 CoreWeave、Nebius。
常作为多云 GPU 容量的补充来源。
七、生产部署、可靠性与服务治理
Term
中文理解
在推理系统里看什么
Active-active
双活:多个区域或集群同时承载实时流量,某个平面失败后由其他平面继续服务。
可用性高,但需要多地路由、状态和容量协调。
Active-passive
主备:热备集群或区域保持就绪但平时空闲,主用失败后切换。
结构相对简单,但备用资源利用率和切换速度需要权衡。
Autoscaling
自动扩缩容:根据流量或利用率自动增减模型副本。
目标是匹配容量与需求,同时维持延迟 SLA、减少浪费。
Autoscaling window
自动扩缩容窗口:决定扩容或缩容的滚动时间范围。
窗口长更稳定,窗口短对突发峰值反应更快。
Cold start
冷启动:副本从零扩到第一次成功响应的时间,包括 GPU 配置、容器启动、模型加载和引擎编译。
是 scale-to-zero 的主要代价,直接影响队列和首请求延迟。
Scale to zero
缩容到零:空闲时关闭全部副本,有请求时按需启动。
省成本但依赖快速 cold start 和可靠 queueing。
Blue-green deployment
蓝绿部署:维护两个并行生产环境,在蓝绿之间切流量。
支持零停机发布和快速回滚。
Canary deployment
金丝雀部署:先把小比例实时流量发给新版本,观察稳定性和性能后逐渐放量。
用真实流量做渐进式验证。
Shadow traffic
影子流量:把真实生产请求镜像到候选部署,但不使用候选结果服务用户。
可以评估新版本,避免直接影响主路径。
Routing (inference)
推理路由:根据负载、KV cache、可用 LoRA 和序列形状把请求放到合适副本。
好的路由器不仅做 round-robin,还利用模型运行状态。
gRPC
gRPC:结构化、schema-first 的双向流式协议。
适合定义良好的服务间通信;schema 校验带来一些额外开销。
WebSocket
WebSocket:轻量、双向流式传输协议。
适合非结构化音频块和实时用户体验。
Service Level Agreement (SLA)
SLA:系统对延迟、吞吐、可用性等指标做出的合同承诺。
对外承诺,通常需要可观测数据支撑。
Service Level Objective (SLO)
SLO:系统内部为满足或超过 SLA 设定的目标。
内部目标通常应比外部 SLA 留出余量。
Docker
Docker:用容器把推理服务及其依赖打包成标准化运行单元。
保证部署环境更可复现,但不自动解决 GPU 驱动和性能问题。
Dockerfile
Dockerfile:创建容器镜像的、人可读且机器可执行的指令文件。
把运行时依赖、启动命令和环境固定下来。
八、推理引擎、运行时与工程工具
Term
中文理解
在推理系统里看什么
vLLM
广泛采用的推理引擎,模型和硬件支持面广,默认配置成熟。
常见能力包括连续批处理、KV 管理、量化和服务 API。
SGLang
快速推理引擎,前端/后端灵活,并强化 MoE 支持。
适合需要结构化工作流和高性能 serving 的场景。
TensorRT
NVIDIA 面向高性能推理优化的运行时。
组合 fused kernels、quantization 等优化。
TensorRT-LLM
NVIDIA 构建的 LLM 推理引擎,提供 Python API,并支持 TensorRT engine 和 PyTorch backend。
集成融合 kernel、量化和 speculative decoding。
Triton Inference Server
NVIDIA 的生产级服务框架,支持多种后端。
解决模型服务编排、协议和后端接入,不等于单一 kernel 库。
ONNX
模型的中间表示和运行时生态。
用于在不同框架或运行时之间交换模型表示。
NIM
NVIDIA 为具体模型提供的预打包、容器化微服务。
降低模型服务打包门槛,但仍需看底层硬件和运行时行为。
NVIDIA Dynamo
NVIDIA 的开源分布式 serving 平台,面向 KV 复用、推理分离和多 GPU/多节点编排。
处在服务编排层,连接模型执行和集群资源。
Transformers (library)
面向 LLM 和其他 Transformer 模型的参考实现库。
常用于模型加载、配置、推理逻辑和研究原型。
Diffusers (library)
图像和视频生成流水线的参考实现库。
把文本编码、去噪、VAE 等组件串成生成 pipeline。
ComfyUI
组装图像生成 pipeline 的工作流工具。
用节点组合 base model、refiner、LoRA、ControlNet 等组件。
九、扩散、多模态、视觉与语音推理
Term
中文理解
在推理系统里看什么
Image generation pipeline
图像生成流水线:通常由 text encoder、迭代 denoiser 和 VAE 等多个模型组成。
不是“一个模型一次前向”这么简单,而是多个阶段串接。
Denoising model
去噪模型:扩散流水线的核心,反复把 latent noise 精炼成图像或视频。
推理步数、latent 尺寸和 kernel 直接影响时延。
Iterative denoising (diffusion)
迭代去噪:从噪声出发,在 latent space 中逐步生成图像或视频。
每一步都要执行去噪计算,步数是重要性能杠杆。
Latent space (images/videos)
图像/视频的低维潜在空间,去噪通常发生在这里,例如 128x128 的表示。
在 latent 空间计算比直接对像素计算更省资源。
VAE (variational autoencoder)
变分自编码器:把 latent 解码到 pixel space;训练中也可反向把像素编码到 latent。
是扩散 pipeline 中从 latent 到最终图像的重要边界。
CLIP (text encoder)
CLIP 文本/图像编码器,早期图像 pipeline(如 SDXL)常用。
现代系统常用更强的完整 LLM 替代或增强 prompt 理解。
Classifier-free guidance
无分类器引导:每一步平衡 unconditional 和 prompt-conditioned 去噪。
guidance 低更有创造性,guidance 高更服从提示,但可能影响质量和速度。
Few-step image generation
少步图像生成:八步或更少生成可用图像。
速度可快 80%-90%,但通常伴随明显质量权衡,适合实时场景。
Latent consistency
潜在一致性:直接预测目标 latent 的少步策略,可重复细化。
很快,但保真度通常低于完整扩散。
SDXL
一个有代表性的早期扩散图像 pipeline:base + refiner + CLIP。
现代系统通常保留多阶段结构,但替换成更强组件。
Omni-modal
全模态:接受文本、图像、视频、音频等多种输入,也产生多种输出。
重点是输入输出模态都不局限于文本。
Vision-language model (VLM)
视觉语言模型:接收图像/视频和文本 prompt,输出文本。
推理时要考虑视觉编码、跨模态 attention 和文本 decode。
Encoder
编码器:把原始输入转换成内部表示的网络,例如 Whisper 的音频特征编码器。
在 encoder-decoder 模型中与 decoder 配对,可能成为多模态流水线的前置阶段。
Automatic Speech Recognition (ASR)
自动语音识别:音频输入、文本输出的转录模型,例如 Whisper。
decoder 工作常主导运行时,可受益于 LLM 式优化和 in-flight batching。
Voice activity detection (VAD)
语音活动检测:把音频流或文件切成包含语音的片段。
ASR 前处理中的轻量模型,减少无语音片段的无效计算。
Diarization
说话人分离:回答“谁在什么时候说话”,把音频按 speaker 切分。
常与 VAD 配合使用,为 ASR 结果加说话人边界。
Neural audio codec
神经音频编解码器:把音频压缩成 token,再由配套 decoder 还原音频。
把音频生成变成 token 级建模问题。
SNAC (audio decoder)
一条高性能音频 decoder 路径,常与 TTS token 流配合。
负责把音频 token 流还原成可播放音频。
十、投机解码与采样加速
这一组的共同目标是:一次昂贵的 target-model forward,尽量确认多个 token。
Term
中文理解
在推理系统里看什么
Speculative decoding
投机解码:先生成 draft tokens,再由目标模型批量验证,以便一次前向接受多个 token。
关键指标是 draft 成本、接受率和最终每步接受 token 数。
EAGLE (speculation)
EAGLE:专门训练的小型 draft model,消费 hidden states 并提出多个 token。
目标是让 draft 更贴近 target,提高 acceptance rate。
Medusa (speculation)
Medusa:通过微调增加额外 decoder heads,每次 forward 产生多个 draft token。
不一定需要独立 draft model,但会引入额外训练或模型结构改动。
Lookahead decoding
前瞻解码:在推理中构造 n-gram,不依赖独立模型也能预测 draft token。
利用已有生成模式换取更少的串行依赖。
N-gram speculation
N-gram 投机:利用 prefill 观察到的 n-gram,在 decode 中提出较长 draft 序列。
对代码补全尤其有效,因为代码常有重复和稳定局部模式。
十一、检索、嵌入与模型质量评估
Term
中文理解
在推理系统里看什么
Embedding model
嵌入模型:把文本或图像编码成固定维度向量,用于语义相似度。
常服务于 RAG、搜索和 agent memory;现代版本常使用 LLM backbone。
Matryoshka representations (embeddings)
Matryoshka 表示:嵌套向量表示,向量前部承载更多语义,可按需截断维度。
在向量大小、检索成本和质量之间做可调权衡。
Vector database
向量数据库:存储和查询 embedding 产生的语义向量。
RAG 的检索层,性能取决于索引、召回、过滤和存储。
Vector similarity
向量相似度:用余弦相似度等公式判断两个向量是否接近。
相似向量通常代表相近语义,但相似度不是事实正确性。
Retrieval-augmented generation (RAG)
检索增强生成:在 prompt 之外,为 LLM 获取额外上下文的应用模式。
端到端延迟要加上检索、重排、拼接上下文和额外 prefill。
Benchmark (intelligence)
智能基准:测量模型答对问题或采取适当行动的能力,例如 MMLU。
衡量模型能力,不等于真实产品质量。
Benchmark (performance)
性能基准:在指定模型和 workload 下测量推理服务的延迟与吞吐。
必须固定硬件、ISL/OSL、并发、batch 和测量口径。
Evals
评估:模拟真实用例的任务特定测试,用来测产品场景下的模型智能。
比通用 benchmark 更接近业务,但也更需要自己维护数据和标准。
Elo (quality meta-metric)
Elo 质量元指标:用两两对决胜率比较模型质量。
是方向性信号,不应单独代替任务指标或人工检查。
Goodhart's Law
古德哈特定律:当一个指标变成目标,它就不再是好的指标。
优化 TPS、TTFT 或 benchmark 时,要同步观察质量、成本和真实体验。
十二、GPU 架构、芯片和系统型号
这一节专门收纳“名字很多、但不应和算法概念混在一起”的硬件术语。书中的数字和路线是该书版本的快照。
Term
中文理解
在推理系统里看什么
Ada Lovelace (architecture)
NVIDIA 面向图形的 GPU 架构,与 Hopper 同期发布;适合小模型和成本敏感 workload。
书中认为它不适合大规模 LLM 推理。
Ampere (architecture)
较早的 NVIDIA GPU 架构,仍用于遗留或小规模部署。
与 Hopper、Blackwell 对比时关注成本、带宽和规模效率。
Hopper (architecture)
NVIDIA 2022 GPU 架构,支持 FP8 和异步编程特性。
FlashAttention 3 的目标架构之一。
Blackwell (architecture)
NVIDIA 2024 年末的 GPU 代际,支持 FP4、MXFP8、MXFP4、NVFP4 和高内存带宽。
低精度格式、带宽和大模型 serving 是其推理语境的重点。
Rubin (architecture)
书中描述的 NVIDIA 下一代架构,引入 HBM4 和面向 compute-bound workload 的 CPX。
属于书中时间点的未来/路线术语,使用时应核对最新官方规格。
Feynman (architecture)
书中描述的 Rubin 之后的未来 NVIDIA 架构,细节有限。
只适合当作路线名,不宜据此推断已落地能力。
B200
Blackwell 数据中心 GPU;书中给出 192 GB VRAM、8 TB/s 带宽和 5 petaFLOPS FP8 的规格描述。
这些是书中快照,实际 SKU 和测量口径需要单独核验。
B300
Blackwell 数据中心 GPU;书中给出 288 GB VRAM、8 TB/s 带宽和 5 petaFLOPS FP8 的规格描述。
主要用于理解显存、带宽和精度对推理的影响。
Grace CPU
NVIDIA 的 ARM CPU,通过高带宽芯片间互连与 GPU 配合。
适合需要 CPU/GPU 高速交换的系统,例如 KV offload。
Vera CPU
书中描述的 NVIDIA ARM CPU,在 Rubin GPU 代际中接替 Grace。
这是架构路线名,具体产品能力需要按版本核验。
GB200
Grace CPU + B200 GPU 的 NVIDIA superchip,通过高带宽 NVLink chip-to-chip 连接。
适合 KV cache offload、LoRA swapping 等受益于 NVLink-C2C 的技术。
GH200
Grace CPU + H200 GPU 的 NVIDIA superchip,通过高带宽 NVLink chip-to-chip 连接。
与 GB200 类似,重点是 CPU/GPU 间高带宽协作。
NVL72
机架级 Blackwell 系统,书中描述为互连 72 个 GPU 和 36 个 CPU。
面向超大模型和极高吞吐 serving;系统级拓扑比单卡规格更重要。
参考来源
本文整理的是 Philip Kiely 所著、Baseten Books 出版的 Inference Engineering 中 Appendix A 的术语。原书按字母排列,本文按推理系统链路重排;硬件型号、软件版本和未来架构路线应以书中版本及官方资料为准。