A

推論術語表

可篩選的決策詞彙,涵蓋模型、系統、最佳化與正式環境。

5 分鐘閱讀

印刷頁: 209–230

在 GitHub 加星

34 個術語

把術語當成診斷把手

若每個指標都對應一項觀察、每種瓶頸都指出受限資源、每項技術都說明改變的機制,推論討論就會更清楚。這份精簡術語表優先保留能協助工程師從產品症狀走到可量測假設,再選擇適當服務手段的詞彙。

量測與工作負載

Time to first token
time to first token,縮寫為 TTFT,量測使用者等到第一個生成 token 可用的時間。它包含排隊與 prefill 工作,因此數值偏高不一定是 decode 問題。
Inter-token latency
inter-token latency,縮寫為 ITL,是 decode 期間相鄰 streaming token 之間的時間。若客戶端額外負擔很小,其倒數對應單一使用者感受到的生成速率。
Perceived tokens per second
使用者感知的 tokens per second,縮寫為 TPS,是單一使用者收到 streaming 輸出的速率。若客戶端額外負擔很小,它約等於 ITL 的倒數,且不同於系統總吞吐量。
Throughput
單位時間完成的有效總工作量,例如所有請求合計的 token 數。它量測系統容量,不等同於單一使用者感受到的生成速度。
Latency percentiles
以中位數、第 95 或第 99 百分位數等方式觀察分布。百分位數能揭露平均值掩蓋的慢尾端,並應依請求形狀與負載切分。
Load testing
以持續且受控的流量揭露飽和點、queue 成長、autoscaling 與失效界線。有效測試會重現抵達時間與序列形狀,而不只是盡快重送相同請求。

模型執行

Prefill
生成開始前,處理完整輸入序列並建立 attention 狀態的階段。大型矩陣運算常使它受限於算力,其時間也會強烈影響首個回應延遲。
Decode
為每個進行中序列反覆產生下一個 token 的自迴歸階段。它會重讀模型 weights 與既存 attention 狀態,因此效能經常受限於記憶體搬移。
Continuous batching
隨個別序列進度加入或移除請求的 token 層級 scheduling。它能維持 accelerator 槽位忙碌,又不必讓每個請求等整個固定 batch 完成。
Key-value cache (KV cache)
KV cache 通常稱為 KV cache,儲存已處理 token 的 attention 鍵與值。重用可避免重新計算先前上下文,但 cache 會占用裝置記憶體,並隨序列長度與並行請求增加。
Prefix caching
跨請求重用相同起始提示的鍵值狀態。若 routing 能維持局部性,重複的系統提示、對話與程式碼上下文可略過大量 prefill。

瓶頸與硬體

Arithmetic intensity
每搬移一個位元組所完成的計算量。把它與處理器的運算對頻寬比例比較,可預測加快算術或減少資料搬移何者更值得優先。
Compute-bound
執行速率主要受可用算力限制的工作負載。單純增加頻寬無法解除限制;減少運算、降低精度或提高 compute unit 使用率才可能有效。
Roofline model
把運算的 arithmetic intensity 放到硬體頻寬與算力上限之間比較的視覺模型。它能把 profiling 結果轉化為瓶頸假設,而非一串使用率百分比。
Video random-access memory
video random-access memory,縮寫為 VRAM,在 accelerator 上容納模型 weights、activations 與 attention cache。容量決定能否放入;頻寬則經常限制 decode streaming token 的速度。
GPU interconnect
accelerator 之間的通訊路徑,例如節點內高頻寬 interconnect,或較慢的節點間網路。平行策略必須符合其頻寬與同步成本。

runtime 與 kernel

Tensor Core
專門處理混合精度矩陣乘加的 GPU 算術單元。推論效能取決於 kernel 的形狀與數值格式,是否能有效使用這些單元。
CUDA
NVIDIA 用於 GPU 記憶體、kernel、運算圖與執行的程式平台。它橫跨低階驅動程式,以及高階推論框架所使用的開發者執行設施。
Kernel fusion
把相鄰操作合併為單一 GPU kernel,使中間值留在靠近運算的位置,避免額外往返裝置記憶體。收益取決於原本的啟動與記憶體成本。
Inference engine
scheduling 模型執行的服務 runtime,並提供 batching、cache、quantization 與 speculation 等最佳化。engine 選擇應依模型支援與實測工作負載行為決定。
Profiler
把時間與記憶體歸因到主機工作、傳輸、kernel 與同步的工具。先以可重現的 benchmark 確立待解釋的使用者指標退化,剖析才最有價值。

最佳化與擴展

Quantization
以較少位元表示 weights、activations 或 cache,降低儲存、頻寬,有時也降低運算成本。不同模型、張量與工作負載的敏感度各異,每次部署都需要品質評估。
Tensor parallelism
tensor parallelism,縮寫為 TP,把單一張量運算拆到多張 GPU。在高速 interconnect 的節點內可改善單一請求延遲,但會引入頻繁的集合通訊。
Mixture of experts
mixture of experts,縮寫為 MoE,把部分線性層 weights 分成稀疏 expert,並把每個 token route 到其中一部分。它能在每次前向傳遞不啟用全部 expert 的情況下擴大模型容量。
Expert parallelism
expert parallelism,縮寫為 EP,把 MoE 模型的 expert 分散到多張 GPU。token 會流向被選中的 expert,以通訊複雜度交換稀疏模型容量與吞吐量。
Pipeline parallelism
pipeline parallelism,縮寫為 PP,把模型層切成多個階段並分別放到不同 GPU。它可讓稠密模型跨節點放入記憶體,但管線 bubble 會使部分裝置在等待其他階段時閒置。
Speculative decoding
一系列先提出再驗證 draft token 的方法,讓 decode 能在一次目標模型前向傳遞中接受多個 token。效益取決於 draft 接受率與驗證負擔。
Prefill-decode disaggregation
讓 prefill 與 decode 在可分別擴縮的服務資源上執行。隔離有助於 scheduling 與硬體匹配,但傳送 attention 狀態會增加網路與營運成本。
Cache-aware routing
把請求送到已持有可用提示 prefix 或轉接器的 replica。更佳局部性可降低首個回應延遲,但仍須與 replica 負載及容錯需求平衡。

正式環境與 modality

Autoscaling
依需求或使用率自動改變服務 replica 數。控制視窗、啟動延遲、queue 策略與安全餘裕會共同決定延遲和閒置成本。
Cold start
從要求新增容量到能成功回傳結果的時間。資源配置、映像啟動、載入 weights 與 runtime 編譯,可能分別主導不同部署。
Vision-language model
vision language model,縮寫為 VLM,同時接收視覺輸入與文字,並輸出文字。影像前處理、視覺 token 與長上下文,使其工作負載不同於純文字生成。
Automatic speech recognition
automatic speech recognition,縮寫為 ASR,把音訊轉成文字。正式流程還可能偵測語音片段並識別說話者;decoder 工作會主導執行時間,也能受益於語言模型式 batching。
Text to speech
text to speech,縮寫為 TTS,把文字轉成音訊。在 token 型系統中,可把 SNAC 這類高效能音訊 decoder 接到生成的 TTS token streaming。

來源索引

  • 基礎

    紙本第 211 至 214 頁涵蓋應用框架、arithmetic intensity、batching、autoscaling 與早期模型術語。

  • 執行與部署

    紙本第 215 至 218 頁涵蓋 CUDA、decode、denoising、部署與數值格式概念。

  • 記憶體與模型行為

    紙本第 219 至 222 頁涵蓋 accelerator、服務指標、鍵值狀態、模型家族與多 GPU 執行。

  • 最佳化與可靠性

    紙本第 223 至 226 頁涵蓋平行、cache、quantization、routing、服務目標與 speculation。

  • 服務與 modality

    紙本第 227 至 229 頁涵蓋延遲、吞吐量、runtime、視覺、音訊、傳輸與裝置記憶體。

Foundational application, model, batching, and performance terminology
印刷頁: 211–214; PDF 頁: 213–216
CUDA, execution, model-format, and deployment terminology
印刷頁: 215–218; PDF 頁: 217–220
GPU, memory, latency, caching, model, and multi-GPU terminology
印刷頁: 219–222; PDF 頁: 221–224
Online serving, parallelism, quantization, routing, and reliability terminology
印刷頁: 223–226; PDF 頁: 225–228
Serving metrics, runtimes, modalities, transports, and device-memory terminology
印刷頁: 227–229; PDF 頁: 229–231