A
推論術語表
可篩選的決策詞彙,涵蓋模型、系統、最佳化與正式環境。
5 分鐘閱讀
印刷頁: 209–230
34 個術語
把術語當成診斷把手
若每個指標都對應一項觀察、每種瓶頸都指出受限資源、每項技術都說明改變的機制,推論討論就會更清楚。這份精簡術語表優先保留能協助工程師從產品症狀走到可量測假設,再選擇適當服務手段的詞彙。
量測與工作負載
- Time to first token
- time to first token,縮寫為 TTFT,量測使用者等到第一個生成 token 可用的時間。它包含排隊與 prefill 工作,因此數值偏高不一定是 decode 問題。
- Inter-token latency
- inter-token latency,縮寫為 ITL,是 decode 期間相鄰 streaming token 之間的時間。若客戶端額外負擔很小,其倒數對應單一使用者感受到的生成速率。
- Perceived tokens per second
- 使用者感知的 tokens per second,縮寫為 TPS,是單一使用者收到 streaming 輸出的速率。若客戶端額外負擔很小,它約等於 ITL 的倒數,且不同於系統總吞吐量。
- Throughput
- 單位時間完成的有效總工作量,例如所有請求合計的 token 數。它量測系統容量,不等同於單一使用者感受到的生成速度。
- Latency percentiles
- 以中位數、第 95 或第 99 百分位數等方式觀察分布。百分位數能揭露平均值掩蓋的慢尾端,並應依請求形狀與負載切分。
- Load testing
- 以持續且受控的流量揭露飽和點、queue 成長、autoscaling 與失效界線。有效測試會重現抵達時間與序列形狀,而不只是盡快重送相同請求。
模型執行
- Prefill
- 生成開始前,處理完整輸入序列並建立 attention 狀態的階段。大型矩陣運算常使它受限於算力,其時間也會強烈影響首個回應延遲。
- Decode
- 為每個進行中序列反覆產生下一個 token 的自迴歸階段。它會重讀模型 weights 與既存 attention 狀態,因此效能經常受限於記憶體搬移。
- Continuous batching
- 隨個別序列進度加入或移除請求的 token 層級 scheduling。它能維持 accelerator 槽位忙碌,又不必讓每個請求等整個固定 batch 完成。
- Key-value cache (KV cache)
- KV cache 通常稱為 KV cache,儲存已處理 token 的 attention 鍵與值。重用可避免重新計算先前上下文,但 cache 會占用裝置記憶體,並隨序列長度與並行請求增加。
- Prefix caching
- 跨請求重用相同起始提示的鍵值狀態。若 routing 能維持局部性,重複的系統提示、對話與程式碼上下文可略過大量 prefill。
瓶頸與硬體
- Arithmetic intensity
- 每搬移一個位元組所完成的計算量。把它與處理器的運算對頻寬比例比較,可預測加快算術或減少資料搬移何者更值得優先。
- Compute-bound
- 執行速率主要受可用算力限制的工作負載。單純增加頻寬無法解除限制;減少運算、降低精度或提高 compute unit 使用率才可能有效。
- Roofline model
- 把運算的 arithmetic intensity 放到硬體頻寬與算力上限之間比較的視覺模型。它能把 profiling 結果轉化為瓶頸假設,而非一串使用率百分比。
- Video random-access memory
- video random-access memory,縮寫為 VRAM,在 accelerator 上容納模型 weights、activations 與 attention cache。容量決定能否放入;頻寬則經常限制 decode streaming token 的速度。
- GPU interconnect
- accelerator 之間的通訊路徑,例如節點內高頻寬 interconnect,或較慢的節點間網路。平行策略必須符合其頻寬與同步成本。
runtime 與 kernel
- Tensor Core
- 專門處理混合精度矩陣乘加的 GPU 算術單元。推論效能取決於 kernel 的形狀與數值格式,是否能有效使用這些單元。
- CUDA
- NVIDIA 用於 GPU 記憶體、kernel、運算圖與執行的程式平台。它橫跨低階驅動程式,以及高階推論框架所使用的開發者執行設施。
- Kernel fusion
- 把相鄰操作合併為單一 GPU kernel,使中間值留在靠近運算的位置,避免額外往返裝置記憶體。收益取決於原本的啟動與記憶體成本。
- Inference engine
- scheduling 模型執行的服務 runtime,並提供 batching、cache、quantization 與 speculation 等最佳化。engine 選擇應依模型支援與實測工作負載行為決定。
- Profiler
- 把時間與記憶體歸因到主機工作、傳輸、kernel 與同步的工具。先以可重現的 benchmark 確立待解釋的使用者指標退化,剖析才最有價值。
最佳化與擴展
- Quantization
- 以較少位元表示 weights、activations 或 cache,降低儲存、頻寬,有時也降低運算成本。不同模型、張量與工作負載的敏感度各異,每次部署都需要品質評估。
- Tensor parallelism
- tensor parallelism,縮寫為 TP,把單一張量運算拆到多張 GPU。在高速 interconnect 的節點內可改善單一請求延遲,但會引入頻繁的集合通訊。
- Mixture of experts
- mixture of experts,縮寫為 MoE,把部分線性層 weights 分成稀疏 expert,並把每個 token route 到其中一部分。它能在每次前向傳遞不啟用全部 expert 的情況下擴大模型容量。
- Expert parallelism
- expert parallelism,縮寫為 EP,把 MoE 模型的 expert 分散到多張 GPU。token 會流向被選中的 expert,以通訊複雜度交換稀疏模型容量與吞吐量。
- Pipeline parallelism
- pipeline parallelism,縮寫為 PP,把模型層切成多個階段並分別放到不同 GPU。它可讓稠密模型跨節點放入記憶體,但管線 bubble 會使部分裝置在等待其他階段時閒置。
- Speculative decoding
- 一系列先提出再驗證 draft token 的方法,讓 decode 能在一次目標模型前向傳遞中接受多個 token。效益取決於 draft 接受率與驗證負擔。
- Prefill-decode disaggregation
- 讓 prefill 與 decode 在可分別擴縮的服務資源上執行。隔離有助於 scheduling 與硬體匹配,但傳送 attention 狀態會增加網路與營運成本。
- Cache-aware routing
- 把請求送到已持有可用提示 prefix 或轉接器的 replica。更佳局部性可降低首個回應延遲,但仍須與 replica 負載及容錯需求平衡。
正式環境與 modality
- Autoscaling
- 依需求或使用率自動改變服務 replica 數。控制視窗、啟動延遲、queue 策略與安全餘裕會共同決定延遲和閒置成本。
- Cold start
- 從要求新增容量到能成功回傳結果的時間。資源配置、映像啟動、載入 weights 與 runtime 編譯,可能分別主導不同部署。
- Vision-language model
- vision language model,縮寫為 VLM,同時接收視覺輸入與文字,並輸出文字。影像前處理、視覺 token 與長上下文,使其工作負載不同於純文字生成。
- Automatic speech recognition
- automatic speech recognition,縮寫為 ASR,把音訊轉成文字。正式流程還可能偵測語音片段並識別說話者;decoder 工作會主導執行時間,也能受益於語言模型式 batching。
- Text to speech
- text to speech,縮寫為 TTS,把文字轉成音訊。在 token 型系統中,可把 SNAC 這類高效能音訊 decoder 接到生成的 TTS token streaming。
來源索引
基礎
紙本第 211 至 214 頁涵蓋應用框架、arithmetic intensity、batching、autoscaling 與早期模型術語。
執行與部署
紙本第 215 至 218 頁涵蓋 CUDA、decode、denoising、部署與數值格式概念。
記憶體與模型行為
紙本第 219 至 222 頁涵蓋 accelerator、服務指標、鍵值狀態、模型家族與多 GPU 執行。
最佳化與可靠性
紙本第 223 至 226 頁涵蓋平行、cache、quantization、routing、服務目標與 speculation。
服務與 modality
紙本第 227 至 229 頁涵蓋延遲、吞吐量、runtime、視覺、音訊、傳輸與裝置記憶體。
- Foundational application, model, batching, and performance terminology
- 印刷頁: 211–214; PDF 頁: 213–216
- CUDA, execution, model-format, and deployment terminology
- 印刷頁: 215–218; PDF 頁: 217–220
- GPU, memory, latency, caching, model, and multi-GPU terminology
- 印刷頁: 219–222; PDF 頁: 221–224
- Online serving, parallelism, quantization, routing, and reliability terminology
- 印刷頁: 223–226; PDF 頁: 225–228
- Serving metrics, runtimes, modalities, transports, and device-memory terminology
- 印刷頁: 227–229; PDF 頁: 229–231