6

多 modality

比較文字、視覺、音訊與影片的推論流程和瓶頸。

10 分鐘閱讀

印刷頁: 153–176

在 GitHub 加星

一口氣讀懂

modality 改變的不只是 payload。vision language model(VLM)先把影像或影片轉成 visual token,再進入語言 decode;embedding model 輸出一個向量,而不是一串 token;automatic speech recognition(ASR)把音訊轉成文字,text to speech(TTS)則多了 audio token decoder 與 waveform 階段。影像與影片生成通常不是 autoregressive token generation,而是反覆 denoise 雜訊。最佳化必須跟著管線走:縮減視覺 context、batching embedding、協調語音 chunk、調整 diffusion kernel,或分散影片 attention。指標也要對準使用者真正看到或聽到的單位,不能只套用同一個 token 計數器。

為何重要

  • 輸入與輸出的邊界決定工作累積在哪裡。像素增加 encoder 與 context 成本;音訊帶來 chunk 與傳輸;向量把成本移到儲存和相似度搜尋;denoising 則會把大型運算路徑重複許多次。
  • 產品可能協調 preprocessor、專用模型與 decoder,而不是只跑一個模型。每個階段都需要自己的延遲、容量與品質預算,否則很小的輔助元件也可能卡住後方昂貴的 accelerator。
  • Token 指標不能原封不動搬到所有 modality。語音使用者在乎第一段可理解的話,轉錄工作在乎單位時間處理多少音訊,影像使用者則在乎完成時間與視覺偏好。
  • 流量形狀會改變服務設計。互動式 embedding lookup、百萬筆 backfill、連續語音、單張影像生成與八張 GPU 協作的影片生成,即使共用底層 library,也需要不同的 batching、queueing、scaling 與故障處理。

心智模型

把每個請求視為不同表示法之間的一連串轉換。記下原始輸入、前處理、模型原生表示、主要 execution loop、後處理、傳輸,以及第一個真正有用的輸出,再替每個邊界標上資源與指標。這張圖會指出應該調整 model kernel、刪除多餘轉換、平行處理互不相依的 chunk,還是改變產品 protocol。

同一個服務問題,五種管線形狀

輸入流向五條對照路徑:視覺理解先把像素轉成 visual token 再進行文字 decode;Embedding 把項目壓縮成單一向量;語音管線由音訊經過轉錄與推理再合成音訊;Image diffusion 反覆修正 latent;Video diffusion 則讓 attention 跨越寬、高與時間。

視覺理解
像素或影格先成為 visual token,再進行文字 decode
Embedding
可變長度輸入轉成一個固定長度的語意向量
語音管線
音訊經過切段、轉錄、推理與語音合成
Image diffusion
帶雜訊的 latent 經多個 denoising step 反覆修正
Video diffusion
時空 latent 讓 attention 與 parallelism 成為主角
  • 視覺理解Embedding: 把文字輸出改成向量輸出
  • Embedding語音管線: 把離線或查詢流量改成即時 streaming
  • 語音管線Image diffusion: 把 autoregressive 輸出改成 iterative denoising
  • Image diffusionVideo diffusion: 讓 latent space 延伸到時間維度

視覺理解先由 encoder 切分並 embedding 影像或抽樣影格,接著讓語言模型把這些 visual token 與 prompt 一起處理。解析度和 frame rate 能保留細節,卻會擴大 prefill 與 key-value cache。動作資訊重要時,應在同一次呼叫處理一段完整的短片;以足以放進 context 的程度 downsample,必要時另行轉錄聲音,並在後續提問中重用相同的視覺 prefix。

Embedding 應把大量回填與線上查詢分成兩條 lane。Backfill 適合大型 request batch、較寬的 queue 與水平 replica;面向使用者的 retrieval 則需要有限 queue 與低 tail latency。BERT-style encoder model 對簡單且延遲敏感的工作仍有用,LLM-derived embedding model 的整體能力通常更強。輸出維度主要影響後續向量儲存、傳輸和相似度運算,對模型 runtime 影響較小;不同模型的 vector space 也不能互換。因此遷移模型必須重算整個 corpus 的 embedding 並重新評估 retrieval,不能只讓維度相同。

即時轉錄可用 voice activity detection(VAD)把連續音訊 stream 切成一般 ASR 呼叫,再經同一條連線傳回文字。依序落在同一個 worker 時,也能把前一段文字當成 context。長檔案的優先順序相反:先移除靜音、切成有意義的 chunk、分散到多個 replica,最後依 timestamp 接回。用 real-time factor(RTF)追蹤效能,偵測異常重複或不合理語速,再用不同 temperature 或切段方式重跑有問題的片段。speaker diarization 是另一條 segmentation、embedding 與 clustering 管線,不是 Whisper 類型的 decode;應獨立 profile,因為該版指出即使最佳化後,處理時間仍至少是轉錄的兩倍。

語音合成先以 autoregressive 方式生成 audio token,再由另一個 decoder 轉成 waveform。兩個階段都要最佳化與 batching,但不能假設 waveform decoder 支援 inference engine 的 token-level scheduler。當生成速度已快過即時播放,再加速也不會讓單一聽眾獲益,應把多出的能力用於更多同時 stream。Cascaded voice 產品還要把 VAD、ASR、語言推理、TTS 與 network round trip 一起納入對話迴圈預算。對於語音轉語音,該版認為當時沒有可商用的 open model,closed alternative 的能力與成本也不如 cascaded system;這項快速變動的取捨必須重新驗證。

Image diffusion 的完成時間會隨 denoising pass 增加。要先用節省記憶體的 attention 與 fusion 暴露真正的 compute-bound 路徑,再以低精度矩陣運算使用更快的 tensor hardware。品質與速度政策可以減少 step,或在前期構圖確立後停止 prompt guidance。影片把 latent 延伸到時間,讓 attention 成為主要成本;常見做法是用完整節點、batch one、cache 中間結果、選擇性降低 attention 精度,再以 context parallelism 取代一般吞吐量 batching。

效能旁邊必須保留 modality 專屬的品質 gate。精度改變後要比較 embedding vector 與 retrieval 結果;依音訊條件檢查轉錄錯誤和 retry heuristic;評估語音自然度與可理解度;影像與影片則要用 human preference 檢查,因為自動視覺評分只能提供方向。只有品質損失仍在產品明定容忍範圍內,最佳化才成立。這個 gate 也要使用與正式產品相同的前處理和後處理,否則模型輸出雖然相近,整條管線仍可能因切段、decode、排序或格式轉換而改變使用者看到的結果。每次實驗都保留 baseline sample 與失敗案例,讓後續 engine、precision 或 hardware 更新能重播同一套判斷。

有效的 benchmark matrix 要跟著產品真正暴露的變數設計。視覺助理要交叉測試影像數量、解析度、抽樣影格、prompt length、cache state 與 response length,因為同一個 model 在單張照片與多段影片上面對的是完全不同的 context 壓力。語音要涵蓋語言、環境雜訊、說話速度、chunk size、silence ratio 與同時 stream;diffusion 則要涵蓋 resolution、clip duration、step schedule、guidance、precision 與 GPU topology。每條路徑先 warm up,再重複足夠次數以看見正常波動,並同時保存原始 latency distribution、resource trace 與具代表性的輸出。這樣才能避免一個只為乾淨單一 sample 調好的 configuration,被誤寫成適用整個 modality 的效能結論;也能在版本更新後重跑相同矩陣,分辨 regression 是來自 input mix、runtime 還是 quality policy。

組合式系統做 capacity planning 時,先找最慢的 stage,再沿著 variability 往上游追。如果 VAD 每秒能切分數百條 stream,而 transcription 只能處理數十條,讓 admission 無限制通過只會堆出愈來愈長的 transcription queue,並把一開始看似便宜的 detector 變成 overload amplifier。若 TTS 生成音訊已快過 client 消費,buffer、network egress 與 connection slot 就會變成新的 capacity limit,而不是 GPU token rate。每個 stage 都要有實測 service rate、有限 buffer、timeout、retry budget 與 backpressure action;下游變慢時,上游應減少接收或降低品質,而不是持續製造無法及時交付的工作。各階段可以獨立 scaling,但 request identity、deadline、configuration 與 cancellation 必須一路保留,避免 retry 重複昂貴工作,也避免在使用者早已離開後才傳回正確卻失去價值的結果。

modality 最佳化要按 population rollout,不能只看 aggregate average。較低 visual resolution 可能保留一般場景,卻讀不到小字;新的 transcription chunk policy 可能在安靜的英文語音表現很好,遇到吵雜、多語或快速換 speaker 就失敗;diffusion precision 改動可能維持整體構圖,卻破壞臉部、文字、細節或 motion coherence。把受控比例流量送到 candidate,實務允許時同時保留 baseline output,並替每個結果標記 input characteristic、model revision、runtime、precision 與完整 configuration。比較時除了整體平均,也要看每個重要 slice 的 tail latency、可持續 throughput、failure rate、unit cost,以及對應的人類偏好或任務品質 gate。只有各 slice 都通過明定界線才逐步放大流量;任何一組使用者可感知 regression 都應觸發 rollback 或縮小適用範圍,而不是被其他容易案例的平均值掩蓋。

先辨認模型的生成原型與真正有意義的輸出單位,再選服務指標。Autoregressive 模型會延伸 tokenized sequence,diffusion 模型則反覆 denoise 輸出。前者涵蓋 vision-language、embedding、ASR 與 TTS 模型;影像和影片生成通常屬於後者。許多 LLM engine 與最佳化技巧可以沿用到相關的 autoregressive modality,但 diffusion 的最佳化路徑不同。接著要用使用者能感知的單位重新定義 latency、throughput 與 quality。對 TTS 來說,單一 audio token 本身沒有實用意義,因此應量測 time to first word 或 time to first sentence,而不是 time to first token。

核心概念

VLM 與影片輸入

Vision encoder 即使比語言模型小,仍可能決定 runtime 相容性。很長的視覺序列會提高 prefill 與 cache 壓力;downsampling、最佳化 attention、cache reuse、quantization、parallelism 與 phase separation 都仍是可用手段。

Omni-modal 或組合式管線

統一模型能保留跨 modality context,並簡化產品邊界。由光學字元辨識、轉錄、retrieval、語言與合成元件組成的管線,則可能在窄任務上更快、更準,也能讓各階段獨立擴縮。

Embedding inference

Encoder-style 工作會平行處理 token,因此 prefix caching 和 prefill-decode separation 沒有幫助。應優先採用單 GPU replica、大型 batch、平行 tokenization、明確 queue,並在變更精度或向量長度時檢查品質。

ASR inference

在 encoder-decoder model 中,autoregressive decoder 通常占主要成本。即時 stream 最能從 chunk orchestration 與 persistent transport 獲益;長檔案則適合移除靜音、平行 chunk、in-flight batching 與針對性 retry。

TTS inference

語音合成結合類似語言模型的 audio-token generation 與 waveform decoding。應量測 time to first byte(TTFB)、第一段有意義語句的時間、生成速度與同時即時 stream;不能獎勵只會超越播放速度、卻沒有增加容量的 token 速度。

影像生成

Iterative denoising 偏向運算瓶頸,並直接暴露 step count 與 guidance 的取捨。Kernel selection、fusion、compilation、matrix precision 與 human preference test,比語言服務的 cache policy 更重要。

影片生成

聯合處理時空的 denoising 能提高連貫性,卻讓 attention 變得非常龐大。Batching 餘裕很小時,吞吐量必須靠更快的 attention、安全重用、選擇性 quantization,以及把 context calculation 分散到高速 interconnect GPU。

運作機制

  1. 從 client payload 到有用輸出,畫出完整的表示法路徑。納入前處理、輔助模型、decoding、儲存與傳輸,不能只計時最大的模型。
  2. 分開互動式、streaming 與 bulk traffic。依各自的 arrival pattern,替每條 lane 設置 queue、concurrency limit、autoscaling signal 與服務目標。
  3. 用具代表性的解析度、frame rate、音訊長度、語言、vector batch、輸出大小、denoising step 與品質案例建立 baseline,並報告整個分布,而不是只選一筆友善輸入。
  4. 依階段 profile。Context 主導時縮減 visual token;launch overhead 主導時增加 embedding batch;音訊 chunk 互不相依時平行處理;編譯 audio decoder;只有 evidence 指向 diffusion attention 時才更換該路徑。
  5. 一次只改一個品質與速度控制項,例如 resolution、vector dimension、precision、chunking、denoising step、guidance 或 cache reuse;用相同輸入與明確 acceptance gate 比較。
  6. 即時音訊使用持久的雙向連線,依實測容量限制 active stream,保持順序,並在 queue 膨脹摧毀對話延遲之前把 backpressure 傳回上游。
  7. 最佳化後重新測量整個產品迴圈。模型變快之後,tokenization、waveform decode、stitching、network transfer、vector search 或 client playback 都可能成為新的限制。

關鍵指標

視覺理解

P95 端到端延遲

依影像數量、解析度、抽樣影格、visual token、cache reuse 與生成文字長度切分。

Embedding

items/s 與 lookup P99

吞吐量與 tail latency 要同時附上 batch size、queue depth、vector dimension 與 retrieval quality。

即時 ASR

chunk round-trip ms

量測從收音到文字的延遲、active stream、chunk duration、backlog,以及不同條件下的轉錄品質。

長檔案 ASR

RTF 與完成時間

追蹤音訊長度除以處理時間、各階段 utilization、retry 次數與 stitch 正確性。

TTS

TTFB 與第一段語句

也要量測每張 GPU 的 real-time stream、underrun、decoder latency,以及生成是否持續領先播放。

影像生成

每張可接受影像的秒數

記錄 step count、guidance schedule、resolution、accelerator time 與 blind human preference。

影片生成

每段可接受影片的秒數

依片長與解析度切分,並追蹤 attention 占比、cache reuse、GPU scaling efficiency 與品質退步。

取捨

視覺細節或 context 預算

較高解析度與 frame rate 能保留小細節和動作,卻會增加 visual token、prefill、cache 與 attention。Downsampling 犧牲資訊,換得整段 clip 能放進一次推論。

統一模型或專用管線

Omni-modal model 能保留聯合 context 並減少 handoff;較小的光學、語音或前處理模型在特定領域可能更快、更準,但會增加 orchestration 工作。

向量資訊量或系統成本

較長向量可保留更多語意資訊,也會增加儲存、傳輸與相似度運算。較短的 Matryoshka-style output 能降低下游成本,卻不會明顯改變 inference time。

循序 context 或檔案 parallelism

循序 chunk 可把前一段文字交給下一段轉錄;長檔案平行處理會快很多,卻失去這份連續性,因此必須用 segmentation 與 retry logic 補回品質。

Diffusion 速度或視覺品質

減少 step、縮短 guidance、cache state 與降低精度都能刪除運算,也可能改變構圖、prompt adherence、細節或時間連貫性,所以每個手段都需要面向人的驗證。

複製或通訊

Context parallelism 會複製影片模型 weights,再把 latent sequence 的 attention 分開。它用記憶體與 interconnect bandwidth 換取單一 batch-one clip 更快完成。

工程檢查表

  • 採購或選架構前,依目前 release 重新查核每一項 2026 年 1 月版模型、runtime、accelerator、format 與效能敘述。
  • 寫下精確的輸入與有用輸出 contract,包括大小、時間長度、格式、語言、品質門檻與 deadline。
  • 盤點所有 preprocessor、model、decoder、queue、store、transport 與 client step,替每個步驟指定 owner 和 latency budget。
  • 當 concurrency 或 scaling policy 衝突時,分開 online lookup、continuous streaming、long-running job 與 backfill。
  • 依正式流量的 input size、output size、batch、concurrency、cache state、step count 與 accelerator topology 分布進行 benchmark。
  • 每個效能實驗都要搭配該 modality 的品質測試,並保留能觸發已知 failure mode 的案例。
  • 設定 queue 與 active-stream 上限,傳遞 backpressure,並測試 slow consumer、retry、disconnect 與部分管線故障。
  • 以端到端 percentile latency、可持續容量、單位成本與可接受輸出品質核准變更,不能只看模型本身的 speedup。

術語

Visual token
經編碼的 image patch 或 video representation,會進入語言模型的 input sequence。
Downsampling
降低影像解析度或影片 frame rate,以縮減視覺 context 成本。
Embedding
把項目放進某個模型專屬 semantic space 的固定長度向量。
Voice activity detection
找出語音區段並產生有意義 audio chunk 的輕量階段。
Real-time factor
轉錄工作中,音訊長度除以處理時間所得的比值。
Time to first byte
語音合成開始傳回可播放輸出之前的延遲。
Iterative denoising
反覆修正 noisy latent,逐步產生影像或影片輸出。
Context parallelism
複製 weights,同時把 attention context 分散到 interconnect GPU。

原書索引

  • 第 153-156 頁

    modality 分類、兩種模型 archetype,以及重新定義效能指標的必要性。

  • 第 156-159 頁

    Vision encoder、視覺 context、影片、downsampling、omni-modal model 與組合式前處理。

  • 第 159-162 頁

    Embedding architecture、traffic lane、vector trade-off、runtime、batching 與 queue。

  • 第 162-166 頁

    轉錄 architecture、live stream、長檔案 parallelism、retry 與 diarization。

  • 第 166-169 頁

    語音合成、audio decoding、使用者指標、streaming 與 voice pipeline。

  • 第 169-172 頁

    Image diffusion、品質評估、kernel、compilation、step 與 guidance。

  • 第 173-176 頁

    Video diffusion、attention 成本、caching、選擇性 quantization 與 context parallelism。

Modality taxonomy, autoregressive and denoising archetypes, shared engines, and metric changes
印刷頁: 153–156; PDF 頁: 155–158
Vision encoders, visual tokens, video processing, downsampling, omni-modal models, and preprocessing pipelines
印刷頁: 156–159; PDF 頁: 158–161
Embedding architectures, online and backfill traffic, vector dimensionality, runtimes, quantization, batching, and queues
印刷頁: 159–162; PDF 頁: 161–164
ASR architecture, live streaming, long-file pipelines, retry heuristics, and diarization
印刷頁: 162–166; PDF 頁: 164–168
TTS architecture, audio decoding, latency metrics, streaming, and cascading voice systems
印刷頁: 166–169; PDF 頁: 168–171
Image diffusion pipelines, quality evaluation, kernels, compilation, quantization, step count, and guidance
印刷頁: 169–172; PDF 頁: 171–174
Video diffusion workload, attention, caching, selective quantization, and context parallelism
印刷頁: 173–176; PDF 頁: 175–178