VLM 與影片輸入
Vision encoder 即使比語言模型小,仍可能決定 runtime 相容性。很長的視覺序列會提高 prefill 與 cache 壓力;downsampling、最佳化 attention、cache reuse、quantization、parallelism 與 phase separation 都仍是可用手段。
6
比較文字、視覺、音訊與影片的推論流程和瓶頸。
10 分鐘閱讀
印刷頁: 153–176
modality 改變的不只是 payload。vision language model(VLM)先把影像或影片轉成 visual token,再進入語言 decode;embedding model 輸出一個向量,而不是一串 token;automatic speech recognition(ASR)把音訊轉成文字,text to speech(TTS)則多了 audio token decoder 與 waveform 階段。影像與影片生成通常不是 autoregressive token generation,而是反覆 denoise 雜訊。最佳化必須跟著管線走:縮減視覺 context、batching embedding、協調語音 chunk、調整 diffusion kernel,或分散影片 attention。指標也要對準使用者真正看到或聽到的單位,不能只套用同一個 token 計數器。
把每個請求視為不同表示法之間的一連串轉換。記下原始輸入、前處理、模型原生表示、主要 execution loop、後處理、傳輸,以及第一個真正有用的輸出,再替每個邊界標上資源與指標。這張圖會指出應該調整 model kernel、刪除多餘轉換、平行處理互不相依的 chunk,還是改變產品 protocol。
輸入流向五條對照路徑:視覺理解先把像素轉成 visual token 再進行文字 decode;Embedding 把項目壓縮成單一向量;語音管線由音訊經過轉錄與推理再合成音訊;Image diffusion 反覆修正 latent;Video diffusion 則讓 attention 跨越寬、高與時間。
視覺理解先由 encoder 切分並 embedding 影像或抽樣影格,接著讓語言模型把這些 visual token 與 prompt 一起處理。解析度和 frame rate 能保留細節,卻會擴大 prefill 與 key-value cache。動作資訊重要時,應在同一次呼叫處理一段完整的短片;以足以放進 context 的程度 downsample,必要時另行轉錄聲音,並在後續提問中重用相同的視覺 prefix。
Embedding 應把大量回填與線上查詢分成兩條 lane。Backfill 適合大型 request batch、較寬的 queue 與水平 replica;面向使用者的 retrieval 則需要有限 queue 與低 tail latency。BERT-style encoder model 對簡單且延遲敏感的工作仍有用,LLM-derived embedding model 的整體能力通常更強。輸出維度主要影響後續向量儲存、傳輸和相似度運算,對模型 runtime 影響較小;不同模型的 vector space 也不能互換。因此遷移模型必須重算整個 corpus 的 embedding 並重新評估 retrieval,不能只讓維度相同。
即時轉錄可用 voice activity detection(VAD)把連續音訊 stream 切成一般 ASR 呼叫,再經同一條連線傳回文字。依序落在同一個 worker 時,也能把前一段文字當成 context。長檔案的優先順序相反:先移除靜音、切成有意義的 chunk、分散到多個 replica,最後依 timestamp 接回。用 real-time factor(RTF)追蹤效能,偵測異常重複或不合理語速,再用不同 temperature 或切段方式重跑有問題的片段。speaker diarization 是另一條 segmentation、embedding 與 clustering 管線,不是 Whisper 類型的 decode;應獨立 profile,因為該版指出即使最佳化後,處理時間仍至少是轉錄的兩倍。
語音合成先以 autoregressive 方式生成 audio token,再由另一個 decoder 轉成 waveform。兩個階段都要最佳化與 batching,但不能假設 waveform decoder 支援 inference engine 的 token-level scheduler。當生成速度已快過即時播放,再加速也不會讓單一聽眾獲益,應把多出的能力用於更多同時 stream。Cascaded voice 產品還要把 VAD、ASR、語言推理、TTS 與 network round trip 一起納入對話迴圈預算。對於語音轉語音,該版認為當時沒有可商用的 open model,closed alternative 的能力與成本也不如 cascaded system;這項快速變動的取捨必須重新驗證。
Image diffusion 的完成時間會隨 denoising pass 增加。要先用節省記憶體的 attention 與 fusion 暴露真正的 compute-bound 路徑,再以低精度矩陣運算使用更快的 tensor hardware。品質與速度政策可以減少 step,或在前期構圖確立後停止 prompt guidance。影片把 latent 延伸到時間,讓 attention 成為主要成本;常見做法是用完整節點、batch one、cache 中間結果、選擇性降低 attention 精度,再以 context parallelism 取代一般吞吐量 batching。
效能旁邊必須保留 modality 專屬的品質 gate。精度改變後要比較 embedding vector 與 retrieval 結果;依音訊條件檢查轉錄錯誤和 retry heuristic;評估語音自然度與可理解度;影像與影片則要用 human preference 檢查,因為自動視覺評分只能提供方向。只有品質損失仍在產品明定容忍範圍內,最佳化才成立。這個 gate 也要使用與正式產品相同的前處理和後處理,否則模型輸出雖然相近,整條管線仍可能因切段、decode、排序或格式轉換而改變使用者看到的結果。每次實驗都保留 baseline sample 與失敗案例,讓後續 engine、precision 或 hardware 更新能重播同一套判斷。
有效的 benchmark matrix 要跟著產品真正暴露的變數設計。視覺助理要交叉測試影像數量、解析度、抽樣影格、prompt length、cache state 與 response length,因為同一個 model 在單張照片與多段影片上面對的是完全不同的 context 壓力。語音要涵蓋語言、環境雜訊、說話速度、chunk size、silence ratio 與同時 stream;diffusion 則要涵蓋 resolution、clip duration、step schedule、guidance、precision 與 GPU topology。每條路徑先 warm up,再重複足夠次數以看見正常波動,並同時保存原始 latency distribution、resource trace 與具代表性的輸出。這樣才能避免一個只為乾淨單一 sample 調好的 configuration,被誤寫成適用整個 modality 的效能結論;也能在版本更新後重跑相同矩陣,分辨 regression 是來自 input mix、runtime 還是 quality policy。
組合式系統做 capacity planning 時,先找最慢的 stage,再沿著 variability 往上游追。如果 VAD 每秒能切分數百條 stream,而 transcription 只能處理數十條,讓 admission 無限制通過只會堆出愈來愈長的 transcription queue,並把一開始看似便宜的 detector 變成 overload amplifier。若 TTS 生成音訊已快過 client 消費,buffer、network egress 與 connection slot 就會變成新的 capacity limit,而不是 GPU token rate。每個 stage 都要有實測 service rate、有限 buffer、timeout、retry budget 與 backpressure action;下游變慢時,上游應減少接收或降低品質,而不是持續製造無法及時交付的工作。各階段可以獨立 scaling,但 request identity、deadline、configuration 與 cancellation 必須一路保留,避免 retry 重複昂貴工作,也避免在使用者早已離開後才傳回正確卻失去價值的結果。
modality 最佳化要按 population rollout,不能只看 aggregate average。較低 visual resolution 可能保留一般場景,卻讀不到小字;新的 transcription chunk policy 可能在安靜的英文語音表現很好,遇到吵雜、多語或快速換 speaker 就失敗;diffusion precision 改動可能維持整體構圖,卻破壞臉部、文字、細節或 motion coherence。把受控比例流量送到 candidate,實務允許時同時保留 baseline output,並替每個結果標記 input characteristic、model revision、runtime、precision 與完整 configuration。比較時除了整體平均,也要看每個重要 slice 的 tail latency、可持續 throughput、failure rate、unit cost,以及對應的人類偏好或任務品質 gate。只有各 slice 都通過明定界線才逐步放大流量;任何一組使用者可感知 regression 都應觸發 rollback 或縮小適用範圍,而不是被其他容易案例的平均值掩蓋。
先辨認模型的生成原型與真正有意義的輸出單位,再選服務指標。Autoregressive 模型會延伸 tokenized sequence,diffusion 模型則反覆 denoise 輸出。前者涵蓋 vision-language、embedding、ASR 與 TTS 模型;影像和影片生成通常屬於後者。許多 LLM engine 與最佳化技巧可以沿用到相關的 autoregressive modality,但 diffusion 的最佳化路徑不同。接著要用使用者能感知的單位重新定義 latency、throughput 與 quality。對 TTS 來說,單一 audio token 本身沒有實用意義,因此應量測 time to first word 或 time to first sentence,而不是 time to first token。
Vision encoder 即使比語言模型小,仍可能決定 runtime 相容性。很長的視覺序列會提高 prefill 與 cache 壓力;downsampling、最佳化 attention、cache reuse、quantization、parallelism 與 phase separation 都仍是可用手段。
統一模型能保留跨 modality context,並簡化產品邊界。由光學字元辨識、轉錄、retrieval、語言與合成元件組成的管線,則可能在窄任務上更快、更準,也能讓各階段獨立擴縮。
Encoder-style 工作會平行處理 token,因此 prefix caching 和 prefill-decode separation 沒有幫助。應優先採用單 GPU replica、大型 batch、平行 tokenization、明確 queue,並在變更精度或向量長度時檢查品質。
在 encoder-decoder model 中,autoregressive decoder 通常占主要成本。即時 stream 最能從 chunk orchestration 與 persistent transport 獲益;長檔案則適合移除靜音、平行 chunk、in-flight batching 與針對性 retry。
語音合成結合類似語言模型的 audio-token generation 與 waveform decoding。應量測 time to first byte(TTFB)、第一段有意義語句的時間、生成速度與同時即時 stream;不能獎勵只會超越播放速度、卻沒有增加容量的 token 速度。
Iterative denoising 偏向運算瓶頸,並直接暴露 step count 與 guidance 的取捨。Kernel selection、fusion、compilation、matrix precision 與 human preference test,比語言服務的 cache policy 更重要。
聯合處理時空的 denoising 能提高連貫性,卻讓 attention 變得非常龐大。Batching 餘裕很小時,吞吐量必須靠更快的 attention、安全重用、選擇性 quantization,以及把 context calculation 分散到高速 interconnect GPU。
P95 端到端延遲
依影像數量、解析度、抽樣影格、visual token、cache reuse 與生成文字長度切分。
items/s 與 lookup P99
吞吐量與 tail latency 要同時附上 batch size、queue depth、vector dimension 與 retrieval quality。
chunk round-trip ms
量測從收音到文字的延遲、active stream、chunk duration、backlog,以及不同條件下的轉錄品質。
RTF 與完成時間
追蹤音訊長度除以處理時間、各階段 utilization、retry 次數與 stitch 正確性。
TTFB 與第一段語句
也要量測每張 GPU 的 real-time stream、underrun、decoder latency,以及生成是否持續領先播放。
每張可接受影像的秒數
記錄 step count、guidance schedule、resolution、accelerator time 與 blind human preference。
每段可接受影片的秒數
依片長與解析度切分,並追蹤 attention 占比、cache reuse、GPU scaling efficiency 與品質退步。
較高解析度與 frame rate 能保留小細節和動作,卻會增加 visual token、prefill、cache 與 attention。Downsampling 犧牲資訊,換得整段 clip 能放進一次推論。
Omni-modal model 能保留聯合 context 並減少 handoff;較小的光學、語音或前處理模型在特定領域可能更快、更準,但會增加 orchestration 工作。
較長向量可保留更多語意資訊,也會增加儲存、傳輸與相似度運算。較短的 Matryoshka-style output 能降低下游成本,卻不會明顯改變 inference time。
循序 chunk 可把前一段文字交給下一段轉錄;長檔案平行處理會快很多,卻失去這份連續性,因此必須用 segmentation 與 retry logic 補回品質。
減少 step、縮短 guidance、cache state 與降低精度都能刪除運算,也可能改變構圖、prompt adherence、細節或時間連貫性,所以每個手段都需要面向人的驗證。
Context parallelism 會複製影片模型 weights,再把 latent sequence 的 attention 分開。它用記憶體與 interconnect bandwidth 換取單一 batch-one clip 更快完成。
第 153-156 頁
modality 分類、兩種模型 archetype,以及重新定義效能指標的必要性。
第 156-159 頁
Vision encoder、視覺 context、影片、downsampling、omni-modal model 與組合式前處理。
第 159-162 頁
Embedding architecture、traffic lane、vector trade-off、runtime、batching 與 queue。
第 162-166 頁
轉錄 architecture、live stream、長檔案 parallelism、retry 與 diarization。
第 166-169 頁
語音合成、audio decoding、使用者指標、streaming 與 voice pipeline。
第 169-172 頁
Image diffusion、品質評估、kernel、compilation、step 與 guidance。
第 173-176 頁
Video diffusion、attention 成本、caching、選擇性 quantization 與 context parallelism。