B
延伸閱讀
以問題為導向,從本書導讀連到原始論文、工具、系統與評估。
5 分鐘閱讀
印刷頁: 231–256
分類閱讀地圖
為下一個工程問題而讀
推論工程範圍太廣、變化太快,任何一本書都不可能是終點。請把這份附錄當成 routing 層:選擇最符合當前決策不確定性的類別,閱讀一份原始資料,重現一個小型結果,再記錄你對系統的理解有何改變。
Chip Huyen 的 AI Engineering
若下一個知識缺口橫跨以基礎模型打造應用的完整實務,可先選這本廣泛導讀。
Sebastian Raschka 的 Build a Large Language Model (From Scratch)
若想以動手實作深入理解大型語言模型架構,可選這條閱讀路徑。
Chris Fregly 的 AI Systems Performance Engineering
若要深入模型工作負載、GPU、CUDA 與 PyTorch 的效能工程,可選這本聚焦效能的書。
可把書中連結的部落格當成較新實作筆記的一個入口,同時確認日期及內容是否適用於你的技術 stack。
架構・模型需要哪些計算?
當服務症狀難以從外部解釋時,從這一類開始。架構論文會揭露序列相依、中間狀態、稀疏性、attention 資料搬移與反覆流程;這些特徵之後都會成為硬體和 scheduling 限制。
閱讀最初的 attention 架構,把 token 互動、可平行的訓練結構與自迴歸服務路徑連結起來。
以第一篇 FlashAttention 論文理解:減少記憶體資料搬移,為何可能比減少算術運算次數更重要。
研讀 denoising diffusion,理解影像與影片生成為何依時程反覆執行模型,而不是一次產生一個 token。
BLIP-2 適合用來理解:不必把所有元件一起重新訓練,視覺 encoder 也能與語言模型交換表徵。
Mamba 提供另一種序列模型,可用來判斷哪些 Transformer 成本是架構必然,哪些只是設計選擇。
開發工具・應在哪裡量測或介入?
模型、工作負載與目標指標明確後,再讀工具文件。可以比較架構支援與最佳化功能,但最終選擇仍應依據你將營運之硬體上的可重現 benchmark 與 profiling。
適合作為廣泛服務基線,學習 continuous batching、分頁 attention 狀態與常見 API。
可比較模型支援、結構化生成、cache 與 mixture of experts(MoE)執行方式的服務專案。
NVIDIA 的 engine 文件呈現依架構調校的 kernel、低精度,以及建置期與執行期的取捨。
先用穩定工作負載重現目標退化,再以 profiling 做法歸因主機與 accelerator 時間。
若框架層證據顯示矩陣形狀、分塊或精度仍是限制,再探索 kernel 建構元件。
前沿開放模型・我能掌控哪一道能力前緣?
模型發行者集合可用來掃描文字、推理、視覺、音訊、影像與影片的能力前緣。它們是探索索引,不是部署核准;仍須確認確切檢查點、授權、分詞器、對話模板、評估紀錄與 engine 相容性。
適合在推理與通用工作負載中,研究稠密與稀疏語言模型的服務選擇。
橫跨語言與多 modality 檢查點的廣泛家族,可比較模型大小與任務專用變體。
包含開放語言與稀疏 expert 模型,可把能力、大小與服務 topology 放在一起評估。
影像生成模型家族,可檢視流程元件、模型變體、記憶體需求與授權限制。
包含 Whisper 檢查點,能以廣泛實作的參考家族建立 automatic speech recognition(ASR)實驗。
GPU 基礎設施・服務依賴什麼?
基礎設施閱讀把 accelerator 限制連到 scheduling、網路、儲存、推出與失效復原。當單次 benchmark 表現良好,整個叢集卻無法在真實流量下交付相同延遲或可用性時,這類知識尤其重要。
透過 interconnect 概覽理解 tensor parallelism(TP)與 expert parallelism(EP)部署背後的 topology 假設。
研讀如何放置、重啟、公開及逐步推出具狀態 GPU 服務工作負載的協調原語。
Designing Data-Intensive Applications
以系統經典教材加強對複寫、分割、一致性、streaming 與失效的推理,不把焦點限於模型執行。
把服務目標、錯誤預算、監控與事件應變套用到作為使用者正式依賴的推論服務。
最佳化研究・哪個機制會攻擊我的瓶頸?
帶著基線與可證偽假設閱讀最佳化研究。論文中的加速取決於模型、請求形狀、硬體、batch 策略、品質容忍度與實作品質;移植結果前,先重現這些條件。
若懷疑 attention cache 碎片或 scheduler 使用率是限制,可閱讀 vLLM 系統論文。
當 decode 具有序列性,且能以額外平行運算換取較低單一使用者 token 延遲時,研究草擬與驗證生成。
activations 感知 weight quantization
以 AWQ 檢視校正與敏感通道如何影響低位元 weights 的品質效能取捨。
若剖析指出瓶頸在服務 attention 而非一般框架負擔,可探索可客製的 attention kernel library。
以系統分析檢驗:計入狀態傳輸成本後,分開 prefill 與 decode 是否真的改善目標工作負載。
智慧評估・最佳化後仍然有用嗎?
品質是部署限制,不是附註。公開評估有助於呈現能力面向,但正式環境核准還應結合能重現產品真實失敗成本的任務範例、對抗案例與人工審查。
廣泛的知識 benchmark,可用來理解彙總學術任務分數的優點與限制。
精簡的程式碼生成參考,適合研究功能正確性、取樣與 benchmark 污染疑慮。
large-scale text embedding benchmark
以 MTEB 比較表徵模型在檢索、相似度、分類、分群與其他 embedding 任務的表現。
儲存庫層級的軟體任務 benchmark,呈現孤立程式碼片段與使用工具之工作流程的差距。
通往抽象與泛化評估的入口,避免把能力侷限為熟悉的語言任務。
把閱讀轉化為證據
- 用一句話寫下要做的決策,以及阻礙它的不確定性。
- 先讀原始論文或官方文件,再依賴 benchmark 摘要或供應商比較。
- 用你的模型、請求分布、硬體與品質檢查,重現最小且相關的主張。
- 記錄假設、版本、工作負載形狀、結果與回復條件,讓證據在下一次工具更新後仍可使用。
來源索引
導讀
紙本第 233 頁說明持續學習為何必須跟上快速變動的領域。
架構
紙本第 234 至 238 頁收錄語言、視覺、音訊、attention、diffusion 與序列模型基礎。
開發工具
紙本第 239 至 242 頁收錄 runtime、GPU 函式庫、profiling 與模型工具。
前沿開放模型
紙本第 243 至 245 頁索引跨多種 modality 的開放模型發行者。
GPU 基礎設施
紙本第 246 至 248 頁把 accelerator 系統連到協調與可靠性資源。
推論最佳化
紙本第 249 至 253 頁彙整 quantization、cache、attention、speculation、平行與分離研究。
智慧評估
紙本第 254 至 255 頁收錄通用推理、程式碼、數學、embedding 與應用任務評估。
- How the appendix frames continued learning and changing technical material
- 印刷頁: 233–233; PDF 頁: 235–235
- Model architecture, attention, diffusion, multimodality, and representation learning resources
- 印刷頁: 234–238; PDF 頁: 236–240
- CUDA, inference runtimes, model libraries, profiling, and developer tools
- 印刷頁: 239–242; PDF 頁: 241–244
- Frontier open-model publishers and modality-spanning model collections
- 印刷頁: 243–245; PDF 頁: 245–247
- GPU architecture, interconnects, orchestration, data systems, and reliability
- 印刷頁: 246–248; PDF 頁: 248–250
- Quantization, caching, attention, speculation, parallelism, and disaggregation research
- 印刷頁: 249–253; PDF 頁: 251–255
- General, code, mathematics, embedding, and real-world model evaluations
- 印刷頁: 254–255; PDF 頁: 256–257