B

延伸閱讀

以問題為導向,從本書導讀連到原始論文、工具、系統與評估。

5 分鐘閱讀

印刷頁: 231–256

在 GitHub 加星

分類閱讀地圖

為下一個工程問題而讀

推論工程範圍太廣、變化太快,任何一本書都不可能是終點。請把這份附錄當成 routing 層:選擇最符合當前決策不確定性的類別,閱讀一份原始資料,重現一個小型結果,再記錄你對系統的理解有何改變。

  • Chip Huyen 的 AI Engineering

    若下一個知識缺口橫跨以基礎模型打造應用的完整實務,可先選這本廣泛導讀。

  • Sebastian Raschka 的 Build a Large Language Model (From Scratch)

    若想以動手實作深入理解大型語言模型架構,可選這條閱讀路徑。

  • Chris Fregly 的 AI Systems Performance Engineering

    若要深入模型工作負載、GPU、CUDA 與 PyTorch 的效能工程,可選這本聚焦效能的書。

  • Baseten 部落格

    可把書中連結的部落格當成較新實作筆記的一個入口,同時確認日期及內容是否適用於你的技術 stack。

架構・模型需要哪些計算?

當服務症狀難以從外部解釋時,從這一類開始。架構論文會揭露序列相依、中間狀態、稀疏性、attention 資料搬移與反覆流程;這些特徵之後都會成為硬體和 scheduling 限制。

  • Transformer 基礎

    閱讀最初的 attention 架構,把 token 互動、可平行的訓練結構與自迴歸服務路徑連結起來。

  • 輸入輸出感知 attention

    以第一篇 FlashAttention 論文理解:減少記憶體資料搬移,為何可能比減少算術運算次數更重要。

  • diffusion 模型基礎

    研讀 denoising diffusion,理解影像與影片生成為何依時程反覆執行模型,而不是一次產生一個 token。

  • 凍結 encoder 的多 modality 架構

    BLIP-2 適合用來理解:不必把所有元件一起重新訓練,視覺 encoder 也能與語言模型交換表徵。

  • 選擇性狀態空間

    Mamba 提供另一種序列模型,可用來判斷哪些 Transformer 成本是架構必然,哪些只是設計選擇。

開發工具・應在哪裡量測或介入?

模型、工作負載與目標指標明確後,再讀工具文件。可以比較架構支援與最佳化功能,但最終選擇仍應依據你將營運之硬體上的可重現 benchmark 與 profiling。

  • vLLM

    適合作為廣泛服務基線,學習 continuous batching、分頁 attention 狀態與常見 API。

  • SGLang

    可比較模型支援、結構化生成、cache 與 mixture of experts(MoE)執行方式的服務專案。

  • TensorRT-LLM

    NVIDIA 的 engine 文件呈現依架構調校的 kernel、低精度,以及建置期與執行期的取捨。

  • PyTorch Profiler

    先用穩定工作負載重現目標退化,再以 profiling 做法歸因主機與 accelerator 時間。

  • CUTLASS

    若框架層證據顯示矩陣形狀、分塊或精度仍是限制,再探索 kernel 建構元件。

前沿開放模型・我能掌控哪一道能力前緣?

模型發行者集合可用來掃描文字、推理、視覺、音訊、影像與影片的能力前緣。它們是探索索引,不是部署核准;仍須確認確切檢查點、授權、分詞器、對話模板、評估紀錄與 engine 相容性。

  • DeepSeek AI 集合

    適合在推理與通用工作負載中,研究稠密與稀疏語言模型的服務選擇。

  • Alibaba Qwen 集合

    橫跨語言與多 modality 檢查點的廣泛家族,可比較模型大小與任務專用變體。

  • Mistral AI 集合

    包含開放語言與稀疏 expert 模型,可把能力、大小與服務 topology 放在一起評估。

  • Black Forest Labs 集合

    影像生成模型家族,可檢視流程元件、模型變體、記憶體需求與授權限制。

  • OpenAI 模型集合

    包含 Whisper 檢查點,能以廣泛實作的參考家族建立 automatic speech recognition(ASR)實驗。

GPU 基礎設施・服務依賴什麼?

基礎設施閱讀把 accelerator 限制連到 scheduling、網路、儲存、推出與失效復原。當單次 benchmark 表現良好,整個叢集卻無法在真實流量下交付相同延遲或可用性時,這類知識尤其重要。

  • Kubernetes 文件

    研讀如何放置、重啟、公開及逐步推出具狀態 GPU 服務工作負載的協調原語。

  • Designing Data-Intensive Applications

    以系統經典教材加強對複寫、分割、一致性、streaming 與失效的推理,不把焦點限於模型執行。

  • Site Reliability Engineering

    把服務目標、錯誤預算、監控與事件應變套用到作為使用者正式依賴的推論服務。

最佳化研究・哪個機制會攻擊我的瓶頸?

帶著基線與可證偽假設閱讀最佳化研究。論文中的加速取決於模型、請求形狀、硬體、batch 策略、品質容忍度與實作品質;移植結果前,先重現這些條件。

  • 分頁 attention 記憶體管理

    若懷疑 attention cache 碎片或 scheduler 使用率是限制,可閱讀 vLLM 系統論文。

  • speculative decoding

    當 decode 具有序列性,且能以額外平行運算換取較低單一使用者 token 延遲時,研究草擬與驗證生成。

  • activations 感知 weight quantization

    以 AWQ 檢視校正與敏感通道如何影響低位元 weights 的品質效能取捨。

  • FlashInfer

    若剖析指出瓶頸在服務 attention 而非一般框架負擔,可探索可客製的 attention kernel library。

  • 務實的分離研究

    以系統分析檢驗:計入狀態傳輸成本後,分開 prefill 與 decode 是否真的改善目標工作負載。

智慧評估・最佳化後仍然有用嗎?

品質是部署限制,不是附註。公開評估有助於呈現能力面向,但正式環境核准還應結合能重現產品真實失敗成本的任務範例、對抗案例與人工審查。

  • 大規模多任務語言理解

    廣泛的知識 benchmark,可用來理解彙總學術任務分數的優點與限制。

  • HumanEval

    精簡的程式碼生成參考,適合研究功能正確性、取樣與 benchmark 污染疑慮。

  • large-scale text embedding benchmark

    以 MTEB 比較表徵模型在檢索、相似度、分類、分群與其他 embedding 任務的表現。

  • SWE-bench

    儲存庫層級的軟體任務 benchmark,呈現孤立程式碼片段與使用工具之工作流程的差距。

  • ARC Prize

    通往抽象與泛化評估的入口,避免把能力侷限為熟悉的語言任務。

把閱讀轉化為證據

  1. 用一句話寫下要做的決策,以及阻礙它的不確定性。
  2. 先讀原始論文或官方文件,再依賴 benchmark 摘要或供應商比較。
  3. 用你的模型、請求分布、硬體與品質檢查,重現最小且相關的主張。
  4. 記錄假設、版本、工作負載形狀、結果與回復條件,讓證據在下一次工具更新後仍可使用。

來源索引

  • 導讀

    紙本第 233 頁說明持續學習為何必須跟上快速變動的領域。

  • 架構

    紙本第 234 至 238 頁收錄語言、視覺、音訊、attention、diffusion 與序列模型基礎。

  • 開發工具

    紙本第 239 至 242 頁收錄 runtime、GPU 函式庫、profiling 與模型工具。

  • 前沿開放模型

    紙本第 243 至 245 頁索引跨多種 modality 的開放模型發行者。

  • GPU 基礎設施

    紙本第 246 至 248 頁把 accelerator 系統連到協調與可靠性資源。

  • 推論最佳化

    紙本第 249 至 253 頁彙整 quantization、cache、attention、speculation、平行與分離研究。

  • 智慧評估

    紙本第 254 至 255 頁收錄通用推理、程式碼、數學、embedding 與應用任務評估。

How the appendix frames continued learning and changing technical material
印刷頁: 233–233; PDF 頁: 235–235
Model architecture, attention, diffusion, multimodality, and representation learning resources
印刷頁: 234–238; PDF 頁: 236–240
CUDA, inference runtimes, model libraries, profiling, and developer tools
印刷頁: 239–242; PDF 頁: 241–244
Frontier open-model publishers and modality-spanning model collections
印刷頁: 243–245; PDF 頁: 245–247
GPU architecture, interconnects, orchestration, data systems, and reliability
印刷頁: 246–248; PDF 頁: 248–250
Quantization, caching, attention, speculation, parallelism, and disaggregation research
印刷頁: 249–253; PDF 頁: 251–255
General, code, mathematics, embedding, and real-world model evaluations
印刷頁: 254–255; PDF 頁: 256–257