目錄

推論工程精要

高效且可靠的模型服務實務指南。

在 GitHub 加星

11 個單元

  1. P

    前言

    理解推論工程為何已成為一門獨立的工程領域。

    9–143 分鐘閱讀

    • scope
    • inference-stack
  2. 0

    推論

    建立推論堆疊的全貌,判斷何時值得進行專門最佳化。

    15–229 分鐘閱讀

    • scope
    • inference-stack
    • specialization
  3. 1

    先備知識

    串連產品限制、模型選擇、評估方法與服務指標。

    23–389 分鐘閱讀

    • model-selection
    • latency
    • throughput
    • evaluation
  4. 2

    模型

    從推論時形成的瓶頸理解模型架構。

    39–709 分鐘閱讀

    • transformers
    • attention
    • mixture-of-experts
    • roofline
  5. 3

    硬體

    把運算、記憶體與互連限制映射到服務行為。

    71–929 分鐘閱讀

    • gpu
    • memory
    • interconnects
    • accelerators
  6. 4

    軟體

    依據基準測試與效能剖析選擇執行環境和核心函式。

    93–11610 分鐘閱讀

    • kernels
    • runtimes
    • benchmarking
    • profiling
  7. 5

    最佳化技術

    依據瓶頸、品質預算與拓撲選擇最佳化手段。

    117–15210 分鐘閱讀

    • quantization
    • speculation
    • caching
    • parallelism
    • disaggregation
  8. 6

    多模態

    比較文字、視覺、音訊與影片的推論流程和瓶頸。

    153–17610 分鐘閱讀

    • vision
    • audio
    • embeddings
    • generation
  9. 7

    生產環境

    把推論營運成可靠、可觀測且具成本意識的服務。

    177–20812 分鐘閱讀

    • scaling
    • reliability
    • observability
    • cost
    • protocols
  10. A

    術語表

    快速查找推論系統常用詞彙。

    209–2305 分鐘閱讀

    • reference
    • terminology
  11. B

    延伸閱讀

    依主題進入現代推論工程重要資料來源的閱讀地圖。

    231–2565 分鐘閱讀

    • reading-map
    • references