基础(Foundations)
LLM 推理是模型与现实世界相遇的场所。它为从即时聊天回复到代码生成的一切提供动力,并直接影响延迟、成本和用户体验。理解推理的工作原理是构建更智能、更快、更可靠的 AI 应用的第一步。
- 什么是 LLM 推理? — 了解 LLM 推理的基本概念、推理服务器、服务与推理的区别,以及推理优化。
- LLM 是如何工作的? — 从分词(tokenization)和 Transformer 架构(注意力机制、注意力掩码)到推理的预填充与解码阶段。
- 训练与推理的区别 — 比较训练与推理这两个阶段,以及它们如何适应模型生命周期。
- LLM 推理的关键指标 — 学习延迟、吞吐量、有效吞吐量等关键性能指标。
- LLM 推理在哪里运行? — 了解 CPU、GPU 和 TPU 之间的差异,以及可以在哪里部署它们。