跳到主要内容

什么是 LLM 推理?

LLM 推理(inference)指的是使用训练好的 LLM(如 GPT-5、GLM-5 和 DeepSeek-V3.2),根据用户输入(通常是以自然语言提供的提示词(prompt))生成有意义的输出。在推理过程中,模型通过其庞大的参数集处理提示词,生成文本、代码片段、摘要和翻译等响应。

本质上,这就是 LLM 真正「发挥作用」的时刻。以下是一些真实世界的示例:

  • 客服聊天机器人: 实时生成个性化、贴合上下文的客户查询回复。
  • 写作助手: 补全句子、纠正语法,或总结长文档。
  • 开发者工具: 将自然语言描述转换为可执行的代码。
  • AI 智能体: 自主执行复杂的多步推理和决策过程。

使用下方的可视化工具查看请求在 LLM 推理过程中的流转。有关详细信息,请参阅LLM 推理的工作原理

提示: 若无法显示,请直接打开 独立工具页面

什么是推理服务器?

**推理服务器(inference server)**是管理 LLM 推理如何运行的组件。它加载模型、连接所需的硬件(如 GPU),并处理应用请求。当提示词到达时,服务器分配资源、执行模型并返回输出。

LLM 推理服务器所做的远不止简单的请求-响应。它们提供了大规模运行 LLM 所必需的功能,例如:

  • 批处理(Batching): 合并多个请求以提高 GPU 效率
  • 流式输出(Streaming): 在 token 生成时即发送,以降低延迟
  • 扩缩容(Scaling): 根据需求增加或减少副本
  • 监控(Monitoring): 暴露指标以用于性能分析和调试

在 LLM 领域,人们经常把推理服务器推理框架混用。

  • 推理服务器通常强调接收请求、运行模型并返回结果的运行时组件。
  • 推理框架则往往强调更广泛的工具包或库,它们提供 API、优化和集成,以便高效地服务模型。

热门的推理框架包括 vLLM、SGLang、MAX 和 TensorRT-LLM。它们旨在最大化 GPU 效率,同时让 LLM 更容易大规模部署。

服务(serving)与推理有什么区别?

推理是计算过程。服务(serving)则是将这种计算提供给用户和应用的生产流程。

在日常交流中,人们经常互换使用这两个术语,因为现代框架同时处理两者。像 vLLM、SGLang、MAX 和 TensorRT-LLM 这样的工具不仅高效地运行推理,还管理请求并暴露 API。因此,「推理框架」和「服务框架」往往指代相同的系统。

但严格来说,它们并不是一回事,当你开始设计基础设施时,这种区别就会变得重要。

  • 推理是前向传播:输入 token,输出下一个 token 的分布,通过预填充(prefill)和解码(decode)循环不断重复。这是一个计算操作。你可以在 Jupyter notebook 或 Python 脚本中运行推理,完全无需服务器。那仍然是推理,但你并没有在「服务」什么。
  • 服务则是将这种能力转化为可靠生产服务所需的一切:API 接口(HTTP/gRPC)、请求排队与调度、跨并发请求的批处理、跨副本的负载均衡、自动扩缩容、模型加载与版本管理、健康检查、可观测性以及资源分配。

所以,当有人互换使用这两个术语时,他们通常只是在放宽说法,因为他们的推理引擎恰好也是他们的服务器,这是很常见的情况。

什么是推理优化?

**推理优化(inference optimization)**是一系列让 LLM 推理更快、更便宜、更高效的技术。它的目标是在不损害模型质量的前提下,降低延迟、提高吞吐量并降低硬件成本。

一些常见策略包括:

  • 连续批处理: 动态地对请求分组,以获得更好的 GPU 利用率
  • KV 缓存管理: 复用或卸载注意力缓存,以高效处理长提示词
  • 投机解码: 使用更小的草稿模型来加速 token 生成
  • 量化: 以较低精度(如 INT8、FP8)运行模型,以节省内存和算力
  • 前缀缓存: 缓存常见提示词片段以减少冗余计算
  • 多 GPU 分布/并行: 将 LLM 拆分到多个 GPU 上,以支持更大的上下文窗口

在实践中,推理优化可能决定一个应用是感觉迟钝又昂贵,还是能带来流畅、高性价比的用户体验。

更多内容请参阅推理优化章节。

为什么我应该关心 LLM 推理?

你可能会想: 我只是在调用 OpenAI 的 API,我真的需要理解推理吗?

像 OpenAI、Anthropic 等无服务器 API 让推理看起来很简单。你发送提示词,得到响应,然后按 token 付费。基础设施、模型优化和扩缩容都被隐藏起来,不可见。

但关键在于:你走得越远,推理就越重要。

随着应用的增长,你最终会遇到无服务器 API 无法完全解决的限制(例如成本、延迟、定制化或合规性)。这时,团队就开始探索混合或自托管的解决方案。

尽早理解 LLM 推理(例如批处理缓存量化路由)能让你占据明显优势。它能帮助你评估不同模型服务提供商和推理框架的特性,从而做出更明智的选择、避免意外,并构建更具可扩展性的系统。

  • 如果你是开发者或工程师: 在现代 AI 应用开发中,推理正变得与数据库或 API 一样基础。了解它的工作原理有助于你设计更快、更便宜、更可靠的系统。糟糕的推理实现可能导致响应缓慢、计算成本高昂以及糟糕的用户体验。
  • 如果你是技术负责人: 推理效率直接影响你的利润。一个优化不佳的部署可能花费 10 倍以上的 GPU 时,同时带来更差的性能。理解推理有助于你评估供应商、做出自建 vs. 购买(build-vs-buy)的决策,并为团队设定切实可行的性能目标。
  • 如果你只是对 AI 感到好奇: 推理正是「魔法」发生的地方。了解它的工作原理有助于你区分 AI 炒作与现实,并让你成为 AI 讨论中更有见识的参与者和贡献者。

更多信息,请参阅无服务器 vs. 自托管 LLM 推理