正在刊行长文 · Essay
2026-09-03所有内容
随机比特 · Random Bits

别让大模型毁了你的接口:生产级 AI 为什么要将 LLM 赶出主链路?

2026-09-03AI Engineering / Systemsrbits.uk
别让大模型毁了你的接口:生产级 AI 为什么要将 LLM 赶出主链路?

01 痛点场景:我们花十年把接口压到 50ms,加了个大模型一秒打回原形

在做常规后端架构时,每个团队都对延迟锱铢必较:

但在业务把大语言模型 (LLM) 引入系统之后,灾难发生了:

很多团队的第一反应,是把希望寄托在“在线推理优化”上:换轻量级小模型、做 4-bit 量化、调小 Context 上下文,或者推流式输出 (SSE)。

这些手段当然有价值,但流式输出只是“给用户看的进度条”,并没有解决系统瓶颈。大模型推理具有非确定性、高延迟、长尾波动和高昂成本,而在线请求主链路 (Hot Path) 需要的是确定性、毫秒级响应、高并发韧性与可预测的开销

生产级 AI 系统的成熟标志,不是在用户请求主链路上继续死磕几十毫秒的推理压缩,而是把昂贵、缓慢、不可控的智能搬离用户请求的热路径,转变为离线的智能制造工厂;在线服务只负责极速装配、状态读取、兜底降级与安全交付


02 第一性原理:为什么在主链路直接调大模型是反模式?

从传统后端工程的第一性原理来审视,把 LLM 直接串联在用户请求路径上,会在四个本质维度与生产系统发生剧烈对抗:

生产级 AI 架构分水岭:同步直连 vs 动静解耦

1. 延迟分布彻底失控 (P99 长尾雪崩)

传统微服务处理的是确定性的 CPU 指令与索引查找,耗时分布集中。而自回归大模型的延迟由两部分组成:首字延迟 (TTFT) 和每 Token 解码耗时(耗时与生成长度强线性相关)。

Prompt 稍有增长、模型服务排队,或者模型在长思考时突然“话痨”,接口耗时就会从 1.5 秒陡增到 8 秒甚至十几秒。在线主链路串联了一个 P99 极长且方差巨大的黑盒节点,整个调用链的熔断、超时和重试机制将彻底形同虚设。

2. 边际成本随流量线性激增

传统架构依靠高命中率的缓存享受流量红利——访问量越大,单次请求的摊销成本越低。

但在主链路上实时调用大模型,意味着每一次用户刷新、翻页、甚至爬虫扫描都在真金白银地燃烧 GPU 算力或 API 费用。对于没有做解耦的高并发服务,突发流量不仅没有规模效应,反而会以每千 Token 几美分的成本迅速打穿当月的预算水位线。

3. 系统确定性被外部 API 绑架

后端架构的基石是幂等性、确定性输出和严谨的状态机。直接在主链路上依赖大模型,相当于把系统的可用性押注在第三方厂商的网络稳定性、账号配额 (Rate Limit) 以及随机采样的输出质量上。

一旦模型偶尔吐出截断的 JSON、非预期的格式甚至幻觉数据,原本健壮的在线业务逻辑便会瞬间崩溃。

4. 容量规划与弹性伸缩失衡

评估普通后端服务需要多少 Pod,看的是 CPU/内存负载与并发连接数,几秒钟就能完成 HPA 弹性扩容。

但大模型的吞吐受限于 GPU 显存 (KV Cache 瓶颈) 和供应商严格的并发速率配额。当突发流量来临时,在线系统根本无法通过瞬时扩容来满足大模型算力的爆发需求。


03 架构解耦:从“同步直连”到“智能工厂”

要打破这个死局,核心在于完成系统认知的跃迁:大模型是深度的思考引擎与内容生成器,但绝不是一个合格的高并发 Web 服务器

生产级系统必须在边界上彻底划分出两个世界:

1. 离线智能工厂 (Offline Pipeline)

以事件驱动或定时批处理的方式运行,负责做“重的、贵的、复杂的”计算:

2. 在线极速交付 (Online Serving)

面向终端用户,坚决不与大模型发生同步 I/O。它的工作极其轻量、极度确定:


04 案例实战:自适应学习系统的两代架构演进

为了具象化理解这一分水岭,我们来看一个真实的业务场景:自适应学习系统 (Adaptive Learning)

工程提示与假设说明: 在部分高并发自适应学习系统的架构设计讨论中,常会推演 340k RPS、端到端响应低于 500ms 的极限设计目标。必须明确,这是特定架构在推演极限容量规划时的场景假设,而非经过通用生产验证的标准基准。在实际业务中,工程师应以自身系统的真实 QPS 和延迟 SLA 为基准,核心是借鉴其“动静分离”的方法论。

1. 初代实现:直觉带来的灾难

产品经理提出:“每个学生的能力都是动态变化的,当学生提交第 5 题的答案后,系统应当根据他过去 5 题的掌握度,实时生成最适合他的第 6 题,并附带针对性的思路解析。”

工程师顺理成章地写出以下代码:

  1. 学生点击提交;
  2. 接口拉取历史答题记录,拼接出一段 2000 字的 Prompt;
  3. 同步调用外部大模型 API;
  4. 页面转圈 6 秒,大模型返回题目与解析;
  5. 解析 JSON,渲染给学生。

结果:上线第一天,学生的平均等待时间高达 6.8 秒;高峰期模型超时率飙升至 12%,学生不断重试刷新,直接导致后端线程池耗尽,全站接口响应超时。

2. 二代重构:把智能搬到离线

架构重构后,系统边界被重新划定:

  1. 离线批量生产变体: 教学大纲和知识图谱是已知的。离线 Worker 针对每个知识点、每种难度等级,预先驱动大模型批量生产上百道题目变体,并同时生成对应的分步提示 (Hints)、常见误区归因 (Misconception Analysis) 与标准解答。
  2. 入库前离线静态质检: 离线对题目执行语法检测、逻辑闭环校验与敏感词过滤,确保入库的每一道题都不存在语法错误或事实幻觉。
  3. 在线轻量计算与极速装配: 学生提交作答后,在线系统不调用大模型,而是运行微秒级的贝叶斯知识追踪 (BKT) 规则算法,仅在内存中更新学生的能力值分数。
  4. Redis 毫秒级命中: 根据新的能力标签,直接从 Redis 题目池中 SRANDMEMBER 随机拉取一道符合难度的预计算题目,整个接口耗时 25ms
环节 / 模块 处理时机 承载技术 核心优势
题目与解析生成 离线 (Offline) 异步 Worker + 大模型 吞吐平稳,不卡死线上,方便批量质检
内容合规与幻觉校验 离线 (Offline) 规则断言 + 判别模型 质量兜底,坏样本绝不进入生产环境
学生能力值更新 在线 (Online) 轻量业务算法 (CPU) 微秒级计算,完全无外部 RPC 依赖
下一题获取与装配 在线 (Online) Redis 缓存检索 耗时 < 30ms,抗百万级并发冲击

通过这种改造,系统不仅重新找回了传统后端的亚秒级高并发韧性,而且单次交互的算力成本下降了两个数量级。


05 结语:后退一步,是为了走得更稳

大模型是一次深刻的技术跃迁,但它并没有颠覆分布式系统的物理法则。

在请求主链路里同步串联大模型,本质上是用最脆弱的组件去承载最核心的吞吐。只有克制住“什么都想在线实时生成”的冲动,把昂贵的智能推向离线,让确定的交付留在前沿,AI 应用才能真正具备企业级的性能、弹性与商业可行性。


预告:下篇我们将探讨什么?

把大模型赶出主链路,只是架构演进的第一步。但这立刻会带来一系列全新的工程难题:

  1. 时效性滞后:如果业务数据(如商品库存、实时价格)瞬息万变,离线预生成的内容如何不变成“过期货”?
  2. 无效预计算浪费:长尾长尾内容的访问频次符合幂律分布,盲目预计算会烧光 Token,如何做精细化的冷热分流?
  3. 错误持久化扩散:在线幻觉只影响一个人,离线生成的幻觉入库会毒害成千上万个用户,如何构建高精度的质检与熔断体系?

在下一篇**《智能搬到离线后,如何解决数据滞后与预计算浪费?(下篇)》**中,我们将深入拆解六步落地流水线、Slot-Filling 动态插槽模式,以及离线智能工程的黄金监控指标体系。

敬请关注。


公开参考资料

  1. Core Architectural Patterns for LLM System Design: https://deepengineering.net/p/core-architectural-patterns-for-llm-system-design
  2. Designing a High-Scale Adaptive Learning System: https://architecturallyspeaking.substack.com/p/designing-a-high-scale-adaptive-learning
  3. Under the Hood: How AI-Powered E-commerce Search Actually Works: https://architecturallyspeaking.substack.com/p/under-the-hood-how-ai-powered-ecommerce
  4. System Design for Generative AI Applications (Packt): https://www.oreilly.com/library/view/system-design-for/9781807789930/
随机比特公众号二维码
公众号 · 随机比特
从 AI 工具热闹里拆工程真相

写边界、控制面、上下文、成本与安全。