Skip to content

覆盖层技术栈

大模型应用开发基于已有的客户端服务端基础技术栈,新增大模型相关的处理技术,形成独立的覆盖层。所谓"覆盖",是指这些技术不改变底层架构,而是在现有技术栈之上叠加一层 AI 特有的处理逻辑——它们与传统的 HTTP、数据库、前端渲染并存,但引入了全新的组件和交互范式。

理解覆盖层的概念,是理解今日层出不穷的 AI 技术栈的关键。它不是从头重写整个应用,而是在关键节点注入 AI 能力:在请求层注入提示词和上下文,在数据层注入向量检索和 RAG,在控制流层注入 Agent 循环和工具调用,在 UI 层注入流式渲染和生成式组件。

覆盖层主要包括以下技术领域:

  • 会话管理(Session):大模型推理 API 本身是无状态的——每次调用都是独立的请求,不携带之前对话的记忆。会话管理层负责在无状态 API 之上构建有状态的对话体验,包括消息历史的组织与持久化、上下文窗口的监控与压缩、以及多轮对话中用户意图的追踪。这是覆盖层中最基础也最容易被低估的环节——糟糕的会话管理会在几轮对话后就让模型"失忆"或上下文混乱。

  • 提示词工程(Prompt Engineering):提示词不是"写一段指令",而是设计一套模型行为约束协议。System Prompt 定义模型的角色、边界和安全规则,User Prompt 承载用户的当前意图,上下文注入(Context Injection)将检索结果、用户偏好、页面状态等隐性信息拼接到 Prompt 中。提示词工程往更系统化的方向发展,逐步演化为上下文工程(Context Engineering)——管理进入上下文窗口的全部信息的整体编排。

  • Agent 循环:Agent 将大模型从"问答机"升级为"行动者"。核心机制是 ReAct 循环——模型思考 → 决策是否需要调用工具 → 调用工具获取结果 → 基于结果再思考 → 最终输出。这个循环需要编排层来控制:最大迭代次数(防止死循环)、工具调用的超时和重试、错误处理与回退策略、以及多 Agent 之间的任务分发和结果汇总。Agent 协议(MCP 用于工具调用,A2A 用于 Agent 间协作)正在逐步标准化。

  • RAG 检索增强生成:RAG 是覆盖层中工程化最成熟的模块。它将检索和生成解耦——检索层负责从向量数据库或搜索引擎中查找相关上下文,生成层(LLM)负责基于检索结果生成回答。RAG 的工程重点在于全链路优化:分块策略(chunking)→ Embedding → 向量检索 → 精排(Rerank)→ 上下文构造 → 生成。每一个环节的错误或低质量都会累加到最终结果中。Agentic RAG 进一步让 Agent 自主控制检索时机和策略,从"检索一次"升级为"边检索边判断"。

  • AI UI:AI 应用的前端与传统前端存在一定差异。流式渲染将 LLM 的 token-by-token 生成过程实时呈现,SSE(Server-Sent Events)是承载这一能力的基础协议。生成式 UI 让 AI 不仅返回文本,还能动态触发交互组件(图表、表格、表单卡片)的渲染。结构化输出校验(Zod、TypeChat)确保 AI 的返回值符合前端组件的类型期望。浏览器端推理(Transformers.js、WebGPU)将部分 AI 能力直接留在用户设备上,降低延迟和保护隐私。

  • LLMOps 评估与观测:AI 应用的质量无法像传统软件一样用单元测试完全覆盖——模型的输出是概率性的,同一个输入可能产生不同的结果。LLMOps 围绕三个核心问题构建:评估(RAGas、TruLens 等框架通过"模型评测模型"量化 RAG 和生成质量)、观测(LangSmith、LangFuse 提供从 Prompt 到最终输出的全链路追踪)、和实验(A/B 测试不同 Prompt、模型版本、检索策略的效果对比)。

这些覆盖层模块不是独立运行的孤岛,而是一条从用户输入到模型输出的完整管线。Session 管理上下文生命周期,Prompt 工程组织输入格式,Agent 编排控制流程,RAG 注入外部知识,AI UI 负责前端交互,LLMOps 守护质量和可靠性。理解这条管线的每一环节及其相互依赖关系,是构建生产级大模型应用的前提。