1 分钟阅读 次阅读

在将大语言模型(LLM)集成到实际的 Agent 架构或业务工作流时,理解其底层的运行机制与工程评测指标是进行系统调优的前提。本文对 LLM 相关的核心术语与技术概念进行了系统性整理。

一、 架构与状态管理机制

1. 无状态架构 (Statelessness)

LLM 的 API 接口遵循严格的无状态(Stateless)设计。模型在服务器端不持久化维护任何单个用户的会话上下文(Session State)。客户端必须在每次发起 HTTP/gRPC 请求时,将完整的历史对话数组(Message History)作为 Payload 重新提交。

2. Prompt Caching与 KV Cache(缓存与缓存命中的原理)

大模型基于 Transformer 架构,其注意力机制(Attention)会计算并存储键(Key)和值(Value)矩阵。 当 API 服务商启用了 Prompt Caching 时,如果系统检测到当前请求的文本前缀(如长篇的 System Prompt 或参考文档)与近期请求完全一致,引擎会直接从显存中读取之前缓存的 $K$ 和 $V$ 张量,跳过计算密集型的 Prefill(预填充)阶段。这不仅能大幅降低 API 调用成本,还能显著优化首字响应延迟。

3. 上下文窗口 (Context Window)

受限于 Transformer 自注意力机制的计算复杂度(通常呈序列长度的平方级增长 $O(N^2)$),模型单次能处理的 Token 序列存在硬性物理上限(如 32K、128K)。当输入序列超过此阈值时,必须在客户端执行截断(Truncation)或滑动窗口策略,否则会导致系统级溢出错误。

二、 编解码与采样生成机制

1. Tokenization (分词与编码)

大模型并不直接处理自然语言字符,而是通过 BPE (Byte Pair Encoding) 等算法将文本切分为 Token 序列。 由于主流词表主要针对英文语料训练,英文通常一个单词对应 1 个 Token;而中文字符往往需要通过 UTF-8 字节映射,导致单个汉字占用 1~3 个 Token。这种编码差异使得处理同等信息密度的中文文本时,系统吞吐量消耗更快。

2. 自回归生成 (Autoregressive Generation)

LLM 的文本生成本质是一个基于极大似然估计的概率预测过程。在给定前置上下文 $x_{<t}$ 的情况下,模型通过计算概率分布 $P(x_t \vert{} x_{<t})$ 来预测下一个最优 Token,并将其拼接到输入序列中进行下一轮迭代,直至输出终止符。

3. 核采样调优 (Temperature & Top-p)

这组参数直接控制模型在进行下一个 Token 预测时的概率分布形态:

  • Temperature ($T$):在 Softmax 层对 Logits ($z_i$) 进行缩放操作,公式为 $q_i = \frac{\exp(z_i / T)}{\sum_j \exp(z_j / T)}$。$T < 1$ 会使分布变尖锐(收敛于最大概率,适合代码与 JSON 提取);$T > 1$ 会使分布平滑,增加随机性(适合创意生成)。
  • Top-p (Nucleus Sampling):截断概率长尾。系统按概率从大到小对候选词排序,当累积概率达到设定的 $p$ 值时,剔除剩余的所有候选词。

工程规范:通常建议只调整 Temperature 或 Top-p 其中的一项,以避免概率截断逻辑冲突。

三、 Agent 交互与工程开发范式

1. System Prompt (系统提示词)

在 API 调用的消息结构中,具有最高优先级的指令上下文。它通过在 Attention 层的最前端注入,作为“最高指令”全局约束模型的角色定位、输出格式与行为边界,抗干扰能力显著强于常规 User Prompt。

2. Function Calling / Tool Use (函数调用)

模型本身不具备网络通信与执行本地脚本的能力。Function Calling 是一种通过语法约束(Grammar-constrained Decoding)让模型输出结构化 JSON 的范式。模型通过分析意图,将需要调用的本地方法名及参数组装成 JSON 抛回给客户端,由客户端(如 C# 或 Python 脚本)执行业务逻辑后,再将执行结果返还给模型进行自然语言总结。

3. RAG vs SFT

  • RAG (Retrieval-Augmented Generation,检索增强生成):通过外挂向量数据库,在请求发生时动态检索相关文档并注入到上下文。适用于知识库问答,开发周期短、成本低。
  • SFT (Supervised Fine-Tuning,监督微调):通过反向传播更新模型底层的权重矩阵。主要用于对齐特定场景的输出格式与语气(如训练其严格遵循特定的企业级报表规范),而非注入纯粹的外部知识。

4. SSE 流式输出 (Server-Sent Events)

为了掩盖自回归生成机制中 Token 逐个计算的延迟,API 通常采用 Chunked Transfer Encoding。一旦计算出新的 Token 便立即向客户端推送,将用户的等待感知从“整体生成时间”转移到“首字生成时间”。

四、 模型能力与性能评测指标

1. 能力与学术基准 (Benchmarks)

  • MMLU:评估大规模多任务语言理解能力的综合指标,覆盖数十个专业学科。
  • GSM8K / MATH:用于评测思维链(Chain-of-Thought)推理能力与数理逻辑下限的核心数据集。
  • HumanEval / MBPP:评估代码生成与补全能力的基准集,采用 Pass@k 准则。
  • LMSYS Chatbot Arena (ELO):基于人类偏好的盲测排位系统,采用 Bradley-Terry 模型计算胜率,是最接近真实体感的综合质量指标。

2. 系统工程与性能指标

  • TTFT (Time To First Token):首字延迟。受限于 Prefill 阶段的计算,是决定系统交互响应敏捷度的核心指标。
  • TPS (Tokens Per Second):吞吐量。反映模型在 Decode 阶段的推理速度。
  • Latency (端到端延迟):单次请求的总体耗时。
  • QPS (Queries Per Second) / Concurrency:高并发场景下单节点的 API 承载极限。

3. 质量与稳定性指标

  • 幻觉率 (Hallucination Rate):生成的 Token 虽具有高概率连贯性,但在客观现实或给定约束下为伪造事实的比例。
  • 大海捞针测试 (Needle In A Haystack, NIAH):专用于评估超长上下文窗口模型的注意力检索衰减率。在海量无关文本(草垛)中随机插入特定关键信息(针),测试其精确召回率。
  • PPL (Perplexity,困惑度):衡量模型对特定文本序列预测能力的底层指标。$PPL = \exp(-\frac{1}{N} \sum_{i=1}^N \log P(x_i\vert{}x_{<i}))$,数值越低,说明模型对当前生成的语句概率越自信,流畅度通常越高。

留下评论