跳转到内容

术语表

首次出现时采用“中文术语(English term)”,后续根据语境使用更自然的简称。定义只提供本课程需要的最小边界,具体协议和算法仍以对应模块与来源为准。

工作流 · Workflow

由代码预先决定步骤、分支和停止条件的执行路径。

智能体 · Agent

在程序边界内,由模型根据当前状态选择下一步动作的系统。

工具调用 · Tool Calling

模型提出结构化动作,程序完成校验、授权和实际执行。

状态机 · State Machine

用有限状态和明确转换规则描述系统如何变化。

结构化输出 · Structured Output

让模型按可解析、可验证的数据结构返回结果,而不是只给自然语言。

模式约束 · Schema

对数据字段、类型、必填项和取值范围的机器可检查约束。

检索增强生成 · Retrieval-Augmented Generation, RAG

先检索外部材料,再把相关证据放进模型上下文中生成答案。

服务端事件流 · Server-Sent Events, SSE

服务器通过一个持续的 HTTP 连接向浏览器单向发送文本事件。

背压 · Backpressure

下游处理不过来时,限制上游继续生产数据的流量控制机制。

超时 · Timeout

操作超过明确期限后主动停止等待,并进入可分类的失败路径。

取消 · Cancellation

调用方明确通知正在执行的工作尽快停止,并释放相关资源。

截止时刻 · Deadline

一个绝对时间点;到达后,整条调用链都不应再为本次操作启动新工作。

重试 · Retry

在可分类的临时失败后再次尝试;是否安全取决于副作用、幂等性和剩余时间。

事件标识 · Event ID

标识事件在一个有序事件流中的位置,用于断线续传、去重和回放。

幂等 · Idempotency

同一个业务意图重复提交时,不会额外产生新的业务副作用。

词元 · Token

模型处理文本时使用的离散单位;它不一定等于一个字或一个单词。

嵌入表示 · Embedding

把离散对象映射成连续向量,使相似性或后续模型能够进行数值运算。

注意力 · Attention

模型在计算当前位置表示时,对上下文中不同位置分配关联权重的机制。

查询、键和值 · Query, Key, Value (Q/K/V)

由输入表示经过不同线性投影得到的三组向量:Q与K计算权重,权重再组合V。

因果掩码 · Causal Mask

在自回归生成中屏蔽当前位置之后的Token,防止预测时读取未来答案。

多头注意力 · Multi-Head Attention

用多组独立投影并行计算注意力,再拼接和投影回模型维度。

位置表示 · Positional Representation

向Token表示加入顺序或相对距离信息,因为单独的注意力运算并不知道输入排列。

上下文窗口 · Context Window

一次推理中模型能够读取和生成的 Token 总预算。

预填充与解码 · Prefill and Decode

推理的两个阶段:先并行处理已有输入,再逐Token生成后续输出。

键值缓存 · KV Cache

自回归解码时保存历史Token各层的K/V,避免每生成一步都重复计算整段前缀。

回放 · Replay

使用记录的输入、状态、事件和版本重新执行,或在不执行副作用的情况下重新计算判定。

追踪记录 · Trace

跨步骤记录一次任务的时间、公开状态、调用、结果和关联身份。

产物 · Artifact

一次执行产生并可被验证、保存、读取或比较的输出对象。

黄金测试 · Golden Test

使用固定输入和审核过的预期结果检查行为是否发生意外变化的测试。

清单 · Manifest

描述一次执行所需输入、配置、版本身份和预期产物的结构化记录。

证据包 · Evidence Bundle

把运行清单、结构化结果、Trace、副作用记录、产物及其验证结果关联在一起的最小可检查集合。

确定性执行 · Deterministic Execution

在已声明的输入、配置和版本身份相同时,执行产生相同可观察结果的约束。

副作用账本 · Side-effect Ledger

记录外部写入的意图、幂等身份、执行结果、验证状态和补偿状态的结构化账本。

不变量 · Invariant

在所有合法状态与状态转换中都必须成立、可以被程序检查的条件。

乐观并发控制 · Optimistic Concurrency Control

提交写入时检查读取版本是否仍然有效,冲突时拒绝并要求重新计算。

快照 · Snapshot

某个已知版本上的完整状态副本,用于缩短恢复路径,但不能替代增量事件和校验。

事务 · Transaction

把一组数据库读写作为一个提交或回滚边界处理的机制。

隔离级别 · Isolation Level

规定并发事务能够观察哪些中间结果,以及哪些冲突由数据库或应用处理。

幂等键 · Idempotency Key

由调用方为同一业务意图稳定复用的身份,用于查找首次执行结果并阻止重复副作用。

事务性发件箱 · Transactional Outbox

把业务写入与待发布消息写进同一数据库事务,再由独立发布器可靠转发。

补偿 · Compensation

为已提交且无法直接回滚的业务副作用执行一个新的、可审计的纠正动作。

旁路缓存 · Cache-Aside

应用先查缓存,未命中时读取权威存储并回填,写入时显式更新或失效缓存。

缓存准入 · Cache Admission

候选值产生后决定它是否值得进入缓存的策略,与选择淘汰谁是不同问题。

缓存淘汰 · Cache Eviction

容量不足时选择并移除哪个已驻留条目的策略。

缓存代次 · Cache Generation

随数据、配置或策略发布递增的版本身份,使新请求不再命中旧代次结果。

缓存身份键 · Cache Key

把决定结果等价性的业务输入、版本、变体和安全作用域规范化为稳定身份。

缓存隔离盐 · Cache Salt

加入缓存身份的隔离版本,用于限制跨信任域复用或强制切换命名空间;它不是授权判断。

缓存击穿风暴 · Cache Stampede

同一热点条目失效或缺失时,大量请求同步回源并放大下游工作的故障模式。

错误命中率 · False Hit Rate

被判定可复用的命中中,按任务真值实际不应共享旧结果的比例。

栅栏令牌 · Fencing Token

随所有权代次单调递增、在提交点原子比较的令牌,用于拒绝旧持有者的晚到写入。

租约 · Lease

在有限时间内授予执行或持有资格的许可;过期本身不会停止仍在运行的旧持有者。

负缓存 · Negative Cache

短期复用确定性的不存在或拒绝结果;超时、服务端错误与未知结果不能直接当作确定负值。

前缀缓存 · Prefix Cache

复用完全相同Token前缀在指定模型执行身份下产生的中间推理状态。

请求合并 · Request Coalescing / Singleflight

把同一填充身份上的并发未命中合并为一次源站工作,并让等待者共享结果。

完整响应缓存 · Exact Response Cache

在完整输入、数据、工具、模型与策略身份一致且产品契约允许时复用已完成输出。

复用距离 · Reuse Distance

同一对象两次访问之间出现的不同对象数量,用于估计给定容量下的命中机会。

语义缓存 · Semantic Cache

依据近似语义匹配复用旧响应的机制,本质上是需要校准、错误预算与安全Gate的替代判定器。

错误时返回陈旧值 · Stale-If-Error

仅在指定源站错误、数据类别和最大Age允许时,用旧值替代当前错误。

陈旧时后台再验证 · Stale-While-Revalidate

在明确允许的陈旧窗口内先返回旧值,同时由受控刷新任务重新验证或填充。

不安全命中 · Unsafe Cache Hit

虽然找到缓存条目,但身份、权限、代次、完整性或近似替代条件不成立的错误复用。

工作集 · Working Set

在给定时间或访问窗口内仍活跃、可能再次访问并竞争有限缓存容量的对象集合。

死信队列 · Dead-letter Queue

隔离超过有限重试或无法处理消息的队列,便于诊断和受控重放。

交付语义 · Delivery Semantics

描述消息在故障和重试下可能不送达、送达一次或重复送达的协议边界。

数据泄漏 · Data Leakage

训练或调参路径使用了真实预测时不可获得的信息,使评测结果被高估。

训练、验证与测试切分 · Train, Validation and Test Split

分别用于拟合参数、选择配置和最终核验泛化能力的数据边界。

混淆矩阵 · Confusion Matrix

按真实类别和预测类别统计计数,用于展开准确率背后的错误结构。

精确率与召回率 · Precision and Recall

精确率衡量预测为正的样本中有多少正确,召回率衡量真实为正的样本中有多少被找到。

概率校准 · Calibration

检查预测概率与实际发生频率是否对应,而不是只比较排序或分类正确率。

分块 · Chunking

把来源文档切成可索引、可检索且仍能定位回原文的证据单元。

重排序 · Reranking

对第一阶段召回的候选使用更精细但通常更昂贵的模型重新排序。

前K召回率 · Recall@k

对每个查询检查前K个候选是否覆盖全部或所需相关项的检索指标。

平均倒数排名 · Mean Reciprocal Rank, MRR

对每个查询取第一个相关结果排名的倒数,再在查询集合上求平均。

证据约束 · Grounding

要求输出中的可核查结论能够绑定到当前允许使用的外部证据。

引用 · Citation

把一个可核查结论连接到具体来源身份和原文位置的可验证指针。

无答案 · No-answer

当证据不足、冲突或越过授权边界时,系统明确拒绝生成无依据结论的终态。

工具契约 · Tool Contract

定义工具输入、输出、权限、副作用、超时、幂等和错误分类的可执行边界。

能力令牌 · Capability

把可执行动作限制在明确资源、范围、期限和调用次数内的授权对象。

工作记忆 · Working Memory

只服务于当前运行、可以丢弃或重建的有限上下文视图。

长期记忆 · Long-term Memory

跨运行持久保存、需要来源、作用域、保留期和删除规则的信息。

威胁模型 · Threat Model

明确资产、信任边界、攻击者能力、滥用路径和缓解措施的结构化分析。

最小权限 · Least Privilege

只授予完成当前动作所需的最小资源范围、操作集合和有效期限。

提示注入 · Prompt Injection

不可信内容试图改变系统指令、越过权限或诱导执行非预期动作的输入攻击。

评测用例 · Evaluation Case

包含初始状态、输入、夹具、预算和机器断言的一次可执行检查。

沙箱 · Sandbox

限制代码、文件、网络和进程能力的隔离执行边界。

对抗测试 · Red Teaming

从攻击者视角主动构造滥用和越界路径,并把有效案例转成回归评测。

服务级别目标 · Service Level Objective, SLO

在一个时间窗口内,对用户可感知可靠性指标设定的明确目标。

错误预算 · Error Budget

由可靠性目标允许的失败量,用于决定发布、降级和修复优先级。

对账收敛 · Reconciliation

比较期望状态与实际状态,并通过幂等动作持续缩小差异的恢复循环。

人工接管 · Human Handoff

自动化在证据不足、风险过高或预算耗尽时,把状态与证据交给人工继续处理。

成本预算 · Cost Budget

对单次任务或时间窗口内允许消耗的模型、检索、工具和基础设施资源设定上限。

数据血缘 · Data Lineage

记录数据版本由哪些来源、转换任务和配置产生,用于追踪影响、重建和撤回。

数据契约 · Data Contract

对数据身份、Schema、语义、质量、权限和更新责任作出的可验证约定。

数据新鲜度 · Data Freshness

派生资产相对来源有效时间的滞后程度,必须按用户路径和数据集分别测量。

删除标记 · Tombstone

传播删除或撤回意图的显式记录,使异步派生系统能够清除后代资产而不是只丢失源文件。

首Token延迟 · Time to First Token, TTFT

从服务接受请求到客户端收到第一个输出Token的时间,通常包含排队与Prefill。

Token间延迟 · Inter-Token Latency, ITL

流式生成过程中相邻输出Token之间的时间分布,用于描述解码阶段的连续体验。

连续批处理 · Continuous Batching

在生成迭代边界动态加入和移出请求,以提高设备利用率并控制排队的服务调度机制。

负载丢弃 · Load Shedding

容量不足时按明确优先级主动拒绝或降级部分请求,保护已接纳请求和系统恢复能力。

行为树 · Behavior Tree

用层级控制节点组合可复用动作,并根据成功、失败或运行中状态选择行为。

量化 · Quantization

用更低精度数值表示权重或激活,以换取更小模型或更低推理成本,并重新测量质量损失。