概述

从 2022 年 ChatGPT 的横空出世,到 2024-2025 年 AI Agent 的全面爆发,大语言模型(LLM)领域经历了从"对话工具"到"智能体平台"的深刻演进。本文系统梳理这一发展脉络中的核心概念和名词,按 LLM 基础、RAG 与知识增强、推理与提示技术、Agent 核心、Agent 协议与标准、Agent 框架与工具、Agent 评估与可观测性、新兴概念八大维度,力求全面覆盖、简明解释,并附上可查证的参考链接。


一、LLM 基础概念

Token(令牌)

  • 解释:模型处理文本的最小单位,一个 Token 可以是一个词、一个子词或一个字符,取决于分词策略。模型以 Token 序列为输入和输出。
  • 相关文档:OpenAI: What are tokens? | Hugging Face Tokenizers

Tokenization(分词)

  • 解释:将原始文本切分为 Token 序列的过程,常见算法包括 BPE(Byte-Pair Encoding)、WordPiece、SentencePiece 等。分词直接影响模型的词表大小和编解码效率。
  • 相关文档:Hugging Face: Tokenizers Summary

Prompt(提示词)

  • 解释:用户输入给模型的文本指令或上下文,引导模型生成期望的输出。Prompt 的设计质量直接影响模型响应的准确性和实用性。
  • 相关文档:OpenAI: Prompt Engineering Guide

Prompt Engineering(提示工程)

  • 解释:系统性地设计和优化 Prompt 以获得更好的模型输出的方法论与实践。包括角色设定、示例设计、思维链引导等技巧。
  • 相关文档:Prompt Engineering Guide (DAIR.AI)

System Prompt(系统提示词)

  • 解释:在对话开始时设定模型角色、行为边界和输出格式的隐藏指令,对用户不可见但影响模型的所有后续响应。
  • 相关文档:OpenAI: System Messages

Few-shot Learning(少样本学习)

Zero-shot Learning(零样本学习)

  • 解释:不给任何示例,仅靠任务描述指令让模型直接完成新任务。依赖模型在预训练中获得的能力泛化。
  • 相关文档:GPT-3 Paper

In-context Learning(上下文学习,ICL)

Context Window(上下文窗口)

Temperature(温度)

  • 解释:控制模型输出随机性的参数。值越高输出越多样随机,值越低越确定保守。0 表示近乎确定性输出。
  • 相关文档:OpenAI: API Reference

Top-p Sampling(核采样,Nucleus Sampling)

Top-k Sampling

Hallucination(幻觉)

Embedding(嵌入 / 向量表示)

  • 解释:将文本、图片等离散数据映射为高维连续向量,使语义相近的内容在向量空间中距离更近。是语义检索和 RAG 的基础。
  • 相关文档:OpenAI: Embeddings Guide | Sentence-BERT

Fine-tuning(微调)

  • 解释:在预训练模型基础上,使用特定领域数据进一步训练,使模型适配下游任务。包括全量微调和参数高效微调。
  • 相关文档:Hugging Face: Fine-tuning Guide

SFT(Supervised Fine-Tuning,监督微调)

  • 解释:使用人工标注的输入-输出对进行有监督训练,让模型学会按特定格式和风格响应。是后训练阶段的第一步。
  • 相关文档:Ouyang et al., “InstructGPT”

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)

DPO(Direct Preference Optimization,直接偏好优化)

LoRA(Low-Rank Adaptation,低秩适配)

  • 解释:冻结预训练模型权重,在旁边训练低秩矩阵来适配新任务的参数高效微调方法。大幅降低显存和计算需求。
  • 相关文档:Hu et al., “LoRA”

QLoRA(Quantized LoRA,量化低秩适配)

  • 解释:将基座模型量化到 4-bit,再使用 LoRA 进行微调的方法。可在单张 GPU 上微调大模型。
  • 相关文档:Dettmers et al., “QLoRA”

Quantization(量化)

  • 解释:将模型参数从高精度(如 FP16)压缩到低精度(如 INT8、INT4),减少显存占用和推理成本,同时尽量保持模型性能。
  • 相关文档:GPTQ Paper | bitsandbytes

MoE(Mixture of Experts,混合专家模型)

  • 解释:模型包含多个"专家"子网络,每次推理时通过门控机制动态选择少量专家参与计算。在增大参数量的同时控制推理成本。代表模型有 Mixtral、DeepSeek-MoE。
  • 相关文档:Shazeer et al., “Sparsely-Gated MoE” | Mixtral 8x7B

Multimodal(多模态)

  • 解释:模型能够同时处理文本、图像、音频、视频等多种模态输入和输出。是 LLM 向通用 AI 发展的重要方向。
  • 相关文档:OpenAI: GPT-4V | Google: Gemini

VLM(Vision-Language Model,视觉语言模型)

  • 解释:能够理解和推理图像与文本关系的模型,支持图像描述、视觉问答、图文匹配等任务。
  • 相关文档:Liu et al., “LLaVA” | Qwen-VL

Pre-training(预训练)

Post-training(后训练 / 对齐训练)

  • 解释:在预训练之后,通过 SFT、RLHF 等方法使模型输出符合人类偏好和任务需求的过程。决定了模型的"可用性”。
  • 相关文档:OpenAI: GPT-4 Technical Report

Constitutional AI(宪法 AI)

  • 解释:Anthropic 提出的 AI 对齐方法,通过一组"宪法"原则让模型自我评估和修正输出,减少对人类标注的依赖。
  • 相关文档:Bai et al., “Constitutional AI”

Guardrails(护栏)

  • 解释:为模型输入输出设置安全过滤和约束机制,防止生成有害、越狱或超出范围的回复。
  • 相关文档:NVIDIA NeMo Guardrails

Structured Output(结构化输出 / JSON Mode)

二、RAG 与知识增强

RAG(Retrieval-Augmented Generation,检索增强生成)

Vector Database / Vector Store(向量数据库 / 向量存储)

  • 解释:专门存储和检索高维向量的数据库,支持近似最近邻(ANN)搜索。常见方案有 FAISS、Milvus、Pinecone、Chroma 等。
  • 相关文档:Milvus | Pinecone | Chroma

Chunking(分块 / 文本分块)

  • 解释:将长文档切分为较小片段的过程,以便进行向量化和检索。分块策略直接影响检索质量和 RAG 效果。
  • 相关文档:LangChain: Text Splitters

Chunking Strategy(分块策略)

  • 解释:决定如何分块的方法论,包括固定大小分块、按语义分块(Semantic Chunking)、按段落分块等。好的策略平衡上下文完整性和检索精度。
  • 相关文档:LlamaIndex: Chunking

Semantic Search(语义搜索)

  • 解释:基于向量相似度进行搜索,而非关键词精确匹配。能理解查询的语义含义,找到概念相关但字面不同的结果。
  • 相关文档:Pinecone: Semantic Search

Hybrid Search(混合搜索)

  • 解释:结合向量语义搜索和传统关键词(BM25)搜索的方法,兼顾语义理解和精确匹配,提升召回率。
  • 相关文档:Weaviate: Hybrid Search

Reranking(重排序)

  • 解释:对初步检索结果使用更精细的模型(如 Cross-Encoder)重新打分排序,提升最终呈现给模型的 Top-K 结果的相关性。
  • 相关文档:Cohere: Rerank | SBERT Cross-Encoders

Grounding(事实锚定 / 接地)

  • 解释:将模型生成的内容锚定到可验证的外部知识源,确保回答有据可查,是 RAG 的核心目标之一。
  • 相关文档:Google Cloud: Grounding with Gemini

Knowledge Graph (in LLM context)(知识图谱)

  • 解释:在 LLM 场景中,知识图谱用于存储实体间的结构化关系,可以作为 RAG 的补充,提供更精确的事实推理能力。GraphRAG 是典型应用。
  • 相关文档:Microsoft: GraphRAG | Neo4j + LLM

三、推理与提示技术

Chain-of-Thought(思维链,CoT)

ReAct(Reasoning + Acting,推理与行动)

  • 解释:让模型交替进行推理和行动(如调用工具),将思考过程和工具调用结果结合来解决问题。是 Agent 的基础范式之一。
  • 相关文档:Yao et al., “ReAct”

Tree of Thoughts(思维树,ToT)

  • 解释:将推理过程组织为树形结构,允许探索多条推理路径并通过评估回溯选择最优路径。适合搜索和规划类问题。
  • 相关文档:Yao et al., “Tree of Thoughts”

Graph of Thoughts(思维图,GoT)

  • 解释:在 ToT 基础上进一步泛化,允许推理节点形成任意有向图结构,支持路径合并和循环,增强复杂推理能力。
  • 相关文档:Besta et al., “Graph of Thoughts”

Self-Consistency(自洽性 / 自我一致性)

Reflection / Self-Reflection(反思 / 自我反思)

Test-time Compute(测试时计算 / 推理时计算扩展)

Reasoning Models(推理模型)

  • 解释:通过强化学习训练模型在回答前进行长链推理,显著提升数学、编程等复杂任务能力。代表模型有 OpenAI o1/o3、DeepSeek-R1。
  • 相关文档:OpenAI o1 System Card | DeepSeek-R1

Scratchpad(草稿本)

四、Agent 核心概念

AI Agent(AI 智能体)

Agentic Workflow(智能体工作流)

  • 解释:由多个 LLM 调用步骤组成的自动化流程,每个步骤可能涉及推理、工具调用或决策。是 Agent 落地的主要形态。
  • 相关文档:Andrew Ng: “Agentic Design Patterns”

Tool Use / Tool Calling / Function Calling(工具使用 / 工具调用 / 函数调用)

  • 解释:模型根据用户意图,选择并调用外部工具(如搜索、计算器、API),将工具返回结果融入回答。是 Agent 与外部世界交互的核心能力。
  • 相关文档:OpenAI: Function Calling | Anthropic: Tool Use

Planning(规划)

Memory (Short-term / Long-term / Working Memory)(记忆:短期 / 长期 / 工作记忆)

  • 解释:Agent 存储和检索信息的能力。短期记忆对应上下文窗口,长期记忆通常使用向量数据库,工作记忆是当前任务的中间状态。
  • 相关文档:LangChain: Memory | MemGPT

Observation(观察)

Action Space(行动空间)

  • 解释:Agent 可以执行的所有可能动作的集合,包括可调用的工具、可发送的消息等。行动空间的设计决定了 Agent 的能力边界。
  • 相关文档:OpenAI: Function Calling Guide

Reward / Feedback Loop(奖励 / 反馈循环)

Autonomy Levels(自治等级)

  • 解释:衡量 Agent 自主决策程度的指标,从完全人工操作到完全自主。不同任务需要不同的自治等级。
  • 相关文档:Microsoft: Autonomous AI Agent Levels

Human-in-the-Loop(HITL,人在回路)

Agent Loop(智能体循环:感知 → 规划 → 行动 → 观察)

  • 解释:Agent 的核心运行周期:感知环境状态 → 规划下一步行动 → 执行行动 → 观察结果,循环直至完成目标。
  • 相关文档:ReAct Paper | Anthropic: Agent Loop

Multi-Agent System(多智能体系统)

Role-playing(角色扮演)

  • 解释:在多 Agent 系统中,为每个 Agent 分配特定角色(如 coder、reviewer、manager),通过角色间的交互协作完成任务。
  • 相关文档:CAMEL: Role-Playing Language Agents

Handoff(交接 / 转交)

  • 解释:Agent 将当前任务或子任务转交给另一个 Agent 或人类处理的机制,实现专业化分工。
  • 相关文档:OpenAI: Agents SDK (Handoffs)

SOP(Standard Operating Procedure,标准操作流程)

  • 解释:为 Agent 预定义的标准化操作流程,将复杂任务拆解为可复用的步骤模板,提升一致性和可靠性。
  • 相关文档:MetaGPT: SOPs for Agents

Durable Execution(持久化执行)

Sandboxing / Code Interpreter(沙箱 / 代码解释器)

Computer Use(计算机使用)

  • 解释:Agent 能够像人类一样操作计算机界面(点击、输入、滚动),直接与桌面应用和操作系统交互。
  • 相关文档:Anthropic: Claude Computer Use

Browser Automation(浏览器自动化)

  • 解释:Agent 通过程序化方式控制浏览器,实现网页浏览、表单填写、数据抓取等操作。是 Web Agent 的基础能力。
  • 相关文档:Playwright | Browser Frameworks: Browser Use

五、Agent 协议与标准

MCP(Model Context Protocol,模型上下文协议)

ACP(Agent Communication Protocol,Agent 通信协议)

A2A(Agent2Agent Protocol,Agent 间协议)

  • 解释:Google 提出的开放协议,允许不同框架构建的 Agent 互相发现、通信和协作,打破 Agent 生态孤岛。
  • 相关文档:Google: A2A Protocol | Google Blog: A2A

OpenAPI (in Agent context)(OpenAPI 规范)

Function Calling Schema(函数调用 Schema)

  • 解释:定义 Agent 可调用函数的名称、参数、返回值等规范,使模型能正确生成函数调用请求。通常以 JSON Schema 表达。
  • 相关文档:OpenAI: Function Calling Guide

Agent Client Protocol(Agent 客户端协议)

  • 解释:定义 Agent 与其客户端(前端界面、调用方)之间的交互协议,包括消息格式、流式输出、状态同步等。
  • 相关文档:AGNTCY: Agent Client Protocol

六、Agent 框架与工具

LangChain(LangChain 框架)

  • 解释:最流行的 LLM 应用开发框架,提供 Prompt 管理、链式调用、工具集成、Agent 编排等完整能力。
  • 相关文档:LangChain 官网 | GitHub

LangGraph(LangGraph)

  • 解释:LangChain 团队推出的 Agent 编排框架,基于图(Graph)结构定义 Agent 工作流,支持循环、分支、人工干预等复杂流程。
  • 相关文档:LangGraph 文档 | GitHub

LangSmith(LangSmith)

  • 解释:LangChain 的可观测性平台,提供 LLM 应用的 Tracing、调试、评估和监控能力。
  • 相关文档:LangSmith 官网

AutoGen(AutoGen 框架)

  • 解释:微软推出的多 Agent 对话框架,通过 Agent 间的多轮对话协作解决复杂任务,支持人类参与和代码执行。
  • 相关文档:AutoGen GitHub | AutoGen Paper

CrewAI(CrewAI 框架)

  • 解释:基于角色的多 Agent 协作框架,定义 Crew(团队)、Agent(成员)、Task(任务)等概念,简单直观地编排 Agent 团队。
  • 相关文档:CrewAI 官网 | GitHub

LlamaIndex(LlamaIndex 框架)

  • 解释:专注数据连接和 RAG 的 LLM 应用框架,提供数据摄入、索引、检索和生成的完整工具链。
  • 相关文档:LlamaIndex 官网 | GitHub

Semantic Kernel(Semantic Kernel)

  • 解释:微软推出的 LLM 编排 SDK,支持 C#、Python、Java,以"技能(Skills/Plugins)“为核心抽象,面向企业级应用。
  • 相关文档:Semantic Kernel 文档 | GitHub

AutoGPT(AutoGPT)

  • 解释:早期著名 autonomous agent 项目,让 GPT-4 自主设定子目标、执行任务、自我反思。开创了 AI Agent 的先河。
  • 相关文档:AutoGPT GitHub

MetaGPT(MetaGPT)

  • 解释:模拟软件开发团队的 Multi-Agent 框架,为不同 Agent 分配产品经理、架构师、工程师等角色,按 SOP 协作完成软件开发。
  • 相关文档:MetaGPT GitHub | MetaGPT Paper

七、Agent 评估与可观测性

Benchmark(基准测试)

  • 解释:用于标准化评估 LLM 和 Agent 能力的测试集和排名体系,通过统一任务和指标对比不同模型/系统的表现。
  • 相关文档:Hugging Face Open LLM Leaderboard

Harness(测试工具 / 评估框架)

  • 解释:运行 Benchmark 的软件框架,管理模型推理、评分计算和结果输出。lm-evaluation-harness 是最广泛使用的实现。
  • 相关文档:lm-evaluation-harness (EleutherAI)

SWE-bench(软件工程基准测试)

  • 解释:评估 Agent 在真实软件工程任务中表现的基准测试,要求 Agent 修复 GitHub 上的真实 issue。
  • 相关文档:SWE-bench 官网 | 论文

AgentBench(Agent 基准测试)

  • 解释:全面评估 LLM 作为 Agent 在多种环境(操作系统、数据库、知识图谱、游戏等)中表现能力的基准测试。
  • 相关文档:AgentBench 论文

GAIA(General AI Assistants Benchmark)

  • 解释:评估通用 AI 助手的基准测试,包含需要多步推理、工具使用和真实世界知识的复杂任务。
  • 相关文档:GAIA 论文 | GAIA Hugging Face

Tracing / Observability(追踪 / 可观测性)

  • 解释:对 LLM 和 Agent 的执行过程进行监控和记录,包括调用链路、Token 消耗、延迟、错误等。是生产环境运维的核心能力。
  • 相关文档:LangSmith | Langfuse | Arize Phoenix

Eval / Evaluation(评估)

  • 解释:系统性地评估 LLM/Agent 输出质量和能力的过程,包括自动评估(如 LLM-as-judge)和人工评估。
  • 相关文档:OpenAI: Evals | Ragas (RAG eval)

Leaderboard(排行榜)

  • 解释:公开展示不同模型/Agent 在特定 Benchmark 上表现的排名,方便横向比较。知名的有 Hugging Face Leaderboard、LMSYS Chatbot Arena。
  • 相关文档:LMSYS Chatbot Arena | Hugging Face Leaderboard

八、新兴概念

AGI(Artificial General Intelligence,通用人工智能)

Scaling Laws(缩放定律)

Emergent Abilities(涌现能力)

Compound AI Systems(复合 AI 系统)

  • 解释:由多个 AI 组件(LLM、检索器、工具、评估器等)组合而成的系统,通过组件协作实现比单一模型更强的能力。Agent 是其典型形态。
  • 相关文档:Berkeley AI: Compound AI Systems

AI Operating System(AIOS,AI 操作系统)

Agent Marketplace(Agent 市场)

  • 解释:类似应用商店的 Agent 交易平台,开发者发布和分享可复用的 Agent,用户按需选择和使用。
  • 相关文档:OpenAI: GPT Store | Coze

GUI Agent(图形界面智能体)

  • 解释:能够通过理解图形用户界面(GUI)进行操作的 Agent,与 Computer Use 类似但更侧重移动端和 Web 端。
  • 相关文档:Anthropic: Claude Computer Use | AppAgent

Agentic Search(智能体搜索)

  • 解释:由 Agent 驱动的下一代搜索范式,不仅返回链接,还自动浏览、理解和综合信息,直接给出答案。
  • 相关文档:Perplexity AI | OpenAI: Deep Research

Deep Research(深度研究)

  • 解释:Agent 自主进行多轮搜索、阅读、分析、综合的长文本研究能力,能产出结构化的研究报告。OpenAI 和 Google 均已推出相关功能。
  • 相关文档:OpenAI Deep Research | Google Gemini Deep Research

发展脉络图

时间里程碑事件代表性技术 / 产品
2017Transformer 架构提出Attention is All You Need
2018-2019预训练模型兴起BERT、GPT-2
2020GPT-3 发布,提出 In-context LearningFew-shot Learning、Scaling Laws
2022.01Chain-of-Thought 提示技术CoT Prompting
2022.03RLHF 在 InstructGPT 中应用SFT + RLHF 对齐训练
2022.10ReAct 范式提出Reasoning + Acting
2022.11ChatGPT 发布,LLM 大规模普及GPT-3.5、对话式 AI
2023.02多模态 LLM 出现GPT-4、GPT-4V
2023.03AutoGPT 引爆 autonomous agent 概念AutoGPT、BabyAGI
2023.06RAG 成为知识增强主流方案LangChain、LlamaIndex
2023.10Agent 框架百花齐放AutoGen、MetaGPT、CrewAI
2024.05多 Agent 协作标准酝酿A2A Protocol、MCP
2024.09OpenAI o1 发布,推理模型时代开启Reasoning Models、Test-time Compute
2024.10Anthropic 推出 Computer UseGUI Agent、Browser Automation
2024.11Anthropic 发布 MCP 协议Model Context Protocol
2025.01DeepSeek-R1 开源推理模型RL for Reasoning
2025.02Google 推出 A2A 协议Agent 互操作性
2025.06OpenAI 推出 Deep ResearchAgentic Search
2025+Agent 走向生产环境AIOS、Agent Marketplace

🌍 The world is yours. — Tony Montana, AI Generated