一文说明人工智能领域的 20+ 个核心概念 —— 不只是定义,而是深入理解每个概念背后的"为什么"
目录

一、引言:为什么需要理解这些基础概念
hello 大家,我们都知道,人工智能领域的发展速度之快,让"跟上节奏"本身成了一件难事。2025 年 GPT-4o 还在让开发者惊叹,2026 年 GPT-5.5、Claude Opus 4.6、DeepSeek V4、Gemini 3.1 Pro 已经让人应接不暇。各种新名词、新概念、新框架层出不穷,从业者很容易陷入"会用但不知道为什么这样用"的困境。
所以,为了帮助大家理解这些和ai有关的概念,便有了这篇文章~~
这篇文章覆盖的内容包括:
- AI 是什么:从日常体验到技术本质,理解人工智能的"智能"到底意味着什么
- AI 发展简史:从 1950 年图灵测试到 2026 年大模型军备竞赛,七十年风雨历程中的三大教训
- AI / ML / DL 三层关系:为什么深度学习是机器学习的分支,而机器学习是 AI 的核心实现方式
- Transformer 架构深度解析:自注意力机制、QKV 矩阵、多头注意力、位置编码——大语言模型的"发动机"
- LLM 大语言模型:GPT-5.5、Claude Opus 4.6、Gemini 3.1 Pro、DeepSeek V4 等主流模型的能力边界和适用场景
- Prompt 提示词:CO-STAR 框架、系统提示词与用户提示词的区别、提示词工程的核心思想
- 提示词设计技巧:从角色提示到链式思考(CoT)、自我一致性、迭代优化策略
- 生成参数详解:Temperature、Top-P、Top-K、Repetition Penalty——如何精准控制模型的"创造力"
- Token 词元:计费单位、上下文窗口限制、分词器的工作原理、Token 优化策略
- 会话记忆与上下文窗口:它们之间的关系、各自的限制和实际影响
- 多模态:文本、图像、音频、视频的融合技术及其典型应用
- RAG 检索增强生成:核心原理、向量数据库、Embedding、Graph RAG、Agentic RAG
- Embedding 与向量数据库:语义搜索的核心技术、主流模型与数据库选型对比
- 模型训练与微调:预训练、SFT、RLHF、DPO、RLAIF、LoRA 的完整技术栈
- AI 模型评测体系:MMLU、HumanEval、SWE-bench、GPQA、Chatbot Arena
- AI Agent 架构:从单智能体到多智能体协作,LangGraph、CrewAI、AutoGen 等框架
- AI 幻觉:成因、类型、检测与缓解策略
- AI 安全与伦理:对齐技术、偏见问题、全球监管法规
二、人工智能(AI):概念、本质与日常应用
2.1 人工智能的定义
人工智能(Artificial Intelligence,简称 AI),是指通过计算机系统模拟人类智能的技术。它的本质是:让机器通过算法和数据,具备类似人类的认知和思维能力,从而完成学习、推理、决策等复杂任务。
这个定义中有三个关键词值得展开:
- 模拟:AI 不是"复制"人类智能,而是在特定任务上达到或超越人类水平的表现。一个能下围棋赢过世界冠军的 AI(AlphaGo),并不具备"饿了要吃饭"的常识。这种"窄领域超强、宽领域很弱"是当前 AI 的典型特征。
- 算法和数据:AI 的智能来自两个源头——算法(怎么做)和数据(学什么)。算法决定了模型的学习方式和能力上限,数据决定了模型学到的具体知识和模式。两者缺一不可。
- 类人能力:包括感知(看、听)、认知(理解、推理)、决策(选择、规划)、行动(执行、生成)。不同的 AI 系统在这些能力上的侧重不同。
2.2 日常生活中的 AI
与其从抽象定义出发,不如从日常体验入手,这能更直观地理解 AI 的实际形态:
内容推荐:打开抖音、小红书、B站,刷到的内容越来越符合你的口味。这不是巧合,而是推荐算法在不断"学习"你的行为模式——你看了什么、停留了多久、点赞了哪些、分享了什么。每一次交互都在更新模型对你的"理解",让你看到的下一页内容更可能让你继续刷下去。这就是 AI 在"学习"和"预测"。
语音助手:对着 Siri、小爱同学、天猫精灵说话,它们能听懂你在讲什么,还能用自然语言回答你。这套流程背后是三个 AI 系统的协作:语音识别(ASR)把声音变成文字,自然语言理解(NLU)理解文字的含义和意图,自然语言生成(NLG)和语音合成(TTS)把回答变成声音。这就是 AI 在"听"和"说"。
视觉识别:拍照自动识别人脸、美颜滤镜精准定位五官、OCR 把图片中的文字提取出来、翻译软件对准路牌就能实时翻译。这些都是计算机视觉(Computer Vision)的典型应用——AI 在"看"和"理解"。
AI 生成内容:输入一段文字描述,AI 就能生成一张逼真的图片、一段视频、一首音乐。比如 Sora(OpenAI)、即梦(字节跳动)、可灵(快手)等工具,输入"一只猫在月球上弹钢琴",就能生成对应的视频。这就是 AI 在理解文字并创作生成内容。
自动驾驶:新能源汽车在高速公路上自动跟车、变道、避障。车辆通过摄像头、雷达、激光雷达感知周围环境,通过 AI 算法实时判断:前方车辆减速了要不要刹车、旁边车道有空间要不要变道、这个路口能不能左转。这就是 AI 在"思考"和"做决策"。
2.3 AI 应用 vs AI 算法 vs AI 模型
这三个词经常被混用,但它们的含义有明确的区别:
- AI 应用:把 AI 能力运用到具体业务和实际场景中,以产品或系统的形式落地。比如豆包、Cursor、自动驾驶辅助系统、智能客服机器人。AI 应用是"用户能直接使用的东西"。
- AI 算法:计算机模仿人类思考、学习、判断时,遵循的数学公式和执行流程。它是实现 AI 能力的具体方法和逻辑。可以把 AI 算法理解为 AI 的"大脑逻辑"——同样的数据,不同的算法会产生不同的学习效果和输出质量。
- AI 模型:用特定算法在特定数据上训练出来的产物。模型 = 算法 + 训练数据 + 训练过程。同一个算法(如 Transformer),用不同的数据训练,会得到不同的模型(如 GPT 用于英文、Qwen 用于中英文)。
常见的 AI 算法包括:线性回归、逻辑回归、决策树与随机森林、支持向量机(SVM)、卷积神经网络(CNN)、循环神经网络(RNN)、Transformer(当前大语言模型的基础架构)。
2.4 Agent(智能体)与 Copilot(副驾驶)
**Agent(智能体)**是一个能够感知环境输入、自主决策、规划行动路径,并可调用工具或执行操作以达成目标的自主性软件实体。
Copilot(副驾驶)模式与 Agent 模式的核心区别在于控制权归属:
| 控制权 | 人主导,AI 提供建议 | AI 自主规划和执行 |
| 决策方式 | 人决定是否采纳 AI 的建议 | AI 自主决定行动步骤 |
| 典型场景 | ChatGPT 普通问答、Cursor Ask 模式 | Cursor Agent 模式、AutoClaw 浏览器自动化 |
| 交互方式 | “我提问题,你给我建议,我决定做不做” | “我提目标,你自己想办法完成,向我汇报结果” |
| 风险 | 低(人在回路中) | 中到高(AI 自主执行,需要安全机制) |
举个例子来说明两者的区别:
- Copilot 模式:你对 AI 说"帮我看看这段代码有什么问题",AI 分析后给出建议,你看了觉得有道理,手动修改代码。
- Agent 模式:你对 AI 说"帮我把这个项目中的所有 TODO 注释替换成对应的 Issue 链接,然后提交 PR",AI 自己搜索文件、替换内容、执行 git 操作、创建 PR,最后告诉你"完成了,这是 PR 链接"。
在当下,agent毫无疑问是主流存在。
2.5 Vibe Coding(AI 编程)
Vibe Coding 是一种以自然语言驱动的软件开发方式。开发者通过描述需求或意图,借助大语言模型自动生成、修改代码,从而完成开发任务。开发者只管验收、反馈、迭代,快速把想法变成可运行程序。
这个概念在 2025-2026 年迅速成为主流开发方式之一。它的核心转变是:从"写代码"到"描述需求"。以前是"我知道怎么实现,我来写",现在是"我知道要什么效果,AI 来实现"。
关于vibe coding,我之前也有一篇文章专门讲到,大家有兴趣的可以去看看
常用的 Vibe Coding 工具按类别分:
AI 原生 IDE(日常开发主力,在编辑器内深度集成 AI):
| Cursor | 基于 VS Code,Agent 模式支持自主编程,Composer 功能强大 | cursor.sh |
| Windsurf | Codeium 出品,Flow 模式自动分析上下文并执行多步操作 | windsurf.com |
| Trae | 字节跳动出品,内置 Builder 模式,中文体验优秀 | trae.ai |
CLI 工具(终端内使用,不占界面):
| Claude Code | Anthropic 官方 CLI,深度集成 Claude 模型 | claude.ai/code |
| Aider | 开源 CLI,支持多模型,Git 集成好 | aider.chat |
| Cline | VS Code 插件,终端内操作 | cline.bot |
即时生成工具(一句话生成可运行项目,快速出 Demo):
| Devin | 首个 AI 软件工程师,全自主开发 | devin.ai |
| 秒哒 | 字节跳动出品,中文友好 | miaoda.cn |
| 码上飞 | 即时生成,快速出原型 | codeflying.net |
三、AI 发展简史:从图灵测试到超级智能的七十年
3.1 为什么需要了解 AI 的发展历程
要真正理解今天的 AI 为什么是这个样子,必须回到历史中去。AI 不是一夜之间"突然出现"的——它经历了三次寒冬、两次复兴、无数次的路线之争,才走到今天的大语言模型时代。了解这段历史,你就能理解:
- 为什么专家系统在 1980 年代风靡一时,又在 1990 年代迅速衰落
- 为什么深度学习在 2012 年"突然爆发"(其实已经酝酿了 30 年)
- 为什么 Transformer 架构的出现是整个 AI 领域的分水岭
- 为什么 ChatGPT 在 2022 年底引爆了全球 AI 热潮
3.2 AI 发展的七个阶段
第一阶段:AI 的诞生(1950-1974)—— 从"机器能思考吗"到第一次黄金时代
1950 年,艾伦·图灵(Alan Turing)发表了一篇划时代的论文《Computing Machinery and Intelligence》,提出了一个至今仍在被讨论的问题:“机器能思考吗?“为了回答这个问题,他设计了著名的"图灵测试”——如果一台机器在与人类的对话中,让人类无法分辨对方是机器还是人,那么这台机器就具备了"智能”。
1956 年,达特茅斯会议(Dartmouth Workshop)召开。约翰·麦卡锡(John McCarthy)在这次会议上正式提出了"Artificial Intelligence(人工智能)"这个术语。这次会议被公认为 AI 学科的诞生标志。
在接下来的十几年里,AI 进入了第一个黄金时代。研究者们开发出了能证明数学定理的程序(Logic Theorist)、能下棋的程序、能解决简单自然语言问题的程序(ELIZA 聊天机器人)。当时的人们对 AI 充满乐观——“20 年内,机器将能完成人类能做的一切工作”。
第二阶段:第一次 AI 寒冬(1974-1980)—— 期望越高,失望越大
1970 年代中期,热情骤然冷却。原因很简单:早期 AI 系统的能力远远低于预期。那些在实验室里表现不错的系统,一到真实世界就完全失效。符号逻辑推理在简单的"玩具问题"上有效,但面对现实世界的复杂性和模糊性,完全无能为力。
1973 年,英国政府发布了著名的《Lighthill 报告》,严厉批评 AI 研究"没有取得任何实质性进展"。英国政府大幅削减 AI 研究经费,随后美国 DARPA 也跟进削减。AI 研究资金几乎枯竭,大量研究者被迫转行。这就是第一次 AI 寒冬。
第三阶段:专家系统的复兴(1980-1987)—— “知识就是力量”
1980 年代,AI 以"专家系统"的形式强势回归。专家系统的核心思想是:不追求通用智能,而是聚焦于特定领域,将人类专家的知识编码为"如果-那么"规则。
一个典型的专家系统:MYCIN(1976 年开发,1980 年代投入使用),它包含了约 600 条关于血液感染诊断的规则,在诊断某些细菌感染方面的准确率超过了初级医生。XCON(1980 年)为 DEC 公司每年节省了 4000 万美元——它自动配置计算机系统的组件,减少了大量人工错误。
专家系统在商业上的成功引发了第二次 AI 投资热潮。日本启动了雄心勃勃的"第五代计算机"项目,美国、英国也纷纷跟进。但专家系统的致命缺陷已经暴露:规则写不完、规则会冲突、系统无法应对新情况、维护成本极高。
第四阶段:第二次 AI 寒冬(1987-1993)—— 专家系统的崩溃
1987 年,专用 Lisp 机器市场崩溃。通用计算机(如 Sun 工作站)的性能已经超过了昂贵的专用 AI 硬件。加上专家系统在实际应用中暴露的大量问题(维护困难、无法处理不确定性、知识获取成本高),AI 投资再次大幅萎缩。
日本第五代计算机项目在 1992 年正式宣告失败——投入了 10 年时间、数百亿日元,却没有产生任何有商业价值的成果。AI 再次跌入低谷。
但正是在这个寒冬中,有一批研究者默默坚持着另一条技术路线——神经网络。虽然当时不被主流 AI 界看好,但他们的工作为后来的深度学习革命埋下了种子。
第五阶段:机器学习的崛起(1993-2012)—— 从"规则"到"数据"
1990 年代,AI 的研究重心从"基于规则的推理"转向了"基于数据的统计学习"。支持向量机(SVM)、随机森林、贝叶斯网络等机器学习方法开始成为主流。
关键事件:
- 1997 年:IBM 深蓝(Deep Blue)击败国际象棋世界冠军卡斯帕罗夫。这是 AI 在智力竞技领域第一次击败人类世界冠军。
- 2006 年:杰弗里·辛顿(Geoffrey Hinton)发表了关于深度信念网络(Deep Belief Networks)的论文,标志着"深度学习"这个概念的正式提出。他证明了多层神经网络可以通过"逐层预训练"来有效训练。
- 2011 年:IBM Watson 在《危险边缘》(Jeopardy!)问答节目中击败了两位人类冠军。
第六阶段:深度学习革命(2012-2017)—— "数据 + 算力 + 算法"的三重奏
2012 年是深度学习革命的元年。辛顿的两位学生 Alex Krizhevsky 和 Ilya Sutskever(后来成为 OpenAI 的联合创始人)设计的 AlexNet 在 ImageNet 图像识别大赛中,以压倒性优势击败了所有传统方法——错误率从 26% 骤降到 15.3%。这次胜利向全世界证明了:深度学习 + GPU 算力 + 海量数据 = 前所未有的能力。
此后,深度学习在图像识别、语音识别、机器翻译等几乎所有 AI 任务上取得了突破性进展:
- 2014 年:Ian Goodfellow 发明了 GAN(生成对抗网络),开启了 AI 生成图像的时代
- 2014 年:Google 收购 DeepMind,后者开始研发 AlphaGo
- 2016 年:AlphaGo 以 4:1 击败围棋世界冠军李世石。围棋被认为是人类智力游戏的巅峰,其状态空间远超国际象棋,此前没人相信 AI 能在围棋上击败人类顶级棋手
- 2017 年:Google 发表论文《Attention Is All You Need》,提出了 Transformer 架构。这篇论文改变了整个 AI 领域的走向,时至今日,transformr依旧是所有大模型的基础架构。
第七阶段:大语言模型时代(2017-2026)—— 规模即能力
Transformer 的出现,让研究者们发现了一个惊人的规律:模型越大,能力越强,而且这种能力的增长不是线性的,而是涌现式的,说白了就是以量制胜,靠数据给他堆积起来,就比如让一个人把github上面的所有代码学会,那么毋庸置疑他会成为计算机领域唯一的god。
- 2018 年:Google 发布 BERT(基于 Transformer 的编码器),OpenAI 发布 GPT-1。BERT 在 11 项 NLP 任务上刷新了最佳成绩
- 2019 年:OpenAI 发布 GPT-2(15 亿参数),因为"太危险"而延迟发布——他们担心这个模型被用于生成虚假新闻
- 2020 年:OpenAI 发布 GPT-3(1750 亿参数),首次展示了"涌现能力"——模型在没有专门训练的情况下,能够完成翻译、编程、写诗等任务
- 2022 年 11 月:OpenAI 发布 ChatGPT,基于 GPT-3.5。两个月内用户突破 1 亿,成为历史上增长最快的消费级应用。AI 从"实验室技术"变成了"全民工具"
- 2023 年 3 月:OpenAI 发布 GPT-4,支持多模态(图像理解),在律师资格考试中排名前 10%
- 2023 年:Meta 开源 Llama 2,中国大模型厂商集中爆发(百度文心、阿里通义、字节豆包、智谱 GLM 等)
- 2024 年:多模态模型全面爆发——GPT-4o 支持实时音视频交互,Sora 实现文生视频,Claude 3 在多项基准上超越 GPT-4
- 2025 年:AI Agent 爆发——模型不仅能"聊天",还能自主操作浏览器、写代码、调用 API、完成复杂任务链。DeepSeek-R1 以极低成本达到顶级推理能力,引发"价格屠夫"讨论
- 2026 年:模型能力持续攀升——Claude Opus 4.6 支持 1M Token 上下文和自适应推理,GPT-5 系列迭代到 5.5 版本,DeepSeek V4 在 SWE-bench 编程基准上达到 81% 的得分,Gemini 3.1 Pro 在 MMLU-Pro 上达到 91.2% 的领先水平 [17][18]

3.3 AI 发展史的三大教训
回顾这七十年的历史,有三个反复出现的教训:
教训一:不要高估短期,不要低估长期。1960 年代的 AI 研究者认为"20 年内 AI 能替代人类所有工作",这个预测至今没有实现。但 2010 年很少有人能预测到,短短 13 年后,AI 就能通过律师资格考试、写出可用的代码、生成逼真的视频。
教训二:算力、数据、算法,三者缺一不可。神经网络的概念在 1950 年代就出现了,但直到 2012 年才爆发——因为有了 GPU(算力)、ImageNet(数据)和更好的训练算法。Transformer 在 2017 年就提出了,但真正的爆发在 2022 年——因为需要足够的算力来训练 GPT-3 级别的大模型,那么算力其实就是基础设施,比如电。
教训三:寒冬孕育突破。每一次 AI 寒冬之后,都有一批研究者从主流路线之外找到了新的方向。没有第一次寒冬,就不会有专家系统的想法;没有第二次寒冬,神经网络可能不会得到持续的关注;没有过去几年的积累,ChatGPT 的爆发就不可能发生。
四、AI、机器学习、深度学习:三层关系深度拆解
3.1 三层关系概述
人工智能、机器学习、深度学习这三者的关系,可以用一个技术圈常见的比喻来理解:三层同心圆。
- 最外层:人工智能(AI)——目标是让机器拥有类似人类的智能。这是最宏大的愿景,涵盖所有试图让机器变"聪明"的技术。
- 中间层:机器学习(ML)——是 AI 的核心实现方式。它通过数据训练模型,让机器自动学习规律,而不是依赖人工编写规则。
- 最内层:深度学习(DL)——是机器学习的一个重要分支。基于多层神经网络,让机器自动从海量数据中学习特征与规律。

一句话总结:深度学习是机器学习的重要分支,机器学习是人工智能的核心实现方式。
3.2 人工智能(AI)——最宏大的愿景
人工智能的目标是让机器表现出类似人类的智能行为。这个定义非常宽泛,因为它涵盖了一切试图让机器"聪明"起来的技术——从 1950 年代的符号逻辑推理,到 2020 年代的大语言模型,都属于 AI 的范畴。
AI 的实现方式有很多种,机器学习只是其中之一。早期 AI 也曾尝试"专家系统"——由人类专家手动编写成千上万条规则,让机器按照规则来推理。比如:“如果病人发烧且咳嗽且肺部有阴影,那么可能是肺炎”。这种方式的局限性很明显:规则写不完、规则之间会冲突、规则无法应对新情况。
3.3 机器学习(ML)——从规则到数据
**机器学习(Machine Learning)**的核心思想是:不写规则,而是让机器从数据中自动学习规则。
传统的编程方式:
数据 + 规则 → 计算机 → 答案
机器学习的方式:
数据 + 答案 → 计算机 → 规则(模型)
举个例子:要识别一张图片是猫还是狗。传统方式需要手动编写规则——“猫的耳朵是尖的,狗的眼睛是圆的,猫的尾巴是细的……”——然后让计算机按照这些规则判断。但"尖耳朵"这个规则怎么写?多尖算尖?不同品种的猫耳朵形状差异很大,不同角度拍出来的耳朵也不一样。规则写到吐也写不完。
机器学习的方式完全不同:给算法看十万张标注了"猫"或"狗"的图片,算法自己从这些图片中"学习"出猫和狗的区别特征。它学到的不是人类定义的"尖耳朵"规则,而是像素级别的抽象模式——这些模式人类可能无法用语言描述,但机器"知道"怎么用它们来区分猫和狗。
机器学习的常见方法:
| 线性回归 | 找一条直线拟合数据点,预测连续值 | 房价预测、销售额预测 |
| 逻辑回归 | 将线性回归的输出映射到 0-1,用于分类 | 垃圾邮件分类、疾病预测 |
| 决策树 | 通过一系列"如果-那么"规则进行决策 | 信用评估、客户分类 |
| 随机森林 | 多棵决策树的集合,投票决定最终结果 | 高精度分类和回归 |
| 支持向量机(SVM) | 找到最优分类边界,最大化类别间距 | 文本分类、图像识别 |
| K-Means 聚类 | 将数据自动分组,组内相似、组间差异 | 用户分群、异常检测 |
3.4 深度学习(DL)——多层神经网络的力量
深度学习(Deep Learning)之所以叫"深度",是因为它使用了多层神经网络——每一层从上一层提取的特征中继续学习更抽象的特征。
用一个视觉识别的例子来说明深度学习的工作原理:
- 第 1 层:识别最基本的边缘和颜色块(“这条线是直的还是弯的”)
- 第 2 层:将边缘组合成简单形状(“这些线组成了一个圆”)
- 第 3 层:识别更复杂的图案(“这个圆加上两个三角形,看起来像猫的脸”)
- 第 4 层:识别完整的物体(“这是一只猫”)
- 更深层:识别场景和关系(“一只猫坐在沙发上,旁边有一本书”)
深度学习的关键突破在于:不需要人工设计特征。传统机器学习需要人类专家先"提取特征"——比如识别猫之前,先手动定义"猫的特征是尖耳朵、圆脸、长胡须"。深度学习完全不需要这一步——它自己从原始像素中逐层学习特征。这就是为什么深度学习在图像识别、语音识别、自然语言处理等领域取得了远超传统方法的成果。
深度学习的核心技术:
| CNN(卷积神经网络) | 通过卷积核在图像上滑动,局部感知 | 图像识别、目标检测 |
| RNN(循环神经网络) | 处理序列数据,记住之前的信息 | 文本生成、时间序列预测 |
| LSTM / GRU | 改进的 RNN,解决长序列记忆问题 | 机器翻译、语音识别 |
| Transformer | 自注意力机制,并行处理序列 | 所有大语言模型的基础架构 |
| GAN(生成对抗网络) | 生成器与判别器对抗训练 | 图像生成、风格迁移 |
| Diffusion Model | 逐步去噪生成高质量图像 | Stable Diffusion、DALL-E |
3.5 为什么是大语言模型的时代
当前 AI 领域最热门的"大语言模型"(LLM)属于深度学习的范畴,具体来说,它们都基于 Transformer 架构。Transformer 在 2017 年由 Google 提出(论文标题《Attention Is All You Need》),它的核心创新是自注意力机制(Self-Attention)——让模型在处理一个词时,能够同时"关注"句子中的所有其他词,理解它们之间的关系。
这个机制的重要性怎么强调都不过分。在 Transformer 出现之前,处理文本序列的主流方式是 RNN/LSTM——它们必须按顺序处理每个词,处理第 100 个词时必须"记住"前面 99 个词的意思。这导致两个问题:处理速度慢(必须串行),以及"记忆"在长序列中逐渐衰减。Transformer 的自注意力机制让所有词可以同时被处理,而且任意两个词之间的"距离"都是 1 步——无论它们在句子中离得多远。
Transformer 的另一个关键特性是可扩展性:它的架构天然适合大规模并行计算(GPU/TPU),这让训练超大模型成为可能。从 GPT-1(1.17 亿参数)到 GPT-4(据估计超过 1 万亿参数),从 BERT 到 Claude Opus,模型参数量的指数级增长,带来了能力的质变——这就是"大"语言模型中"大"字的含义。
五、Transformer 架构深度解析:大语言模型的"发动机"
5.1 为什么 Transformer 改变了世界
在 Transformer 出现之前,处理文本序列的主流方式是 RNN(循环神经网络)和 LSTM(长短期记忆网络)。它们有一个共同的致命缺陷:必须按顺序处理每个词。处理第 100 个词时,必须"记住"前面 99 个词的意思。这导致:
- 处理速度慢(必须串行,无法并行)
- "记忆"在长序列中逐渐衰减(梯度消失问题)
- 无法有效利用 GPU 的并行计算能力
2017 年,Google 的八位研究者(Vaswani 等)发表了一篇题目极其大胆的论文:《Attention Is All You Need》(注意力就是你所需要的全部)。这篇论文提出的 Transformer 架构,用**自注意力机制(Self-Attention)**彻底替代了 RNN 的循环结构,让所有词可以同时被处理,而且任意两个词之间的"距离"都是 1 步——无论它们在句子中离得多远。
这篇论文不仅改变了 NLP 的方向,还为后来的 GPT、BERT、Claude、Gemini 等所有大语言模型奠定了基础。可以说,没有 Transformer,就没有今天的大语言模型时代。

5.2 Transformer 的整体架构
Transformer 由**编码器(Encoder)和解码器(Decoder)**两部分组成,每部分由多个相同的层堆叠而成(原文中 N=6)。
编码器:接收输入序列,将其转换为一系列"上下文感知"的向量表示。每个编码器层包含两个子层:
每个子层后面都有一个"残差连接(Add)“和"层归一化(Norm)”。残差连接让信息可以绕过子层直接传递,解决了深层网络的训练困难问题。
解码器:接收编码器的输出和之前已生成的输出,逐步生成目标序列。每个解码器层比编码器多一个子层:
5.3 自注意力机制:核心中的核心
自注意力机制是 Transformer 的"灵魂"。它的核心思想是:让序列中的每个词,都能直接"看到"序列中的所有其他词,并计算出它们之间的关联程度。
具体来说,自注意力机制的计算过程分为四步:
第一步:生成 Q、K、V 矩阵
对于输入序列中的每个词,模型通过三个不同的线性变换,生成三个向量:
- Q(Query,查询):代表"我在找什么"。每个词通过 Q 向量来表达"我想了解什么信息"
- K(Key,键):代表"我能提供什么"。每个词通过 K 向量来表达"我包含了什么信息"
- V(Value,值):代表"我实际包含的内容"。每个词通过 V 向量来表达"我实际要传递的信息"
可以把 Q、K、V 类比为搜索引擎中的"搜索词"、“网页标题"和"网页内容”——你输入搜索词(Q),系统匹配标题(K),返回内容(V)。
第二步:计算注意力分数
对于每个词,计算它的 Q 向量与所有词的 K 向量的点积(内积)。点积越大,说明两个词的相关性越高。
注意力分数矩阵 = Q × K^T
# 如果序列长度为 4,则得到一个 4×4 的矩阵
# 矩阵中第 i 行第 j 列的值,表示"第 i 个词对第 j 个词的关注程度"
第三步:缩放 + Softmax
将注意力分数除以 √d_k(d_k 是 K 向量的维度),然后经过 Softmax 转换为概率分布。除以 √d_k 是为了防止点积过大导致 Softmax 的梯度消失。
注意力权重 = Softmax(注意力分数 / √d_k)
第四步:加权求和
将注意力权重与 V 矩阵相乘,得到最终的输出。每个词的输出是所有词 V 向量的加权平均,权重由注意力分数决定。
输出 = 注意力权重 × V
一个直观的例子:
假设输入句子是:“我在吃一个苹果,它很甜”。
对于"它"这个词,自注意力机制会计算出它和"苹果"的关联度最高(因为"它"指代的是"苹果"),和"甜"的关联度次之(因为"甜"是苹果的属性),和"我"、"吃"的关联度较低。
所以"它"的最终输出向量中,会融入更多来自"苹果"和"甜"的信息,而不是"我"和"吃"的信息。这就是自注意力机制的核心价值——它让每个词都能"理解"它和句子中其他词的关系。
5.4 多头注意力(Multi-Head Attention)
单头注意力只能学到一种"关系模式"。多头注意力则是同时运行多个自注意力机制(原文中 h=8),每个"头"关注不同的关系模式:
- 头 1 可能关注"主谓关系"(“我"→"吃”)
- 头 2 可能关注"动宾关系"(“吃"→"苹果”)
- 头 3 可能关注"修饰关系"(“苹果"→"甜”)
- 头 4 可能关注"指代关系"(“它"→"苹果”)
然后将所有头的输出拼接在一起,经过一个线性变换,得到最终的输出。多头注意力让模型能同时从多个角度理解文本,这是它比单头注意力强大得多的原因。
5.5 位置编码(Positional Encoding)
Transformer 没有 RNN 的循环结构,因此它没有内置的"位置感知"能力——模型不知道"我"在"吃"的前面还是后面。为了解决这个问题,Transformer 在输入嵌入(Input Embedding)上叠加了位置编码。
位置编码是一个与输入嵌入维度相同的向量,它包含了词在序列中的位置信息。原文使用的是正弦/余弦函数生成的位置编码:
PE(pos, 2i) = sin(pos / 10000^(2i/d_model))
PE(pos, 2i+1) = cos(pos / 10000^(2i/d_model))
# pos = 词在序列中的位置
# i = 位置编码向量的维度索引
# d_model = 模型的嵌入维度
通过这种方式,每个位置都有一个唯一的编码,模型可以区分"苹果很好吃"和"好苹果很吃"这两个完全不同的句子。
5.6 Transformer 的三种变体
自 2017 年以来,Transformer 架构演化出了三种主要变体,分别应用于不同的场景:
| 仅编码器(Encoder-only) | 只使用编码器部分 | BERT、RoBERTa | 文本理解、分类、抽取 | 情感分析、命名实体识别、搜索结果排序 |
| 仅解码器(Decoder-only) | 只使用解码器部分 | GPT 系列、Claude、Llama | 文本生成、对话 | ChatGPT、AI 写作、代码生成 |
| 编码器-解码器(Encoder-Decoder) | 完整使用两部分 | T5、BART、原始 Transformer | 序列到序列转换 | 机器翻译、文本摘要 |
为什么 GPT 系列只用解码器?
因为 GPT 的核心目标是"生成文本"——给定前面的内容,预测下一个词。解码器的自回归特性(每一步生成都依赖之前生成的内容)天然适合这个任务。而编码器的双向注意力(可以看到整个序列)在生成任务中反而是劣势——因为生成时未来的词是不可见的。
这就是为什么 GPT 的完整名称是 Generative Pre-trained Transformer(生成式预训练 Transformer)——"生成式"这三个字,暗示了它使用解码器架构的事实。
5.7 从 Transformer 到 GPT:缩放的魔力
Transformer 架构的另一个关键特性是可扩展性:它的架构天然适合大规模并行计算(GPU/TPU),这让训练超大模型成为可能。研究者们发现,只需要扩大 Transformer 的规模(更多层、更宽维度、更多训练数据),模型的能力就会持续提升,甚至涌现出意想不到的能力。
从 GPT-1(1.17 亿参数)到 GPT-4(据估计超过 1 万亿参数),参数量的指数级增长带来了能力的质变:
- GPT-1(2018):能完成简单的句子补全
- GPT-2(2019):能生成几段连贯的文本
- GPT-3(2020):涌现出少样本学习能力——不需要专门训练就能完成翻译、编程等任务
- GPT-4(2023):多模态理解、高级推理、代码生成、通过律师资格考试
- GPT-5.1(2025-2026):原生多模态、超强推理、Agent 自主执行
整个过程中,核心架构没有本质变化——仍然是 Transformer 解码器。变化的是规模:更多的参数、更多的数据、更多的算力。这就是 Scaling Law(缩放定律)的力量。
六、大语言模型(LLM):核心概念与主流模型盘点
4.1 什么是大语言模型
**LLM(Large Language Model,大语言模型)**是一种基于海量文本数据训练、能理解和生成人类语言的人工智能模型 [1]。
这个定义中的三个关键词:
- 海量文本数据:训练数据量以 TB 为单位。GPT-4 的训练数据包括了互联网上的网页、书籍、学术论文、代码仓库、维基百科等几乎所有公开可获取的文本。这意味着模型"读过"的内容远超任何人类一生能读完的量。
- 理解和生成:LLM 不只是"预测下一个词"的文字接龙机器。在足够大的规模下,模型涌现出了真正的理解能力——它能理解上下文、理解隐含含义、理解逻辑关系。同时,它能生成流畅、连贯、有逻辑的长文本。
- 人类语言:LLM 主要处理的是自然语言,但它的能力已经扩展到代码(编程语言本质上也是一种"语言")、数学公式、结构化数据等。

4.2 LLM 的核心能力
LLM 的能力可以概括为以下几个方面:
文本生成:这是 LLM 最基础的能力。给定一段提示词,模型生成连贯的续写文本。这包括文章写作、代码生成、诗歌创作、对话回复等。
上下文理解:LLM 能理解对话的上下文——包括之前说过的话、隐含的意图、语气和情感。在上下文窗口(Context Window)内,模型能保持对对话历史的完整记忆。
推理能力:足够大的 LLM 展现出了逻辑推理能力。它能分析问题、拆解步骤、推理出结论。Chain-of-Thought(链式思考)提示技术就是专门用来激发模型推理能力的。
多语言能力:LLM 的训练数据通常包含多种语言,因此它能理解和生成多种语言的文本。像 Qwen、DeepSeek、GLM 等国产模型在中英文双语能力上尤其出色。
指令遵循:经过指令微调(Instruction Tuning)的 LLM 能准确理解并执行用户的指令——“用表格列出”、“翻译成英文”、“用通俗的语言解释”——模型会根据指令调整输出格式和风格。
4.3 主流大语言模型一览(2026 年 6 月)
以下是最新主流大语言模型的盘点,按开发商和发布时间排列 [2][3][4]:
一、国际顶级模型
| GPT-5.5 | OpenAI(美国) | 多模态,原生音视频处理,超强推理,Agent原生支持,编程能力质变 | 1M | 推理能力最强,工具调用最稳定,综合能力领先,Terminal-Bench 82.7% |
| GPT-5.1 | OpenAI(美国) | 多模态,实时音视频交互,自适应推理模式 | 400K | 性价比高,图像理解能力强,生态成熟 |
| Claude Opus 4.6 | Anthropic(美国) | 1M上下文(已GA),自适应推理,128K输出,Context Compaction | 1M | 超长文档处理、编程最强、安全对齐标杆 |
| Claude Sonnet 4.6 | Anthropic(美国) | 1M上下文(已GA),平衡性能与成本,编程能力强 | 1M | 日常使用的性价比之选,长文档处理 |
| Claude Sonnet 4.5 | Anthropic(美国) | 平衡性能与成本,编程能力强,智能体长时运行 | 200K | 日常使用的性价比之选(已下线) |
| Gemini 2.5 Pro | Google(美国) | 多模态,深度融合搜索,Deep Think深度推理 | 1M(计划扩展至2M) | 上下文窗口最大之一,MMLU-Pro领先,搜索集成 |
| Gemini 2.5 Flash | Google(美国) | 多模态,超低延迟,高吞吐 | 1M | 性价比高,快速响应,适合大规模应用 |
二、中国国产模型
| DeepSeek V4 | DeepSeek(中国) | 推理与编程能力极强,成本极低,1.6T参数MoE | 1M | SWE-bench领先,复杂逻辑推理,开源MIT协议 |
| DeepSeek V3.2 | DeepSeek(中国) | 671B参数,37B激活,DSA稀疏注意力 | 128K | 性价比之王,开源MIT协议 |
| DeepSeek-R1 | DeepSeek(中国) | 推理能力极强,成本极低 | 128K | 推理性价比之王,开源 |
| Qwen 3.5 (235B) | 阿里(中国) | 全栈AI能力,阿里云生态,原生多模态 | 最高1M(Plus/Flash 256K) | 中文能力最强,电商/企业场景,支持1M长上下文 |
| Qwen 3 | 阿里(中国) | 开源,MoE架构,8款模型从0.6B到235B | 262K(可扩展至1M via YaRN) | 开源社区活跃,可私有化部署,多规格选择 |
| GLM-5.2 | 智谱AI(中国) | 百万上下文,编程Agent,MIT协议开源 | 1M | 百万上下文开源旗舰,编程能力强,可商用 |
| GLM-5.1 | 智谱AI(中国) | 上下文理解,多任务处理 | 200K | 中文理解,本土化适配 |
| Kimi K2.6 | 月之暗面(中国) | 超长上下文,联网搜索,Thinking模式 | 256K | 长文理解,联网搜索,性价比高 |
| Kimi K2.7 Code | 月之暗面(中国) | 编程专用,MoE架构,MIT协议开源 | 256K | 编程能力强,开源可商用 |
| 豆包(Doubao-Seed-2.0) | 字节跳动(中国) | 与抖音生态深度集成,消费级应用 | 128K | 消费级应用,亿级用户,多模态 |
| 混元 | 腾讯(中国) | 微信/腾讯云生态,企业级安全 | 128K | 企业级安全,社交场景,腾讯生态集成 |
三、开源模型
| Llama 4 Scout | Meta(美国) | 开源,多模态,MoE架构,17B激活/109B总参数 | 10M | 全球最大上下文窗口,开源社区,可私有化部署 |
| Llama 4 Maverick | Meta(美国) | 开源,多模态,MoE架构,17B激活/400B总参数 | 1M | 高质量开源,可私有化部署,企业级 |
五、许可证速查
| MIT协议 | ✅ 完全可商用 | DeepSeek V4, GLM-5.2, Kimi K2.7 Code |
| Apache 2.0 | ✅ 完全可商用 | Llama 4系列 |
| 商业授权 | ❌ 需付费 | GPT系列, Claude系列, Gemini系列 |
| 限制性开源 | ⚠️ 需审批 | 部分国产模型 |
六、上下文窗口排行榜
| 1 | Llama 4 Scout | 10M |
| 2 | Gemini 2.5 Pro(计划) | 2M |
| 3 | GPT-5.5 / Claude Opus 4.6 / Sonnet 4.6 / DeepSeek V4 / GLM-5.2 | 1M |
| 4 | Gemini 2.5 Pro / Flash / Qwen 3.5旗舰版 / Llama 4 Maverick | 1M |
| 5 | GPT-5.1 / Qwen 3 | 400K / 262K |
| 6 | Claude Sonnet 4.5 / GLM-5.1 | 200K |
| 7 | Kimi K2.6 / K2.7 | 256K |
| 8 | DeepSeek V3.2 / R1 / 豆包 / 混元 | 128K |
数据来源:各模型官方文档、技术报告、API规格说明(2026年6月) 选择模型的核心考量因素:
- 任务类型:编程任务 Claude 系列表现优秀;推理任务 GPT-5.1 和 DeepSeek-R1 都很强;中文任务 Qwen 和 GLM 有天然优势
- 成本预算:DeepSeek 系列的 API 价格极低(输入 $0.14/百万 Token,输出 $0.28/百万 Token),是预算有限时的首选;GPT-5.1 和 Claude Opus 4.6 价格最高但能力最强
- 上下文长度:需要处理超长文档(如 20 万字的合同、代码库)时,Claude 和 Gemini 的超长上下文窗口是刚需
- 数据隐私:需要私有化部署时,Llama 4、Qwen、DeepSeek 等开源模型是唯一选择
七、Prompt(提示词):结构、类型与工程化方法
5.1 什么是 Prompt
**Prompt(提示词)**是用户或系统提供给大语言模型的指令或文本,用于引导模型生成特定输出。它是人与 LLM 交互的"接口"——Prompt 的质量直接决定了输出结果的质量。
可以把 Prompt 理解为"给 AI 下达的任务说明书"。一份好的说明书,应该包含:任务是什么、背景信息、输出格式、风格要求、约束条件。写得越清楚,AI 完成得越好。
那么关于提示词的解析,我之前也有一篇文章有进行解析,大家可以去看看。
5.2 系统提示词 vs 用户提示词
Prompt 分为两个层次,它们的角色和生命周期完全不同:
| 定义 | 由终端用户直接输入,触发单次任务 | 由开发者预设,嵌入系统后端 |
| 核心功能 | 传达即时需求(提问、指令) | 定义模型角色、行为规范、知识边界 |
| 生命周期 | 单次对话 | 持续影响所有交互 |
| 类比 | 操作指令 | 操作系统 |
| 示例 | 用户输入:“查询订单 #12345” | 预设:“你是一名客服,用友好语气解答问题,不知道就说不知道” |
系统提示词如同"操作系统",它定义了 AI 的底层行为规则——它是什么角色、它应该用什么语气、它知道什么不知道什么、它不能做什么。用户提示词如同"操作指令",它驱动单次任务——“翻译这段文字”、“帮我写一篇文章”、“分析这个数据”。
系统提示词的典型内容:
你是一个专业的技术支持助手,为公司的 SaaS 产品提供技术支持。
行为准则:
– 回答简洁准确,先说结论再展开细节
– 当不确定时,明确说明"我不确定",绝不编造信息
– 优先引导用户查看官方文档中的相关章节
– 处理敏感信息(如账号、密码)时,主动提醒用户注意安全
– 对于需要操作数据库或服务器的请求,必须确认用户有相应权限
知识边界:
– 你了解产品的所有公开功能
– 你不了解未公开的内部 API
– 你无法访问用户的真实数据
5.3 提示词的基本结构:CO-STAR 框架
设计提示词时,可以遵循 CO-STAR 结构化框架,它确保提示词覆盖了所有关键维度 [5]:

| C | Context(背景) | 提供足够的背景信息,帮助 AI 理解任务的上下文和环境 | “平台:微信公众号,读者 20-35 岁,晚上 9 点发布” |
| O | Objective(目标) | 明确说明希望 AI 完成的具体目标或任务 | “写一篇约 300 字的美食短文” |
| S | Style(风格) | 指定 AI 生成内容的风格 | “市井烟火气,轻快爽利,口语化” |
| T | Tone(语气) | 确定 AI 生成内容的语调 | “热情馋人,像朋友深夜发美食照片” |
| A | Audience(受众) | 描述目标受众的特征 | “20-35 岁城市白领,晚上 9 点有点饿” |
| R | Response(响应格式) | 指定 AI 回应的格式和具体要求 | “标题不超过 15 字,正文分 3 段,每段空一行” |
CO-STAR 框架的实战例子:
【角色】
你是一名资深美食专栏作家,擅长用文字"让读者流口水"。
【背景】
– 平台:微信公众号,读者 20-35 岁,晚上 9 点,有点饿
– 对象:西安肉夹馍(腊汁肉夹白吉馍)
– 卖点:馍酥脆、肉软烂、肥不腻、瘦不柴
【任务】
写一篇约 300 字的美食短文,要求:
1. 开头用一句话抓住注意力
2. 分别描写"馍"和"肉",各用至少 1 个比喻
3. 结尾让读者产生"现在就想吃"的冲动
4. 自然融入"酥、脆、软、烂、香"5 个关键词
【输出格式】
– 标题:不超过 15 字
– 正文:分 3 段(开头 / 描写 / 结尾),每段空一行
【补充约束】
– 语气:热情馋人,像朋友深夜发美食照片;用"你"制造对话感,加拟声词(咔嚓、滋啦、嗯~)
– 风格:市井烟火气,轻快爽利;句子偏短,口语化(贼香、一口下去、没谁了)
– 不写制作过程,不写店铺地址
– 禁用"垂涎欲滴""回味无穷""唇齿留香"等陈词滥调
– 每段至少一个短句(不超过 10 字)
这个例子展示了 CO-STAR 框架的完整应用:角色定位(美食专栏作家)、背景信息(平台、读者、对象)、任务目标(300 字美食短文)、输出格式(标题 + 3 段正文)、风格约束(热情、口语化、禁用陈词滥调)。每个维度都为 AI 的生成提供了明确的指引,减少了模糊和不确定性。
5.4 什么是提示词工程(Prompt Engineering)
**Prompt Engineering(提示词工程)**是指通过设计和优化输入给大语言模型的提示词,来引导模型生成更准确、更稳定、更符合预期结果的一种工程方法。
它不是"写一句好话"这么简单,而是一套系统的方法论,包括:
- 任务分析:理解 AI 需要完成什么任务,确定关键约束条件和成功标准
- 结构设计:选择合适的提示词框架(如 CO-STAR),组织信息层次
- 迭代优化:根据输出结果不断调整提示词,逐步逼近最佳效果
- 测试验证:用不同的输入测试提示词的稳定性,确保在各种情况下都能得到预期结果
- 版本管理:将提示词作为"代码"来管理,记录修改历史,进行 A/B 测试
一个真实的 Prompt Engineering 工作流程:
第 1 版:简单指令
"帮我写一篇关于人工智能的文章"
→ AI 输出:一篇泛泛而谈的 AI 科普文,没有针对性
第 2 版:添加角色和约束
"你是一名技术博主,写一篇 2000 字关于人工智能的技术文章,面向有编程基础的读者"
→ AI 输出:有深度了,但结构松散,没有重点
第 3 版:使用 CO-STAR 框架
"【角色】技术博主 【背景】面向有 2 年编程经验的开发者 【任务】写一篇 2000 字文章,聚焦 AI 在代码生成领域的应用 【输出格式】包含 3 个实战案例,每个案例有代码示例"
→ AI 输出:结构清晰,有针对性,但案例不够深入
第 4 版:添加示例和约束
"【角色】技术博主… 【示例】案例应该包含:问题描述、AI 如何解决、代码对比(手动写 vs AI 生成)、效果对比 【约束】不要泛泛而谈,每个案例必须具体到工具名称和实际使用场景"
→ AI 输出:达到了预期效果
八、提示词设计技巧:从基础到进阶
6.1 基础技巧
技巧一:角色提示(Role Prompting)
通过设定身份来约束模型的语气、专业深度和思维方式。角色提示是 Prompt Engineering 中最基础也最有效的技巧之一。
你是一位资深的 Python 架构师,拥有 15 年后端开发经验。请用专业但易懂的语言回答以下问题。
你是一位善解人意的心理咨询师,擅长倾听和引导。请用温和、不评判的语气回应以下倾诉。
角色的设定会显著影响 AI 的输出风格和内容质量。一个"Python 架构师"会给出更专业、更深入、更结构化的回答;一个"心理咨询师"会给出更温和、更开放、更有同理心的回应。
技巧二:结构化指令引导
通过特定分隔符、列表和 Markdown 格式来清晰地界定指令的不同部分,防止模型混淆。
常用的分隔符:
- """ 或 ''' — 包裹长文本(如"翻译以下内容:“”“…”“”)
- 【】 或 [] — 标注不同部分(如"【背景】… 【任务】… 【约束】…")
- XML 标签 — 精确标注不同内容块(如 <context>…</context><task>…</task>)
- Markdown 标题 — 用 #、## 组织层次结构
【背景】
以下是一段技术文档的摘录。
【任务】
将这段文档翻译成中文,保持技术术语的准确性。
【约束】
– 不要添加原文中没有的信息
– 技术术语保留英文并在括号中标中文
– 保持原文的段落结构
【原文】
"""
The Transformer architecture uses self-attention mechanisms to process
all tokens in parallel, eliminating the sequential bottleneck of RNNs.
"""
技巧三:少样本提示(Few-Shot Prompting)
提供 1-3 个正确的输入输出示例,让模型快速学习格式和规则。模型在看到示例后,会自动"理解"你期望的模式。
将以下产品名称转换为对应的英文缩写。格式:产品名称 → 缩写
机器学习 → ML
人工智能 → AI
自然语言处理 → NLP
深度学习 →
模型在看到前三个示例后,会理解"提取首字母大写"的规则,输出"DL"。
少样本提示的关键在于:示例的质量比数量重要。一个好的示例胜过三个普通示例——它应该精确地展示你期望的格式、风格和内容深度。
6.2 进阶推理技巧
技巧四:链式思考(Chain-of-Thought,CoT)
让模型分步推理,先思考再输出答案,大幅提升复杂问题的准确率。CoT 的核心思想是:不直接要答案,而是要求展示推理过程 [6]。
请一步步推理以下问题,展示你的完整思考过程,最后得出结论:
一件衣服原价是 200 元,先打 8 折,再减去满 100 减 20 的优惠券,
最后还要加上 5% 的税费。小李用这张优惠券买这件衣服,实际支付多少钱?
让我们一步步思考:
模型会这样推理:
步骤 1:计算打折后的价格
200 × 0.8 = 160 元
步骤 2:检查是否满足优惠券条件
160 元 ≥ 100 元,满足满 100 减 20 的条件
160 – 20 = 140 元
步骤 3:计算税费
140 × 1.05 = 147 元
结论:小李实际支付 147 元。
如果没有 CoT 提示,模型可能直接输出一个错误的答案(比如漏掉税费或优惠券条件判断错误)。CoT 让模型"慢下来",把推理过程外显化,每个步骤都可以被验证,从而大幅提高准确率。
CoT 适用场景:
- 数学计算题
- 多步骤逻辑推理
- 代码调试(“请逐步分析这段代码的执行流程”)
- 决策分析(“请分析这个方案的优缺点,然后给出建议”)
CoT 不适用场景:
- 简单的知识问答(“法国的首都是哪里?”——不需要推理)
- 创意写作(“写一首诗”——不需要分步推理)
- 格式转换(“把这段文字翻译成英文”——不需要推理)
技巧五:自我一致性(Self-Consistency)
传统 CoT 只走一条推理路径;自我一致性则探索多条路径,最终聚合为一致答案。它不再依赖"一次思考定生死",而是通过"多次尝试 + 投票机制"来提高准确率 [7]。
请从不同角度独立思考以下问题三次,每次采用不同的表达方式或拆解顺序,
展示完整推理过程。然后比较三个答案,选择最合理且一致的结果作为最终输出。
问题:
小明有 60 张游戏卡牌,他每天卖出 5 张。第 3 天结束后,他休息了 2 天没卖,
之后继续每天卖 5 张。问他一共用了多少天才卖完?
要求:
1. 每次推理必须独立,不能复制前面的内容
2. 最终输出格式为:
→ 第一次推理:…
→ 第二次推理:…
→ 第三次推理:…
→ 综合判断与最终答案:…
模型会进行三次独立推理:
→ 第一次推理(按天数计算):
前 3 天卖出 15 张,剩余 45 张
第 4-5 天休息,未卖出
第 6 天起继续卖,每天 5 张
45 ÷ 5 = 9 天
经历天数:3(卖)+ 2(休)+ 9(卖)= 14 天
→ 第二次推理(按卖出的天数计算):
总共需要卖 60 ÷ 5 = 12 天
前 3 天卖出,中间休息 2 天,剩余 9 天卖出
实际经历:3 + 2 + 9 = 14 天
→ 第三次推理(按日期排列):
第 1 天:卖 5,剩 55
第 2 天:卖 5,剩 50
第 3 天:卖 5,剩 45
第 4 天:休息
第 5 天:休息
第 6 天:卖 5,剩 40
…
第 14 天:卖 5,剩 0
总共 14 天
→ 综合判断与最终答案:14 天(三次推理结果一致)
自我一致性的核心价值在于:降低单次推理的随机误差。LLM 的推理过程有一定随机性——同一个问题问两次,可能得到不同的推理路径。自我一致性通过多次独立推理然后投票,降低了这种随机性带来的错误风险。
6.3 优化与迭代策略
技巧六:由浅入深(Iterative Refinement)
不要指望一次写出完美的 Prompt。先从简单的指令开始,观察输出,再根据不足逐步添加约束条件和背景。这是一个"测试 → 调整 → 再测试"的循环过程。
迭代 1(基础指令):
"帮我写一个 Python 函数,实现快速排序"
→ 问题:输出缺少注释,没有类型提示,没有测试用例
迭代 2(添加约束):
"帮我写一个 Python 函数实现快速排序,请包含:
– 类型提示(Type Hints)
– 详细的 docstring
– 关键步骤的注释"
→ 问题:输出格式不够规范,缺少边界条件处理
迭代 3(添加格式要求):
"帮我写一个 Python 函数实现快速排序,请包含:
– 类型提示(Type Hints)
– Google 风格的 docstring
– 关键步骤的注释
– 处理空数组、单元素数组、大量重复元素的边界情况
– 在 docstring 中包含 3 个测试用例的示例
– 使用 TypeVar 实现泛型版本"
→ 输出达到了预期质量
迭代的关键原则:
- 每次只改一个维度,观察效果后再改下一个
- 如果某个修改没有改善输出,回退到上一个版本
- 把 Prompt 当作代码来管理——用 Git 记录每次修改
- 测试 Prompt 的稳定性——用 5 个不同的输入测试,确保输出质量一致
九、生成参数详解:Temperature、Top-P、Top-K 与采样策略
9.1 为什么需要了解生成参数
很多人使用大语言模型时,只关注 Prompt 怎么写,却忽略了生成参数对输出质量的巨大影响。同样的 Prompt,不同的参数配置,可能产生截然不同的结果——一个严谨准确,一个天马行空。
生成参数控制的是模型"如何选择下一个词"。理解这些参数,能让你在"创造力"和"准确性"之间精准拿捏。比如写诗时需要高温度(大胆想象),写代码时需要低温度(严谨准确)。[19]
9.2 Temperature(温度):控制"创造力"的旋钮
Temperature 是最常用的生成参数,它控制模型输出的"随机性"和"创造性"。
在模型生成每个词时,它实际上是在计算"下一个词的概率分布"——比如在"我今天吃了"之后,模型会计算出"饭"的概率是 0.4,"面"是 0.3,“苹果"是 0.1……Temperature 的作用就是调整这个概率分布的"陡峭度”:
- Temperature = 0:模型总是选择概率最高的词(贪婪策略)。输出完全确定,同样的输入永远得到同样的输出。适合需要精确、一致结果的场景
- Temperature < 0.5:概率分布变得更陡峭,高概率词的概率更高,低概率词的概率更低。输出比较保守、稳定、可预测。适合代码生成、事实性问答、翻译
- Temperature = 1.0:保持原始概率分布,不做任何调整。这是大多数模型的默认值
- Temperature > 1.0:概率分布变得更平坦,低概率词的概率被提高,高概率词的概率被降低。输出更多样、更有创意、但也更容易跑偏。适合创意写作、头脑风暴、诗歌生成
直观理解:把 Temperature 想象成"酒精度"——0 度时人完全清醒,说话严谨准确;1 度时微醺,说话更有趣但也有点飘;2 度时醉了,可能说出天马行空的话,但也可能前言不搭后语。
Temperature 的实战建议:
| 0 ~ 0.2 | 代码生成、数学计算、事实提取 | 输出精确、稳定、可复现 |
| 0.3 ~ 0.5 | 技术文档、翻译、数据分析 | 输出准确、偶尔有合理的变化 |
| 0.6 ~ 0.8 | 通用对话、内容写作、邮件 | 平衡准确性和流畅性 |
| 0.9 ~ 1.2 | 创意写作、广告文案、头脑风暴 | 输出多样、有创意、但可能不够严谨 |
| 1.3 ~ 1.5 | 诗歌、故事、艺术创作 | 输出极富想象力,但可能偏离主题 |
9.3 Top-P(核采样):动态截断概率尾部
Top-P(也叫 Nucleus Sampling,核采样)是另一种控制输出多样性的方法。它的核心思想是:只从累积概率达到 P 的最小词集合中采样,砍掉概率太低的"长尾"词。
举个例子:模型计算出下一个词的概率分布是:
- “饭”:40%
- “面”:25%
- “苹果”:15%
- “火锅”:8%
- “零食”:5%
- “药”:3%
- “石头”:2%
- “电脑”:1%
- “宇宙”:0.5%
- “量子”:0.5%
如果 Top-P = 0.9,模型会从累积概率达到 90% 的词中采样——也就是"饭"(40%)+ “面”(25%)+ “苹果”(15%)+ “火锅”(8%)= 88%,再加"零食"(5%)= 93%。所以候选词集是"饭、面、苹果、火锅、零食"这 5 个词。剩下的"药、石头、电脑、宇宙、量子"被直接排除——它们的概率太低,不太可能是有意义的选择。
Top-P 与 Temperature 的区别:
- Temperature 是"缩放"概率分布(改变所有词的概率比例)
- Top-P 是"截断"概率分布(直接排除概率太低的词)
- 两者可以同时使用——先用 Temperature 调整分布,再用 Top-P 截断尾部
Top-P 的实战建议 [19]:
| 0.1 ~ 0.5 | 极度保守,只选最可能的词 | 需要严格准确性的场景 |
| 0.7 ~ 0.9 | 平衡准确性和多样性(推荐默认值) | 通用对话、内容写作 |
| 0.9 ~ 0.95 | 允许更多样的选择 | 创意写作、头脑风暴 |
| 1.0 | 不做任何截断(等同于禁用 Top-P) | 需要最大多样性的场景 |
9.4 Top-K:固定候选词数量
Top-K 是最简单粗暴的截断策略:只从概率最高的 K 个词中采样,其余全部排除。
- Top-K = 1:等价于 Temperature = 0(贪婪策略),只选概率最高的那个词
- Top-K = 40:只从概率最高的 40 个词中选(多数模型的默认值)
- Top-K = 0:禁用 Top-K(不限制候选词数量)
Top-K 的问题:它不够灵活。如果概率分布很集中(比如概率最高的 3 个词就占了 95%),Top-K=40 会把很多概率极低的词也纳入候选——这些词几乎不可能是好的选择,但它们的加入会引入噪声。如果概率分布很分散(比如 100 个词平分概率),Top-K=40 又可能排除掉一些合理的候选词。
这就是为什么 Top-P 通常比 Top-K 更受欢迎——Top-P 会根据实际概率分布动态调整候选词数量,而不是机械地固定为 K 个。
9.5 其他重要参数
Repetition Penalty(重复惩罚):降低已经被生成过的词的概率,防止模型陷入重复循环。值通常在 1.0-1.3 之间。1.0 表示不惩罚,1.2 表示适度惩罚(降低已出现词 20% 的概率)。值太高会导致模型刻意回避已出现的词,输出不自然。
Frequency Penalty(频率惩罚):根据词在已生成文本中出现的次数来惩罚——出现次数越多,惩罚越重。这与 Repetition Penalty 不同:Repetition Penalty 是"出现过就惩罚",Frequency Penalty 是"出现越多惩罚越重"。
Presence Penalty(存在惩罚):类似 Frequency Penalty,但惩罚力度与出现次数无关——只要出现过就惩罚,不管出现几次。这鼓励模型引入新话题和词汇。
Min-P:2024 年提出的新参数,作为 Top-P 的补充。它设置一个"最小概率门槛"——只有概率超过最大概率 × Min-P 的词才能被采样。比如 Min-P = 0.1,如果最大概率是 0.4,那么只有概率 ≥ 0.04 的词才能被采样。这有效地排除了"虽然属于 Top-P 集合但概率极低"的词。
9.6 参数组合实战指南
场景一:写代码
Temperature: 0.1
Top-P: 0.9
Repetition Penalty: 1.0(不惩罚)
→ 代码需要精确,一点都不能错。低温度确保每次输出都是最"正确"的选择。
场景二:通用对话
Temperature: 0.7
Top-P: 0.9
Repetition Penalty: 1.05
→ 平衡准确性和流畅性,轻微防止重复。
场景三:创意写作
Temperature: 1.0
Top-P: 0.95
Repetition Penalty: 1.1
Frequency Penalty: 0.1
→ 高温度 + 高 Top-P 让输出充满想象力,适度的惩罚防止用词单调。
场景四:事实性问答
Temperature: 0.0
Top-P: 1.0(禁用)
Repetition Penalty: 1.0
→ 零温度 + 无截断,选择最可能的词,确保输出稳定可复现。
场景五:头脑风暴
Temperature: 1.2
Top-P: 0.95
Frequency Penalty: 0.3
Presence Penalty: 0.2
→ 高温度 + 宽松截断 + 强惩罚,鼓励模型不断引入新话题和词汇。
十、Token(词元):计费单位、上下文窗口与模型理解能力的基石
10.1 什么是 Token
Token(词元)是大语言模型处理文本时的最小语义单位。它不是字,也不是单词,而是将文本拆解为模型可理解的离散单元 [8]。
Token 通过分词器(Tokenizer)将文本拆分而来。不同模型的分词器不同,同一个词在不同模型中可能被拆分成不同的 Token。比如:
| “人工智能” | 2 个 Token(“人工” + “智能”) | 1 个 Token(“人工智能”) |
| “unbelievable” | 3 个 Token(“un” + “believe” + “able”) | 2 个 Token(“unbelieve” + “able”) |
| “Hello World” | 2 个 Token(“Hello” + " World") | 2 个 Token(“Hello” + " World") |
Token 的计算规则(以英文为例,粗略估计):
- 1 个英文单词 ≈ 1-1.5 个 Token
- 1 个中文字 ≈ 1.5-2 个 Token(中文的 Token 效率比英文低)
- 1 个标点符号 ≈ 1 个 Token
- 代码的 Token 效率通常比自然语言高(因为代码中的关键词和符号更短)
10.2 Token 的三大作用
作用一:计费单位
几乎所有商用大模型都按 Token 收费——输入 Token + 输出 Token,每百万 Token 一个价格。不同模型的价格差异巨大:
| GPT-5.1 | $2.50 | $10.00 |
| GPT-4o | $2.50 | $10.00 |
| Claude Opus 4.6 | $15.00 | $75.00 |
| Claude Sonnet 4.5 | $3.00 | $15.00 |
| DeepSeek-V3 | $0.14(约 ¥1) | $0.28(约 ¥2) |
| DeepSeek-R1 | $0.55 | $2.19 |
| Qwen 3.5 | $0.50 | $2.00 |
这就是为什么 DeepSeek 引发了"价格屠夫"的讨论——它的 API 价格比 GPT-4o 低 18 倍,比 Claude Opus 低 100 倍以上。对于日均 Token 消耗量大的场景(如客服系统、内容生成平台),模型选择直接决定了运营成本。
Token 消耗的隐性成本:很多人只关注输出 Token 的费用,忽略了输入 Token。实际上,每次对话都需要把整个对话历史 + 系统提示词作为输入发送给模型。如果对话已经进行了 20 轮,每轮的输入都包含前面所有的对话内容,输入 Token 的数量会随着对话轮次线性增长,最终可能远超输出 Token。
作用二:上下文长度限制
模型有最大上下文窗口(如 8K、32K、128K、256K、1M Token),超过上限模型就无法处理,会截断或报错。
上下文窗口大小决定了模型一次能"看到"多少内容。不同场景对上下文窗口的需求:
| 简单问答 | 1K-4K |
| 文章生成 | 4K-16K |
| 代码审查(单个文件) | 8K-32K |
| 长文档分析(合同、论文) | 32K-128K |
| 代码库级别分析 | 128K-256K |
| 整本书级别的分析 | 256K-1M |
作用三:决定模型理解能力
Token 切分越合理,模型越能理解语义。分词器的质量直接影响模型的语言理解能力——如果分词器把一个完整的语义单元(如"人工智能")拆成了两个无关的片段(“人”+“工”+“智”+“能”),模型就需要花费额外的"注意力"来理解这些片段之间的关系。
10.3 Token 的两种分类
输入 Token(Prompt Token / Input Token):发给模型的内容,包括:
- 用户的问题
- 历史对话记录(之前的问答)
- 上传的文档、图片、代码
- 系统提示词
输出 Token(Completion Token / Output Token):模型生成的回答。
Token 消耗的典型分布:
一次对话的总 Token 消耗 = 输入 Token + 输出 Token
假设一个 20 轮对话:
– 系统提示词:500 Token(每轮都包含)
– 每轮用户输入:约 200 Token
– 每轮 AI 输出:约 500 Token
– 第 20 轮的输入包含:系统提示词 + 前 19 轮的全部内容
第 20 轮的输入 Token ≈ 500 + (200+500) × 20 = 14,500 Token
第 20 轮的输出 Token ≈ 500 Token
第 20 轮总消耗 = 15,000 Token
整个对话的总 Token 消耗 ≈ 150,000 Token(实际可能更多)
这就是为什么长对话的 API 费用比预期高——每次对话都在"重复发送"之前的内容。
十一、会话记忆(Chat Memory):让对话保持连贯的核心机制
11.1 什么是会话记忆
在对话系统中,会话记忆(Chat Memory)指的是模型对历史对话内容的存储与利用机制。它让 AI 能够"记住"之前说过什么,从而在后续对话中做出连贯的回应 [9]。
会话记忆包括:
- 用户之前说过的话:你的偏好、你的需求、你提到过的人名地名
- 模型之前的回答:AI 说过什么、给出了什么建议
- 当前对话的上下文状态:对话进行到哪一步了、当前在讨论什么话题
没有会话记忆的对话:
用户:我在做一个 Spring AI 项目
AI:好的,Spring AI 是一个不错的框架
用户:怎么接入大模型?
AI:请问您使用的是什么框架?需要我帮您推荐吗?
有会话记忆的对话:
用户:我在做一个 Spring AI 项目
AI:好的,Spring AI 是一个不错的框架
用户:怎么接入大模型?
AI:在 Spring AI 中接入大模型,你需要在 pom.xml 中添加 spring-ai-openai-spring-boot-starter 依赖,
然后在 application.yml 中配置 API Key…(基于之前的上下文,AI 知道你在用 Spring AI)
第二句虽然没提"Spring AI",但 AI 能理解你是在延续上文——这就是会话记忆在起作用。
11.2 会话记忆的作用
上下文连贯:能理解"它"、“这个”、“那个"等指代,让对话流畅不脱节。没有会话记忆,每次对话都像"第一次见面”,所有指代都会丢失。
减少重复输入:无需每次重复背景信息,交互更高效。没有会话记忆,每次开始新的话题都需要重新说一遍"我在做一个 Java 项目,用 Spring Boot 框架,数据库是 MySQL…"
个性化体验:记住用户偏好、历史偏好,提供定制回复。比如记住"你上次说喜欢用 Python",下次推荐代码时优先给 Python 版本。
多轮任务完成:逐步收集信息,支持复杂任务。比如"帮我写一个用户注册接口"→"加上邮箱验证"→"再加一个手机号验证"→"最后加上密码强度检查",每一步都在前一步的基础上迭代。
11.3 会话记忆的实现方式
LLM 的会话记忆不是"独立的记忆系统",而是通过将历史对话内容作为上下文的一部分发送给模型来实现的。每次对话时,模型会收到:
系统提示词
+
历史对话记录(用户问题 1 + AI 回答 1 + 用户问题 2 + AI 回答 2 + …)
+
当前用户问题
模型的"记忆"本质上就是这些历史对话文本。模型看到的不是"记忆数据库",而是"对话历史文本"。这就是为什么会话记忆受上下文窗口限制——超过窗口上限的历史对话会被截断或遗忘。
十二、上下文窗口(Context Window):从"背包容量"理解模型记忆边界
12.1 上下文窗口的概念
**上下文窗口(Context Window)**是大语言模型一次最多能处理的输入 Token 数量 [10]。
这个限制是硬性的——不是"建议不要超过",而是"超过就无法处理"。如果把 LLM 比作一个人,上下文窗口就是它的"工作记忆容量"——一次只能记住这么多内容,超过的部分会丢失。
12.2 上下文窗口与会话记忆的关系
这两个概念经常被混淆,但它们的关系可以用一个直观的比喻来理解:
上下文窗口 = 背包容量
当前输入 + 会话记忆 + 系统提示词 = 你要装进去的东西
如果东西太多(超过背包容量),就不能全部装进去。你只能选择:
- 丢掉一些东西(截断历史对话)
- 压缩东西(用摘要代替完整对话)
- 换一个更大的背包(使用上下文窗口更大的模型)
实际情况:
假设上下文窗口 = 128K Token
系统提示词:2K Token
用户当前输入:1K Token
剩余可用空间:128K – 2K – 1K = 125K Token
这些 125K Token 可以装:
– 约 25 万英文字符(1 Token ≈ 4 英文字符)
– 约 62,500 个中文字(1 Token ≈ 2 个中文字符)
– 约 200 页 A4 文档
– 或约 150 轮之前的对话历史
当对话历史超过 150 轮时,最早的对话会被"遗忘"。
12.3 上下文窗口的演进
上下文窗口的大小在过去两年中经历了爆炸式增长:
| 2022 年 | GPT-3.5 | 4K Token |
| 2023 年 | GPT-4 | 8K-32K Token |
| 2023 年 | Claude 2 | 100K Token |
| 2024 年 | GPT-4 Turbo | 128K Token |
| 2024 年 | Claude 3 | 200K Token |
| 2024 年 | Gemini 1.5 Pro | 1M Token |
| 2025 年 | Claude Opus 4 | 262K Token |
| 2025 年 | Gemini 2.5 Pro | 1M Token |
| 2026 年 | GPT-5.1 | 256K Token |
| 2026 年 | Claude Opus 4.6 | 1M Token(Beta) |
| 2026 年 | Gemini 3.1 Pro | 1M Token |
1M Token 意味着什么?它可以一次性处理:
- 约 150 万英文字符
- 约 50 万个中文字
- 一整部《三体》三部曲
- 或一个中等规模代码库的全部源代码
12.4 上下文窗口的"天花板效应"
上下文窗口越大越好吗?不完全是。有两个实际问题需要考虑:
注意力稀释:当上下文窗口非常大时,模型对中间和后半部分内容的"注意力"会下降。研究表明,LLM 对上下文开头和结尾的内容关注度最高,对中间部分关注度较低。这被称为"Lost in the Middle"(迷失在中间)现象。
成本暴增:每次对话都要把整个上下文窗口的内容发送给模型。即使你的问题只有 100 个 Token,如果上下文窗口中有 100K 的文档,你仍然需要为这 100K 的输入 Token 付费。大上下文窗口的"隐形成本"是 API 费用的显著增加。
实用建议:不要因为模型支持 1M Token 就把整本书丢进去。更高效的做法是:先用 RAG 检索出相关片段,再把片段放入上下文窗口。这样既保证了准确性,又控制了成本。
十三、多模态(Multimodal):文本、图像、音频、视频的融合智能
13.1 什么是多模态
**多模态(Multimodal)**是指融合文本、图像、音频、视频等多种类型信息,让模型能理解、生成不同模态数据的技术 [11][12]。
单模态 vs 多模态:
- 单模态模型只能处理一种数据类型。比如纯文本模型只能理解和生成文字,你给它一张图片它完全不知道该怎么处理
- 多模态模型能同时处理多种数据类型。比如 GPT-4o 能理解图片中的文字和物体,能识别语音中的情绪,还能生成图片
从单模态到多模态的转变,本质上是让 AI 的感知能力从"只能读文字"扩展到"像人一样综合感知"——人不会只用眼睛看,也不会只用耳朵听,而是多种感官协同工作,形成对世界的完整理解。
13.2 常见的模态类型
| 文本(Text) | 理解自然语言 | 生成自然语言 | 问答、翻译、写作 |
| 图像(Image) | 识别物体、场景、文字 | 生成图片、编辑图片 | 文生图、图生文、图片编辑 |
| 音频(Audio) | 语音识别、音乐理解 | 语音合成、音乐生成 | 语音助手、音乐创作 |
| 视频(Video) | 场景理解、行为识别 | 视频生成、视频编辑 | Sora、可灵、即梦 |
13.3 多模态的典型应用场景
智能问答 —— 上传图片 + 提问
场景:医疗影像分析
用户上传一张 X 光片,提问:"这张 X 光片中有异常吗?"
AI 分析图片中的骨骼结构,识别可能的骨折或病变,给出初步判断和建议
文生图 —— 文本描述 → 图片
场景:AI 绘画
用户输入:"一只穿着宇航服的柴犬,站在月球表面,背景是蓝色的地球"
AI 生成对应的图片
代表工具:DALL-E 3、Midjourney、Stable Diffusion、Seedream(字节跳动)
图生文 —— 图片 → 文字描述
场景:商品描述生成
用户上传一张商品图片
AI 自动生成商品标题、描述、卖点
语音助手 —— 语音 → 文本 → LLM → 语音
场景:智能客服
用户:"我要查询我的订单状态"
AI 先做语音识别(ASR):"我要查询我的订单状态"(文字)
→ 交给 LLM 理解意图并查询订单
→ 生成回复文字:"您的订单已发货,预计明天到达"
→ 语音合成(TTS):用户听到 AI 的语音回复
视频理解 —— 视频摘要、行为识别
场景:安防监控
监控摄像头实时分析视频流
AI 识别异常行为(如"有人闯入禁区"),自动告警
视频生成 —— 文字描述 → 视频
场景:创意内容制作
用户输入:"一只猫在月球上弹钢琴,背景是星空"
AI 生成对应的短视频
代表工具:Sora(OpenAI)、可灵(快手)、即梦(字节跳动)
13.4 多模态的技术核心
多模态模型的核心挑战是模态对齐——如何让模型理解"这段文字"和"这张图片"描述的是同一个东西。
技术实现上,有两种主要路径:
路径一:统一编码。将文本、图像、音频等不同模态的数据统一编码到同一个向量空间中。在这个空间中,语义相近的内容(无论是什么模态)向量距离也相近。比如"猫"这个词的文本向量,和一张猫的图片向量,在向量空间中应该非常接近。
路径二:跨模态注意力。使用 Transformer 的注意力机制,让模型在处理一种模态时,能同时"关注"到另一种模态的信息。比如在生成图片描述时,模型的注意力可以在图片的不同区域和已生成的文字之间自由切换。
当前最先进的多模态模型(如 GPT-5.1、Gemini 2.5 Pro)同时使用了这两种技术,实现了原生多模态理解和生成。
十四、RAG(检索增强生成):给 AI 装上"外挂大脑"
14.1 什么是 RAG
**RAG(Retrieval Augmented Generation,检索增强生成)**是一种结合外部知识库检索与大模型生成的技术。核心是让大模型在回答前先"查资料"(检索外部知识库),再基于检索到的权威信息生成答案 [13][14]。

RAG 就像给 AI 装上了"外挂大脑":让它在回答问题时,先从外部知识库中检索相关片段,再将这些片段作为上下文,输入给模型。这样,AI 的回答就基于真实、最新数据,大幅减少"幻觉"(编造答案),同时支持动态知识更新。
14.2 一个直观的类比:开卷考试 vs 闭卷考试
- 传统 LLM:就像闭卷考试——你只能靠死记硬背(训练数据),可能把"秦始皇统一六国"错记成"秦始皇统一七国"
- RAG:就像开卷考试——给你发了一本历史书(RAG 的知识库),你先快速翻书找到"秦朝"章节(检索),再根据书里的内容组织答案(生成),确保答案是真实的
RAG 让 AI 从"背书机器"升级为"会查资料的专家",适合需要高准确性的场景(如医疗咨询、法律问答、企业知识库)。
14.3 RAG 解决的核心问题
问题一:知识过时
大模型训练数据是"历史的"——GPT-4 的训练数据截止到 2024 年某个时间点,之后发生的事它一概不知。而 RAG 可以接入最新文档、实时数据、内部知识库,实现"动态知识"。
传统 LLM:
问:"2026 年诺贝尔物理学奖获得者是谁?"
答:"我无法回答,我的训练数据截止到 2024 年…"(或编造一个答案)
RAG 增强的 LLM:
问:"2026 年诺贝尔物理学奖获得者是谁?"
→ 检索 → 从最新新闻中找到答案
答:"2026 年诺贝尔物理学奖授予了…"
问题二:幻觉(Hallucination)
模型容易"编答案"——当它不知道答案时,它会生成一个看起来合理但实际上是错误的回答。RAG 基于真实文档,为回答提供依据,大幅降低幻觉。
问题三:私有知识
模型默认不知道公司内部数据、私有文档、业务规则。RAG 可以接入企业知识库、本地文件,实现"企业专属 AI"。
场景:客服 AI
传统 LLM:不知道你们公司的退货政策
RAG 增强的 LLM:检索公司内部的退货政策文档,基于文档内容回答
问题四:上下文窗口限制
模型不能一次读太多内容。RAG 只检索"相关片段"而不是全部数据,节省 Token。
场景:分析 1000 页的公司手册
传统 LLM:无法一次性放入上下文窗口(超过 128K Token 限制)
RAG 增强的 LLM:检索与用户问题相关的 3-5 个片段,只放入这几个片段
问题五:可解释性
传统模型回答是"黑盒"——你不知道它为什么这么回答。RAG 可以返回"引用来源",支持溯源。
RAG 增强的回答:
"根据《2026 年公司员工手册》第 3 章第 2 节,年假的计算方式为…
(来源:员工手册 v2026.1, 第 15 页)"
14.4 RAG 的工作流程
RAG 的完整工作流程分为两个阶段:离线索引阶段和在线查询阶段。
离线索引阶段(准备知识库):
在线查询阶段(用户提问时):
RAG 的提示词模板:
你是一个专业的问答助手。请基于以下提供的参考信息回答用户的问题。
如果参考信息中没有相关内容,请明确说明"根据现有资料,我无法回答这个问题"。
【参考信息】
{检索到的 Chunk 1}
{检索到的 Chunk 2}
{检索到的 Chunk 3}
【用户问题】
{用户的问题}
【回答要求】
– 基于参考信息回答,不要编造
– 如果参考信息中有引用来源,请在回答中标注
– 如果参考信息中没有答案,明确说明
14.5 RAG 的进阶形态
基础的 RAG 已经非常强大,但 2025-2026 年出现了几种进阶形态:
Graph RAG(图谱 RAG):不只是在向量数据库中搜索相似片段,而是构建知识图谱——将文档中的实体(人物、组织、地点、概念)和它们之间的关系提取出来,形成图结构。查询时,AI 可以在知识图谱中导航,找到间接关联的信息。这对于需要理解"关系"和"层次"的复杂查询尤其有效。
Agentic RAG(智能体 RAG):将 RAG 与 Agent 机制结合。Agent 不只是"检索一次 → 生成答案",而是可以"检索 → 分析 → 发现信息不足 → 再次检索 → 再分析 → 生成答案"。这种多轮迭代的检索方式,类似于人类在查资料时"看了第一篇文章 → 发现还有疑问 → 继续查第二篇文章"的过程。
多模态 RAG:不只是检索文本,还能检索图片、表格、视频。比如用户问"这个产品的设计图在哪里",RAG 可以在知识库中检索相关的图片并返回给用户。
十五、Embedding 与向量数据库:AI 理解语义的"数字密码"
15.1 什么是 Embedding(嵌入)
**Embedding(嵌入)**是将文本、图像、音频等非结构化数据转换为固定长度的数值向量(一串数字)的技术。这个向量"编码"了原始数据的语义信息——语义相近的内容,向量在数学空间中的距离也相近 [20]。
举个例子:
- "猫"的 Embedding 向量可能是:[0.23, -0.45, 0.78, 0.12, …](假设 768 维)
- "狗"的 Embedding 向量可能是:[0.21, -0.43, 0.75, 0.15, …](和"猫"很接近!)
- "电脑"的 Embedding 向量可能是:[-0.67, 0.89, -0.12, 0.34, …](和"猫"完全不同)
"猫"和"狗"的向量距离很近(因为它们都是宠物、动物、四条腿),而"猫"和"电脑"的向量距离很远。这就是 Embedding 的核心价值——把语义的相似性转化为数学上的距离。
15.2 Embedding 模型的工作原理
Embedding 模型本质上是一个"压缩编码器"——输入一段文本,输出一个固定长度的向量。这个向量"压缩"了文本的核心语义特征。
训练 Embedding 模型的核心思想是:让语义相近的文本产生相近的向量,语义不同的文本产生距离远的向量。这通常通过对比学习(Contrastive Learning)来实现——模型在训练时看到"正例对"(语义相近的文本对,如"猫"和"小猫咪")和"负例对"(语义不同的文本对,如"猫"和"汽车"),学习将正例的向量拉近、负例的向量推远。
15.3 主流 Embedding 模型对比(2026 年)
以下是当前主流的 Embedding 模型 [20]:
| Gemini Embedding 2 | 768 / 3072 | 综合性能最强,多语言支持优秀 | 通用 RAG、多语言搜索 | |
| text-embedding-3-large | OpenAI | 256-3072(可调) | 支持维度压缩,灵活性强 | 通用 RAG、API 集成 |
| Qwen3-VL-2B | 阿里 | 1536 | 开源,多模态(支持图文混合) | 中文 RAG、多模态检索 |
| BGE-M3 | BAAI(智源) | 1024 | 开源,支持多语言和稠密+稀疏混合检索 | 中文 RAG、混合检索 |
| Cohere Embed v4 | Cohere | 1024 | 专为 RAG 优化,压缩率高 | 企业级 RAG |
| Jina Embeddings v3 | Jina AI | 1024 | 支持 89 种语言,任务特定嵌入 | 多语言 RAG、长文档 |
选择 Embedding 模型的关键考量:
- 语言:中文场景优先选 BGE-M3、Qwen3-VL;多语言场景选 Gemini Embedding 2、Jina
- 维度:维度越高,表示的语义信息越多,但存储和检索的成本也越高
- 开源 vs 闭源:开源模型可以本地部署,数据不出域,适合对隐私有要求的场景
- 多模态:如果知识库中混合了文本和图片,需要选支持多模态的 Embedding 模型
15.4 向量数据库:Embedding 的"存储引擎"
向量数据库是专门为存储和检索高维向量数据而设计的数据库。与传统数据库(如 MySQL、PostgreSQL)不同,向量数据库的核心操作不是"精确匹配"(WHERE name = ‘张三’),而是相似度搜索(找到与查询向量最相似的 Top-K 个向量)。
为什么需要专门的向量数据库?
传统数据库的索引结构(如 B-Tree)是为精确匹配和范围查询优化的,在高维向量搜索中效率极低。向量数据库使用专门的索引算法(如 HNSW、IVF、PQ),能在毫秒级完成百万甚至十亿级向量的相似度搜索。
主流向量数据库对比(2026 年) [20]:
| Pinecone | 托管云服务 | 零运维,自动扩展,开发者体验最好 | 快速原型、不想管运维的团队 |
| Weaviate | 开源 | 功能最丰富,支持混合搜索、多模态 | 复杂搜索需求、自托管 |
| Milvus / Zilliz Cloud | 开源 + 云服务 | 十亿级向量规模,企业级基础设施 | 大规模生产环境 |
| Qdrant | 开源 | Rust 编写,性能优秀,API 设计精良 | 高性能场景、自托管 |
| Chroma | 开源 | 轻量级,Python 原生,开发者友好 | 本地开发、原型验证 |
| Redis | 开源 | 不是纯向量数据库,但支持向量搜索 | 已有 Redis 的团队、实时应用 |
选型建议:
- 快速上手:Chroma(本地)或 Pinecone(云端)
- 功能丰富:Weaviate(混合搜索、多模态)
- 大规模生产:Milvus / Zilliz Cloud
- 性能优先:Qdrant
- 已有 Redis 基础设施:Redis 向量搜索
十六、模型训练与微调:从预训练到对齐的完整技术栈
16.1 大模型是怎么"炼"出来的
一个大语言模型的诞生,通常经过三个阶段:
阶段一:预训练(Pre-training)—— 让模型学会"语言本身"
预训练是大模型的基础。在这个阶段,模型在海量文本数据上(通常是数万亿 Token),学习预测下一个词(Next Token Prediction)。这个阶段的目标是让模型学会语言的模式——语法、词汇、常识、推理能力。
预训练的核心特点:
- 数据量巨大:GPT-4 的训练数据估计在 10-20 万亿 Token 之间,涵盖了互联网上几乎所有公开可获取的文本
- 算力成本极高:训练 GPT-4 级别的模型,需要数千张 GPU 运行数周甚至数月,成本估计在 5000 万到 1 亿美元之间
- 无监督学习:不需要人工标注数据,只需要"预测下一个词"这个简单的任务——因为每个词都可以作为下一个词预测的目标
预训练完成后,模型叫做 Base Model(基座模型)。基座模型已经学会了语言,但有一个问题:它只会"续写",不会"对话"。你问它"法国的首都是哪里?“,它可能回答"法国的首都是哪里?这是一个关于地理的问题……”——它不知道这是一个问题,需要给出答案,而不是续写。
阶段二:监督微调(Supervised Fine-Tuning,SFT)—— 让模型学会"对话"
SFT 使用高质量的人工标注数据(通常是几万到几十万条),让模型从"续写模式"切换到"对话模式"。标注数据通常包含:
- 用户问题和理想回答的配对
- 多样化任务:问答、翻译、摘要、代码生成、创意写作等
- 高质量、多样性、安全性并重
经过 SFT 后,模型学会了"理解指令"和"按指令回应"。但 SFT 有一个局限:它只能模仿训练数据中的回答风格,无法判断"什么样的回答更好"。
阶段三:偏好对齐(Preference Alignment)—— 让模型学会"什么样的回答更好"
这是让模型从"能回答问题"到"回答得好"的关键一步。主要有两种技术路线 [21][22]:
16.2 RLHF(基于人类反馈的强化学习)
RLHF(Reinforcement Learning from Human Feedback)是 2022 年由 OpenAI 在 InstructGPT 论文中提出的方法,至今仍是主流的对齐技术之一。
RLHF 的工作流程分为三步:
收集偏好数据:给模型同一个 Prompt,生成多个不同的回答,让人类标注者选择"哪个更好"。比如对于"如何学编程",回答 A 是"很简单的,跟着教程就行",回答 B 是"建议从 Python 开始,因为语法简单,社区活跃。推荐资源:Python 官方教程、CS50 课程……"——标注者会选 B(更详细、更有帮助)
训练奖励模型(Reward Model):用收集到的偏好数据训练一个"奖励模型",它能预测人类会喜欢哪个回答。奖励模型本质上是一个分类器——输入一个 Prompt + 回答,输出一个"奖励分数"(这个回答有多好)
用强化学习优化:使用 PPO(Proximal Policy Optimization)算法,让模型生成回答,奖励模型打分,然后根据分数调整模型参数,让模型倾向于生成高分回答
RLHF 的优缺点:
- 优点:效果好,能显著提升模型的有用性、诚实性和无害性
- 缺点:需要训练和维护一个额外的奖励模型,训练过程不稳定,需要大量人工标注
16.3 DPO(直接偏好优化)
DPO(Direct Preference Optimization)是 2023 年底由 Stanford 提出的方法,它简化了 RLHF 的流程。DPO 不需要训练单独的奖励模型,也不需要使用强化学习——它直接从偏好数据中优化模型。
DPO 的核心思想是:将偏好数据直接转化为一个损失函数,让模型"更喜欢"被人类选中的回答,"更不喜欢"被人类拒绝的回答。它把 RLHF 的"三步走"(采集偏好→训练奖励模型→强化学习)简化为"一步走"(直接从偏好数据优化)。
DPO 的优缺点:
- 优点:简单、稳定、不需要奖励模型、不需要强化学习、训练效率高
- 缺点:在复杂任务上的效果可能不如精心调优的 RLHF
2026 年的趋势:到 2026 年,DPO 已经成为大多数团队的首选方案(简单、稳定、效果好),而 RLHF 主要用于需要极致性能的场景。同时,出现了"迭代 DPO"和"在线 DPO"等改进版本,进一步缩小了与 RLHF 的差距 [21]。
16.4 RLAIF(基于 AI 反馈的强化学习)
RLAIF(Reinforcement Learning from AI Feedback)是 RLHF 的变体,用 AI 替代人类来判断回答的好坏。这解决了 RLHF 的一个核心瓶颈:人类标注的成本高、速度慢、一致性差。
RLAIF 的工作流程与 RLHF 类似,但偏好判断由 AI(通常是另一个更强大的模型)来完成。研究表明,在某些任务上,AI 的判断与人类判断高度一致,有时甚至更一致(因为 AI 不会疲劳,不会因为情绪波动而产生不一致的判断)。
16.5 微调方法的选型总结
| SFT | 几千到几万条高质量问答对 | 低到中 | 高 | 好 | 让模型学会特定领域的对话风格 |
| RLHF | 几万条偏好数据 + 奖励模型训练 | 高 | 低 | 最好 | 追求极致性能,有充足资源 |
| DPO | 几千到几万条偏好数据 | 中 | 高 | 很好 | 大多数生产场景的首选 |
| RLAIF | 用 AI 判断替代人类 | 中 | 中 | 好 | 人类标注成本太高的场景 |
| LoRA(低秩适配) | 几百到几千条数据 | 极低 | 高 | 中等 | 快速微调、资源受限的场景 |
LoRA(Low-Rank Adaptation) 是 2024-2026 年最流行的轻量级微调方法。它不修改原始模型的所有参数,而是添加少量可训练参数(通常是原始参数的 0.1%-1%),大幅降低了微调的计算和存储成本。一个 7B 参数的模型,用 LoRA 微调可能只需要一个消费级 GPU。
十七、AI 模型评测体系:如何判断一个模型"好不好"
17.1 为什么需要评测基准
在 2026 年,市面上有几十个大语言模型,每个都声称自己"在某方面最强"。但普通用户怎么判断哪个模型真正适合自己?这就是评测基准的价值——它们提供了标准化的测试框架,让不同模型的能力可以被客观比较。
但评测基准也有局限性:模型可能"刷榜"(针对评测集优化,但不代表真实能力提升)、评测集可能过时或泄露、单一评测分数不能反映综合能力。理解评测基准的"能做什么"和"不能做什么",是每个 AI 从业者必备的素养 [23]。
17.2 核心评测基准一览
知识类评测:
| MMLU | 57 个学科的多选题(数学、历史、法律、医学等) | 接近饱和(Top 模型 >88%) | Gemini 3.1 Pro: 91.2% |
| MMLU-Pro | MMLU 的升级版,更难,选项从 4 个增加到 10 个 | 未饱和 | Top 模型 85-92% |
| GPQA Diamond | 研究生级别的物理、化学、生物问题 | 未饱和 | Claude Opus 4.6: 68.4% |
推理类评测:
| MATH | 竞赛级数学问题 | GPT-5 系列表现最突出 |
| ARC-AGI | 抽象推理和模式识别 | 人类水平约 85%,AI 仍低于人类 |
| BIG-Bench Hard | 超出模型舒适区的困难任务集合 | 各模型差距较大 |
编程类评测:
| HumanEval | 164 个 Python 编程问题 | 接近饱和(Top 模型 >95%) |
| HumanEval+ | HumanEval 的增强版,修正了不完整的测试用例 | 未饱和 |
| SWE-bench | 真实 GitHub Issue 修复 | DeepSeek V4: 81%,Claude Opus 4.6: ~78% |
| Aider Polyglot | 多语言编程能力 | Claude Opus 4.6: 82.1% |
综合评测:
| Chatbot Arena (LMSYS) | 人类盲测投票,计算 Elo 分数 | GPT-5.5、Claude Opus 4.6 领先 |
| Arena Hard | Chatbot Arena 的自动版,用 GPT-4 作为评判 | 反映模型在实际对话中的表现 |
17.3 如何正确看待评测分数
不要只看一个分数。一个在 MMLU 上得分最高的模型,可能在编程任务上表现平平。更何况,MMLU 等基准已经接近饱和——Top 15 个模型在 MMLU-Pro 上的分数都超过了 87%,2% 的差距在测量误差范围内。
关注对你重要的维度。如果你主要用模型写代码,看 SWE-bench 和 HumanEval+ 比看 MMLU 更有意义。如果你用模型做创意写作,Chatbot Arena 的 Elo 分数可能比任何基准都更有参考价值。
警惕刷榜。有些模型在评测集上表现优异,但在真实场景中表现一般——因为它们可能被"针对训练"过。最可靠的评测是你自己的实际体验——用你的真实任务测试不同的模型,看哪个真正满足你的需求。
十八、AI Agent 架构:从单兵作战到多智能体协作
18.1 什么是 AI Agent
AI Agent(智能体)是一个能够感知环境、自主决策、规划行动路径、调用工具以达成目标的自主系统。与传统的"问答式" AI 不同,Agent 不只是"回答问题",而是"完成任务" [24]。
Agent 的核心能力:
- 感知(Perception):理解环境输入——用户指令、上下文、工具返回结果
- 规划(Planning):将复杂目标拆解为可执行的步骤序列
- 行动(Action):调用工具(搜索、代码执行、API 调用、浏览器操作)来执行步骤
- 反思(Reflection):评估执行结果,发现错误,调整策略
18.2 Agent 的核心架构
一个典型的 AI Agent 包含以下组件:
大脑(LLM):Agent 的核心推理引擎。它负责理解任务、拆解步骤、决定何时调用什么工具、判断任务是否完成。
工具(Tools):Agent 可以调用的外部能力。常见工具包括:
- 搜索引擎(获取最新信息)
- 代码执行器(运行 Python/JavaScript 代码)
- 浏览器(访问网页、填写表单、点击按钮)
- API 调用(与外部系统交互)
- 文件系统(读写文件)
- 数据库(查询和操作数据)
记忆(Memory):Agent 的状态存储。分为:
- 短期记忆(Short-term Memory):当前任务中的上下文和历史步骤
- 长期记忆(Long-term Memory):跨任务的持久化知识(如用户偏好、历史经验)
规划器(Planner):将用户的大目标拆解为具体的、可执行的小步骤。比如"帮我做一个电商网站"→ 拆解为"设计数据库 → 搭建后端 API → 构建前端页面 → 部署上线"。
反思器(Reflector):评估每一步的执行结果。如果某一步失败,反思器会分析原因并调整策略——“上一步的 API 调用返回了 403 错误,可能是因为没有权限,我需要先检查 API Key 的配置”。
18.3 多智能体系统(Multi-Agent System)
2025-2026 年,AI Agent 的发展方向从"单兵作战"转向了"多智能体协作"。多个 Agent 各自承担不同的角色,协同完成复杂任务 [24]。
层级化指挥链(Hierarchical Chain of Command):
[规划 Agent —— 指挥官]
├── [执行 Agent A —— 前端小组]
├── [执行 Agent B —— 后端小组]
├── [执行 Agent C —— 测试小组]
└── [监控 Agent —— 情报官]
指挥官 Agent 接收任务,拆解为子任务,分配给各个执行 Agent,并监控整体进度。执行 Agent 各自完成自己的子任务,向指挥官汇报结果。监控 Agent 负责检查质量和发现潜在问题。
主流多智能体框架:
| LangGraph | LangChain | 低层控制,图结构定义 Agent 交互流程 | 需要精细控制 Agent 协作逻辑的场景 |
| CrewAI | CrewAI | 角色驱动,易于定义 Agent 的角色和目标 | 快速搭建多 Agent 协作系统 |
| AutoGen | Microsoft | 对话式多 Agent,支持人机协作 | 研究、复杂推理、代码生成 |
| OpenAI Swarm | OpenAI | 轻量级,实验性框架 | 快速实验多 Agent 模式 |
两种组织模式:
- 顺序执行(Sequential):Agent A 完成 → Agent B 接手 → Agent C 接手。适合流程明确的线性任务
- 层级执行(Hierarchical):指挥官 Agent 派发任务 → 执行 Agent 并行工作 → 指挥官汇总结果。适合可以并行处理的复杂任务
18.4 Agent 的挑战与风险
可靠性问题:Agent 可能在多步推理中出错,而且错误会累积——“第一步错了,第二步基于错误的前提继续推理,最终结果可能完全偏离”。
安全问题:Agent 拥有自主执行能力(操作浏览器、运行代码、调用 API),如果失控可能造成实际损害。比如 Agent 可能误删文件、发送错误邮件、执行危险命令。
成本问题:Agent 的每次推理和工具调用都需要消耗 Token,复杂任务可能需要几十甚至上百次 LLM 调用。一个 Agent 任务可能消耗 50 万 Token,成本远超普通对话。
控制问题:如何在"让 Agent 自主执行"和"保持人类控制"之间找到平衡,是 Agent 设计的核心挑战。目前的主流做法是"关键步骤需要人类确认"——Agent 在执行高风险操作(如删除、付款、发送)前,必须等待人类批准。
十九、AI 幻觉深度解析:为什么 AI 会"一本正经地胡说八道"
19.1 什么是 AI 幻觉
**AI 幻觉(Hallucination)**是指大语言模型生成的内容看似合理、流畅、自信,但实际上与事实不符、凭空编造的现象 [25]。
典型的幻觉表现:
- 编造不存在的论文、书籍、人物、事件
- 给出看似合理但实际上是错误的数学计算结果
- 对事实性问题的回答中包含明显错误的信息
- 生成引用的法律条文、技术文档,但原文中并不存在
关键是:幻觉的输出通常非常流畅、自信,如果不仔细核实,很容易被误导。这就是为什么幻觉是 AI 应用中最危险的陷阱之一。
19.2 幻觉的成因
成因一:训练数据的局限性
模型的训练数据可能包含错误信息、过时信息、偏见信息。模型学到的不是"真理",而是"训练数据中的模式"。如果训练数据中大部分关于某个话题的信息都是错误的,模型也会输出错误的答案。
成因二:概率本质
LLM 本质上是一个"概率预测器"——它预测的是"下一个词最可能是什么",而不是"下一个词是否真实"。当模型遇到知识盲区时,它不会说"我不知道",而是会选择概率最高的词来续写——即使这个词可能导致错误的信息。
成因三:上下文窗口的限制
当需要的信息超出了上下文窗口的范围,模型只能基于不完整的信息生成答案。就像一个人只看了书的目录就写书评——内容看起来可能合理,但细节是编造的。
成因四:过度泛化
模型在训练中学会了"模式",但有时会把模式应用到不适用的情况。比如模型知道"诺贝尔奖得主通常有很高的学术成就",可能会把某个领域的知名学者"错误地"列为诺贝尔奖得主。
19.3 幻觉的缓解策略
策略一:RAG(检索增强生成)
这是目前最有效的幻觉缓解方法。让模型从外部知识库中检索相关信息,再基于检索到的信息生成答案。相当于"先查资料再回答",而不是"凭记忆回答"。
策略二:精确提示词(Precision Prompting)
在 Prompt 中明确约束模型的行为:
- “如果你不确定,请明确说明’我不确定’,不要猜测”
- “请基于以下提供的参考信息回答,不要使用参考信息之外的内容”
- “对于事实性陈述,请标注信息来源”
策略三:多步验证(Multi-Step Verification)
让模型生成答案后,再让模型(或另一个模型)检查答案中的每个事实性陈述。类似人类写文章后的"校对"过程——第一遍写,第二遍检查。
策略四:Best-of-N 采样
对于同一个问题,让模型生成 N 个不同的回答,然后选择最一致、最合理的那个。如果多个回答中出现了相同的事实陈述,这个陈述更可能是正确的;如果只有一个回答中出现了某个陈述,它可能是编造的。
策略五:降低 Temperature
对于事实性要求高的场景,使用低 Temperature(0-0.3)可以减少模型的"创造性"和"随机性",从而降低幻觉的概率。但代价是输出可能更"机械"。
策略六:外部知识验证
让模型在生成答案后,自动调用搜索引擎或知识图谱来验证关键事实。如果发现不一致,标记或修正。
二十、AI 安全、对齐与伦理:让 AI 向善的关键议题
20.1 为什么 AI 安全如此重要
随着 AI 能力的快速增长,一个关键问题日益突出:如何确保越来越强大的 AI 系统,始终按照人类的价值观和利益行事? [26]
这不是一个遥远的未来问题——已经有很多真实案例:
- AI 生成的深度伪造(Deepfake)被用于诈骗和虚假信息传播
- 模型在回答中无意泄露训练数据中的隐私信息
- 模型的偏见导致对特定群体的不公平对待(如招聘中的性别偏见、贷款审批中的种族偏见)
- AI 被用于生成恶意代码、钓鱼邮件、虚假评论

20.2 AI 对齐(AI Alignment)
AI 对齐的目标是:确保 AI 系统的行为与人类的价值观、意图和期望保持一致。
对齐的三个层次:
- 指令对齐:AI 能准确理解并执行用户的指令("帮我翻译这段文字"→ 确实翻译了)
- 意图对齐:AI 能理解用户指令背后的真实意图(用户说"我好无聊",AI 应该提供有趣的内容,而不是说"无聊是一种情绪状态")
- 价值观对齐:AI 的行为符合人类的道德和伦理标准(当用户要求生成仇恨言论时,AI 应该拒绝)
核心对齐技术 [26]:
- RLHF / DPO:通过人类偏好数据训练模型,让模型倾向于生成"好"的回答
- Constitutional AI(宪法 AI):Anthropic 提出的方法,给模型设定一套"宪法"(行为准则),让模型在生成回答时自我检查是否符合宪法
- Red Teaming(红队测试):专门的团队(内部或外部)尝试"攻击"模型,发现漏洞和风险,然后修复
- AlphaAlign:2026 年提出的新方法,用纯强化学习激励模型主动进行安全推理,而不是简单地拒绝回答
20.3 AI 偏见与公平性
AI 模型可能从训练数据中学习并放大社会中存在的偏见:
- 性别偏见:"护士"在模型生成中更可能是女性,"CEO"更可能是男性
- 种族偏见:某些种族在犯罪预测中被错误地标记为高风险
- 地域偏见:对某些地区或文化的刻板印象
偏见问题的根源在于:训练数据反映了人类社会的既有偏见,模型不加批判地学习并放大了这些偏见。解决偏见需要从数据收集、模型训练、评估测试三个环节同时入手。
20.4 AI 监管与治理(2026 年最新进展)
欧盟 AI 法案(EU AI Act):全球最全面、最具影响力的 AI 监管法规,2026 年已全面生效。它按风险等级将 AI 应用分为四类:不可接受风险(禁止)、高风险(严格监管)、有限风险(透明度要求)、低风险(无额外要求)。违规罚款最高可达全球年收入的 7% 或 3500 万欧元 [26]。
中国 AI 治理:2026 年,中国发布了《人工智能应用伦理安全指引 1.0》,明确了 AI 应用的伦理安全理念与原则,包括以人为本、智能向善、公平公正、安全可控、隐私保护等 [26]。同时,中国在生成式 AI 服务管理、深度合成内容标识、个人信息保护等方面也有一系列法规。
企业自监管:OpenAI、Anthropic、Google、Meta 等公司都建立了内部的安全团队和红队测试机制。Anthropic 的"负责任扩展政策"(RSP)要求模型在能力达到一定阈值时,必须通过额外的安全测试才能继续扩展。
20.5 个人使用 AI 的安全建议
二十一、Vibe Coding 深入:从概念到实践的全景解析
12.1 Vibe Coding 的核心哲学
Vibe Coding 这个术语最早由 Andrej Karpathy(OpenAI 联合创始人、前 Tesla AI 总监)在 2025 年初提出。他用这个词来描述一种全新的编程体验:你不再一行行写代码,而是用自然语言描述你想要什么,AI 来生成代码,你负责验收、反馈、迭代。
这种工作方式的核心理念是:把"实现"外包给 AI,把"判断"留给自己。开发者从"代码的生产者"转变为"需求的描述者和质量的把关者"。
Vibe Coding 已经逐渐成为新一代开发方式的主流趋势。以下几个岗位的兴起,也印证了这一点:
- AI 应用开发工程师:专注于用 AI 工具开发和部署 AI 驱动的应用。核心技能不是"写很多代码",而是"用自然语言高效地驱动 AI 生成代码"
- Agent 开发工程师:专注于设计和开发 AI Agent 系统。需要理解 Agent 的决策机制、工具调用流程、安全边界和与外部系统的集成
- AI 算法工程师:专注于 AI 模型的研发和优化。这个方向要求最高,需要深厚的数学和机器学习基础
前两个方向是大多数开发者未来可以重点努力和发展的方向。AI 时代的开发者核心竞争力不再是"写代码的速度",而是:
12.2 Vibe Coding 工具深度对比
AI 原生 IDE:这类工具在传统 IDE 的基础上深度集成 AI 能力,是目前开发者日常使用最频繁的工具。
Cursor:
- 基于 VS Code 内核,对所有 VS Code 插件完全兼容
- Agent 模式是 Cursor 的杀手级功能——AI 能自主理解整个项目结构,跨文件修改代码,运行终端命令,检查错误并自动修复
- Composer 功能可以一次性生成多个文件(如"帮我创建一个完整的 REST API,包括 model、controller、service 和 test")
- Tab 自动补全的预测准确率远超传统的代码补全——AI 不仅预测你要写什么代码,还能预测你要做什么操作
- 支持接入 OpenAI、Anthropic、Google 等多个模型提供商
Windsurf:
- Codeium 出品,在 AI 交互体验上做了独特创新
- Flow 模式自动分析上下文并执行多步操作——比如你改了一个函数名,它能自动找到所有调用了这个函数的地方并同步修改
- Cascade 功能理解项目的整体结构,提供项目级别的建议和重构方案
- 价格比 Cursor 低,对个人开发者更友好
Trae:
- 字节跳动出品,对中文开发者体验做了深度优化
- 内置 Builder 模式,适合快速构建项目原型——你描述需求,它一次性生成完整项目
- 与国内开发者常用的工具和平台(如飞书、阿里云)集成更好
- 在对中文指令的理解和中文项目的支持上相比 Cursor 有天然优势
CLI 工具:在终端中直接使用,不需要图形界面,适合在远程服务器上工作或追求极致效率的开发者。
Claude Code:
- Anthropic 官方 CLI 工具,深度集成 Claude 系列模型
- 理解整个代码库的结构,不仅仅是当前打开的文件
- 代理式执行——你能告诉它"帮我修这个 bug",它会自己读代码、找到问题、修改代码、运行测试、确认修复
- 支持 Git 感知——能理解代码的变更历史,生成更合理的修改建议
Aider:
- 开源 CLI 工具,支持几乎所有主流 LLM(OpenAI、Anthropic、DeepSeek、Ollama 本地模型等)
- 自动 Git 集成——每次修改自动生成有意义的 commit message
- 在地图编辑模式中,Aider 能精确修改代码中的特定位置
- 支持多文件编辑——一次请求可以同时修改多个相关文件
Cline:
- VS Code 插件形式,但本质是 CLI 工作流
- 支持自主执行终端命令——AI 能安装依赖、运行测试、部署应用
- 每一次操作前都会请求你的确认,兼顾了自主性和安全性
即时生成工具:这些工具的特点是"一句话生成完整项目",适合快速验证想法和生成 Demo。
Devin:
- 号称"首个 AI 软件工程师",能独立完成从理解需求到部署上线的全过程
- 拥有自己的浏览器、终端和编辑器——能像人类开发者一样使用这些工具
- 适合复杂、多步骤的开发任务
秒哒:
- 字节跳动出品,中文友好
- 一键生成完整项目,包含前端、后端和数据库
- 适合快速构建原型和 MVP
码上飞:
- 即时生成,快速出原型
- 界面直观,操作简单
- 适合非技术背景的创业者快速验证产品想法
12.3 Vibe Coding 的最佳实践
Vibe Coding 虽然降低了编程的门槛,但要做好它,仍然需要遵循一些原则:
原则一:需求描述要结构化
模糊的需求得到模糊的代码。使用 CO-STAR 框架来描述你的开发需求——背景(Context,项目环境和技术栈)、目标(Objective,要解决什么问题)、风格(Style,代码风格偏好)、约束(Tone/Constraints,性能要求、兼容性要求)、响应格式(Response,期望的输出格式)。
【背景】React 19 + TypeScript + Tailwind CSS 项目
【任务】创建一个可复用的数据表格组件
【约束】
– 支持排序、分页、行选择
– 响应式设计,移动端折叠为卡片视图
– 支持暗色模式
– TypeScript 严格模式,不使用 any
– 包含单元测试
【输出格式】
– 组件文件:DataTable.tsx
– 类型定义:types.ts
– 样式:使用 Tailwind CSS 类
– 测试文件:DataTable.test.tsx
原则二:分步推进,不要一步到位
不要试图让 AI 一次生成 5000 行代码。正确的方式是:
每一步完成后再进行下一步,每一步都验证 AI 的输出是否正确。这比"一次性生成全部"的成功率高得多。
原则三:读代码比写代码更重要
Vibe Coding 时代,开发者的核心工作从"写代码"转变为"读代码和审代码"。AI 生成的代码不一定正确,甚至可能包含安全漏洞或性能问题。开发者需要有足够的技术判断力来:
- 快速判断生成的代码是否正确
- 识别潜在的性能问题和安全风险
- 理解代码的整体结构是否合理
- 确保代码符合项目的架构规范
原则四:用好 Git,做好版本控制
AI 生成的代码经常需要回退。频繁提交、写好 commit message,是 Vibe Coding 的好习惯。建议每次让 AI 完成一个独立的小任务后,先审查代码,确认无误后立即提交。这样如果 AI 后续的修改搞砸了,可以轻松回退。
二十二、总结:一张图看清核心概念之间的关系
13.1 概念全景图
人工智能(AI)
│
├── 七十年发展简史:三次寒冬、两次复兴、一次爆发
│
├── 机器学习(ML)── 让机器从数据中学习规则
│ │
│ ├── 传统 ML:线性回归、决策树、SVM、K-Means
│ │
│ └── 深度学习(DL)── 多层神经网络,自动学习特征
│ │
│ ├── CNN:图像识别
│ ├── RNN/LSTM:序列处理
│ └── Transformer:大语言模型的基础
│ │
│ ├── 编码器-解码器架构
│ ├── 自注意力机制(Q、K、V)
│ ├── 多头注意力
│ └── 位置编码
│ │
│ └── 大语言模型(LLM)
│ │
│ ├── 训练:预训练 → SFT → RLHF/DPO 对齐
│ │
│ ├── 输入:Prompt(提示词)
│ │ ├── 系统提示词(角色、规则)
│ │ ├── 用户提示词(任务指令)
│ │ └── CO-STAR 框架(Context/Objective/Style/Tone/Audience/Response)
│ │
│ ├── 生成控制:Temperature / Top-P / Top-K / Repetition Penalty
│ │
│ ├── 处理单位:Token(词元)
│ │ ├── 输入 Token(计费)
│ │ └── 输出 Token(计费)
│ │
│ ├── 记忆机制:会话记忆(Chat Memory)
│ │ └── 受限于 上下文窗口(Context Window)
│ │
│ ├── 能力扩展:多模态(Multimodal)
│ │ ├── 文本
│ │ ├── 图像
│ │ ├── 音频
│ │ └── 视频
│ │
│ ├── 知识增强:RAG(检索增强生成)
│ │ ├── Embedding 模型(语义向量化)
│ │ ├── 向量数据库(相似度检索)
│ │ ├── Graph RAG(知识图谱增强)
│ │ ├── Agentic RAG(多轮迭代检索)
│ │ └── 引用溯源
│ │
│ ├── Agent 能力:自主感知、规划、执行、反思
│ │ ├── 单智能体
│ │ └── 多智能体协作(LangGraph、CrewAI、AutoGen)
│ │
│ ├── 风险与挑战
│ │ ├── 幻觉(Hallucination)
│ │ └── 安全与伦理(对齐、偏见、隐私)
│ │
│ └── 评测体系:MMLU / HumanEval / SWE-bench / GPQA / Chatbot Arena
│
└── 其他 AI 分支:专家系统、进化算法、模糊逻辑…
13.2 核心概念速查表
| AI | 让机器模拟人类智能 | 总目标 |
| ML | 让机器从数据中学习 | AI 的核心实现方式 |
| DL | 多层神经网络自动学习 | ML 的强力分支,当前 AI 爆发的原因 |
| Transformer | 基于自注意力机制的序列处理架构 | 所有大语言模型的"发动机" |
| LLM | 基于海量文本训练的语言模型 | 当前 AI 应用的核心引擎 |
| Prompt | 给 LLM 的指令 | 人机交互的接口 |
| CO-STAR | 结构化提示词框架 | 确保 Prompt 覆盖所有关键维度 |
| Temperature | 控制模型输出的随机性 | 在"创造力"和"准确性"之间调节 |
| Top-P | 动态截断低概率词 | 排除不合理的候选词,提高输出质量 |
| Token | LLM 处理的最小语义单位 | 计费、容量、理解的基础 |
| 会话记忆 | 模型对对话历史的存储和利用 | 保持对话连贯性 |
| 上下文窗口 | 模型一次能处理的最大 Token 数 | 记忆容量的硬限制 |
| 多模态 | 融合文本、图像、音频、视频 | 让 AI 像人一样综合感知 |
| Embedding | 将文本转换为语义向量 | 语义搜索和 RAG 的基础 |
| 向量数据库 | 存储和检索高维向量 | RAG 的"存储引擎" |
| RAG | 检索外部知识库 + 生成答案 | 解决知识过时、幻觉、私有知识问题 |
| 预训练 | 在海量数据上学习"下一个词预测" | 大模型的基础能力来源 |
| SFT | 用高质量标注数据微调 | 让模型从"续写"切换到"对话" |
| RLHF | 基于人类反馈的强化学习 | 让模型输出更符合人类偏好 |
| DPO | 直接从偏好数据优化 | 更简单、更稳定的对齐方法 |
| LoRA | 低秩适配微调 | 大幅降低微调成本 |
| AI Agent | 自主感知、规划、执行的智能体 | 从"问答"到"完成任务"的进化 |
| 多智能体 | 多个 Agent 协作完成复杂任务 | 处理单个 Agent 无法完成的复杂任务 |
| 幻觉 | 模型生成看似合理但错误的内容 | AI 应用中最危险的陷阱 |
| AI 对齐 | 确保 AI 行为符合人类价值观 | 让 AI 向善的技术基础 |
附录 A:关键词中英文对照表
| 人工智能 | Artificial Intelligence | AI |
| 机器学习 | Machine Learning | ML |
| 深度学习 | Deep Learning | DL |
| 大语言模型 | Large Language Model | LLM |
| 提示词 | Prompt | — |
| 提示词工程 | Prompt Engineering | — |
| 词元 | Token | — |
| 检索增强生成 | Retrieval Augmented Generation | RAG |
| 卷积神经网络 | Convolutional Neural Network | CNN |
| 循环神经网络 | Recurrent Neural Network | RNN |
| 链式思考 | Chain of Thought | CoT |
| 少样本提示 | Few-Shot Prompting | — |
| 上下文窗口 | Context Window | — |
| 多模态 | Multimodal | — |
| 向量数据库 | Vector Database | — |
| 嵌入 | Embedding | — |
| 智能体 | Agent | — |
| 副驾驶 | Copilot | — |
| 自注意力 | Self-Attention | — |
| 多头注意力 | Multi-Head Attention | MHA |
| 位置编码 | Positional Encoding | — |
| 监督微调 | Supervised Fine-Tuning | SFT |
| 基于人类反馈的强化学习 | Reinforcement Learning from Human Feedback | RLHF |
| 直接偏好优化 | Direct Preference Optimization | DPO |
| 低秩适配 | Low-Rank Adaptation | LoRA |
| 幻觉 | Hallucination | — |
| AI 对齐 | AI Alignment | — |
| 红队测试 | Red Teaming | — |
附录 B:推荐学习路径
如果读完这篇文章后,想要深入某个方向,以下是推荐的学习路径:
方向一:AI 应用开发
方向二:AI 算法研究
方向三:AI 产品设计
网硕互联帮助中心

评论前必须登录!
注册