一个刚接触 AI 的 Java 开发者,混进技术群里听别人聊天,大概率是这种体验:
「这个需求用 RAG 就行,别急着 Fine-tuning。」
「你 System Prompt 写清楚点,再调一下 Temperature。」
「这模型上下文窗口不够,Token 超了,得做切片 Embedding 存向量库。」
「它又幻觉了,得加个 Function Calling 让它自己查数据。」
听完你满脑子都是:这些词每个都好像在哪听过,但到底啥意思?RAG 和 Fine-tuning 有啥区别?Token 和参数是一回事吗?
别慌,你不是一个人。这些「AI 黑话」,本质就是一层「专业术语的包装纸」——剥开看,每个词背后都是一个挺简单、挺直观的概念。
今天这篇,就是一篇扫盲文。我用「一个 Java 开发者也听得懂」的方式,把这些高频黑话一次讲透,每个词都给你一句「人话解释」和一个「通俗类比」。
一、一张图看懂 AI 黑话的「全家福」
先别急着逐个背,我们先建立一张「地图」,把这些黑话分门别类。它们其实可以归成四大类:
一句话:AI 黑话虽多,但逃不出四件事——模型是什么、怎么跟它说话、怎么让它变强、怎么用它干活。抓住这四条线,所有词都能各归其位。
下面,我们一条线一条线地拆。
二、模型相关黑话
2.1 大模型(LLM)
LLM(Large Language Model,大语言模型),就是那个「AI 的大脑」。它的本质,用一句话说:
一个巨大的「概率机器」——你给它一段文字,它预测下一个字最可能是什么,一个字一个字地接下去。
一句话:大模型不是「会思考」,而是「极其擅长预测下一个字」。当这个「预测」准到一定程度,看起来就像「真的会说话、会思考」了。
2.2 Token:AI 世界的「最小单位」
Token 是模型处理文本的最小单位,也是计费单位。
- 它不完全是「一个字」,也不是「一个词」,而是介于两者之间;
- 大致上,一个汉字 ≈ 1 个 Token,一个英文单词 ≈ 1~2 个 Token。
「我喜欢编程」 → 大约 4~5 个 Token
「I love coding」 → 大约 3~4 个 Token
一句话:Token 就是 AI 的「字符计数单位」。为什么重要?因为模型的收费、上下文长度限制,全按 Token 算——你用 AI 花钱,本质就是在买 Token。
2.3 上下文窗口(Context Window):模型「一次能看多少」
上下文窗口,就是模型一次能「看见」的文字总量上限。
你可以把模型想象成一个人,盯着一块有限大小的白板。白板上写着所有信息(你的问题、历史对话、查到的资料),但白板有限,写满了就得擦掉最早的。
一句话:上下文窗口就是模型「一次能记住多少」。窗口越大,一次能塞进的信息越多;但超出窗口,最早的内容就被「忘掉」了。
2.4 参数(Parameters):模型的「脑容量」
参数,可以粗略理解成模型「脑容量」的度量——参数越多,模型越「大」,通常也越聪明。
小模型:7B 参数(70 亿)
大模型:70B / 200B / 更大
一句话:参数越多 ≈ 脑子越大 ≈ 通常越聪明,但也越贵、越慢。「7B」「70B」这种数字,说的就是参数量。
2.5 Temperature / Top-p:控制「随机性」的旋钮
这两个词控制的是同一个东西——模型回答的「随机性/创造性」。
| 参数 | 作用 | 低值 | 高值 |
|---|
| Temperature | 控制随机程度 | 更严谨、稳定 | 更有创造性、发散 |
| Top-p | 控制候选范围 | 只选最可能的 | 允许更多可能 |
一句话:Temperature 和 Top-p 是「创造力的旋钮」——想要严谨稳定就调低,想要天马行空就调高。
三、提示词相关黑话
3.1 Prompt:你对模型说的话
Prompt 就是「你输入给模型的那段话」。它是你和 AI 沟通的唯一接口。
一个 Prompt 的例子:
「你是一位资深 Java 工程师,帮我解释一下 HashMap 的底层原理」
3.2 System Prompt:给模型定的「人设和规矩」
System Prompt 是最开头、最优先的那段指令,用来给模型定人设、立规矩。
System Prompt(定人设):
「你是一个严谨的代码审查助手,只回答技术问题,
不闲聊,回答要简洁,用中文,别夹英文缩写。」
一句话:Prompt 是「你问什么」,System Prompt 是「你让它是谁」。System Prompt 优先级最高,能「约束」模型后续的所有行为。
3.3 Prompt Engineering:提示词工程
Prompt Engineering,就是「怎么把话说到位」的技巧。核心思想:说清楚、给框架、给示例。
❌ 差 Prompt:「写个排序」
✅ 好 Prompt:「用 Java 写一个冒泡排序,加上详细注释,
解释时间复杂度,再给一个使用示例」
一句话:Prompt Engineering 不是玄学,本质就是「把需求说清楚」——目标、约束、格式、示例,交代得越全,模型做得越准。
3.4 Few-shot / Zero-shot:给不给示例
这两个词描述「你给模型示例了吗」:
| 术语 | 含义 | 类比 |
|---|
| Zero-shot | 不给示例,直接问 | 让没见过的题 |
| Few-shot | 给几个示例,再问 | 先看例题再做 |
Few-shot 示例:
「把英文转中文。示例1:hello → 你好;示例2:world → 世界。
现在请翻译:java → ?」
一句话:Few-shot 就是「先给它看几个答案,它照着学」,往往比 Zero-shot 更准。
四、让模型「变聪明」的三种方式(重点)
这一章是全文的核心。 很多人分不清 Prompt、RAG、Fine-tuning,其实它们对应「让 AI 变强」的三条完全不同的路。
| 方式 | 改不改模型 | 核心动作 | 类比 | 成本 |
|---|
| Prompt | ❌ 不改 | 优化输入 | 换个说法问 | 最低 |
| RAG | ❌ 不改 | 给它查资料 | 开卷考试 | 中等 |
| Fine-tuning | ✅ 改 | 用数据训练 | 补课/深造 | 最高 |
一句话:Prompt 是「换个方式问」,RAG 是「给它开卷考试」,Fine-tuning 是「给它补课深造」。 记住这三句类比,三者的区别一辈子忘不掉。
一个实用的选择口诀:
| 场景 | 选哪个 |
|---|
| 只是想让回答更准 | 先优化 Prompt |
| 需要模型知道「私有知识」(文档、数据库) | 用 RAG |
| 需要模型「学会某种风格/能力」(如专业术语、特定格式) | 用 Fine-tuning |
| 知识经常变 | RAG(更新资料即可,不用重训) |
| 知识相对固定、要深度内化 | Fine-tuning |
五、RAG 深入:给模型「开卷考试」
RAG(Retrieval-Augmented Generation,检索增强生成),是现在最火的落地方式。它解决一个痛点:大模型不知道你的私有数据(你的文档、你的数据库,它训练时没见过)。
RAG 的思路很简单:不让模型「背」,而是让它「现场查」。
5.1 RAG 的完整流程
用户问:「我们公司的年假政策是什么?」
RAG 过程:
① 检索:从「员工手册」里找到「年假」相关段落
② 增强:把这段手册内容,拼在用户问题后面
③ 生成:模型读着手册内容,回答「贵司年假是...」
5.2 关键配套:Embedding 和向量数据库
RAG 的「检索」不是靠关键词,而是靠 Embedding(向量化):
Embedding 就是把一段文字,变成一串「坐标数字」,保证「意思越近的文字,坐标离得越近」。
这些「坐标」存在 向量数据库(Vector Database) 里。提问时,把问题也转成坐标,找「离它最近的几段资料」。
一句话:RAG = 检索 + 增强 + 生成。它让模型不用「背下所有知识」,而是「用到时现查」。Embedding 负责「把意思变成坐标」,向量数据库负责「存坐标、找最近的」。
六、Fine-tuning 深入:给模型「补课」
Fine-tuning(微调),是「用你自己的数据,去训练/调整模型」,让它真正「学会」某种知识或风格。
6.1 RAG vs Fine-tuning:本质区别
| 维度 | RAG | Fine-tuning |
|---|
| 知识放哪 | 外部资料库 | 内化进模型参数 |
| 模型变了吗 | 没变 | 变了 |
| 更新知识 | 换资料即可 | 要重新训练 |
| 类比 | 开卷考试 | 把知识背下来 |
6.2 LoRA:低成本的微调
Fine-tuning 很贵(要动整个大模型)。LoRA(Low-Rank Adaptation) 是一种「省钱版微调」——不重训整个模型,只训练「一小部分参数」,成本大幅降低。
一句话:如果 Fine-tuning 是「回炉重造整个脑子」,LoRA 就是「只补一小块课」。
6.3 RLHF:用人类反馈训练
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习),是让模型「学会什么回答是人类喜欢的」。
一句话:RLHF 就是「人给答案打分,模型照着改」,让模型的回答更符合人类的偏好。
6.4 什么时候该微调?
| 情况 | 建议 |
|---|
| 知识频繁更新 | ❌ 别微调,用 RAG |
| 需要模型「稳定输出某种格式/风格」 | ✅ 可微调 |
| 有大量高质量标注数据 | ✅ 可微调 |
| 只是想让它知道你的文档 | ❌ 用 RAG 更划算 |
一句话:能 RAG 就 RAG,非必要不微调。因为 RAG 灵活(换资料就行),微调又贵又不灵活(知识变了要重训)。
七、应用相关黑话
7.1 Agent:能自主干活的 AI
Agent(智能体),是「能自主规划、调用工具、完成复杂任务的 AI 应用」。它不只是「一问一答」,而是「自己拆任务、自己干、自己检查」。
一句话:普通 AI 是「你问它答」,Agent 是「你给目标,它自己跑完全程」。
7.2 Function Calling:让模型会「调工具」
Function Calling(函数调用),是让模型能「调用外部工具/函数」的能力。模型不再只会「说」,还能「动手」——查数据库、调 API、发请求。
注意:模型并不真的「执行」工具,它只是「决定调哪个、传什么参」,真正执行的是外面的程序。这和你写 Java 时「调用一个方法」是类似的思路。
一句话:Function Calling 让模型从「只会说」进化到「能干活」——它是 Agent 的「手」。
7.3 幻觉(Hallucination):一本正经胡说八道
幻觉,是模型「一本正经地编造不存在的答案」。它不知道自己不知道,还会编得有理有据。
你问:「xxx 公司的 CEO 是谁?」
模型幻觉:「是张三。」(实际上张三根本不存在,模型瞎编的)
一句话:幻觉是 AI 最危险的毛病——它不会说「我不知道」,而是会自信地编一个。所以关键信息,别光信它,要核实。
7.4 多模态(Multimodal):能看图、听声音
多模态,就是模型不再只处理文字,还能处理图像、语音、视频。
一句话:单模态 = 只会看字;多模态 = 字、图、音、视频都能看懂。
7.5 推理(Reasoning):让模型「先想后说」
推理,是让模型在回答前「先在内部思考、拆解、推理」,而不是「脱口而出」。现在很多模型都有「深度思考」模式。
普通模式:直接给答案(可能没想清楚)
推理模式:先拆解问题 → 逐步推理 → 再给结论(更准,但更慢)
一句话:推理就是「让模型先打草稿,再答题」。慢一点,但更靠谱。
八、一张「AI 黑话速查表」
最后,把这篇讲过的所有词,压成一张速查表。建议收藏,随时查阅:
| 术语 | 一句话解释 | 类比 |
|---|
| LLM | 大语言模型,AI 的大脑 | 概率机器 |
| Token | 文本最小单位,计费单位 | 字符计数 |
| 上下文窗口 | 模型一次能看多少 | 有限的白板 |
| 参数 | 模型脑容量 | 神经元数量 |
| Temperature | 控制随机性 | 创造力旋钮 |
| Prompt | 你输入的话 | 提问 |
| System Prompt | 定人设规矩 | 立规矩 |
| Prompt Engineering | 把话说到位 | 提问技巧 |
| Few-shot / Zero-shot | 给不给示例 | 给不给例题 |
| RAG | 检索增强生成 | 开卷考试 |
| Fine-tuning | 微调模型 | 补课深造 |
| LoRA | 省钱版微调 | 只补一小块课 |
| RLHF | 用人类反馈训练 | 打分改答案 |
| Embedding | 文字变坐标 | 意思→位置 |
| 向量数据库 | 存坐标找最近 | 坐标库 |
| Agent | 自主干活的 AI | 会办事的助手 |
| Function Calling | 让模型调工具 | 给 AI 装手 |
| 幻觉 | 一本正经瞎编 | 不懂装懂 |
| 多模态 | 能看图听声 | 五感俱全 |
| 推理 | 先想后说 | 先打草稿 |
写在最后
我们从「听群友聊天像听天书」出发,把这堆 AI 黑话分门别类地扫了一遍盲。回顾这条主线:
- 四大类:模型是什么、怎么说话、怎么变强、怎么干活;
- 模型相关:LLM、Token、上下文窗口、参数、Temperature;
- 提示词相关:Prompt、System Prompt、Prompt Engineering、Few-shot;
- 三种变强方式(核心):Prompt 是「换个说法」,RAG 是「开卷考试」,Fine-tuning 是「补课深造」;
- RAG 深入:检索 + 增强 + 生成,靠 Embedding 和向量数据库;
- Fine-tuning 深入:LoRA 省钱、RLHF 打分,能 RAG 就别微调;
- 应用相关:Agent、Function Calling、幻觉、多模态、推理。
最后送你一句话:
AI 黑话,没有一个是「黑科技」,它们都是「用一个新词,包装一个挺朴素的想法」。 你缺的不是智商,只是一张「把词和意思对上」的对照表——而这篇文章,就是给你的那张表。
下次再听到「这个用 RAG 就行」「调一下 Temperature」「它又幻觉了」,你可以微微一笑:原来,就是那么回事。