Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
4 changes: 3 additions & 1 deletion textbook-zero-to-agent/00_INDEX.md
Original file line number Diff line number Diff line change
Expand Up @@ -2,7 +2,7 @@
type: course-index
aliases: [Textbook-INDEX]
date: 2026-07-06
updated: 2026-07-12
updated: 2026-07-24
abstraction_layer: 技巧 + 方法(入门封装)
course: zero-to-agent
tags: [AI教程, Agent, 课程索引]
Expand All @@ -12,6 +12,8 @@ tags: [AI教程, Agent, 课程索引]

> 设计原则:每章都产出可运行的东西;理解跟着动手走,而不是反过来。
> 起点:完全零基础(不假设编程经验)。终点:能独立设计、构建、评测、部署生产级 Agent 系统。
>
> 版本说明(2026-07-24):12 章正文已从"要点摘要"扩写为**完整教学课文**——每个知识点都配了原理讲解、生活化类比、可运行代码/示例与"在哪会失败"的提醒,供零基础读者独立自学。练习、项目、自测题与实验包结构保持不变。

## 路线图

Expand Down
111 changes: 97 additions & 14 deletions textbook-zero-to-agent/01_AI认知启蒙.md
Original file line number Diff line number Diff line change
Expand Up @@ -2,6 +2,7 @@
type: course-chapter
abstraction_layer: 技巧 + 方法(入门封装)
date: 2026-07-06
updated: 2026-07-24
course: zero-to-agent
chapter: 1
stage: 1
Expand All @@ -10,31 +11,112 @@ tags: [AI教程, LLM入门, Prompt]

# 第 1 章 AI 认知启蒙:把 LLM 用成第二大脑

> 这一章不教你写代码,也不教你调 API。它要解决一个更底层的问题:**你脑子里那个"AI 是什么"的模型是不是对的。** 绝大多数人用不好 AI,不是因为不会写 prompt,而是因为脑子里装了一个错误的比喻——把它当成"更聪明的搜索引擎"或者"会打字的百科全书"。这个错误的比喻会让你在所有后续章节里反复摔跤。所以我们先花一章,把这个比喻换掉。

## 学习目标

- 用自己的话解释 LLM 是什么、为什么会"胡编"、什么任务可靠什么不可靠
- 每天用 AI 完成至少一件真实任务,并能判断输出质量
- 建立"AI 是概率系统而非数据库"的核心直觉

## 知识点
---

## 1.1 LLM 到底在做什么:一个"超级自动补全"的心智模型

你手机输入法有个功能:你打"今天天气真",它会在上面弹出"好""不错""热"几个候选词。它是怎么知道的?它不理解天气,它只是统计过海量的中文句子,发现"今天天气真"后面**最常出现**的是这几个词。

大语言模型(Large Language Model,LLM)本质上就是这个功能的超级加强版。它在互联网规模的文本(几万亿词)上训练,学到的是一件事:**给定前面的一段文字,下一个词最可能是什么。** 然后它把这个动作重复成千上万次——预测一个词、把它接到句尾、再预测下一个——就"写"出了一整段流畅的回答。

这里有个关键术语要先记住:模型处理的最小单位不是"字",而是 **token(词元)**。一个 token 大约是一个英文单词、或半个到一个汉字。你可以先粗略理解成"字",第 4 章会讲清楚它为什么重要。

为什么这个"超级自动补全"的比喻如此重要?因为它一次性解释了 AI 所有让新手困惑的行为:

- 它为什么这么流畅?因为流畅(下一个词接得顺)正是它被训练的**唯一目标**。
- 它为什么会一本正经地胡说?因为它追求的是"像不像一句合理的话",而不是"是不是真的"。
- 它为什么同一个问题两次答得不一样?因为"下一个词"是从一个概率分布里**抽样**出来的,不是查表查出来的。

请把这句话刻进脑子,它是本书第一心法的种子:**流畅不是正确性的证据。** 一段话写得越像专家,你越应该警惕,因为"写得像专家"是模型的**默认属性**,不是它对内容负责的信号。

> [!warning] 一个必须破除的误解
> "参数直答"(模型不查任何资料、直接凭训练时记住的东西回答)**不是**一次带来源的知识查询。它更像一个读过海量书、但手边一本书都没有的人在凭记忆复述——大方向常对,具体的人名、数字、年份、引文、链接极不可靠。

## 1.2 幻觉:不是 bug,是生成系统的固有属性

"幻觉"(hallucination)指模型生成了**听起来合理但实际错误或根本不存在**的内容。新手最常见的反应是"这是个 bug,以后会被修好"。不会。幻觉是"生成"这个机制的固有产物,只能被**治理**,不能被根除。

理解它的成因,就知道什么时候该警惕。模型在生成时,无论手里有没有足够证据,它都会**倾向于给出一个"像答案"的续写**——因为它的训练目标就是"接得像模像样",而不是"证据不足时闭嘴"。于是:

- **越冷门、越具体的事实,幻觉率越高。** 问"《红楼梦》的作者是谁"很安全(这句话在训练数据里出现过无数次);问"某本小众书第 3 章第 2 段讲了什么"就极度危险(模型很可能现编一段)。
- **人名、数字、引文、链接、法条编号**是幻觉重灾区。这些东西"格式很固定、内容却因具体而稀有",模型最容易编出一个格式正确但内容虚构的版本。

**实操准则**:凡是关键的、可核查的事实(尤其是要拿去做决策或发给别人的),要么让 AI 联网核查并给出来源,要么你自己去搜索引擎/原始资料核对。**没有出处的事实性回答,默认按"草稿"对待,验证之后才能当"事实"用。**

## 1.3 能力地图:它在哪里强,在哪里弱

用好一个工具的前提,是知道它**在哪里会失败**(这是本书第二心法)。LLM 的能力有一张相当清晰的地图:

**强项(放心用)**——这些任务的共同特征是"答案不唯一、重在流畅和结构、错了你一眼能看出来":
- 改写、润色、变换语气
- 总结、提炼要点
- 翻译
- 头脑风暴、给点子
- 解释概念、打比方
- 写初稿(邮件、大纲、文案)

**弱项(要么别用,要么必须验证)**——这些任务需要"精确、唯一、可验证的正确答案":
- 精确的事实(尤其冷门事实)
- 数学计算(它是在"续写一个看起来对的算式",不是真在算)
- 最新信息(训练有截止日期,之后的事它不知道)
- 数长文本的字数 / 数第几个字(它看到的是 token 不是字符,这类任务超出它的感知粒度)

1. **LLM 的一句话工作方式**:从海量文本学习统计结构,再逐个 token 生成可能的续写。语言建模可以从压缩式预测理解,但参数直答不是带来源的知识查询——所以流畅不是正确性的充分证据。
2. **幻觉是生成系统需要治理的固有风险**:模型会在缺少足够证据时仍生成“像答案”的文本,但成因不只一种,不能全部归结为有损压缩。越冷门、越具体(人名、数字、引文、链接)的事实,越应要求可核查来源。
3. **能力地图**:强——改写、总结、翻译、头脑风暴、解释概念、写初稿;弱——精确事实、数学计算、最新信息、数长文本的字数。
4. **对话是无状态的**:模型没有记忆,"记忆"是每次把历史重发一遍。上下文窗口有限,太长的对话会"忘头"。
5. **温度与随机性**:同一问题两次答案不同是特性。重要任务问两遍,比较答案是免费的质检。
6. **主流产品版图**:对话产品(Claude、ChatGPT、Gemini)、API、开源模型三条线的区别与适用场景。
一个可迁移的判断法:**如果验证一个答案比你自己从头做还费劲,就不该把这件事交给 AI。** 反过来,如果"生成很难、但验证很容易"(比如让它写十个标题你挑一个),那就是 AI 的黄金场景。这条"验证成本 < 生成成本才值得委托",是本书贯穿始终的第三心法,也是你将来设计 Agent 时的分工原则。

## 1.4 对话是"无状态"的:AI 没有记忆

这是最反直觉、也最有用的一个认知。你和 AI 聊了二十轮,感觉它"记得"你前面说的话。真相是:**模型本身没有任何记忆。**

它是怎么做到"记得"的?每次你发新消息,程序都会把**从头到尾的完整对话历史**重新打包发给模型,模型每次都是"第一次"读这整段历史,然后续写。所谓"记忆",只是每一轮都把过去重发一遍造成的错觉。

这个事实一次性解释了两个现象,也预告了后面好几章的核心问题:

1. **长对话会"忘头"。** 模型能一次读进的文本量是有限的(这个上限叫**上下文窗口**)。对话太长,超出窗口的最早内容会被截断,于是它真的"忘了"开头说过什么。
2. **长对话越来越贵、越来越慢。** 因为每一轮都要重发全部历史,历史越长,每次处理的文本越多。

(到第 5 章你会亲手写代码维护这个"历史列表",那时你会彻底告别"AI 有记忆"的错觉;第 8 章讲的"记忆架构"和"上下文工程",本质都是在管理这个有限的窗口。)

## 1.5 温度与随机性:同问不同答是特性,不是故障

前面说过,"下一个词"是从概率分布里**抽样**的。控制这个抽样有多"放飞"的参数叫**温度(temperature)**:

- 温度高 → 抽样更随机 → 输出更多样、更有创意,也更容易跑偏
- 温度低(趋近 0)→ 每次都挑概率最高的词 → 输出更确定、更稳定

对你现在最有用的推论是一条**免费的质检技巧**:重要的问题**问两遍**(或另开一个对话再问一次),比较两次答案。如果两次说法一致,可信度较高;如果两次自相矛盾,这本身就是一个强烈的"低置信度"信号——说明模型对这件事其实没把握。这几乎不花成本,却能挡掉相当一部分幻觉。

## 1.6 产品版图:对话产品、API、开源模型

同样的底层模型,有三种用法,适用场景不同,现在有个大致印象即可:

- **对话产品**(Claude、ChatGPT、Gemini 等):网页/App 里直接聊天,开箱即用,本章你只需要这个。
- **API**:用代码调用模型,把它变成你自己程序里的一个"组件"——这是第 5 章的分水岭,也是从"用 AI"到"造 AI 产品"的跨越。
- **开源模型**:模型权重公开,可以下载到自己的机器/服务器上跑。适合数据不能外传、或要深度定制的场景,代价是你要自己承担部署运维(第 12 章会谈)。

现阶段的建议非常明确:**先把一个对话产品用到极致。** 不要急着碰 API,把"和 AI 高质量对话"这件基本功打扎实——它是后面一切的地基。

---

## 练习

1. 让 AI 分别写一封辞职信的三个版本(正式/温和/简短),观察指令措辞如何改变输出。
2. 故意诱导幻觉:问一个不存在的书名的内容简介,观察模型如何编造;再问"这本书存在吗",比较差异
3. 把一篇 3000 字文章分别要求压缩成 100 字、3 个要点、1 条推文,体会"格式约束"的威力
4. 同一个数学题(如 3 位数乘法)问 5 次,统计正确率——建立"LLM 不是计算器"的体感。
1. 让 AI 分别写一封辞职信的三个版本(正式 / 温和 / 简短),观察指令措辞如何改变输出。**观察重点**:你只改了一个形容词,输出结构就变了——这就是"指令即规格"的第一次体感
2. 故意诱导幻觉:问一个**不存在**的书名的内容简介,观察模型如何编造;再问"这本书真的存在吗",比较两次差异。**观察重点**:它编得多流畅、多自信
3. 把一篇 3000 字文章分别要求压缩成 100 字、3 个要点、1 条推文,体会"格式约束"如何塑造输出
4. 同一个 3 位数乘法问 5 次,统计正确率——亲手建立"LLM 不是计算器"的体感。

## 项目

**七日 AI 工作流日记**:连续 7 天,每天用 AI 完成一件真实任务(写邮件、做计划、学概念、分析文档),记录:任务、你的指令、输出质量评分(1-5)、你做了什么修正。第 7 天写一页总结:AI 在你的生活里最强/最弱的三个场景。这份日记是你后续所有章节的"需求来源"。
**七日 AI 工作流日记**:连续 7 天,每天用 AI 完成一件真实任务(写邮件、做计划、学概念、分析文档),记录四栏:任务、你的指令、输出质量评分(1-5)、你做了什么修正。第 7 天写一页总结:AI 在你的生活里最强 / 最弱的三个场景各是什么。

这份日记不是练习,是**资产**——它是你后续所有章节的"真实需求来源"。当第 3 章让你优化 prompt、第 5 章让你选项目时,你会回来翻它。

## 阅读资料

Expand All @@ -60,13 +142,14 @@ tags: [AI教程, LLM入门, Prompt]
4. 出 3 道检验我是否真懂的问题,等我回答后再点评
```

这个 prompt 模板体现了本章核心技能:把 AI 从"答题机"变成"苏格拉底式私教"。
这个模板体现了本章核心技能:把 AI 从"答题机"变成"苏格拉底式私教"。注意第 4 步——**让它出题考你、而不是直接告诉你答案**,是把 AI 用成学习工具而非答案工具的关键分野

## 推荐 Agent

- **Claude / ChatGPT 对话产品本体**——本章不需要任何专门工具,先把对话用到极限
- **NotebookLM**:上传你的七日日记,让它生成回顾问答,体验"基于你自己资料的 AI"
- **NotebookLM**:上传你的七日日记,让它生成回顾问答,体验"基于你自己资料的 AI"(这是第 6 章 RAG 的直觉预演)
- 若你用 Obsidian:从本章起建一个 `AI学习` 目录,所有练习产出直接入库——你在同时练习知识管理

## 自测题

1. **为什么参数直答不能当作事实来源?这个认知改变你的哪些使用习惯?**
Expand Down
Loading
Loading