第 31 章 · AI 如何改变 Crypto Research
AI 给出的结论,凭什么可以相信?
- 练习的能力
- AI LiteracyResearch
- 动手
- 搭一条自己的研究流水线:搜集 → 抽取 → 对比 → 验证 → 打分 → 监控,先用一个项目跑通。
- AI Lab
- 让 AI 输出一份研究结论并附来源,你逐条打开来源,统计有多少条经不起核对。
一个现实问题
周一早上,你要在两小时后的会上讲一个你从没听说过的协议。
你把它的名字丢给一个 AI,加了一句「帮我做一份研究简报」。三分钟后你拿到一份三页的东西:它解决什么问题、收入怎么来、代币怎么分配、有哪些风险。分节整齐,语气克制,还附了九个链接。
你把它发进群里。十分钟后,一个同事回了一句:
「这里写的费率是 0.05%,你在哪看的?」
你点开那一条后面的链接。它指向一篇中文解读文章。文章里确实写了 0.05%,并且注明「据官方文档」。你再去翻官方文档,发现文档里现在写的是另一个数,而且页面底部标着几个月前的更新时间——中间有过一次治理投票改了这个参数。
你有点慌,开始逐条点开其余八个链接。结果是:三条能打开并且确实支持那句话,两条打开了但里面根本没提这件事,两条指向的是同一篇二手文章,还有一条是 404。
这份简报没有一句话是明显胡说的。它读起来比你自己两小时能写出来的东西更专业。问题在于你没有任何办法知道,哪几句是真的。
于是本章的问题:AI 给出的结论,凭什么可以相信?
注意这个问题不是「AI 能不能用于研究」。它当然能,而且提速非常明显。真正的问题是:一份混着事实、过期信息和合理猜测的输出,你怎样把它们分开。
如何跟上最新的 Crypto 知识那一页给过一条六步的研究流水线。这一章要做的不是重复它,而是补上它最难的一步:每一条结论的可信度,怎样被单独标出来。
思想实验
三个研究员,同一个陌生协议,同一小时,各交一份东西。
甲全手工。 他打开官方文档、治理论坛和一个区块浏览器,一页页读。一小时后,他交上来 6 条结论。每一条他都能说出是在哪个页面的哪一段看到的,其中 2 条他标了「不确定,文档写得含糊」。
乙全交给 AI。 他给了协议名字和一句要求,把输出复制过来,改了改错别字。一小时里他实际只花了 8 分钟。他交上来 23 条结论,覆盖面比甲宽得多——甲完全没提到的合规状况、竞争格局、团队背景,乙的报告里都有。
丙用 AI 搜集,自己核对。 他先让 AI 列出「要判断这个协议,需要查清楚的 12 件事」,然后自己去一手来源逐个查,把原文段落贴回给 AI,让它按统一格式整理成表。一小时后他交上来 11 条结论,每条后面有一个链接和一句「我是在这一段看到的」。
现在开始检验。找一个真的熟悉这个协议的人,逐条核对。
| 甲(全手工) | 乙(全 AI) | 丙(AI 搜集 + 人工核对) | |
|---|---|---|---|
| 交出的条数 | 6 | 23 | 11 |
| 经得起核对的 | 6 | 14 | 11 |
| 明确错误的 | 0 | 5 | 0 |
| 无法核对的 | 0 | 4 | 0 |
| 覆盖的面 | 窄 | 最宽 | 中等 |
乙的报告里,正确的条数(14)比甲和丙都多。这一点必须说清楚,否则这个实验就变成了一个反 AI 的宣传。乙确实产出了最多的正确信息,而且他只花了 8 分钟。
但接着看第二周发生了什么。
这份报告被拿去做了一个决定。 会上有人引用了乙报告里的一条——那条恰好在错误的 5 条里。决定做完,三周后出了问题,复盘时才发现源头在这里。
这时候真正的差别才显出来:甲和丙可以指着任何一条结论说「这句话我是在这里看到的」,乙不能。 乙的 23 条里,有 14 条是对的,但他自己也不知道是哪 14 条。
所以这个实验的结论不是「AI 不可靠」,而是一件更具体的事:
一份没有标出可信度的报告,它的价值等于其中最弱的那一条。
因为使用者无法挑选,他只能整份信或者整份不信。而整份信的代价,在真的出事之前是看不见的。
你来决定
你现在要为一个投资会议准备这份简报。两小时。你怎么做?
观察结果
四个选项指向同一个结构:一份报告里的每一句话,可靠性完全不同,必须被分开对待。
把任何一份研究输出里的句子拆开,它们只可能是三类:
| 类型 | 长什么样 | 怎样核对 | AI 在这里可靠吗 |
|---|---|---|---|
| 可核对的事实 | 合约地址、参数、代币总量、某次治理投票的结果、某个日期 | 打开一手来源,逐字对 | 不可靠。它会编,而且编得很像 |
| 口径依赖的数字 | 收入、TVL、活跃地址、收益率 | 先确认口径和时间,再自己重算 | 更不可靠。它常常连口径都说不清 |
| 推断与判断 | 这个机制有什么风险、这个模式能不能持续、竞争格局怎样 | 无法核对,只能看论证过程 | 相当有用。这是它最该干的活 |
这张表解释了一件反直觉的事:AI 在研究里最不可靠的部分,恰好是大多数人最依赖它的部分。
人们用它来「快速了解事实」,而它在事实上最容易出错;人们不太敢用它来「形成判断」,而那恰好是它能提供真实价值的地方——因为判断本来就不该被直接采信,你天然会去检查它的论证。
第二类值得单独说。口径错误比编造更难发现,因为数字本身是真的,只是它回答的不是你以为的那个问题。把激励支出算进协议收入,把全稀释估值当成市值,把桥过来的资产重复计入两条链的锁仓量——这些数字都能在某个页面上找到,都不算「编造」,但用它们做的判断全错。第 19 章和第 26 章都花过篇幅处理这件事,在这里它变成了一个针对 AI 输出的固定检查项。
所以研究流程真正要改变的不是「用不用 AI」,而是一件更小的事:
让每一条结论带上它自己的可信度,而不是让整份报告共享一个可信度。
建立模型
一、按「错了能不能被发现」来分工
决定一件事交不交给 AI,不看它做得好不好,看它做错的时候你能不能发现。
| 任务 | 交给 AI | 理由 |
|---|---|---|
| 列出「这类协议要查哪些事」 | 可以 | 错了只是多查一项,代价接近零 |
| 翻译一段官方文档原文 | 可以 | 原文在手边,错了一眼能看出来 |
| 把你贴进去的原文抽成结构化的表 | 可以 | 它不需要回忆,只需要搬运 |
| 把三个协议的机制放进同一张对照表 | 可以,但要核对每一格 | 结构是它的强项,格子里的内容仍是事实 |
| 指出「这份分析还缺哪些数据」 | 可以,而且价值很高 | 这一步的产出是问题,不是答案 |
| 直接回答「这个协议的手续费是多少」 | 不可以 | 它会给一个数,而你无从判断 |
| 直接回答「这个协议现在的收入是多少」 | 不可以 | 口径和时间它都说不清 |
| 概括一份你没读过的审计报告 | 不可以 | 你没读过,就无法发现它漏掉了什么 |
最后一条是一条通用规则,值得单独记:不要让 AI 概括一份你不打算自己读的文件。 概括的价值在于帮你决定读不读,而不在于代替读。
二、六步流水线,重点在后两步
如何跟上最新的 Crypto 知识给过一条六步链路:搜集、抽取、对比、提问、验证、监控。那一页讲的是每一步做什么。这一章把它改成研究一个具体项目时的版本,并且把重量压在最后两步上:
- 搜集
- 抽取
- 对比
- 验证
- 打分
- 监控
| 步 | 谁做 | 做到什么程度算完成 |
|---|---|---|
| 1 搜集 | AI 提清单,你找来源 | 每一项都有一个可以打开的一手来源,不是「据说」 |
| 2 抽取 | AI | 把原文变成字段:名称、数值、单位、时间、来源位置 |
| 3 对比 | AI | 同类项目放进同一张表,差异单列一栏 |
| 4 验证 | 只能是你 | 逐条打开来源,确认原文真的这么写 |
| 5 打分 | 你 | 给每一条结论标一个证据等级 |
| 6 监控 | AI + 自动检查 | 参数、治理提案、合约升级、解锁日程有变化时提醒你 |
第五步是这一章新增的那一步,也是最容易被跳过的一步。 跳过它的后果在思想实验里已经出现过:乙的报告有 14 条是对的,但没人知道是哪 14 条。
三、证据等级:四档就够了
给每一条结论标一个等级。不要设计复杂的评分体系,四档最好用,因为它们对应四种完全不同的后续动作:
| 等级 | 含义 | 可以怎样使用 |
|---|---|---|
| E0 已验证 | 我打开了一手来源,原文确实这么写,我记下了位置和时间 | 可以写进结论,可以据此做决定 |
| E1 二手一致 | 两个以上互相独立的二手来源说法一致,但我没看到一手原文 | 可以写进报告,必须标注为待验证 |
| E2 模型输出 | 只有 AI 说了这件事,我还没核对 | 不能出现在结论里,只能留在待办清单上 |
| E3 推断 | 这不是事实,是我或模型的判断 | 可以写,但必须写清楚依据和它可能错在哪 |
一条硬规则:E2 不允许进入任何被别人读到的段落。 它要么被核对成 E0,要么被降级成「我们还不知道」。
这条规则的实际效果是:你的报告会变短。这是对的。 一份 11 条全是 E0 和 E3 的报告,比一份 23 条混着 E2 的报告有用得多,因为前者可以被使用,后者只能被重做一遍。
四、结论卡:让每一条都能被单独检查
要让打分可执行,结论必须有固定的格式。一条结论应该长这样:
结论: 这个协议对每笔交易收取 X% 的手续费,其中 Y% 归国库
证据等级: E0
来源: 官方文档「Fees」一节 / 治理提案第 N 号
我看到的原文:(贴一段,不超过三行)
取数时间: 某年某月某日
口径说明: 这是协议层收费,不含前端额外加价
如果它错了:会影响到「协议收入」那一节的全部推算最后两行是这张卡的价值所在。「口径说明」拦住第二类错误,「如果它错了」让读者知道这一条有多重要——有些结论错了无关紧要,有些错了整份报告作废,它们不该被同等对待。
这个格式看起来很啰嗦。实际做起来,AI 可以帮你填前面几行,你只需要填「我看到的原文」和「口径说明」这两行。而这两行恰好是无法外包的两行。
五、一条报告级的自检
整份报告写完,问三个问题:
- 如果把所有 E2 删掉,这份报告还剩什么? 剩得太少,说明你做的是编辑工作,不是研究工作。
- 最重要的那三条结论,分别是几级? 如果一份报告的核心论点建立在 E1 和 E2 上,它的结论强度不该是「我认为」,而是「如果这几件事成立,那么」。
- 有哪些事我查过但没查到? 这一条最容易被省略,也最有信息量。查不到本身就是一个发现——一个连收入口径都不公开披露的协议,这件事值得写进报告,而不是在报告里留一处空白。
它叫什么
前面那些动作,每一个都有名字。
把和这个问题相关的材料找出来。
关键区别在于材料从哪来:让模型「凭记忆回答」和让模型「读你给它的这份文档再回答」,是两件完全不同的事。 前者的产出是回忆,后者的产出是阅读理解。
回忆会受知识截止时间限制,也会在缺口处自动补全;阅读理解不会——原文里没有的东西,一个被明确约束过的模型会说「文档里没写」。
所以搜集这一步最重要的动作,是把一手来源真的送到模型面前,而不是提一个名字让它自己想。
把一段自然语言的原文,变成一组带字段的数据:名称、数值、单位、时间、来源位置。
这是 AI 在研究里最可靠的一类任务,因为它不需要回忆任何东西。同样一件事,问它「这个协议的费率是多少」它可能编,把文档那一段贴给它让它抽出费率,它几乎不会错。
这个差别值得记住:同一个模型,在「回忆」和「搬运」两种模式下的可靠性相差极大。 你的提示词决定它进入哪一种模式。
要求模型输出固定字段的结构,而不是一段自由文字。
它在研究里的作用不是好看,是让缺失变得可见。一段自由文字可以把「我不知道」藏在流畅的叙述里;一张要求填「取数时间」和「来源位置」的表格藏不住——那一格要么有东西,要么是空的。
这也是AI 在 Crypto OS 中的位置那条安全链路里的同一层:把自由文本变成字段,是后面所有校验能够存在的前提。 在研究里它拦住的是错误信息,在资金操作里它拦住的是错误交易,机制是同一个。
打开来源,确认原文真的支持这句话。
有三种常见的失败,它们看起来都像「有来源」:来源打不开(链接失效或根本不存在)、来源打得开但不支持这句话(模型把两段无关的内容缝在了一起)、来源是二手的(它引用的是一篇转述文章,而不是文档本身)。
核对一条来源平均只要几十秒。这件事的成本一直被高估,而它的收益是整份报告能不能被使用。
把一次性的结论,变成一个会持续跑的检查。
研究报告的保质期比大多数人以为的短得多。参数会被治理投票改掉,合约会被升级,团队会更换,解锁会到期。一份三个月前完全正确的报告,今天可能有三分之一不成立。
监控要盯的不是价格,是那些会让你的结论失效的变量:你在报告里依赖的那几个参数、相关的治理提案、合约的升级事件、代币的解锁日程。这一步天然适合自动化,也是 AI 在研究链路里唯一可以长期无人值守的位置——因为它的产出是「有变化,你来看」,而不是一个结论。
把模型收成一句话:
AI 负责搜集与假设,事实必须回到一手来源与链上数据。
具体做法是给每一条结论标一个证据等级,并且规定:未核对的,不许进入结论。
动手
选一个你不熟悉的协议。不熟悉是必要条件——用熟悉的项目做这个练习,你会在不知不觉中用已有的知识替模型补全,测不出任何东西。
给自己 90 分钟。目标不是做出一份好报告,是跑通一次流程并留下记录。
搜集:先让 AI 出题,不要让它答题。
我要研究一个「某某类型」的协议。在我给你任何具体信息之前,
请列出要判断这一类协议,必须查清楚的 12 件事。
每一件事写三行:
1. 要查什么(具体到一个数字或一个事实,不要写「了解它的机制」)
2. 通常在哪里能查到(文档的哪一节、治理论坛、链上、审计报告)
3. 如果查不到,说明什么
不要提到任何具体项目,也不要猜任何数字。注意这个提示词里没有出现项目名字。 这是有意的:一旦给出名字,模型会开始回忆,而回忆正是我们要避开的模式。
把这 12 项抄进一张表,加三列:来源、证据等级、取数时间。这张表就是你这次研究的骨架。
抽取:自己去找原文,把原文贴回给 AI。
逐项打开一手来源:官方文档、治理论坛的提案原帖、审计报告、区块浏览器上的合约页面。每找到一段相关原文,就贴给 AI 让它抽字段:
下面是我从「来源名称」复制的原文。请只根据这段原文,抽出:
名称 / 数值 / 单位 / 生效时间 / 这段话在原文的哪个小节。
原文里没有写的字段,写「原文未提及」,不要补全,不要推测。
原文:
(贴进来)「原文未提及」这四个字是这一步的关键。 如果模型在这里开始替你补全,换一个更严格的说法再试一次。
对比:把它放进同类里。
找两个同类协议,让 AI 把三者放进同一张表。只用你已经贴过原文的字段,其余留空。
把下面三个协议的这几项放进一张对照表,最后加一栏「最大的差异在哪」。
只使用我提供的内容,凡是我没给的,那一格填「未查」。空格会很多。空格是这一步最有价值的产出——它们告诉你下一个小时该去查什么。
验证:这一步不许用 AI,逐条打开来源。
回到第一步那张表,一行一行地问:这句话我真的在原文里看到了吗?在哪一段?
特别检查这三类:
□ 任何带小数点的数字 → 回原文逐位核对
□ 任何「协议收入」类指标 → 口径是什么?含不含激励?取数时间?
□ 任何来自二手文章的说法 → 追到它引用的那份一手文档每核对完一条,记下花了多少秒。做到第十条时你会发现,平均耗时比你开始前估计的少得多。
打分:给每一条标等级,然后把 E2 全部拿掉。
按四档标:E0 已验证、E1 二手一致、E2 只有模型说过、E3 推断。
标完之后做一件事:把所有 E2 从报告正文里删掉,移到一个叫「待核实」的清单里。
删完之后看剩下的部分。如果剩下的少于一半,这次练习的最重要的一课你已经拿到了。
监控:写出三个会让你的结论失效的变量。
变量 1: (例如某个参数被治理改动)
在哪里能看到变化: (治理论坛 / 合约事件 / 官方公告)
变了之后,我哪一条结论会失效:
检查频率:写完之后,至少给其中一个变量设一个真实的提醒——一个日历提醒也算。这一步的意义是让你体会到:研究的产出不是一份文档,是一个需要维护的状态。
做完之后你会有:一张 12 项的表、每项的来源和等级、一份「待核实」清单、三个监控变量。
这套东西就是毕业项目里研究报告的骨架。 从现在开始,你研究的每一个项目都用这张表,一个季度之后你会有一套属于自己的、可复用的研究系统。想把这套流程真正做成能跑的工具,那是 T31 的内容。
AI Lab
这个任务的目的不是评价某个模型,是让你得到一个属于你自己的数字。这个数字会改变你以后读任何 AI 输出的方式。
选一个你能验证的协议——最好是你上一个 Lab 刚查过的那个,因为你手里已经有一手来源了。
请给我一份关于「某协议」的研究简报,包含 15 条具体结论。
硬性要求:
1. 每一条结论后面必须附一个可以打开的链接,并注明这句话
对应来源里的哪一节或哪一段。
2. 每一条标注证据类型:一手文档 / 治理提案 / 链上数据 /
二手分析 / 我的推断。
3. 每一个数字都要写清楚单位、口径和取数时间。
4. 凡是你不确定的,单独列在最后一节「我不确定的部分」,
不要写进正文,也不要用模糊措辞掩饰。
5. 不要为了凑满 15 条而补充泛泛的行业常识。
宁可给 8 条具体的,也不要 15 条正确的废话。拿到之后,打开一个计时器,逐条核对,记录每一条花了多少时间。
把结果填进这张表:
总条数:
链接打不开的:
链接能打开但不支持这句话的:
来源是二手的:
数字口径错误或缺失时间的:
完全经得起核对的(E0):
核对全部 15 条总共花了: 分钟最后那一行是这个练习真正想让你看到的东西。 大多数人第一次做完会发现:核对的总时间远小于自己的预期,而经得起核对的比例也远低于自己的预期。这两个数字放在一起,就是「以后要不要核对」这个问题的答案。
几个可以预期的现象,看到了不必惊讶:
- 链接的问题比内容的问题更多。 模型生成链接的机制和生成句子是同一个,所以它会造出结构正确但不存在的地址。
- 越具体的数字越容易错。 「大约百分之几」通常没问题,「0.05%」这种精确值出错率明显更高。
- 它很少说「我不确定」。 即使提示词里明确要求了,那一节往往也是空的或者只有一两条无关痛痒的。这不是模型在撒谎,是它确实没有可靠的方式知道自己不知道。
- 同一个问题问两次,答案可能不同。 这是一个很有用的探针:答案不稳定的地方,通常就是它在编的地方。 你可以把关键的几条重新问一遍,看它变不变。
把这次的三个数字记下来,一个季度后再做一次同样的练习。你会发现变化的主要不是模型,是你的提示词——以及你的核对速度。
AI 说完之后,你必须自己验证
- 每一个链接能不能打开——先统计死链数量,这是最快的一项检查
- 能打开的链接里,页面上是否真的有支持那句话的内容,还是模型把两处无关内容缝在了一起
- 来源是一手的还是二手的——指向解读文章、聚合网站、社交平台的,一律记为二手
- 所有带小数点的数字,回原文逐位核对,特别是费率、比例和阈值
- 所有「收入」「锁仓」「活跃」类指标,口径写清楚了吗,取数时间写清楚了吗
- 有没有把全稀释估值当成市值,把激励支出算进协议收入,把桥接资产重复计入两条链
- 它引用的文档版本,是不是已经被后来的治理提案改过
- 它标为「不确定」的条目,是真的不确定,还是它把一个确定的事实说成了不确定
- 最后统计三个数:总条数、E0 条数、经不起核对的条数
真实案例
有一类错误的传播路径高度一致:模型在一篇报告里给出一个协议参数,这个参数被写进一篇中文解读,解读被另一个人引用,再被下一个模型当作训练或检索材料读到。
几轮之后,这个参数在互联网上有了好几处「来源」,看起来互相印证。 但把每一条追到底,会发现它们追向同一个起点,而那个起点是一次生成。
这个现象对研究方法的含义很具体:「有多个来源都这么说」不等于已验证。 判断标准不是来源的数量,是这些来源彼此独立吗。三个二手来源互相抄,证据强度不如一份一手文档。
这也是证据等级里 E1 必须和 E0 分开的原因。E1 是「两个独立二手来源一致」,而「独立」这个词需要你亲自确认。
一份分析给出某协议的年化收入,数字确实能在一个数据平台上查到。问题出在它把两件事加在了一起:用户支付的手续费,和协议为了吸引这些用户而发出去的激励对应的名义价值。
前者是收入,后者是成本,而且是用代币支付的成本。两者相加得到的数字在任何一个会计口径下都不成立,但它看起来很正常,因为它确实是两个真实数字的和。
用这一章的框架看,这属于第二类错误——数字是真的,但它回答的不是你以为的那个问题。 这类错误无法靠「核对来源」发现,因为来源确实这么写。它只能靠一个动作发现:自己把这个数字重算一遍,并且写出口径。
第 26 章那张五行损益表在这里就是核对工具:把收入、成本、激励分行列出,加不起来的地方就是口径出问题的地方。
一个协议通过治理投票修改了一个关键参数。链上的合约立刻生效,治理论坛上有完整的提案和投票记录,但官方文档的对应页面几个月后仍写着旧值。
于是出现了一个尴尬的局面:最权威的那份文档是错的,而正确答案在链上和治理帖里。
这件事说明「一手来源」需要再分一层:链上状态 优先于 治理记录 优先于 官方文档 优先于 一切二手内容。 前面的东西无法被后面的东西推翻——如果文档和链上不一致,以链上为准,并且把这个不一致本身写进报告。
第 23 章讲过怎样直接去链上读这类状态。在 AI 时代这项能力变得更重要了,因为它是你唯一不依赖任何人转述的信息通道。
把 AI 从研究流程里的位置调对以后,节省的时间不是均匀分布的。
几乎不省时间的:核对事实、读审计报告、确认口径。这些工作本来就必须由人做,而且做不快。
省一点时间的:写作与整理。把已经查清楚的东西组织成一份可读的报告,从一小时变成二十分钟。
省很多时间的:出题、翻译原文、把三个协议放进同一张表、从一份长文档里定位到相关段落、把结论变成持续监控。这几项加起来,原本可能占掉一次研究一半以上的时间。
所以「AI 让研究快了多少倍」这个问题问错了。它没有让研究整体变快几倍,它是把研究里那些机械的部分几乎归零,让你把全部时间花在核对和判断上。 而这两件事,恰好是研究里唯一无法外包的部分。
改一个变量
模型在这里几乎完全失效——它的训练数据里没有这个项目,检索到的也只有项目方自己的宣传材料。
这时候 AI 的价值不降反升,但位置要换。 它不再是信息来源,而是两样别的东西:一个出题器(这一类协议通常有哪些坑,要查哪 12 件事)和一个原文处理器(把它的合约代码、白皮书、官方推文贴进去,让它抽结构)。
注意一个特殊风险:在缺乏外部信息时,模型会更多地采信你贴给它的材料。 而你贴进去的如果是项目方的宣传文案,它会把宣传语气一起继承下来。对策是在提示词里明确:「下面这份材料来自项目方,请把其中的主张和事实分开列。」
新协议真正的信息在链上——合约部署时间、权限地址、初始流动性来源、早期交互地址的构成。这些东西没有任何一手文档,但它们全部可以被直接读出来。
可靠性会明显上升,因为模型从「回忆」切换到了「阅读」。这是本章推荐的用法。
但有两个新问题会出现。第一个是它仍然会在文档没写的地方补全。 文档里没有的东西,它有时会用常识填上,而且不会标注。对策是在提示词里强制要求:文档未提及的,必须写「文档未提及」。
第二个更隐蔽:文档本身可能是错的或过期的。 上面那个案例已经说明,最权威的文档也会和链上不一致。把文档喂进去解决的是「模型有没有胡说」,解决不了「文档对不对」。
所以这个做法的正确定位是:它把第一类错误(编造)降到很低,对第二类错误(口径)帮助有限,对文档本身的过期问题完全无效。
打分那一步还需要吗?
更需要。 因为报告给别人看时,至少还有别人会来质疑你;只给自己看时,没有任何人会拦住你把一条 E2 当成事实用掉。
而且三个月后你重读自己的报告时,你会完全不记得哪一条是自己核对过的、哪一条是模型说的。那时候没有标记的报告,整份都只能当成 E2 重做一遍。
这里有一个很实际的建议:证据等级不是写给读者的,是写给三个月后的自己的。 从这个角度看,个人研究笔记比对外报告更需要它。
这解决了知识截止时间的问题,也大幅减少了死链。但它不解决本章的核心问题。
原因是它改变的是「能不能拿到信息」,而本章处理的是「拿到之后怎样判断它对不对」。联网之后会出现三个新问题:它检索到的可能是一篇二手解读而不是一手文档(而它不一定分得清)、它可能读到一个已经过期的页面、它读到互相矛盾的两个来源时会自己挑一个,而不告诉你另一个的存在。
最后一条最危险,因为它把一个「这件事有争议」的状态,悄悄变成了一个确定的答案。
所以联网之后清单要改,不是取消。改法是:从「这个链接存不存在」转向「它为什么选了这个来源,有没有更权威的来源说了不同的话」。 一个可以直接加进提示词的要求是:如果不同来源说法不一致,全部列出来,不要替我选。
带走的问题
这一章是 AI 六问里第一次真正回答第 13 问的地方。答案很具体:AI 在研究里降低的是搜集成本、翻译成本、结构化成本和监控成本,它不降低验证成本。
这句话的实际含义是:一份研究的总时间不会因为用了 AI 就下降 90%,但时间的构成会完全改变。 原来可能一半时间在找资料、一半时间在核对和思考,现在是一成时间在找资料、九成在核对和思考。
判断一个 AI 研究流程有没有用对,就看这个比例。如果用了 AI 之后你核对的时间也变少了,那不是提速,是把风险藏了起来。
一份 AI 生成的研究报告出了错,谁承担损失?
答案毫无悬念:署名的那个人。 模型不承担任何后果,「仅供参考」也不转移任何责任。
这一问在本章有一个非常具体的用法:在你把报告发出去之前,问自己——如果这里面某一条是错的,出问题的会是谁,会损失什么。 如果答案是「一位同事会据此做一个几十万的决定」,那么这份报告里不允许存在任何 E2。
这也解释了为什么打分那一步不能省。不是为了严谨,是因为出事时你需要能说清楚:哪些结论我核对过,哪些我明确标过没核对。 这两句话的区别,是专业和不专业的区别。
研究流水线里,哪一步必须保留人?
验证那一步,而且只有那一步是绝对的。 其余五步都可以交出去,唯独「打开一手来源确认原文真的这么写」不能,因为这一步的错误是静默的——做错了不会报错,只会在几周后以另一种形式出现。
还有一个更微妙的地方:「这件事值不值得研究」这个判断也必须是人的。 模型会把你给它的任何问题都认真回答一遍,包括那些根本不该问的问题。研究里最大的浪费不是查错了,是花三天研究了一个不重要的东西。
本章自测
三类:可核对的事实(地址、参数、日期)、口径依赖的数字(收入、锁仓、活跃)、推断与判断(风险、可持续性、竞争格局)。
AI 在第三类上最可靠,在第一类和第二类上最不可靠。这恰好和大多数人的用法相反——人们用它「快速了解事实」,而事实是它最容易出错的地方;不太敢用它形成判断,而判断本来就不会被直接采信,你天然会检查它的论证。
第二类最危险,因为数字是真的,只是口径不对。它无法靠核对来源发现,只能靠自己重算一遍。
因为第二个模型手里同样没有一手来源,它只能靠「这看起来合不合理」来判断。而第一个模型编造出来的东西,正是「看起来合理」的那一类。
两个不可靠的组件串起来不会变成可靠的组件,而且它们的错误方式高度相关——它们倾向于在同一个地方一起错。
有一种例外情况:如果第二个模型被给予了它能实际打开的一手来源,并被要求逐条比对原文,那它做的是「比对」而不是「判断」,那是有效的。区别在于它手里有没有可以对照的东西。
E0 已验证(打开过一手来源,原文确实这么写)、E1 二手一致(两个以上彼此独立的二手来源说法一致)、E2 模型输出(只有 AI 说过,还没核对)、E3 推断(不是事实,是判断)。
硬规则只有一条:E2 不允许出现在任何会被别人读到的段落里。 它要么被核对成 E0,要么被写成「我们还不知道」。
执行这条规则的直接后果是报告变短。这是对的——一份 11 条全是 E0 和 E3 的报告可以被使用,一份 23 条混着 E2 的报告只能被重做一遍。
关于 E1 有一个容易忽略的点:「独立」需要你亲自确认。三个互相抄的二手来源,证据强度不如一份一手文档。
要。顺序是:链上状态 → 治理记录 → 官方文档 → 一切二手内容。
原因是快速迭代的协议里,参数改了但文档没更新是常态。这时候最权威的那份文档反而是错的,正确答案在链上和治理提案里。
遇到不一致时的做法不是二选一,而是:以链上为准,并且把这个不一致本身写进报告。 一个文档长期和链上不符,这件事本身就是关于这个团队的一条信息。
没有标准答案,检查这几件事:
- 你能不能指着其中任意一条说出它的证据等级?说不出来,说明整份只能算 E2。
- 里面的数字,有几个写了口径和取数时间?一个都没有,说明第二类错误你还完全没有防线。
- 你核对一条来源平均花了多少秒?大多数人会发现这个数字比自己想象的小得多,那么「太麻烦所以不核对」这个理由就不成立了。
- 最重要的那三条结论,如果其中一条是错的,会影响什么?影响得到一个真实决定的,就不该留任何未核对项。
- 你有没有为这份研究设过任何监控?没有的话,它的保质期是多久,你知道吗?
一个经验值:第一次做这个统计的人,经得起核对的比例通常在一半上下,而且死链比内容错误更多。 看到这个结果不用沮丧,它说明的不是模型差,而是你之前一直在用整份报告共享一个可信度。
一句话带走
AI 负责搜集与假设,事实必须回到一手来源与链上数据。