AI 让答案变得廉价,也让验证变成了稀缺手艺
AI 生成的边际成本塌到接近零,验证的成本一分没降。这是我们下一步想做的事的起点。
如果你每天用 AI 干活——做尽调、查财报、写代码、整理一份研究——你大概已经习惯了这个动作:问一句,拿到一段看起来相当完整的回答,然后就没有然后了。
那段回答到底对不对,你其实不知道。
要知道,你得自己去核。而核一次的成本,有时候比你自己从头做还高。
这是我这个夏天反复撞到的一件事。它也是我们接下来想做的事情的起点。
大多数人在比模型,我认为稀缺的东西已经换了
现在的主流讨论是”哪个模型更强”。榜单一周一换,参数一代比一代大。
但你把成本结构摊开看,会发现过去两年真正发生的变化只有一件:生成一段答案的边际成本,塌到了接近零。
而验证那段答案的成本,一分钱没降。
它还是要一个人打开财报原文、翻到那一页、把数字对上;还是要一个人把代码跑一遍、看它在边界条件上会不会炸。这件事没有被自动化,甚至没有被记录下来。
于是出现了一个很别扭的局面:世界上正在以极低成本生产大量”看起来对”的内容,而判断它们对不对的能力,仍然是手工的、一次性的、不可积累的。
我写稳定币那本书的时候,规矩是每一个数字都要回到一手来源。有一次我让另一个模型帮我查一家公司的财报数据,它给了我一个看起来非常合理的数——合理到我差点直接用了。我还是去翻了 10-Q 原文。
核对花掉的时间,远超它生成那句话的时间。
更浪费的是:这次核对的结果,除了我自己,谁也拿不到。下一个问同样问题的人,会重新踩一遍。
“分享聊天记录”只解决了前半段
最初我想做的事情很朴素:让大家把和 AI 的完整交互过程发出来,而不是只发最后那段答案。
因为真正值钱的往往不是一个 prompt,而是整个过程——怎么提问、怎么给上下文、怎么发现它在胡说、怎么把它掰回来、什么时候该换个模型重来。
一个不太会用 AI 的人,看高手的完整过程,比看一百条”万能 prompt”有用得多。这个判断我现在依然认为是对的。
但后来我意识到,它只回答了半个问题。
它回答的是:这个答案是怎么来的。
它没有回答:这个答案到底对不对,以及别人能不能接着往下做。
而后面这两个,才是前面说的那个成本缺口所在。
三个词:可追溯、可验证、可继续
所以我们把它扩成了一个闭环:
生成 → 公开 → 验证 → 继续 → 再验证。
对应三件事:
可追溯——看得见答案是怎么被逼出来的,不是只看最后一段。
可验证——别人可以质疑、可以换个模型重跑、可以摆出证据推翻你。
可继续——任何人可以从你停下的地方接着往前,而不是重新开始。
第三个是我最看重的,因为它是现在完全缺失的一环。
今天你看到一份别人做得很扎实的 AI 研究,你能做的只有点赞、评论、收藏。你没有办法接着做。
这就像一个只能阅读、不能 fork 的 GitHub。
关于”验证”,有一件事必须说清楚
我们要的不是让大家最后达成共识。
多数人同意,也可能是错的。这一点在金融领域尤其明显——共识往往是最贵的东西。
我们要的是让一个结论可追溯、可质疑、可复现。是可信度被一次次检验之后慢慢累积起来,而不是靠投票决定谁对。
这中间有个很细的区别,我踩过:给结论打上”已验证 / 有争议 / 已推翻”的标签,看起来像验证,本质上还是投票,只是换了个说法。
真正能判定对错的来源只有三种:
- 可重放的执行——同样的输入跑一遍,谁跑结果都一样;
- 权威文件比对——财报原文、监管文本、链上状态;
- 时间——预测到期了,现实来裁决。
三种之外的,都该老实叫”评论”,别叫”验证”。
单位可能要变
传统互联网的基本单位是:
帖子 → 评论 → 点赞。
内容发出来的那一刻就定型了,之后只会往下沉。
而我们在想的是另一个单位:
对话 → 证据 → 验证 → 继续。
在这个结构里,内容不是一个死的帖子,而是一个可以被验证、被修正、被接手、被继续发展的节点。
我不打算把它说得比实际更容易
这个方向有三个真实的难点,我现在也没有全部解决,不如直接摊开讲。
第一,成本方向是反的。
传统内容平台的边际成本接近零,发布免费、阅读免费。而这件事一旦让 AI 在平台内跑起来,就变成了发布的人花钱、阅读的人免费。这对冷启动极其不友好——供给方要先掏钱,才能生产出内容。
第二,验证是公共品。
验证者花自己的成本,让所有人受益。纯粹按次收费的模型下,理性的人不会去做这件事。这一环必须被补贴,否则它就是一句漂亮话。
第三,生成成本远低于验证成本,开放广场必然被淹。
只要这个不对称存在,供给就会压垮验证能力。Stack Overflow 在大模型时代遇到的困境,本质就是这个。所以它一定得从一个足够窄、结论足够能被判定的领域切进去,而不是一上来做通用广场。
我在把这套东西的完整方案交给另一个模型做对抗性评审时,被指出的最狠的一刀,也正是在这里。那次评审的复盘我另外写过,结论很不客气:在验证这条闭环被真实数据证明成立之前,上面所有的设计都没有地基。
我接受这个判断。所以第一版会做得很小。
所以第一版会很小
小到几乎不像一个”新方向”:你可以在 Pickful 里直接和 AI 对话,然后把完整的过程分享出来,大家互相看。
没有验证,没有 fork,没有模型对比。
因为在做那些之前,有三个数我必须先拿到:有没有人愿意在这里跟 AI 聊;聊的时候会不会追问,还是问一句就走;聊完之后,愿不愿意公开。
第三个数如果是零,那么上面写的所有东西都只是设想。
在拿到它们之前,我不打算假装自己已经知道答案。
生成答案的能力,正在变成所有人都有的东西。判断答案是否可靠、并在它之上继续往前的能力,不会。
AI 让答案变得廉价,也就同时让”验证”变成了这个时代真正稀缺的手艺。
我们想把这门手艺,从每个人私下的、一次性的动作,变成公开的、可以累积的东西。
如果你也每天在跟 AI 打交道,我很想听你说一件事:你上一次发现 AI 给你的答案是错的,是怎么发现的?
那个”怎么发现的”,就是我们想留下来的东西。
轉發此貼文?
與您的關注者分享。
回覆