Archive Vol · VOL-6160

Token 额度焦虑:我们缺的或许不是额度,而是一套”检索增强”的方法论

2026年7月22日 5 min read 18 次阅读

焦虑清单,又添了一项。 原本让人无限焦虑清单已经足够长了。 现在,它又多了一行,AI 订阅的额度。 每天要反复打开所有Agent 的订阅页面,看看额度还剩下多少,日子过的精打细算。 不知道这个月的额度够不够,也不知道每次点击会消耗多少,简单

阅读 18

焦虑清单,又添了一项。

原本让人无限焦虑清单已经足够长了。

现在,它又多了一行,AI 订阅的额度。

每天要反复打开所有Agent 的订阅页面,看看额度还剩下多少,日子过的精打细算。

不知道这个月的额度够不够,也不知道每次点击会消耗多少,简单任务不敢用觉得不划算,复杂任务转眼一周的额度就耗尽了。

更让人不能接受的是,每当有更好用的大模型迭代之后,紧接着就会出现算力紧张的问题,最近这段时间 KimiK3 爆火,之后暂停开放新用户订阅,很多人因为没赶上扼腕叹息。但是抢到了又如何呢,简简单单处理两三个任务,打开额度一看,40% 已经消耗掉了 ,距离下个月还有 28 天。

很难不让人焦虑,此外,Codex、Claude 更不用说,真的是精打细算花了好多钱。

有个案例,大概是去年 6 月左右,Cursor 调整了订阅计费方式,引发了一些争议。

真正引发争议的,并不是涨价,而是成本突然变得不可预测。不同模型、不同上下文、不同任务复杂度,最后消耗的额度完全不同。很多用户愤怒,并不是因为多花了多少钱,而是因为第一次发现,自己竟然不知道一次思考会花多少钱。

所以,人其实没有那么害怕损失,人更害怕无法预测的损失。

一笔明确的一百元支出,往往比一个不断跳动、没有上限的计价器更容易接受。

额度越紧,每一次提问的赌注感就越重。于是就开始犹豫,这个问题值不值得问?要不要让 AI 再推演一轮?这个模糊的念头,究竟值不值得花掉几十万 Token?

一个月几十到几百美金。真正让人烦躁的,还是不确定性造成的,额度消耗的不确定性。

我越来越觉得,Token 不只是一个技术单位,它更像是人类第一次拥有了机器认知劳动的计价器。

过去,我们为一本书付费,为一块硬盘付费,为网络带宽付费。现在,我们开始为一次分析、一次追问、一次展开、一段机器替我们完成的推理付费。

Token 并不等于思考,它计量的是模型运行过程中消耗的计算资源。但对于普通人来说,它第一次让”认知外包”这件事有了肉眼可见的价格。

除此之外,还有一个非常重要的问题是,我们对AI 生成的内容天然保持警惕,尤其是幻觉比较严重的 AI 大模型,因此就出现了,一个问题,反复在多个 AI 上进行反例论证、验证,这样轮番操作,反倒消耗了更多的额度。

于是,我开始思考,哪些问题值得用高质量的大模型,哪些不用。以及如何使用AI 工具,能够更省 Token,且减少幻觉。

因此不得不提到一个概念, RAG。

RAG 是什么意思?

简单说,RAG 就是“检索增强生成”(Retrieval-Augmented Generation),意思是让大模型先去外部知识库检索相关资料,再基于这些资料生成回答,这样答案通常更准确、更新,也更贴近具体场景。

RAG 作为一个明确的技术框架,通常被认为是在 2020 年左右被正式提出并命名的,但它的思想并不是 2020 年才出现,而是更早就来自信息检索、开放域问答和自然语言生成这些方向的长期积累。

当前,RAG基本已经是行业共识了,尤其在企业知识库、客服、文档问答、合规检索这类场景里,RAG 已经是非常主流的默认方案之一。

于是,我立马想到,我现在做的这种所谓的个人数字基座,是不是一种 RAG 呢?

首先,回答这个问题,是,但不完全是。因为个人数字基座里包含可检索的个人资料库,并且未来 AI 在回答关于我的问题时,会先从这个库里找证据再生成答案,那这一层就是典型的 RAG 思路。

但是呢,个人数字基座通常比 RAG 更大,RAG 只是其中“检索 + 生成”的问答层,而个人数字基座还可能包括身份层、数据治理层、权限层、版本管理、可信证明、同步与备份等等。

还是那句话,个人数字基座是数据底盘,而 RAG 就是让 AI 从这个数字底盘里提取事实信息、再回答的一种方式、路径。

很多人把 RAG 理解成一种技术,我更愿意把它理解成一种认知方式。

它并没有试图让模型把整个世界都背下来,而是承认记忆本来就是有限的。真正重要的,不是记住所有知识,而是在需要的时候,能够找到正确的知识,不是让模型自由发挥,而是先找到证据,再开始生成。

这样既减少了幻觉,还节省了Token 无意义的消耗。

再深挖一下,RAG 的本质是,建立一套能够随时调取的索引,而不是把所有东西都放在脑子里。

因此还是老观点,在未来,大模型之间的能力会越来越接近,Agent 会越来越便宜,工具会越来越同质化。

真正拉开差距的,不再是谁用了哪个模型,而是谁拥有一套属于自己的认知基础设施。

我一直在做自己的数字基座,很多朋友以为,我还是在积累资料,做所谓的个人知识库。

其实不是。

资料从来不是最难的,硬盘足够大,什么都存得下。

真正困难的是系统化的架构和索引。

存储不是资产。

能够被正确召回的存储,才是资产。

所以,我越来越觉得,未来真正重要的,不是拥有一个更聪明的 AI,而是拥有一套更聪明的自己。

AI 负责生成,数据库负责记忆,索引负责检索,而人负责提出问题、做出判断,并承担判断之后的一切后果。

这几件事情,未来很长时间都不会改变。

说到底,中年人的所有焦虑,本质上都是同一道题:有限预算,面对无限责任。年轻的时候,我们相信无限,相信时间无限、精力无限、机会无限。中年以后,我们慢慢接受有限,然后开始学习另一种能力:不是不断增加资源,而是在有限的资源里,把系统搭好。

Token 焦虑,不过是这堂老课的新教材。

真正的解药,从来不是额度的有限或者无限,而是一套能够管理自己认知的系统。因为未来真正昂贵的,不再是生成答案,而是知道什么时候,用什么方式,在哪里调取哪一部分最真实的信息。

GROWTH LAYER

生长批注

0 条

选中正文,在右侧留下批注。

还没有批注。

DISCUSSION

文章评论

0 条

批注针对原文,评论讨论整篇文章。所有评论都会直接发布。

    还没有评论,欢迎留下第一个想法。