Cointime

扫码下载App
iOS & Android

看不见的账单:Token 放大效应实测拆解

一次 Agent 任务的 Token 内循环结构测算——你看到的输出,只是消耗的冰山一角

用户看到 10,000 个 Token 的交付物,系统烧掉的可能是 40 万,甚至 300 万。没有计量的 Agent 系统,等于没有闸门的水库。本研究以一次典型的 Web3 项目宣发任务为样本,对 Agent 工作流的 Token 消耗结构进行了逐阶段的结构化测算,得出了五个足以改写企业对 AI 成本直觉的发现。

首先,用户往往只看到冰山露出水面的部分:一份约 10,000 Token 的宣发内容包背后,单 Agent 工作流的总消耗约 39 万 Token,交付 Token 仅占总消耗的 1%–3%,用户可见的部分远不到水面线。其次,放大效应背后的主引擎并非生成本身,而是"上下文重读税"——Agent 每前进一步,都要把此前的全部历史重新读一遍,N 步任务的累计重读量近似按 N²/2 增长,这意味着放大效应服从的是平方律而非线性律。第三,反思与重试是最深的隐形黑洞:每一轮"自我检查—修改重写"都意味着全量上下文重读加全量重新生成,三轮反思的成本约等于把任务重做三遍。第四,多智能体协作会让放大倍数从 30 倍跳向 300 倍,因为编排者向每个子 Agent 广播上下文、Agent 之间交叉验证与辩论、失败分支重试,协作不是把任务分掉,而是把上下文复制了 N 份。第五,消耗与人数脱钩,与任务复杂度超线性挂钩——Agent 时代的 Token 预算无法再用"员工数 × 使用频率"估算,唯一有效的治理手段,是把计量做到每一次调用、每一个任务的颗粒度。

从线性消耗到内循环:放大效应的定义

Chatbot 时代的 Token 消耗是线性的:用户问一句,模型答一句,账单与对话量一一对应。Agent 时代彻底改写了这个函数。一个 Agent 接到任务后,会自主地规划步骤、检索资料、调用工具、生成草稿、自我反思、修改重写、交叉验证——其中绝大部分 Token 消耗发生在系统内部,用户从头到尾看不见。Token 在 Agent 的工作循环里反复流转、反复燃烧,这就是"循环端"研究揭示的 Token 放大效应。

这一放大效应的核心度量是:放大倍数 A = 任务总消耗 Token ÷ 最终交付 Token。这个比值的直觉意义是,用户每拿到 1 个 Token 的成果,系统在幕后烧掉了多少个 Token。Chatbot 的 A 值约等于 1–2;而测算显示,Agent 工作流的 A 值起步就是两位数,多智能体场景轻松突破三位数。

为什么必须度量它?因为它决定了两件事:第一,企业的真实账单——同样一个"生成宣发内容"的需求,A = 5 与 A = 300 之间是六十倍的成本差;第二,供给侧的容量规划——此前成本研究中"日均 5,000 万 Token"的分水岭,在 A 值失控的 Agent 系统面前,可能一个上午就被击穿。可以说,Agent 不是更贵的 Chatbot,而是一种消耗结构完全不同的物种——评估它的账单,先要解剖它的循环。

(测算口径说明:本报告全部数字为基于公开模型规格与典型工作流结构的自下而上测算,关键假设逐项列示于各章,用于揭示消耗的结构与量级,非任何单一系统的实测审计值。)

解剖一次宣发任务:11 万 Token 去哪了

样本任务是:向单个内容 Agent 输入约 25,000 Token 的项目资料(白皮书节选、官网文案、社区 FAQ),要求产出一套完整宣发内容包——1 条主推文、2 组推文线程、1 篇长文公告、1 份活动文案、6 组配图提示词,合计交付约 10,000 Token。

逐阶段拆解显示,消耗集中在六个环节:任务规划阶段,Agent 需要读入全部项目资料、拆解目标、生成执行计划,并经历 2 轮计划修订,每轮都要重读资料与计划,这一步约消耗 88,000 Token,占比 23%;检索注入阶段进行 8 次知识库/网络检索,每次注入约 9,000 Token 的参考材料进入上下文,约消耗 72,000 Token,占比 18%;草稿生成阶段携带资料、计划与检索结果的完整上下文,分 6 段生成内容初稿,约消耗 82,000 Token,占比 21%;反思重写阶段进行 2 轮自我检查与修改,每轮都要全量重读上下文并输出修订稿,约消耗 98,000 Token,占比 25%,是六个环节中占比最高的一项;工具调用阶段完成格式化、链接校验、配图提示词生成等 10 次工具调用的输入输出,约消耗 31,000 Token,占比 8%;合规与终检阶段进行敏感词围栏、事实一致性检查与最终定稿输出,约消耗 19,000 Token,占比 5%。

六个环节合计,总消耗约 390,000 Token,交付约 10,000 Token,放大倍数 A 约为 39 倍。这组数字揭示了两个细节:第一,纯粹的"生成"只占两成,八成消耗花在读、想、查、改上;第二,占比最高的单项是反思重写,恰恰是让 Agent"对结果负责"而非"一次性输出"的那个环节——质量与消耗,在结构上是同一件事。

放大的三台发动机

发动机一:上下文重读税(Context Re-read Tax)——平方律的元凶。 大模型没有工作记忆,Agent 每前进一步,都必须把此前的全部历史——资料、计划、检索结果、已生成内容——重新作为输入读一遍。若每步新增约 L 个 Token 的上下文,则第 K 步需重读约 K × L,N 步任务的累计重读量近似为 N² × L ÷ 2,也就是步骤数翻一倍,重读税翻四倍。这解释了一个反直觉现象:把任务拆得越细、Agent 越"严谨",单位成果的成本反而可能越高。放大效应的增长是平方级的,而预算直觉是线性的——失控就发生在这两条曲线的裂口里。

发动机二:反思循环(Reflection Loop)——把任务重做 N 遍。 每一轮"检查—批评—重写"都是一次全量重读加一次全量再生成。测算显示,每增加一轮反思,任务总消耗约增加 25%–40%;三轮反思的 Agent,成本结构上约等于把任务完整做了三遍。反思换来的是交付质量——但没有计量,你不知道自己为质量付了几倍的价。

发动机三:检索注入(Retrieval Injection)——每查一次,胖一圈。 RAG 每次检索都会把数千 Token 的外部材料注入上下文,而注入的材料会被后续每一步反复重读——检索不是一次性开销,而是会滚动计息的本金。检索越频繁、注入越大方,重读税的基数越高,两台发动机形成正反馈。

规划在烧,检索在烧,反思在烧,重读在烧——生成本身,反而是整台机器里最便宜的动作。

从 37 倍到 300 倍:多智能体乘数

单 Agent 的 39 倍只是起点。当任务交给多智能体系统——一个编排者(Orchestrator)指挥文案、图像、审核、数据多个子 Agent 协作——三个乘数开始工作:上下文广播,即编排者要把任务背景复制给每个子 Agent,上下文被复制 N 份;交叉验证与辩论,即 Agent 互相评审对方产出,每轮评审都是全量重读;失败分支重试,即任一子任务失败,相关分支整体重跑。协作不是把消耗分掉,而是把消耗乘上去。

按工作流复杂度可以分为五个层级。最基础的 L1 单轮直出,是 Chatbot 式一问一答、无循环的场景,典型放大倍数在 1 到 2 倍之间,交付 10,000 Token 的总消耗约 2 万 Token。L2 单 Agent 基础流,在规划、检索、生成之外没有反思环节,放大倍数升至 8 到 15 倍,总消耗约 10 万到 15 万 Token。L3 单 Agent 完整流,也就是本报告的测算样本,包含 2 到 3 轮反思重写与工具调用,放大倍数达到 30 到 50 倍,总消耗约 30 万到 50 万 Token。L4 多 Agent 协作,由编排者加 3 到 5 个子 Agent 通过交叉验证协作完成,叠加上下文广播与评审循环,放大倍数跳升至 80 到 150 倍,总消耗约 80 万到 150 万 Token。L5 深度研究型场景,涉及多轮辩论、大规模检索、长程推理与失败重试,属于 Inference-time Compute 密集型任务,放大倍数可达 300 倍以上,总消耗约 300 万 Token 起。

市场信号与测算结果相互印证:2026 年 6 月,头部厂商正式放弃了 Agent 产品的"无限量"订阅定价——当 A 值可以在 L2 与 L5 之间自由跳动时,任何包月制都是在给对手写空头支票。同理,企业侧任何基于"人数 × 频率"的预算模型,都已在结构上失效。

问题从来不是"Agent 贵不贵",而是你是否知道自己的系统正运行在哪一级。L3 是生产力,失控的 L5 是事故。而"知道运行在哪一级",本身就是一种基础设施能力——它要求消耗被统一计量、被逐任务归因、被实时可见。

水库与闸门:计量是唯一的治理

放大效应无法被"消灭"——重读、反思、检索正是 Agent 产生质量的方式。能做的只有一件事:让每一滴消耗可见、可归因、可控制。这要求计量颗粒度从"月账单"下沉到"每一次调用、每一个任务、每一个 Agent"。

这正是 UniKey 以 AI Credits 体系给出的工程答案。首先是统一计量单位:模型调用、检索、工具、Agent、Skill、Workflow 的全部消耗收敛为同一单位,官方统一面值 1U 等于 10,000 AI Credits,规划、检索、反思、生成等不同发动机的燃烧第一次可以同表核算,几十万 Token 的内循环被显化成一张清晰的 Credits 账单。其次是任务级穿透:消耗明细可按任务、按 Agent、按阶段归因,能看见 39 倍里的每一倍花在了规划、检索还是反思,L4 的广播开销与 L5 的辩论开销分别是多少。第三是预算闸门:团队与项目维度的额度、权限与用量管控,让 L5 级的消耗必须先申请闸门,而不是事后在账单上相认。第四是路由降压:多模型智能路由把重读、检索这类直觉型负载导向正在技术通缩的低价模型,把昂贵的思考型算力留给真正需要推理的环节,在不牺牲 A 值结构的前提下,压低每一倍放大的单价。第五是 Settlement 级审计:每一次调用、执行与交付进入清算层记录,多 Agent 协作的消耗与贡献可分摊、可追溯、可结算。

落到操作层面,这套治理在 UniKey 上是一条完整闭环:充值 AI Credits 获得额度,按团队与项目分配预算闸门,Agent 执行任务时消耗实时显化为 Credits 明细,用量报表按任务级复盘以识别失控的 L4/L5 工作流,再通过优化编排,让同样的交付以更低的 A 值完成。放大效应从一笔糊涂账,变成一个可以被持续压降的运营指标。对于正在把宣发、社群、内容交给 Agent 的团队,接入统一计量的那一天,就是水库装上闸门的那一天。

Agent 系统是一座水库:上游是平方律的来水,库容是你的预算。放大效应决定了来水永远超出直觉——而没有计量的 Agent 系统,等于没有闸门的水库。

数据说明:本文数据为基于典型工作流的结构化测算,用于说明消耗结构与量级,非实测审计结果;"循环端"概念参考了行业公开研究。产品信息以官方最新政策为准。

评论

所有评论

推荐阅读