一句话看懂:AI的边际成本并未趋零。斯坦福HAI数据显示,GPT-3.5水平推理成本18个月降幅超99%,但企业账单却反向暴增——埃森哲因Token支出膨胀叫停低价值AI任务,多家媒体用“Token末日”形容企业勒紧AI开支的暗流。真相是:单价在跌,但单位任务消耗的Token量涨得更快。当AI从单次问答走向多步Agent、从试点走向规模化,一个任务要烧掉的Token是过去的数倍到数十倍。企业AI成本像一座冰山,水面上那10%的模型订阅费人人可见,真正吞噬预算的90%沉在水下:调用放大、上下文通胀、重试纠错、人工兜底、评估治理,以及“越智能越贵”的悖论。管理者必须从“采购AI”转向“运营AI”,用架构设计和单位经济核算管住这座冰山,否则ROI永远算不清。
AI 的边际成本,真的在趋零吗?
大多数企业给 AI 立项时,成本栏里只填一个数:模型订阅费,或者 API 采购价。这个数往往不大,而且还在飞快变小。斯坦福 HAI《2025 AI Index》给出了一个被反复引用的数字——达到 GPT-3.5 水平(按 MMLU 等效)的推理成本,从 2022 年 11 月的每百万 Token 20 美元,跌到 2024 年 10 月的 0.07 美元——约 18 个月里降幅超过 99%,即降至原来的约 1/280。于是一个直觉流行开来:AI 的边际成本正在趋零,用得越多越便宜,早晚像用电一样廉价。
但真实账单在往反方向走。2026 年 6 月,媒体披露埃森哲要求员工停止把 AI 用于“把 PDF 转成 PPT”这类低价值日常任务,因为内部 Token 支出正在急剧膨胀;其负责智能体战略的高管坦言,公司已走到一个“支出不可预测的拐点”,连高层都在追问花出去的钱到底换回了多少价值。同月,多家媒体用“Token 末日(Tokenpocalypse)”来形容这股企业悄悄勒紧 AI 开支的暗流——有平台从包月订阅转向按 Token 计费,也有公司在鼓励员工“尽量多用 AI”之后,转头给编码工具的用量设了上限。
单价跌去约 99%,账单却在爆表——这两件事同时为真,说明我们对 AI 成本的直觉错了。真相是:单价(每个 Token 多少钱)确实在跌,但单位任务消耗的 Token 量在涨,而且涨得更快。当 AI 从“单次问答”走向“多步 Agent”、从试点走向规模化,一个任务要烧掉的 Token,是过去的数倍到数十倍。“边际成本趋零”是消费级、单轮问答场景的幻觉;在企业级复杂任务里,往往恰好相反。
更值得管理者警惕的是账单的结构。业界普遍估计,企业花在 AI 上的钱,大头是推理(inference)而非训练——训练是一次性投入,推理却随每一次调用、每一位用户、每一笔业务持续发生。也就是说,AI 真正的成本不是“买模型”那一下,而是“用模型”这件事本身;它会一直计费,并随使用深度膨胀。
问题的根子在于两条曲线的方向相反。一条是“单价”曲线,受益于模型压缩、硬件迭代和厂商价格战,一路向下;另一条是“单位任务用量”曲线,受你把 AI 用得多深驱动——单轮问答、多轮对话、检索增强、单 Agent、多 Agent,每往复杂里走一步,一笔任务要吞的 Token 就上一个台阶。消费级场景停在第一条曲线的低点,所以感觉“越来越便宜”;企业级复杂任务却在沿第二条曲线快速爬升,于是账单不降反升。谁在算 AI 的账,就必须同时盯住这两条曲线,而不是只看厂商报价单上那个越来越小的数字。
这座冰山长什么样?
把企业的 AI 成本想象成一座冰山。
露出水面、被写进预算的那 10%,是模型订阅费和 API 报价单——所有人都看得见,也往往只算了这一块。真正决定成败的 90%,沉在水面之下:为喂给模型而产生的上下文与检索开销、多步 Agent 的调用放大、为保证质量的重试与纠错、AI 干不了时的人工兜底、规模化后必须常设的评估与治理合规,以及一条最隐蔽的暗流——“为了效果不断往里堆 Token”带来的隐性通胀。
水面上那块,会随单价下降而缩小;水面下那块,会随你把 AI 用得越深、越智能而不断变大。多数 AI 项目 ROI 算崩,不是因为水面上那 10% 估错了,而是因为压根没算水面下的 90%。下面把这座冰山逐块凿开。
看完这六大隐性成本,你是否也在重新审视自家AI项目的账单?许多企业发现,实际支出远超立项时的估算。用我们的AI顾问,输入你当前AI工作流的典型任务参数,诊断你的成本结构是否暗藏“冰山”。
要点一:调用放大——一个任务,几十次调用
- 表现形式:在单轮问答里,一次提问对应一次模型调用,直觉估成本很容易。但一个 Agent 任务不是这样:它要先规划、再调工具、读取返回结果、把结果写回上下文、判断下一步,如此循环。一个任务往往对应几次到几十次模型调用加工具调用。以一个典型的研究型 Agent 为例:一个主调度 Agent 先把问题拆成若干子问题,再并行派出多个子 Agent 各自检索、各自占用一份上下文,最后由主 Agent 汇总成稿——光是这样一个来回,背后就是十几次相互独立的模型调用。Anthropic 公开过自家多智能体研究系统的实测数据:单个 Agent 平均消耗的 Token 约是普通聊天的 4 倍,多智能体系统约是 15 倍;在其内部评测中,Token 用量本身就能解释约 80% 的效果差异——换句话说,好结果几乎是“用 Token 堆出来的”。
- 为什么致命 / 管理启示:这意味着在 Agent 架构里,“能力”和“成本”是绑死的——想要更好的结果,代价就是成倍的 Token,你没法只要前者不要后者。更麻烦的是它会失控放大:一个子 Agent 递归地再拆出子 Agent,或某个工具意外返回了超大结果,单次任务成本可能在高倍基线上再翻若干倍,而不少系统并没有设“熔断”或单次预算上限,等于一辆没有刹车的车。立项时若拿“单次问答”的成本去估一个 Agent 化的工作流,规模化后的实际账单可能差一到两个数量级。
- 一句影响:同一个模型,用 Agent 方式完成一件复杂任务,Token 账单可能是它做一次简单问答的十几倍到上百倍;一次深度研究型任务,单次就可能消耗数百万 Token。
要点二:上下文通胀——你塞得越多,每次都更贵
- 表现形式:为了让模型答得更准,团队会本能地把更多资料塞进上下文——更长的历史对话、更多的检索文档、更全的系统提示。问题是,每一次调用都要把这些 Token 重新读一遍并计费;多轮对话里,累积的历史会被反复重发。更关键的是价格阶梯:主流厂商对超长上下文单独加价——例如 Gemini 系列在单次请求超过 20 万 Token 后单价直接翻倍,Claude 对超过 20 万输入 Token 的请求也适用更高档费率。一旦跨过阈值,整条请求都按贵的算。
- 为什么致命 / 管理启示:这里要先澄清一个常见技术误区——用“大窗口”模型本身并不会更贵。计费是按你实际消耗的 Token 算的,装了 100 万窗口但只用了 5000 Token,价格和小窗口一模一样。真正推高成本的,是你去“填满”它:检索越贪、历史越长、每轮重发越多,账单越高,还可能一头撞进加价档。“上下文越大越好”因此是个危险的默认值。它的解法也不在少花钱,而在设计:用检索式记忆只带每一步必要的上下文,往往比无脑塞长上下文既便宜又更准。
- 一句影响:一个把长对话历史整段重发的客服 Agent,跑到第 20 轮时,单次调用成本可能是第 1 轮的数倍;换成只带必要上下文的方案,这部分开销能压到零头。
要点三:重试与纠错税——为质量花的钱,账面上看不见
- 表现形式:企业级应用不敢只跑一次。为了压住幻觉和输出不稳定,工程上普遍会叠加自我检查、多次采样投票、失败重跑、反思重写等机制。这些都是实打实的 Token 消耗,却几乎从不出现在“这个功能大概要几次调用”的直觉估算里。此外,这一轮能力更强的“思考型”模型,会在给出答案前先生成大段推理过程,而这些推理 Token 通常按更贵的输出价计费;在一些研究场景中,它们能占到输出 Token 的七八成。
- 为什么致命 / 管理启示:可靠性从来不是免费的。你把准确率从 90% 提到 99%,靠的往往正是这些看不见的冗余调用,它们可能吃掉总 Token 里很大一块。质量与成本在这里第二次绑定:越要稳,越要烧。危险之处在于,这笔“质量保险费”通常在 PoC 阶段被省略——试点时“跑通一次就行”,一旦上量、真要对结果负责,重试和纠错的开销才集中爆发。
- 一句影响:一个“跑三次取多数结果”的稳妥方案,Token 成本直接是单次的三倍还多;这笔保险费若没进立项测算,规模化后就是三倍的意外账单。
要点四:人工兜底——被从“AI 账”里悄悄漏掉的那部分
- 表现形式:没有哪个 AI 系统能 100% 自动跑完。总有一部分任务要回落到人身上:AI 拿不准的转人工、AI 生成的内容要人审校、边缘案例要人处理。这部分人力成本,常常被记在“运营”或“客服”账上,从“AI 项目的 ROI”里被悄悄漏掉了。
- 为什么致命 / 管理启示:只算 Token、不算兜底,会系统性地高估 AI 的降本幅度。这类支出常被称作 AI 的“影子人力”——它真实存在、却从不出现在 AI 的成本报表上。更隐蔽的一层是它可能不降反增:AI 用得越多,需要人来核的量反而可能上升——生成得多、要审的也多;而当输出足够像模像样、错误却更难一眼看穿时,审校的单件耗时甚至会比过去更长。如果核对一份 AI 草稿比人自己动手写还慢,这笔账实际是负的。评估一个 AI 方案的真实经济性,必须把“AI 成本 + 人工兜底成本”合起来,再去和“纯人工”对比,而不是拿 AI 那一半单独去比。
- 一句影响:一个号称“替代 80% 人工”的方案,若剩下 20% 的复杂案例恰好最耗时、生成内容又必须全量人审,真实降本可能远不到 80%,极端情况下甚至归零。
要点五:评估与治理——规模化之后的固定成本
- 表现形式:试点阶段可以“跑通就行”,规模化之后不行。监控、评测、合规审查、防滥用、审计留痕,会从“可选项”变成一笔必设的常设开销。埃森哲把这类支出归入其 Token 治理框架的固定维度,并披露了两个刺眼的数字:事后补治理平均要多花 2 到 4 个月返工,而一个被放弃的 AI 项目平均沉没约 720 万美元。它还发现,在某个数万席位的部署里,消耗高度集中——前 100 名用户就占了近七成用量。
- 为什么致命 / 管理启示:治理不是成本中心的“额外负担”,而是规模化的入场券。它决定了你能不能在出事之前就看见成本和风险。没有可观测性——每一个 Token 归属到哪个用户、哪条工作流、哪笔业务——你根本不知道钱烧在了哪里,也就无从优化,更谈不上问责。这笔钱是固定投入,需要足够的业务量去摊薄;但省掉它的代价,是你只能在账单寄到那一刻,才第一次看清自己的 AI 成本结构。
- 一句影响:把治理留到出问题再补,返工可能吞掉一个季度的进度;而“消耗高度集中在少数用户”这种事,缺乏可观测性的团队往往完全看不见,直到超支。
要点六:“越智能越贵”的悖论——能力是拿 Token 换来的
- 表现形式:这一轮的能力跃升,很大程度上靠“推理时多花算力”换来——更长的思维链、更多轮的推理、更长的上下文。而如前所述,这些推理过程通常按更贵的价计费。于是出现了一个反直觉的现象:同一类任务,你想要更聪明的答案,往往要付更多 Token。市场价格也印证了这一点——高推理模型与经济型模型之间的单价差,可以达到一二十倍甚至更高。
- 为什么致命 / 管理启示:这直接戳破了“AI 边际成本趋零”的乐观叙事。单价确实在跌,那条断崖式下滑的曲线是真的——但它跌的是“同等能力”下的价格。一旦你去追逐更强的能力、更复杂的任务,单位任务的 Token 需求就会上一个台阶,两条曲线相互抵消,甚至后者跑赢。管理者必须分清自己到底在做哪件事:是“用更便宜的方式做同一件事”(这才享受降价红利),还是“用 AI 做以前根本做不了的、更贵的事”(这不省钱,是在买增量能力)。把两者混为一谈,是预算失控的起点。
- 一句影响:把一个简单分类任务硬塞给顶级推理模型,成本可能是用小模型的一二十倍,效果却未必更好——为“用不上的智能”付费,是规模化之后最常见、也最冤枉的浪费。
要点七:同一个任务,成本能差好几倍——架构才是成本的主开关
- 表现形式:把前面六块合起来看,会发现一件反直觉的事:决定一笔 AI 任务花多少钱的,往往不是“用了哪个模型”,而是“这条任务被怎么拆、怎么调、怎么带上下文”。同一个业务需求,一种设计可能几分钱搞定,另一种设计可能贵出几倍甚至十几倍。埃森哲披露,仅靠把请求“自动路由到合适的模型”这一招,某全球性银行的推理成本就降了约 90%;另一家电信运营商据称把年度 AI 支出压低了约 68%——两者动的都不是模型,而是消费方式。
- 为什么致命 / 管理启示:这把成本的主动权,从供应商手里交回到了企业自己手里,也意味着责任再无处可推。买最贵的模型不等于花最多的钱,用最便宜的模型也不等于最省;真正的浪费发生在架构层——该用小模型的地方上了大模型、该缓存的没缓存、该截断的上下文整段重发、该设上限的 Agent 没有刹车。反过来,同样的业务量,一套精心设计的架构可以只花粗放方案的零头。“成本工程”正在成为一项和“效果工程”同等重要、却常被忽视的能力。
- 一句影响:两个团队做同一件事、用同一批模型,一年下来的 AI 账单可能差出好几倍——差距不在模型账户,而在架构设计的水平。
结论:从「采购 AI」转向「运营 AI」
把上面这六块叠起来,一个判断就清楚了:AI 不是一件你“买回来”的工具,而是一笔你“要持续经营”的、会随使用深度膨胀的单位成本。
过去买软件,是一次性授权加可预测的年费,边际成本近乎零,用得越多越划算——这是整整一代管理者的成本直觉。AI 把这个直觉反了过来:每一次调用都在真实消耗算力,用得越深、越智能,单位成本越可能不降反升。这要求认知从“采购”切换到“运营”——不再问“这个 AI 工具卖多少钱”,而是问“我这条业务工作流,每完成一笔任务要烧掉多少 Token、其中有多少是真正必要的”。
这也是为什么,正如上一节所拆解的,同一个任务在不同架构下成本能差出好几倍——成本的高低,往往不在模型本身,而在你怎么拆任务、怎么调模型、怎么管上下文。冰山水面下那 90%,恰恰是“运营能力”能够撬动的部分。领先者和落后者的差距,正在从“谁更早用上 AI”,转向“谁能让每一单位智能都花在刀刃上”。正如我们之前分析焦点科技如何用AI麦可升级外贸平台时看到的,真正的竞争力来自对AI能力的精细运营,而非简单接入。
给管理者的三条启示
一、立项时就把“全生命周期 Token 成本”写进 ROI,别只填一个订阅费。 估算一笔业务的 AI 成本,要按“单位任务”算完整链路:一次任务要几次调用、每次带多长上下文、要不要重试、多少比例会回落到人工兜底,再加上摊薄进来的治理开销。用真实的提示词规模和调用路径去实测一遍账,而不是拿 API 单价简单一乘了事。一个可操作的锚点:把“每完成一笔业务的成本”当作核心指标,而不是盯着“每个 Token 多少钱”——正如业内越来越多人所说,真正该比的不是哪个模型每 Token 更便宜,而是哪个方案每完成一件事更便宜。
二、用架构设计来控成本,而不是只会砍用量。 控本最大的杠杆藏在水面之下,且多数不牺牲体验:开启提示缓存,让重复的系统提示和知识包以约十分之一的价格被复用;把简单任务路由到小模型,只在真正需要强推理时才动用贵模型;每一步只带必要的上下文,而非把历史整段重发;给 Agent 设单次预算上限和熔断,防止失控放大。这些都是设计选择,往往能把成本压掉几成、甚至一个数量级,而不只是省下几个百分点。前面提到的那些大幅降本,靠的正是路由、缓存这类架构手段,而不是让员工少用 AI。
三、建立 AI 的“单位经济”核算与可观测性。 你无法优化你看不见的东西。在规模化之前,就要有能力把每一个 Token 归属到具体的用户、工作流和业务动作,从而算得出每条工作流的单位成本和单位产出:谁在消耗、消耗在哪一环、这笔消耗值不值,一张表要能说清。缺了这套核算,AI 支出就是一本越滚越大、却没人解释得清的黑账——而它迟早会摆到 CFO 的桌上,在一个你最不希望被追问的时刻。这种对成本结构的深度洞察,与Klarna用AI替代700个客服后又把人请回来的教训异曲同工——AI项目的成败往往取决于对隐性成本的清醒认知。
结尾:一个更大的判断
过去十年,云计算教会了企业一件事:算力可以变成一条随用随付、可精细计量的水电账,而“云成本管理(FinOps)”也随之成为一门专门的运营学科。AI 正在重演同一条曲线,只是更陡——因为 Token 的消耗不像存储和带宽那样线性,它会随着任务的智能程度、拆解方式和调用路径剧烈波动。
值得注意的是,当年那些最早把云成本当作一门经营学科来管的企业,并没有因此少用云——恰恰相反,正因为算得清、管得住,它们才敢把业务大胆地搬上云。AI 会重复这个逻辑:真正拉开差距的,不是谁用得克制,而是谁能在看清成本结构的前提下,把 AI 用得更狠、更准。
可以预见,“AI 的单位经济”会像当年的云成本一样,从少数工程师关心的技术细节,变成一把手必须看懂的经营语言。分水岭不在于谁的模型更先进,而在于谁先学会把水面下那 90% 的账,摊到阳光下算清楚、管起来。对今天的管理者来说,真正该问的已经不是“我们要不要上 AI”,而是“我们完成每一笔业务,到底在为多少 Token 买单,其中又有多少花得值”。看得见这座冰山的人,才谈得上驾驭它。
常见问题(FAQ)
为什么AI的Token单价跌了99%,企业账单反而更贵了?
因为单位任务消耗的Token量涨得更快。Agent任务调用量可达单次问答的15倍,长上下文、重试纠错等隐性成本推高总消耗,抵消了单价下降。
AI成本冰山的水面下90%具体包括哪些隐性成本?
主要包括:Agent调用放大、上下文通胀、重试纠错税、人工兜底、评估治理合规,以及“越智能越贵”的悖论——能力提升靠堆Token,成本随之飙升。
如何用架构设计降低AI推理成本?
关键手段:开启提示缓存复用重复内容;将简单任务路由到小模型;只带必要上下文而非整段历史;给Agent设预算上限和熔断。这些可压降成本数成至一个数量级。
企业如何建立AI的单位经济核算?
需将每个Token归属到具体用户、工作流和业务动作,计算每条工作流的单位成本和产出。这要求可观测性,否则AI支出会变成无人解释得清的黑账。
“越智能越贵”的悖论对企业AI预算有何影响?
高推理模型单价可达经济型的20倍以上,若简单任务误用贵模型,成本飙升而效果未必提升。管理者需区分“用AI做同一件事降本”和“做更贵的事买增量能力”。
想把这套打法用到你自己的业务上?
读完这座AI成本冰山,你是否也想算清自己企业每笔业务真实的Token账单?我们的AI创新诊断服务,可以帮你梳理工作流、定位成本黑洞,并给出架构优化方案。
💎 核心承诺:先诊断、再合作,思路不对不推进。
专属咨询热线:400 822 8832

![告别转型停滞与业务扯皮:重构前中后台架构与双重负责制的 5 大数字化策略 [附全景图解]](https://runwise.co/wp-content/uploads/2023/09/platform-transformation-right-300x169.jpg.webp)
![创新指南|敏捷研发转型 – 需从战略,产品,流程,组织和文化5个维度变革 [附图解]](https://runwise.co/wp-content/uploads/2022/10/Agile-R-D-approach-300x171.png.webp)
![[2026全景图解] 企业如何开启生成式AI创新? 从5大应用场景和6步抓手](https://runwise.co/wp-content/uploads/2023/05/robot_crawl_fi.jpg-300x157.webp)
![乐高开放式创新拆解:[2026图解] Lego如何靠280万社区粉丝驱动爆款产品开发?](https://runwise.co/wp-content/uploads/2023/10/2023FALL-Beretta_1290x860-300x200.png.webp)
![AI 产品增长实战:[2026图解] Gamma用生成式 AI 颠覆 PPT 的三重密码](https://runwise.co/wp-content/uploads/2023/09/gamma-app-300x150.jpeg.webp)











