AI项目核算
用一笔可逐行改数字的账,把返工、维护和一次性投入算进AI回报,并解释试点结论为何不能直接乘以部门数。

一句话看懂:一个部门试点AI算出−7.4%的容量价值回报率,铺开到20个部门却变成−16.1%,核心原因是试点部门不是平均部门、维护成本不随规模摊薄。本文提供一套可逐行改数字的核算方法:把返工率、持续维护和一次性投入全部计入,区分释放工时与现金节省,并给出返工率上限和维护结构的敏感性分析。管理者可用这套方法在董事会前逐行解释算式,而不是把工作量换算当利润。

工商银行在 2024 年报和业绩发布会上公开了两组数字。一组是投入:当年金融科技投入 285.18 亿元。另一组是产出:自建的千亿级金融大模型“工银智涌”已覆盖 20 余个主要业务领域、200 余个场景,累计调用量超 10 亿次;人工智能等新技术全年承担工作量超 4 万人年(工商银行 2024 年度报告)。

这两组数字都是真实的、公开的、可核验的。

但它们不能相除。

“4 万人年工作量”是一个工作量换算——把机器处理的任务量,按人工处理同等任务量所需的人力折算出来。它不是裁员数,不是薪酬支出的减少,也不是利润。285 亿的科技投入里,绝大部分与大模型无关。把两个数字放在一起做除法,得到的既不是投资回报率,也不是任何一个能在董事会上站得住的指标。

这不是挑一家银行的毛病,恰恰相反——工行的披露口径是清楚的,它自己没有做这个除法。做这个除法的通常是下面的人:一个部门试点跑完了,效果看起来不错,接下来要向董事会申请一笔铺开预算。这时候最容易发生的事,就是把工作量换算当成成本节省,把试点结论当成全公司结论。

这篇文章提供一套可以逐行改数字的核算方法。它适合已有明确任务、能够记录处理时间的试点。文中数字全部是假设,不代表任何企业的真实成绩。

一、先分清你准备证明哪一种价值

“省时间”“省钱”“多赚钱”需要不同的证据,不能合并成一个漂亮的回报率。

价值类型 至少需要记录什么 容易犯的错误
释放工作容量 同质量任务的净人工时间变化,以及释放出的时间是否能重新安排 把零散节省的工时直接当作工资支出减少
减少现金支出 实际减少的外包、加班或其他可避免支出,减去新增支付 工资总额没有变化,却把“工时×工资”报为现金节省
增加业务收益 同口径比较下新增的贡献毛利,以及其他变化的影响 将所有收入增长归功于 AI,再与同一批产能节省重复相加

工行的“4 万人年”落在第一栏,是容量口径。它证明的是机器承担了大量工作,不证明第二栏和第三栏。

这条纪律也适用于引用别人的数字。 Klarna 在 2024 年 2 月的公司新闻稿中说,AI 助手首月完成了相当于 700 名全职客服的工作量,并预计改善当年利润 4,000 万美元。前者是工作量换算,后者是当时的预测(Klarna 公司新闻稿)。

后来发生的事更值得管理者留意。2025 年,Klarna CEO 关于客服质量与人工服务的一段公开表态进入了美国 SEC 的上市审核往来:SEC 工作人员援引 Forbes 对“AI 服务质量低于人工客服”的报道,要求公司说明随着使用经验增加,其 AI 策略是否发生调整;Klarna 在 2025 年 7 月 16 日的回函中明确表示,相关报道误解了 CEO 所说的一项提升人工客服质量的高技能自由职业顾问试点,这些评论并非针对 AI 驱动的客服质量问题(SEC / Klarna 往来原文)。

同一段公开表述在媒体报道、监管问询与公司澄清中出现了不同解读。这正说明,如果效率、质量和人工兜底的口径没有写清,事后很容易被解释成完全不同的结论。

这不是一个“AI 不行”的故事,而是一个口径的故事。首月的工作量换算有明确口径;后续围绕客服质量与人工服务的公开讨论,则出现了媒体解读、监管追问与公司澄清。它们回答的并不是同一个指标。你在立项时把效率、质量和人工兜底分别写清楚,就是在为一年后的自己留一份可辩护的记录。

二、以完成任务为分母,把全过程放回账里

不要用“每次模型使用多少钱”替代“完成一件业务任务多少钱”。一个任务可能经过多次请求、重试和人工接管。

建议每个试点按下表记录。以下是本文提出的管理口径,并非某家公司的财务制度。

项目 记录内容 避免重复计算
原流程 相同任务类型、业务量、最终质量与人工时间 原流程已有的复核也要纳入,不能拿完整人工流程与 AI 初稿时间相比
AI 后人工 资料准备、发起任务、常规审核、修改、额外接管 如接管时间已含审核,不能再重复加一遍
直接工具成本 接口费用、必要许可证、检索与存储 本来就要支付的共用费用,只分摊与试点相关的部分
持续维护 知识更新、失败排查、评估、权限管理与规则调整 与一线处理工时分开;已有工时记录不得两头计入
一次性投入 集成、初始评测、流程设计与培训 现金评价按发生时间记账;按窗口分摊仅作明确的管理比较
质量与风险 错误、升级、客诉、时效及失败后果 不能可靠折成钱的风险独立列门槛,不能按零成本放过

有的试点提高了可处理业务量,有的减少了现有业务的支出。选择一种主收益口径,同一份工时不要既计降本又计增收。

三、部门试点:一笔三个月的假设账

假设一家企业让某个部门用 AI 辅助整理标准服务请求。新旧流程处理相同的每月 1,000 件任务,且最终均达到相同验收标准。所有返工任务最后都被人完成,因此本例分母仍是 1,000 件。

下表全部为假设输入,单位为人民币;100 元/小时是内部工时价值估计,不是已减少的现金工资。

假设输入 数值 定义
月任务量 N 1,000 件 固定同类型任务组合
原流程 t₀ 12 分钟/件 包含原有处理与复核
AI 后准备及操作 p 2 分钟/件 人工主动投入,不将模型等待一律算为人工劳动
AI 后常规审核 a 3 分钟/件 每件都审核
额外返工发生率 q 20% 按任务数计算,非请求失败率
每件返工额外时间 e 10 分钟 在 p、a 以外新增的时间
一线工时价值 w 100 元/小时 本例统一估值
接口费用 2,000 元/月 本例已含重试产生的支出
必要许可证等 1,000 元/月 与接口费用不重叠
持续维护 20 小时/月 × 100 元 另计 2,000 元/月,不包含一线复核
一次性投入 I 12,000 元 在试点开始时发生
评价窗口 M 3 个月 不将成熟期回报替代首期结果

AI 后每件任务的人工时间:

t₁ = p + a + q × e = 2 + 3 + 20% × 10 = 7 分钟

原流程每月 200 小时;AI 后一线处理约 116.67 小时,释放约 83.33 小时,按本例工时价值估算为 8,333.33 元。新增持续费用为接口、许可证和维护合计 5,000 元/月。

管理成本比较,全部基于假设 原流程/月 AI 辅助流程/月
一线人工等价成本 20,000.00 11,666.67
接口、许可证 0.00 3,000.00
持续维护等价成本 0.00 2,000.00
运行阶段合计 20,000.00 16,666.67
一次性投入按三个月均分,仅作本表比较 0.00 4,000.00
首三个月对应的月均总成本 20,000.00 20,666.67

不计启动投入,运行阶段每月资源价值净节省约 3,333.33 元;计入全部启动投入,三个月总成本由 60,000 元变成 62,000 元,反而多了 2,000 元。初稿更快,不能推出这个评价窗口内总成本更低。

项目回报率的分母:

净释放人工价值 B = N × (t₀ − t₁) ÷ 60 × w

评价期增量投入 C = I + M ×(接口 + 许可证 + 持续维护)

容量价值口径回报率 = (M × B − C) ÷ C

本例为 (25,000 − 27,000) ÷ 27,000 ≈ −7.4%。这与“总流程成本增加约 3.3%”不同,两个比率分母不同,不可互换。

这里的 −7.4% 是释放工时全部能按设定价值使用时的假设评价,仍不是现金投资回报。若没有减少实际支出,也没有证据说明释放的容量带来了新增价值,应分别保留工时观察和新增现金账,现金回报暂不认定。不要用一个主观“兑现率”把缺失的证据变成财务实绩。

用同样的框架诊断你的业务

如果你正在为AI试点准备铺开预算,与其自己反复调返工率和维护假设,不如让AI顾问帮你把六项输入逐行算清,并给出盈亏平衡点。

免费体验 Upskill AI 顾问 →

四、董事会面前的那笔账:铺到 20 个部门会怎样

上面那 3,333 元,本身不是管理者要决策的东西。真正摆在会议桌上的问题通常是:试点跑完了,要不要批一笔预算铺到全公司。

这时最常见的推理是:一个部门省 3,333 元,20 个部门就省 6.7 万元,规模上去以后单位成本还会摊薄。

这个推理有两处错。

第一处错:试点部门不是平均部门。 试点通常落在资料最干净、流程最标准、人员最配合的那个部门——这也是它被选中的原因。铺开之后,接手的是资料格式不统一、例外情况更多、人员不熟悉的部门。返工率会上升,而不是持平。

第二处错:维护成本不随规模摊薄,反而增加。 每个部门有自己的资料、规则和异常类型。20 个部门意味着 20 套知识需要更新、20 类失败需要排查,通常还要加一个中央平台团队来管权限、评估和版本。

立即登录阅读全文
登录或注册即可解锁全站内容,即表示你理解并同意 服务协议 与 隐私政策

按下面这组假设重算。所有输入仍为假设值。

铺开阶段假设输入 数值
部门数 D 20 个
每部门月任务量 1,000 件
铺开后平均返工率 q 30%(试点为 20%)
每部门集成与培训 12,000 元(一次性)
平台建设 300,000 元(一次性)
每部门分散维护 15 小时/月 × 100 元
中央平台维护 1 人 × 160 小时/月 × 150 元
评价窗口 M 12 个月

t₁ = 2 + 3 + 30% × 10 = 8 分钟

单部门月释放价值 = 1,000 × (12−8) ÷ 60 × 100 = 6,666.67 元,20 个部门合计 133,333.33 元/月。

铺开阶段增量投入 金额
接口费用 20 × 2,000 40,000 元/月
许可证 20 × 1,000 20,000 元/月
分散维护 20 × 1,500 30,000 元/月
中央平台维护 24,000 元/月
月增量小计 114,000 元/月
一次性投入 240,000 + 300,000 540,000 元

12 个月净释放价值 = 1,600,000 元;12 个月增量投入 C = 540,000 + 12 × 114,000 = 1,908,000 元。

容量价值口径回报率 = (1,600,000 − 1,908,000) ÷ 1,908,000 ≈ −16.1%

试点是 −7.4%,铺开是 −16.1%。规模没有摊薄成本,它放大了成本。

这个结果不意味着这个项目该被砍掉,而是意味着在批预算之前,有两个具体的数字需要先谈定

  • 返工率上限。 在其他输入不变时,12 个月要达到容量价值收支平衡,20 个部门的平均人工时间需不高于每件 7.23 分钟,对应平均返工率不高于 22.3%。试点是 20%,铺开假设是 30%。这 8 个百分点就是这笔预算成不成立的地方。
  • 维护结构。 若能在不增设中央团队的情况下把维护控制在纯分散的 30,000 元/月,同样的 12 个月账会从 −16.1% 变成约 −1.2%,接近打平。在铺开阶段,维护是比接口费用更大的变量。

这两个数字,比任何一张功能对比表都更能决定这笔钱该不该批。

五、最该补测的,可能是返工与复核

回到单部门口径。在其他输入不变时,只改变额外返工比例,结果就完全不同。

假设情景 AI 后人工分钟/件 三个月净容量价值,扣除增量投入 同一分母的回报率
返工 10% 6 3,000 元 11.1%
返工 20% 7 −2,000 元 −7.4%
返工 40% 9 −12,000 元 −44.4%

单部门首三个月达到容量价值收支平衡,需要平均人工时间不高于每件 6.6 分钟;在准备 2 分钟、审核 3 分钟、每次额外返工 10 分钟不变时,返工率须不高于 16%。这只是上述假设推导出的临界点,不是企业 AI 的通用合格线。

如果失败次数会增加接口费用,敏感性表也要联动修改。本表为单变量演示,暂时固定月度接口支出。

六、把“继续投入”变成一项有条件的决定

可以在正式验收前,与业务和财务共同填写以下三行,而不是先选一个好看的成功率。

决定 必须看到的条件 下一步
继续小范围 质量门槛通过;完整成本可记;主要不确定项有测量办法 保留同类型人工比较,补测返工与维护
扩大一次 净价值在保守假设下仍成立;新增使用者与异常任务也能被支持 单独预算扩员培训、接管与维护,分批验证
暂停或缩小 关键质量要求不达标,或真实额外工作使收益持续为负 回到最容易验证的一类任务;不要先撤掉人工退路

这是本文建议的判断顺序,不是对所有行业规定统一阈值。低错误后果的内部材料整理,与影响设备安全、客户权益或专业判断的任务,需要不同的验收强度;有些风险应直接限制应用范围,不适合用平均节省金额抵消。

规模数字同样要按这个纪律读。摩根大通的公司材料称,其内部生成式 AI 平台在八个月内完成 20 万用户接入。摩根大通官方案例这说明平台覆盖速度,和工行的“200 余个场景”“10 亿次使用量”一样,都是采用规模的证据,不是项目回报的证据。摩根大通如何先统一平台与风险边界

接入、使用和价值,是三件需要分别举证的事。

七、把这笔账套到你自己的项目上

上面所有数字都是假设值,真正有用的是那套结构。把你自己项目的六个输入填进去,结论可能和本文完全相反——那正是这篇文章希望发生的事。

需要先准备的六个数字:月任务量、原流程单件耗时、AI 后准备与审核时间、返工发生率、每月新增的工具与维护支出、一次性投入。其中最容易拿不到的是返工率,因为多数团队没有单独记。如果没有,先按估值填,再把“补测返工”写进下一阶段的动作。

利益关系说明: 下文提及的 Upskill Pro 是 Runwise 的自有产品。本文的核算方法不依赖任何工具,用纸笔或表格同样可以完成。

如果你想让人帮你把这笔账过一遍,可以把下面这段直接复制到 Upskill Pro 的专业级AI顾问工具:

我们有一个 AI 试点要决定是否扩大投入,请帮我做一份可以拿到经营会上的核算。

项目背景:[一句话说明任务类型和所在部门]
月任务量:___ 件
原流程单件耗时:___ 分钟(含原有复核)
AI 后准备+操作:___ 分钟/件
AI 后常规审核:___ 分钟/件
额外返工发生率:___%,每次额外 ___ 分钟
一线工时价值:___ 元/小时
每月新增工具支出:___ 元;每月维护投入:___ 小时
一次性投入:___ 元
拟评价窗口:___ 个月
如果铺开,目标部门数:___ 个

请分四步输出:
一、分别算出容量口径回报率和总流程成本变化,并说明两者分母不同、不可互换;
二、做返工率的敏感性分析,给出本项目的盈亏平衡返工率;
三、按铺开部门数重算,明确指出维护成本是否随规模摊薄,并给出铺开后的返工率上限;
四、给出"继续小范围/扩大一次/暂停"三选一的建议,每一项写清必须先看到什么证据。

要求:区分释放工时与现金节省,不要把工时价值报成成本下降;
所有推算过程列出算式;对我没有提供的数据,明确标注为待补,不要替我估算。

最后那两条要求是关键。你要的不是一个好看的回报率,是一份在董事会上被追问时能逐行解释的算式。

如果你的下一步是扩到更多人,可以继续读摩根大通如何先统一平台与风险边界。今天先做的动作则更小:选一类真实任务,把准备、审核、返工和维护四项都记进去,再讨论那笔铺开预算。

常见问题(FAQ)

AI项目核算中,为什么试点回报率不能直接乘以部门数?

试点部门通常资料最干净、流程最标准、人员配合,铺开后返工率上升,维护成本也因多套知识、规则和异常类型而增加,不会随规模摊薄。

AI项目核算里,释放工时和现金节省有什么区别?

释放工时是容量口径,按人工等价时间折算,不等于实际减少的工资支出;现金节省必须是实际减少的外包、加班等可避免支出,减去新增支付。

如何计算AI项目的盈亏平衡返工率?

在其他输入不变时,令净释放价值等于增量投入,反推平均人工时间,再减去准备和审核时间,除以每次额外返工时间,得到返工率上限。

AI项目铺开时,维护成本为什么是比接口费用更大的变量?

每个部门有独立资料、规则和异常,需要分散维护,通常还要增设中央平台团队,维护工时和成本随部门数线性甚至超线性增加,而接口费用往往可预测。

AI项目核算中,一次性投入应该如何处理?

现金评价按发生时间记账;若做管理比较,可按评价窗口分摊,但必须明确标注为分摊口径,不能与现金回报混为一谈。

想把这套打法用到你自己的业务上?

如果你手头有一个AI试点要决定是否扩大投入,可以把你的六项数据填入Upskill Pro,让它帮你算清容量口径回报率和返工率上限。

💎 核心承诺:先诊断、再合作,思路不对不推进。

专属咨询热线:400 822 8832

扫码添加顾问 Ben 企业微信

扫码加顾问 Ben 评估
点个赞鼓励一下作者吧~
点赞
收藏
请用微信扫码分享哦~
分享
加入AI创新
专业交流群

免费送7行业30+案例
及时看最新直播/研报

勿删,用于自定义目录加锚点,隐藏即可

相关文章推荐
点赞
收藏
请用微信扫码分享哦~
分享

还差一步
扫码锁定入群名额

加我时请备注下方群名

创新战略交流群

免费送“2024新业务孵化/战略创新指南”

B2C增长创新群

免费送“10大消费行业50个增长案例汇总”

B2B增长创新群

免费送“7大B2B行业30个增长案例汇总”

AI应用创新群

免费送“20篇AI研报+110套GPT提示”
关闭按钮
欢迎来到Runwise即能创新社区!
登录装饰图,三个人围坐在电脑前,对某个灵感进行沟通和讨论
已有账号?
电话咨询
7x24热线,欢迎致电咨询
微信咨询
扫码添加专家微信
扫码添加专家微信
享专家1V1咨询