
为什么AI的经济价值竞争不会在模型层决出胜负,而将在其底层的数据平台展开?
Stephen
Catanzano
AI Token经济学并非仅由模型定价决定。数据质量、检索精度、算力资源分配、缓存机制、语义理解以及数据治理,都会影响生成可信AI输出的成本。能够优化数据层的企业,不仅可以减少不必要的Token消耗,还能提升AI的性能、可靠性和可扩展性。
一个新词,描述的是一种早已存在的模式
“Tokenomics(Token经济学)”常常被理解为模型服务商定价页面上的数字:每百万输入Token的价格、每百万输出Token的价格。价格越低,业务案例似乎就越有吸引力。
这只是故事的一部分,而非全部。
类似的情形我们早已见过。云计算曾长期停留在“有趣的试点项目”阶段,直到单位算力成本低于企业自建基础设施的成本,才真正迎来大规模普及。它的采用并不是缓慢增长,而是迅速爆发。
AI同样遵循这一规律。当获得一个成功结果的单位经济成本低于维持现状的成本时,这项技术就会成为必然选择。真正推动这一转变的,并不是模型变得更智能,而是实现结果的成本变得更低。
因此,真正值得关注的问题并不是“一个 Token 的成本是多少?”,而是“为了获得一个可信的答案,需要消耗多少Token?除此之外,我还为实现这一结果付出了哪些成本?”
而这些问题的答案,都存在于数据层。
真正的成本公式
大多数 AI 商业案例都假设:
成本 = Token 数量 × Token 单价。
但实际上,更接近真实情况的计算方式应为:
每次有效结果的成本 =(上下文 Token + 生成 Token)× Token 单价 × 成功所需的平均尝试次数 + 检索与数据处理流水线的算力成本 + 数据存储、传输与重复带来的成本 + 因答案缺乏可信度而产生的成本。
其中,只有 Token 单价这一项由模型服务商决定,也是企业最难掌控的因素。其余三项,则完全掌握在企业自己手中。
不要把战略建立在价格战之上
随着 AI 推理能力的单位成本大幅下降,人们很容易据此推断,其成本最终将趋近于零。但对此仍需保持谨慎,原因主要有以下三点。
基础设施成本终究需要回收。 数据中心、电力、芯片和散热等基础设施都需要大量资本投入,而这些投入最终都必须通过某种方式收回——无论是体现在推理服务的价格中,还是体现在算力资源的使用条件上。能力变得更便宜,并不意味着算力资源本身也同样廉价。
Token 越便宜,消耗的 Token 往往越多。 杰文斯悖论(Jevons' Paradox)始终成立:推理成本下降,并不会让企业的 AI 支出减少,反而会促使企业将 AI 推理应用到更多场景,从而进一步扩大 Token 的总体消耗。
AI 智能体(Agent)改变了成本计算方式。 一个能够自主规划、调用工具、反复推理并不断重试的 AI 智能体,在每一次循环中都会重新发送累积的上下文信息,其 Token 消耗可能是一次直接调用模型的数十倍甚至数百倍。因此,Token 消耗并不会随着任务复杂度线性增长,而是呈现复合式增长。
因此,即使 Token 的单价持续下降,企业的 AI 总支出仍可能不断增加。除非企业能够主动优化决定 完成任务究竟需要消耗多少 Token 的那一层——数据层。
杠杆一:不要再为低质量数据支付溢价
几乎每个数据环境(Data Estate)都存在大量 ROT 数据——即冗余(Redundant)、过时(Obsolete)和无价值(Trivial)的数据。
例如,同一项政策存在七个不同版本;三个“记录系统”保存着彼此矛盾的数据。过去,由于存储成本较低,这更多只是一个数据治理问题。但当 AI 模型开始使用这些数据时,它们就会演变为每次查询都需要支付的成本:企业需要为这些数据建立向量索引、在每次查询时将其检索到上下文中,并承担模型基于相互矛盾的信息进行推理后,输出模糊甚至错误答案所带来的人工校验成本。
数据副本泛滥同样如此。一份经过良好治理的权威数据,远胜于九份为了方便而复制的数据。因为副本越多,模型检索到过期或错误数据的概率就越高。
因此,数据去重、数据分层和数据规范化,如今已不仅仅是数据治理工作,而是具有明确投资回报的数据成本优化措施。
确定哪一个系统才是真正的权威数据源,也不再只是治理层面的讨论,而是直接影响 AI 成本的一项投入。
如果AI必须在大量无价值的数据中筛选出真正有价值的信息,那么企业实际上是在以完整的模型推理成本,为十年前本应完成的数据治理“买单”。
杠杆二:提升检索精度,就是控制成本
最简单的方式是尽可能多地检索相关内容,将大量信息填充进模型的上下文窗口,再交给模型自行判断哪些信息有价值。
但这也是成本最高的方法。
因为每一次调用模型,都需要为全部上下文 Token 付费;而对于 AI 智能体(Agent)来说,每一次迭代都会重新发送这些上下文,成本还会不断累积。
更加工程化的方法,应结合以下能力:
合理的数据分块
混合检索
关键词检索与语义检索
在相似度计算之前进行元数据过滤
检索结果重排序
基于数据时效性和权威性的加权排序
仅依赖向量检索,往往难以准确处理设备编号、零件编号、错误代码等需要精确匹配的信息。
实践表明,两种方案之间,每次查询所消耗的Token数量,往往可以相差一个数量级。
更重要的是,检索越精准,模型生成答案的质量通常也越高。因为当有效信息被大量噪声淹没时,模型的推理能力也会随之下降。
能够同时降低成本、提升质量并减少时延的优化手段并不多,而提升检索精度正是其中之一。企业在这一环节投入的每一美元,都能够持续降低未来每一次 AI 查询的推理成本。
杠杆三:让每项任务运行在最合适、成本最低的算力上
很多企业习惯性地认为,AI工作负载(AI Workload)就意味着必须使用GPU。事实上,这种认知不仅不准确,而且成本高昂。数据摄取、数据解析以及文本提取本质上都是CPU更擅长处理的任务。数据清洗、去重、关联以及聚合也是如此,这些正是分布式查询引擎数十年来持续优化的能力。同样,关键词检索、数据过滤以及传统分类算法(Classical Classifiers),通常只需大型语言模型千分之一甚至更低的成本即可完成。
因此,应把昂贵的 GPU 留给真正需要的大模型推理。应将每一项任务分配给能够正确完成该任务、同时成本最低的计算资源。更重要的是,不要让前沿大模型去完成 SQL 的 WHERE 子句本就能够精准完成的工作。
如果问题本质上只是一次查询、一次关联或一次聚合,那么就应先通过传统计算完成结果,再将结果交给模型进行理解和表达。这样不仅成本更低、速度更快,而且结果始终准确。而算术计算恰恰不是大型语言模型最擅长的能力。存储格式也是同样的道理,只不过更加容易被忽视。
采用列式存储、开放表格式以及符合实际访问模式的数据分区,能够充分发挥谓词下推能力。这意味着,同样一个查询,系统可能只需扫描2GB数据,而不是1PB数据。最便宜的Token,永远是那个根本无需生成的Token。
杠杆四:构建语义层,让模型无需“猜测”
如果模型无法理解企业数据的真实含义,它就只能依靠不断尝试来推断,而这意味着更多的迭代、更高的成本。
例如,让模型查询“企业客户业务第三季度的营收”,但面对的只是一个未经定义的原始数据模型。
模型可能会找到四个可能代表“营收”的字段,却无法判断“Enterprise”究竟代表客户类型、产品线还是销售区域——因为在不同的数据表中,它可能分别表示这三种含义。模型也不知道企业财年的第三季度并不等同于自然年的第三季度。
因此,它只能不断抽样、生成查询、发现结果异常、再重新生成查询……每一次循环都会增加Token消耗,而最终得到的结果仍然需要人工核查。
如果能够为模型提供统一定义的业务指标、经过认证的维度、数据血缘以及明确标识的权威数据源,这一系列探索过程便会大幅缩短。
最终,模型只需执行一次规范的查询,即可得到唯一、可追溯的结果。过去,数据目录和数据定义更多是基于数据治理的需要,其价值虽然得到认可,却难以获得足够预算。
如今,它们已经能够直接带来可量化的Token成本节省,因为每一次“猜测”都会产生Token费用。更进一步,如果一个AI应用因缺乏可验证的数据访问控制而无法投入生产环境,那么它实现一次有效结果的成本实际上就是无限大。
杠杆五:缓存、预计算与重复利用
几乎所有企业级AI工作负载都具有重复性,应充分利用这一特点。
缓存所有相对稳定的数据。例如,未发生变化的文档的Embedding、在数千次调用中保持一致的系统提示(System Prompt)、Schema描述以及策略文档。多数模型服务商都会对这类缓存上下文提供更低的计费。此外,对于已经生成过的答案,也应进行缓存。例如,当400名员工提出同一个制度问题时,理想情况应是产生400次缓存命中(Cache Hit),而不是400次模型推理调用。
提前完成计算(Precompute)。如果某项摘要或分类结果会被反复使用,就应在数据接入阶段一次性完成,而不是每次请求都重新调用模型。将重复发生的模型推理,转变为一次简单的数据查询。
根据任务复杂度选择模型。分类、路由和简单问答等任务,并不需要使用参数规模最大的模型。应优先采用小模型处理,仅在模型置信度较低时,再升级至更强的大模型。这样可以显著降低整体推理成本,同时几乎不会影响最终质量,因为真正复杂的问题仍然由能力更强的模型负责。
杠杆六:模糊的需求,会以 Token 的形式计费
模型不会主动推断那些没有明确表达的意图。面对一个模糊的任务,它也不会停下来向用户确认,而是不断尝试理解需求。
对于AI智能体而言,收到一个目标不清晰的任务后,它通常会自行拆解任务、尝试一种方案、重新评估、再尝试另一种方案,并在每一次循环中重新读取不断增长的上下文信息。
模糊的指令不仅会导致答案质量下降,更会带来高昂的Token成本。因此,应首先明确任务的完成标准。

输出需要采用什么格式?应包含哪些内容?哪些内容属于任务范围之外?没有明确成功标准的AI智能体,并不知道什么时候应该停止。其次,应限制智能体能够调用的工具数量。每增加一个可调用工具,都会增加模型需要反复读取的上下文信息,也意味着多了一条可能浪费计算资源的决策路径。
此外,应尽量返回结构化数据。相比于让模型反复解析一大段自然语言文本,一个具有明确类型定义的数据对象,其处理成本要低得多。
最后,应为 AI 智能体设置明确的边界:
限制最大迭代次数;
限制工具调用次数;
设置 Token 预算上限;
使用历史摘要替代完整对话记录,而不是每一次都携带全部上下文。
无限制的Agent循环,是生成一张“令人意外”的 AI 账单最可靠的方法。
无法度量,就无法优化
大多数企业只知道 AI 的总体支出,却几乎不了解其他任何成本指标。这就像 2013 年初期的云计算一样,当时企业只关注云支出总额,而 FinOps 正是在这种背景下应运而生。
应建立以每次成功结果的成本为核心的度量体系,例如每张成功处理的工单成本、每份成功处理的文档成本、每次 AI 智能体(Agent)运行的成本。这才是真正决定 AI 商业价值能否成立的关键指标。
在这一指标之下,还需要持续监测影响成本的各项驱动因素:
让这些指标按具体应用场景和团队进行可视化展示。仅仅将每次成功结果的成本透明地呈现给开发和建设 AI 应用的团队,所带来的行为改变往往比大多数技术优化措施更加显著。
信任,是一切价值的基础。
一个无人信任的答案不仅没有价值,反而具有负价值。它需要消耗 Token 才能生成,需要人工进行验证;而一旦在管理层面前给出错误答案,还会损害整个 AI 项目的可信度。
这样的情况发生几次之后,即使企业已经为此投入了大量成本,这个应用场景也会悄然被放弃。
信任并非来自模型本身,而是来自数据血缘能够回答“这个数字来自哪里?”;来自访问控制能够确保模型只能访问用户有权限查看的数据;也来自整个组织采用一致的数据定义。
如今,几乎每家企业都能够搭建一个可以演示的 AI 应用。但要真正让 AI 成为企业日常运营所依赖的能力,则需要坚实的数据基础。而那些过去十年持续投入建设数据基础能力的企业,实际上已经在不知不觉中建立了自己的 AI 成本优势。
实践路径
1. 建立度量体系。按具体应用场景衡量每次成功结果的成本。通常成本分布并不均衡,往往只有两到三个应用场景占据了大部分支出。
2. 优先优化上下文规模。这是影响成本最大的杠杆,也是最容易快速取得成效的优化方向。
3. 清理数据资产。开展数据去重、规范化、删除无价值数据,并明确权威数据源。
4. 重新分配算力资源。将确定性计算任务从GPU转移到更适合、成本更低的计算资源上执行。
5. 优化模型路由与缓存。根据任务复杂度选择不同规模的模型,并对重复发生的任务提前进行预计算。
6. 进一步明确需求定义。限定AI智能体的任务范围,限制迭代次数,并采用结构化方式输出工具调用结果。
7. 持续完善语义体系与数据治理。这是能够持续产生复利效应的关键杠杆,它不仅能够降低后续每一个AI应用场景的建设成本,也能加快业务审批和落地速度。
总结
Tokenomics(Token经济学)并不是一个定价问题,而是一个披着定价外衣的架构问题。真正重要的曲线,并不在模型服务商的定价页面上。因为模型价格的下降,对所有企业都是一样的,因此不会成为任何企业的竞争优势。真正决定竞争力的,是企业自己能够掌控的那条曲线——企业究竟能够以多高的效率,借助 AI 将一个业务问题转化为一个可信的答案.
这一切都发生在数据层:取决于企业保存了哪些数据、删除了哪些数据;取决于数据检索是否足够精准;取决于昂贵的算力资源是否真正用于值得投入的任务;也取决于企业的系统是否真正理解数据的含义,而不是每次都从零开始推断,并为此付出完整的推理成本。
模型是最容易采购的部分,而数据层则需要企业长期建设。真正决定AI经济效益能否成立的,也正是数据层。
本文作者

Stephen Catanzano
首席分析师
(Principal Analyst),
数据中心 & AI
文章版权和解释权归微信平台Omdia所有


Omdia隶属于Informa TechTarget, Inc. d/b/a Informa TechTarget(纳斯达克代码:TTGT),是一家全球领先的技术研究与咨询机构。依托对科技市场的深刻洞察、与行业领导者的深入对话以及庞大数据资源,Omdia帮助客户洞察趋势、把握机遇,抢占市场先机。从研发到投资回报,我们识别最具潜力的机遇,推动科技产业持续发展。
omdia.com.cn
Joyce.Liu@omdia.com



