technology

AI 令牌能计量支出,却不能衡量智能

按令牌计费正在 AI 领域普及,但模型特定的计数、缓存、质量和能耗,使其尚不能成为通用商品单位。

1 分钟阅读 39 palabras
#artificial intelligence #AI infrastructure #cloud computing #enterprise software #FinOps
AI 令牌能计量支出,却不能衡量智能

目录

令牌正在成为商业人工智能中最显眼的计量器。供应商统计模型读取和生成的内容,企业收到使用报告,财务团队也能给原本像无价实验的应用分配明确成本。NPR 的报道提出,令牌是否会成为 AI 时代的千瓦时。

这个类比让 AI 消耗变得可读,因此很有用,但并不完整。千瓦时是标准化的物理量;令牌则由模型的分词器和计费规则产生。两个系统可能以不同方式切分同一提示,对读取和生成收取不同费率,并用不同的计算量产出质量不等的结果。令牌已经是发票单位,但还不是商品单位。

令牌衡量模型工作,而非固定物理量

文本令牌是由模型编码方式定义的信息片段。它可能是一个完整单词、单词的一部分、标点或其他元素。这让令牌数量在同一模型家族内可复现,却不能自动跨家族比较。仅仅更换分词器,同一份文档的计数就可能不同,此时还没有考虑智能水平、硬件或能效差异。

商业计量又增加了更多层次。Amazon Bedrock 的计费文档分别记录输入、输出、缓存读取和缓存写入令牌,因为它们可能采用不同价格。其配额文档还区分实际计费量与某些令牌类型消耗服务容量的速度。这些控制是合理的,却说明每百万令牌的标题价格无法描述完整的经济产品。

这并不意味着令牌数据没有价值。在应用、模型和配置保持稳定时,它能显示使用量增长并帮助发现浪费。错误在于把令牌增长直接当作有效智能增长,或把标价下降视为完成一项业务任务的成本同比下降。

只有加入工作负载结构,发票才有意义

企业工作负载由输入、输出、缓存上下文、重试和失败答案组成。检索系统可能读取大量缓存材料,只生成简短回答;编程代理可能输出很长,并在工具出错后重复步骤;推理模型也可能消耗远超可见答案所暗示的计算量。不同模式会把同一价格表变成不同账单。

质量和延迟构成剩余的分母。TokenArena 研究从价格、响应速度、有效上下文、质量和建模能耗等维度评估真实推理端点。其核心发现是差异性:排名会随工作负载结构变化,即使原始令牌价格看似可比,每个正确答案的成本或能耗也可能明显不同。这是研究证据,并非适用于所有生产系统的普遍定律,但它指出了正确问题。买方需要的是一个被接受结果的成本,而不只是生成文本的成本。

这种区别也影响供应商。供应商可以通过提高硬件利用率、使用更小模型或大幅折扣来降低令牌价格。如果质量下降导致更多重试,客户的实际成本未必改善。反过来,更贵的模型若能一次完成高价值任务,也可能更经济。每令牌价格衡量费率,每个经验证任务的成本才衡量业务结果。

标准能让计量器可审计,却不能让它成为通用单位

计量缺口已经足以吸引标准机构。6 月,Linux Foundation 宣布将与 FinOps 社区合作,为 AI 基础设施经济建立开放规范、基准和最佳实践,其中包括把通用云成本规范扩展到基于令牌的支出。

有用的标准可以要求供应商和网关报告模型身份、输入输出量、缓存活动、服务等级、地区、批处理状态、延迟和调整项。它还可以定义企业如何把这些遥测数据连接到具体应用和被接受的结果。这样的披露能让发票可核对,也能降低跨供应商比较的脆弱性。

但它不会把令牌变成焦耳。质量依赖任务,分词器可能不同,供应商也可能在单位名称不变时改变模型行为。现实的近期成果是带有一致元数据、可审计的计量器,而不是智能的统一物理换算率。

真正可投资的信号是每个有用结果的成本

对投资者而言,令牌总量增长可以显示采用程度,却不能单独回答利润率问题。收入取决于定价和结构,毛利取决于推理成本,客户留存则取决于输出是否节省时间、增加收入或降低风险。供应商若一边补贴昂贵工作负载,一边报告更多令牌,活动增长可能快于经济价值增长。

对企业买方而言,实用基准应是一组跨模型验证的小型任务,并衡量总账单、完成率、人工审核时间、延迟和错误成本。令牌数量应放在这张记分卡内,而不是凌驾其上。这也说明了反方观点:令牌无需成为物理单位也能支持采购,云客户同样会比较运行在不同硬件上的虚拟机。一致披露可以在完美可比性出现之前建立可用市场。

如果供应商采用不依赖分词器的等价规则,而且独立审计证明令牌、能耗、质量与成本在不同工作负载间存在稳定关系,本分析就需要改变。在此之前,令牌最适合被理解为 AI 经济发票上的一行。它能说明购买了多少计量活动,但更困难的指标——交付了多少有用智能——仍需围绕它另行建立。

来源:

NPR

相关文章

相关文章即将推出...