过去几年,大模型行业最受关注的指标,往往是参数规模、上下文长度、模型性能和各类评测榜单。 但随着人工智能从模型训练走向大规模应用,一个新的指标正在受到越来越多关注——词元(Token)调用量。
近期,润迅团队参加人工智能产业相关会议时,现场分享的一组数据十分直观地体现了这一变化:从2025年5月至2026年8月,OpenRouter平台模型周均词元(Token)调用量从约2.29T/周快速增长至93.4T/周;现场展示的另一组数据中,豆包日均词元(Token)调用量也呈现出明显增长趋势。

图:润迅团队参加人工智能产业相关会议,现场分享词元(Token)调用量增长趋势
这些数字背后,真正值得关注的并不只是“大模型使用的人越来越多”。
更重要的是,人工智能的使用方式正在改变。
从模型能力,到模型真正被调用
词元(Token)是大模型处理文本和信息的基本单位之一。
无论是一次对话、一段代码生成、一份文档分析,还是知识库检索、AI Agent执行任务,背后都会产生不同规模的词元(Token)输入和输出。
因此,相比单纯讨论一个模型拥有多少参数,词元(Token)调用量更直接地反映了模型究竟被使用了多少。
过去,大模型更多被作为聊天工具使用,一名用户提出一个问题,模型完成一次回答,整个调用链相对简单。
进入Agent时代后,这种关系正在发生变化。
一个AI Agent为了完成一个任务,可能需要理解目标、检索资料、调用工具、分析结果、重新规划、再次调用模型并最终输出结果。
对于用户来说,这可能只是“一次任务”。
但对于模型基础设施而言,背后可能已经发生了多轮甚至大量模型调用。
因此,当AI从“回答问题”逐渐走向“执行任务”,词元(Token)的消耗速度也会随之上升。
词元(Token)增长,意味着企业面对的问题也在改变
如果一家企业每天只发生少量模型调用,那么直接连接某一家模型厂商的API,通常已经能够满足需求。
但是,当模型调用规模持续增加之后,事情开始变得复杂。
企业可能同时使用OpenAI、Claude、Gemini、DeepSeek、Qwen、豆包等不同模型,也可能同时存在研发、知识库、客服、办公、Agent等不同AI应用。
此时,企业真正需要回答的问题开始从:
“我们应该用哪个模型?”
逐渐变成:
“我们的AI系统应该如何统一调用这些模型?”
哪些业务正在产生词元(Token)消耗?
哪些任务需要更强的模型?
哪些任务可以交给成本更低的模型?
不同模型之间如何切换?
越来越多的模型接口应该如何统一管理?
这也是为什么,随着词元(Token)调用量增长,模型网关和统一模型调用平台开始变得越来越重要。
MaxModel连接的,正是模型与应用之间这一层
润迅MaxModel并不是再创造一个新的大模型,而是面向企业多模型使用环境,在应用与不同大模型之间建立统一的模型服务入口。
上层的AI应用、Agent和业务系统,可以通过统一方式连接不同模型能力。
从这个角度看,MaxModel所解决的问题与词元(Token)调用规模的增长有着直接关系。
当调用量很小时,企业关注的是:
有没有模型可以用。
当调用量不断扩大之后,企业开始关注:
模型怎么接、怎么管、怎么切换,以及大量词元(Token)调用如何被更有效地组织起来。
这也是人工智能真正进入规模化应用之后,基础设施层正在发生的变化。
模型决定能力上限,而词元(Token)调用,决定这些能力是否真正进入业务。