智曲信息技术研究院长期聚焦 AI 芯片、服务器架构与数据中心技术的发展趋势,本文为智曲信息为大家带来的最新行业动态深度分析。"我们正处在Agentic AI(智能体AI)时代的转折点。"这是英伟达管理层在最近一次财报电话会上做出的判断。支撑这一判断的核心证据,是全球token消耗量的陡峭增长曲线——第三方监测机构OpenRouter的数据显示,在Claude Code、OpenAI Codex等各类编程智能体的驱动下,全球大模型的token消耗量正以前所未有的速度攀升。
与聊天式AI一问一答的模式不同,智能体在执行任务时需要连续进行数十甚至上百次模型调用:理解指令、拆解步骤、调用工具、验证结果、自我修正。一个看似简单的"帮我分析这份报表并生成报告"的指令,背后可能产生数百万token的计算量。这种"推理密集型"的应用形态,从根本上改变了算力需求的结构。
业内将这一趋势概括为"token经济学":token的生成速度决定用户体验,token的成本决定商业可行性。谁能提供更低的单位token成本和更高的生成速度,谁就能在AI基础设施竞争中占据主动。这也是英伟达近期所有产品宣传都聚焦"每瓦token数"和"单位token成本"这两项指标的深层原因。
对云厂商而言,token消耗量与云收入之间的关联度正变得越来越高,这给了他们持续加码资本开支的底气。目前头部云厂商已将经营现金流的大部分投入AI基础设施建设,且丝毫没有减速迹象。
观察人士指出,与训练算力需求的阶段性波动不同,推理算力需求一旦被智能体应用激活,就会随着应用渗透率的提升而持续复利式增长。对企业CIO来说,现在需要认真评估的不再是"要不要上AI",而是"如何以最优成本结构承接即将到来的推理负载洪峰"。
