记者在2026世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026)上采访发现,随着智能体让词元消耗大幅攀升 ,降本增效成为众多企业的发力点。从芯片到算电协同,从大模型到智能模型路由,每个环节都在为降低词元成本而发力 。

当前,国内算力芯片创业市场上 ,张量处理单元(TPU)是热门赛道。在大规模纯张量AI训练或推理的场景下,最新代际TPU的能效 、单位词元成本优于主流GPU产品。
TPU芯片企业中昊芯英创始人杨龚轶凡表示,百万词元成本降到最低是当前优化的方向 ,因为高额算力成本已经制约AI商业化落地。公司新一代芯片的目标就是大幅压低单位词元成本,比上一代成本直接减半,后续迭代有望降到原有的十分之一 。只有成本下探 ,各类AI应用才能规模化普及。
算力中心的成本从源头决定词元成本。2026年政府工作报告中首次提及“算电协同”,对此,中科类脑董事长刘海峰告诉记者 ,算力基础设施全生命周期成本中,电力支出占比超20%,是决定算力产业核心竞争力的关键变量 。以1000P标准算力集群为例 ,年度总耗电量约2000万度,依托平台优化可节约20%用电量,即每年减少400万度电力开支,节约成本直接转化为经营毛利 ,大幅提升价格竞争力。
对于算电协同降本增效的路径,刘海峰表示,目前算电协同更多依靠物理空间靠近 ,未来重点是实现算力、电力双向柔性联动调度。例如通过统筹风电、光伏、储能多类型供电来源,动态测算不同时段最优供电成本结构,最大化绿电使用比例;同时基于分时电价 、风光发电实时波动 ,灵活迁移算力任务负载,主动错峰使用低价清洁能源,从源头压缩算力用电成本 。
不少国产大模型在追求性能的同时 ,也在着力改善词元性价比。腾讯副总裁林松涛表示,混元HY3大模型以相对小的参数实现了比肩更大尺寸旗舰模型的能力,使用成本只有顶尖模型的百分之几 ,为企业的规模化应用提供了更加经济的选择。
美团LongCat-2.0(龙猫)大模型在业内首次提出输入命中缓存不收费的模式 。对此,美团相关负责人透露,典型智能体使用场景中,用户输入和输出比例约为150比1。经测算 ,针对输入部分的缓存词元采用不计费规则,用户的综合成本有望降低一个数量级。
刚上线即引发关注的万亿参数旗舰模型Kimi K3,虽然单价不菲 ,却表现出了颇为不错的性价比 。
大模型评测机构SuperCLUE发现,通过测算完成同样任务的成本开支,Kimi K3在任务得分比第二名高出18%的前提下 ,任务平均成本却低约16%。这意味着,国产旗舰模型的性价比在持续优化。
对此,SuperCLUE创始人徐亮认为 ,Kimi K3在处理多轮交互复杂任务时,依托更强底层能力减少迭代轮次,叠加优异的上下文缓存命中率 ,综合调用开销优于预期。
由于不同大模型的能力和价格差别较大,“智能模型路由 ”也成为WAIC的热点 。
派欧云创始人姚欣介绍称,此前智能模型路线仅做简单“请求转发”,新的智能模型路由在处理高价值、高风险或结果不确定的关键步骤时 ,不是只问一个模型,而是将问题同时分发给多个擅长此道的专家模型,通过交叉验证和融合生成最终答案。同时智能路由会根据任务类型进行选择 ,比如简单问答用轻量模型,复杂推理用强模型,并压缩冗余上下文 ,复用之前的计算结果,设置预算护栏和失败回退机制。最终目标是用更经济的词元成本,完成同样质量的任务 。
派欧云综合测算发现 ,其智能模型网关可以将智能水平提升20%,同时将成本降低50%到60%。
(文章来源:经济参考报)