"大多数业务不要需使用顶尖的过剩智能。"
作者:苏打
编辑:tuya
出品:财经涂鸦(ID:caijingtuya)

"AI 竞争正经历从‘规模竞赛’到‘效率竞争’再到‘绿色竞争’的范式演进,我们必须让每一个 Token 承载更高的智能价值、消耗更少的能碳代价,最终推动 AI 走进千行百业。"
公司情报专家《财经涂鸦》获悉,9 月 10 日,"Token 效率:推动 Agent 智能提升与广泛应用的关键 " 见解论坛于 2026 Inclusion · 外滩大会举行。论坛共识显示,算力堆叠的粗放时代已经终结,通过全栈系统工程击碎 Token 膨胀,不仅是 Agent 实现规模化商业普及的硬性边界,更是推动 AI 回归绿色低碳与数字普惠的唯一正轨。
会上,蚂蚁集团副总裁、平台技术事业群总裁骆骥对蚂蚁集团联合中国信息通信研究院人工智能研究所编写的《Token 效率:AI 时代绿色计算的关键变量》研究报告进行了预览介绍。
报告提到,Agent 单任务 Token 消耗可达标准对话的 5 至 30 倍,编码类甚至超 1000 倍,而国内智算 GPU 利用率不足 30%,同时智算集群的电力需求正突破区域电网承载极限。
"Token 效率是化解这一矛盾的关键变量"。报告指出,进入 AI 时代,大模型引入了 Token 这一新的关键转化环节,绿色计算的转化链路从 " 碳→电力→算力→业务 " 的四级扩展为 " 碳→电力→算力→ Token →业务 " 的五级转化,Token 由此成为连接算力投入与业务产出的核心枢纽,Token 效率也成为 AI 时代绿色计算新的优化维度和抓手。
报告还构建了覆盖模型层、推理层、Agent 层、应用层的四层 Token 效率全栈技术体系框架,并面向未来提出涵盖计算效率、上下文与 Token 利用效率、任务效能、经济性、能碳效率五个维度的度量体系。
以全链路工程解法对抗 Token系统性消耗
" 国内算力受限,倒逼我们在模型架构上想办法。" 蚂蚁集团百灵语言基座负责人张志强在论坛中坦言。
面对 Agent 的长上下文挑战,百灵大模型将高稀疏 MoE 与混合线性注意力结合,仅激活六十四分之一的参数就换来数倍容量收益;配合 " 先学通识再做题 " 的课程编排与 FP8 低精度训练,生产吞吐直接飙升超 30%,甚至正探索极限的 FP4 预训练,真正实现用更低的 FLOPs 撬动更高阶的智能。
据 SGLang 核心贡献者童心源分享,SGLang 首日闪电支持 DeepSeek V4.1 等模型,依托基数树缓存(Radix Cache)与分级存储实现上下文极致复用,避免无谓重算;配合自研投机解码与 PD 分离,不仅将高并发 Agent 吞吐拉升 2.7 倍,更在与蚂蚁百灵合作中跑出 1120 tokens/ 秒的惊人速度,让复杂长程任务从 10 分钟压缩至 2 分钟内闭环。
论坛中,盛大集团副总裁兼 EverMind CEO 邓亚峰则进一步指出,模型参数迭代慢,但记忆与 Harness 层可极速演进。面对长交互带来的 Token 暴增,EverMind 通过结构化长期记忆底座 EverOS+ 自进化 Agent 框架 Raven,将海量交互数据精准提炼后按需喂给模型,不仅以十分之一的数据量实现高保真交付,更跑出 "Token 消耗减半、性能逆势提升 " 的实效。
单点技术无法消解系统性消耗,因此,行业需要一套贯穿模型、引擎、记忆与 Infra 的全链路工程解法。
" 编码 Agent 的消耗暴涨了 1,200 倍,行业正从粗放的‘ Token Maxing ’走向理性算账。" 蚂蚁集团平台技术事业群总架构师黄挺指出。
据悉,蚂蚁灵犀平台通过自研路由模型将任务精准分流,直接省下 38.9% 的成本;更结合上下文动态裁剪、JSON 语义化压缩,以及将巡检海量结果外置仅留摘要等工程手段,在特定场景斩掉多达 98% 的无效 Token,用系统工程重构智能的成本底座。
大多数业务不需要最顶尖的过剩智能
在圆桌上,蚂蚁集团郑佳俊、邓亚峰与 ACE Studio 创始人郭靖展开观点碰撞。
郑佳俊算了一笔账,个人用 AI 买生产力,一个月花几十上百美元不算贵;但一旦落地到蚂蚁这种日活亿级的具体业务,单次调用的高昂成本乘以海量并发,对于商业来说就是不可承受的数字。
"大多数业务不需要最顶尖的过剩智能,拿百 B 级模型配上定向 SFT,成本降到两三成,效果并不会变差。"
ACE Studio 创始人郭靖以 AI 音乐创作印证了这一逻辑。他坦言,在专业任务中,基于大模型自蒸馏出几十 B 参数的专用模型,表现不仅不输最先进大模型,成本却能低上几个数量级," 合适比最强更重要。"
" 过去行业有个误区,仿佛花掉的 Token 越多就代表创造的价值越大,这完全错了。"EverMind 邓亚峰同时给出一套解题思路,通过构建本地懂偏好的轻量模型协同云端强模型的 " 混合调度 ",或者将长记忆用几十 B 的小模型精炼后再喂给基座,完全可以在性能不缩水的前提下,将综合成本直降三分之一。
本文由公众号财经涂鸦(ID:caijingtuya)原创撰写,如需转载请联系涂鸦君。
添加涂鸦君个人微信(ID:tuyaclub)
加入【公司情报社群】
参与资本市场讨论
获取一手情报


登录后才可以发布评论哦
打开小程序可以发布评论哦