财联社-深度 4小时前
英伟达新一代算力平台补齐拼图 结合DeepSeek模型Token成本可降35倍
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

《科创板日报》8 月 25 日讯(编辑 宋子乔) 英伟达硬件演进正加速驶向下一站,为智能体(Agent)打造新一代算力平台。

当地时间 8 月 24 日,英伟达宣布,推理加速器 Groq 3 LPX 机架已进入全面量产阶段。英伟达高级总监 Dion Harris 表示,Groq 机架将与 Vera 中央处理器和 Rubin 图形处理器一同部署在新型云服务商 Nebius 的数据中心,并将于今年晚些时候上线。

Groq 3 LPX 机架是英伟达专为 Vera Rubin 平台设计的推理加速扩展组件,需与 Vera Rubin NVL72 GPU 主机架搭配部署—— NVL72 负责更广泛的训练、推理以及上下文处理,LPX 专门加速输出 AI 生成结果(Token),主打超低延迟 Token 生成,两者异构协同,可大幅提升万亿参数、超长上下文智能体推理的每瓦吞吐与交互响应速度。

英伟达此前将 Vera Rubin 平台定义为专为智能体 AI 与科学计算时代设计的机架级超级计算平台。英伟达此次将 Groq 3 LPX 正式推向全面生产,核心目的并不是用专用推理芯片取代 GPU,而是为 Vera Rubin 补充传统 GPU 架构在低延迟 Token 生成方面的能力。

相比 Blackwell,Vera Rubin 在智能体工作上的效率得到了极大的提升,英伟达释出多个最新测试数据(本次测试使用的基准为 SemiAnalysis AgentX,该基准针对 Kimi K3、MiniMax M3、GLM5.3、Qwen3.5、DeepSeek V4 Pro 等各类模型)——

英伟达称,在 Artificial Analysis 测试中,搭载 Gemma 4 31B 模型、100K Token 上下文时,Groq 3 LPX 实现每秒 3400 个输出 Token,为该模型创下最高纪录;针对智能体编程等低延迟工作负载,其响应速度最高达到最近竞争平台的 4 倍。英伟达称,这种速度可以让智能体更快完成代码编写、测试、工具调用和结果验证等连续任务。

与此同时,英伟达公布 Vera Rubin NVL72 在真实智能体工作负载下的新测试结果:基于 SemiAnalysis 的 AgentX 工作负载、采用 DeepSeek V4 Pro 模型,Vera Rubin 每兆瓦(MW)吞吐量最高达到上一代 GB300 NVL72 的 30 倍,每 Token 成本最高降低 35 倍。对于运营商而言,这意味着在固定的电力和基础设施预算下,可以支持更高的交互式代理容量,或者以更低的运营成本提供相同的容量。

英伟达强调,智能体任务不同于传统聊天对话,任务上下文会随着数百个步骤不断累积,甚至达到数十万 Token。英伟达援引 OpenRouter 数据称,智能体 AI 工作负载消耗的 Token 数量可以达到简单聊天请求的 15 倍。原因在于,一个智能体可能先查询数据库,再搜索新闻和文件,调用子智能体进行分析,运行代码并反复验证,整个过程中上下文不断累积。

近期腾讯、阿里、DeepSeek 等头部厂商相继推进 AI 智能体产品迭代与生态布局,AI 应用端发展聚焦终端场景落地与生态壁垒搭建。天风国际证券最新研报称,当前 Harness 加速开放迭代,前沿 AI 竞争正向 Agent 执行框架与商业化兑现深化。

英伟达正紧随这一趋势调整硬件优化方向,当 AI 迈入智能体时代,AI 基础设施的评价体系或将随之变化,基础设施服务商的硬件迭代重心将从追求训练更大模型,转向单位能耗有效 Token 产出、单位成本任务处理能力,以及智能体复杂任务的执行时延。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

英伟达 ai 最高纪录 科创板 基础设施
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论