投资界 17小时前
梁文锋突袭马斯克
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

原标题:梁文锋突袭马斯克

今天,这一架太魔幻了!

一边是梁文锋,终于在凌晨放出了 DeepSeek V4 Pro 正式版。

另一边,马斯克砸下了下一代旗舰 Grok 4.6,主打一个成本低,性能强。

两大巨头,同一时间发布,火药味儿瞬间拉满。他们盯上的,几乎是同一件事——

让模型能在长任务里持续调用工具、修改代码、验证结果,最后交付一个真正能用的成品。

DeepSeek V4 Pro 来了

马斯克 Grok 4.6 出战

DeepSeek V4 Pro 正式版最亮眼的成绩,是在两项评测中拿下 **,直接反杀 Fable 5。

网络安全智能体测试 CyberGym 拿到 83.3 分,超过 Fable 5 的 83.1 分、Opus 4.8 的 78.3 分。

自动化任务 AutomationBench 拿到 31.8 分,把 Fable 5 的 29.1 分和 Opus 4.8 的 27.2 分一起压了下去。

最「贴脸」的一次,则发生在 Terminal-Bench 2.1。

DeepSeek 拿到 87.9 分,超过 Opus 4.8 的 85.0 分,距离 Fable 5 的 88.0 分,只差 0.1。

其他几项高难度 Agent 测试中,DeepSeek 则实现了对 Opus 4.8 的 * 跨越。

带工具的「人类最后考试」中拿到 60.0 分,反超 Opus 4.8 的 57.9 分,继续逼近 Fable 5 的 63.0 分。

就连此前最薄弱的软件工程智能体,DeepSWE 也从预览版的 12.8 分暴涨到 62.7 分,接近原来的 4.9 倍。

这个成绩不仅超过 Opus 4.8 的 58.0 分,距离 Fable 5 的 70.0 分也只剩 7.3 分。

同一时间,马斯克也把 Fable 5 和 GPT-5.6 Sol 架在了火上烤。

Grok 4.6 先是在综合能力上追平 GPT-5.6,再在编码测试中连续完成反超。

综合智能指数上拿到 61 分,距离 Fable 5 的 62 分只差 1 分。

CursorBench 上拿到 69.9%,超过 GPT-5.6 的 67.2%,距离 Fable 5 的 70.5% 只有 0.6 个百分点。

FrontierCode 上拿到 61.3%,也压过 GPT-5.6 的 60.6%,继续紧追 Fable 5 的 63.6%。

到了更接近真实职场交付的知识工作中,Grok 4.6 直接翻身反杀,在三项评测中全部拿下 *。

GDPval-AA v2 中拿到 1753 Elo,超过 Fable 5 的 1741,也超过 GPT-5.6 的 1728。

AA-Briefcase 上再拿 1577 Elo,压过 Fable 5 的 1574 和 GPT-5.6 的 1502。

专业法律任务 Harvey LAB 中拿到 15.8%,Fable 5 只有 11.3%,GPT-5.6 更是只有 2.5%。

更狠的是,DeepSeek V4 Pro 和 Grok 4.6 不仅在性能上直逼 OpenAI 和 Anthropic 的 * 模型,还一起把前沿智能的价格打了下来。

每百万输出 Token,Grok 4.6 要 6 美元,GPT-5.6 Sol 要 30 美元,Claude Opus 5 要 25 美元,Fable 5 要 50 美元。

而 DeepSeek 只要 0.87 美元——

约为 Grok 4.6 的 1/7、GPT-5.6 Sol 的 1/35、Claude Opus 5 的 1/29、Fable 5 的 1/57!

全网首测

DeepSeek 大战 Grok

现在,* 批实测已经出炉。DeepSeek V4 Pro 和 Grok 4.6,也终于从跑分榜走进真实任务场。

* 轮,我们直接给 DeepSeek 上强度。

只用一条提示词,它便在浏览器中从零搭出了一颗完整的 3D 交互式地球。

拖动、旋转、缩放等基础交互全部可用;全球数据流、动态航线和地理标记,也被完整铺在地球表面。

再往细节看,大气层散射、云层渲染、昼夜光影乃至整套 UI 界面,同样一应俱全。

接下来,直接把两款模型拉进同一个擂台。

AI 博主「向阳乔木」先用 DeepSeek V4 Pro 连跑三个小任务,随后又把其中两道题的相同提示词交给 Grok 4.6,直接对比最终成品。

* 个任务,是调用 3 个 Skill 开发并部署一个网站。

DeepSeek 顺利跑通了整套流程,从页面设计和完成度来看,整体表现非常稳定。

第二个任务,是一次复刻 60 种设计风格,并生成一整套 Bento 卡片集中展示。

这一轮,DeepSeek 在字体、配色和版式上做出了明显区分,整体视觉效果相当不错。

最后一个任务,则是从零生成一款 3D 打砖块游戏。

游戏不仅可以直接上手,还加入了立体场景、背景音乐和动态音效,操作反馈和可玩性全部在线。

随后,相同的提示词被交给了 Grok 4.6。

在 3D 打砖块这一局中,两款模型几乎打成平手。

Grok 生成的游戏同样质感在线,无论视觉效果、场景完整度还是可玩性,都与 DeepSeek V4 Pro 不相上下。

到了 60 种 Bento 设计这一局,Grok 4.6 则扳回一分。

它生成的部分页面,在排版、配色和视觉层次上更为成熟,最终效果也更加好看

更激烈的对决,发生在 Flappy Bird 上。

开发者 Jun Song 给出完全相同的提示词,让 DeepSeek V4 Pro 和 Grok 4.6 分别从零「手搓」一款游戏。

结果,两款模型走出了截然不同的路线。

DeepSeek V4 Pro 消耗超过 2 万 Token,成本仅为 0.019 美元;Grok 4.6 只使用约 5000 Token,成本却达到 0.03 美元。

但从最终成品来看,这一局 DeepSeek 明显更胜一筹。

游戏中不仅有山脉远景和层叠云朵,水管也带有渐变与体积感。角色穿过水管时,画面甚至会弹出「+1」的浮动动画。

从场景层次到操作反馈,细节几乎全部拉满,端到端构建的完成度明显高于 Grok 4.6。

在开发者 Hamza 进行的另一项前端测试中,DeepSeek V4 Pro 再次拿下 Grok 4.6。

无论页面完成度还是最终视觉效果,V4 Pro 交出的成品都更胜一筹。

不过,V4 Pro 也没有场场封神。

在一组鹈鹕对比测试中,相较于 Flash 版本,V4 Pro 的整体画面完成度更高,大象的造型也更加美观。

* 的问题是——鹈鹕的运动方向,被完全画反了。

继续增加难度,让 DeepSeek V4 Pro、GPT-5.6 Sol 和 Claude Opus 5 使用 Three.js 生成同一棵樱花树,差距就更加明显。

无论是树干与枝叶的细节,还是光影、景深和整体氛围,V4 Pro 都不如另外两款 * 模型。

DeepSeek V4 Pro;GPT-5.6 Sol;Claude Opus 5

几轮实测看下来,DeepSeek V4 Pro 和 Grok 4.6 确实已经打到了同一水平线,难分伯仲。

两大 AI 同一天

追上了 OpenAI 和 Anthropic

对于这两款模型的同时爆发,大佬 Rick De Oliveira 给出的评价是,「强大,而且实惠。」

这 DeepSeek V4 Pro 和 Grok 4.6 的加持下,这两个几乎不可能同时出现的词,在今天,* 次真正走到了一起。

从网络安全、知识型任务到 Agent 自主解决问题,它们已经在多个战场上,凭借着更低的成本直接击碎了前沿能力的天花板。

回看今天这场魔幻的 AI「对轰」,DeepSeek 与 Grok 共同改写了一条游戏规则:

* 智能,不再高不可攀。

过去,开发者往往只能在「用不起」和「不够强」之间艰难选择。

而今天,DeepSeek 用仅为 SOTA 几十分之一的价格掀翻桌子,Grok 则以极高的性价比紧随其后。

这场「高能低价」的正面冲击,已经撕开了旧秩序的裂口。

而战争还没有结束。

马斯克已经提前预告,Grok 4.7 马上就来,目标直指超越所有 *AI;OpenAI 与 Anthropic 的反击,也必将接踵而至。

身处这个以「小时」为单位进化的时代,智能不再是少数巨头的特权,属于所有人的应用大爆发,才刚刚开始。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

马斯克 突袭 职场 考试 火药
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论