8月中旬,大模型市场密集上新。8月12日,xAI发布Grok 4.6;8月14日前后,Google发布Gemini 3.7 Flash。两个模型前后脚落地,定位高度重合,都自称「干活型模型」——一个主攻编程与智能体,一个主攻长程任务与视觉交互。我们决定让它们同题PK:同一批创意型任务各跑一遍,看谁更能「把一件事干完干好」。
结果有些出乎意料。官网数据都很好看,一上考场,两个都翻了车。
先看纸面参数

Gemini 3.7 Flash 是Google DeepMind在8月中旬发布的,距离3.6 Flash仅三周。定位明确:面向编码和智能体任务的最高性能工作模型。
上下文窗口100万token,最大输出65536 token,支持文本、图像、视频、音频和PDF输入,知识截止到2026年3月。
定价是重点:输入每百万token 0.75美元,输出每百万token 3.75美元(2026年12月31日前的介绍价;2027年1月1日起涨至1.5美元 / 7.5美元)。
基准数据相当能打。DeepMind官方对比显示:FrontierCode 1.1 Main从3.6 Flash的34.4%拉到43.6%,DeepSWE v1.1从48.6%冲到65.3%,Terminal-bench 2.1拿到85.8%,CodeArena(Web开发)Elo从1538涨到1588,AutomationBench也从17.0%翻到30.4%。

Grok 4.6 于8月12日发布,是Grok 4.5的后续版本。官方口径是「专注长程运行的智能体,以及更宏大的交互和视觉工作」。上下文窗口500K token(比Gemini 3.7 Flash小一半,也是目前前沿模型里偏小的),定价输入每百万token 2美元、输出6美元,缓存输入0.5美元;超过200K token的请求整体费率翻倍至4美元 / 12美元。
xAI官方成绩单同样亮眼:Artificial Analysis综合智能指数61分,追平GPT-5.6 Sol,只比Claude Fable 5的62分低1分;GDPVal-AA v2拿到1753分(比Grok 4.5的1526大幅跃升);CursorBench v3.2从66.7%涨到69.9%,DeepSWE v1.1从54%涨到65.9%,FrontierCode v1.1 Extended拿到61.3%。
两个模型,两套漂亮数据,放在一起看,谁都像「新一代干活王」。但纸面数据是纸面数据,真实干活是另一回事。
考题:三题创意实测
我们为这场对决设计了三道题,全部复用本工作区跑过同一套benchmark的案例,方便横向对比历史成绩:
- 指环王:Karpathy在8月初提出的新基准。给模型《指环王》第一章前段原文,让它用Three.js程序化渲染出一个3D世界。测的是「读懂一段文学 → 理解一个世界 → 把世界程序化搭出来」的完整链路。
同一份完整Prompt(原著原文约1817词)我们之前跑过DeepSeek V4-Pro 0813和GLM 5.3,成绩都在及格线以上。这场正好给两个新模型补上成绩线。 - 60种设计风格Bento卡片墙:让模型用一个HTML文件生成60种不同设计风格的小卡片,测对设计语法的识别与复刻能力。
同一份Prompt,DeepSeek V4-Pro 0813交出的答卷是「眼前一亮,严格执行不规则拼贴,风格差异明显」。 - 3D滚球闯关游戏:本工作区原创新题。让模型做一个真能玩的3D游戏,要求至少6块浮空平台、12枚金币、3条命、检查点重生、完整的开始到结算循环。测物理手感、关卡设计和游戏循环的完整度。
测试环境:Gemini 3.7 Flash用Gemini CLI跑,Grok 4.6用Grok Build跑。同一份Prompt原样复制,不改一个字。首轮结果如实记录,只允许一轮「帮我修复」。
第一题:指环王——一个没画人,一个画了小土坡
Prompt是原著第一章前段完整原文(从比尔博宣布111岁生日宴会,到霍比屯的议论,再到弗罗多身世往事),一字不改,要求读懂后用Three.js搭出一个讲述开场场景的3D世界。
两个模型的场景都「跑通了」,但跑通只是及格线。
- Gemini 3.7 Flash:世界要素不齐全。场景里几个房子,勉强能看出点霍比屯的影子,运镜叙事「勉强算叙事」,能看出它在试着按原文节奏讲一个开场。但角色一个都没有——没有比尔博,没有弗罗多,没有酒馆前议论的霍比特人。
- Grok 4.6:更惨。场景里只有一个小土坡,世界还原度接近零。运镜是「纯转圈」,镜头绕着土坡转了几圈,没有在讲任何故事。
两个模型远远不如之前测试过这个案例的任何一个模型。同样是完整原文,GLM 5.3交出了要素齐全、零漂浮零穿模、有运镜叙事的霍比屯;DeepSeek V4-Pro 0813同样在及格线以上。而这两个官网数据漂亮的「干活型旗舰」,一个交了个空壳,一个交了个土坡。
第二题:60种风格——一个交了作业,一个全程换色
要求60种设计风格各占一张卡片,用该风格最典型的视觉语言呈现,不能只是换换颜色就交差。
数量上两个模型都凑满了60种,页面也都一次可运行。但质量差异天差地别。
Gemini 3.7 Flash:花了不到两分钟完成。虽然排列有点乱,但风格是真的做了区分——极简主义是极简主义的样子,赛博朋克是赛博朋克的样子,不是换个背景色糊弄。它还自己加了分类,把60种风格按类别组织了一下(Prompt里没要求),属于加分行为。

Grok 4.6:全部都是换颜色的。60张卡片视觉语言几乎一样,区别只在于颜色不同。没有设计可言。

这一题,Gemini 3.7 Flash算交了作业,Grok 4.6连作业都没交全。时间、质量Grok一个都不占。
第三题:云端滚球——可玩性是负数
要求WASD控制球在浮空平台上前进,收集12枚金币到达终点传送门;平台边缘有缺口,掉下去从检查点重生并扣一条命(共3条命);要有开始界面、结算界面、重玩按钮。
两个模型的游戏都「跑通了且可玩」,开始/结算界面、重玩按钮也都有。但玩起来是另一回事。
两个模型做出来的游戏都无法通关:
Grok 4.6:根本没有跳跃功能,遇到平台缺口只能等死。

Gemini 3.7 Flash:做了跳跃功能,但跳跃绑定的事件是重新开始——按跳跃键等于自杀。

物理手感两个都没做出来:没有惯性,没有摩擦,坠落是必然的。可玩性都是负数,也不必过多评价了。
一个把跳跃键绑成了重开键,一个压根没做跳跃。这已经不是质量高低的问题,而是「有没有真的试玩过自己做的游戏」的问题。
结论:数据可以很好看,活要干了才知道
有一个细节值得单独说:Gemini 3.7 Flash三题都「交了作业」。虽然质量参差,但能看出它在认真理解需求,Bento卡片甚至做出了Prompt之外的自发优化。
Grok 4.6则全程在及格线以下,最差的指环王一题交出的是一块小土坡,跟它官网那个「追平GPT-5.6 Sol」的智能指数放在一起,反差巨大。
这不代表benchmark没用。FrontierCode、DeepSWE、CursorBench这些分数测的是真实能力维度,但测的是「被标准化考题约束的能力」;而创意型任务测的是「没有标准答案时,模型能不能自己把事想全」。这次三题恰好是后者,两个模型都没接住。
往大了说,这暴露了一个现实:用价格战和benchmark营销的「干活型旗舰」,和真正能独立交付的Agent之间,还有一段不小的距离。Grok 4.6的官方定位是「长程运行的智能体」,但它在长程任务里连自己做的游戏都不试玩一遍;Gemini 3.7 Flash定价砍半,号称面向智能体的最强工作模型,但它在最基础的「把角色画出来」上都掉了链子。
价格可以砍半,分数可以追平,活要干了才知道行不行。至少在这一批创意考题上,两个「干活型旗舰」都还欠点火候;而此前我们用同一套题测过的DeepSeek V4-Pro 0813和GLM 5.3,反而把作业交得整整齐齐。
文章评论