首页 > 资讯 > 刚刚,Gemini 4 Pro偷跑上线,碾压Astra和Fable

刚刚,Gemini 4 Pro偷跑上线,碾压Astra和Fable

36氪文章 2026-09-18 11:07 1 阅读 查看原文

真是深藏不漏!

这一次,谷歌终于把底牌扔出来了。

就在这两天,大模型竞技场Arena悄然杀入一款新模型,名字竟挂着「gemini-3.8-flash」。

上手实测的AI大佬和开发者交手几轮后,几乎倒吸一口气——

这极有可能是谷歌DeepMind,悟了整整半年的下一代旗舰Gemini 4 Pro!

一张疯传全网的基准图,简直堪称「恐怖」。

Gemini 4 Pro完全杀疯,编码、智能体、推理等领域实力,全面碾压GPT-6 Astra、Claude Fable 5.1。

开发者Vidhi体验过后,被Gemini 4 Pro完全震惊到了。

一张猫咪的SVG图,就证明了一切。GPT-6 Astra直接扔出了一只「大猫咪」(似猫非猫,更像laofu)。

正如传言所说,谷歌内部实现了RSI,Gemini 4 Pro才能和Astra/Fable正面对打。

沉寂许久的巨兽,真的强势回归了!

Gemini 4 Pro匿名偷跑,击败Astra和Fable

AI圈许久未有这么兴奋了。

要知道,谷歌上一个大版本更新Gemini 3.1 Pro,已经是7个月前(2月19日)的事儿了。

谷歌I/O大会上,劈柴曾预告:Gemini 3.5 Pro将在6月上线。

未曾想,这一重大发布鸽了又鸽,最终「胎死腹中」!

就在这个月初,WSJ独家爆料,Gemini 3.5 Pro取消了,原因很简单——

3.5 Pro的进化程度,连Flash都比不上。

好在,Gemini 4在预训练中评估优秀,后训练还在顺利进行中。

如今,Gemini 4 Pro竟穿上了gemini-3.8-flash的「马甲」,在Arena上首个检查点现身了。

毕竟Gemini 3.8 Flash这款模型,早在9月初发布,同名再出现极不寻常。

一大波上手体验后的开发者们,对4 Pro印象深刻,甚至体感超越了Astra和Fable。

从泄露的基准测试图中,可以发现,4 Pro实现了全面压制,成绩单非常亮眼——

DeepSWE v1.1:AI智能体编码任务上,4 Pro拿下了最高88.%分,比Astra还要多近2%;

GDPval-AA v2:在真实知识工作任务中,4 Pro唯一获得了2064 Elo;

Terminal-bench 2.1:4 Pro终端编码能力也是最强的95.3%;

OSWorld-2.0:计算机使用能力方面,4 Pro斩获86.8%,击败了Astra和Fable。

若这张表分数属实,Gemini 4 Pro真是「地表最强」的AI了。

在价格方面,相较于Astra和Fable,也是「御三家」中最具性价比的那个。每百万Token输入价格2.25美元,每百万Token输出价格11.25美元。

AI研究员Qwinah进入Gemini 4 Pro后端后发现,它有1000万输入上限,25.6万输出上限,永久跨会话记忆,不用API即可连网。

全网首测4 Pro,登上热搜

真正比跑分更有看点的,是全网一大的波惊艳实测。

UI网页设计,品味大提升

这不,开发者Bee测完之后,直呼「Gemini 4 Pro太不真实了......」

短短14分钟,4 Pro打造了一个以素描、铅笔与石墨质感为主题的「创意展示网页」。

它竟可以将网页的「滚动即笔触」概念化,向下滑动线条逐渐加深,交互感非常丝滑。

下面这个是一个兼具赛博朋克和复古未来主义的工作网站。

4 Pro在设计过程中,首屏结合了3D网格、数据仪表盘,还有可交互的3D模型。

3D+SVG,夯爆了

全网疯传的一个经典「鹈鹕骑自行车」的测试,Gemini 4 Pro输出的效果非常震撼。

配色、日夜切换、车灯、解剖标注、踏频控制,整个完成度完全不输顶尖大模型。

Pankaj Kumar在体验后,直接总结了几个变化:

速度很快,SVG和3D生成明显进步;一次提示就能把复杂要求吃得比较准。

甚至,它已经能直接生成带完整交互逻辑、视觉效果不错的小游戏。

再来看一个像素风3D宝塔测试,有种身临其境的味道了。

下面这个是4 Pro用时10分钟,制作出的空客H145直升机3D模型。

另外,在一个3D飞行模拟的测试中,4 Pro的画面效果大幅超越了Gemini 3.8 Flash。

从这一点,就可以证明,Gemini 3.8 Flash和竞技场上的gemini-3.8-flash不是同一款。

一键直出可玩的游戏

在游戏生成方面,Gemini 4 Pro也没有落下。

「我的世界」从页面搭建,大游戏中每个模块的设计,完全不输此前放出的Astra的测试。

还有下面这个3D卡丁车竞速游戏,看起来比跑跑卡丁车这些曾风靡一时赛车游戏更现代;而这,是Gemini 4 Pro花了很短时间做出来的。

谷歌真正押注的,叫 RSI

一旦RSI这个循环真能持续转起来,模型升级的节奏可能彻底变掉。

上个月,Google DeepMind首席战略官Jasjeet Sekhon在伯克利的活动上,直接把话挑明了——

RSI(递归自我改进),已成为AI巨额投资逻辑里的关键一环。

整个行业押注的,是能力曲线继续向上。

而如果真正撞上递归自我改进,这条曲线甚至可能从「指数增长」进一步加速。

就在最近,全网流传着更激进的说法:

Gemini 4之所以提前完成预训练,正是因为谷歌DeepMind在训练中实现「RSI闭环了」。

有意思的是,就在14日,谷歌一项名为Dream-RSI的研究也公开了。

它研究的正是,如何让Agent在探索过程中不断改进自己的搜索策略,从经验中继续升级下一轮探索。

可以确认的是,谷歌DeepMind已经公开把RSI摆到了非常重要的位置。

而且,AI参与改进AI的迹象越来越多。

「御三家」要回来了?

所以,Gemini 4 Pro面对的是一个已经彻底变样的牌桌。

OpenAI有Astra;Anthropic有Fable 5.1。

两大巨头已经把竞争从单纯聊天,卷到长任务、Agent、代码、推理乃至自主科研。

谷歌如果只是做出一个「比Gemini 3.8更强」的模型,已经不够了。

Gemini 4 Pro必须重新证明一件事:Gemini还在最前沿!

谷歌要想撑住目前4.23万亿美元的市值,保持AI实力在第一梯队至关重要。

参考资料:

https://x.com/HarshithLucky3/status/2100524699780600136

本文来自微信公众号“新智元”(ID:AI_era),作者:桃子 马可,36氪经授权发布。