ITBear旗下自媒体矩阵:

谷歌邪修Gemini 3.8 Flash!险胜DeepSeek

   时间:2026-09-03 14:44:36 来源:量子位编辑:快讯 IP:北京 发表评论无障碍通道
 

Jay 发自 凹非寺

刚刚,Gemini 3.8 Flash,正式发布。

Coding能力大幅提升,LMArena上,Gemini 3.8 Flash空降Agent榜单第14名,以微弱优势险胜DeepSeek-V4-Pro。

对一款走量定位的Flash模型来说,无疑是超常发挥了,值得表扬。

毕竟价格一分没涨。

是的,3.8 Flash在定价上,仍然与3.7 Flash保持一致。

Benchmark啥的就不细说了,大家看看就行。

相比而言,背后的方法论可能更有意思一点——

从谷歌披露的这些数据看来,Gemini好像「邪修」上了啊。。。

OpenAI和Anthropic都在努力让模型表现更强,同时用更少的步骤完成任务。

谷歌这边,完成任务需要走的步骤却越来越多,主打靠Loop大力出奇迹。

估计也是为了弥补模型智能本身的不足吧。

这可能也是Gemini如此注重「速度」的原因。

目前看来,3.8 Flash是市面上输出最快的模型,断崖碾压的那种,比第二名meta高了几乎一倍。。。

但就是不知道实际用起来到底咋样。

如果智能水平跟不上,输出的全是劣质Token啊。

这方面,有网友发现了端倪。

说这玩意儿完全就是刷分刷出来的,像Terminal-bench 4.0这种8月底刚出的bench,新版Gemini表现纯纯一坨。

但不管怎么样,谷歌这次,终于是睡醒了吧。

过去一个半月,谷歌经历了一窝人事变动,甚至连二进制能力拥有者Jeff Dean都离职了——

谷歌,却连出了三款Flash。

关于这点,DeepMind成员姚顺宇的新帖子,或许能给出一点解释。

对模型来说,那只是一小步;但对RSI来说,则是一次巨大的飞跃呢

六周三款Flash,搞不好只是开胃菜。

Gemini 3.8 Flash:笨,但很努力

3.8 Flash无疑是一款性价比模型,相比3.7 Flash性能大涨,多数场景已经逼近更高成本的旗舰模型。

DeepSWE v1.1上,它能端到端自主解复杂工程问题,得分超过大多数体型大得多的前沿模型,成本只要零头。

金融和法律这类企业级agent场景,它也压过3.7 Flash和其他前沿模型。

HLE-Verified,人类最后的考试上拿到 54.9%,跨STEM、人文、专业领域的多步推理,和旗舰的差距肉眼可见地缩小了。

但智能方面,似乎并没有本质的提升。

3.8 Flash能考出这个分数,单纯是靠卷出来的。。。

是的,面对复杂任务,它会多走几步推理,反复迭代调用工具,所以在高effort档位下,它可能比前辈们烧更多Token。

这么一看,好像也没性价比到哪去啊。

谷歌如果想重回第一梯队,光靠这种Trick估计是不太行的。

还是坐等一手Pro吧。

只守不攻的Cyber模型

对了,还有一款模型——

3.8 Flash Cyber。

谷歌史上最强的网络安全模型。专攻自主发现漏洞、自动生成补丁。

基准上,CyberGym 漏洞发现测试里,3.8 Flash Cyber 超过 3.5 Flash Cyber,也超过大得多的前沿模型。在覆盖 20 种编程语言的内部代码库测试里,挖洞成功率超过 70%。

修洞方面,CWE-Bench上它pass@1达到47.2%,目前领跑的前沿模型是47.8%,几乎打平,成本却低出一大截。

更硬核的是实战报告,它已经在谷歌内部上岗了。

Chrome安全团队拿它修洞,产出的正确补丁数量,是最强商业模型的 2.6倍。

Wiz用它跑内部渗透测试,召回率提升7.5到9.7个百分点,同样成绩的花费,只有其他前沿模型的2.3到5.2分之一。

最夸张的是Google Cloud漏洞研究团队,用它不到两小时,就挖出了一个以往需要研究数月的关键基础漏洞。

不过吧,这又是一个不公开发布的模型。。。

是的,谷歌表示能力太强,只通过Fairwind计划向受信防御者开放。

One More Thing

就在谷歌发模型的当口,meta也端出了新货,Muse Spark 1.3。

又是一款对标Opus 5的模型,Agent和Coding能力同样大幅提升。

还顺手嘲讽了Gemini一波——

我真不想这么说,但是……

Gemni,谁啊?

不是,bro,你跟Gemini比个啥啊???

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version