刚刚,Gemini3.8 Flash 来了,结果惨遭对手嘲讽
📋总体概括
谷歌发布Gemini 3.8 Flash及专攻网络安全的Gemini 3.8 Flash Cyber,距3.7 Flash发布仅三周。短短6周内Gemini Flash产品线完成3次大版本迭代,平均约三周一次,更新节奏明显加快,但也引发竞争对手的嘲讽。
⚡关键信息
- ▸谷歌发布Gemini 3.8 Flash与Gemini 3.8 Flash Cyber(网络安全专用版)
- ▸距Gemini 3.7 Flash发布仅三周,6周内完成3次大版本迭代
- ▸高频更新节奏遭竞争对手嘲讽
🔥犀利点评
谷歌卷版本号卷疯了,周更模型到底是迭代还是凑数?
好好好,谷歌也开始按月更大模型了。就在刚刚,距离Gemini 3.7 Flash发布仅仅过去三周,Google Gemini 3.8 Flash和专攻网络安全的Gemini 3.8 Flash Cyber同时登场。算下来,短短6个星期,Gemini Flash产品线已经完成了3次大版本迭代,平均每三周就有一个......本文来自微信公众号: APPSO ,作者:发布明日产品的,原文标题:《刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽》
好好好,谷歌也开始按月更大模型了。
就在刚刚,距离Gemini 3.7 Flash发布仅仅过去三周,Google Gemini 3.8 Flash和专攻网络安全的Gemini 3.8 Flash Cyber同时登场。

算下来,短短6个星期,Gemini Flash产品线已经完成了3次大版本迭代,平均每三周就有一个新模型出现。
放在过去的大模型行业里,这种更新速度几乎难以想象。

更值得关注的是,谷歌内部一套新的模型开发方式也逐渐显露出来:越来越多Agent、强化学习和工具调用方面的新能力,开始优先出现在体量更小、修改成本更低的Flash上。
而且最近突然加速的还不止谷歌。
就在Gemini 3.8发布前后,Meta刚刚也更新了Muse Spark 1.3,把Agent长任务、编码能力和推理效率列为这一代模型的主要升级方向。

更有意思的是,Meta AI负责人Alexandr Wang发布新模型之后,也再次阴阳怪气地调侃道:「我真不想这么说,但是……Gemini是谁?」

Pro难产,Flash被推上了主桌
先看主角Gemini 3.8 Flash。
谷歌给它的定位相当高,称其为目前谷歌最智能的推理与编程模型之一,重点瞄准端到端自主Agent工作流,以及需要持续运行较长时间的软件工程任务。
从官方公布的Benchmark来看,谷歌显然希望推动Flash摆脱「便宜、快速模型」的固有定位,进一步承担复杂任务的执行。

在DeepSWE v1.1长周期软件工程测试中,Gemini 3.8 Flash可以自主处理复杂的端到端工程问题,成绩超过了不少体量更大的前沿模型。

面对金融和法律等专业场景,它同样提升明显。

在Vals Finance Agent V2、Harvey's Legal Agent Benchmark等测试中,3.8 Flash都显著领先上一代3.7 Flash;涵盖STEM、人文与专业知识的HLE-Verified测试里,它拿到了54.9%的成绩。

至于这款模型是怎么做到的,就不得不提谷歌这次重点强化的Agentic loops,也就是模型在完成复杂任务时持续推理、调用工具、检查结果并修正方案的能力。
过去很多Coding模型更像一次性给答案,生成一段代码以后,后续能不能运行、哪里需要修改,往往还得依赖用户继续介入。
现在的3.8 Flash,则越来越像一个愿意把活干完的「打工圣体」。
面对复杂任务,它可以主动增加推理步骤,连续调用不同工具,根据执行结果重新评估方案,并在发现问题以后继续修改。
因此,当用户把effort level调高以后,模型会投入更多推理和Token预算,以换取更高的复杂任务完成率;面对普通任务,也可以降低effort level,把响应速度和使用成本控制下来。
官方Demo更能说明这种变化。
在Google Antigravity中,只需要给出一个相对简单的循环任务指令,Gemini 3.8 Flash就可以持续调用工具,完成一个可玩的3D巫师闯关游戏,其中包括谜题、环境叙事以及由Nano Banana生成的纹理资源。

它甚至还能做出一个完全可玩的DOS版Google Maps,其中包括街景和导航功能。
不过根据网友的真实测试,3.8 Flash的优缺点也变得更加鲜明。
目前比较一致的感受,是它真的非常快,而且便宜得惊人,但「做得快」和「最终成品最好」之间,暂时还不能完全画上等号。
AI/ML API用完全相同的提示词,让Gemini 3.8 Flash和Claude Opus 5分别制作四个独立的Three.js物理场景,包括针刺气球、水球坠落、蘑菇云以及动态原子模型。

Gemini 3.8 Flash总成本只有0.12美元,Claude Opus 5则花了1.86美元,价格相差超过15倍;与此同时,Flash完成每个场景都不到70秒,Opus 5最慢则接近5分钟。
另一位,开发者Tim Jayas的结果更加夸张。他把同一个提示词分别交给Gemini 3.8 Flash和Opus 5,Opus 5花了整整24分钟,3.8 Flash只用了37秒。

不过另一批测试,也暴露了Flash很典型的另一面。
开发者Aditya用Gemini 3.8 Flash和Kimi K3制作同一个Sticky Ball游戏时就发现,Flash生成速度极快,消耗的Token也明显更少,但最终游戏体验明显落后于K3,在运动机制、移动表现和整体游戏设计上都有差距。

类似情况也出现在一个高复杂度的纽约城市场景测试里。
博主AI Pulse Daily使用完全相同的提示词测试Gemini 3.8 Flash、3.7 Flash和Opus 5,要求模型生成一个细节密集的Three.js纽约城市场景。
结果3.8 Flash整座城市只放了6棵树,甚至比三周前3.7 Flash的10棵还少,而Opus 5塞进了1840棵。

提示词明确要求的人行横道条纹、水下焦散和色差效果,3.8 Flash也全部略过;与此同时,它却主动加入了5个摄像机预设、3个后处理开关、标题卡和实时时钟,其中不少功能根本没有出现在用户要求里。
另外,在价格方面,Gemini 3.8 Flash的输入价格仍然为每百万Token 0.75美元,输出为每百万Token 3.75美元,与三周前降价后的Gemini 3.7 Flash保持一致,目前的优惠价格将持续到2026年底。
对于谷歌来说,Flash的角色已经越来越明确:它既负责成本和速度,也一定程度上承担过去更多由旗舰模型负责的复杂任务。
Gemini的新能力,为什么总在Flash首发?
与Gemini 3.8 Flash一起发布的,还有专门针对网络安全任务训练的Gemini 3.8 Flash Cyber。
后者通过新的Fairwind计划向经过审核的防御者开放,能力重点集中在漏洞发现、渗透测试以及自动生成安全补丁等场景。
Gemini 3.8 Flash Cyber在标准CyberGym漏洞发现Benchmark中明显超过上一代Gemini 3.5 Flash Cyber,同时也超过了多款体量更大的前沿模型。

在谷歌内部覆盖20种编程语言的真实代码测试中,它发现漏洞的成功率超过70%。
自动修复漏洞方面,Gemini 3.8 Flash Cyber在CWE-Bench上取得了47.2%的Pass@1,与表现最好的前沿模型47.8%已经非常接近,而模型运行成本明显更低。

Chrome安全团队给出的内部结果显示,Gemini 3.8 Flash Cyber生成的正确漏洞补丁数量,可以达到部分大型商业模型的2.6倍。
安全公司Wiz的测试同样显示,使用该模型进行渗透测试以后,漏洞召回率提高了约7.5%至9.7%,与此同时,成本下降约2.3至5.2倍。
谷歌云漏洞研究团队还披露过一个更加极端的案例,他们利用Gemini 3.8 Flash Cyber,在不到两个小时的时间里发现了一处严重基础漏洞,而按照传统研究流程,类似问题通常可能需要数月时间才能被定位。
值得一提的是,在Gemini 3.8 Flash系列模型发布前,《华尔街日报》就曾披露Gemini 3.8 Flash在谷歌内部的代号为Skimaki。
员工曾经在内部代码工具Jetski中,让它与Anthropic的Claude Opus进行对比测试,结果不少谷歌工程师反而更加偏好自家的新模型。
代码能力重新成为谷歌重点竞争的战场,而Flash目前显然承担了相当重要的角色。
对比之下,谷歌过去一年在旗舰模型上的进展经历了不少波折。
Gemini 3.0在去年11月发布以后曾经短暂取得领先,随后OpenAI和Anthropic的新模型继续向前推进,谷歌的优势没有维持太久。
Noam Shazeer、Jeff Dean等重要技术人物也在今年夏天陆续离开。
原本计划继续推进的Gemini Pro新版本同样遭遇调整。
皮查伊曾在今年5月透露新版Pro可能在随后一个月到来,但谷歌内部准备的Gemini 3.5 Pro方案最终被取消,其中一个重要原因,就是相对于Flash系列的能力提升不够明显。
更远一些的Gemini 4虽然已经完成部分预训练工作,目前仍然处在后训练阶段,距离正式发布还有一段距离。
谷歌随后也调整了DeepMind的管理层,Koray Kavukcuoglu接手更多管理职责,新管理层给团队提出的一项明确要求,就是进一步加快模型研发与发布速度。
大哥难产,只能靠小老弟Flash出来扛大旗了。
不过Flash最近近乎疯狂的更新频率,背后其实对应着大模型研发方式正在发生的一次变化。
单纯依靠扩大模型规模获得能力增长,边际收益已经没有前几年那么明显;强化学习、Agent training、工具调用和其他后训练技术的重要性,则持续上升。
《华尔街日报》提到一个很关键的细节:Flash规模相对较小,因此修改和重新训练模型所需要消耗的算力更低,谷歌内部可以让多个团队同时尝试不同方案。
换成规模庞大的Pro系列以后,每一次模型调整都会涉及更多GPU、训练时间以及跨团队资源协调,同样一种后训练实验,试错成本自然高得多。
与此同时,谷歌今年明显增加了对强化学习和后训练的投入,还从OpenAI招募了后训练负责人Barret Zoph担任研究副总裁。
资源投入方式变化以后,一个结果逐渐显现出来:新的Agent训练方法、RL策略以及工具调用机制,更容易先在Flash上进行实验,并在验证有效以后迅速进入正式版本。
从产品开发方式来看,现在的Flash多少有点Gemini「高速开发分支」的意思。
模型更小,修改成本更低,所以谷歌可以让多个团队同时尝试不同的Agent training、RL和工具调用方案,三周左右就完成一次新版本迭代。
Pro系列承担的任务则越来越接近真正意义上的旗舰版本,只有能力提升达到足够大的幅度以后,投入巨量算力和内部资源更新一次才更划算。
说到底,谷歌未必一开始就计划让Flash扛起这面大旗。但阴差阳错的是,这种局面恰好撞上了大模型研发重心的变化。
伴随着强化学习、Agent training和工具调用越来越重要,模型体量更小、实验成本更低的Flash,反而在短时间内比Pro更适合快速后训练。
因此在旗舰模型难产的情况下,谷歌反倒提前摸到了Flash模型下半场更重要的能力:也就是更快训练、更快验证,以及更快把新的后训练成果交到用户手里。
当然,这一切的前提是,Gemini 4最终能争点气,不再让人失望。