5月19日Google I/O发布Gemini 3.5 Flash,输出速度达同类模型4倍

不错!点赞

简介

2026年5月19日,Google在Google I/O上发布Gemini 3.5 Flash,定位为最强的智能体与编码模型,官方称其每秒输出token约为同类前沿模型的4倍,在Terminal-Bench 2.1上得分76.2%。

2026年5月19日,Google在Google I/O开发者大会上发布Gemini 3.5 Flash。官方给它的定位是自家最强的智能体与编码模型,并强调了一个不太常见的指标:每秒输出token约为同类前沿模型的4倍。在模型能力日益接近的阶段,速度本身正在变成一种能力。对需要连续调用工具的智能体来说,输出每慢一秒,整条任务链的等待时间就会被成倍放大,这也是本次发布最值得留意的地方。

一、事件速览

Gemini 3.5 Flash于2026年5月19日的Google I/O上亮相,官方将其描述为面向智能体与编码任务的最强模型,Gemini 3.5 Pro随后跟进,形成Flash与Pro的双线配置。与过去强调综合跑分不同,这次发布把每秒输出token数放到了显要位置,背后是Agentic AI带来的持续推理负载:当模型需要连续思考数十步、反复调用工具,等待时间会被成倍放大。这一判断与智源研究院的观点一致,其将推理优化远未触顶列为2026年十大AI技术趋势之一,推理成本与效率由此成为全年竞争焦点。

二、关键数据与技术细节

  • 发布时间为2026年5月19日,发布场合为Google I/O开发者大会,面向全球开发者同步释出。
  • 官方定位为Google最强的智能体与编码模型,面向长链条工具调用与多步推理场景。
  • 输出速度约为同类前沿模型的4倍,以每秒输出token数为口径,直接影响任务端到端耗时。
  • 在Terminal-Bench 2.1上得分76.2%,考察命令行环境下的多步任务完成能力。
  • Gemini 3.5 Pro在Flash之后跟进,构成同一代产品的双档配置,供不同预算的团队选择。
  • 后续延伸出Gemini 3.6 Flash,7月21日进入稳定版,定价为输入1.50美元、输出7.50美元、缓存0.15美元。

三、行业影响与解读

把速度作为主打卖点,反映出任务形态的深层变化。在单次问答场景下,快一点只是体验优化;但在智能体场景中,一个任务可能包含几十次推理与工具调用,输出速度直接决定整条链路能否在可接受的时间内跑完。4倍的差距,足以让原本不可行的应用变得可用。与此同时,Flash线的定价明显低于Pro线,这种高速加低价的配置,瞄准的正是需要高频调用的商品化场景。对开发者而言,选型逻辑也随之改变:不再是单纯挑能力最强的模型,而是在能力、速度与单价之间找平衡点,因为智能体的每一次循环都会被计费,效率优化的价值被显著放大。

四、值得关注的信号

  • 每秒输出token会成为与跑分并列的核心指标,被写进模型宣传的首页。
  • Flash与Pro的分工趋于稳定,高频智能体任务将持续向Flash线迁移。
  • 推理效率的优化空间仍被业内认为远未触顶,工程红利尚未释放完毕。
  • 持续推理负载将推动调度、缓存与并行策略成为应用层的关键技术。

小结:Gemini 3.5 Flash的意义,在于把速度从体验指标提升为竞争指标。当智能体需要连续不断地思考,模型每快一秒,整条任务链就省下几十秒。配合明显更低的定价,Google在2026年打出的这张效率牌,指向的不是跑分榜,而是每天被调用数百万次的真实流水线。当速度成为卖点,慢就不只是体验问题,而会直接变成成本问题。