[谷歌] 谷歌連發叁款"Lite、Flash"模型,但Pro再次缺席

文丨曉靜
編輯丨徐青陽
美國當地時間7月21日,谷歌DeepMind團隊壹口氣放出叁款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber。
其中,主力模型Gemini 3.6 Flash在編碼和多模態任務上表現更強,但更關鍵的是,它處理相同工作所消耗的輸出token比前代減少了17%到65%。
Gemini 3.5 Flash-Lite主打極致的速度與性價比,每秒可生成350個輸出token。
而Gemini 3.5 Flash Cyber則是壹款針對網絡安全漏洞檢測與修復進行微調的專用模型,目前僅向政府和特定合作伙伴開放。

與此同時,外界期待已久的旗艦模型Gemini 3.5 Pro依然沒有露面,谷歌表示它正在與合作伙伴進行測試,並首次透露,更龐大的Gemini 4預訓練工作已經啟動。
01 告別“啰嗦′^腁I
在大語言模型的應用成本中,輸出token的數量直接關聯到費用與延遲。Gemini 3.6 Flash的設計目標之壹,就是降低這種不必要的消耗,同時保持或增強任務完成的質量。
第叁方基准測試機構Artificial Analysis Index的實測顯示,該模型輸出token使用量較前代降低了17%。在需要多步驟推理和工具調用的復雜工程任務中,節省效果更為明顯。

例如在Datacurve的DeepSWE基准測試中,token消耗減少了65%,這意味著Gemini 3.6 Flash在完成任務時執行了更少的冗余代碼編輯和循環操作。

這種效率提升還帶來了直接的價格下降。
Gemini 3.6 Flash定價為每百萬輸入token 1.50美元,每百萬輸出token 7.50美元。相較於3.5 Flash每百萬輸出token 9美元的價格,單次智能體任務的總成本有所降低。

性能方面,Gemini 3.6 Flash在多個基准測試中取得了可量化的提升。
DeepSWE測試中得分為49%,高於3.5 Flash的37%。MLE-Bench機器學習工程基准測試中,得分從49.7%提升至63.9%。

計算機使用能力在OSWorld-Verified測試中得分為83%,此前為78.4%,該功能現已成為Gemini API和Gemini Enterprise的內置客戶端工具。
知識工作方面,GDPval-AA v2基准上的得分從1349提升至1421。
多家客戶已經給出反饋。
Figma、Harvey、Hebbia和JetBrains均表示,Gemini 3.6 Flash在處理復雜工作流和知識型任務時,在token效率、准確性和速度之間取得了平衡。
谷歌展示了Gemini 3.6 Flash在幾個實際場景中的表現。
在金融領域,該模型使用AI Studio上的Managed Agents,能夠比Gemini 3.5 Flash更高效、更准確地解析和分析財務數據及記錄。

在代碼遷移任務中,Gemini 3.6 Flash在Antigravity平台上借助多智能體編排執行操作,比前代具有更低的延遲和更高的質量。

在創意工具方面,Gemini 3.6 Flash利用視覺理解能力,通過Antigravity和tldraw開源繪圖工具構建了壹個交互式主題工作室。

此外,該模型還使用Gemini App中的畫布功能,幫助開發者制作了壹個用於3D工作流的攝影紋理提取器。

02 在速度上卷出新高度
Gemini 3.6 Flash追求的是效率平衡,Gemini 3.5 Flash-Lite追求的則是速度極限。
谷歌將其定義為3.5系列中“最快、最具成本效益”的模型。根據Artificial Analysis的實測,它的生成速度達到每秒350個輸出token,這大約是上壹代3.1 Flash-Lite速度的兩倍。
定價也極具競爭力,每百萬輸入token 0.30美元,輸出token 2.50美元。這種低成本和高速度,瞄准的是高吞吐量的業務場景,例如智能體搜索、大規模文檔處理等。
雖然名字中帶有Lite,但Gemini 3.5 Flash-Lite在SWE-Bench Pro測試中,得分54.2%,超過了標准版Gemini 3 Flash的49.6%。在OSWorld-Verified測試中,它以74%的成績優於Gemini 3 Flash的65.1%。


開發者還能根據工作負載調整模型的“思考層級”:處理簡單的高容量任務時,可設為最低思考以換取低延遲和低成本;面對復雜子智能體任務時,再提高思考層級保證質量。
谷歌公布了Gemini 3.5 Flash-Lite在肆個場景中的演示案例。
第壹個是從海量電子商務數據集中提取產品特征並進行整合。

第贰個是作為主智能體與Gemini 3.5 Flash-Lite協同工作,即時生成25個獨特的、可隨時探索的網頁設計概念。

第叁個是利用多模態理解能力,大規模進行收據翻譯和摘要。

第肆個是通過即時生成並迭代多個選項來構建游戲。

早期客戶Ashler、Paloalto和Ramp均強調了該模型在速度、智能和成本效益方面的獨特組合,認為其適用於擴展智能體工作流和數據處理任務。
03 “白帽黑客”專用模型
谷歌發布的第叁款模型Gemini 3.5 Flash Cyber,是專門用來發現和修補網絡安全漏洞的。
這款模型基於Gemini 3.5 Flash進行微調,谷歌希望它能以更低的token成本,去完成那些通常交給大模型的代碼安全任務。在名為CyberGym的基准測試中,它的表現已經達到了前沿水平。

不過,鑒於網絡攻防的雙刃劍性質,谷歌對這款模型采取了審慎的交付策略。它不會面向所有開發者開放,而是直接集成到谷歌的代碼安全智能體CodeMender中,作為壹個有限訪問試點項目,僅獨家提供給政府和受信任的合作伙伴。
谷歌Gemini團隊產品管理高級總監圖爾西·多希表示,這是為了讓壹線的防御者能在關鍵漏洞被廣泛利用前,搶先壹步發現並修復它們,降低被濫用的風險。
谷歌透露,在內部測試中,這個模型在開源代碼庫V8 JavaScript Engine中找出了55個問題,其中10個漏洞是其他模型未能發現的。
從叁款新模型的布局能看出,谷歌當前的策略是在效率上建立優勢。
當下,越來越多的企業開始審視AI投入產出比,意識到大量消耗token並不總能換來好結果。谷歌CEO桑達爾·皮查伊在今年早些時候就提過,有的公司5月份就花完了全年的token預算,如果能混合使用Flash模型和其他前沿模型,能節省大量資金。
這種思路反映在產品上,就是不斷壓低成本、提高速度,同時增強模型處理具體任務的能力。
伴隨這些高性能指標,安全也是必須要做的功課。Gemini 3.6 Flash在化學、生物、放射性、核(CBRN)以及網絡攻擊濫用方面,都加強了前沿安全防護,提升了抵御越獄攻擊的能力,同時盡量減少對正常有益用途的拒絕。
對於普通用戶和開發者,這些模型自發布當天就可以在Google AI Studio、Android Studio和Gemini應用裡用到,同時可在Google Antigravity及Gemini Enterprise應用中使用。
Gemini 3.5 Flash-Lite還會逐步在谷歌搜索引擎中推開。Gemini 3.5 Flash Cyber,將通過CodeMender以邀請制落地。
04 3.5 Pro仍在測試,Gemini 4已在路上
盡管Flash模型陸續到位,但開發者社區更關心的問題始終是:Gemini 3.5 Pro何時發布?
谷歌上壹次更新Pro系列模型是在今年2月發布的Gemini 3.1 Pro。此後,競爭對手的旗艦產品持續迭代。
OpenAI先後發布了GPT-5.5並開始推出GPT-5.6,Anthropic推出了Claude Opus 4.8和Claude Sonnet 5,並擴大了前沿模型Fable 5的訪問權限。
今年5月,谷歌在發布Gemini 3.5 Flash時曾預告Pro版本已在內部使用,預期壹個月內推出。如今已至7月末,該模型仍處於未公開狀態。彭博社此前報道稱,谷歌因難以達到內部性能目標,在推出3.5 Pro方面面臨內部延遲。
對此,谷歌DeepMind技術負責人洛根·基爾帕特裡克在社交媒體上回應說,Gemini 3.5 Pro正在與合作伙伴進行測試,計劃在准備就緒後立即廣泛提供。但他沒有給出具體的時間節點。

谷歌方面並未詳細解釋延期原因,但在公布Flash系列的同時,首次正式提及了下壹代旗艦模型Gemini 4的進展。團隊表示,已經啟動了Gemini 4的預訓練工作,並稱其為“迄今為止最雄心勃勃的預訓練工作”。
這在壹定程度上表明,谷歌的模型研發管線仍在持續推進,而3.5 Pro的交付節奏可能受內部測試和性能目標的影響。
美國網絡科技媒體BI表示,截至Flash系列新模型發布當天,在Artificial Analysis的數學和推理等綜合基准測試中,谷歌還沒有壹款模型進入該排行榜前拾名。
新模型開放訪問後,開發者社區很快傳出了相當數量的負面聲音。這些反饋主要集中在3.6 Flash的實際表現上。
有開發者在構建3D金門大橋場景時,反復提示了叁次,模型仍持續忽略指令。最終輸出質量甚至還不如5個月前發布的Gemini 3.1 Pro。

另壹位開發者在Antigravity平台上測試後反饋,木頭紋理質量更差,大理石缺乏功能性,在AI游戲測試中同樣失利。

有用戶給模型布置中等規模任務,兩分鍾就完成了,但結果被評價為“壹個本地4B模型都能比它做得更好”。

還有人將矛頭指向了性價比。
有評論指出,3.6 Flash雖然便宜,但在每個編碼基准上都表現不佳。相比之下,Kimi K3和GLM 5.2等模型由資本規模遠小於谷歌的實驗室打造,卻交出了更好的成績。
月之暗面作為Kimi的創建者,估值約300億美元,與谷歌約4.5萬億美元的市值相差約150倍。開發者對此表達了困惑。
更具體的數據來自Artificial Analysis的評分。
有用戶注意到,3.6 Flash在該平台上的得分與3.5 Flash完全相同,但排在Meta Spark 1.1、GLM-5.2、GPT-5.6 Luna、Claude Sonnet 5、Grok4.5和GPT-5.6 Terra之後。

[加西網正招聘多名全職sales 待遇優]
| 分享: |
| 注: |
| 延伸閱讀 | 更多... |
推薦: