找回密碼註冊

Opus 5 新對手 !Google 發布 Gemini 3.8 Flash,Coding 性能看齊 Claude 旗艦模型

跳轉到指定樓層
1#
1509 0 as89725671 發表於 昨天 13:12 | 只看該作者 |只看大圖 回帖獎勵 |倒序瀏覽 |閱讀模式
六週內三度進化!Google DeepMind 近日再於自家部落格上,發布推出 Gemini 3.8 Flash 與資安版本 Gemini 3.8 Flash Cyber。這不僅是繼三週前推出 3.7 Flash 後的新力作模型,更是讓模型在短短六週內迎來第三度更新,展現 Google 在 AI 模型研發上的緊湊節奏。


程式碼與 AI 代理能力大躍進,跑分直逼 Claude Opus 5
Google 強調,Gemini 3.8 Flash 在程式碼撰寫與 AI 代理(Agent)任務上的表現,較前代實現了跨越式的突破。官方評測數據顯示,在長週期軟體工程基準 DeepSWE v1.1 中,3.8 Flash 斬獲 71.0% 的高分,不僅超越 3.7 Flash 的 65.3%,更進一步縮小了與勁敵 Claude Opus 5(74.0%)的差距。

此外,在垂直領域的表現更是亮眼:於 Vals Finance Agent v2(金融)與 Harvey’s Legal Agent Benchmark(法律)測試中,3.8 Flash 分別取得 61.4% 與 10.0% 的成績,雙雙擊敗 Claude Opus 5 的 58.6% 與 6.7%;而在多學科推理 HLE-Verified 評測中,亦繳出 54.9% 的優異水準。


首創資安特化版 Cyber:精準揪蟲、自動修復
針對網路安全場景,Google 此次同步推出了同源衍生版本 Gemini 3.8 Flash Cyber。該模型聚焦於漏洞發掘與自動產出修補程式(Patch),目前正透過全新的「Fairwind Program」向受信任的資安防禦方開放申請。

在成本效益與精準度上,Cyber 版本展現了極大的優勢。於 Collinear 維護的 CWE-Bench 基準中,其 pass@1 達到 47.2%,位居柏拉圖前緣(Pareto Front),效能直逼頂尖前沿模型的 47.8%,但運算成本卻顯著降低。根據 Chrome 資安團隊的回饋,該模型產出的正確修補程式數量是對照組商用模型的 2.6 倍;資安大廠 Wiz 的內部滲透測試也指出,其召回率(Recall Rate)提升了 7.5 至 9.7 個百分點,而成本僅為同級前沿模型的 1/2.3 到 1/5.2。


維持推廣優惠價,全面部署 Google 生態系
在定價策略上,Gemini 3.8 Flash 繼續沿用前代的推廣優惠價:每百萬輸入 Token 為 0.75 美元,輸出則為 3.75 美元。Google 官方提醒,此優惠將於 2026 年 12 月 31 日截止;自 2027 年 1 月 1 日起,費率將調回正常的 1.50 美元(輸入)與 7.50 美元(輸出)。

目前,Gemini 3.8 Flash 已全面上線,開發者可透過 Gemini API、Google AI Studio、Android Studio 及 Antigravity 平台進行存取;企業端客戶可於 Gemini Enterprise 中呼叫;一般消費者則能在 Gemini App、AI Mode 及 Google 試算表(Google Sheets)中體驗最新功能。


消息來源 : 1
更多圖片 小圖 大圖
組圖打開中,請稍候......
您需要登錄後才可以回帖 登錄 | 註冊

本版積分規則

小黑屋|手機版|無圖浏覽|網站地圖|XFastest  

GMT+8, 2026-9-4 03:12 , Processed in 0.103318 second(s), 53 queries .

專業網站主機規劃 威利 100HUB.COM

© 2001-2018

快速回復 返回頂部 返回列表