AI 资讯量子位
谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让
假期第一天,谷歌携 Gemini 4 Argon 空降多榜单第一。 拳打Opus 5.5,脚踢GPT-6 Astra。 更夸张的还在后头,单项任务成本最低可至 1.99美元 ,直接是Astra费用砍半。 最高百万Token输出上限 ,面向编程、金融和法律等复杂工作流,而且划重点,网络安全防御能力超牛掰。 这波等等党要赢麻了。 不过吧,咱普通用户现在只可远观,暂时还吃不上。 Gemini 4 Argon目前只开放给部分经过筛选的网络安全团队使用,其它订阅用户得一步步来。 倒是谷歌内部对新一代旗舰模型的态度还挺有意思…
内容摘要
假期第一天,谷歌携 Gemini 4 Argon 空降多榜单第一。
拳打Opus 5.5,脚踢GPT-6 Astra。
更夸张的还在后头,单项任务成本最低可至 1.99美元 ,直接是Astra费用砍半。
最高百万Token输出上限 ,面向编程、金融和法律等复杂工作流,而且划重点,网络安全防御能力超牛掰。
这波等等党要赢麻了。
不过吧,咱普通用户现在只可远观,暂时还吃不上。
Gemini 4 Argon目前只开放给部分经过筛选的网络安全团队使用,其它订阅用户得一步步来。
倒是谷歌内部对新一代旗舰模型的态度还挺有意思的。
劈柴哥、哈萨比斯还有接班人Koray Kavukcuoglu,纷纷一键三连为其站台: 谷歌is back!
DeepMind研究员Zirui Wang发帖直言:
RSI来了! 我已做无可做,是时候追逐我的咖啡师梦想了:)
讲真?
轮到你了,谷歌
全体起立!咱盼星星盼月亮的 Gemini 4 ,它终于来了。
仔细数一数,距离谷歌上一代旗舰模型发布都快一年了,哪吒都没这么难产。
这一年OpenAI、Anthropic是追着谷歌砍啊,放假前一周还连发Opus 5.5、Sonnet 5.5、GPT-6.1 Sol逼宫。
你说谷歌能不急吗,新型号 Argon 火速上岸。
先看跑分情况, 清一色的性能领跑 。
Argon在衡量长期软件工程任务的DeepSWE v1.1上拿到77.9%,高于Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。
网络安全漏洞修复测试CWE-bench v1则拿到68%,和GPT-6 Astra 并列第一 。
Argon以68.90%登顶Vals Index榜首,较Gemini 3.8 Flash实现大幅提升。
尤其是 RSI指数 一跃第四,超越了GPT-6 Astra。
Gemini 4 Argon在另外的第三方评测中也不遑多让。
文本领域,Argon在代码编写、高难度提示词、指令遵循、长查询以及创意写作赛道优势显著,以1525分位居 Text Arena第一 。
在评测网页开发的 Code Arena中排名第八 ,较Gemini 3.8 Flash High提升了21个名次,但依旧稍逊于Claude和GPT最新模型。
Artificial Analysis测评中,Argon和GPT-6 Astra旗鼓相当,高于GPT-6.1 Sol一分,提升主要来自于 更少的幻觉 和 更强的智能体能力 。
但在价格上,Argon相比Astra优势明显。
优惠期间Argon单题成本约 低四成 ,每百万输入Token为2美元、输出Token为10美元,目前是最具性价比的模型之一。
在具体工作中,Argon也更倾向于处理复杂且长期的深度推理任务,比如软件工程、企业专业知识梳理以及网络安全防御等。
模型的 百万Token输出 上限,就是为这种长任务准备的,它能给模型更多连续工作的余地和充足的推理深度。
以谷歌内部使用情况为例,其中Argon在谷歌各数据中心自主识别并落地内存优化方案,待方案全面部署后,预计可释放超300 TiB内存。
另一个案例中,Argon Agent围绕视频解码器的Rust移植版本,反复实验并替换了3.2万行SIMD代码,最终版本运行速度达到原Rust移植版的2.7倍。
官方还重点强调了Argon的 防御性网络安全 优势。
它能够自主发现、验证并修补20多种语言的关键软件漏洞,在Wiz内部黑箱渗透测试中,模型可以在无源代码下实时分析网络系统,高效发现攻击面、识别漏洞以及生成概念验证证据。
为了防止滥用,Argon首批进入的是谷歌的Fairwind计划,面向经过审核的网络安全防御方。
对受信任的防御团队,谷歌会放开针对网络安全任务的部分限制,Argon将帮助防守方补洞,以及用来寻找攻击入口。
One More Thing
不过嘴上说说得了,Argon实际跑起来怎么样,还得打个问号。
毕竟咱普罗大众还没用上啊喂。。。
有小道消息透露,谷歌内部员工对Gemini 4 并不完全看好 。
一些接触过Gemini 4的员工认为,模型在实际编程任务中并没有跑分那么亮眼,网页和应用的前端界面设计仍是短板,甚至存在过度刷榜的嫌疑。
然而另一名熟悉开发工作的员工则表示,内部普遍认为Gemini 4已达到前沿水平。谷歌也回应称,说它编程表现不佳并不准确。
总之模型到底咋样,还有待观察。
所幸的是, 谷歌终于回到了牌桌之上 。
参考链接:
[1]
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
[2]
[3]
https://x.com/MrZiruiWang/status/2105388591644131582
[4]
https://x.com/arena/status/2105394855644139908
[5]
https://x.com/ArtificialAnlys/status/2105392625788637299
版权所有,未经授权不得以任何形式转载及使用,违者必究。
Gemini 谷歌
鹭羽
扫码分享至朋友圈
相关阅读
清华校友立功!谷歌发布首个全科医疗大模型,14项任务SOTA
“通用医学AI史上里程碑之作”
医学人工智能 谷歌
谷歌「AI联合数学家」来了!刷新最难数学AI基准SOTA,牛津教授用它解开群论悬案
谷歌AI for Math迈出最新一步
AI 谷歌
华为突破封锁,对标谷歌Dropout专利,开源自研算法Disout,多项任务表现更佳
Disout Dropout 华为 谷歌
“谷歌你变了”,老员工痛别谷歌:透明开放不复往昔,公司文化“面目全非”
谷歌版ChatGPT灾难级发布,市值一夜狂跌7000亿,熬夜网友:退钱!
还带跌了微软百度
ChatGPT 谷歌
谷歌扔下芯片核弹:开源全球首个可制造的PDK,免费帮有缘人实现造芯梦想
你有想过自己制造芯片吗?自己设计的那种。
芯片 谷歌
热门文章
又快又能打!匿名模型玉兔模型杀上双榜第一,Coding实测全记录
量子计算走上桌面!“小盒子”跑通端到端,数据全程不出门
啥题啊能干崩OpenAI最强模型训练…
量子AI创业来了一支“清华梦之队”:10亿估值,用量子改造大模型底层
HC归来,华为正重新定义AIDC基础设施
加入我们
寻求报道
商务合作
追踪人工智能新趋势,报道科技行业新突破
资讯来源
量子位