谷歌Gemini 4 Argon屠榜,但干活差点意思

作者:字母AI 发布时间:2026-10-02 05:34:46 浏览:1
关键字:
谷歌发布新一代旗舰模型Gemini 4 Argon,在多项知识工作基准测试中超越OpenAI和Anthropic,但在终端操作等任务上仍有短板。

谷歌发布新一代旗舰模型Gemini 4 Argon,在18项基准测试中拿下12项第一,长程软件工程测试得分77.9%刷新纪录,安全测试攻击成功率仅0.7%为参测最低。

但Argon并非全面领先,在部分软件工程、终端操作和科学任务上落后GPT-6 Astra约10.5个百分点,Agent终端操作能力也不及Claude Opus 5.5。

其低幻觉率表现突出,答错时仅15%给出错误答案,远低于Astra的45%至51%,不过谷歌自报成绩引发质疑,独立评测显示其智能指数与Astra同分、低于Opus 5.5。

尝鲜期Argon每百万输入token收费2美元、输出10美元,结束后恢复至输入4美元、输出20美元,目前首批仅限谷歌Fairwind计划的网络安全防御人员使用。

阅读原文

本文由AI融业云采集并编辑,仅供学习使用!

本文来自tmtpost.com,作者字母AI

关于AI融业云:一站式AI应用服务平台,了解创始人 | 联系我们

有问题,请联系客服!http://www.rongyeyun.com/kefu/