谷歌DeepMind正式发布年度旗舰模型Gemini 4 Argon,在代码、企业任务、安全与长上下文能力上全面对标生产力工具。最大升级是上下文窗口从上一代约6.4万Token跃升至100万Token,可一次性处理数百页代码、大型项目文档乃至企业内部知识库,推动AI从代码助手向项目级助手演进。
价格方面,Argon输入为每百万Token 2美元、输出10美元,命中缓存时输入成本最高可降95%,显著降低企业大规模AI任务的长期使用门槛。
谷歌还展示了多个内部案例:Argon智能体团队分析服务器数据,释放超300 TiB内存;参与Fuchsia系统Zircon内核等大型代码迁移,并优化libgav1视频解码库中超过3.2万行SIMD代码。这些信号表明谷歌希望证明Gemini已进入企业真实工作流。
公开测试中,Argon在DeepSWE v1.1软件工程测试获77.9%,金融、法律、安全等测试也领先。但业内随即出现“Benchmaxxing”质疑,认为模型可能针对测试题优化,而真实企业项目包含数十万行代码、复杂业务逻辑与协作要求,难以被单一跑分体现。
更深层的挑战来自AI入口变化。随着智能体发展,用户正从搜索框寻找答案转向直接让AI执行任务,OpenAI、Anthropic、Meta均在布局个人智能体。Gemini 4 Argon能否帮谷歌抢回主动权尚待验证,但AI大战远未结束。
