9月4日,Meta发布Muse Spark 1.3,对标谷歌Gemini 3.8 Flash,主打“前沿性能、极致低价”,在编程与智能体任务上实现突破,工具调用次数减少20%,token消耗降低25%。
该模型智力指数达62分,超越GPT-5.6 Sol与Claude Opus 5,在DeepSWE v1.1基准测试中以75.4分登顶,输入每百万token仅1.25美元。
质疑声随之而来:基准测试分数飙升但真实体验提升有限,部分测试“弃权率”升高。
行业观察者认为,大模型竞争正从“参数红利”转向“智能体工程”,低成本长程任务落地能力将成为核心壁垒。
