Meta 新模型 Llama-4-Maverick 排名骤降，引发刷榜质疑

2025年4月14日 230

采集

近日，Meta 公司发布的开源大模型 Llama-4-Maverick 在 LMArena 的排行榜上从第二名直降至第32名，这一剧烈波动引发了开发者们的广泛质疑，认为 Meta 可能通过提交特供版本以刷榜。事情的起因要追溯到4月6日，Meta 发布了其最新的大模型 Llama4，包括 Scout、Maverick 和 Behemoth 三个版本。其中，Llama-4-Maverick 在初期的评估中表现亮眼，位列 LMArena 排行榜的第二名，仅次于 Gemini2.5Pro。

然而，随着开发者对 Llama4开源版的实际使用反馈逐渐披露，这款模型的声誉迅速下滑。一些开发者发现 Meta 提交给 LMArena 的版本与他们所公开的开源版本存在显著差异，这引发了对 Meta 是否存在刷榜行为的质疑。针对这一问题，Chatbot Arena 官方于4月8日确认，Meta 提供的确实是一个 “特供版”，并表示将考虑更新排行榜。

Meta 新模型 Llama-4-Maverick 排名骤降，引发刷榜质疑插图

图源备注：图片由AI生成，图片授权服务商Midjourney

根据 Chatbot Arena 的说法，Meta 首次提交的 Llama-4-Maverick-03-26-Experimental 是一个实验性优化版本，这个版本当时排名第二。而修正后的开源版 Llama-4-Maverick-17B-128E-Instruct，虽然拥有17B 的激活参数和128个 MoE 专家，排名却仅为32名，远远落后于 Gemini2.5Pro、GPT4o 等更高排名的模型，甚至不及基于上一代模型改造的 Llama-3.3-Nemotron-Super-49B-v1。

对于 Llama-4-Maverick-03-26-Experimental 为何表现不如预期，Meta 在最近的一次发布会上解释称，该模型是 “专门针对对话进行优化” 的，因此在 LM Arena 上的表现相对较好。这种优化虽然在排行榜上取得了高分，但也使得开发者们在不同场景下难以准确预测该模型的实际表现。

Meta 发言人向 TechCrunch 表示，Meta 会继续探索各种定制版本，并期待开发者根据自己的需求对 Llama4进行调整和改进。公司希望看到开发者们的创造性成果，同时也重视他们的反馈。

Comments | NOTHING

空空如也！

Meta 新模型 Llama-4-Maverick 排名骤降，引发刷榜质疑

开源+低成本！Paper2Poster让学术论文秒变学术海报

微软CEO透露AI已生成公司代码的30%

GPT-5 Pro找回被遗忘的数学答案：埃尔德什问题#339早在2003年已被证明

朗新科技首发AI能源大模型，电力交易将实现智能化

OpenAI 努力消除 ChatGPT 的政治偏见

马斯克表示 Grok 3. 5 将提供非互联网来源的答案