阿里Qwen3.8-Max发布:2.4万亿参数,多项基准超越GPT-5.6 Sol和Fable 5
阿里巴巴刚刚把一张成绩单拍在了硅谷的桌上——Qwen3.8-Max在多项基准测试中超越了OpenAI和Anthropic的旗舰模型。
三个关键信息
2.4万亿参数,活跃参数950亿。 Qwen3.8-Max是阿里Qwen系列迄今为止最大的模型,总参数量2.4万亿,采用MoE架构,任意时刻活跃参数约950亿。这种设计在推理成本和模型能力之间取得平衡——你不需要同时点亮全部参数来获得顶级性能。
关键基准全面领先。 IFBench(指令跟随)得分82.8,GPT-5.6 Sol为72.7,Fable 5仅63.5;PaperBench(论文复现)93.0,超过Sol的90.5和Fable 5的88.8;HealthBench 60.2和PLawBench 73.2同样领先。在Terminal Bench 2.1(终端操作)上以86.6略逊于Sol的88.8,但在AndroidBench(75.1 vs 74.0)和自研的QwenSWEBench(80.7 vs 73.5)上扳回。目前基准数据截至8月3日,尚无独立第三方评测。
中国AI模型密集发布,价格战加剧。 Bloomberg用「死亡地带」形容当前的竞争态势:两周前Moonshot AI的Kimi K3以远低于美国对手的成本达到了可比性能;现在阿里又用最大规模模型直接对标前沿。美国的芯片出口管制并没有阻止中国AI公司在基准测试上追平甚至反超。
王斗视角
2.4万亿参数的模型在IFBench上比Sol高出10分、比Fable 5高出近20分——这不是统计噪音,这是断层级的差距。当然,阿里公布的基准里有两个是自研的(QwenSWEBench和QwenQoderBench),在自家考卷上考第一不算数,要看的是IFBench、PaperBench、HealthBench这些第三方题。而在这些第三方题上,Qwen3.8-Max确实打出了硬成绩。更有意思的是价格:中国模型的API定价普遍只有美国同行的几分之一。当性能追平而价格差5倍的时候,芯片禁令的故事就变得很难讲了。
