随着智谱的GLM-5.3终于也在AA竞技场开榜,年中这一轮国产模型的上新,基本算是告一段落了,相当于期中考试出分。
若以AA竞技场为参照标准,且全部按提交的满功率版本来算,目前各家厂牌的成绩如下:
Kimi K3和GLM-5.3并列60分,是中国唯二能够挤进T1阵营里的模型,死死咬住了GPT-5.6和Claude Opus 5。
当然Kimi K3是已经发布超过1个月的「老」模型了,可见含金量之足,月之暗面应该是今年惊喜最大的AI公司了,路线修正得太及时了。
按照智谱创始人唐杰的说法,GLM-5.3是故意在控制变量,只通过后训练来做迭代,不动基座、架构和参数,看看能有多少提升,也很满意新模型的表现。
T2档位排下来依次是58分的Qwen3.8 Max、53分的DeepSeek-V4-Pro、52分的Qwen3.8 27B,也是兼顾性能与经济性的高竞争区间,凡尔登绞肉机的市场。
阿里的Qwen3.8这一代其实口碑不错,非但Max版本重回开源,27B版本更是被评价为「Opus at home」,在Hugging Face,Qwen全系列模型今年被下载了20亿次以上,比第2名到第5名加起来还多。
DeepSeek-V4-Pro到底出了什么问,现在没人知道,虽说有搭配专武(Harness极简模式)的找补,但我觉得 说得没毛病,一言不合就堆定语,是车圈陋习,咱大模型行业不要学。
再说T3分段,这里已经接近上桌吃饭的底线了,能看到45分的MiniMax-M3、43分的MiMo-V2.5-Pro、42分的Hy3,主打一个量大管饱的供应,够用就行,要啥自行车呢。
MiniMax今年算是垫给了智谱,M3押注的原生多模路线,在商业价值上还是比不过纯Coding,最后还是靠视频模型找回了场子,字节比智谱好打你们敢信?
在DeepSeek-V4-Flash发布之前,小米的MiMo系列模型其实在OpenRouter上当了小半年的性价比之王,很适合用来跑自动化工具链之类的低价值高频次任务,也已经在财报里帮雷总做市值管理了。
腾讯的Hy3是姚顺雨的第一个作品,打响了翻盘的第一步,而且真做到了中美两开花,内有扶WokrBuddy上位的功劳,外有开打OpenRouter价格战的成绩,均衡双修。
再往下数,T4的分段就很接近不可言说的深海了,蚂蚁的Ling 3.0 Flash是38分,美团的LongCat 2.0是34分,阶跃的Step 3.7 F
 
 
Back to Top