B站今天上线了测试模型能力的「AI无限竞技场」,我愿称之为本月最佳整活。
之所以用整活二字,是因为所有测评项目都是由B站UP主手搓出来的,理论上并不像传统刷型Benchmark那么严谨。
但从今年以来模型评测的风向转变来看,所谓的严谨,其实是最不要紧的。
要知道,现在市面上参考价值最高的LMArena——也就是AA竞技场——是由用户匿名投票投出来的,这意味着榜单充满了人类的主观偏好,不问对错,只看答案讨喜与否。
所以从严谨性上,哪怕LMArena一度遭遇了很多业内人士的轮番炮轰,但这不耽误它依然是模型评测最大的参照系。
说白了,哪有那么多人每天用模型去解专业数学,评价到底好不好用,最后还不是得看大伙的真实需求吗。
那么问来了,既然LMArena已经如此权威,那为什么B站还要大费周章地再做一个呢?
这就涉及到评分机制的问了,由于LMArena并没有设置任何参与门槛,所以理论上,所有人都可以用脚投票。
我记得年初Surge AI还喷过这一点,说你们的用户压根不会仔细读,扫两眼就选出答案了,这对模型厂商不公平啊......
但在B站,只有UP主可以参与测评,好不好不能选几道就盖棺定论了,得拿作品说。
更何况,因为各模型训练语料不同,老外觉得好用,并不代表我们也认为好用。
这就能解释得通,为什么B站的「AI无限竞技场」与LMArena榜单出入非常大,单是前10名里国产模型就占据了一半,仅有GPT-6 Astra、Claude Fable 5.1这些公认「六边形战士」是重合的。
要知道,那些B站参与测评的UP主已经在实打实用模型解决问了。
注意啊,我指的不单是做网页、解决屎山代码这些主流Coding场景,UP们整出来的大活,还包括考建模、打麻将、当媒婆、对「新三国」暗号等等......
我之前就说过,AI行业当下最要紧的,是去AI味,凭什么做模型就得对着别人的榜单和任务定向优化,反而忽略我们自己最需要的场景,中文社区的真实反馈,这不就来了吗。
更重要的是,B站榜单的实时排名,既会不断刺激模型厂商进步,也相当于给模型的发展历史进行社区化「归档」,完成取之用户、用之用户的良性循环。
我自己是很愿意见到这种场面的,看的人越多,就越能减少一些常识性误解,这对普通人之于AI的认知,助益莫大。
看AI、学AI、搞产品、测模型,眼看着B站的生态,是越来越完善了。
@aigc1024
之所以用整活二字,是因为所有测评项目都是由B站UP主手搓出来的,理论上并不像传统刷型Benchmark那么严谨。
但从今年以来模型评测的风向转变来看,所谓的严谨,其实是最不要紧的。
要知道,现在市面上参考价值最高的LMArena——也就是AA竞技场——是由用户匿名投票投出来的,这意味着榜单充满了人类的主观偏好,不问对错,只看答案讨喜与否。
所以从严谨性上,哪怕LMArena一度遭遇了很多业内人士的轮番炮轰,但这不耽误它依然是模型评测最大的参照系。
说白了,哪有那么多人每天用模型去解专业数学,评价到底好不好用,最后还不是得看大伙的真实需求吗。
那么问来了,既然LMArena已经如此权威,那为什么B站还要大费周章地再做一个呢?
这就涉及到评分机制的问了,由于LMArena并没有设置任何参与门槛,所以理论上,所有人都可以用脚投票。
我记得年初Surge AI还喷过这一点,说你们的用户压根不会仔细读,扫两眼就选出答案了,这对模型厂商不公平啊......
但在B站,只有UP主可以参与测评,好不好不能选几道就盖棺定论了,得拿作品说。
更何况,因为各模型训练语料不同,老外觉得好用,并不代表我们也认为好用。
这就能解释得通,为什么B站的「AI无限竞技场」与LMArena榜单出入非常大,单是前10名里国产模型就占据了一半,仅有GPT-6 Astra、Claude Fable 5.1这些公认「六边形战士」是重合的。
要知道,那些B站参与测评的UP主已经在实打实用模型解决问了。
注意啊,我指的不单是做网页、解决屎山代码这些主流Coding场景,UP们整出来的大活,还包括考建模、打麻将、当媒婆、对「新三国」暗号等等......
我之前就说过,AI行业当下最要紧的,是去AI味,凭什么做模型就得对着别人的榜单和任务定向优化,反而忽略我们自己最需要的场景,中文社区的真实反馈,这不就来了吗。
更重要的是,B站榜单的实时排名,既会不断刺激模型厂商进步,也相当于给模型的发展历史进行社区化「归档」,完成取之用户、用之用户的良性循环。
我自己是很愿意见到这种场面的,看的人越多,就越能减少一些常识性误解,这对普通人之于AI的认知,助益莫大。
看AI、学AI、搞产品、测模型,眼看着B站的生态,是越来越完善了。
@aigc1024