现在的 AI 榜单看多了真挺麻木的,大家基本都在已有参考答案的池子里卷。
TRACES 提的这个思路很对路。如果没有标准答案,AI 到底能不能自己把结论探索出来?
重点测寻找路径和自主试错,而不是只看一个冷冰冰的最终得分。大模型从做家走向科研助手,这步跨越确实该有新的基准了。

AI探索 | Hermes/OpenClaw优质资源优质信息
 
 
Back to Top