这篇论文指向了一种新的 Agent 架构:
Generator → 多次尝试 → Verifier → 选择 → 继续执行
未来提高 Agent 性能,可能不需要每次都等待更大的基础模型。
让 AI 一次多做几个答案,再让另一个 AI 用更细的评分、多维度评分、多次评分,从里面挑出最靠谱的那个。
下一阶段提升 Agent 的关键,除了让 AI 更会做,还要让 AI 更会判断自己什么时候真的做对了。这可能会成为 Test Time Scaling 很重要的一条路线。

AI探索 | Hermes/OpenClaw优质资源优质信息
 
 
Back to Top