继续发一则和国内 model researcher 交流的 memo。今天和某模型厂的一位 post-train researcher 聊了聊。Ta 对「国内在 Pre-training 上更有优势、Post-training 相对落后」这件事,补充了一个视角:
国内基本已经「会做」Pre-training 了,但 Post-training 可能还处在一个比较混沌的阶段。
一个核心原因是,两者的 reward 清晰程度很不一样。
Pre-training 的反馈很明确,比如可能就是在单位时间内,把 Next Token Loss 降得越低越好,同时尽可能降低训练成本。
Post-training 要解决的,则是怎么让模型在下游应用中表现得更好。但怎么定义和评估这个「更好」,以及怎么确认模型是真的变强了、而不是在 hacking 某个指标,都非常 tricky。
此外,Pre-training 的创新也更容易被外界看到。
模型架构没有那么强的机密性,一开源大家就能看到,也可以写成 Paper、拿去做 PR。但一家模型公司的数据是怎么清洗的、具体用了什么训练 Recipe,通常不会拿出来讲。
再加上众所周知的缺卡问,而模型的绝对能力又是模型厂的生死线,大家自然会把更多资源投入反馈更明确、也更容易获得声量的 Pre-training。
Post-training 因此陷入了一个有点尴尬的循环:因为混沌,所以拿不到足够多的资源;又因为资源不够,这种混沌迟迟无法被解决。
除了这个,我们还聊到了几个挺有意思的点:
1/ 「大厂最终一定会赢」是一种偷懒的推论。
模型竞争不是比身价。拥有更多钱、卡和人,不等于一定能训出最好的模型。
在这位 researcher 看来,真正起决定性作用的,可能是组织里到底有多少人发自内心想把模型训好,以及组织摩擦会不会消耗掉这些人的热情。(没有说加入创业公司的人会更有梦想的意思。)
2/ Agent 确实已经在替代 AI Lab 里的一部分工作。(所以我们最近和一些 researchers 交流,感觉有些人确实已经有失业焦虑了。)
拿 Infra 举例,现在可以直接告诉 Agent:「每秒只能输出 50 个 Token,请优化到 60 个」,然后让它自己检查 Kernel 和整条链路。
所以一些 Infra 工程师开始自己给自己找事干,比如跑去研究算法、理解训练需求。
(从这里再往外延伸一步:如果说 AI Coding 模糊了产品、研发和设计之间的边界,那么 AI for AI / RSI 似乎也在逐渐模糊数据、算法和 Infra 之间的边界。
3/ Model Research 本身,可能就是最 Science 的 AI for Science。
我们还探讨了两个没有答案的问,也列在这里吧,欢迎有想法的朋友分享你的见解~
Q1/ 怎么让模型拥有时间概念?
这个之所以会是个问,是因为如果模型不交卷,它就可以一直保持「我没错」的状态。反正模型不老不死,所以从它自己的视角看,磨洋工可能并不是什么坏事。(GPT-5.6 一直写测试,是不是就是深刻践行了这一点啊 doge.jpg)
就像《葬送的芙莉莲》里,对于一个能活几千年的精灵来说,花十年寻找一枚戒指完全合理。
但我们这些凡胎肉体,根本等不起…(除非 AI 医疗让人类永生哈哈
Q2/ OpenAI 是怎么持续相信 RL 这个方向,并最终把 o1 做出来的?
我们好奇的不是具体的 Recipe,而是背后的组织问。
想起之前请清华大学叉院的助理教授
录过一期播客,他在节目里提到,OpenAI 很早就在做 RL,但之前做了很久都没有得到结果。
那么,在一个方向连续失败很多年以后,他们的团队为什么还能继续相信它,招到人、说服老板、拿到资源,然后真的把事情做出来呢🤔
这个问可能需要更了解 OpenAI 的朋友来回答了。
最后,其实跟很多 researchers 交流,尤其是问他们觉得哪家模型更有希望时,大家最后都会强调组织文化。
在一个快速变化、资源永远不够的行业里,怎么把人和算力分给那些还没有答案的创新,以及愿意等这些创新多久,可能和技术判断本身一样重要吧。
@aigc1024
 
 
Back to Top