上周,AI 行业两个头部模型发布重要更新,Anthropic 的 Opus 5.5,以及 GPT-6 的 Sol 和 Luna。
一周之后,GPT 6 Sol 和 Luna 几乎没人再提,Opus 5.5 的讨论还在继续。
中秋节的时候,我和歸藏、杨攀、向阳乔木,一起聊了聊 Opus 5.5 这个模型,它到底有什么魔力,为什么直到今天还在刷屏。
以下为聊天实录,视频版本欢迎去 bilibili 或小宇宙搜索 Next Token 进行收听,或直接访问官网找到所有的渠道链接 nexttoken.tv 。
Opus 5.5 越界,Muse 爆火,以及中国到底有没有 AI 产品经理?
一、Opus 5.5 刷屏的三类内容
Opus 5.5 的刷屏内容,大致可以分为三类。
第一类是品牌宣传片。整条片子是 Opus 5.5 用代码一点一点生成的,画面上堆了大量材质,笔触有蜡笔的粗粝感,噪点被处理成纸张的纹理,一眼看过去很难判断这是代码画的还是视频模型生成的。
第二类是像素动画。歸藏说做像素动画本身不难,难的是让角色的技能和场景之间产生物理互动。他举的例子是一个法师放技能打稻草人,技能落下的瞬间整个屏幕跟着震动,打击效果是用像素写出来的,手感接近《泰拉瑞亚》里那些做得好的模组。做游戏,打击感是特别要紧的东西。还有一个案例是 3D 像素版的《三国无双》赵云演示,像素颗粒比《Minecraft》更细,赵云从空中落下砸地,周围一片怪物清空。
第三类是用模型操作电脑画画。向阳乔木提到模型控制电脑里的画图工具,一笔一笔把一张 Dario 的画像画出来。同一张照片,GPT-6 Sol 画出来像六岁小孩的涂鸦,Opus 5.5 画出来的就像街头艺术家一样。向阳乔木说这类"给一张图,让它从头画出来再录成视频"的内容最近在 X 上很火。
歸藏自己也做了一条宣传片和一个游戏结算动画的 skill,不说的,你根本想不到,这是一个大模型自己完全靠代码完成。
歸藏说这类视频的产出已经到了八九十分的水平,接单,包括接很贵的单,完全没问,虽然距离真正顶尖的那一批比如何同学的特效还有距离。
橘子补了一句,这类视频的报价之前最多能做到十万块一个。
二、有审美的熟练工
海辛做了一个中秋节的小猫视频,她只给了脚本和音乐,模型自己选了贴纸风格,从头做出一条有剧情、转场干净的完整视频,而且是一次过,没有回炉。橘子说这件事如果交给真人团队做,估计也得两三天。
音乐那边,上一期节目聊过 GPT-6 做原创音乐非常厉害,这次 Opus 5.5 的音乐能力更神了。卡点和动作、转场对齐,片头打字的音效卡在节拍器的 BPM 上。歸藏说它不是按 Agent 的流水线先做视频、再随便配一段音频然后对节奏,它在思考的那一刻,脑子里已经有成片了。
杨攀用了一个类比,以前 AI 做的视频剪辑,感觉像 2023 年让 AI 写代码,对动效、对文案、对节奏的理解都很简陋。
歸藏说那时候的模型像一个刚学会 AE 和 PR 的实习生,照着厉害的人模仿,你只要换一个主,出来的就是四不像。实习生会操作软件,但不理解为什么这样编排能让人看着舒服,那属于初级软件操作工的水平。他说现在的差别在于它有自己的一套判断,知道怎么把不同的元素组织成一个整体。
橘子说这个模型不只会剪素材,它还有很强的审美。
三、世界模型?
杨攀抛了一个暴论,无论是对打击感、对视频的理解,还是对画笔的控制,都说明它对这个世界、对空间、对物理规律的理解已经很深,那这个东西就是世界模型。
歸藏不同意把它换算成"理解世界"。他说十几岁的孩子理解世界,动物也理解世界,但它们没有智能,无法基于这些理解创造出新的东西。小孩能理解,但他组合不了,而这里站着的是一位训练了十几年的艺术家,能把世界画出来,而且是动态的。
歸藏还做了一个判断,如果 Opus 5.5 这类模型能达到 MiniMax H3 那种动效还原的水平,甚至在某些层面直接爆掉它,追赶的难度会变得很高。因为 H3 没有这么大的智能,需要配合大语言模型才能完成工作,而 Opus 5.5 是一体的,一次出。他说以前你不会相信大语言模型用纯代码做出的视频能比视频模型更好,哪怕只是在某几个阶段,现在他一定有可能,今年下半年一定可以。
杨攀说,Opus 5.5 相当于第一次划出了剪辑师的斩杀线。橘子不同意"只是剪辑师",他说这是越界,把很多 Agent Skill、视频 Skill、视频 Agent 一起卷进去了。他举的例子是这一周刚好有一个视频 Agent 的宣发,用 HTML 加音效做解说视频,Opus 一句出来的效果是它的十倍。
从这个对比里,我们看到两条路线,剪映走工具路线,越做越复杂,功能越堆越多,这周也发了带 Agent 的版本;Opus 走智能路线,越做越强。两条线都在往前走,但智能的加速度比软件功能的加速度大太多。
歸藏说它处理问的方式很独特,是从最底层的库直接拼,用 FFmpeg、音效生成库、命令行、Git、Bash 这些构建互联网的基础设施,不经过界面,也没有上层那些封装好的东西。
这很符合第一性原理。
四、长板很多的天才员工
向阳乔木说 Opus 5.5 的聪明体现在有自己的判断力。
他给自己的 RSS 阅读器加一个"保存为 Markdown 或 PDF"的功能,把需求说完、功能做完之后,模型主动提了一句,「用户可能不知道已经操作过了,要不要把按钮改成一个已完成的标记?」
向阳乔木说他原来用大模型的感觉是它会讨好人类,按你给的一步一步执行,看起来就很愣,而且如果提需求的人本身是外行,模型会被他引偏。
歸藏的说法是,现在它像一个熟练工,你作为老板说要做这个,它明白有些细节你是不懂的,它会告诉你这样不行,应该怎么做。橘子给这种角色起了个名字,老板最爱的天才员工。
杨攀说提示词的写法也跟着变了,以前要引导它、跟它约定、给它严格限制,现在基本上只做一件事,对齐"我想干什么",至于它怎么干,已经不用管了。
向阳说为什么会这样呢?是不是 Skill 这类东西被模型内化吸收了?
歸藏认为一定存在这个方法,他说 Skill 和 MCP 这类可程序化、可模板化的东西是完美的训练素材,聊天记录、Skill 本身,再加上结果,就是一份非常格式化的数据,规范、好训,而且能把结果完整地内化进模型,视频、图像、音频都能被卷进这套规范里。
杨攀提到有一张流传的锯齿状智能的图,红线覆盖的区域是模型不如人的地方。他说前沿公司内部一直有人在看,哪些领域现在还不如人,哪些领域从来没覆盖过,然后去找那个领域的数据。
写代码这件事差不多了,OpenAI 去弄 3D,Anthropic 去弄物理、视觉、材质,突破新边界的过程反过来又抬升了整体智能。他的总结是,只要找到一个没训过的新领域数据,训完,模型的整体智能就会再涨一截。
橘子说大模型的这种智能进化和人类相比有着独特的优势。人类的特长是每个人有一块专属长板,拼成组织才能做成大事,现在一个模型就把这些拼完了,Coding 打通任督二脉,超强代码能力叠加 Computer Use,再叠加多模态理解,音乐、视频、图像挨个解锁,有点武侠小说的绝学味道。
向阳乔木说,人类曾经被认为独有的一种创新能力,是把隔得很远的两条信息关联起来,如果模型每一处都是长板,那它的创新力应该比人更强。
歸藏对国产模型厂商提了一个疑问,海外前沿厂商每次都能找到自己能力圈的边缘,再往前探一步,国产厂商可能更求稳,明知道某些能力不行,而且那个方向既容易传播又能拓展边界,却没有去做。
国内做的最好的例子的是 Seedance 2.0。在它之前,视频模型比的是物理还原、真实度、单镜头提示词遵循、复杂提示词下的还原。Seedance 换了比法,不比还原度,比智能程度,一句十五秒切成八个镜头,组成一个完整的故事。这个方向是 Sora 2 启发的,但它当时做到了极致,即便 2.5 都不如它好玩。
五、越界之后,人的位置
橘子说工程师的角色在变,专业 Coding 这块已经没什么好卷的,模型现在又具备了设计和宣发的能力,剩下留给人的,可能是跟人沟通的能力。
歸藏觉得这很危险,我们这一波人还知道怎么做视频、怎么写代码,下一代人上来就是一句,你给我做个视频。他还说 AI 本身已经是黑盒,Anthropic 天天在做可解释性,它正在把 AI 之外互联网上其他可数据化的东西也变成黑盒。
杨攀看得乐观一些,他说过去几十年互联网和移动互联网把从业者搞得很累,这一轮也许能把人解放出去,以后人只负责提需求。
歸藏对内容行业的判断相当激进,他说数字世界的内容创作工作不需要很多人,全世界可能维持两万人的队伍,就是最顶尖的那一拨,因为只有他们能跟上 AI 那种整合和思维能力。向阳乔木的解释是大家只想看最好的。橘子看到的是集中度的上升,这些人的能力被 AI 无限放大,其他人反而更没有机会,最终可能是万分之一的人加上 AI 自动化,解决几乎全部内容供给。至于剩下的人做什么,他的回答是消费就好。
六、RSI 是否已经存在?
杨攀形容了用 Claude 的心态,你面对的是一个神,干活的时候特别怕被拒绝,更怕一下惹他不高兴,他就离你而去,把你封号。他说每次许愿成功就觉得很牛,但全程小心翼翼、战战兢兢。
向阳乔木说,模型的用户没有忠诚度,哪个模型好就立刻切过去。这一波之前 OpenAI 刚被捧上天,那只是两周前的事,我们都是渣男渣女。
歸藏认为前沿公司手里可能同时握着好几个前沿的模型,藏着半年一年,所以他们对未来的乐观或悲观,建立在外人看不到的模型上。你想想,他们四五个月前就能用上 Opus 5.5。
向阳乔木回忆,去年底到今年初有一批 X 上的网红加入了 Anthropic,当时大家猜他们看到了什么,有可能就是 RSI,模型自己迭代自己的速度。
以上就是 Next Token 004 关于 Opus 5.5 的一些讨论,本期还讨论了在美国爆火的 Muse,据悉,国内
一周之后,GPT 6 Sol 和 Luna 几乎没人再提,Opus 5.5 的讨论还在继续。
中秋节的时候,我和歸藏、杨攀、向阳乔木,一起聊了聊 Opus 5.5 这个模型,它到底有什么魔力,为什么直到今天还在刷屏。
以下为聊天实录,视频版本欢迎去 bilibili 或小宇宙搜索 Next Token 进行收听,或直接访问官网找到所有的渠道链接 nexttoken.tv 。
Opus 5.5 越界,Muse 爆火,以及中国到底有没有 AI 产品经理?
一、Opus 5.5 刷屏的三类内容
Opus 5.5 的刷屏内容,大致可以分为三类。
第一类是品牌宣传片。整条片子是 Opus 5.5 用代码一点一点生成的,画面上堆了大量材质,笔触有蜡笔的粗粝感,噪点被处理成纸张的纹理,一眼看过去很难判断这是代码画的还是视频模型生成的。
第二类是像素动画。歸藏说做像素动画本身不难,难的是让角色的技能和场景之间产生物理互动。他举的例子是一个法师放技能打稻草人,技能落下的瞬间整个屏幕跟着震动,打击效果是用像素写出来的,手感接近《泰拉瑞亚》里那些做得好的模组。做游戏,打击感是特别要紧的东西。还有一个案例是 3D 像素版的《三国无双》赵云演示,像素颗粒比《Minecraft》更细,赵云从空中落下砸地,周围一片怪物清空。
第三类是用模型操作电脑画画。向阳乔木提到模型控制电脑里的画图工具,一笔一笔把一张 Dario 的画像画出来。同一张照片,GPT-6 Sol 画出来像六岁小孩的涂鸦,Opus 5.5 画出来的就像街头艺术家一样。向阳乔木说这类"给一张图,让它从头画出来再录成视频"的内容最近在 X 上很火。
歸藏自己也做了一条宣传片和一个游戏结算动画的 skill,不说的,你根本想不到,这是一个大模型自己完全靠代码完成。
歸藏说这类视频的产出已经到了八九十分的水平,接单,包括接很贵的单,完全没问,虽然距离真正顶尖的那一批比如何同学的特效还有距离。
橘子补了一句,这类视频的报价之前最多能做到十万块一个。
二、有审美的熟练工
海辛做了一个中秋节的小猫视频,她只给了脚本和音乐,模型自己选了贴纸风格,从头做出一条有剧情、转场干净的完整视频,而且是一次过,没有回炉。橘子说这件事如果交给真人团队做,估计也得两三天。
音乐那边,上一期节目聊过 GPT-6 做原创音乐非常厉害,这次 Opus 5.5 的音乐能力更神了。卡点和动作、转场对齐,片头打字的音效卡在节拍器的 BPM 上。歸藏说它不是按 Agent 的流水线先做视频、再随便配一段音频然后对节奏,它在思考的那一刻,脑子里已经有成片了。
杨攀用了一个类比,以前 AI 做的视频剪辑,感觉像 2023 年让 AI 写代码,对动效、对文案、对节奏的理解都很简陋。
歸藏说那时候的模型像一个刚学会 AE 和 PR 的实习生,照着厉害的人模仿,你只要换一个主,出来的就是四不像。实习生会操作软件,但不理解为什么这样编排能让人看着舒服,那属于初级软件操作工的水平。他说现在的差别在于它有自己的一套判断,知道怎么把不同的元素组织成一个整体。
橘子说这个模型不只会剪素材,它还有很强的审美。
三、世界模型?
杨攀抛了一个暴论,无论是对打击感、对视频的理解,还是对画笔的控制,都说明它对这个世界、对空间、对物理规律的理解已经很深,那这个东西就是世界模型。
歸藏不同意把它换算成"理解世界"。他说十几岁的孩子理解世界,动物也理解世界,但它们没有智能,无法基于这些理解创造出新的东西。小孩能理解,但他组合不了,而这里站着的是一位训练了十几年的艺术家,能把世界画出来,而且是动态的。
歸藏还做了一个判断,如果 Opus 5.5 这类模型能达到 MiniMax H3 那种动效还原的水平,甚至在某些层面直接爆掉它,追赶的难度会变得很高。因为 H3 没有这么大的智能,需要配合大语言模型才能完成工作,而 Opus 5.5 是一体的,一次出。他说以前你不会相信大语言模型用纯代码做出的视频能比视频模型更好,哪怕只是在某几个阶段,现在他一定有可能,今年下半年一定可以。
杨攀说,Opus 5.5 相当于第一次划出了剪辑师的斩杀线。橘子不同意"只是剪辑师",他说这是越界,把很多 Agent Skill、视频 Skill、视频 Agent 一起卷进去了。他举的例子是这一周刚好有一个视频 Agent 的宣发,用 HTML 加音效做解说视频,Opus 一句出来的效果是它的十倍。
从这个对比里,我们看到两条路线,剪映走工具路线,越做越复杂,功能越堆越多,这周也发了带 Agent 的版本;Opus 走智能路线,越做越强。两条线都在往前走,但智能的加速度比软件功能的加速度大太多。
歸藏说它处理问的方式很独特,是从最底层的库直接拼,用 FFmpeg、音效生成库、命令行、Git、Bash 这些构建互联网的基础设施,不经过界面,也没有上层那些封装好的东西。
这很符合第一性原理。
四、长板很多的天才员工
向阳乔木说 Opus 5.5 的聪明体现在有自己的判断力。
他给自己的 RSS 阅读器加一个"保存为 Markdown 或 PDF"的功能,把需求说完、功能做完之后,模型主动提了一句,「用户可能不知道已经操作过了,要不要把按钮改成一个已完成的标记?」
向阳乔木说他原来用大模型的感觉是它会讨好人类,按你给的一步一步执行,看起来就很愣,而且如果提需求的人本身是外行,模型会被他引偏。
歸藏的说法是,现在它像一个熟练工,你作为老板说要做这个,它明白有些细节你是不懂的,它会告诉你这样不行,应该怎么做。橘子给这种角色起了个名字,老板最爱的天才员工。
杨攀说提示词的写法也跟着变了,以前要引导它、跟它约定、给它严格限制,现在基本上只做一件事,对齐"我想干什么",至于它怎么干,已经不用管了。
向阳说为什么会这样呢?是不是 Skill 这类东西被模型内化吸收了?
歸藏认为一定存在这个方法,他说 Skill 和 MCP 这类可程序化、可模板化的东西是完美的训练素材,聊天记录、Skill 本身,再加上结果,就是一份非常格式化的数据,规范、好训,而且能把结果完整地内化进模型,视频、图像、音频都能被卷进这套规范里。
杨攀提到有一张流传的锯齿状智能的图,红线覆盖的区域是模型不如人的地方。他说前沿公司内部一直有人在看,哪些领域现在还不如人,哪些领域从来没覆盖过,然后去找那个领域的数据。
写代码这件事差不多了,OpenAI 去弄 3D,Anthropic 去弄物理、视觉、材质,突破新边界的过程反过来又抬升了整体智能。他的总结是,只要找到一个没训过的新领域数据,训完,模型的整体智能就会再涨一截。
橘子说大模型的这种智能进化和人类相比有着独特的优势。人类的特长是每个人有一块专属长板,拼成组织才能做成大事,现在一个模型就把这些拼完了,Coding 打通任督二脉,超强代码能力叠加 Computer Use,再叠加多模态理解,音乐、视频、图像挨个解锁,有点武侠小说的绝学味道。
向阳乔木说,人类曾经被认为独有的一种创新能力,是把隔得很远的两条信息关联起来,如果模型每一处都是长板,那它的创新力应该比人更强。
歸藏对国产模型厂商提了一个疑问,海外前沿厂商每次都能找到自己能力圈的边缘,再往前探一步,国产厂商可能更求稳,明知道某些能力不行,而且那个方向既容易传播又能拓展边界,却没有去做。
国内做的最好的例子的是 Seedance 2.0。在它之前,视频模型比的是物理还原、真实度、单镜头提示词遵循、复杂提示词下的还原。Seedance 换了比法,不比还原度,比智能程度,一句十五秒切成八个镜头,组成一个完整的故事。这个方向是 Sora 2 启发的,但它当时做到了极致,即便 2.5 都不如它好玩。
五、越界之后,人的位置
橘子说工程师的角色在变,专业 Coding 这块已经没什么好卷的,模型现在又具备了设计和宣发的能力,剩下留给人的,可能是跟人沟通的能力。
歸藏觉得这很危险,我们这一波人还知道怎么做视频、怎么写代码,下一代人上来就是一句,你给我做个视频。他还说 AI 本身已经是黑盒,Anthropic 天天在做可解释性,它正在把 AI 之外互联网上其他可数据化的东西也变成黑盒。
杨攀看得乐观一些,他说过去几十年互联网和移动互联网把从业者搞得很累,这一轮也许能把人解放出去,以后人只负责提需求。
歸藏对内容行业的判断相当激进,他说数字世界的内容创作工作不需要很多人,全世界可能维持两万人的队伍,就是最顶尖的那一拨,因为只有他们能跟上 AI 那种整合和思维能力。向阳乔木的解释是大家只想看最好的。橘子看到的是集中度的上升,这些人的能力被 AI 无限放大,其他人反而更没有机会,最终可能是万分之一的人加上 AI 自动化,解决几乎全部内容供给。至于剩下的人做什么,他的回答是消费就好。
六、RSI 是否已经存在?
杨攀形容了用 Claude 的心态,你面对的是一个神,干活的时候特别怕被拒绝,更怕一下惹他不高兴,他就离你而去,把你封号。他说每次许愿成功就觉得很牛,但全程小心翼翼、战战兢兢。
向阳乔木说,模型的用户没有忠诚度,哪个模型好就立刻切过去。这一波之前 OpenAI 刚被捧上天,那只是两周前的事,我们都是渣男渣女。
歸藏认为前沿公司手里可能同时握着好几个前沿的模型,藏着半年一年,所以他们对未来的乐观或悲观,建立在外人看不到的模型上。你想想,他们四五个月前就能用上 Opus 5.5。
向阳乔木回忆,去年底到今年初有一批 X 上的网红加入了 Anthropic,当时大家猜他们看到了什么,有可能就是 RSI,模型自己迭代自己的速度。
以上就是 Next Token 004 关于 Opus 5.5 的一些讨论,本期还讨论了在美国爆火的 Muse,据悉,国内