绝了!这应该是最适合接入视频剪辑工作流的AI!!
因为它真正能看懂视频,并且够快够便宜!
对于做视频,不管是专业还是非专业选手,最耗费时间的其实就是找素材,和选素材!
好几个小时的素材,可能真正能用上的就几分钟!
而为了找到合适的,往往需要把每一条都从头看完,
根据脚本反复拖动时间轴、记录和剪切可用的素材。
这非常费时间,一点也不AI。
我也试过用很多AI来解决这个需求,包括一些所谓的视频素材AI管理工具,
能读视频的多模态模型其实很多,靠截图的方式能够理解视频的内容,
但也仅限于知道视频的内容,因为这些模型不太能理解视频里各个镜头和画面的时间关系。
这次看到 新出的多模态模型 Ling-3.0-flash-VL,
MoE架构,总参数124B、有效激活5.5B参数,支持256K长上下文和VideoRoPE时空编码。
激活参数更小,说明成本更低!
这个VideoRoPE时空编码,据说是靶向解决我上面说的那个问!
第一时间测试了一下!!
我丢给它一个演讲的视频,让它告诉我讲了什么,有什么重点,
另外我告诉它,我想基于这个演讲视频剪辑一个高光短视频,需要它帮我找到一些高光时刻,然后告诉我准确的时间码,并且为这个高光短视频写一个文案。
这已经不是单纯的“视频总结”之类的简单任务,
它需要按照时间线给出:
高光时间段+核心观点+入选理由+建议标+开头钩子+发布文案。
这应该才是多模态模型能够发挥价值的地方!!
普通模型可以告诉你“一小时的视频讲了什么”,但内容创作真正需要的是:这一小时里,到底哪些能够用,要怎么用?
让我比较惊喜的是,它不光给了我高光视频剪辑要用的分镜、脚本、文案,甚至还给了我转场、和BGM的建议!
完全就是一份可以照做的剪辑执行单!!
这说明和它对原视频的理解已经远超我的预估!!
我在想,也许可以把这套能力接入剪辑工具,整个工作流就还可以继续延伸:
读取视频 → 理解内容 → 定位高光 → 输出时间码 → 调用工具裁剪 → 生成标和发布文案。
完全实现视频剪辑自动化!!
当然,理想是丰满的,AI挑出的素材不一定全都符合审美和叙事偏好,
时间码和上下文完整性也需要人工复核。
要想创作出好的视频作品,必然还是需要人的参与!
不过,用AI搞定素材的初筛,也是目前的超级刚需啊!!
AI探索 | Hermes/OpenClaw
因为它真正能看懂视频,并且够快够便宜!
对于做视频,不管是专业还是非专业选手,最耗费时间的其实就是找素材,和选素材!
好几个小时的素材,可能真正能用上的就几分钟!
而为了找到合适的,往往需要把每一条都从头看完,
根据脚本反复拖动时间轴、记录和剪切可用的素材。
这非常费时间,一点也不AI。
我也试过用很多AI来解决这个需求,包括一些所谓的视频素材AI管理工具,
能读视频的多模态模型其实很多,靠截图的方式能够理解视频的内容,
但也仅限于知道视频的内容,因为这些模型不太能理解视频里各个镜头和画面的时间关系。
这次看到 新出的多模态模型 Ling-3.0-flash-VL,
MoE架构,总参数124B、有效激活5.5B参数,支持256K长上下文和VideoRoPE时空编码。
激活参数更小,说明成本更低!
这个VideoRoPE时空编码,据说是靶向解决我上面说的那个问!
第一时间测试了一下!!
我丢给它一个演讲的视频,让它告诉我讲了什么,有什么重点,
另外我告诉它,我想基于这个演讲视频剪辑一个高光短视频,需要它帮我找到一些高光时刻,然后告诉我准确的时间码,并且为这个高光短视频写一个文案。
这已经不是单纯的“视频总结”之类的简单任务,
它需要按照时间线给出:
高光时间段+核心观点+入选理由+建议标+开头钩子+发布文案。
这应该才是多模态模型能够发挥价值的地方!!
普通模型可以告诉你“一小时的视频讲了什么”,但内容创作真正需要的是:这一小时里,到底哪些能够用,要怎么用?
让我比较惊喜的是,它不光给了我高光视频剪辑要用的分镜、脚本、文案,甚至还给了我转场、和BGM的建议!
完全就是一份可以照做的剪辑执行单!!
这说明和它对原视频的理解已经远超我的预估!!
我在想,也许可以把这套能力接入剪辑工具,整个工作流就还可以继续延伸:
读取视频 → 理解内容 → 定位高光 → 输出时间码 → 调用工具裁剪 → 生成标和发布文案。
完全实现视频剪辑自动化!!
当然,理想是丰满的,AI挑出的素材不一定全都符合审美和叙事偏好,
时间码和上下文完整性也需要人工复核。
要想创作出好的视频作品,必然还是需要人的参与!
不过,用AI搞定素材的初筛,也是目前的超级刚需啊!!
AI探索 | Hermes/OpenClaw