Open Montage:基于Agent技术的开源AI短剧制作系统
Open Montage是一个基于Agent技术的开源视频制作系统,在GitHub上已斩获超过4万星标。它包含12个制作流程、52个工具和500多种代理功能,足以媲美一个小型制作公司的能力。本文深入拆解了该项目的五层架构——Pipeline(流水线类型)、Stage(制作阶段)、Tool(工具层)、Skill(技能层)和Agent(智能代理层),并结合实操演示(60秒神经网络动画短片)和进阶应用(播客类读书分享视频),展示了如何将Open Montage融入本地视频生产流水线,实现“一句话生成视频”的高效创作。文章核心观点:Open Montage的价值不在于它本身能生成多高质量的视频,而在于它提供了一套可借鉴、可改造、可融合的完整视频生产框架体系。

嗨,欢迎来到灵姐说AI。这期视频,给大家分享一款开源的、基于Agent技术的视频制作系统。这是一个开源的项目,它在GitHub上面已经斩获了超过4万颗星,这个项目的名字叫做Open Montage。它可以达到一个小型制作公司的效果。这个项目包含了12个制作流程、52个工具,以及500多种代理功能。它可以帮助你从一个Idea开始,层层推进,最后完成视频的生成和剪辑产出。这期视频会给大家介绍一下我对这个项目的理解、它能完成哪些内容、对于我们制作视频它的借鉴意义和借鉴点在哪里,以及我是怎么用这个项目、我制作出来了哪些内容。
一、项目概览:从科幻预告片到皮克斯动画
大家看到现在这个网页的页面就是Open Montage的项目。大家可以找到这个链接,看到这个GitHub的项目。在这个项目介绍的下面这个位置,它给出了比较多优质的、使用这个项目制作出来的视频。
比如说这里的《明天的信号》,它制作的是一个科幻电影的预告片。从概念的设计到剧本的编写、场景的规划,到AI生成的动画片段、背景音乐还有画面构图,都是通过这个项目的工具来完成——是不是效果还不错?
再看一下其他的视频类型。再比如说这个短片,叫做《最后的香蕉》:
Nobody picks the last banana. He sat at the back of the fruit aisle, bruised a little too brown, watching the others get chosen one by one. Hans reached in, grabbed the apples, the mango…
这个短片是皮克斯风格的动画短片,它的总成本是1.33美元。它使用了TikTok的风格分级标注,画面制作是使用了它背后的工具Remotion的软件来完成的。
再比如说这个片子《亚历山大的图书馆》:
In Alexandria, in the first century BC, there was a library…
这个片子的成本就比较低,因为它调用相关的模型用得少,总成本是0.02美元。它用了一些免费的公共音效、背景音乐以及画面,比如说这里的蜡烛烛火、不断跳动的百位计数器去反映它要表达的主题。
下面还有一些其他的案例,大家可以去官方的网站去看。
二、我的理解:不是软件,是模块
我更多的是想跟大家分享一下我的理解。
这个项目,我理解它的一个最大的亮点在于:它给你提供了一套相对完整的、相对全面的、用于视频制作的全套流程和结构。很多人可能自己梳理的时候,梳理不了这么完整。
一方面,你可以直接用它来制作视频。另外一方面,你可以把它融合进你本地已经在做的视频流水生产线,把一些生产模块补全,作为参考。
比如说大家知道,我是一直在做我的视频生产工厂这个模块的。那我就可以用Open Montage这个项目做一个对照,看看哪些薄弱的模块可以去补全。
所以我们去理解这个项目的时候,不要把它理解为一个“做视频的软件”,而更多的是要把它理解为一组可以被Codex调度的视频生产技能的模块。
三、五层结构:从Pipeline到Skill
实际上它是有五层结构的:
第一层:Pipeline(流水线类型)
它的视频类型是哪些?不同的视频类型,对应的流水线是不一样的。
我们平时生成视频用得比较多的无非是这么几种:
-
生成一些教程类的、概念解释类的
-
复刻一些爆款视频的结构,换一个主题来进行二次生产
-
将一些口播的视频进行混剪,再包装B-roll,生成一些纪录片
-
生成一些预告片、广告片或者说一些故事片
-
对于我们一些长视频的博主,可以让它来帮你把一些长视频切成短视频,在多渠道分发
-
生成一些产品的广告、品牌广告、概念片等等
所以在这个项目里面,它的Pipeline实际上是它的最高层——它定义的是究竟要做哪一种视频。实际上你在做类似的内容生产流程的时候,你也需要去做这样的定义。无非是说,作为我们特定的一类博主,你的视频类型往往是确定的。比如说像我做的比较多的,就是一些概念定义型的视频,或者说一些A-roll加B-roll的口播视频的组合。

第二层:Stage(制作阶段)
这里大家看到的8个步骤——研究、方案、脚本、分镜、素材、剪辑、合成、渲染到最后的发布包装——实际上就是我们制作视频、生成视频的过程。
你就可以拿这个去对比一下你现有的视频的生成流程,是不是在其中一个步骤中有缺失。而且针对不同的视频类型,具体到每一个单个步骤,它所包含的Skill、可调用的工具、产物以及审核标准,都是有所差别的。
第三层:Tool(工具层)
根据它的能力象限的不同,它会组成不同的能力组。
有的人会觉得可能它最后生成的质量没那么好,但实际上这和它背后调用的工具的质量有关。就以视频的生成为例,你可以调用Seedance,也可以调用HappyHouse——你调用的模型不同,也会导致整个的生成结构不同。
所以说这个工具并不是一个免费的视频生成工具,它基于Agent的技术来开发。比如说你调用谷歌的Veo视频生成工具,它还是有具体的费用的。当然也会有很多在GitHub上面的开源工具,它是不收费的。
第四层:Skill(技能层)
我认为最有价值的就是它的Skill这一层,就是它的导演技能。
比如说里面的创意制作技能——它怎么去设计这个故事情节、怎么去推进结构、怎么层层递进,这里面就很考验它的经验积累。再比如说它怎么去筛选素材、怎么进行素材的拼接、怎么形成对A-roll的包装,这些都会有非常多的沉淀。
那这些已经包装好、沉淀好的Skill,我就可以把它拿过来,把它的文档拿过来,借鉴过来,放到我现有的内容工厂的工作流里面,把它进行融合,最后去搭建出来我自己的完整的内容工厂的生产线。
比如说在这里,大家看到,这里呢就是让我本地的Codex去读了我现有的内容工厂的生产线,再对比Open Montage的优点和做得好的地方,然后看看怎么能融合。你看它就在看哪些生产环节、哪些Skill、哪些内容是Open Montage可以针对我现有的项目进行补充的。
如果说你本身在本地没有搭建这样的生产环节的流水线,你就可以先在Open Montage的基础上来进行升级融合。还有一种更高阶的办法就是——你去GitHub上面,或者等我后面会分享出更多的这种视频制作的项目(比较优质的、星标比较多的),然后你把三个或者多个融合起来,共同形成基于你自己内容系统的视频制作的流水生产线,而不是机械地使用Open Montage。
四、实操演示:一句话生成60秒动画短片
再给大家看看实操。
这里呢,我就是使用Codex来给他指令。我把Open Montage的链接给到他,让他帮我克隆这个仓库并且进行本地部署。我部署大概花了44分钟。
部署完成之后呢,我就给他布置了一个非常简单的任务,用一句话。我说:“用Open Montage的项目框架,做一个60秒的、解决神经网络是如何学习的动画短片。”
其中呢,我把它拆出来,我说这里的音频使用我本地的TTS的能力。这个TTS是我本地生成音频的一个能力,而且这个TTS是我之前已经沉淀好的Skill——它用的是已经克隆过我声音的这么一个能力。
所以说你在用这个GitHub项目的时候,你是可以在它的基础上去迭代去改造的。这个不要拘泥于说“这个项目克隆出来效果不好你就完事了”,你是可以在它的大的框架下改造的。而我认为它最大的亮点就是它的整个的框架体系。
好,一开始我这里TTS的技能还失败了,然后后面让他微调了一下,好,他这里就帮我生成了一个对应的视频,大家可以看一下:
想象你正在教孩子认猫。第一张照片他猜错了。神经网络一开始也这样——先猜,他看到输入信号一层层传下去,最后给出一个预测。接下来把预测和正确答案比较,差距越大,误差越大。学习不是突然懂了,而是把误差反向传回每一条连接——帮倒忙的连接调小一点,更接近答案的连接保留或者加强。这个过程像沿着误差坡度下山,它叫梯度下降。重复很多次以后,网络开始学会模式。它开始看懂猫的线索——边缘像耳朵,纹理像毛。所以学习不是魔法,是预测、犯错、改正、再预测。
是不是还是挺不错的?我就用一句话就完成了这个60秒的短片。那么这些60秒的短片,你再把它稍微调整一下,或者花一点钱调一些API的接口,它的整个的画面效果会更好。你是不是这些内容就可以放在一些短视频的平台,你每天日更一条、日更十条,是不是都能做到?
五、进阶应用:复用框架完成读书分享视频
再给大家看一个新的应用。
这个项目是我之前做到一半没有做完的。实际上呢,我是想做一个播客类的节目,大家主要是听声音,画面呢就是偶尔辅助看一下。这里呢,我是想介绍一本书——我把书的内容给他,我的音频文字还有字幕全部都生成完了。但是对于画面呢,一直没有搞出来,而且就是搞得不太满意。
在这里呢,我就再复用一下——就是沿用和参照一下Open Montage这个项目的能力,再加上Codex本身就可以调用的Hyperframes还有Remotion的能力,来完成这个书本介绍的视频的制作和剪辑。
而且我补充一下——这里呢,我给它的内容,因为我希望这个素材更丰富,我是接了很多公开的视频接口的。有一些图片、视频和素材网站,它很多素材是免费的,你只要去相应的网站注册,把它的API接口写进去,在Codex里面连接好,都是可以去调用的。
给大家稍微看一个十几秒的效果,给大家感受一下:
大家好,欢迎来到灵姐说AI。今天这期我们先做一集读书分享。我要分享的书是《超高效》,副标题叫《通过优化大脑改变你的工作方式》。这不是一本教你挤时间的效率书,它更像是在问一个更底层的问题:为什么同样是工作,有时候你越做越清醒,有时候越做越乱?
我想先从一个很熟悉的画面开始——你打开电脑,本来只想做一件事,结果先打开AI,让它帮你列思路,又打开文档准备整理,再打开网页查一点资料。AI很快给了你十几个方向,你觉得它很厉害,可是自己的脑子却越来越乱。半小时过去了,你看起来推进了很多,但好像又没有真正想清楚什么。
如果你也有这种感觉,先别急着怪自己不自律。这本书给了我一个特别好用的说法:你可能不是不够努力,你只是开错档了。《超高效》最重要的模型是——大脑不是一盏灯,只有开和关;它更像一台有档位的发动机,不同任务需要不同档位。



