LTX-2.3:一句话变一段片,开源视频卷到哪一步了
前阵子给一门课做宣传素材,要一段十秒左右的开场动画。按老办法:要么外包,要么打开剪辑软件跟关键帧搏斗一晚上。这次我偷了个懒——写了句提示词,丢给本地的开源视频生成模型,去泡了杯茶。
茶还没凉,片子出来了。不算完美,但够用。那一刻我意识到:视频生成这条赛道,已经不是”演示视频里很惊艳、实际用起来很拉胯”的阶段了。
这篇聊聊我最近在折腾的 LTX 系列——Lightricks 出的开源视频生成模型,一路卷到了 LTX-2.3。
为什么值得盯 LTX 这条线
视频生成模型这两年其实分两个阵营:闭源大厂(效果惊艳,按秒计费,还得排队)和开源阵营(可以本地跑、可以魔改、权重全开放)。
LTX 在开源阵营里一直是个很特别的存在:
它从第一天起就冲着”快”去。 别的模型生成十秒视频要等半首歌的时间,LTX 的架构设计就是往实时方向压的——同样的显卡,别人还在排队,它已经出片。对想把它接进工作流的人来说,“快”不是锦上添花,是能不能用的分水岭。
消费级显卡真的能跑。 这是我最看重的一点。不用租云上昂贵的卡,本地一张游戏显卡就能出活。能跑在自己机器上的技术,才谈得上”折腾”。
开源权重,想接哪接哪。 ComfyUI 社区生态成熟,想串图生视频、串 ControlNet 式的控制、做风格化,管道怎么拼都行。闭源 API 给的是结果,开源模型给的是可能性。
到了 LTX-2.3 这一版,直观感受是:画面的一致性、动作的自然程度又往前拱了一截,提示词的理解也更听话了。以前需要反复抽卡的画面,现在一次过的概率明显变高。
它现在到底能干成什么
说点实在的,按我上手这段时间的体验,这类开源视频模型现在真正能打的场景是:
- 素材级镜头:空镜、氛围镜头、转场背景。做片子的人都知道,这类镜头不需要叙事,只要”对味”,AI 生成几乎零成本。
- 图生视频:拿一张静态图(比如用图像模型生成的封面),让它动起来,做片头、做海报动效,性价比极高。
- 小体量商用内容:电商产品的动态展示、课程宣传的开场动画——我这次做的就是这类。
而还差口气的地方也直说:
- 长叙事还不行。超过十几秒、需要角色一致性和剧情连贯的内容,开源模型基本靠抽卡和拼接硬凑。
- 物理规律偶尔犯迷糊。水怎么流、布怎么飘,模型是”学感觉”的,细看仍有破绽。
- 手指、文字这类老大难,比前两年好多了,但还没到能闭眼信的程度。
一句话总结:它是顶级的素材供应商,还不是导演。 导演的活——分镜、节奏、叙事——暂时还得人来。
我接进工作流的方式
分享一个我现在的用法,给同样爱折腾的朋友参考:
- 图像模型先出关键帧,把构图和风格在这一层锁死;
- LTX 做图生视频,让关键帧动起来,每个镜头单独生成;
- 剪辑软件里拼节奏,音乐和转场还是人的活;
- 最后压缩发布——视频比图片大得多,压缩这一步别省。
这个管道里最妙的是:每一环都是本地可跑或者开源可控的,不欠任何平台的账。我平时折腾 NAS、跑本地模型攒下的那点家底,在这条管道里全用上了。
写在最后
有人问我:AI 都能生成视频了,剪辑师是不是要失业?
我的看法还是那个老观点——工具替代的是”动作”,替代不了”判断”。 生成一段素材的动作被替代了,但”这段素材该不该用、放在哪、配什么节奏”的判断没有。会拍的人拿它当加速器,不会拍的人拿它当抽卡机,差距只会更大。
对普通人来说,开源视频模型最大的意义不是省钱,是把”试错”变便宜了——以前一个创意要不要做,得先掂量成本;现在先花十分钟生成看看,不行就扔。创意这种东西,就是在便宜的试错里长出来的。
我在给学生讲 AI 大模型课的时候,会把这条管道当案例拆给他们看:从提示词到成片,中间每一环都是可学、可练、可接的手艺。AI 时代不缺会用工具的人,缺的是把工具串成流水线的人。
对了,如果你也想在本地跑一跑,建议先从图生视频入手——先出一张满意的图,再让它动起来,成功率最高,成就感来得最快。