神仙打架,MinimaxH3还在开源2K视频中,原生4K的Ltx2.5深夜开源了,哇哦。如果4k又能更快,更稳定,那才更好,相信最近会有加速插件,量化模型跟上,最喜欢看开源社区发力了,期待哪天原生4K 5秒就能出1分钟视频才好。
我去查询MinimaxH3参数量是33B,本次的Ltx2.5有22B的参数量【PS这两个是我自己查询不是官方数据】这么一比可能Ltx2.5在某些方面稍加逊色,但是解决了ltx2.3不太清晰的问题,可以支持一次生成多个连续镜头,人物、场景、声音跨镜头保持一致性,无需后期拼接,提示词理解能力主要依赖于gemma4模型。
先说结论:又快,有高清,要是MinimaxH3有这么快就好了,5秒的视频,1280*736 分辨率只需要121秒图片,15秒视频生成完毕只需要314秒。
官方示例
如何在本地使用?一步一步带你制作第一个Ltx2.5视频
1.下载comfyui整合包
Comfyui ltx2.5工作流以及整合包链接:https://pan.quark.cn/s/4f19adda4ddc
2.更新到最新版本0.32.0+
3.拖入工作流
4.下载模型以及存放位置
工作流注意事项
1.分辨率和像素在这里调整
时长和帧率在这里,先跑5秒看看效果,满意了再跑15秒的
3.注意官方最低使用蒸馏后disstill模型16G显存可用,用 distilled 模型 + FP8/INT8 量化 + 降低分辨率(540p–720p)+ 缩短时长(3–5秒)可以降低到12G
4.模型也下载好了,工作流也拖入进来了,那么怎么样的提示词才能更好的发挥ltx2.5的效果呢?
官方提示词指南
一、核心原则
写提示词时,要像摄影师在描述镜头一样,用流畅的自然语言把完整画面讲清楚。 LTX-2.5 最擅长:单一主体、清晰运镜、统一光影、明确音频的电影感场景。
通用规则:
用现在时描述动作
写成一段流畅的段落(不要关键词堆砌)
场景聚焦:少而清晰的人物和动作,比拥挤画面效果更好
光影统一:每个镜头保持一种合理的光源逻辑
先写核心,再逐步加细节迭代
二、提示词必须包含的 6 大要素
Establish the Shot(确立镜头)
使用电影术语:特写、中景、全景、过肩等,匹配你想要的风格。
Set the Scene(设定场景)
描述灯光、色调、表面纹理、氛围,建立情绪和调性。
Describe the Action(描述动作)
按时间顺序写自然动作,从开始到结束流畅连贯。
Define the Character(s)(定义人物)
年龄、发型、服装、明显特征。情绪用身体动作表达,不要直接写“sad / angry”。
Identify Camera Movement(s)(运镜)
明确怎么动、什么时候动,以及运动后画面变成什么样。
Describe the Audio(音频)
环境音、音乐、对白、歌唱。
对白用引号包起来
可指定语言和口音
三、结构写法
- 单镜头(Single-Shot)——最常用
写成一段流畅段落
约 4–8 句描述
细节程度匹配镜头尺度(特写要精细,全景可概括)
运镜相对主体来描述
示例结构:
[镜头类型] + [场景与光影] + [人物外貌与动作] + [运镜] + [音频与对白]
- 长场景 / 剧本风格(Screenplay-Style)
适合有对白、多节拍、精确时间的场景。 可使用场景标题、角色提示、引号对白,但仍然保持现在时和物理情绪表达。
- 多镜头(Multi-Shot)——LTX-2.5 新能力
一次生成 2–4 个镜头,并保持人物/场景/声音一致性。
必须做的事:
用自然语言明确写出转场(例:A hard cut transitions to… / A match cut connects…)
每个新镜头重新建立构图、角度、人物、光影
重复出现的人物用相同视觉标识(例:the woman in the yellow raincoat)
明确音频是否跨镜头连续(例:the synth score continues across the cut)
多镜头示例(官方):
A wide shot frames a rainy city intersection at dusk, neon signs reflecting on wet asphalt. A young woman in a yellow raincoat walks toward camera, gripping a folded newspaper, while cars hiss past behind her. Soft synth music and distant traffic fill the air. A hard cut transitions to a medium close-up of her face under the hood, raindrops catching the neon as she looks off-screen left; the synth score continues across the cut, traffic muffled. She whispers, “He’s late.” Another hard cut jumps to a low-angle shot of a man’s scuffed boots stepping into a puddle at the curb; the music drops to a low drone. He lifts his head into frame — short dark hair, soaked jacket — and smiles toward her off-screen as a bus rumbles past.
建议: 优先 2–4 个镜头,每个镜头职责清晰(建立→细节→反应)。
四、特殊功能提示词
Dub-It(配音 / 替换对白)
模板:
text
[Speaker] is speaking [Language/Accent], saying: "[完整对白]"
要求:
提供完整对白原文(模型不会自动翻译)
用目标语言的原生文字(俄语用西里尔字母等)
目前验证语言:英语、法语、西班牙语、德语、俄语
只支持单人说话
对白长度尽量匹配原片时长(略长好于太短)
图生视频(Image-to-Video)
优先用单连续镜头。 可在提示词开头加:“Use the provided start image as the first frame”,再描述后续动作与运镜。
五、模型仍不太稳定的点
屏幕文字
:短文字有改善,但拼写和跨帧一致性不保证,重要文字建议后期添加。
复杂物理
:高度混乱的运动容易出伪影,日常合理动作更可靠。
六、常用术语参考(可直接抄用)
镜头语言:Follows / Tracks / Pans across / Circles around / Tilts upward / Pushes in / Pulls back / Overhead view / Handheld / Over-the-shoulder / Wide establishing shot / Static frame
灯光:Flickering candles / Neon glow / Natural sunlight / Dramatic shadows
氛围:Fog / Rain / Dust / Smoke / Particles
音频:Coffeeshop noise / Wind and rain / Forest ambience with birds / Whisper / Shout
风格:Film grain / Lens flares / Depth of field / Slow motion / Time-lapse