博主头像

👤 同一博主

按发布时间查看该博主的全部资讯要点

查看全部博主 →
博主头像

🎬 MiniMax H3 两段式潜空间放大指南:极速生成 HD 超清 AI 视频

🎯 核心观点 针对 MiniMax H3 直接生成高分辨率视频速度慢的问题,提出“两段式潜空间放大”工作流。 核心思路为:低分辨率搭建结构(快速采样),高分辨率进行精修(二次采样)。 该方案旨在平衡画质与效率,主要目的是节省时间而非显存。 🛠️ 关键事实与步骤 前置准备: 安装支持 2D/3D 潜空间放大的扩展节点,本教程选用 3D 版本以增强时空一致性。 下载 FP16 格式的放大模型,放置于 `latent upscale models` 目录。 下载 Turbo LoRA(图生视频用 1.1 版本,参考视频用 0.1 版本)及新版 ComfyUI 以支持新注意力机制。 工作流执行: 第一阶段:设定低分辨率(如 608x352,0.2 Megapixels),使用 OLA 采样算法和 Simple 调度器,共 8 步采样。通过 `SplitSigmas` 节点截取前半段 Sigma,仅构建视频大体结构。 潜空间放大:分离音视频 Latent,使用 3D 放大节点将视频部分放大(设定目标宽高,需为 32 像素倍数),再合并音频。 第二阶段:对放大后的 Latent 进行二次采样精修,最后解码输出高清视频。 加速机制: 结合 Turbo 模型(权重 1.0)减少采样步数。 启用 `Model Attention Backend` 节点,切换至 Kitchen Attention 机制以提升运算效率。 ⚖️ 结论与适用性 画质提升: 面部细节:近距离镜头下五官、发丝、皮肤纹理清晰,中景人物边缘更清楚。 动作细节:骑马、炒菜、滑雪等快速移动场景中,肢体轮廓、背景层次及动态效果(如蒸汽、水花)表现稳定自然。 风格适应:风格化人物、夜景反光及特殊低机位镜头均能保持一致性。 局限性: 参考视频生成(Reference to Video)因 Turbo LoRA 版本较低(0.1),质量略逊于图生视频;建议不使用加速模型,改用完整步数采样以获得更好效果。 适用人群:追求生成速度且对视频动态细节有较高要求的 AI 视频创作者。

博主头像

🎬 LTX 2.5 全流程指南:ComfyUI 原生工作流实操与三大翻车痛点攻克

🎬 核心观点 LTX 2.5 模型在 ComfyUI 中已实现原生支持,通过扩散保真渲染、视频解码器优化及新文本编码器,显著提升了提示词理解力与细节保留能力。尽管在多镜头切换和复杂动作执行上表现优异,但在物理规律遵循(如物体形变、穿透)及人物一致性维持方面仍存在明显短板。 🔍 关键事实/论据 技术升级:引入扩散保真渲染,动态分配计算预算以保留高频细节;采用扩散式视频解码器进行“翻译后精修”;新文本编码器能准确记忆动作序列、灯光及运镜指令。 工作流配置:ComfyUI 需更新至最新版并加载官方模板。推荐使用蒸馏模型(Distilled)以提升速度,搭配 12B 文本编码器。可利用 `Generate LTX Prompt` 节点增强提示词,并根据需求选择空间放大(超分)或时间放大(插帧)模型。 实操表现: 多镜头与动作:能原生理解多镜头提示词(如长城、东京、巴黎场景切换),人物一致性较好;能执行修自行车等包含五段连续动作的复杂链条。 首尾帧控制:通过 `LTX add guide` 节点设定首尾帧位置(0 和 -1)。若首尾帧差异大易产生转场,相似度高则生成一镜到底视频。 缺陷案例:收伞时伞骨变软、人物下车关门出现穿透现象;镜头移开再回归时面部特征发生漂移;文生视频中“25岁女性”常被生成得偏老,建议用 "girl" 替代 "woman"。 💡 结论与建议 LTX 2.5 适合需要高精度细节保留、复杂动作序列及多镜头叙事的内容创作。用户应充分利用其原生多镜头支持和提示词增强功能,但在处理物理交互(如软硬物体碰撞)和长时间面部一致性时需降低预期或调整策略。建议优先使用蒸馏模型以提高效率,并在编写提示词时注意用词精准度以规避年龄偏差等问题。

博主头像

🎬 MiniMax H3 Turbo 全流程指南:四步采样,2分钟出片与防闪烁工作流

🚀 核心观点 MiniMax H3 Turbo 方案通过“四步采样”实现高效视频生成,约2分钟即可产出5秒(120帧)视频。针对动作幅度不同的场景,推荐两种工作流:平缓动作直接使用加速 LoRA;剧烈动作或易闪烁场景采用“两段式采样”以平衡速度与稳定性。 📊 关键事实与评测数据 基础性能对比:在 RTX 4090 (24G) 显卡上,原始图生视频工作流耗时约8分29秒;使用加速 LoRA 后缩短至1分38秒,效率提升显著。 LoRA 横向测评:测试了 KJ、LARIF、JBUFF 三组模型,场景设定为清晨花店整理鲜花(含对话)。 KJ (V0.1):画面无崩坏,但音频存在电子杂音,且声音以画外音形式出现,口型不同步。 LARIF (V4 STAB 600 EMA):音频较干净,但仍为画外音,人物嘴巴未同步说话。 JBUFF:专为 int8 简质模型优化(权重设为0.75)。表现最佳,动作自然,声音干净,口型与声音关系合理。厨房场景测试也证实了其稳定性。 闪烁问题解决方案:四步 Turbo 在处理剧烈动作(如船上丢明信片)时会出现画面闪烁。 🛠️ 工作流配置与建议 平缓动作工作流(推荐 JBUFF LoRA) 适用场景:站立、轻微转身、整理物品、走路、做饭等温和动作。 关键设置:使用 int8 简质模型;开启 Sage Attention;采样步数设为4;采样器改为 Euler;将 BasicGuider 替换为 CFGGuider(CFG设为1.0);通过 Zero Out 节点处理负向条件。 两段式采样工作流(解决闪烁) 适用场景:动作快、变化剧烈或需要高稳定性的复杂场景(如镜面反射校正、御剑飞行)。 核心逻辑:将 Sigma 分为两部分。前两步使用完整 H3 模型构建基本结构;后四步接入加速 LoRA 进行细化,并禁用 Noise。 效果:虽速度略慢于纯四步方案(仍约2分钟),但能有效防止闪烁,保证动作与镜头关系的完整性。

博主头像

🎬 从 11 分钟缩短到 3 分钟!实测 MiniMax H3 三重加速节点叠加效果

🚀 核心观点 通过叠加 SoulAttention、SageAttention 和 EasyCache 三种加速技术节点,可显著缩短 MiniMax H3 模型的生成时间。实测表明,该组合方案能将文生视频耗时压缩至约一半,图生视频及参考视频生成耗时甚至可缩减至原来的三分之一,且画面质量无明显降低。 📊 关键事实与论据 加速原理简述: SoulAttention:动态识别图像重点与非重点区域(如人脸 vs 背景),优化注意力计算资源分配。 SageAttention:采用更适合显卡的低精度计算方式,提升运算效率。需注意 `allow compile` 选项:本地运行建议开启以利用编译后的速度优势;云端环境因每次重新分配资源,建议设为 False 以避免重复编译耗时。 EasyCache:针对视频帧间的连续性,缓存不变部分避免重复计算。 实测数据对比: 文生视频:普通工作流耗时 7分12秒,加速后降至 3分34秒(速度约提升一倍)。 图生视频:普通工作流耗时 10分49秒,加速后降至 3分19秒(时间缩短至约三分之一,提速3.2倍)。 参考生成:普通工作流耗时 8分05秒,加速后降至 3分41秒。 参数设置建议: SoulAttention:Tau 设为 1.2(保守值),Start/End Percent 分别设为 0.2 和 0.9(首尾20%及最后10%不参与加速)。 EasyCache:Reuse Threshold 设为 0.3,启用范围同样为 0.2 至 0.9。 💡 结论与操作指南 适用性:该方案适用于文生视频、图生视频及参考视频生成。 前置条件:需将 ComfyUI 更新至最新版(EasyCache 已原生支持),并通过 ComfyUI Manager 安装 SoulAttention 扩展,或克隆项目至 Custom Nodes;SageAttention 需安装 KJ 提供的 ComfyUI-KJ-Node。 注意事项:加速可能导致细微的动作逻辑变化(如桅杆初始状态不同),但整体质量保持较高水平。工作流已构建于 Running Hub 平台供参考。

博主头像

🎬 原生对口型+动作迁移?极限压测最强开源全模态模型 MiniMax H3

🎬 MiniMax H3 模型深度评测与实战指南 💡 核心观点 MiniMax H3 是目前开源领域备受关注的全模态视频生成模型,其最大亮点在于能够同时生成高质量的视频画面与同步音频(包括环境音、动作音效及对口型)。该模型在物理规律理解、多镜头叙事以及复杂动作迁移方面表现优异。通过 ComfyUI 工作流配合结构化提示词和参考图技术,用户可以实现从“文生视频”到“图生视频”再到“多源参考生成”的多样化创作。 📊 关键事实与技术参数 模型版本与格式:当前 ComfyUI 支持的是 H3 Base 版本,主要生成 768P 分辨率视频。工作流中推荐使用 `int8` 量化版本的模型以平衡性能与效果。 核心组件: 主模型:分为 `FL2V`(负责图生/文生视频)和 `Reference to Video`(负责参考生成)。 编码器:使用千问 VR 32B 文本编码器,以及专用的音频和视频 VAE。 硬性约束条件: 帧率:必须固定为 24 fps。 帧数公式:总帧数需满足 “17的倍数 + 5” 的规则(例如生成特定秒数时需通过此公式计算总帧数)。 采样设置:推荐使用特定的 Sampler,采样步数为 20 步。 🛠️ 工作流与操作技巧 1. 提示词结构化策略 无论是文生视频还是图生视频,提示词的写法对结果影响巨大。建议采用 “五块式” 结构: 视觉风格 时间轴动作(最关键):明确标注动作起止时间(如 0-2秒、2-3.5秒),详细描述每个时间段的具体行为。 镜头语言 声音描述 限制条件 对比测试结论:普通提示词仅包含人物和场景,导致动作关系松弛;而使用结构化时间轴提示词后,动作顺序、镜头关系及叙事逻辑显著增强。 音频对齐:模型具备强大的声音对齐能力,如金属摩擦声、点击声等能精准对应画面中的可见动作。 2. 图生视频(Image-to-Video) 首尾帧控制:支持接入 `First Frame` 和 `Last Frame` 图片以控制起始和结束状态。 一致性要求:参考图中的人物特征需与提示词描述保持一致。 物理模拟能力:模型能理解局部物理变化,如手掌擦拭水汽玻璃时,清晰区域随手部移动逐渐扩大;牛奶注入咖啡时,液面升高、颜色混合及冰块状态均符合物理守恒逻辑。 3. 参考生成(Reference Generation) 多源输入:支持同时接入人物、服装、道具、环境等多张图片。 关键参数 `reference image size`: Match:将参考图缩小至接近目标视频像素面积,Token 少,速度快,但人物一致性较弱。 Max:尽量保留原始细节,速度慢,但人物特征(如项链、发色)一致性更强。 Character Sheet 优势:使用包含多视角的角色设定图比单张正面照更能保证转身或全身动作时的特征稳定性。 职责分配:在多参考图测试中,需通过提示词明确每张图的职责(身份优先 > 服装道具 > 环境),避免构图直接复制。 🚀 高级应用与结论 多镜头叙事与动作迁移 分镜控制:通过在提示词中使用 `short1`, `short2` 等标签,可实现多镜头切换的压缩叙事(如物品滑落、追逐、接住物品的连续场景)。 原生对口型:使用 `` 标签指定语言(如 Chinese),模型能生成准确的中文发音与口型,且背景音(如倒茶声)不会覆盖对白。 动作迁移:可将一段视频中的动作序列(如试穿风衣的完整过程)迁移到另一张人物参考图上,保留目标人物身份的同时复现复杂动作顺序。 总结 MiniMax H3 是一款真正具备实用价值的全模态开源模型。其优势在于原生音频同步、首尾帧控制以及多模态参考生成。虽然对提示词的结构化程度和参数设置(如帧数公式)有较高要求,但通过合理的工作流配置(如在 RunningHub 上获取最新工作流),创作者可以克服技术门槛,实现高一致性和强叙事性的视频内容创作。

博主头像

🎬 CrossView Warp 全流程教学:揭秘 LTX 2.3 3D 球形摄像机运镜的终极秘籍

🎯 核心观点 CrossView Warp 技术旨在解决视频生成后补拍侧面机位的难题,通过保留原有表演内容,仅重新调整摄像机位置或生成新的运镜动画。 该技术基于 LTX 2.3 模型与 IC-LoRA 工作流,核心在于利用深度图(Depth Anything)解析空间关系,并通过粉色区域标识原摄像机未拍摄到的盲区,由模型进行细节补全。 最佳适用场景是横版、主体居中且原相机稳定的视频素材,避免竖版视频或主体偏离中心的情况,以确保空间信息表述清晰。 🛠️ 关键事实与步骤 环境配置:需安装 ComfyUI 扩展 CrossView Warp,克隆至 Custom Nodes 文件夹并重启;安装 Depth Anything 插件;下载对应的 CrossView Warp LoRA 至 LoRA 目录。 工作流结构:分为基础视频生成与放大两个阶段。核心节点包括原视频输入、CrossView Warp 节点及两路 IC-LoRA 引导。 双路引导机制: 第一路直接使用原视频,通过 Video IC-LoRA Guide 锁定人物身份与动作。 第二路将参考视频经 Depth Anything 生成深度图,输入 CrossView Warp 节点生成带有粉色盲区的新视角视频,再经另一路 IC-LoRA Guide 引导采样。 节点操作: 机位调整:在球体界面拖动相机改变位置。绿色区域代表训练数据覆盖的高可靠区;黄色区域为创作区,张力强但稳定性稍弱;灰色区域超出训练范围,不建议使用。 相机动画:右键点击添加关键帧,左键调整位置,Shift+右键删除。通过 Interpolation(线性或平滑曲线)和速度参数(如 Ease In Out)控制运动轨迹。 提示词策略:可使用触发词 "crossview",或具体描述粉色盲区中需要模型想象补充的不可见内容。 ⚠️ 结论与注意事项 优势:能实现从正面到侧面、俯视或仰视的平滑运镜,保留人物表演连续性,并在复杂场景(如樱花飘落)中维持视觉元素。 局限性: 竖版视频无法使用 IC-LoRA,导致效果失效。 当原视频已有复杂运镜或主体非居中时,人物一致性可能下降,空间结构易丢失。 黄色区域虽能产生更强纵深,但模型可能自由发挥导致画面被重新解释。 最佳实践:选择横版、主体靠近中央、原相机稳定的素材,优先在绿色区域调整机位,以获得最高质量的第二机位视频。

博主头像

🎬 单图人像 vs 四栏角色表:揭秘 Best Face ID 如何破译 LTX 2.3 的记忆代码

🎯 核心观点 Best Face ID 插件旨在解决 LTX 2.3 模型中的人物一致性问题,主要包含单图参考生成和角色设定图(Character Sheet)两种工作流。 单图模式依赖面部特征保持,而角色设定图模式通过提供全身、侧面及背面信息,能显著提升发型、服装及整体外观的一致性。 参考图的宽高比与目标视频比例匹配度直接影响相似度,方形视频(1024x1024)通常稳定性最高。 高清放大虽能提升细节,但因涉及重新采样,可能导致身份一致性略有下降,建议作为可选步骤。 📊 关键事实与测试数据 模型与参数:主模型为 LTX 2.3 1.1 版;Lora 权重设为 1;`sauce id` 固定为 2;`face skill` 设为 1;引导强度为 1。 参考图要求:单图需满足单人、正面、光线清楚、面部占比大;建议去背以集中注意力;最长边缩放至 512。 分辨率测试: 竖图生横视频:脸部相似度明显下降。 横图生竖视频:人物一致性不高。 竖图生竖视频:面部特征稳定。 结论:横图配横视频,竖图配竖视频。 角色设定图规范:必须为横向四栏图(正脸特写、全身正面、90度侧面、背面);背景建议纯白;`reference resize mode` 必须选 `native resolution`,不可选 `match target`,否则会导致细节丢失。 提示词结构:以 `reference_T2A` 开头,按四层书写:人物外貌、服装配饰、新场景动作、景别运镜光线。 高清放大流程:第一阶段半分辨率生成,第二阶段使用 `tile latent upscaler` 放大及 `tile sampler` 精修;单图模式输出 1408x1920,角色设定图模式输出 1024x1920。 💡 结论与建议 单图场景:若仅有一张清晰近照,使用普通 Best Face ID Lora,缩放至 512x512,选择 `match target` 模式,保持参考图与视频比例一致。 多视角场景:若需保留发型、服装等更多特征,使用 Character Sheet Lora,选择 `native resolution` 模式,提供标准四栏设定图。 操作建议:优先确保基础视频生成稳定,再考虑高清放大;提示词需准确描述脸型、发型及服饰,避免简单场景描述,以增强身份稳定性。

博主头像

🎬 Krea 2 迎来重磅升级!v1.2 实测:不仅能换脸换头,还能完美匹配角色表

🎯 核心观点 Krea 2 Identity Edit 1.2 版是目前最强大的 Krea 2 图片编辑模型,相比 1.1 版使用价值更强。 该版本补全了人物编辑功能,支持换脸、换头、换人及局部增强,并新增 Mask 功能和角色列表支持。 功能支持不等于每项都稳定,部分效果可能需要多次尝试(抽卡)才能获得最佳结果。 📊 关键事实与论据 功能升级: 支持单图编辑和多图参考编辑,可精确控制换脸(仅五官)、换头(含刘海)或换人(含发型、服装)。 新增 `reference boost` 参数,用于控制参考图外观约束强度。测试显示数值设为 4 时,脸部、发型及服装与参考图接近度最佳;数值 1 时身份特征突出但细节偏差大,数值 12 时提升不明显。 新增 `reference boost mask`,其作用不同于输入遮罩,而是通过增加特定区域的注意力强度来增强一致性。测试表明,当 `reference boost` 设为 4 时,Mask 能显著提升人脸一致性;若 `reference boost` 为 1,Mask 几乎不起作用。 支持角色列表(Character Sheet)作为参考,可生成包含正面、四分之三侧面、侧面和背面的 2x2 视图,用于保持多视角下的人物身份稳定。 技术参数与设置: 工作流基于 ComfyUI 构建,使用 Krea 2 Turbo 模型(FP8 版本)。 文本编码器建议使用 Qwen 3 VL 或 Qwen 2.1 VL,因为它们是视觉模型,能理解参考图片。 关键节点包括 `create tooledit model patch`(注入参考图信息)和 `create to edit grounded in code`(结合编辑指令与参考图的文本编码器)。 参考图类型可选 `fit`(自适应,保留更多原始信息)或 `crop`(裁切,适合近景),`fit` 在保留服装等细节上表现更强。 采样设置:使用 Turbo 模型时,采样步数建议为 10,CFG 设置为 1.0。 测试结论: 在双人场景编辑中,提示词无需过长,只要准确定位人物位置即可,详细提示词并未表现出明显优势。 生成角色列表时,建议去除背景以减少干扰,且分辨率不能太低,以保证拆分后各视角图片的比例和清晰度。 视觉编码器(VE)对比中,Qwen 2.1 VL 略优于 Qwen 3 VL,但差异不实质,用户无需过度纠结。 💡 结论与建议 适用场景:适用于需要高精度人物一致性保持的图片编辑任务,如角色设计、多视角生成及复杂场景的人物替换。 操作建议: 默认将 `reference boost` 设置为 4 以获得平衡的效果。 若需保留参考图的大量外观信息(如服装),优先选择 `fit` 模式;若侧重面部近景,可尝试 `crop` 模式。 使用 Mask 功能时,务必配合较高的 `reference boost` 值(如 4)才能发挥增强一致性的作用。 生成角色列表时,保持背景简洁,确保分辨率足够高,以便后续作为高质量参考图使用。 风险提示:部分功能(如 Mask 和角色列表)的效果可能受随机性影响,需多次生成以筛选最佳结果。

博主头像

🎬 JoyAI Image Edit 全流程教学:手把手教你实现像素级精准对齐与图片编辑

🎯 核心观点 本视频为 ComfyUI 平台下 JoyAI Image Edit 模型的全流程教学,重点解决单图编辑中的像素级精准对齐问题。 该模型由京东研发,分为 Single(单图编辑)和 Plus(多图参考生成)两个版本,二者共用 WAN2.1 的 VAE,但 Diffusion Model 和 Text Encoder 必须配对使用。 针对像素不对齐痛点,视频提出了一种通过“等比缩放至 1024x1024 方形画布”再“精确裁剪”的优化工作流,以实现严格对齐。 📋 关键事实与论据 模型架构:Single 和 Plus 模型需搭配特定的编码节点,且要求 ComfyUI 更新至最新版本以支持扩展节点。 提示词规范:单图编辑需明确四点:修改对象、目标结果、保留内容、编辑边界。例如换装时需锁定脸、发型和姿势,仅更换服装。 像素对齐原理: 传统 Empty Latent 若分辨率与原图比例不一致(如 1024x1024 处理竖图),会导致构图重建和白边消失。 手动修改分辨率(如 768x1280 或 1088x1920)虽可改变比例,但仍无法实现像素严格对齐。 最优解:将原图等比缩放(Padding)至 1024x1024,使用相同分辨率的 Empty Latent 生成,最后裁掉多余像素,可确保人物位置、白边及整体构图与原图严格一致。 多图参考(Plus)限制: 提示词需明确每张图的职责(如 Image1 为人物,Image2 为服装)。 建议人物与背景置于同一张主图中,避免分开提供导致“贴图感”。 不同分辨率的参考图(竖图、横图、方图)混合使用时,易出现人物拉伸或重新构图现象,建议尽量使用相同分辨率。 能力边界:模型在材质替换(如琥珀树脂改玉石)、物体移动(茶壶移入红框)及新视角生成(相机八方向旋转)方面表现良好,但在复杂 3D 场景(如温室图书馆)的视角切换中,可能出现楼梯、水池位置变化或人物裁切等一致性问题。 💡 结论与建议 模型选择:处理单张图编辑任务时,优先使用 Single 模型;Plus 模型更适合多图参考生成,若仅传一张图,其效果可能不如 Single 模型专注。 工作流推荐:强烈建议使用视频中提供的“严格对齐”工作流,该方法通过方形画布中间态处理,有效解决了分辨率差异导致的像素错位问题。 操作提示:在使用 Plus 模型时,若需保持物体尺寸不变,需在提示词中明确强调修改前后比例一致;删除物体时需同时描述关联物(如投影)及背景补全状态。

博主头像

🎬 用这套流程一天产出 12 段高质量 AI Vlog:拒绝机械人像,开启“事件级”叙事

🎯 核心观点 高质量 AI Vlog 的核心在于“事件级”叙事,而非机械的人像动作(如眨眼、微笑)。 目标是在 10 秒内完成一个可剪辑成片的小事件,通过建立“动作地灵针”概念,让静态图片包含明确的起始动作,从而引导视频生成的自然运动路径。 流程的核心价值在于通过三道质量门槛,将不稳定的生成过程转化为可复用、高良品率的生产流程,减少废片率。 🛠️ 关键事实与论据 三道质量门槛: 提示词门槛:使用 `female portrait director` Skill,将模糊想法转化为包含年龄、服装、场景、道具及具体动作细节(如“左手托相机,右手捏住半露照片”)的精准描述,避免模型自行决定关键细节。 静态图门槛:生成包含“动作起始状态”的图片。对比显示,若图片中动作已完成(如墨镜戴好),视频模型需自行设计动作;若图片中动作进行中(如墨镜下移),视频生成更顺畅。 视频生成门槛:使用 LTX 2.3 模型,配合五段式动作节拍提示词,增强视频动感。 技术工具与参数: 图像生成:商用路线使用 JPT Image 2;开源路线使用 Create Tool V2 肉模型 + TurboLora + Y2.1 VE,采用两段式采样(大结构生成 + 低 Denoise 精修)。 视频工作流:分为人物一致性保持与高清放大两个阶段。 一致性节点:使用 `likeness guide`(提取人脸)、`likeness anchor`(持续注意力锚定)及 latent 注入,确保转头、表情变化后人物特征不崩坏。 放大技术:使用 Latent Upscaler 配合 Tile 模式,避免高分辨率生成时爆显存。 案例数据:利用 6 组场景实际产出 12 段高质量竖屏 Vlog。 ⚠️ 结论与注意事项 适用场景:该流程特别适用于旅行、生活类 Vlog,因所用 Skill 主要优化写真风格图片,故定位在 Vlog 领域更合适。 局限性: 即使使用高清工作流,仍可能出现逻辑错误(如将“收伞”演绎为“开伞”并遮挡面部),这属于模型理解偏差,非工作流能完全解决。 提示词需明确锁定原始设定,防止扩写过程中设定被悄悄替换。 执行建议: 提示词需包含具体动作状态(如“照片刚露出一半”)而非最终结果。 视频提示词建议采用五段式动作节拍描述,以提升 LTX 生成的连贯性。 安装 Skill 时可直接通过 GitHub 链接或让大语言模型辅助安装。

博主头像

🎬 AI 视频终于有“记忆”了!实测 MSR V2:从种子到开花的精准逻辑控制

🎯 核心观点 MSR V2(Multi Subject Reference)技术实现了视频生成的“记忆”功能,能精准控制从种子到开花等复杂逻辑事件,而非简单堆砌画面元素。 该模型支持多主体参考,能在镜头切换后保持人物发型、服装及身份的高度一致性,适用于叙事视频制作。 相比 V1 版本,V2 在整体效果、身份保持及多镜头连贯性上有显著提升。 📊 关键事实与论据 技术架构:MSR 节点将多张参考图(人物、道具、背景)整理成参考序列,交由 LTX 2.3 模型生成视频;需安装“雷控 MSR”扩展及特定 LoRA。 参数设置:参考序列长度设为 65 帧,最终视频长度为 241 帧(约 10 秒),两者不可混淆。 提示词规范:采用 Prompt Relay in Code 编码器;写法需先说明每张参考图职责,再按“初始画面-动作过程-结果状态”顺序描述视频内容。 容量测试: 1 人物 + 1 背景:表现稳定。 2-3 人物:表现良好,第 3 人可能中途进入画面。 4 人物:效果波动,可能出现人物缺失,需多次尝试(抽卡)。 属性组装:成功融合脸部、礼服、机械伞及背景,证明可固定身份并更换服装/道具,但复杂动作(如雨伞旋转)表现不明显。 动作限制: 物体交接:能完成轨迹但细节复刻有偏差。 植物生长:成功展示从种子到开花的完整事件。 失败案例:人物交叉换位未发生;机械环遮挡后人物一致性丢失,推测因训练集缺乏此类内容。 多镜头测试:在中景、近景及过肩镜头切换后,角色视觉身份保持稳定。 💡 结论与建议 适用场景:最适合需要多镜头切换、保持角色一致性的叙事视频创作。 使用建议: 参考图数量控制在 2-3 张核心图,避免过多导致失败。 每张参考图职责需单一明确,留空无用位置。 复杂动作需明确左右位置、顺序及物体归属。 遇到遮挡或换位等复杂交互时,需做好多次生成(抽卡)的心理准备。

博主头像

🎬 我给拍完的 AI 视频加了 63 个机位!手把手教你视角重构|CrossView 深度指南:揭秘“三

🎥 核心观点 CrossView 是一种基于 LTX 2.3 模型的 IC LoRA,允许用户利用已生成的视频作为参考,通过提示词重构虚拟摄像机机位。 该技术并非简单的画面裁切或随机生成,而是基于参考视频重新生成同一场表演,实现视角的自由切换。 提示词采用固定的“三轴格式”,通过控制相机围绕主体的左右移动、整体高度及距离,共形成 63 种组合方法。 建议优先使用官方原词,避免自行创造词汇,以确保生成效果稳定。 ⚙️ 关键事实与论据 模型与参数:使用 LTX 2.3 主模型(1.1 版)及 CrossView LoRA(1.5 版),LoRA 强度推荐值为 0.6 至 1.5。 工作流结构:分为两个阶段。第一阶段根据参考视频生成新摄影角度;第二阶段进行分块放大处理,无论分辨率调多大均会分块处理,并需使用第二组提示词作为内容一致性锚点,防止放大后偏离原视频。 三轴控制逻辑: 左右轴:控制相机围绕主体向左或向右移动,非人物移动或镜像,场景元素会重新组织。 距离轴:控制远近,拉远效果通常比拉近更稳定,拉近有时类似重新裁剪。 高度轴:控制高低机位,低机位增强仰视感,高机位扩大地面占比。 误差累积风险:连续多次生成(串联)会放大上一轮的误差,导致物体比例、细节变形(如凤凰变垂直火焰),因此建议一步生成大角度变化,仅在一步崩坏时才考虑两步串联。 原视频限制:原视频若包含相机运动(如侧向跟拍),会导致方向控制含糊,效果减弱;最佳输入为固定机位、单镜头、主体持续可见的视频。 📝 结论与建议 适用场景:适合宏大场景、复杂运动(如飞天舞者)及需要多视角剪辑的视频制作。 谨慎场景:商业产品描述需谨慎使用,因为改变镜头可能会改变产品细节。 操作建议: 严格遵循三轴提示词格式。 从中等角度开始尝试,逐步调整。 确保原视频为固定机位,主体清晰。 利用 RunningHub 等平台获取最新工作流支持。

博主头像

🎬 Krea2 没有稳定参考图?用 LoRA 解决角色一致性|从数据集到 Turbo 出图:Krea2

🎯 核心观点 Krea 2 模型具备极强的写实感、电影感和细节表现力,但原生仅支持文生图,难以通过提示词维持角色一致性。 若需实现同一虚拟人物在不同场景(如街头、书店、雪地)及不同构图(近景、16:9 大场景)下的稳定呈现,训练 LoRA 是必要手段。 训练目标不仅是生成头像,更是为了支持封面、海报及大场景角色展示,需兼顾身份一致性与场景泛化能力。 📊 关键事实与论据 数据集构建:建议准备 20 至 50 张高质量图片,需包含不同场景、角度、光线和构图。图片需数字命名并对应同名 txt 提示词文件。 训练环境:推荐使用 4090 24G 显卡实例,利用预装好环境、模型及数据集的镜像加速流程。 模型选择:训练底模选用 Krea 2 的 Ro 模型,而非 Turbo 模型。虽然 Turbo 速度更快,但官方解释其不适合作为训练底模,且生成 LoRA 的方式不稳定。 参数设置:训练步数建议在 3000 至 5000 步之间,3000 步通常可获得不错效果;采样间隔设为 250 步。 验证策略:训练完成后,使用 Krea 2 Turbo 模型加载 LoRA 进行验证。LoRA 强度建议设置在 0.75 至 1 之间,测试中 0.85 表现较好。 测试标准:需进行两类测试。一是 3:4 人像测试,验证身份稳定、风格复现及光线变化;二是 16:9 大场景测试,验证动态场景(如奔跑、骑车)下的稳定性。 ✅ 结论与建议 推荐流程:先制作清晰的 Character Sheet 确定人物设定,再生成 20-50 张多样化训练图,确保图文一一对应。 工具选择:新手建议优先使用 AI Toolkit 跑通流程,熟练后可尝试其他工具。 注意事项: 训练收敛速度较慢,步数至少需 1500 步以上,3000 步效果更佳。 由于训练数据侧重面部和发型,情绪范围可能偏窄,复杂表情需额外优化。 在玻璃反射或实验室等复杂场景中易出现重复人像,提示词中需明确加入“没有重复的人物”。 大动作场景可用,但小细节可能需要多次抽卡以获得最佳效果。

已显示 13 / 13 篇