博主头像

👤 同一博主

按发布时间查看该博主的全部资讯要点

查看全部博主 →
博主头像

🎬 MiniMax H3 Turbo 全流程指南:四步采样,2分钟出片与防闪烁工作流

🚀 核心观点 MiniMax H3 Turbo 方案通过“四步采样”实现高效视频生成,约2分钟即可产出5秒(120帧)视频。针对动作幅度不同的场景,推荐两种工作流:平缓动作直接使用加速 LoRA;剧烈动作或易闪烁场景采用“两段式采样”以平衡速度与稳定性。 📊 关键事实与评测数据 基础性能对比:在 RTX 4090 (24G) 显卡上,原始图生视频工作流耗时约8分29秒;使用加速 LoRA 后缩短至1分38秒,效率提升显著。 LoRA 横向测评:测试了 KJ、LARIF、JBUFF 三组模型,场景设定为清晨花店整理鲜花(含对话)。 KJ (V0.1):画面无崩坏,但音频存在电子杂音,且声音以画外音形式出现,口型不同步。 LARIF (V4 STAB 600 EMA):音频较干净,但仍为画外音,人物嘴巴未同步说话。 JBUFF:专为 int8 简质模型优化(权重设为0.75)。表现最佳,动作自然,声音干净,口型与声音关系合理。厨房场景测试也证实了其稳定性。 闪烁问题解决方案:四步 Turbo 在处理剧烈动作(如船上丢明信片)时会出现画面闪烁。 🛠️ 工作流配置与建议 平缓动作工作流(推荐 JBUFF LoRA) 适用场景:站立、轻微转身、整理物品、走路、做饭等温和动作。 关键设置:使用 int8 简质模型;开启 Sage Attention;采样步数设为4;采样器改为 Euler;将 BasicGuider 替换为 CFGGuider(CFG设为1.0);通过 Zero Out 节点处理负向条件。 两段式采样工作流(解决闪烁) 适用场景:动作快、变化剧烈或需要高稳定性的复杂场景(如镜面反射校正、御剑飞行)。 核心逻辑:将 Sigma 分为两部分。前两步使用完整 H3 模型构建基本结构;后四步接入加速 LoRA 进行细化,并禁用 Noise。 效果:虽速度略慢于纯四步方案(仍约2分钟),但能有效防止闪烁,保证动作与镜头关系的完整性。

博主头像

🎬 从 11 分钟缩短到 3 分钟!实测 MiniMax H3 三重加速节点叠加效果

🚀 核心观点 通过叠加 SoulAttention、SageAttention 和 EasyCache 三种加速技术节点,可显著缩短 MiniMax H3 模型的生成时间。实测表明,该组合方案能将文生视频耗时压缩至约一半,图生视频及参考视频生成耗时甚至可缩减至原来的三分之一,且画面质量无明显降低。 📊 关键事实与论据 加速原理简述: SoulAttention:动态识别图像重点与非重点区域(如人脸 vs 背景),优化注意力计算资源分配。 SageAttention:采用更适合显卡的低精度计算方式,提升运算效率。需注意 `allow compile` 选项:本地运行建议开启以利用编译后的速度优势;云端环境因每次重新分配资源,建议设为 False 以避免重复编译耗时。 EasyCache:针对视频帧间的连续性,缓存不变部分避免重复计算。 实测数据对比: 文生视频:普通工作流耗时 7分12秒,加速后降至 3分34秒(速度约提升一倍)。 图生视频:普通工作流耗时 10分49秒,加速后降至 3分19秒(时间缩短至约三分之一,提速3.2倍)。 参考生成:普通工作流耗时 8分05秒,加速后降至 3分41秒。 参数设置建议: SoulAttention:Tau 设为 1.2(保守值),Start/End Percent 分别设为 0.2 和 0.9(首尾20%及最后10%不参与加速)。 EasyCache:Reuse Threshold 设为 0.3,启用范围同样为 0.2 至 0.9。 💡 结论与操作指南 适用性:该方案适用于文生视频、图生视频及参考视频生成。 前置条件:需将 ComfyUI 更新至最新版(EasyCache 已原生支持),并通过 ComfyUI Manager 安装 SoulAttention 扩展,或克隆项目至 Custom Nodes;SageAttention 需安装 KJ 提供的 ComfyUI-KJ-Node。 注意事项:加速可能导致细微的动作逻辑变化(如桅杆初始状态不同),但整体质量保持较高水平。工作流已构建于 Running Hub 平台供参考。

博主头像

🎬 原生对口型+动作迁移?极限压测最强开源全模态模型 MiniMax H3

🎬 MiniMax H3 模型深度评测与实战指南 💡 核心观点 MiniMax H3 是目前开源领域备受关注的全模态视频生成模型,其最大亮点在于能够同时生成高质量的视频画面与同步音频(包括环境音、动作音效及对口型)。该模型在物理规律理解、多镜头叙事以及复杂动作迁移方面表现优异。通过 ComfyUI 工作流配合结构化提示词和参考图技术,用户可以实现从“文生视频”到“图生视频”再到“多源参考生成”的多样化创作。 📊 关键事实与技术参数 模型版本与格式:当前 ComfyUI 支持的是 H3 Base 版本,主要生成 768P 分辨率视频。工作流中推荐使用 `int8` 量化版本的模型以平衡性能与效果。 核心组件: 主模型:分为 `FL2V`(负责图生/文生视频)和 `Reference to Video`(负责参考生成)。 编码器:使用千问 VR 32B 文本编码器,以及专用的音频和视频 VAE。 硬性约束条件: 帧率:必须固定为 24 fps。 帧数公式:总帧数需满足 “17的倍数 + 5” 的规则(例如生成特定秒数时需通过此公式计算总帧数)。 采样设置:推荐使用特定的 Sampler,采样步数为 20 步。 🛠️ 工作流与操作技巧 1. 提示词结构化策略 无论是文生视频还是图生视频,提示词的写法对结果影响巨大。建议采用 “五块式” 结构: 视觉风格 时间轴动作(最关键):明确标注动作起止时间(如 0-2秒、2-3.5秒),详细描述每个时间段的具体行为。 镜头语言 声音描述 限制条件 对比测试结论:普通提示词仅包含人物和场景,导致动作关系松弛;而使用结构化时间轴提示词后,动作顺序、镜头关系及叙事逻辑显著增强。 音频对齐:模型具备强大的声音对齐能力,如金属摩擦声、点击声等能精准对应画面中的可见动作。 2. 图生视频(Image-to-Video) 首尾帧控制:支持接入 `First Frame` 和 `Last Frame` 图片以控制起始和结束状态。 一致性要求:参考图中的人物特征需与提示词描述保持一致。 物理模拟能力:模型能理解局部物理变化,如手掌擦拭水汽玻璃时,清晰区域随手部移动逐渐扩大;牛奶注入咖啡时,液面升高、颜色混合及冰块状态均符合物理守恒逻辑。 3. 参考生成(Reference Generation) 多源输入:支持同时接入人物、服装、道具、环境等多张图片。 关键参数 `reference image size`: Match:将参考图缩小至接近目标视频像素面积,Token 少,速度快,但人物一致性较弱。 Max:尽量保留原始细节,速度慢,但人物特征(如项链、发色)一致性更强。 Character Sheet 优势:使用包含多视角的角色设定图比单张正面照更能保证转身或全身动作时的特征稳定性。 职责分配:在多参考图测试中,需通过提示词明确每张图的职责(身份优先 > 服装道具 > 环境),避免构图直接复制。 🚀 高级应用与结论 多镜头叙事与动作迁移 分镜控制:通过在提示词中使用 `short1`, `short2` 等标签,可实现多镜头切换的压缩叙事(如物品滑落、追逐、接住物品的连续场景)。 原生对口型:使用 `` 标签指定语言(如 Chinese),模型能生成准确的中文发音与口型,且背景音(如倒茶声)不会覆盖对白。 动作迁移:可将一段视频中的动作序列(如试穿风衣的完整过程)迁移到另一张人物参考图上,保留目标人物身份的同时复现复杂动作顺序。 总结 MiniMax H3 是一款真正具备实用价值的全模态开源模型。其优势在于原生音频同步、首尾帧控制以及多模态参考生成。虽然对提示词的结构化程度和参数设置(如帧数公式)有较高要求,但通过合理的工作流配置(如在 RunningHub 上获取最新工作流),创作者可以克服技术门槛,实现高一致性和强叙事性的视频内容创作。

博主头像

🎬 Krea 2 迎来重磅升级!v1.2 实测:不仅能换脸换头,还能完美匹配角色表

🎯 核心观点 Krea 2 Identity Edit 1.2 版是目前最强大的 Krea 2 图片编辑模型,相比 1.1 版使用价值更强。 该版本补全了人物编辑功能,支持换脸、换头、换人及局部增强,并新增 Mask 功能和角色列表支持。 功能支持不等于每项都稳定,部分效果可能需要多次尝试(抽卡)才能获得最佳结果。 📊 关键事实与论据 功能升级: 支持单图编辑和多图参考编辑,可精确控制换脸(仅五官)、换头(含刘海)或换人(含发型、服装)。 新增 `reference boost` 参数,用于控制参考图外观约束强度。测试显示数值设为 4 时,脸部、发型及服装与参考图接近度最佳;数值 1 时身份特征突出但细节偏差大,数值 12 时提升不明显。 新增 `reference boost mask`,其作用不同于输入遮罩,而是通过增加特定区域的注意力强度来增强一致性。测试表明,当 `reference boost` 设为 4 时,Mask 能显著提升人脸一致性;若 `reference boost` 为 1,Mask 几乎不起作用。 支持角色列表(Character Sheet)作为参考,可生成包含正面、四分之三侧面、侧面和背面的 2x2 视图,用于保持多视角下的人物身份稳定。 技术参数与设置: 工作流基于 ComfyUI 构建,使用 Krea 2 Turbo 模型(FP8 版本)。 文本编码器建议使用 Qwen 3 VL 或 Qwen 2.1 VL,因为它们是视觉模型,能理解参考图片。 关键节点包括 `create tooledit model patch`(注入参考图信息)和 `create to edit grounded in code`(结合编辑指令与参考图的文本编码器)。 参考图类型可选 `fit`(自适应,保留更多原始信息)或 `crop`(裁切,适合近景),`fit` 在保留服装等细节上表现更强。 采样设置:使用 Turbo 模型时,采样步数建议为 10,CFG 设置为 1.0。 测试结论: 在双人场景编辑中,提示词无需过长,只要准确定位人物位置即可,详细提示词并未表现出明显优势。 生成角色列表时,建议去除背景以减少干扰,且分辨率不能太低,以保证拆分后各视角图片的比例和清晰度。 视觉编码器(VE)对比中,Qwen 2.1 VL 略优于 Qwen 3 VL,但差异不实质,用户无需过度纠结。 💡 结论与建议 适用场景:适用于需要高精度人物一致性保持的图片编辑任务,如角色设计、多视角生成及复杂场景的人物替换。 操作建议: 默认将 `reference boost` 设置为 4 以获得平衡的效果。 若需保留参考图的大量外观信息(如服装),优先选择 `fit` 模式;若侧重面部近景,可尝试 `crop` 模式。 使用 Mask 功能时,务必配合较高的 `reference boost` 值(如 4)才能发挥增强一致性的作用。 生成角色列表时,保持背景简洁,确保分辨率足够高,以便后续作为高质量参考图使用。 风险提示:部分功能(如 Mask 和角色列表)的效果可能受随机性影响,需多次生成以筛选最佳结果。

博主头像

🎬 AI 视频终于有“记忆”了!实测 MSR V2:从种子到开花的精准逻辑控制

🎯 核心观点 MSR V2(Multi Subject Reference)技术实现了视频生成的“记忆”功能,能精准控制从种子到开花等复杂逻辑事件,而非简单堆砌画面元素。 该模型支持多主体参考,能在镜头切换后保持人物发型、服装及身份的高度一致性,适用于叙事视频制作。 相比 V1 版本,V2 在整体效果、身份保持及多镜头连贯性上有显著提升。 📊 关键事实与论据 技术架构:MSR 节点将多张参考图(人物、道具、背景)整理成参考序列,交由 LTX 2.3 模型生成视频;需安装“雷控 MSR”扩展及特定 LoRA。 参数设置:参考序列长度设为 65 帧,最终视频长度为 241 帧(约 10 秒),两者不可混淆。 提示词规范:采用 Prompt Relay in Code 编码器;写法需先说明每张参考图职责,再按“初始画面-动作过程-结果状态”顺序描述视频内容。 容量测试: 1 人物 + 1 背景:表现稳定。 2-3 人物:表现良好,第 3 人可能中途进入画面。 4 人物:效果波动,可能出现人物缺失,需多次尝试(抽卡)。 属性组装:成功融合脸部、礼服、机械伞及背景,证明可固定身份并更换服装/道具,但复杂动作(如雨伞旋转)表现不明显。 动作限制: 物体交接:能完成轨迹但细节复刻有偏差。 植物生长:成功展示从种子到开花的完整事件。 失败案例:人物交叉换位未发生;机械环遮挡后人物一致性丢失,推测因训练集缺乏此类内容。 多镜头测试:在中景、近景及过肩镜头切换后,角色视觉身份保持稳定。 💡 结论与建议 适用场景:最适合需要多镜头切换、保持角色一致性的叙事视频创作。 使用建议: 参考图数量控制在 2-3 张核心图,避免过多导致失败。 每张参考图职责需单一明确,留空无用位置。 复杂动作需明确左右位置、顺序及物体归属。 遇到遮挡或换位等复杂交互时,需做好多次生成(抽卡)的心理准备。

已显示 5 / 5 篇