每日签到 地址发布 老王说明书 宣传中心 繁/简
讨论怎么用ai搞涩涩
查看: 3.5W|回复: 89
收起左侧

[硬核教程] MiniMax H3 详细教程

    [复制链接]
跳转到指定楼层
楼主
发表于 2026-8-8 12:33:07 | 只看该作者 |只看大图 回帖奖励 |倒序浏览 |阅读模式

马上注册,结交更多好友,享用更多功能,让你轻松玩转社区。

您需要 登录 才可以下载或查看,没有帐号?免费注册

x
本帖最后由 wulesoicq 于 2026-8-8 14:12 编辑

一开始我听说H3要开源,吹的牛逼,我是不屑一顾。LTX2.3刚出来的时候吹的乌丢乌丢的,结果还不是一坨。结果下载下来玩了几天之后我发现我错了,H3是真的强不说可以挑战Seedance,但绝对可以让我把所有其它开源的视频生成模型删了。


我先简单介绍下这个H3这个模型。这个视频生成框架起始分3部分。


H3-Context-IR(估计不会开源,只能API调用,输入5.80元/百万tokens 输出23.00元/百万tokens)


H3-Base(已经开源,包含2个模型)


H3-Regenerate-2K(未来可能会开源,现在API调用0.3元/秒)

H3-Context-IR 其实可以看成提示词细化的框架,能把我们写的自然语言的提示词按照标准化的格式细化、扩写提示词生成模型更能理解的、更加清晰的指令提示词。
虽然官方给了一个提示词手册,但要自己写提示词还是太麻烦了。
官方发布了Skill,但是没有订阅coding plan的话还是不便宜。
不如用官方的H3-Context-IRAPI接口比较便宜,处理一条提示词也大概只要2、3毛钱。


H3-Base
就是这次开源的两个模型ref2va,fl2va。
fl2va是基本模型,可以用来做基本的文生视频,图生视频。
ref2va是参考生视频,可以参考视频,图像生成视频,也可以根据音频克隆人声,更好的生成台词。
网上有误解这两个模型生成视频的最佳分辨率推荐都是768P 而不是2K。


H3-Regenerate-2K
是更具H3-Base模块生成的视频,和提示词二次采样,生成2K分辨率的视频,和传统的超分放大还是略有不同的,HF上面官方的工作人员说,H3-Regenerate-2K有可能会开源。个人觉得还是不要有太多期望,反正768P分辨率也完全够用了。


配置要求
出乎意料H3的参数只有20B,32G内存+12G显存就能运行,只要能跑的起wan2.2的那么跑H3就毫无压力,而且这次官方开源的是CFG蒸馏版本,虽然没有蒸馏采样步数,但起码要比wan2.2刚出来的时候快的多。
模型选择
魔塔社区就有Comfy Org的官方仓库,而且下载速度不慢,我就不转存到网盘了


注意:
diffusion_models有条件的话就下minimax_h3_fl2va_int8_convrot.safetensors,minimax_h3_ref2va_int8_convrot.safetensors这两个,不要下修剪版。
text_encoders_models有条件就下qwen3vl_32b_minimax_h3_int8_convrot.safetensors

工作流示例
文生视频
Comfyui提前就拿到了H3的权重,所以原生支持还是非常充分的,只要把版本升级到0.31 以上就能完美运行H3模型。
我只简单整理了下官方给的工作流模版。
强烈建议暂时不要使用任何加速节点,包括SageAttention等注意力加速。


模型选择

注意:
H3_M 选fl2va模型
H3_VV 选video_vae
H3_VA 选audio_Vae
Qwen_VL(负责反推和扩写提示词) 选Krea2的clip模型或者ideogram4的clip模型都可以。


在图像加载节点框的空白位置,点击鼠标右键,在下拉菜单选择停用框内节点,就变成文生视频模型
输入简单的提示词就可以了,注意要开启提示词增强。

提示词
第一个镜头:一个中国女孩穿着JK制服在教室拍写真
第二个镜头:女孩坐在课桌上,抚摸自己的头发
第二个镜头:女孩脱掉自己的上衣,露出乳房,乳头清晰可见

示例

文生图主要是看看模型的基础能力,镜头切换,提示词遵循都很准确


图生视频
直接上传首帧图像,或首尾帧图像,简单写提示词
示例1
首帧图

提示词

成品

示例2
首帧图

提示词

成品

示例3
首帧图

提示词

成品



文生视频,图生视频简单好用,萌新小伙伴可以先研究这个工作流。


参考生视频
这是关键点,如果想要制作AI短剧什么都就一定要精通,这种生成视频的方法。
用一句话概括:
就是在指定的场景中,让指定的角色,进行指定内容的表演,说出指定内容的台词。


我用最简化的方式重头带大家做一遍,希望对大家有所帮助
假设有这么一个剧本
一个女孩在城中村的小巷卖淫,一个中年大叔来问价,女孩说50块钱,大叔同意了女孩就跪下开始给大叔口交。
分镜脚本
镜头1:一个女孩站在深夜的小巷,大叔问价:“口一次多少钱”
镜头2:女孩说“50块钱”,然后跪下
镜头3:女孩开始给大叔口交
注意:我这里就用最简单的给大家演示,
如果小伙伴们要玩可以增加的分镜就多了,比如一开始女孩的孤寂落寞的特写,男人和女孩讨价还价的细节,女孩给男脱裤子什么的...
我这里就只做8S视频,所以就简化了。
场景,环境布置的参考图

角色参考图(我们这就不定义男性角色了)

口交视频
注意:我这里不使用任何Lora,你光说口交它不一定能生成,
所以我们给模型一个口交的参考视频,只让模型参考口交的动作和拍摄角度,
如果要加脱裤子等镜头也可以加类似的参考图,这样模型的产出就更稳定。
当然以后Lora丰富了,也可以考虑让模型自己生成试试。

语音克隆
让角色用我们克隆我们上传的语音说台词,这里就不演示了。


简单总结一下,我们的需求就是
图1的女孩站在图2的电线杆旁,一个中年大叔出现问女孩说:“多少钱口一次”,图1女孩说“50块钱”。然后图1女孩跪下双手扶着男人大腿。开始模仿视频1的动作给男人口交。
如果你用Seedance2.0 或者在官方使用H3 那么 这样的提示词就可以了,然后你就等着抽卡吧。
它们都有一套智能体,分析用户的需求然后生成标准给谁的提示词给模型使用。
但我们现在工作才刚刚开始
H3-Context-IR模块没有开源!!
我们生成提示词的办法只有3个
1:使用官方的H3-Context-IR API 来生成提示词,缺点有限制成人内容,优点便宜效果好一条提示词2-3毛钱。
2:用官方给的Skill,来生成提示词,缺点挺贵的,反正我用gpt5.6或者Qwen 3.8 或者K3来生成一次大概就要20-30万token,如果没有订阅的还真玩不起。
3:研究规则和提示词手册,用人脑代替AI,自己写。


我的解决办法,用H3-Context-IR API 帮我们写不会被限制的部分,然后人工补上限制部分。
比如我们让官方帮我们生成
图1的女孩站在图2的电线杆旁,一个中年大叔出现问女孩说:“多少钱口一次”,图1女孩说“50块钱”。然后图1女孩跪下双手扶着男人大腿。


  1. 【subject_definitions】



  2. <Subject 1> is the young girl defined by the two-panel character sheet in <Picture 1>, featuring an extremely thin build, black hair styled in a braided updo, and wearing a white collar with a burgundy bow and gold button, a pink bikini top with white ruffle straps, and pink bikini bottoms with ruffles.

  3. <Subject 2> is the environment in <Picture 2>, a dark, narrow alleyway at night illuminated by a warm yellow streetlight attached to a utility pole on the left, lined with old, worn buildings.



  4. 【summary】



  5. [reference generation] The target video features <Subject 1> standing in <Subject 2>. A middle-aged man approaches her, asks a question, and <Subject 1> responds before kneeling down to hold his thighs with both hands.



  6. 【retention_analysis】



  7. <Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - the girl's extremely thin build, black braided updo hair, white collar with a burgundy bow, and pink bikini with white ruffles are preserved.

  8. <Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the dark, narrow alleyway at night, warm yellow streetlight, utility pole on the left, and old buildings are preserved.



  9. 【detailed_description】



  10. The target video is in a realistic, gritty cinematic style, characterized by high contrast, deep shadows, and the warm, localized glow of street lighting on textured surfaces.



  11. [Shot 1] The shot opens with a medium-wide framing of <Subject 2>, a dark, narrow alleyway at night illuminated by a warm yellow streetlight attached to a utility pole on the left, lined with old, worn buildings. Standing directly beneath the pool of yellow light next to the weathered utility pole is <Subject 1>. She is clearly recognizable by her extremely thin build, black hair styled in a braided updo, white collar with a prominent burgundy bow and gold button, pink bikini top with white ruffle straps, and matching pink ruffle bikini bottoms. The harsh overhead light casts deep shadows across her pale skin and highlights the textures of the damp asphalt. A middle-aged man (S1), wearing a dark, casual jacket, steps into the foreground from the right side of the frame. He turns his body slightly toward the girl, establishing a tense spatial relationship in the confined alley. Ambient night sounds and the distant hum of the city establish the quiet atmosphere. The middle-aged man (S1), his voice gruff and direct, asks, <d>[Chinese] 多少钱口一次?</d> As he speaks, he keeps his hands in his jacket pockets, looking down at the girl. After his question, the faint sound of a chilly evening breeze passes through the narrow corridor.



  12. [Shot 2] At 00:02.500, the shot cuts to a tighter medium angle focusing on the interaction between the two figures. The warm yellow light continues to illuminate <Subject 1>'s face and upper body as she looks up at the man. Maintaining a calm expression, <Subject 1> (S2), her voice soft but clear, replies, <d>[Chinese] 50块钱。</d> Immediately after her final word ends, her lips close into a firm line and her gaze shifts downward as a visible physical transition begins. She bends her knees and drops smoothly down onto the rough, dark pavement of the alleyway. Her white collar and pink bikini contrast sharply with the grim environment as she completes the downward motion. Once on her knees, she reaches out both arms and firmly grasps the middle-aged man's thighs with her hands, pressing her palms against the dark fabric of his trousers. Her grip is steady, anchoring her position at his feet. The man remains standing still, his posture stiffening slightly in response to the physical contact. The camera slowly pushes in on the kneeling girl and the man's legs, emphasizing the drastic height difference and the uncomfortable dynamic between them. The ambient city hum continues steadily beneath the quiet tension of the scene until the video ends.



  13. 【overall_soundscape】



  14. The target video features a quiet, tense urban atmosphere with ambient night sounds, a distant city hum, and a faint evening breeze, interrupted only by the clear, localized dialogue and the subtle rustle of clothing during physical movement.



  15. 【non_diegetic_music】



  16. N/A
复制代码

然后再补上口交部分,也就是参考视频的那部分提示词

  1. 【subject_definitions】

  2. <Subject 3> refers to the oral sex scene in <Video 1>. Only the sequence of actions is retained.

  3. 【summary】

  4. [reference generation] The target video features <Subject 1> standing in <Subject 2>. A middle-aged man approaches her, asks a question, and <Subject 1> responds before kneeling down to hold his thighs with both hands.<Subject 1>Start using <Subject 3>'s posture and movements to give the man a blowjob.

  5. 【retention_analysis】

  6. <Subject 3>(appears in [Shot 3]): refers to the oral sex scene in <Video 1>. Only the sequence of actions is retained.

  7. 【detailed_description】

  8. [Shot 3] At 00:04.500

  9. <Subject 1>Start using <Subject 3>'s posture and movements to give the man a blowjob.
复制代码


限制部分的提示词添加合并进去就可以了,这样就大幅减轻了工作量。当然你如果2,3毛钱也不想花,那么就可以纯手工写,其实也不是太困难的事,只是有点费时间。
示例

当然了有很多小伙伴不想做什么AI短剧,只想搞点换装舞蹈,换人舞蹈什么就行了。
其实我也是这一类,我连真人的短剧都不想看更不想看什么AI短剧了,我一直觉得AI短剧挺傻逼的。
只是想搞点自己实用的小视频爽一下,那么我特别制作了简易版的参考视频生成工作流。
把2套提示词模版固定在里面了,可以完成服装替换和人物替换,虽然这对H3来说有点大材小用,但用起来简单方便,不用写一个字的提示词。
人物替换
原视频01

上传素材

示例

原视频02

上传素材

示例

服装替换

服装1

示例

服装2

示例

提示大家可以参考下,这个工作流里的提示词模版和思路,制作更多单一功能的工作流的,比如换头,换头发,换背景什么的,好了希望大家玩的愉快。
帖子一般都是我在等视频生成的时候写的 有什么地方写错了 还请各位小伙伴指正。

收藏收藏641 转播转播 分享淘帖 赞80 踩
把本文推荐给朋友或其他网站上,有用户注册并在论坛充值消费,您将获得多层会员奖励.
回复

使用道具 举报

来自 2#
 楼主| 发表于 2026-8-8 12:57:14 | 只看该作者
MiniMax基础工作流就是加了个图像反推的节点
MiniMax替换工作流也是一样
参考视频工作流,我就是用的官方的一点都没改,关键是提示词.

链接: https://pan.baidu.com/s/1sdxCunOjNV2ehhBw5ALpsQ?pwd=k7zw 提取码: k7zw


回复 支持 反对

使用道具 举报

推荐
发表于 2026-8-9 21:46:16 手机版 | 只看该作者
太六了,等我攒一年钱买台电脑
回复 支持 1 反对 1

使用道具 举报

推荐
 楼主| 发表于 2026-9-2 20:17:10 | 只看该作者
咔咔开咔就是 发表于 2026-9-2 04:16
求楼主解救,没招了,不知道哪的问题

H3_C 选qwen3vl_32b_minimax_h3_int8_convrot.safetensors
回复 支持 1 反对 0

使用道具 举报

推荐
 楼主| 发表于 2026-8-12 02:52:57 | 只看该作者
叶云礼 发表于 2026-8-12 01:37
老哥要不要整一个h3导演台工作流呀,能多段拼接一次性出超长视频

关键是提示词,现在的问题是本地qwen3.6 27B 运行官方的Skill经常乱来,等qwen3.8 27B开源了后,我看看能力,如果够强的话做个提示词增强才是关键,视频长短是次要的,重要的是能不能精确参考,什么时候参考哪个视频的运镜,什么时候参考服装,动作,这些都要靠复杂的提示词
回复 支持 1 反对 0

使用道具 举报

推荐
 楼主| 发表于 2026-8-10 11:56:02 | 只看该作者
MMM1027 发表于 2026-8-10 11:48
谢谢楼主.替换成功了.不过多人物的参考视频.老是会一起替换.偶尔也会只替换衣服.不知道是我提示词 ...

多人物参考生视频,你可以用使用官方的H3-Context-IR API 来生成提示词,

回复 支持 1 反对 0

使用道具 举报

推荐
发表于 2026-8-10 11:12:06 | 只看该作者
支持一下大佬的技术贴,咬牙升级一下内存再来研究
回复 支持 1 反对 0

使用道具 举报

推荐
发表于 2026-8-8 22:57:39 手机版 | 只看该作者
牛啊,支持,终于来了
回复 支持 1 反对 0

使用道具 举报

地板
发表于 2026-8-8 23:26:15 | 只看该作者
厉害了,如果能像B站作者一样是整个包就完美了,
回复 支持 反对

使用道具 举报

5#
发表于 2026-8-9 00:37:30 | 只看该作者
不错不错,已经激发我深深的学习欲望了。
回复 支持 反对

使用道具 举报

6#
发表于 2026-8-9 00:55:21 | 只看该作者
下载的模型越来越多了,专门的2t固态也不够用了,太难了
回复 支持 反对

使用道具 举报

7#
发表于 2026-8-9 01:43:16 | 只看该作者
无言以对 膝盖已经跪下来了
回复 支持 反对

使用道具 举报

8#
发表于 2026-8-9 12:58:50 | 只看该作者
已有工作台整合包了 速度比UI稍慢
回复 支持 反对

使用道具 举报

9#
发表于 2026-8-9 14:55:58 | 只看该作者
网盘里的东西看得一头雾水,小白只能等其他大佬的整合包了
回复 支持 反对

使用道具 举报

10#
发表于 2026-8-9 15:54:45 | 只看该作者
问一下这个模型哪里下载
Qwen_VL\qwen3vl_8b_Instruct-abliterated-BF16 .safetensors
回复 支持 反对

使用道具 举报

11#
 楼主| 发表于 2026-8-9 16:02:05 | 只看该作者
tpy2 发表于 2026-8-9 15:54
问一下这个模型哪里下载
Qwen_VL\qwen3vl_8b_Instruct-abliterated-BF16 .safetensors

Krea2的clip模型或者ideogram4的clip模型都可以
回复 支持 反对

使用道具 举报

12#
发表于 2026-8-9 16:38:52 | 只看该作者
这个替换的提示词写的好专业啊
回复 支持 反对

使用道具 举报

14#
发表于 2026-8-9 22:36:18 | 只看该作者
有工作流吗
回复 支持 反对

使用道具 举报

15#
发表于 2026-8-10 00:16:15 | 只看该作者
电脑太差玩不转
回复 支持 反对

使用道具 举报

16#
发表于 2026-8-10 09:56:14 手机版 | 只看该作者
krea2跑提示词经常跑不出来,换qwen3模型找不到网址
回复 支持 反对

使用道具 举报

18#
发表于 2026-8-10 11:23:12 | 只看该作者
笔记本16g显卡5080,32g运行内存,下载minimax_h3_fl2va_int8_convrot.safetensors【34.04g】可以吗
回复 支持 反对

使用道具 举报

19#
发表于 2026-8-10 11:48:01 | 只看该作者
谢谢楼主.替换成功了.不过多人物的参考视频.老是会一起替换.偶尔也会只替换衣服.不知道是我提示词有问题还是模型问题.



回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 免费注册
点击进行验证

本版积分规则

我们不生产资源,只做资源的搬运工。

广告合作-tags标签-app下载-Archiver-小黑屋-