如何更好地使用 Minimax H3 - 掌握提示词撰写技巧,生成你想要的视频

摘要

想要提升Minimax H3的创作效果?本文深入解析Minimax H3的提示词撰写核心技巧,从构思到指令优化,助你精准掌控AI视频生成过程,打造高质量视频内容。

如何更好地使用 Minimax H3 - 掌握提示词撰写技巧,生成你想要的视频

1. 撰写提示词的友好建议:

掌握提示词撰写技巧,在 MiniMax H3 生成你想要的视频。


1.1 整体公式

完整提示词 = 参考素材说明 + 核心创意 + 画面过程说明.


1.2 四个要素如何描述

参考素材说明
告诉 H3 你上传的每个素材是干什么用的。写清素材编号:按你上传的顺序,比如@图片1,@音频2,@视频3写清每个素材的用途:人物参考(锁定脸/形象)/物体参考(锁定物体) / 场景参考(锁定场景)/关键帧(锁定帧,如果有首帧尾帧需求明确提出) / 音色参考(锁定音色)/故事版(根据故事版分镜生成镜头内容)/风格参考(根据图片的风格,生成类似的风格内容)/构图参考(根据图片中物体构图,生成对应的构图)/音频复用(生成视频的音频直接复用参考音频素材)/音频部分复用(生成视频某个声音轨道/某个时间段部分复用参考音频素材) / 动作参考(锁定动作)/运镜参考(锁定运镜)/视频编辑(对视频某个内容进行增删改),以及其他要求也可按需写明。没有上传素材时整段跳过示例:@图片1 提供了xx角色的形象(如果有多个角色,需要能指代清楚),@视频2提供了动作参考。如果素材中有非常想要保持的特征,建议明确写出来,这样可以让一致性更好。在音频复刻/部分复刻中,如果对于人声对白内容/唱歌歌词内容的保持有较高的要求,强烈建议补充具体歌词文本内容。比如@音频1 作为目标视频的音频复刻素材,具体歌词是:“ABCDEFGHIJKLMN”。
核心创意
用一句话锁定全片信息,必须包含:主体:谁/什么(人/物/动物/其他)地点:在哪里事件:在做什么题材/风格:什么调性(写实/动画/电影感/广告片/纪录片……)特殊风格列举:赛博朋克/霓虹灯美学/涂鸦风 等特殊运镜:要不要特殊镜头(航拍/一镜到底/慢动作……)默认会切镜运镜风格写清即可;注意环绕运镜,建议用truck left+pan right 或者 truck right+pan left,而非直接说环绕运镜 切镜风格普通切镜(cut)叠化切镜(fade)随着节奏卡点切镜快切如果任何元素有直接和引用素材的关联,都欢迎用户用@图片1/@音频1/@视频1等等方式强调下。 示例:一位穿汉服的年轻女子(@图片1)在樱花纷飞的庭院里舞剑,古典国风,电影质感,一镜到底。
画面过程说明
按时间轴或故事线分段写,每个分镜/时间段包含两部分:想要(画面里要出现什么):画面景别+内容 + 运镜 + 动作 + 台词 + 音效以切镜shot作为时间戳的分段。每个shot内部写好景别,具体内容,shot内部运镜,人物台词,音效等这个shot内的内容注意台词的长短尽量和镜头长短对齐 (这个得强调下,很多口型问题会来自于这个)如果一句台词跨shot,可以用接着上个shot继续说这样的描述表明是跨shot的台词对白 如果任何元素有直接和引用素材的关联,可用@图片1,@音频1 等等方式强调下。如果你希望视频中出现具体文字、Logo、标题、标语、按钮文案等,一定要把文字原文写出来。 例如:画面中出现英文 :“H3”。 或者:手机屏幕上显示标题:“AI Video Creation”,按钮文字为:“Start Now”。不想要(视频里不要出现什么)不想要背景音乐时,需明确写明,比如不希望视频里出现背景音乐,建议在提示词最后明确写:非叙事性音乐:N/A 或者使用英文格式:"non_diegetic_music": N/A 不要额外添加背景音乐。尽量少写比喻句,多写看得见的画面写 H3 提示词时,建议尽量使用具体、直接、可视化的描述,少写需要“意会”的句子。因为 H3 更擅长理解明确的画面指令,而不是抽象比喻。如有台词,必须明确具体内容,比如一位穿汉服的年轻女子说:“你来了,剑等你好久了。”示例(需要再调整下例子):0-3 秒:全景,女子(@图片1)从画面左侧缓步走入樱花庭院(@图片2),背景虚化,没有对白,只有脚步声。 3-8 秒:切镜到女子(@图片1)的中景,她拔出长剑(@图片3),缓缓起势,樱花瓣从树上飘落。镜头推进。 8-12 秒:切镜到特写,剑光一闪,慢动作,樱花被剑气激得四散。 非叙事性音乐:N/A


1.3 镜头怎么拆

H3 有基础的分镜能力,以及 H3 对于切镜点遵从较强,如果你想要更好的生成,以下有一些建议:
  • 台词:台词的长短和画面变化内容需要合乎每个shot的长短逻辑,尽量不要出现一个3s shot说很大一段话的情况,会非常影响效果H3 能够响应跨shot (J-cut,L-cut)的台词响应,只要明确写出一句台词跨了哪些shot就可以响应! 对于一个shot而言如果是画面内说话人角色,需写清楚是哪个角色说的,如果是画面外说话人,写清楚是画外说话人。如果发生了画内外因为切镜造成的转化的情况可以明确写出来,比如一个比较复杂的例子:一个画外音响起说:Wake up Wake up。之后切镜到一个中年妇女的近景,她是画外音的主人,她继续说道:It‘s time to go to school !
  • 切镜一致性保持:切镜的时候可明确写出切镜到什么景别,具体主体是之前的哪个角色,有助于跨镜头一致性的保持


1.4 三类模式生视频,提示词分别怎么写

上传多模态素材融合(多模态参考)
你可以同时上传:人物图 + 动作视频 + 场景图 + 音乐。每个素材都要写清它的角色:@图片1 → 人物参考(锁脸)@视频1 → 动作参考(锁动作)@音频1 → 节奏/情绪参考示例:@图片1 是人物参考(锁这位女子的脸),@视频1 是动作参考(用里面的舞剑动作),@音频1 是情绪参考(古风配乐)。让这位女子在樱花庭院里按视频里的动作舞剑。
上传图片生成视频(图生视频)
只上传 1 张图:说清楚是首帧(视频开头画面)还是尾帧(视频结尾画面)上传 2 张图(首+尾帧):H3 不会自动加切镜,只补两帧之间的动作、光影、声音示例:@图片1 是首帧参考图:女子持剑站在樱花树下。让她从持剑起势到舞剑完毕,自然衔接,不要切镜。
纯文字生成视频
不依赖任何参考素材,直接根据你的文字提示词建立主体、场景、动作。这种模式:文字描述要更具体(主体外观、场景细节、动作描述都要写清)多用「大全景交代空间 + 中景承载动作 + 特写强调细节」的分层写法示例:写实自然纪录片风格,电影级真实光影。清晨的薄雾中,在广阔的湿地芦苇荡里,一只优雅的白鹤单腿站立在浅水中,缓慢转头看向镜头。柔和的逆光,雾气在光束里飘动。


1.5 容易踩的坑

常见问题怎么改
只写一段话没分段按 3 段公式拆开写
素材上传了但没说用途补一句「@图片1 是 XX 参考」
想用音乐但说「不要 BGM」这两个矛盾,要么删一个,要么分场景写
想一镜到底但写了很多分镜全文保持一段情节描述,删掉【镜头 N】结构
想要主角脸一致但没传图一定要上传人物参考图,并标注「人物参考」
提示词太短(H3 没素材可参考时)至少写出主体外观 + 场景细节 + 动作 + 风格


扫描二维码

扫描二维码在手机上阅读

文章海报