深度横测完H3、Seedance系列,结果有点意外...(附7个超高质量提示词)

简介: H3和Seedance该怎么选?看完这7个硬核场景你就有数了。

大家好,我是袋鼠帝

这个月是视频模型的爆发期,前有Minimax H3开源,后有字节把Seedance2.0升级到Seedance2.5。然后又是阿里放出Wan3.0,好像很少有一个月更新三个视频模型的盛况。

于是我又猛猛肝,连写了4篇视频相关的文章,也总结沉淀了一些包括AI短剧和电影级视频的玩法。

然后我看了一下,评论区很多朋友在问这些新的视频模型,到底选哪一个比较好?

其中提到最多的还是,H3和Seedance的模型。

那我今天就先给H3和Seedance做一个横测。主要从成本效果,以及在7种经典场景里面的表现,评测一下它们的能力。

这次参与测评的模型包含:Seedance2.5、Seedance2.0 fast、MiniMax H3。

我用下来,个人感觉H3目前还只够跟Seedance2.0 fast比一比,所以这篇主要是它俩的横测。

我其实也想一次性多测几个模型,但是视频模型成本有点高啊,经费燃烧比Agent还快。有点顶不住。所以就先测他们了,如果大家对这个系列感兴趣,可以多多三连,让我知道,后续我可以多出别的视频模型横测😄~

ok,话不多说,我们直接开始!

PS:最后会综合成本、效果给大家一些建议~

1.仿真人微表情控制与表演\

参考素材

视频提示词

人设女性:年轻漂亮,长发披肩,坐在出租车后排。角色状态:与男友分手告别,表面强撑微笑、内心悲伤压抑,最终情绪崩溃嚎啕大哭。场景出租车内部的后排车厢作为空间环境参考,前排副驾驶空位(前景局部失焦虚化);侧车窗与后车窗均被雨水打湿;车窗外为城市街道夜景、霓虹灯光、淅淅沥沥的小雨。画面风格真人实拍质感的青春恋爱电视剧,现代都市写实服化道,细腻情感戏审美,情绪戏节奏克制。影调车内整体偏暗,窗外城市夜景与霓虹灯光透过雨打车窗,在车内形成流动的彩色光斑与明暗切片,勾勒女性面部轮廓与长发边缘;车窗玻璃上雨珠反光;夜景冷调为主,霓虹光斑冷暖交织。全局约束无字幕、禁止生成字幕。画面内容分镜 1,0s-6s,车内中景,固定机位,摄像机位于前排副驾驶位置朝后方拍摄;前景左下方为副驾驶空座椅背局部(失焦虚化),女性位于画面右侧三分线位置。她侧着脸望向右侧车窗外,轻咬下唇,微笑着与窗外人道别,窗外站着一名身穿灰色夹克黑色牛仔裤的男性,透过车窗只能看见男性的局部身体:对白:女性(轻咬下唇,微笑):「就这样,不用送了。」随后她转头面向镜头,对前排司机说:对白:女性:「司机,开车。」说完她不经意地带出一声压抑的细微啜泣,随即轻轻舒了一口气,脸上仍保持着刚才的微笑。出租车随即启动,车身轻微震动一下,车辆起步向前开动,窗外男性朝着车窗挥手再见(局部入画),男性与窗外雨幕与霓虹灯光快速向后掠过。音效:淅沥雨声打在车顶与车窗,城市夜晚低缓的环境底噪;对白期间人声清晰突出;一声压抑的细微啜泣;轻舒气声;发动机启动声与车身轻微震动;轮胎碾过湿路面的起步声。分镜 2,6s-15s,切换车内后排近景,手持拍摄,轻微仰拍,镜头随行驶中的车身轻微晃动;焦点在女性肩部以上正面,她背后隔着被雨打湿而模糊的后车窗,城市街景与霓虹灯光逐渐远去。一开始女性脸上仍带着微笑,没有皱眉也没有哭,慢慢地她开始轻微皱起眉头,小幅摇了摇头,像是反悔刚才说出口的话;接着她的嘴角微微下压,抿紧双唇,眼眶开始泛红;她稍稍仰起头试图忍住,眼神有些游离地瞥向旁边车窗外;接着她终于再也压抑不住 —— 嘴角明显下垂,眉毛内收收紧,鼻子开始抽搐,眼神黯淡,眼眶湿润,泪水开始流出;然后她垂下头、微微蜷缩着肩膀,随即猛然仰头,嚎啕大哭,一边哭一边抬手擦去脸上止不住的泪水。整段为逞强微笑→压抑情绪→悲伤外泄→情绪大爆发的连续情绪变化,一镜到底。音效:雨声持续;行驶中发动机低鸣与轮胎碾过湿路面的沙沙声;呼吸渐重、吸鼻声;压抑啜泣转为放声大哭;手背擦拭泪水的摩擦声与衣料声。全局配乐雨夜分手情绪戏(15s 配乐轨,无歌词)0-6s 无BGM,只保留对白和环境声;6-8s 微笑→轻微皱眉 | 钢琴单音/两音动机从雨声里渗出,极弱 pad 垫底,像回忆浮上来;8-10s 摇头反悔→抿唇→眼眶泛红 | 钢琴变叹息式下行音型,大提琴长音进入;10-12s 仰头忍泪→眼神游离 | 小提琴组加入,和声加厚,钢琴分解和弦铺开;12-13.5s 嘴角下压→鼻翼抽动→泪落 | 情绪临界:弦乐揉弦+力度加强,钢琴和弦加重;13.5-15s 垂头蜷缩→仰头嚎啕大哭 | 段落峰值:弦乐齐奏主题,钢琴八度重音。

Seedance 2.5我用了很多次了,就是断档领先,提示词遵循度非常高。

角色表演细节到位,角色的皮肤、毛发质感不油腻,整体画面调色和构图具有电影质感,这段分手戏中女生的表情与情绪从 逞强微笑 → 压抑情绪 → 悲伤外泄 → 情绪大爆发 的连续情绪变化处理得很好。

PS:指令遵循真的非常强,我感觉很多人说它不如Seedance2.0好用,可能是因为还没适应新模型的提示词写法吧🤔。

Minimax H3/Seedance 2.0 fast

看下来两者对于仿真人角色参考图的还原度各有不足,H3 的角色皮肤、毛发和衣服会明显有些塑料感。

2.0 fast 虽然没能完全精准的还原参考图的角色面部,但看起来更加真实,情感切换也更丝滑,自然。在微表情控制上2.0 fast会更细腻一点。

(不过这些不属于穿帮镜头,比较难靠抽卡或优化提示词和参考图来解决)

2.短剧宫斗剧\

参考素材

视频提示词

人设红衣上位皇妃:身穿红色丝绸服饰、贵妃装扮的皇妃,发髻高挽,簪着步摇发簪,妆容精致艳丽,气势凌人;此刻面容凶狠、眼含嫉妒怒意,居高临下。素衣下位妃子:身穿素色轻纱妃嫔服饰的年轻妃子,面容清丽、神情柔弱;被推倒在地,双手挡脸、一脸惊恐(倒地后一直维持倒地姿态到结尾) —— 这份惊恐只是伪装,她实际心怀算计,最终将露出狡诈得意的笑容。皇上:身材高大强壮的帝王,神情威严,突然出现阻止红衣上位皇妃,满面怒容,厉声呵斥时气势迫人。场景紫禁城后宫一处宫廷院落的长廊为空间环境参考,朱红廊柱、红墙宫檐、砖石地面,开阔明亮;白天,晴。画面风格真人实拍质感古装宫廷权谋剧,高品质古装影视剧写实服化道,宫廷权谋题材气质,画面写实、表演细腻。影调明亮通透的自然日光环境,红色丝绸在光下色泽浓郁、质感鲜明,素色轻纱轻薄通透,一红一素形成强烈视觉对比;肤色自然,画面清晰明快。全局约束无字幕、禁止生成字幕;无配乐、禁止生成 BGM。画面内容分镜 1,0s-4s,全景,固定机位。红衣皇妃与素衣妃子在长廊中对峙,红衣皇妃向前逼近一步,双手猛力一推,素衣妃子失去重心向后踉跄倒地,手肘撑地;红衣皇妃居高临下俯视着她,面容凶狠、眼含嫉妒,呵斥道;对白:红衣皇妃(凶狠嫉妒):「我让你知道什么叫规矩!什么叫体统!」;音效:衣料摩擦声、身体倒地的闷响,宫苑安静,偶有微风。分镜 2,4s-7s,中近景,荷兰角,高机位俯拍,红衣皇妃保持俯视姿态,镜头从红衣皇妃身后高机位俯拍红衣皇妃的脑后以及后景处倒地的素衣妃子;红衣皇妃右手伸向发髻拔下步摇发簪,单手高高举起,簪尖朝下对准地上素衣妃子,身体前倾作势刺下;地上的素衣妃子瞳孔骤缩,双手抬起挡在脸前,发出一声惊叫;音效:发簪从发髻抽出的细微金属响动、衣袖摩擦声、素衣妃子短促的惊叫。分镜 3,7s-9s,近景,荷兰角,手持镜头。就在发簪将要刺下的瞬间,一只强壮有力的手臂从画侧猛然伸入,五指紧紧攥住红衣皇妃高举发簪的手腕,她的动作戛然而止;发簪仍握在她手中,停在半空;音效:衣袖急停摩擦声、手腕被攥住的闷响。分镜 4,9s-10s,中景,固定机位。红衣皇妃抬头,顺着抓住她手腕的手臂望去,双眼骤睁、脸色大变,又惊又恐,发出一声惊叹,红衣皇妃倒吸一口凉气;分镜5,10s-12s,反打镜头,固定机位,抓着红衣皇妃手腕正是皇上,镜头聚焦皇上上半身近景,皇上满面怒容,厉声呵斥;对白:皇上(气愤):「有朕在,不许任何人伤害她!」;音效:衣料摩擦,四周安静,人声突出。分镜6,12s-15s,固定机位,双人前后景镜头,摄像机从皇上正面一侧拍摄,视角越过皇上的肩膀聚焦他身后倒地的素衣妃子的上半身和脸部,位于后景处仍倒在地上的素衣妃子 —— 她缓缓放下挡在脸前的双手,眼中的惊恐悄然褪去,嘴角勾起一丝狡诈得意的笑容;音效:环境安静,仅衣料轻微摩擦。

Minimax H3/Seedance 2.0 fast

这个仿真人短剧场景下SD2 fast的表现有些惊喜,整体质感、人物动作的连贯性和分镜构图表现都相当不错。

H3这次问题有点多,一旦到大动作镜头,动作的力度和打击感都偏弱,而且人物的动作和姿态的连贯性不够好。尤其是最后素衣妃子的表情,H3塑料很明显,也完全没有体验狡诈。关键人物也参考得不对。

这两段视频都是经过2-3次抽卡选出比较好的片段,如果按成本算其实还是会低于使用SD2.5直出一次的成本。但体验下来,SD2 fast的抽卡成功率是要比H3高的。

3.3D CG动画特效战斗\

参考素材

视频提示词

人设修仙武者:年轻男性,身姿挺拔,气质清冷出尘、仙风道骨;御剑飞行双脚踏着巨剑剑身上,处于战斗施法状态,先后单手结印、双手结印。足下巨剑:宽大厚重,剑身泛寒光,可一分为五,在修仙武者脚下呈扇形展开。巨型妖兽:穷奇外形的庞然巨兽,体型如小山般巨大,四足粗壮、巨爪如柱;处于发狂肆虐状态,四爪先后被锁、挣扎咆哮。场景玄幻仙侠架空世界,一片人迹罕至的荒山野地作为主要空间环境参考,开阔荒原,远处连绵荒山轮廓,偶有碎石与低矮枯木。战斗后期巨兽头顶上空汇聚雷云。画面风格3D CG 高精度建模动画,国漫精品剧集质感;玄幻仙侠题材,写实 CG 建模与毛发皮肤细节,仙术法阵与雷霆特效能量感强烈;宏大战斗场面调度,史诗感。影调开阔荒原大场景、宏大空间纵深;主发光源来自法术能量:巨剑分身寒光、金色法阵明亮金辉自地面向上映照巨兽身型、白紫色雷霆爆裂闪光;雷云汇聚后环境被云层阴影笼罩、明暗对比加剧,法阵金光与雷光交替勾勒妖兽与武者的轮廓;妖兽挣扎时尘土飞扬、暗部细节增多。视觉参考参考国漫《灵笼》《凡人修仙传》CG 剧集视觉质感:高精度角色建模、材质与光影写实、仙术特效的能量流动与光效层次、大场景运镜调度。全局约束无字幕、禁止生成字幕。分镜1,0s-2s,大远景,固定镜头,高机位轻微俯拍,从年轻修仙武者身后拍摄,武者脚踏巨剑剑身御剑悬停在空中位于画面的左上角,镜头视线聚焦下方的荒原野地:一头穷奇外形的巨型妖兽正在荒地上发狂肆虐,挥动巨爪拍碎地面、仰头咆哮,扬起大片尘土碎石;音效:妖兽低沉咆哮、爪击地面的闷响、碎石飞溅声。分镜2,2s-4s,中近景,固定镜头,聚焦悬停空中的武者上半身近景,武者目光一凝,随即抬手单手结印,口唇快速念出咒语「分则能成!」;音效:低沉咒语吟诵声。分镜3,4s-5s,切换武者脚下巨剑特写,固定镜头,脚下的巨剑剑身泛起光纹、嗡鸣震动,随即一分为五,在修仙武者脚下呈扇形展开,巨剑本体仍位于武者脚下;音效:剑身震颤金属嗡鸣。分镜4,5s-8s,大远景→妖兽四只巨爪的局部中景,荷兰角,快速跟拍,镜头紧密跟随四把分身巨剑的飞射轨迹跟拍。四把分身巨剑如流光般疾速飞射而下,分别命中妖兽四只巨爪,击中瞬间化作虚灵形态的灵光锁链缠绕锁紧四爪;妖兽四爪被锁、挣扎甩动却无法挣脱,仰头怒吼;音效:剑气破空声、锁链缠绕铮鸣、妖兽挣扎怒吼、地面震颤闷响。分镜5,8s-10s,特写,固定镜头,聚焦武者胸前结印的双手。高空中的武者双手抬起、十指交叠快速多次结印,法力凝聚的微光在掌间亮起,随即放声暴喝;对白:修仙武者(怒喝):「雷光咒!」;音效:灵力汇聚的低沉嗡鸣、武者暴喝声、妖兽持续咆哮。分镜6,10s-11s,全景,仰拍后拉。妖兽脚下的地面骤然亮起一个与它身型投影同样巨大的金色法阵,符文旋转展开、金光上涌,将挣扎的妖兽笼罩其中;音效:法阵启动的深沉轰鸣、能量流动的嗡嗡声。分镜7,11s-15s,大远景,仰拍。妖兽头顶上空乌云迅速汇聚,雷云翻滚、电光在云层中窜动,天色骤然压暗;一道巨大白紫色雷霆从乌云中迸发,自天而降击中巨兽身体,法阵金光与雷光同时爆发,妖兽身形被耀眼光芒吞没、剧烈震颤;音效:雷云翻滚闷响、电流滋啦声、雷霆炸裂巨响、轰鸣回响、大地震动。全局配乐:纯音乐 + 无词吟唱0s-2s:琵琶轮指 + 二胡紧张颤音长音,低音提琴拨弦脉冲;旋律短促、小二度游移(不安定感),音量中等、密度低2s-4s:琵琶扫弦 + 古筝十六分音符急奏,堂鼓+小钹进入密集节奏层,弦乐群齐奏推高4s-5s:大鼓滚奏渐密,铜管短促强音("锁"的动作感),低频持续音垫底;妖兽咆哮处配乐主动让位——音量降、减旋律密度,给咆哮音效留空间5s-8s:只留低频持续音 + 箫孤音。打击乐静默、旋律消失8s-10s:古筝泛音 + 弦乐长音渐强,无词女声"啊——"进入(非歌词);和声从暗小调切向明亮大三和弦的临时离调10s-11s:大鼓滚奏 + 定音鼓渐强,弦乐密集颤音,30-60Hz 低频持续轰鸣;旋律线消失,只剩节奏与和声爬升;11s-15s:大鼓+定音鼓+镲片同击,唢呐/铜管齐奏强音,琵琶古筝最高密度扫弦;雷光爆闪处配乐让位 0.3s 给雷声音效;结尾快速衰减至低频余震 + 箫尾音

Seedance 2.5

Seedance2.5整体表现是相当不错的,有些小bug比如角色御剑飞行时与剑面的交互关系不对,巨剑分身时也有点穿帮没有精准还原提示词,如果输入时加入更细致的分镜图作为参考,应该就能解决上述问题;其他像运镜、战斗特效和大场景表现都是SOTA级别。

M****inimax H3/Seedance 2.0 fast

它俩在这个场景下表现差不多,都有些小穿帮镜头,但H3 的主要问题在于打击感偏弱,还有就是虽然看起来是3D,但是更偏动画感,真人感稍弱。

我感觉这次SD2 fast在这个场景下表现是最好的,bug镜头最少,特效和大场面效果也不错。

4.上美风格 2D 动画打戏\

参考素材

视频提示词

人设哪吒:少年神话英雄形象,头扎双髻,双脚各踏着一只风火轮,手持火尖枪,本场处于战斗状态,面容凌厉。敖丙:东海龙王三太子(人形态),双手各持一柄铜锤,自海底乘风浪升至空中。银白色巨龙:东海龙王三太子(龙形态),银白鳞片,身躯修长优雅,气势威严的东方中国龙。场景东海海面:波涛汹涌的海面与连绵的礁石海岸线,乌云密布的天空压得很低,海面中心旋转着巨大漩涡;空间分三层 —— 海面、漩涡上空的对峙空域、漫天乌云。画风中国水墨与水粉手绘 2D 动画质感(参考 20 世纪 80 年代上海美术电影制片厂经典动画美学),传统矿物颜料色彩,大胆简洁的轮廓,柔和的手绘边缘扩散,略微模糊的绘画边缘,细腻的水粉洇染质感,不完美的笔触轮廓,模拟动画电影颗粒,轮廓周围柔和的色彩光晕,浓郁的中国奇幻美学,超精细。影调乌云压顶、无直射日光,天地处于大面积漫射柔光之中;整体低饱和、压暗阴影,海面呈深色冷调反光,人物轮廓被矿物颜料系的柔和色彩光晕轻轻勾勒,水墨洇染过渡,画面带模拟动画颗粒质感的沉稳基调。全局约束无字幕、禁止生成字幕。画面内容分镜1,0s-2s,远景大全景,缓慢推进。乌云密布的东海海面上,哪吒背对着镜头,双脚各踏着一只风火轮、手持火尖枪,悬空漂浮在左侧空中;画面下方的海面中心惊涛波动,巨大漩涡正在加速旋转。音效:海浪翻涌、高空风啸、漩涡水流旋转声。分镜2,2s-4s,中景,荷兰角,手持拍摄,轻微晃动,镜头聚焦海面上的漩涡中心,漩涡中心升起一股上升浪涛,敖丙人形态双手持铜锤乘浪涛从海中飞升到空中;音效:海浪翻涌、高空风啸、漩涡水流旋转声。分镜4,4s-6s,全景,侧向机位,轻微横移跟拍。哪吒脚下风火轮火焰猛地喷涌,从左侧疾速冲刺到敖丙面前,火尖枪直刺而出;敖丙双锤交叉迎上,两件兵器当空相击;音效:破空声、双锤挥动风声、兵刃相撞的金属脆响。分镜5,6s-8s,中近景,稳定机位。两人近距离连续交锋数招:火尖枪刺出被铜锤砸开,枪尖横扫被双锤上格,火星飞溅;哪吒在左、敖丙在右;音效:连续金属撞击声、火花嗤响。分镜6,8s-10s,中景,手持拍摄。哪吒枪尖格开敖丙压下的铜锤,借力迅速向后悬空滑退拉开身位,随即转身侧身,奋力抬腿踢出脚下其中一只风火轮;风火轮脱脚而出,拖着一道火焰尾迹如炮弹般朝敖丙飞去,哪吒脚下只剩一只风火轮承托;音效:衣袍破空、风火轮脱出的火焰呼啸声。分镜7,10s-12s,轻微荷兰角,从中景快速拉开至全景。风火轮轰然击中敖丙胸口,爆开一团火花与气浪;敖丙被冲击力打得向后倒飞,坠入下方海面漩涡之中,激起冲天水花与浪柱;音效:风火轮逼近的尖啸、轰然击中巨响、水花炸开、入水闷响。分镜8,12s-15s,中景,荷兰角,顶视角俯拍。镜头聚焦敖丙落海的位置,海平面猛然翻涌,水下传来沉闷轰鸣,巨浪滔天而起,一头银白色巨龙盛着滔天巨浪从海中破浪跃出,头部直冲镜头而来,身躯修长优雅、鳞片泛着银光,巨龙在空中昂首张开大嘴,对着发出一声震耳欲聋的吼叫,龙须飞扬、水花四溅,画面以巨龙昂首怒吼的姿态收尾;音效:水下沉闷的轰鸣声、巨浪翻涌声,震耳欲聋的龙吼、巨浪崩落声。全局配乐(纯音乐,无歌词)中国大鼓 / 堂鼓 / 板鼓 / 大钹镲 / 铜锣 / 琵琶 / 古筝 / 二胡 / 笛子编制的传统中国打击乐与民族管弦乐,全场强节奏。0s-4s 战鼓低音滚奏收紧 + 古筝低音拨奏 + 笛子低区长音,压抑蓄势节奏渐快;4s-8s 锣鼓经急急风快板,堂鼓板鼓密集敲击 + 钹镲合击 + 琵琶古筝快速扫弦刮奏 + 二胡急促短弓,节奏密集强劲;8s-10s 鼓点骤停一瞬后大鼓连击三响 + 镲合击,重音顿挫;10s-12s 命中瞬间大鼓重击 + 铜锣长震齐响后鼓滚奏下行骤降为低频滞重单拍;12s-15s 战鼓急进 + 大锣大钹齐鸣,唢呐二胡齐奏上扬主题、笛子加花,响度与声部密度至顶点,结尾大锣长鸣收束。

Minimax H3/Seedance 2.0 fast

H3这次小问题有点多哪吒脚下的风火轮大小比例有点违和,打戏动作打击感偏弱,最大的BUG是最后一幕白龙出海的画风变成3D建模了(后续抽卡了两次也都会出现);

SD2fast 的表现相当优秀,动作打击感在线,运镜和构图也是及格以上水平,基本上没有大穿帮镜头。我感觉用来制作漫剧的性价比很高。

5.视频一镜到底\

以下均为纯文字提示词一次抽卡直出

文生视频提示词\

15秒,9:16,连续镜头,一镜到底。真人实拍写实儿童房 + 二维儿童手绘动画特效融合。严格采用5-6岁儿童第一人称视角,镜头高度较低,只偶尔看到孩子的小手、睡衣袖口、袜子和脚尖,不出现孩子完整正脸。温暖晨光照进一间真实、温馨、略微凌乱的儿童房:浅木色小书桌、蜡笔、画纸、绘本、彩色积木、低矮儿童床、淡蓝色被子、云朵动物地毯、毛绒兔、星月吊饰和布艺游戏帐篷。0-3秒:镜头看向儿童书桌,一架普通白纸折成、略显不工整的纸飞机静静躺在画纸上。孩子伸出小手轻轻碰它,纸飞机突然抖动,边缘浮现鹅黄、天蓝色蜡笔线,自行滑过桌面飞起。飞机掠过儿童画,画中的太阳和彩虹短暂以二维手绘方式眨动。孩子惊讶追过去,镜头慢半拍抬起。3-6秒:纸飞机穿过彩色积木,尾部拖出蜡笔彩线,积木表面浮现歪歪扭扭的手绘门窗和小旗,像孩子想象中的迷你城市。孩子伸手去抓,飞机突然俯冲从指尖溜走,贴着地毯飞行,地毯上的小花、小草图案沿飞行轨迹以二维蜡笔动画短暂“长出来”。镜头跟随孩子小跑,带轻微上下起伏、运动模糊和短暂失焦。6-10秒:纸飞机掠过床边毛绒兔,毛绒兔本体保持真实静止,只在表面浮现简单手绘眨眼和一只指路的小手。飞机飞上床铺,淡蓝色被子表面出现柔软的手绘白云线条,像云朵山丘。孩子扑向床面,手掌压进被子,纸飞机从指尖前突然拉升,飞向床头星月吊饰。镜头急忙抬头,短暂自然过曝。10-13秒:纸飞机绕星星、月亮和星球吊饰飞行,真实吊饰被气流带动轻轻摇晃,几个吊饰之间浮现黄色星星、蓝色行星和歪斜虚线组成的二维“儿童星空航线”。孩子踮脚伸手去够,纸飞机突然俯冲钻进床边布艺帐篷。孩子掀开帐篷,真实布料表面浮现蜡笔森林、蘑菇、小花和弯曲小路,飞机沿手绘小路飞出帐篷。13-15秒:纸飞机突然加速绕儿童房最后飞一圈,此前出现过的积木小旗、地毯花朵、云朵线、星空轨迹和森林涂鸦被一起卷起,化成红黄蓝绿的二维蜡笔小星星,形成短暂的儿童涂鸦银河。孩子在房间中央张开双手,纸飞机摇摇晃晃落回掌心。所有手绘星星散开并回到原本物件表面。镜头低头看掌心里的真实白色纸飞机,右翼上一颗小小黄色蜡笔星星轻轻闪一下,随即变回普通蜡笔印记,温柔结束。手绘动画始终是二维逐帧儿童蜡笔、彩铅、油画棒质感,线条轻微跳动、涂色不均、有颗粒和重复描边,不使用立体CG。所有幻想必须依附真实儿童房物件,不切换到真正的森林、城市或宇宙。相机始终比纸飞机慢半拍,不提前构图,不稳定居中。保留儿童追跑带来的轻微手持抖动、转身惯性、快速低头抬头、自然遮挡、短暂失焦和运动模糊。整个空间连续可信,始终在同一间儿童房内。环境音:纸张划过空气的沙沙声、袜子踩木地板和地毯声、积木轻碰、被子摩擦、吊饰碰撞、帐篷布料摩擦、孩子轻微喘息和开心惊呼。手绘特效仅加入极轻的蜡笔摩擦声、柔和“咻”“啵”和小铃音,不使用大型魔法或科幻音效。\

Minimax H3/Seedance 2.0 fast

两个模型在这个场景下表现都不错,全程视角的场景环境、纸飞机的状态和儿童的手部镜头都保持了很好的稳定性和连贯性。

6.汽车广告\

参考素材

视频提示词

类型:电影级真人汽车广告,写实摄影。设定:图4、 图5:共同作为理想 i8 外观主体参考。严格保持车辆真实车型设计、车身比例、车头造型、车窗轮廓、悬浮式深色车顶、隐藏式门把手、轮毂以及白色 / 浅灰白车漆,不改变车型,不重新设计车辆。图3:作为驾驶舱、方向盘、中控台材质与设计细节参考。图2:作为整车座舱空间、浅色座椅、三排座椅布局、全景天幕及内饰配色参考。图1:只参考车辆侧面夕阳剪影构图、金色时刻光线和旅行氛围,不参考其中因逆光产生的深色车身颜色。整条视频始终展示同一辆理想 i8,所有镜头中的车型、车身比例、车漆、轮毂、车窗、灯组与内饰保持连续一致。整体定位为面向年轻家庭的高品质新能源汽车品牌广告。真实自然、温暖、清爽、有朝气,不刻意煽情。人物是一对约30岁的年轻父母和一名5岁左右的孩子,现代简洁休闲穿着;人物只是生活氛围的组成部分,**车辆始终是主要视觉主体**。Shot 1|0:00–0:03清晨晴朗的现代住宅社区。一辆理想 i8 停在道路旁,阳光从建筑与树木之间洒下。低机位前侧45度汽车英雄镜头,车辆占据画面主体。镜头沿车头缓慢横向滑动并轻微推进,清晰掠过流畅的前舱盖、黑色前风挡区域、车身曲面与前轮。车漆呈现柔和真实的天空与树影反射,画面明亮、洁净、高级。年轻父亲从住宅方向走向车辆,手中拿着一个轻便周末旅行包;孩子活泼地从他身旁跑过,奔向汽车。不刻意摆拍,像一个真实周末早晨。Shot 2|0:03–0:06切至车辆侧面中广景,完整展示车辆的侧面比例,年轻母亲打开后排车门,孩子开心地率先坐进车内,父亲将旅行包轻松放入车中。摄影机沿车身从后向前平稳滑动,经过后轮、隐藏式门把手、宽大的侧窗和前门,在家庭成员上车过程中始终保持汽车侧面线条清晰完整。动作自然快速、有生活感,不做夸张表演。车门轻柔关闭。Shot 3|0:06–0:09切镜进入车内,完整还原浅色豪华内饰座舱。首先是驾驶席附近的精致近景:阳光沿浅色方向盘边缘滑过,方向盘、中控区域和材质细节保持参考图设计。摄影机顺势向后缓慢移动,空间逐渐打开,展示宽敞明亮的三排座舱与全景天幕。父亲驾驶,母亲坐在副驾驶或第二排,孩子舒服地坐在后排靠窗位置,好奇地望向窗外。柔和阳光透过全景天幕进入车内,在浅色座椅表面形成流动光影。孩子轻轻笑了一声,父母相视微笑。重点表现“全家人在同一个舒适移动空间里”的感觉,而不是堆砌功能展示。Shot 4|0:09–0:12切至户外动态驾驶镜头。理想 i8 行驶在通往郊外的宽阔道路上,两侧是明亮绿色植物与疏朗树木。低位侧后方跟车摄影,摄影机与车辆保持相近速度,背景形成自然流动感,而车身本体保持稳定清晰。随后摄影机略微加速,与车辆形成优雅的平行追拍。阳光沿悬浮式黑色车顶、侧窗和浅色车身滑动。车辆行驶安静、稳定、从容,不表现激烈驾驶,不漂移、不急加速。通过运动传达轻快的周末出发感。Shot 5|0:12–0:15傍晚金色时刻。参考 图1 的夕阳环境和侧面剪影构图,但车辆本身继续保持白色 / 浅灰白真实车漆。一家人已经来到湖边或海边开阔草地。理想 i8 从画面一侧缓慢驶入并停下,形成完整优雅的侧面轮廓。远处天空呈柔和橙金色与淡粉色渐变,落日映在车窗与车身表面。摄影机保持低位宽银幕构图,孩子从车旁开心跑向父母,三人在车辆旁形成自然温暖的家庭剪影。最后约0.8秒镜头轻微拉远,将汽车、年轻家庭与夕阳共同收入画面。结尾停留在一种“下一段旅程刚刚开始”的状态。可在画面最后简洁出现品牌文字:”理想 i8,家人的每一程,都值得期待。“字体克制、现代、简洁,不出现额外广告文字。影像风格高端新能源汽车商业广告,真实真人实拍摄影质感,年轻家庭 lifestyle advertising,现代、温馨、轻快、清新而高级。自然阳光,柔和高光,真实玻璃反射和汽车漆面反射,细腻材质,真实皮革与织物纹理,轻微浅景深。色彩以浅灰白、暖米色、清新绿色和金色阳光为主。前半段明亮清晨感,中段清爽自然,结尾进入温暖 golden hour。镜头运动稳定、顺滑、克制,使用汽车广告常见的低机位滑轨、缓慢推镜、平行追拍,不使用剧烈甩镜、不使用夸张无人机运动。整体节奏从「出发」→「进入家庭空间」→「行驶」→「抵达」,情绪逐渐升温。配音:真实环境声音贯穿:清晨轻微鸟鸣与微风声、脚步声、车门轻柔关闭声、车内轻微衣物摩擦、孩子自然短促的笑声、车辆行驶时柔和的轮胎与道路环境声。新能源汽车本身保持安静,不生成夸张发动机轰鸣。全局配乐:现代温暖的轻快品牌广告配乐,约100–110 BPM。清新的 acoustic guitar / muted guitar 节奏作为主体,配合柔软 piano、轻盈 percussion、极轻的 hand clap 与温暖 synth pad。0–6秒保持清爽活力,6–12秒逐渐增加节奏层次,12秒进入夕阳镜头后旋律自然舒展并形成温暖的小高潮。音乐年轻、有希望感、有旅行感,但不幼稚、不煽情、不使用宏大史诗管弦乐。

Minimax H3/Seedance 2.0 fast

使用汽车的实拍照作为参考图输入生成的仿实拍汽车广告,两个模型表现都还不错,分别只抽卡了两次就输出了以下两段效果。

主体汽车产品全程基本没有变形或出现bug镜头,不过仔细看的话H3在人物上车的时候动作有点僵硬,而且有点穿帮,同时有个内饰分镜小瑕疵,其余镜头都还不错、整体氛围感和BGM也塑造的不错。

SD2 fast基本没什么大毛病,方向盘大大的logo露出镜头,看出来它很懂广告,结尾的广告词语音播报也是亮点,如果把这段视频进行超分高清输出后甚至说可以达到作为贴片广告发布的水平了。

这里分享一个创作此类实体产品广告的小技巧:

就是输入的参考尽可能选用高质量、高分辨率的产品实拍图,这样视频模型还原产品主体时的外形质感和精准度也会更高。

7.大型 3A 游戏界面与场景\

参考素材

视频提示词

中国3A动作角色扮演游戏实机UI演示,东方神话写实美学,参考《黑神话:悟空》的厚重、古朴、电影级3A游戏质感。Unreal Engine 5,PBR物理渲染,Nanite高精度几何体,Lumen全局动态光照,3D Game Cinematic。高精度真人比例神话角色、中国传统神话建筑,真实金属、丝绸、玉石、木材材质,体积云雾、真实景深与布料物理模拟。整套UI统一采用暗金、墨黑、朱砂红、旧青铜、玉白,融合水墨晕染、篆刻印章、古卷、云雷纹、莲花火焰纹与青铜器纹饰;半透明、低占屏率、克制、清晰、沉浸,不使用现代科幻、赛博朋克、卡通手游或欧美高魔炫光UI。0秒-3秒轻微高角度缓慢推进。黑暗云海中的古代神话祭坛 作为角色选择界面,远山与残破古建筑隐入薄雾,暖金神光穿透云层。祭坛中央站着”孙悟空 、哪吒 、二郎神 “三名可游玩角色。光标依次掠过孙悟空、二郎神,最后停在哪吒;当前选中项出现**朱砂红描边+淡金水墨光晕**,底部「选择角色」按钮亮起。点击确认,哪吒向前半步,火尖枪触地,混天绫轻扬。3秒-6秒镜头平滑推近并绕至哪吒 三分之四侧面,背景浅景深。右侧滑入「**装扮 / APPEARANCE**」面板,墨黑半透明底板、暗金边框,栏目显示「头部 / 肩饰 / 腕甲 / 腰饰 / 披挂」,配件缩略图采用玉牌与青铜令牌式槽位。光标进入「头部」,当前选中框以朱砂红高亮并带淡金水墨扩散效果;选择**赤金莲纹发冠**,发冠实时替换。随后进入「腕甲」,选择**赤金莲火护腕**,金属表面呈现真实磨损、雕纹与火光反射。6秒-8秒镜头继续缓慢环绕。切换「披挂」,选择**赤红云纹混天绫**,丝绸瞬间舒展并自然翻卷,暗金云纹随受光若隐若现。左侧浮现四枚哪吒专属法宝图标:**火尖枪、乾坤圈、混天绫、风火轮**,图标采用古代印玺、法器铭纹和莲火纹设计。底部「确认装扮 / CONFIRM」按钮由墨黑常态变为朱砂红+淡金高亮,点击确认;UI化作水墨烟气向两侧消散。哪吒握紧火尖枪,风火轮短暂显现,迸出少量橙红火星。8秒-10秒镜头缓慢拉回。画面中下方出现极简古风Loading界面:「**正在前往蓬莱仙岛**」,细长暗金加载线快速从0%填充至100%,两侧只有轻微云纹与烟雾装饰。黑暗祭坛逐渐被白色云海吞没,水墨远山、仙岛建筑轮廓、玉石地面与金色晨光由远及近逐层加载生成,无缝完成世界切换。10秒-15秒Loading完成,镜头无缝切换为**标准第三人称越肩实机视角**,位于哪吒身后稍高位置。哪吒站在蓬莱仙岛主城入口的白玉大道 { {Mixed 2}} 上,前方是繁华宏大的中式神话仙城:朱红牌楼、白玉栏杆、飞檐斗拱、金顶仙宫、炼丹阁、法器铺、茶楼、悬浮楼阁、石桥与云桥层层延伸;仙人、道士、精怪与灵兽穿行,仙鹤掠过屋檐,远处瀑布从悬空山峰坠入云海。HUD自然淡入并始终保持稳定:**左上角**:哪吒头像 + 深红生命值 + 金色神力值 + 玉青体力条,旧青铜与暗金细框;**右上角**:圆形水墨小地图,外圈如古代天象罗盘,显示道路、商铺、NPC与任务点;**右下角**:火尖枪攻击、乾坤圈投掷、混天绫束缚、三昧真火、风火轮突进五枚技能图标,采用篆刻印章与莲火纹设计;**左下角**:丹药、法宝、快捷道具栏,玉石与旧青铜槽位;**画面远处中央**:淡金神话符印任务标记「前往凌霄渡口」。玩家控制哪吒沿白玉大道向前行走,人群自然避让,NPC产生轻微注视反馈,远处两名仙人御剑掠过。镜头保持真实第三人称跟随,混天绫、发丝和衣摆随运动与风力自然摆动。最终保持完整HUD、小地图、状态条、技能图标、道具栏与任务标记,呈现真实可玩的中国3A神话动作游戏实机画面。整体要求:镜头连续流畅,UI出现、选择、高亮、确认、消散、加载和HUD淡入均有明确交互反馈;角色、装备与场景连续一致;UI文字简洁清晰,不出现乱码,不堆叠多余界面,不频繁切镜,不做宣传片蒙太奇,整体像真实3A游戏从角色选择界面直接进入实机游玩的完整录屏。

Minimax H3/Seedance 2.0 fast

最后,来个高信息密度的视频画面场景,这个算是超高难度的了。

对于H3和SD2 fast来说都属于是比较大的挑战,两者其实都完整完成了提示词的要求,但都存在比较大的bug镜头。

H3的问题是角色、场景和UI元素的对于参考图和提示词的还原度不够,建模显得有些低精度和劣质,没有达到提示词中要求的UE5画风和参考3A大作画质的水平。

SD2fast则是后面把另外两个角色弄丢了,以及转场加载进入游戏场景时角色的正面朝向没有正确转身,不过这些可以通过抽卡和后期剪辑来解决。它对于角色、场景和UI元素的游戏画面质感还原算是比较到位的。

既然这一趴两个都不太ok,那就在让Seedance2.5来试试。

从这个复杂场景就更容易看出Seedance 2.5的领先水平了,整体效果很不错,有一点小瑕疵是高密度游戏界面中的小文字乱码和形变(不过可以通过直接喂图片生成首尾帧视频的方式解决);

画面中的光标与UI交互,游戏场景和游戏UI界面的还原感觉都十分接近真实的国产3A游戏大作的实机演示效果。不得不说,SOTA就是🐂🍺,单单看质感都很不一样。

测下来,我的感受是 SD2.0 fast > H3,H3的画质还是有些塑料感,不适合所有场景。

另外,SD2.0 fast 给人的感觉很全能,没有特别弱的场景。我感觉Seedance2.0 fast大概有SD2.0 80%的能力,但速度会快很多,价格也更香。

之前网上有很多H3能威胁Seedance的言论,但我感觉目前H3 跟SD2.0 fast还有明显的差距。虽然差距不是非常大,但肉眼可见。

然后SD2.0 fast和H3都是以性价比著称,目前企业使用它们的主要方式是通过API调用。

我看了一下目前这两个模型的API价格:

Seedance 2.0 fast API价格为0.6元/秒。

H3(768P)API价格为0.5元/秒。

H3每秒便宜了1毛钱。

但我觉得在API层面,性价比更高的还是SD 2.0 fast,毕竟去省那点点成本,还不如提升一下效果。

另外很多人都说H3是开源免费的,可以自己部署使用,我搜了一下网上给的H3的部署所需资源。

可以看到,消费级显卡理论上可以用,但是都非常慢。可以说没法投入生产环境。

官方推荐的配置可以很舒服的使用,但是需要4张H100的卡。

我查了一下大概要100万¥,关键买裸卡只是开始,4张 H100 实际部署还需要:专用服务器/主板(支持多卡 NVLink)、液冷或高功率风冷散热系统(SXM5 单卡功耗高达 700W)、大功率电源与机房基础设施、InfiniBand 或高速网络互联(多卡训练必需)

如果直接购买 4卡整机服务器(如 HGX 平台),整机价格一般在 $200,000 – $400,000+(约 144万 – 288万+人民币)

肯定还有平时的运维成本,必须得雇一个懂技术的来运维吧,不然出点问题随时用不了...

所以这样看下来,如果你想自己部署开源的H3,畅快的使用,其实成本还挺高的。

除非你对外提供服务,但对外提供服务,用的人一旦多起来,所需的算力又不是这100万的几台机器能够承受得住的了。

综合下来,我其实是更推荐大家再大部分的场景下使用Seedance2.0 fast的,因为我觉得它应该是目前性价比最高的视频模型了。

然后一些复杂场景,重要镜头和上Seedance2.0或者Seedance2.5。

总的来说,我觉得Seedance的整体稳得一批,不管是SOTA的SD2.5还是高性价比的SD2.0 fast都足够能打。

不过我也很乐意看到不断有新的更强的模型出现,有竞争,我们的视频模型整体才能进步的更快,大家也能薅到更多羊毛~ 价格也能卷得更便宜。这是好事情。

「最后」\

回到开头的那个问题(视频模型怎么选?),就跟很多人问我 Agent 选哪个是一样的,我觉得没有最好的,只有最适合的。

因为不同的场景所需要的模型或者说Agent其实都不一样,所以最适合的才是最好的。

如果追求效果,那Seedance系列模型肯定还是目前的最优解。

以上仅代表我个人的看法,如果你有不同的想法,欢迎评论区交流~

我是袋鼠帝,一个致力于帮你把AI变成真实生产力的博主。我们下期见。

能看到这里的都是凤毛麟角的存在!

如果觉得不错,随手点个赞、在看、转发三连吧~

如果想第一时间收到推送,也可以给我个星标⭐

谢谢你耐心看完我的文章~

目录
相关文章
人工智能 缓存 前端开发
9157 40
人工智能 JavaScript 开发工具
3776 9
开发工具 Swift git
1433 2
缓存 JavaScript Shell
1738 2
人工智能 JavaScript 测试技术
1312 0
Shell API 调度
950 3
人工智能 JavaScript 测试技术
530 4
人工智能 Java BI
634 0