MiniMax H3 对比 Seedance 2.0:基于原始提示词的视频实测

以三组可追溯的 MiniMax H3 提示词为起点,对照 H3 示例与 Seedance 2.0 片段,观察片头、时尚与产品画面的呈现。

Industry News
MiniMax H3 与 Seedance 2.0 基于原始提示词的视频测试封面

这次我们只选了三组 MiniMax H3 示例,它们的来源文档里都有文字提示词:一段都市谜题感的图形片头、一支白棚眼镜广告和一支人体工学椅短片。它们刚好都碰到一个很实际的问题:一段 AI 视频看起来不错,但参考画面会不会跑偏、产品会不会变形、镜头会不会不听指令。

下面的 MiniMax H3 视频是这些提示词在来源文档中对应的输出;配对的 Seedance 视频则以 720p Standard 生成。MiniMax 在每一条 H3 记录中都明确标为不完整提示词,因此如果要做完全公平的复跑,也需要相同的参考图或参考视频。官方展示和在同一份简报下生成的结果不是一回事。关于 MiniMax H3 的命名、已公布规格及官方示例背景,可参阅 MiniMax H3 指南

保持不变的条件

控制项 固定做法
源素材 每组测试保留 MiniMax H3 来源记录中写明的参考素材包;在某类参考素材不可用时,不用替代素材补给另一模型。
提示词 从 MiniMax H3 的文字提示词出发,保留镜头顺序、排除项和音频方向;仅在当前调用需要英文时做忠实翻译。
时长与比例 15 秒;测试 1 为 16:9,测试 2 和 3 为 9:16。
Seedance 路径 Seedance 2.0 Standard,720p。
MiniMax H3 路径 使用来源记录写明的参考工作流,并保留原始交付文件供复核。
音频 每次生成均开启音频。三份简报都没有规定台词,因此不将口型同步作为决定性评分项。
复核方法 看完整片段,而非挑选一张静帧;把缺失的控制项记录下来,而不是把不可用的输入类型当作质量失败。

在 PixVerse 上,Seedance 2.0 提供文生视频、图生视频、转场、图像参考和原生音频等路径;公开产品页说明了当前 Standard 与 Fast 选项。ByteDance 的 Seedance 2.0 页面介绍了其文本、图像、音频和视频输入方向。这些信息说明各路径能接收什么;真正的比较要从画面开始。

MiniMax H3 与 Seedance 2.0 一览

项目 MiniMax H3 文档信息 PixVerse 上的 Seedance 2.0
视频时长 5-15 秒 4-15 秒
视频与声音 24 FPS,原生立体声音频 视频生成时支持原生音频
参考输入 最多 9 张图片、3 个视频和 3 个音频文件;合计 12 个文件 当前 PixVerse 路径最多 9 张图片参考
图像驱动模式 首帧、尾帧和全能参考工作流 文生视频、图生视频、转场和图像参考
分辨率 文档中列有 1440p 模式 Standard 最高 1080p;Fast 最高 720p

有关 Seedance 当前的访问方式、设置和分辨率限制,请参阅 PixVerse 上的 Seedance 2.0。如果 H3 要进入正式排期,也应先确认当前可用的 MiniMax 入口。

我们如何看这些结果

我们把交付的视频当作剪辑素材来看,而不是只盯着其中最漂亮的一帧。我们主要观察五件事:简报意图有没有贯穿整段视频,关键参考是否仍能认出,运动与镜头方向是否稳定,声音是否贴合场景,以及我们会不会愿意把这段素材放进常规剪辑。

这不是盲测,也不是对模型做整体排名。H3 文件来自官方来源文档示例,配对的 Seedance 视频则是 720p Standard 输出。因此,H3 视频是有价值的画面质量参考,但不能证明这是一场条件完全一致的复跑。以下记录只谈这三组配对素材的画面。

使用的原始提示词

下列每个案例都能在 MiniMax H3 来源文档中找到文字提示词。片头需要随附的视觉参考;眼镜广告需要参考视频、模特图和产品图;椅子短片需要产品细节图和产品图。扫地机器人拆解案例没有可用的文字提示词,因此没有放进来。厨房互动案例需要人物与表演参考素材,但它们不在这次测试包中,也一并排除。

测试 1:图形化谜题片头

原始提示词重点: 基于给定视觉参考制作一支 15 秒、16:9 的轻度都市谜题片头。来源提示词要求日系复古动画片头的视觉语言、硬边剪影、漫画拼贴、非对称分屏、清晰可读的英文署名、随鼓点推进的硬切转场,以及一段悬念感强于爵士感的原创配乐。

四张给定关键帧需要读成同一支完整片头:由聚焦式开场进入受控转场,形成稳定主画面,并让观众确实看得清标题。

MiniMax H3 来源输出

MiniMax H3 文档提供的来源输出;并非由 PixVerse 独立生成。

Seedance 2.0 测试输出

Seedance 2.0 Standard 输出,720p。

我们的观察

我们第一眼注意到的是图形处理:硬朗的黑色画格、插画式取景,以及偏冷的夜景配色,让整段片子更像拼贴,而不是实拍场景。后半段的深色停顿形成了有意的留白,也让前面出现的色彩和线条更醒目。H3 示例的画面更密,经历了更多画格与标题卡细节;Seedance 则像是同一视觉范围里更克制的版本。我们喜欢锐利的几何分框和较柔和的城市灯光背景之间的反差。

测试 2:白棚眼镜广告

原始提示词重点: 一支 9:16 时尚广告,沿用参考视频的节奏和白棚处理,两位给定时尚模特以及一副给定设计的眼镜。指令重点是保留模特身份、冷感编辑风格,以及眼镜的环绕式曲面、反光材质与锐利几何轮廓。

这个测试会同时考验产品身份和双人一致性:眼镜需要始终容易辨认,两位模特也要维持白棚风格,并完成由广到近的一组镜头。

MiniMax H3 来源输出

MiniMax H3 文档提供的来源输出;并非由 PixVerse 独立生成。若要继续做成广告制作流程,可参考如何把产品照片制作成 AI 视频广告

Seedance 2.0 测试输出

Seedance 2.0 Standard 输出,720p。

我们的观察

这支是三组里时尚画面最干净的一支。明亮的白棚给画面留下了充足空间,黑色环绕式眼镜则为两张面孔提供了清楚的视觉锚点。我们喜欢两人相对的构图:有编辑大片的感觉,也带一点冷感,但并不僵硬。H3 的来源示例把姿态和轮廓推得更强;Seedance 更安静,以近景为主,让眼镜和两种对照鲜明的造型承担画面。

测试 3:人体工学椅功能短片

原始提示词重点: 展示一把黑色人体工学办公椅,包括 360 度产品视图、透气网布细节、腰托与人体工学曲线可视化、扶手和高度调节、办公使用场景,以及骨骼支撑图形。来源素材使用了单独的产品细节图与产品图。

椅子在从产品主画面转到网布细节、调节动作和办公使用画面时,需要保住轮廓与材质细节。

MiniMax H3 来源输出

MiniMax H3 文档提供的来源输出;并非由 PixVerse 独立生成。

Seedance 2.0 测试输出

Seedance 2.0 Standard 输出,720p。

我们的观察

对我们来说,这支是三组 Seedance 结果里触感最强的一支。手和扶手的近景让调节动作显得很具体,网布靠背也保留了足够的可见度,让椅子有了材质纹理。我们还喜欢黑色表面在较暗环境里仍然保持层次,没有压成一个单一形状。H3 示例更像经过打磨的产品主视觉短片;Seedance 则更靠近、更实用,主要由产品细节来推动画面。

常见问题

MiniMax H3 和 Seedance 2.0 使用的是同一条提示词吗?

每一组 Seedance 案例都以 MiniMax H3 的文字简报为起点,包括时长、画幅和预期视觉方向。本文并不声称这是一次原始 A/B 复跑:官方 H3 示例使用了原来的媒体素材包,而这些随附资产并非每一项都能在 Seedance 路径中使用。任何不可用的控制项都会被记录,而不会换成另一种创意素材。

这次测试会衡量音频质量吗?

每次生成都开启音频,并从场景贴合度和时间配合上复核。三组来源提示词都不需要有台词的对比,因此本文不就口型同步作出结论。

怎样才算公平比较?

锁定参考素材包、提示词、时长、画幅和复核标准。保留每一个交付文件,再从完整片段中判断连续性、运动、声音和制作可用性。

结语

看完这三组配对后,我们最明显的感受是,两套素材会用不同方式处理同类简报。Seedance 在眼镜近景和椅子细节中显得更直接;H3 的片头示例则带有更繁复的图形开场和署名语言。这些只是对现有片段外观的观察,不是通用排名。

把素材和提示词版本放在一起,保留不够理想的生成结果,并看完整段剪辑。PixVerse Canvas 工作流提供了一种跨多个视频模型执行这一流程的方式。