简介
2026 年 3 月 24 日字节跳动发布 Seedance 2.0,采用统一多模态架构,单次支持最多 9 张参考图、3 个视频片段与 3 个音频片段,生成 1080p、15 秒片段并原生支持多语言对白。
2026 年 3 月 24 日,字节跳动发布 Seedance 2.0。这款视频生成模型采用统一多模态架构,可同时接受文本、图像、音频、视频输入,单次支持最多 9 张参考图、3 个视频片段与 3 个音频片段,生成 1080p、15 秒的片段,并原生支持多语言对白。在 Artificial Analysis 基准上,它以 1269 的 Elo 评分超过 Veo 3、Sora 2 与 Runway Gen-4.5,登顶视频生成榜单。
一、事件速览
Seedance 2.0 的核心变化是输入形态的全面放开,它不再只是单纯的文生视频,而是把文本、图像、音频、视频统一进同一架构,创作者可以一次性给出 9 张参考图、3 段视频与 3 段音频作为生成条件。与上一代相比,这种设计把多种输入当成同一类条件来处理,创作者不必再在文生视频与图生视频之间做取舍,这直接降低了复杂创意的表达成本。输出方面支持 1080p、15 秒片段,并原生支持多语言对白。其研究论文描述了 4 至 15 秒的音视频直接生成,原生输出分辨率包括 480p 与 720p。产品侧,Seedance 2.0 通过 Dreamina 全球提供,并正在集成进 CapCut,这意味着能力会直接落到字节的创作者工具链中。
二、关键数据与技术细节
- 发布时间:2026 年 3 月 24 日,字节跳动发布 Seedance 2.0。
- 输入能力:统一多模态架构,单次最多支持 9 张参考图、3 个视频片段、3 个音频片段。
- 输出规格:生成 1080p、15 秒片段,原生支持多语言对白。
- 论文口径:描述 4 至 15 秒的音视频直接生成,原生输出分辨率含 480p 与 720p。
- 榜单成绩:Artificial Analysis 基准 Elo 评分 1269,超过 Veo 3、Sora 2 与 Runway Gen-4.5。
- 分发渠道:通过 Dreamina 全球提供,并正在集成进 CapCut。
三、行业影响与解读
2026 年视频模型的竞争基线被原生音频彻底改写了。过去评测主要看画质与运动一致性,现在对白、环境音、音效、口型同步、音画对齐都已成为核心产品力的一部分,这让视频生成第一次真正接近可用成片。Seedance 2.0 以 1269 的 Elo 分超过 Veo 3、Sora 2 与 Runway Gen-4.5,意味着中国厂商在多模态生成这一细分赛道上取得了领先。对创作者而言,输入条件的丰富意味着可控性提升,参考图与参考音频能显著减少反复抽卡的次数,这是生成式视频从演示走向生产工具的关键一步。在商业层面,短视频、电商素材与广告片是最先受益的三类场景,它们的共同特点是对时长要求不高、但对产量要求极高。更关键的是分发环节的打法,通过 Dreamina 全球提供并集成进 CapCut,字节把模型能力直接接到创作者的剪辑流程里,这种模型加工具链的闭环,是纯模型公司难以复制的壁垒。
四、值得关注的信号
- 原生音频成为标配后,评测体系会向音画对齐与口型同步倾斜,纯视觉模型将迅速掉队。
- 模型能力集成进 CapCut 这类工具,说明生成式视频的胜负手正在从榜单转向工作流嵌入。
- 1080p 与 15 秒的组合已接近短视频主流规格,商用落地的成本门槛大幅降低。
- Veo 3、Sora 2 等海外旗舰被超越,中国在多模态生成上的领先可能比语言模型更持久。
小结:Seedance 2.0 用 1269 的 Elo 分和统一多模态架构,把字节推上了全球视频生成的第一梯队。原生音频让竞争基线整体抬高,而与 Dreamina、CapCut 的深度结合则提供了模型之外的护城河。2026 年视频生成的竞争,将是能力与工作流捆绑的竞争。
