声音与画面同时生成,而不是事后配上去
台词、环境声和音效与画面出自同一次推理,所以不会跑偏。把台词写进双引号,角色的口型就已经围着它成形——不需要单独的 TTS,也不需要手动对轨。
字节跳动的旗舰视频模型,也是 Snaptale 中第一个自己生成声音的模型。台词出画时口型已经对上,最多 30 张参考图把角色牢牢锁住,运镜依然像有人在现场执导。
台词、环境声和音效与画面出自同一次推理,所以不会跑偏。把台词写进双引号,角色的口型就已经围着它成形——不需要单独的 TTS,也不需要手动对轨。
Seedance 2.0 接受九张参考图,2.5 接受三十张——整组角色、服装、产品和场地都绑进同一次生成。Snaptale 会按提示词里提到的顺序,把你 @ 到的素材接上去。

把任意图片钉成首帧——GPT Image 2 的静帧、上传的照片、之前的渲染结果——还可以再给一张尾帧来决定镜头落到哪里。同一素材同时出现在两处提示词里时,Snaptale 会自动接上引用。
要一个开场全景、一个中景转身和一个特写,2.5 会在同一次渲染里把转场做完——声音也跟着镜头一起走。在多主体镜头上,它的指令跟随明显比 2.0 更紧。
选好画幅,模型就按这个画幅构图——不居中裁切,不会把头切出画外。Snaptale 以 720p 渲染 2.5,需要成对素材时可以把同一场景两种画幅都交付。
无需选模型、无需服务商密钥、无需提示词仪式。描述镜头,智能体在合适时选用 Seedance 2.5——你留在对话里,看它一轮轮迭代。
像导演一样写这个镜头,并把台词放进双引号。Snaptale 会识别出对白,把片段排到 Seedance 2.5 上,让人声与画面一起生成。
你 @ 到的每个项目角色、产品或风格素材,都会作为带标号的参考传进去——最多三十个——让整段片子里的角色都不跑形。
换画幅、加时长、把生成的音频静音换成自己的音轨——Snaptale 只重切改动的部分,时间轴的其余内容原样保留。
Seedance 2.5 本身很强。Snaptale 让它可被导演——持久素材、角色锁定,工作室与智能体共用同一项目。
音频与画面一起生成,所以根本不存在会出错的对轨步骤。保留模型的音轨,或者静音换成你自己的——两种做法都不需要重新渲染视频。
三十张参考图足够在一次生成里放下完整的角色组、服装和场地,连贯性不再是要一个镜头一个镜头去争取的东西。
Snaptale 把 2.5 作为安全、风格化内容的默认模型,并把写实或含知名 IP 的脚本提前路由到更宽松的模型——不用先赔一次被拒的渲染才知道。
裁剪、重切、换音乐、改画幅——都在同一段对话里,都在你刚生成的那个片段上。
720p 下每个片段 4–15 秒。模型本身能做到 30 秒,但 Snaptale 让所有视频模型共用同一组时长档位,好让脚本规划和时间轴计算保持可比——更长的叙事就拼接多个片段,参考图集合会让它们保持连贯。
会,这也是相比 2.0 最主要的变化。台词、音效和背景音乐都与画面出自同一次推理。把台词写进提示词的双引号里,模型会围着它做口型。你也可以关掉它,改用 Snaptale 自己的音乐和配音轨。
最多 30 张,是 Snaptale 里参考集合最大的模型。2.0 是 9 张。Snaptale 会按提示词顺序,把你 @ 到的素材作为带标号的参考传进去。
暂时不能。视频编辑和延长跑在 Seedance 2.0 上,因为那样我们可以在渲染开始前就把输出时长——也就是价格——定下来。在 2.5 上,编辑后的片段时长由供应商自己决定,而每秒费率大约是四倍,所以我们特意没有把它接到这条路径上。
720p。和 2.0 不同,这个模型在我们的供应商这里没有 1080p 或 4K 档。Snaptale 的导出环节会用一次轻量处理把成片升采样到 1080p。
2.5 是安全、明显风格化或虚拟内容的默认选择。读起来偏写实,或者以知名现实 IP、公众人物为核心的脚本,会被提前路由到 Happy Horse 1.1——Seedance 系列的内容审查往往会拒掉这类内容,提前切换比赔一次被拒的渲染便宜。