ESC
AI 1 分钟阅读

Seedance 2.5发布

Seedance 2.5视频生成模型已在即梦AI和豆包Pro等平台上线,即将通过BytePlus ModelArk提供API。新版本将视频生成时长延长至30秒,增强故事叙述能力,支持多轮扩展生成长视频。模型优化了视觉细节和多模态参考功能,支持精确编辑和绿幕编辑等专业功能,提升视频生成质量。

来源:Hacker News

今天,Seedance 2.5在即梦AI、豆包Pro等其他平台上线,API访问即将通过BytePlus ModelArk提供。我们邀请您尝试并分享反馈。

即梦网页 -> 视频生成 -> 选择Seedance 2.5

豆包Pro -> 视频生成 -> 选择Seedance 2.5

Seedance 2.5将单次视频生成从15秒延长至30秒,并进一步增强了其在较长视频中的叙事能力。在30秒内,模型可以组织多个逻辑相连的镜头,使故事通过铺垫、发展、转折和结局展开,而不仅仅是扩展单个时刻。例如,在一个歌手舞台表演的一镜到底片段中,模型描绘了歌手在更衣室与工作人员互动、穿过后台走廊、遇到舞者并与他们一起上台表演的完整故事,而不仅仅是上台的那一刻。

T2V提示:一镜到底手持稳定器跟踪镜头。摄像机缓慢推进,穿过厚重的红色帷幕缝隙,进入一个温暖色调的后台更衣室。一位年轻女歌手背对摄像机,正在调整耳塞,一位工作人员提醒她该上场了。她转向摄像机并开始演唱城市流行音乐。摄像机后退并跟踪她穿过帷幕进入昏暗的后台走廊,途中与她的舞者自然互动;一位工作人员递给她一个麦克风。她和舞者然后走上舞台,摄像机弧形移动到后方,逐渐揭示红黑相间的舞台设计、LED屏幕、聚光灯、烟雾和反光地板。摄像机最后拉远到竞技场的全景,显示满座的观众、灯板、荧光棒和欢呼的人群,捕捉音乐会青春自由的高潮。

得益于模型的多轮扩展能力,用户可以将后续镜头平滑地附加到现有视频输出中。在整个扩展过程中,它保持了主要角色、环境和叙事节奏的一致性。这允许用户一次性输出持续几分钟的视频,减少了分割片段、重复拼接镜头和修复过渡的工作量。

R2V提示:扩展视频。从@Video 1的视觉和主体继续,生成另一个30秒片段,保持角色主体、场景、视觉风格和音效的一致性。小男孩抱着足球沿着火车车厢奔跑。当地铁停止时,侧门打开,他立即冲出去,男主角追赶他。两人跑过站台并跑到街上,沿途惊吓到路人和车辆。男主角最终追上并抓住他。男孩抬头,委屈。男主角的愤怒慢慢消退;他拍拍男孩的头,露出无奈的微笑。

在视觉呈现方面,模型实现了更平滑的镜头转换过渡。主要主体在多次剪切中保持稳定,音频和视频保持同步,从而产生高度连贯的长视频。例如,在京剧场景中,摄像机执行一个优美的圆形摇镜,跟随主演流动的袖子,而主要主体和背景保持完全一致。袖子的摆动在空中形成自然的弧线,紧密遵循真实世界的物理规律。

R2V提示:16:9宽屏,电影质感,单次连续镜头,平滑摄像机移动,无剪切。场景参考:@Image 4。0–5秒:以@Image 2中霸王的特写开始。摄像机缓慢环绕其上半身并过渡到中景。霸王旋转转身,他的身体和靠旗快速扫过镜头形成自然遮挡,摄像机跟随到@Image 1中虞姬的侧面。6–10秒:摄像机从@Image 1中虞姬的中景稳定环绕,跟随她的水袖通过弧线。她抬起手臂,手腕抖动,展开袖子,半转身。然后她收回袖子,保持姿势,侧目看向霸王。11–20秒:@Image 3中的男武生以空翻进入。霸王占据舞台中心,而武生在对面进退进行战斗交锋。虞姬站在霸王稍后侧方,穿插水袖动作以柔克刚。摄像机从中近景慢慢拉远到全景舞台。结束时,三人面向观众并摆出同步的京剧结束姿势。

此外,为了解决AI生成视频中常见的人工痕迹,Seedance 2.5系统地优化了物体纹理、皮肤和眼睛特征、光照和颜色饱和度等细节。该模型还尽量减少字幕和背景音乐中的不可控出现,提供最终产品,其质量接近真人拍摄的电影效果。

Seedance 2.5进一步增强了其多模态参考生成能力。它允许用户在一次输入中提供多达30张图像、10个视频片段和10个音频片段作为参考材料。更大数量和更广泛类型的参考可以更好地捕捉用户意图,生成具有更多主体、更丰富场景和更灵活镜头的复杂视频。

该模型全面理解所有材料中的视觉构成、场景、风格、角色和道具等元素,并按照指示应用到视频生成过程中。即使在多角色镜头或群体叙事等复杂场景中,它也能保留多个角色的外观和声音,同时保持每个主体的特征稳定。

R2V提示:一个30秒的音乐会序列,16:9横屏,电影现实主义,真实的音乐厅光影,温暖金色舞台灯光,以及正式古典音乐会的氛围。使用@Image 1作为场地。参考@Image 2作为钢琴家。参考@Image 3作为大提琴。参考@Image 4作为小提琴。主唱必须严格遵循@Image 5。参考@Images 6到10作为其他管弦乐队成员。参考@Images 11到14作为合唱团。参考@Images 15到18作为观众座位。主唱从舞台中央走向前沿。钢琴家位于钢琴旁。管弦乐队布置在两侧和后方。合唱团站在舞台后部。以音乐厅全景的高角度广角镜头开始。钢琴家按下琴键,主唱步入聚光灯开始演唱。摄像机自然移动经过小提琴、大提琴和管弦乐队,他们一起演奏,小提琴明亮而大提琴温暖。后半部分,合唱团加入。主唱短暂与前排观众眼神交流,观众以微笑和轻微点头回应。在结束镜头,摄像机拉远。演唱结束,观众加入鼓掌。

Seedance 2.5还增强了特定参考能力,包括粘土渲染、运动和创意参考,使用户对画面中的主体、动作和镜头有更精细的控制。** **例如,通过粘土渲染参考,用户可以使用无纹理的3D模型构建场景的空间结构、角色姿势、运动路径和摄像机角度。然后模型使用该结构生成视频,确保复杂镜头的构图和走位与创作者的预期紧密匹配。此外,Seedance 2.5改进了光照控制。通过利用粘土渲染的空间信息,它生成遵循物理规律的逼真光照效果,如光源方向、色温、强度和阴影投射。这导致最终输出中更自然的光影。

R2V提示:参考@Clay Render 1的摄像机移动、节奏、镜头大小过渡、主体轨迹和走位。参考@Image 2的角色设计、场景、材质、光照、颜色和童话氛围,将白色模型渲染为梦幻、温暖的3D动画短片,带有童真奇幻感。故事展开如下:飞越幻想天空 → 神话生物伴飞穿越云海 → 潜入海洋 → 在深海中与鳐鱼穿梭 → 穿过时空的镜像裂缝 → 从宇宙中拾取星星 → 变回卧室 → 父亲掖好被子 → 绘本合上并定格在最后一帧。

在视频创作中,用户通常需要在生成过程中控制节奏,并在之后精炼细节。动作发生的确切秒数、镜头剪切的精确时间,以及特定片段中角色的动作是否需要调整,都对最终结果有深远影响。更精确和可靠的编辑能力允许创作者准确实现他们的想法,提高效率并减少重复生成的成本。

Seedance 2.5支持通过时间戳进行精确内容编辑。在生成阶段,用户可以使用提示控制特定时间框架的叙事、摄像机视角、移动和整体节奏,使输出更符合他们的创作意图。生成后,用户可以针对特定片段中的角色、动作或情节元素进行修改,同时在编辑前后保持连续性和真实性。

Seedance 2.5还提升了多种编辑功能,如绿幕编辑、摄像机视角编辑和基于参考的编辑,以满足电影和广告等专业领域的严格要求。例如,在绿幕编辑中,模型可以替换背景并讲述完全不同的故事,同时保持主要主体不变。此外,它擅长渲染主体如何响应新环境的物理规则。这包括衣服飘动的方向、头发状态、步态节奏和光照互动,确保主体与场景和谐融合。

R2V提示:使用@Video 1,渲染绿幕背景、障碍物、服装和支持角色。0–4秒:户外训练,将障碍物替换为岩石、砖块、轮胎和木箱。4–10秒:更衣室,朋友提供鼓励。10–15秒:国际比赛,将训练杆替换为原创防守队员和守门员,主角得分。整体照片级真实,电影质量。

R2V提示:编辑@Video 1。保持角色、动作和视觉风格不变。仅调整摄像机移动。15秒分段摄像机计划:0–4秒,微FPV移动紧贴平底锅,然后跟随弹出的吐司快速摇镜到咖啡;4–7秒,推进并沿锅边横向跟踪,跟随煎蛋翻起并落回原位;7–11秒,快速上升到俯视图,然后匀速下降,扫过盘子和钥匙;11–15秒,使用手持特写跟随双手快速横向摇镜,然后推进早餐并拉远到中景双人镜头。保持整个序列平滑、连续和稳定。