发布时间:2023-06-15
点击次数: 在 AI 绘画领域,阿里提出的 Composer 和斯坦福提出的基于 Stable diffusion 的 ControlNet 引领了可控图像生成的理论发展。但是,业界在可控视频生成上的探索依旧处于相对空白的状态。
相比于图像生成,可控的视频更加复杂,因为除了视频内容的空间的可控性之外,还需要满足时间维度的可控性。基于此,阿里巴巴和蚂蚁集团的研究团队率先做出尝试并提出了 VideoComposer,即通过组合式生成范式同时实现视频在时间和空间两个维度上的可控性。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
前段时间,阿里巴巴在魔搭社区和 Hugging Face 低调开源了文生视频大模型,意外地受到国内外开发者的广泛关注,该模型生成的视频甚至得到马斯克本尊的回应,模型在魔搭社区上连续多天获得单日上万次国际访问量。


Text-to-Video 在推特
VideoComposer 作为该研究团队的最新成果,又一次受到了国际社区的广泛关注。



VideoComposer 在推特
事实上,可控性已经成为视觉内容创作的更高基准,其在定制化的图像生成方面取得了显着进步,但在视频生成领域仍然具有三大挑战:
在此之前,阿里巴巴提出的 Composer 已经证明了组合性对图像生成可控性的提升具有极大的帮助,而 VideoComposer 这项研究同样是基于组合式生成范式,在解决以上三大挑战的同时提高视频生成的灵活性。具体是将视频分解成三种引导条件,即文本条件、空间条件、和视频特有的时序条件,然后基于此训练 Video LDM (Video Latent Diffusion Model)。特别地,其将高效的 Motion Vector 作为重要的显式的时序条件以学习视频的运动模式,并设计了一个简单有效的时空条件编码器 STC-encoder,保证条件驱动视频的时空连续性。在推理阶段,则可以随机组合不同的条件来控制视频内容。
实验结果表明,VideoComposer 能够灵活控制视频的时间和空间的模式,比如通过单张图、手绘图等生成特定的视频,甚至可以通过简单的手绘方向轻松控制目标的运动风格。该研究在 9 个不同的经典任务上直接测试 VideoComposer 的性能,均获得满意的结果,证明了 VideoComposer 通用性。

图 (a-c)VideoComposer 能够生成符合文本、空间和时间条件或其子集的视频;(d)VideoComposer 可以仅仅利用两笔画来生成满足梵高风格的视频,同时满足预期运动模式(红色笔画)和形状模式(白色笔画)
Video LDM
隐空间。Video LDM 首先引入预训练的编码器将输入的视频 。然后,在用预先训练的解码器 d 将隐空间映射到像素空间上去 扩散模型。为了学习实际的视频内容分布
免费 Chrome 扩展程序,使用 ChatGPT AI 生成电子邮件和消息。 
映射到隐空间表达,其中
。在 videocomposer 中,参数设置

ChatGPT Writer
106
查看详情
,扩散模型学习从正态分布噪声中逐步去噪来恢复真实的视觉内容,该过程实际上是在模拟可逆的长度为 T=1000 的马尔可夫链。为了在隐空间中进行可逆过程,Video LDM 将噪声注入到




为了充分探索利用空间局部的归纳偏置和序列的时间归纳偏置进行去噪,VideoComposer 将 

VideoComposer
组合条件。VideoComposer 将视频分解为三种不同类型的条件,即文本条件、空间条件和关键的时序条件,它们可以共同确定视频中的空间和时间模式。VideoComposer 是一个通用的组合式视频生成框架,因此,可以根据下游应用程序将更多的定制条件纳入 VideoComposer,不限于下述列出的条件:
草图序列可以提供更多的控制细节,从而实现精确的定制合成。时空条件编码器。序列条件包含丰富而复杂的时空依赖关系,对可控的指示带来了较大挑战。为了增强输入条件的时序感知,该研究设计了一个时空条件编码器(STC-encoder)来纳入空时关系。具体而言,首先应用一个轻量级的空间结构,包括两个 2D 卷积和一个 *gPooling,用于提取局部空间信息,然后将得到的条件序列被输入到一个时序 Transformer 层进行时间建模。这样,STC-encoder 可以促进时间提示的显式嵌入,为多样化的输入提供统一的条件植入入口,从而增强帧间一致性。另外,该研究在时间维度上重复单个图像和单个草图的空间条件,以确保它们与时间条件的一致性,从而方便条件植入过程。
通过 STC-encoder 处理条件后,最终的条件序列具有与相同的空间形状,然后通过元素加法融合。最后,沿通道维度将合并后的条件序列与连接起来作为控制信号。对于文本和风格条件,利用交叉注意力机制注入文本和风格指导。
训练和推理
两阶段训练策略。虽然 VideoComposer 可以通过图像 LDM 的预训练进行初始化,其能够在一定程度上缓解训练难度,但模型难以同时具有时序动态感知的能力和多条件生成的能力,这个会增加训练组合视频生成的难度。因此,该研究采用了两阶段优化策略,第一阶段通过 T2V 训练的方法,让模型初步具有时序建模能力;第二阶段在通过组合式训练来优化 VideoComposer,以达到比较好的性能。
推理。在推理过程中,采用 DDIM 来提高推理效率。并采用无分类器指导来确保生成结果符合指定条件。生成过程可以形式化如下:

其中,ω 是指导比例;c1 和 c2 是两组条件。这种指导机制在两条件集合判断,可以通过强度控制来让模型具有更加灵活的控制。
在实验探索中,该研究证明作为 VideoComposer 作为统一模型具有通用生成框架,并在 9 项经典任务上验证 VideoComposer 的能力。
该研究的部分结果如下,在静态图片到视频生成(图 4)、视频 Inpainting(图 5)、静态草图生成生视频(图 6)、手绘运动控制视频(图 8)、运动迁移(图 A12)均能体现可控视频生成的优势。




公开信息显示,阿里巴巴在视觉基础模型上的研究主要围绕视觉表征大模型、视觉生成式大模型及其下游应用的研究,并在相关领域已经发表 CCF-A 类论文 60 余篇以及在多项行业竞赛中获得 10 余项国际冠军,比如可控图像生成方法 Composer、图文预训练方法 RA-CLIP 和 RLEG、未裁剪长视频自监督学习 HiCo/HiCo++、说话人脸生成方法 LipFormer 等均出自该团队。
以上就是时间、空间可控的视频生成走进现实,阿里大模型新作VideoComposer火了的详细内容,更多请关注其它相关文章!
# 并在
# 网站优化网站搜索排名
# 鹤壁seo推广营销公司
# 找营销推广公司合法吗
# 甘肃抖音seo优化布局
# 双流网站建设怎么收费
# 推广数字营销介绍语录
# 美容行业网站优化营销
# 无为网站优化价格
# seo补充案例
# 怎样开通推广网站
# 重庆
# 三种
# 视频
# 三大
# 转录
# 开源
# 可以通过
# 杜比
# 火了
# controlnet
# stable diffusion
# runway
# hugging face
# 阿里巴巴
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
腾讯企点客服接待与营销分析能力升级!企业操作更高效、人机交互更智能
人工智能赋能无人驾驶:商业化进程再提速
英伟达CEO宣称生成式AI已迎来“划时代时刻”
2025年贵州省青少年机器人竞赛在安举行
微软更新服务协议,以防止通过AI服务进行逆向工程和数据抓取
GPT-4不能在麻省理工学院获得计算机科学学位
360发布数字安全和人工智能的强大结合:360安全大模型
鸿蒙智能座舱的AI大模型革新,引领智能座舱领域的变革吗?
标贝科技亮相国际顶会ICASSP2025 加速布局海外AI数据市场
杀入生成式AI的亚马逊云科技,能否再次生成未来?
13 个提高生产力的 AI 工具
全国青少年无人机大赛重庆市选拔赛开赛 1252名中小学生参加
美图第二届影像节发布七款AI影像创作工具
小岛秀夫不反对使用AI 但认为人类应该凌驾于AI
上影节直击 | AI技术降低了短片拍摄门槛?金爵奖评委不赞同
首届全国体育人工智能大会在首都体育学院召开
小艺主导智慧交互升级,借助AI大模型增强能力
Dubbo负载均衡策略之 一致性哈希
管提需求,大模型解决问题:图表处理神器SheetCopilot上线
【|直播|预告】人工智能高峰论坛将于7月2日13:30准时开播!
鉴智机器人发布基于地平线征程5的标准视觉感知产品
全场景智能车:智能无处不在|芯驰亮相世界人工智能大会
OpenAI限制网络爬虫访问以保护数据免被用于AI模型训练
两架海燕号无人机交付中国气象局 助力建设国家级机动气象观测业务
全新“AI助手”!讯飞星火助手中心人机协作共创新生态
贫穷让我预训练
360°/180°双模式,佳能公布可折叠小体积的VR全景相机
张勇对话多位诺奖得主 人工智能将无处不在
AI证件照生成器:实际测试中AI软件展现了绝无仅有的强大效能
学界业界大咖探讨:AI对数字艺术创新的推动力
掌阅科技对话式AI应用“阅爱聊”开启内测
Meta 推出 Quest 超级分辨率技术,让 VR 画面更清晰
Win11 AI 助手 Windows Copilot 被吐槽:套皮的 Edge 浏览器
SnapFusion技术大幅提升AI图像生成速度
联想举办2025创新开放日,展出260余项算力及AI产品技术
国网辉南供电:无人机空中巡检 全力护航端午佳节
机智云AI离线语音识别模组,让家电变得更加智能便捷
猿编程参加人工智能高峰论坛,推动人工智能教育解决方案在千所学校推行
如何获得元宇宙的第一个属于自己的空间
大疆 DJI Mini 4 Pro 无人机曝光:流线设计,有望迎来功能性提升
马斯克回应人工智能拯救世界:人类已处于“半机器人”状态
山东机器人编程:Scratch编程基础,认识舞台!~济南机器人编程
智能电网技术:提高能源效率和可靠性
RoboNeo操作教程
华为盘古AI模型实现秒级全球气象预报时间缩短
喜马拉雅在国际会议挑战赛中突破语音重叠难题斩获第一 加速AI创新
日媒:AI高效解析纳斯卡地画
国内阅读行业首款对话式AI应用“阅爱聊”封闭内测
能源电力数字化转型恰逢其时
无人机在电力巡检中的应用:全面解析高效巡检流程