400 128 6709

行业新闻

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

发布时间:2023-12-03点击次数:

最近,微软进行的一项研究揭示了视频处理软件PS的灵活程度有多高

在这项研究中,你只要给 AI 一张照片,它就能生成照片中人物的视频,而且人物的表情、动作都是可以通过文字进行控制的。比如,如果你给的指令是「张嘴」,视频中的人物就会真的张开嘴。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

如果你给的指令是「伤心」,她就会做出伤心的表情和头部动作。

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

当给出指令「惊讶」,虚拟人物的抬头纹都挤到一起了。

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

除此之外,您还可以提供一段语音,使虚拟角色的嘴型和动作与语音同步。或者,您可以提供一段*供虚拟角色模仿

如果你对虚拟人物的动作有更多的自定义编辑需求,例如让他们点头、转头或歪头,这项技术也是支持的

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

这项研究名叫 GAIA(Generative AI for Avatar,用于虚拟形象的生成式 AI),其 demo 已经开始在社交媒体传播。不少人对其效果表示赞叹,并希望用它来「复活」逝者。

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

但也有人担心,这些技术的持续进化会让网络视频变得更加真假难辨,或者被不法分子用于*。看来,反诈手段要继续升级了。

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

GAIA 有什么创新点?

零样本会说话的虚拟人物生成技术旨在根据语音合成自然视频,确保生成的嘴型、表情和头部姿势与语音内容一致。以往的研究通常需要针对每个虚拟人物进行特定训练或调整特定模型,或在推理过程中利用模板视频以实现高质量的结果。最近,研究人员致力于设计和改进零样本会说话的虚拟人物的生成方法,只需使用一张目标虚拟人物的肖像图片作为外貌参考即可。不过,这些方法通常采用基于warping的运动表示、3D Morphable Model(3DMM)等领域先验来降低任务难度。这类启发式方法虽然有效,但可能会限制多样性,导致不自然的结果。因此,从数据分布中直接学习是未来研究的重点

本文中,来自微软的研究者提出了 GAIA(Generative AI for Avatar),其能够从语音和单张肖像图片合成自然的会说话的虚拟人物视频,在生成过程中消除了领域先验。

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

项目地址:https://microsoft.github.io/gaia/可以在此链接上找到相关项目的详细信息

论文链接: https://arxiv.org/pdf/2311.15230.pdf

TTSMaker TTSMaker

TTSMaker是一个免费的文本转语音工具,提供语音生成服务,支持多种语言。

TTSMaker 2275 查看详情 TTSMaker

盖亚揭示了两个关键洞见:

  1. 用语音来驱动虚拟人物运动,而虚拟人物的背景和外貌(appearance)在整个视频中保持不变。受此启发,本文将每一帧的运动和外貌分开,其中外貌在帧之间共享,而运动对每一帧都是唯一的。为了根据语音预测运动,本文将运动序列编码为运动潜在序列,并使用以输入语音为条件的扩散模型来预测潜在序列;
  2. 当一个人在说出给定的内容时,表情和头部姿态存在巨大的多样性,这需要一个大规模和多样化的数据集。因此,该研究收集了一个高质量的能说话的虚拟人物数据集,该数据集由 16K 个不同年龄、性别、皮肤类型和说话风格的独特说话者组成,使生成结果自然且多样化。

根据上述两个洞见,本文提出了 GAIA 框架,其由变分自编码器 (VAE)(橙色模块)和扩散模型(蓝色和绿色模块)组成。

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

VAE的主要功能是分解运动和外貌。它由两个编码器(运动编码器和外貌编码器)和一个解码器组成。在训练时,运动编码器的输入为面部关键点(landmarks)的当前帧,而外貌编码器的输入为当前视频剪辑中的随机采样帧

根据这两个编码器的输出,随后优化解码器以重建当前帧。一旦获得训练完成的VAE,就会得到所有训练数据的潜在动作(即运动编码器的输出)

然后,这篇文章使用扩散模型训练,以预测基于语音和视频剪辑中随机采样帧的运动潜在序列,从而为生成过程提供外貌信息

在推理过程中,给定目标虚拟人物的参考肖像图像,扩散模型将图像和输入语音序列作为条件,生成符合语音内容的运动潜在序列。然后,生成的运动潜在序列和参考肖像图像经过 VAE 解码器合成说话视频输出。

该研究在数据方面进行了构建,从不同的来源收集了数据集,包括 High-Definition Talking Face Dataset (HDTF) 和 Casual Conversation datasets v1&v2 (CC v1&v2)。除了这三个数据集之外,研究还收集了一个大规模的内部说话虚拟人物数据集,其中包含 7K 小时的视频和 8K 说话者 ID。数据集的统计概述如表 1 所示

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

为了学习到所需的信息,文章提出了几种自动过滤策略以确保训练数据的质量:

  1. 为了使嘴唇运动可见,头像的正面方向应朝向相机; 
  2. 为了保证稳定性,视频中的面部动作要流畅,不能出现快速晃动; 
  3. 为了过滤掉嘴唇动作和言语不一致的极端情况,应该删除头像戴口罩或保持沉默的帧。

本文在过滤后的数据上训练 VAE 和扩散模型。从实验结果来看,本文得到了三个关键结论:

  1. GAIA 能够进行零样本说话虚拟人物生成,在自然度、多样性、口型同步质量和视觉质量方面具有优越的性能。根据研究者的主观评价,GAIA 显着超越了所有基线方法; 
  2. 训练模型的大小从 150M 到 2B 不等,结果表明,GAIA 具有可扩展性,因为较大的模型会产生更好的结果; 
  3. GAIA 是一个通用且灵活的框架,可实现不同的应用,包括可控的说话虚拟人物生成和文本 - 指令虚拟人物生成。

GAIA 效果怎么样?

实验过程中,该研究将 GAIA 与三个强大的基线进行比较,包括 FOMM、HeadGAN 和 Face-vid2vid。结果如表 2 所示:GAIA 中的 VAE 比以前的视频驱动基线实现了持续的改进,这说明 GAIA 成功地分解了外貌和运动表示。

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

语音驱动结果。用语音驱动说话虚拟人物生成是通过从语音预测运动实现的。表 3 和图 2 提供了 GAIA 与 MakeItTalk、Audio2Head 和 SadTalker 方法的定量和定性比较。

从数据中可以清楚地看出,GAIA 在主观评价方面远远超过了所有基准方法。更具体地说,如图 2 所示,即使参考图像是闭眼或头部姿态不寻常,基准方法的生成结果通常高度依赖于参考图像;相比之下,GAIA 对各种参考图像都表现出鲁棒性,并生成具有更高自然度、口型高度同步、视觉质量更好以及运动多样性的结果

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

根据表3,最佳的MSI分数表明GAIA生成的视频具有出色的运动稳定性。Sync-D得分为8.528,接近真实视频得分(8.548),表明生成的视频具有出色的唇形同步性。该研究获得了与基线相当的FID分数,这可能是受到了不同头部姿态的影响,因为该研究发现未经扩散训练的模型在表中实现了更好的FID分数,详见表6

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制

以上就是一张照片生成视频,张嘴、点头、喜怒哀乐,都可以打字控制的详细内容,更多请关注其它相关文章!


# 丰田  # 怎么网站seo推广  # 网页seo如何优化导航  # 网站建设目的与意义  # 江山seo排名  # 山西seo服务平台  # 乐乐互联网营销推广公司  # 产品营销推广方案ppt内容排版  # 简单网站建设和制作教程  # 江门均安网站建设  # 学会seo可以做什么  # 会说话  # 模型  # 就会  # 是一个  # 所示  # 中国科学院  # 过程中  # 提出了  # 一张照片  # warp  # udio  # 微软 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: 中国移动主导创立元宇宙产业联盟,包括科大讯飞、芒果TV等在内,共24家成员  朱民:普通人炒股炒不过机器人是很正常的 AI已经能理解市场情绪  AMD在ChinaJoy展示全新的锐龙AI笔记本,开创了人工智能领域的新时代!  AIGC 风潮刮到游戏产业,巨人网络与阿里云达成“游戏 +AI ”合作  人工智能如何帮助制造业?  为什么很多人对纽约《人工智能招聘法》感到生气?  AI赋能艺术 超现实达利奇幻之旅在沪开启  探索AI前沿理念 2025全球人工智能技术大会在杭州开幕  如何用AI重塑你的工作流(一)  陈丹琦ACL学术报告来了!详解大模型「*」数据库7大方向3大挑战,3小时干货满满  2025年深圳举办的SUSECON 创新峰会开始接受报名  VR健身应用《FitXR》将取消Quest 1端会员服务  国家发改委组织工业机器人产业高质量发展现场会  “长沙造”无人机,领先的不止植保  午报 | 字节跳动要造机器人;东方甄选首次启动自有APP|直播|  央视报道车载人机交互技术!MWC上海魅族表现亮眼,现场热火朝天  即时 AI再次升级 30秒生成自带动效的网页 生成速度提升100%  华为HarmonyOS 4将集|成人|工智能大型模型  英伟达推出 L40S GPU,AI 推理性能超过 A100 约 1.2 倍  “踩油门,也要会踩刹车” 互联网企业高管谈人工智能发展  国内AI大模型“安卓时刻”到来!阿里云通义千问免费、开源、可商用  真全息产品,亮相深圳文博会——dipal数伴拓展元宇宙非沉浸式体验  特斯拉人形机器人将亮相 预计售价不超过15万元  苹果AR头显商标与华为撞车,在中国或改名  支持跨语言、人声狗吠互换,仅利用最近邻的简单语音转换模型有多神奇  OpenAI宣布在伦敦设立海外分部,要招揽“世界级人才”  扎克伯格吐槽苹果Vision Pro:社交落后Meta太多,无法建设元宇宙  小艺将具备大模型能力,鸿蒙4加速AI普及之路  掌阅科技申请阅爱聊商标 掌阅科技申请AI相关商标  推动企业数字化转型升级!“松江智造”摘世界人工智能大会重磅奖项  日本学校探索引入 AI 和无人机:提高安保效率,节省劳动力  AMD称下半年AI显卡供应充足,不需要像NVIDIA那样加价抢购  工信部信通院发布《2025大模型和AIGC产业图谱》 360智脑覆盖全产业链  原小米 9 号员工李明打造全球首款 AI 安卓桌面机器人  美图设计室2.0什么时候上线  扎克·施奈德新片《月球叛军》曝剧照 机器人首度现身  创新科学家成功研发FAST激光靶标维护机器人  如何成功实施人工智能?  猿辅导发布最新SaaS业务进展公告:Motiff UI设计工具推出三项新的AI功能  改变城市交通:智慧城市中的智能交通  稿见AI助手:提升写作效率与质量的必备工具  讯飞星火大模型实现升级 助力通用人工智能人才培养  AI绘画,还需要懂数学?  苹果机器学习关键人物 Ali Farhadi 离职,回归 AI2 担任 CEO  山东机器人编程:Scratch编程基础,认识舞台!~济南机器人编程  三个全球首创,青岛西海岸新区“海元宇宙”亮相世界人工智能大会  国产工业机器人领域“暗潮涌动”,即将迎来新一轮复苏  一文看懂基础模型的定义和工作原理  微幼科技晨检机器人:幼儿园健康保障的新伙伴  本届人工智能大会上的这个“镇馆之宝”,来自长宁企业西井科技! 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司