400 128 6709

行业新闻

再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手

发布时间:2023-06-12点击次数:

最近几年,「视频会议」在工作中的占比逐渐增加,厂商也开发了各种诸如实时字幕等技术以方便会议中不同语言的人之间交流。

但还有一个痛点,要是对话中提到了一些对方很陌生的名词,并且很难用语言描述出来,比如食物「寿喜烧」,或是说「上周去了某个公园度假」,很难用语言给对方描述出的美景;甚至是指出「东京位于日本关东地区」,需要一张地图来展示等,如果只用语言可能会让对方越来越迷茫。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

再也不怕「视频会议」尬住了!谷歌chi顶会发布新神器visual captions:让图片做你的字幕助手

最近,谷歌在人机交互顶级会议ACM CHI(Conference on Human Factors in Computing Systems)上展示了一个系统Visual Captions,介绍了远程会议中的一个全新视觉解决方案,可以在对话背景中生成或检索图片以提高对方对复杂或陌生概念的了解。

再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手

论文链接:https://research.google/pubs/pub52074/

代码链接:https://github.com/google/archat

Visual Captions系统基于一个微调后的大型语言模型,可以在开放词汇的对话中主动推荐相关的视觉元素,并已融入开源项目ARChat中。

再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手

在用户调研中,研究人员邀请了实验室内的26位参与者,与实验室外的10位参与者对系统进行评估,超过80%的用户基本都认同Video Captions可以在各种场景下能提供有用、有意义的视觉推荐,并可以提升交流体验。

设计思路

在开发之前,研究人员首先邀请了10位内部参与者,包括软件工程师、研究人员、UX设计师、视觉艺术家、学生等技术与非技术背景的从业者,讨论对实时视觉增强服务的特定需求和期望。

两次会议后,根据现有的文本转图像系统,确立了预期原型系统的基本设计,主要包括八个维度(记为D1至D8)。

D1:时序,视觉增强系统可与对话同步或异步展现

D2:主题,可用于表达和理解语音内容

D3:视觉,可使用广泛的视觉内容、视觉类型和视觉源

D4:规模,根据会议规模的不同,视觉增强效果可能有所不同

D5:空间,视频会议是在同一地点还是在远程设置中

D6:隐私,这些因素还影响视觉效果是否应该私下显示、在参与者之间共享或向所有人公开

D7:初始状态,参与者还确定了他们希望在进行对话时与系统交互的不同方式,例如,不同级别的「主动性」,即用户可以自主确定系统何时介入聊天D8:交互,参与者设想了不同的交互方法,例如,使用语音或手势进行输入

再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手

用动态的视觉效果增强语言交流的设计空间

根据初步反馈,研究人员设计了Video Caption系统,专注于生成语义相关的视觉内容、类型和来源的同步视觉效果。

虽然在探索性会议中的想法大多关注于一对一远程对话的形式,Video Caption同样也可以用于一对多的(例如,向观众进行演示)和多对多场景(多人会议讨论)的部署。

除此之外,最能补充对话的视觉效果在很大程度上取决于讨论的上下文,所以需要一个专门制作的训练集。

研究人员收集了1595个四元组,包括语言、视觉内容、类型、来源,涵盖了各种上下文场景,包括日常对话、讲座、旅行指南等。

比如用户说「我很想看看!」(I would love to see it!)对应于「面部微笑」(face smiling)的视觉内容、「表情符号」(emoji)的视觉类型和「公共搜索」(public search)的视觉源。

「她有没有告诉你我们去墨西哥的事?」对应于「来自墨西哥之旅的照片」的视觉内容、「照片」的视觉类型以及「个人相册」的视觉源。

该数据集VC 1.5K目前已开源。

再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手

数据链接:https://github.com/google/archat/tree/main/dataset

Seede AI Seede AI

AI 驱动的设计工具

Seede AI 713 查看详情 Seede AI

视觉意图预测模型

为了预测哪些视觉效果可以补充对话,研究人员使用VC1.5K数据集基于大型语言模型训练了一个视觉意图预测模型。

在训练阶段,每个视觉意图解析为「 of from 」的格式。

再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手

基于该格式,系统可以处理开放词汇会话和上下文预测视觉内容、视觉源和视觉类型。

再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手

这种方法在实践中也优于基于关键词的方法,因为后者无法处理开放式词汇的例子,比如用户可能会说「你的艾米阿姨将在这个星期六来访」,没有匹配到关键词,也就无法推荐相关的视觉类型或视觉来源。

研究人员使用VC1.5K数据集中的1276个(80%)样本来微调大型语言模型,其余319个(20%)示例作为测试数据,并使用token准确率指标来度量微调模型的性能,即模型正确预测的样本中token正确的百分比。

最终模型可以实现97%的训练token准确率和87%的验证token准确率。

实用性调研

为了评估训练的视觉字幕模型的实用性,研究团队邀请了89名参与者执行846项任务,要求对效果进行打分,1为非常不同意(strongly disagree)、7为非常同意(strongly agree)。

实验结果显示,大多数参与者更喜欢在对话中看到视觉效果(Q1),83% 给出了5-有些同意(somewhat agree)以上的评价。

此外,参与者认为显示的视觉效果是有用的且信息丰富的(Q2),82%给出了高于5分的评价;高质量的(Q3),82%给出了高于5分的评价;并与原始语音相关(Q4,84%)。

参与者还发现预测的视觉类型(Q5,87%)和视觉来源(Q6,86%)在相应对话的背景下是准确的。

再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手

研究参与者对可视化预测模型的技术评价结果进行评分

基于该微调的视觉意图预测模型,研究人员在ARChat平台上开发了Visual Captions,可以直接在视频会议平台(如Google Meet)的摄像头流上添加新的交互式小部件。

在系统工作流程中,Video Captions可以自动捕获用户的语音、检索最后的句子、每隔100毫秒将数据输入到视觉意图预测模型中、检索相关视觉效果,然后提供推荐的视觉效果。

再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手

Visual Captions的系统工作流

Visual Captions在推荐视觉效果时提供三个级别的可选主动性:

自动显示(高主动性):系统自主搜索并向所有会议参与者公开显示视觉效果,无需用户交互。

自动推荐(中等主动性):推荐的视觉效果显示在私人滚动视图中,然后用户点击一个视觉对象可以进行公开展示;在这种模式下,系统会主动推荐视觉效果,但用户决定何时显示以及显示什么。

按需建议(低主动性):用户按下空格键后,系统才会推荐视觉效果。

研究人员在对照实验室研究(n = 26)和测试阶段部署研究(n = 10)中评估了Visual Captions系统,参与者发现,实时视觉效果有助于解释不熟悉的概念、解决语言歧义,并使对话更具吸引力,从而促进了现场对话。

再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手

参与者的task load指数和Likert scale评级,包括无VC、以及三个不同主动性的VC

与会者还报告了在现场进行交互中的不同的系统偏好,即在不同的会议场景中使用不同程度的VC主动性

以上就是再也不怕「视频会议」尬住了!谷歌CHI顶会发布新神器Visual Captions:让图片做你的字幕助手的详细内容,更多请关注其它相关文章!


# 就可以  # 网站排名优化管用易速达  # 宜都seo引流推广  # 汤阴县网站制作推广  # seo优化按天收费seo顾问  # 午夜不用充钱的seo  # 海口网站建设教程视频  # 网站优化三大建议包括  # 湘潭移动端网站建设  # 中医养生营销推广  # 最贵网站建设  # 多语言  # 谷歌  # 开源  # 新能源  # 很难  # 墨西哥  # 出了  # 住了  # 视频会议  # 关键词  # type  # captions  # 视频 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: 当人工智能开始写高考作文?作家陈崇正、朱山坡谈文学与未来  专家解读国家网信办深度合成服务算法备案信息公告:不等于百度、阿里、腾讯等生成式AI产品获批  对Hugging Face开源模型精准投毒!LLM切脑后变身PoisonGPT,用虚假事实洗脑60亿人  盘古大模型3.0正式发布 AI开发正走向新“工业化开发模式”  业内领先 四川大学华西第四医院甲状腺乳腺外科成功进入手术机器人时代  腾讯汤道生:大模型只是起点,产业落地是AI更大的应用场景  AMD在AI方面奋起直追,与英伟达的差距缩小了吗?  推动综合能源服务高质量发展  爱设计 AI 一键生成 PPT 工具上线:输入标题即可生成 PPT  美踏控股推出创新人工智能大数据模型“心乐舞河”:虚拟人音舞社交的新体验  为什么很多人对纽约《人工智能招聘法》感到生气?  懒人必备的家居清洁好物,石头自清洁扫拖机器人G20  马斯克回应“人工智能让一切变得更好”:我们已经是半机器人了  看似低调,实则稳健:字节在AI路上会遇到什么?  如何利用AI工具写好本科论文:科技助你一臂之力  今年,全球客服中心支出将增长 16.2%,迎接对话式 AI 的浪潮,根据 Gartner 报告  华为推出全新操作系统HarmonyOS 4,AI和新引擎完美融合  机构:边缘AI或是当前预期差最大的AI方向  剧透!蜜小豆@2025世界人工智能大会多个亮点曝光  央视报道!星纪魅族集团车载人机交互技术成世界移动通信大会焦点  以分布式网络串联闲置GPU,这家创企称可将AI模型训练成本降低90%  MiracleVision视觉大模型  昇腾AI大模型训推一体化解决方案将在WAIC发布  “木头姐”:特斯拉的人工智能训练——“赢家通吃”的机会  破解零碳产业园建设规范和成果评价难题  企业软件行业更将被AI全面重构!Moka李国兴:未来优秀组织和个人将一定是善于使用AI生产力的  大疆 DJI Mini 4 Pro 无人机曝光:流线设计,有望迎来功能性提升  选对AI智能写作软件,让创作游刃有余!  严打“黑飞”,无人机检测反制设备护航大运会净空安全  华为云发布华为云盘古模型3.0和升腾AI云服务,亮点亮相2025华为开发者大会  AI拉动PCB发展|行业发现  中国联通推出“极光一号”5G机载终端,适配大疆等品牌无人机设备  谷歌 Gmail“帮我写电子邮件”AI 功能开始向安卓和苹果设备推广  AI大模型火了!科技巨头纷纷加入,多地政策加码加速落地  ChatGPT设计出的第一个机器人来了!【附人工智能行业预测】  首届亚太网络法实务大会召开 九位大咖探讨元宇宙与人工智能发展  城市在采用人工智能方面进展如何?  Meta Quest订阅服务每月7.99美元畅玩两款VR游戏应用  Valve 将拒绝采用 AI 生成未知版权内容的游戏上架 Steam  西班牙小鲜肉*视频在网上疯传,本人发文澄清:是AI换脸的假视频!  移远通信率先完成多场5G NTN技术外场验证,为卫星物联网应用落地提速  华为云天筹AI求解器荣获世界人工智能大会最高奖  第二届光合组织AI解决方案大赛赛果揭晓  AMD称下半年AI显卡供应充足,不需要像NVIDIA那样加价抢购  微盟宣布联合腾讯云共建行业大模型:加快激活AI大模型智能应用  全国青少年无人机大赛重庆市选拔赛开赛 1252名中小学生参加  热点资讯:家乐福推出聊天机器人;米哈游2025年营收273.4亿元…  有远见!华为四年前注册商标Vision Pro:苹果AR国内要改名  360发布数字安全和人工智能的强大结合:360安全大模型  揭秘AI数字人语录:抖音AI小和尚、老者语录能赚钱吗? 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司