发布时间:2023-07-17
点击次数: 当前大语言模型 (Large Language Models, LLMs) 如 GPT4 在遵循给定图像的开放式指令方面表现出了出色的多模态能力。然而,这些模型的性能严重依赖于对网络结构、训练数据和训练策略等方案的选择,但这些选择并没有在先前的文献中被广泛讨论。此外,目前也缺乏合适的基准 (benchmarks) 来评估和比较这些模型,限制了多模态 LLMs 的 发展。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
图片
在这篇文章中,作者从定量和定性两个方面对此类模型的训练进行了系统和全面的研究。设置了 20 多种变体,对于网络结构,比较了不同的 LLMs 主干和模型设计;对于训练数据,研究了数据和采样策略的影响;在指令方面,探讨了多样化提示对模型指令跟随能力的影响。对于 benchmarks ,文章首次提出包括图像和视频任务的开放式视觉问答评估集 Open-VQA。
基于实验结论,作者提出了 Lynx,与现有的开源 GPT4-style 模型相比,它在表现出最准确的多模态理解能力的同时,保持了最佳的多模态生成能力。
不同于典型的视觉语言任务,评估 GPT4-style 模型的主要挑战在于平衡文本生成能力和多模态理解准确性两个方面的性能。为了解决这个问题,作者提出了一种包含视频和图像数据的新 benchmark Open-VQA,并对当前的开源模型进行了全面的评价。
具体来说,采用了两种量化评价方案:
为了深入研究多模态 LLMs 的训练策略,作者主要从网络结构(前缀微调 / 交叉注意力)、训练数据(数据选择及组合比例)、指示(单一指示 / 多样化指示)、LLMs 模型(LLaMA [5]/Vicuna [6])、图像像素(420/224)等多个方面设置了二十多种变体,通过实验得出了以下主要结论:
作者提出了 Lynx(猞猁)—— 进行了两阶段训练的 prefix-finetuning 的 GPT4-style 模型。在第一阶段,使用大约 120M 图像 - 文本对来对齐视觉和语言嵌入 (embeddings) ;在第二阶段,使用 20 个图像或视频的多模态任务以及自然语言处理 (NLP) 数据来调整
模型的指令遵循能力。
图片
Lynx 模型的整体结构如上图 Figure 1 所示。
视觉输入经过视觉编码器处理后得到视觉令牌 (tokens) $$W_v$$,经过映射后与指令 tokens $$W_l$$ 拼接作为 LLMs 的输入,在本文中将这种结构称为「prefix-finetuning」以区别于如 Flamingo [3] 所使用的 cross-attention 结构。
此外,作者发现,通过在冻结 (frozen) 的 LLMs 某些层后添加适配器 (Adapter) 可以进一步降低训练成本。
作者测评了现有的开源多模态 LLMs 模型在 Open-VQA、Mme [4] 及 OwlEval 人工测评上的表现(结果见后文图表,评估细节见论文)。可以看到 Lynx 模型在 Open-VQA 图像和视频理解任务、OwlEval 人工测评及 Mme Perception 类任务中都取得了最好的表现。其中,InstructBLIP 在多数任务中也实现了高性能,但其回复过于简短,相较而言,在大多数情况下 Lynx 模型在给出正确的答案的基础上提供了简明的理由来支撑回复,这使得它对用户更友好(部分 cases 见后文 Cases 展示部分)。
1. 在 Open-VQA 图像测试集上的指标结果如下图 Table 1 所示:
图片
2. 在 Open-VQA 视频测试集上的指标结果如下图 Table 2 所示。
图片
3. 选取 Open-VQA 中得分排名靠前的模型进行 OwlEval 测评集上的人工效果评估,其结果如上图 Figure 4 所示。从人工评价结果可以看出 Lynx 模型具有最佳的语言生成性能。
图片
4. 在 Mme benchmark 测试中,Perception 类任务获得最好的表现,其中 14 类子任务中有 7 个表现最优。(详细结果见论文附录)
Open-VQA 图片 cases

OwlEval cases

Open-VQA 视频 case

在本文中,作者通过对二十多种多模态 LLMs 变种的实验,确定了以 prefix-finetuning 为主要结构的 Lynx 模型并给出开放式答案的 Open-VQA 测评方案。实验结果显示 Lynx 模型表现最准确的多模态理解准确度的同时,保持了最佳的多模态生成能力。
以上就是字节团队提出猞猁Lynx模型:多模态LLMs理解认知生成类榜单SoTA的详细内容,更多请关注其它相关文章!
# 丰田
# 外贸营销推广方案产品
# seo建设规划网站
# 达内seo教育
# 铜陵企业营销推广找哪家
# 宁夏抖音推广营销
# 兴国网络营销推广招聘
# 函授站如何推广招生网站
# 怀集seo公司
# 市场营销策划包括市场推广费吗
# 安徽常见营销推广特征
# 进行了
# 模型
# 这是
# 高质量
# 中国科学院
# 提出了
# 所示
# 榜单
# 多模
# fig
# llama
# 开源
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
无人机协助盐城交通执法的协同训练
华为4G5G通信物联网收费标准公布,多年研发成果,十年花费近万亿
郭帆导演成功利用AI技术制作的《流浪地球3》预告片在央视热播,引发巨大反响
生成式人工智能如何改变云安全的游戏规则
7/8上海 | 2025世界人工智能大会分论坛:科技与人文-共筑无障碍智能社会
世界人工智能大会|“AI领航,共筑未来”高端保险论坛成功举办
AI拉动PCB发展|行业发现
中国AI公有云市场2025年逆势蓬勃增长,增速高达80.6%
物联网和人工智能的协同作用:释放预测性维护的潜力
月薪6万,哪些AI岗位在抢人?
掌阅科技入选北京市通用人工智能产业创新伙伴计划第二批成员名单
马斯克回应“人工智能让一切变得更好”:我们已经是半机器人了
苹果AIGC专利:可通过语音指令生成AR/VR虚拟场景
微软大牛加入ZOOM,AI人才大战打响
这效果能打几分?AI真人化《名侦探柯南》
借力AI!PCB全球巨头,有爆发潜质吗?
腾讯TRS之元学习与跨域推荐的工业实战
全面拥抱大模型浪潮,ISC 2025打造全球首场AI数字安全峰会
AI行业盛会大咖云集!Sam Altam、“AI教父”......一文看懂最新观点
对话无界AI创始人长铗:AI的创业机会在应用层丨创新者Innovator
IBM 与 NASA 携手开源地理空间 AI 模型,促进气候科学研究进步
亲身体验鸿蒙4:AI大模型带来的便利,告别单纯的旁观者状态
“黑科技”亮相大湾区轨交论坛 智慧交通迈向“强AI”
如何利用物联网技术提高企业生产线智能化水平,提升生产效率
WHEE安装教程
马斯克发推讽刺人工智能:机器学习的本质就是统计
自研4D激光雷达L1 + GPT大语言模型 宇树Unitree Go2四足机器人有啥黑科技?
Midjourney 5.2震撼发布!原画生成3D场景,无限缩放无垠宇宙
360发布数字安全和人工智能的强大结合:360安全大模型
华为盘古AI模型实现秒级全球气象预报时间缩短
管提需求,大模型解决问题:图表处理神器SheetCopilot上线
三星加速AR眼镜进程,预计明年上半年亮相
猿力科技入选北京市通用人工智能产业创新伙伴计划
值得买科技入选“北京市通用人工智能产业创新伙伴计划”应用伙伴
AIGC浪潮下,联想集团再加码计算与人工智能
京东 AI 大模型官宣 7 月 13 日发布,还有重磅合作
有 ARM 和 X86 两个版本,香橙派游戏掌机细节曝光
OpenOOD更新v1.5:全面、精确的分布外检测代码库及测试平台,支持在线排行榜、一键测试
「从未被制造出的最重要机器」,艾伦·图灵及图灵机那些事
实测 AI 建筑设计软件的自动生成效果图能力
美图秀秀“AI 扩图”功能上线,可根据图像生成更大画幅
提升工作效率的智能工具:Zapier 让工作变得更简单!
AI新视野,增长新势能,伙伴云受邀出席笔记侠创业讲真话AI峰会
上影节直击 | AI技术降低了短片拍摄门槛?金爵奖评委不赞同
微软向美国政府提供GPT大模型,如何保证安全性?
AI成政客博弈工具,美国大选真假难辨,律师们的生意来了
图像生成过程中遭「截胡」:稳定扩散的失败案例受四大因素影响
AI大模型,将为智慧城市带来哪些新变化?
发布最新版本的 PICO OS 5.7.0:支持VR头盔录屏并跨平台分享至微信
360发布AI数字人广场,可同孙悟空、爱因斯坦等古今中外角色对话