发布时间:2024-12-21
点击次数: 智源研究院发布2025年下半年大模型评测结果,评估涵盖100余个开源及闭源模型。此次评测在5月份评估基础上,扩展了任务
类型,新增数据处理、高级编程、工具调用及金融量化交易场景评估等;并首次采用模型辩论方式进行对比评估。
评测结果显示,下半年大模型发展更注重综合能力提升及实际应用。多模态模型发展迅速,而语言模型发展相对放缓。开源生态中,除原有贡献者外,也涌现出新的参与者。
综合榜单:多模态模型表现抢眼
评测涵盖文本、语音、图像、视频理解与生成等多种模态。语言模型方面,虽然在一般中文场景下能力趋于饱和,但在复杂场景中,国内头部模型与国际一流水平仍存在差距。 字节跳动Doubao-pro-32k-preview和百度ERNIE 4.0 Turbo在主观评测中表现领先;OpenAI o1-mini-2025-09-12和Google Gemini-1.5-pro-latest在客观评测中位居前列。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

视觉语言多模态模型方面,优秀开源模型在图文理解任务上正逐渐缩小与闭源模型的差距,但长尾视觉知识、文字识别和复杂图文数据分析能力仍有提升空间。OpenAI GPT-4o-2025-11-20和字节跳动Doubao-Pro-Vision-32k-241028表现突出。

文生图模型方面,头部模型已具备中文文字生成能力,但复杂场景下人物变形问题仍存在。腾讯Hunyuan Image排名第一。
文生视频模型方面,画质和动态效果提升显著,但动作变形、物理规律理解不足等问题依然存在。快手可灵1.5(高品质)表现领先。

语音语言模型方面,受益于文本大模型的进步,能力大幅提升,但与专业模型仍存在差距。阿里巴巴Qwen2-Audio表现最佳。

专项评测:K12学科测试及模型辩论
Tunee AI
新一代AI音乐智能体
1104
查看详情
K12学科测试显示,模型综合得分较半年前提升12.86%,但在部分学科上仍与人类学生存在差距。部分模型在英语和历史科目中表现优于人类平均水平。

模型辩论平台FlagEval Debate的评测结果显示,Anthropic Claude-3-5-sonnet-20251022、零一万物Yi-Lighting、OpenAI o1-preview-2025-09-12在逻辑推理、观点理解和语言表达方面表现出色。

金融量化交易评测显示,深度求索Deepseek-chat、OpenAI GPT-4o-2025-08-06、Google Gemini-1.5-pro-latest在生成量化交易策略代码方面表现领先。

FlagEval评测平台持续迭代
FlagEval平台已覆盖全球800多个开闭源模型,包含20多种任务和90多个数据集。本次评测更新了98%的题目,并提升了难度,以应对数据集泄露和饱和度问题。

智源研究院将继续致力于打造科学、权威、公正、开放的大模型评测体系,为大模型技术生态发展提供持续的洞察。 2025年,FlagEval将进一步探索动态评测和多任务能力评估体系。
以上就是智源发布FlagEval「百模」评测结果,丈量模型生态变局的详细内容,更多请关注其它相关文章!
# 多家
# 榆社网站建设企业
# 长春的网站建设情况
# 服务关键词排名项目
# 南沙网站推广设计
# 网站短视频推广公司排名
# url如何优化网站
# 优酷营销推广员招聘信息
# 长沙天眼seo优化技巧
# seo关键词排名工
# 美国内衣推广网站有哪些
# 文档
# 下半年
# 内测
# 生命科学
# 多模
# 产业
# 但在
# 智源
# 多个
# 开源
# deepseek
# 2025
# 2025年
# gemini
# claude
# 百度
# ai
# 快手
# flageval
# 智源研究院
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
【趋势周报】全球人工智能产业发展趋势:OpenAI向美国专利局提交“GPT-5”商标申请
人工智能加速走进百姓生活:从2025全球人工智能技术大会看行业新趋势
以计算机视觉技术为基础的库存管理如何改革零售行业
B站内测 AI 搜索功能,输入“?”即可体验
优化系统韧性:故障恢复与监控在RabbitMQ中的应用
AI技术加速迭代:周鸿祎视角下的大模型战略
联想创投携手12家被投企业MWC展示元宇宙、机器人等技术
QQ音乐业内率先推出「AI一起听」功能,领取你的AI听歌助手
学生作文评分的新趋势:教师与AI的合作模式
央视报道车载人机交互技术!MWC上海魅族表现亮眼,现场热火朝天
AI 程序 Text With Jesus 在海外迅速受到关注:与耶稣和撒旦进行对话
陈丹琦ACL学术报告来了!详解大模型「*」数据库7大方向3大挑战,3小时干货满满
一文读懂自动驾驶的激光雷达与视觉融合感知
研究表明 GPT-4 模型具备自我纠错能力,有望推动 AI 代码进一步商业化
长宁这家企业在世界人工智能大会上荣获“蓝鼎奖”
郭帆:AI发展日新月异,或是弯道超车好莱坞的最好机会
联想举办2025创新开放日,展出260余项算力及AI产品技术
DragGAN开源三天Star量23k,这又来一个DragDiffusion
生活垃圾智能分类机器人社区展“才能”,征求居民意见
眼球反射解锁3D世界,黑镜成真!马里兰华人新作炸翻科幻迷
Meta Connect 2025已确定时间为9月27-28,主题涵盖Quest 3与AI技术
马斯克嘲讽人工智能:机器学习本质就是统计学
全国青少年无人机大赛重庆市选拔赛开赛 1252名中小学生参加
AI 冥想应用 Ogimi.ai 推出,可为用户提供教练级个性化指导
直击上影节 | 光线传媒董事长王长田谈新技术:未来VR放映效果可能媲美影院
联想浏览器引入小乐 AI 助手,成功接入百度文心一言大模型,经过实测证实
从医疗康复外骨骼到通用人形机器人,傅利叶智能推动核心技术升级
测试框架-安全和自动驾驶
李开复官宣新公司「零一万物」,进军 AI 2.0
朱民:普通人炒股炒不过机器人是很正常的 AI已经能理解市场情绪
Meta 发布 Voicebox AI 模型:可生成音频信息,用于 NPC 对话等
通用医疗人工智能如何革新医疗行业?
陈根:AI工具为游戏软件实时3D内容助力
小米创始人雷军将揭示小米AI在年度演讲中的最新进展
挤爆服务器,北大法律大模型ChatLaw火了:直接告诉你张三怎么判
谷歌推出RT-2视觉语言动作模型,使机器人能够掌握垃圾丢弃技能
GPT-4使用混合大模型?研究证明MoE+指令调优确实让大模型性能超群
阿里达摩院向公众免费开放100项AI专利许可
华为云发布华为云盘古模型3.0和升腾AI云服务,亮点亮相2025华为开发者大会
第二届光合组织AI解决方案大赛赛果揭晓
周鸿祎参加中美青年科技创新峰会,分享人工智能创新机遇
OpenAI 静默关闭 AI 文本检测工具,准确率仅为 26%
海柔创新携手SAP,以机器人技术助力全球客户升级数智化竞争力
“苏南 vs 苏北” AI 分胜负,娱乐性比较工具 EitherChoice 上线
阿里达摩院发布免费开放100项AI专利许可的动机是什么?
金山办公宣布与英伟达团队合作,加速WPS AI服务
全媒封面丨⑤商汤科技:原创AI算法“发电厂”
利用AI探索抗体“钥匙”、加速药物研发——访百图生科团队
利用AI技术更好地发展农村电商
《流浪地球2》里机器人公司的创始人:未来10年,机器人的崛起!