400 128 6709

行业新闻

小米开源首个原生端到端语音大模型 Xiaomi-MiMo-Audio

发布时间:2025-09-19点击次数:

小米正式宣布开源其首个原生端到端语音模型——xiaomi-mimo-audio。该模型基于创新的预训练架构,并利用超过一亿小时的海量语音数据进行训练,首次在语音领域实现了基于上下文学习(icl)的少样本泛化能力,且在预训练过程中观察到了显著的“涌现”现象。

官方指出,经过后训练优化,Xiaomi-MiMo-Audio 在智能理解、情感表达、语音表现力以及安全性等方面展现出卓越的跨模态对齐能力,使得语音交互在自然度、情绪传递和对话连贯性上达到了高度拟人化的水平。

Xiaomi-MiMo-Audio 的核心性能表现如下:

  • 在多项通用语音理解与对话评测基准中,MiMo-Audio 显著优于同规模参数的开源模型,成为当前 7B 级别中性能最强的开源语音模型
  • 在音频理解任务标准测试集 MMAU 上,性能超越 Google 的闭源模型 Gemini-2.5-Flash
  • 在面向复杂音频推理的 Big Bench Audio S2T 基准中,同样超过了 OpenAI 的闭源语音模型 GPT-4o-Audio-Preview

小米开源首个原生端到端语音大模型 Xiaomi-MiMo-Audio

Xiaomi-MiMo-Audio 的主要技术突破包括:

  • 首次验证:将语音无损压缩下的预训练规模扩展至 1 亿小时,可“涌现”出跨任务的泛化能力,展现出强大的 Few-Shot Learning 特性,标志着语音领域的“GPT-3 时刻”到来

小米开源首个原生端到端语音大模型 Xiaomi-MiMo-Audio

PictoGraphic PictoGraphic

AI驱动的矢量插图库和插图生成平台

PictoGraphic 133 查看详情 PictoGraphic
  • 全球首个明确定义生成式语音预训练目标并完整开源整套语音预训练体系的项目,涵盖无损压缩 Tokenizer、全新模型结构、训练流程与评估标准,开启语音技术的“LLaMA 时刻”

小米开源首个原生端到端语音大模型 Xiaomi-MiMo-Audio

  • 首个在语音理解与生成过程中同时引入“思考(Thinking)”机制的开源模型,支持混合式思维推理

模型构成:

  • MiMo-Audio-7B-Base:预训练基础模型,是目前开源生态中首个具备语音续写能力的端到端语音模型
  • MiMo-Audio-7B-Instruct:经轻量级指令微调(SFT)后的版本,在7B参数量级下实现领先的语音理解与生成性能

MiMo-Audio-7B-Instruct 支持通过 prompt 切换 non-thinking 与 thinking 两种运行模式,具备高起点强化学习(RL)潜力,可作为语音领域 RL 与 Agentic 行为研究的理想基座模型。

此外,小米还同步开源了 MiMo-Audio 的 Tokenizer 模型:

  • 参数规模达 1.2B,采用 Transformer 架构,兼顾高效性与建模能力
  • 从零开始训练,覆盖超千万小时真实语音数据
  • 同时支持高保真音频重建与音频转文本(A2T)双重任务

以上就是小米开源首个原生端到端语音大模型 Xiaomi-MiMo-Audio的详细内容,更多请关注其它相关文章!


# 小米  # ai  # go  # 微软  # 核心关键字seo收费低  # 广州网站建设技术托管  # 有什么网站推广赚钱  # 绍兴装修网站建设排名  # 菏泽互联网seo方案  # 开盘前后营销推广  # 天河头条seo价格  # 拼多多网站建设建议  # 以往  # 编程工具  # 过程中  # 可享受  # 印度  # 首次  # 端到  # 首个  # 开源  # gemini  # 大模型  # google  # gpt-4  # gpt  # openai  # 宣威企业网站建设要求  # 百度seo收录培训 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: 清华朱军团队新作:使用4位整数训练Transformer,比FP16快2.2倍,提速35.1%,加速AGI到来!  “上海市民营企业人工智能赋能创新中心”揭牌成立  学而思网校推出首个基于自研大模型的《人工智能第一课》  人工智能在交通领域的革新:智能解决方案彻底改变交通方式  华为推出全新操作系统HarmonyOS 4,AI和新引擎完美融合  实践J*a开发,构建高性能的MongoDB数据迁移工具  硅谷人工智能研究院创始人皮埃罗·斯加鲁菲:Transformer模型演讲  海南科技职业大学第25届中国机器人及人工智能大赛海南赛区荣获一等奖等114项  时隔 4 年:谷歌更新安卓机器人 LOGO,形象更立体  《共同的演化》展览启幕,重新思考人类与人工智能关系  科技数码圈的新物种 乐天派桌面机器人 AI +安卓+机器人 首发价1799元  创新科学家成功研发FAST激光靶标维护机器人  参考封面|人工智能“淘金热”  九号公司主导制定短途交通和送物机器人领域首个国际标准,标志着零的突破发布  一公司推出喷火机器狗,可喷出 9 米长火焰  对话式论文阅读工具PaperMate上线,综述细节AI告诉你  对艺术家拒绝置若罔闻,Stability AI 将推出适应多种画风的开源模型  AI+音乐如何“生成”动听旋律?一起揭秘世界人工智能大会开场曲  Meta将VR头显最低年龄限制从13岁降至10岁  开创全新虚拟现实体验的Pimax Crystal VR头显  大模型训练成本降低近一半!新加坡国立大学最新优化器已投入使用  全媒封面丨⑤商汤科技:原创AI算法“发电厂”  昇腾AI大模型训推一体化解决方案将在WAIC发布  周鸿祎参加中美青年科技创新峰会,分享人工智能创新机遇  机智云AI离线语音识别模组,让家电变得更加智能便捷  羚客系统即将升级,推出全新的AI数字化工具  马斯克反讽人工智能AI炒作:“机器学习”本质就是统计  Meta Quest订阅服务每月7.99美元畅玩两款VR游戏应用  大模型新品出现井喷,AI产业迎来新时代  湖北科技职业学院举行工业机器人及智能制造技术专精特新产业学院建设启动仪式  探展WAIC |万向区块链杜宇:不存在单一技术的iPhone时刻,Web3.0核心将基于AI+区块链+物联网  微软向美国政府提供GPT大模型,如何保证安全性?  郭帆导演成功利用AI技术制作的《流浪地球3》预告片在央视热播,引发巨大反响  Win11 的画图应用将包含 Windows Copilot 的 AI 工具整合  美图影像节演讲实录:191次提及AI,发布7款影像生产力工具  统信深度deepin成立 AI SIG 社区,共同提升 Linux 下 AI 体验  AI证件照生成器:实际测试中AI软件展现了绝无仅有的强大效能  一文读懂自动驾驶的激光雷达与视觉融合感知  华为昇腾AI原生支持30多种基础大模型,包括GPT  从医疗康复外骨骼到通用人形机器人,傅利叶智能推动核心技术升级  ​日媒:AI高效解析纳斯卡地画  构建数字文旅新高地!洛阳涧西区开启元宇宙时代  直击上影节 | 光线传媒董事长王长田谈新技术:未来VR放映效果可能媲美影院  电力人工智能数据集目录首次发布  人工智能和你聊天 成本有多高  鸿蒙智能座舱的AI大模型革新,引领智能座舱领域的变革吗?  深圳人工智能企业超1900家  读创正式上线“读创AI聊”功能  剧透!蜜小豆@2025世界人工智能大会多个亮点曝光  30+大模型齐聚,大模型成世界人工智能大会“顶流” 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司