400 128 6709

行业新闻

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

发布时间:2024-10-09点击次数:

会议组织者都是 nlp 头部科学家,在语言建模方面有着相当的成果。

随着 AI 领域的快速发展,大模型逐渐成为研究的核心,为了更好地探索这一领域,2025 年,一批知名的青年学者组织了一个名为 COLM(Conference on Language Modeling)的新会议。

该会议的组织者们都是 NLP 头部科学家,在语言建模方面有着相当的成果。他们其中既有来自业界的研究人员,也有来自学术界的研究人员。

在今年的组织者中,有我们熟悉的陈丹琦、Angela Fan 等华人学者。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

COLM 是一个专注于语言建模研究的学术场所,旨在创建一个具有不同科学专业知识的研究人员社区,专注于理解、改进和评论语言模型技术的发展。这不仅是学术界的一次创新尝试,也是搭起了语言模型交流互鉴的新桥梁,进一步促进其探索和合作。

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

接收论文链接:https://colmweb.org/AcceptedPapers.html

刚刚,大会公布了 2025 年杰出论文奖,共有 4 篇论文获奖。

值得一提的是,号称撼动 Transformer 统治地位的 Mamba 也在获奖论文中。

此前,Mamba 这项研究惨遭 ICLR 拒稿,引来学术界轩然大波。

不过,之后 Mamba 原班人马发布的 Mamba-2 顺利拿下了 ICML 2025。如今 Mamba 又获得了 COLM 杰出论文奖,很多网友都送来祝贺。

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

Mamba 作者之一、卡内基梅隆大学机器学习系助理教授 Albert Gu 用一张表情很好的表达了自己的感受,看来「COLM 是真香」。

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

杰出论文奖

论文 1:Dated Data: Tracing Knowledge Cutoffs in Large Language Models

  • 机构:霍普金斯大学

  • 作者:Jeffrey Cheng、Marc Marone、Orion Weller、Dawn Lawrie等

  • 论文地址:https://openreview.net/pdf?id=wS7PxDjy6m

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

大型语言模型 (LLM) 通常有「知识截止日期」,即收集训练数据的时间。该信息对于需要 LLM 提供最新信息的应用场景至关重要。

然而,训练数据中所有子资源是否共享相同的「知识截止日期」?模型响应展示出的知识是否与数据截止值一致?

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

该论文定义了「有效截止」的概念,它与 LLM 报告的「知识截止日期」不同,并且训练数据子资源之间也有所不同。该研究提出了一种简单的方法,通过跨版本的数据探测来估计 LLM 在资源级别的有效截止点。至关重要的是,该方法不需要访问模型的预训练数据。

通过分析,该研究发现有效的截止值通常与报告的截止值有很大不同。为了了解这一观察结果的根本原因,该研究对开放的预训练数据集进行了大规模分析。

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

分析揭示了造成这些不一致的两个主要原因:

  • 由于新 dump 中存在大量旧数据,导致 CommonCrawl 数据出现时间错位; 

  • LLM 重复数据删除方案的复杂性涉及语义重复和词汇近似重复。

论文 2:Mamba: Linear-Time Sequence Modeling with Selective State Spaces

  • 机构:卡内基梅隆大学、普林斯顿大学

    Remover Remover

    几秒钟去除图中不需要的元素

    Remover 304 查看详情 Remover
  • 作者:Albert Gu、Tri Dao

  • 论文地址:https://arxiv.org/pdf/2312.00752

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

自 2017 年被提出以来,Transformer 已经成为 AI 大模型的主流架构,但随着模型规模扩大和处理序列变长,其计算效率问题凸显,特别是在长上下文中,计算量将呈平方级增长。

为解决这一问题,研究者们围绕注意力开发了多种变体,如线性注意力、门控卷积、循环模型、SSMs 等,但它们在语言等模态上的表现并不理想,无法进行基于内容的推理。

基于此,论文作者进行了几项改进。首先,让 SSM 参数成为输入的函数,解决了离散模态的弱点,使模型能根据当前 token 有选择地传播或遗忘信息。

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

这种改动导致卷积效率降低,对模型的计算带来了挑战。论文作者设计了一种硬件感知算法,将先前的 SSM 架构设计与 Transformer 的 MLP 块合并为一个块,简化了深度序列模型架构,形成了一种包含选择性状态空间的简单、同质的架构设计(Mamba)。

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

Mamba 可以随上下文长度的增加实现线性扩展,其性能在实际数据中可提高到百万 token 长度序列,并实现 5 倍的推理吞吐量提升。

作为通用序列模型的骨干,Mamba 在语言、音频和基因组学等多种模态中都达到了 SOTA 性能。在语言建模方面,无论是预训练还是下游评估,他们的 Mamba-3B 模型都优于同等规模的 Transformer 模型,并能与两倍于其规模的 Transformer 模型相媲美。

更多详情,可以参考本站之前的报道:五倍吞吐量,性能全面包围 Transformer:新架构 Mamba 引爆 AI 圈。

论文 3:AI-generated text boundary detection with RoFT

  • 机构:俄罗斯 AI 基金会与算法实验室、英国伦敦玛丽女王大学、日本 Noeon 研究所、斯科尔科沃科学技术学院等

  • 作者:Laida Kushnareva, Tatiana Gaintseva, Dmitry Abulkhanov等

  • 论文地址:https://arxiv.org/pdf/2311.08349

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

随着大语言模型的发展,我们越来越频繁地遇到这样的情况:一篇文章起初可能出自人类之手,但随后可能被 AI 接手加以润色。如何从这种文本中检测出人类写作与机器生成的界限?这是一个具有挑战性的问题,但还尚未得到太多关注。

论文作者试图填补这一空白。他们对最先进的检测方法进行了测试。具体而言,他们采用「真假文本」测试集,测试了在极限情况下,这些方法的表现。「真假文本」测试集包含各种语言模型生成的多个主题的短文本。

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

他们发现,基于困惑度的边界检测方法,在处理特定领域的数据时,比对 RoBERTa 模型进行监督式的方法更加鲁棒。他们还发现了一些特定的文本特征。这些特征可能会干扰边界检测算法的判断,导致算法在处理跨领域的文本时,其性能会下降。

论文 4:Auxiliary task demands mask the capabilities of smaller language models

  • 机构:哈佛大学、斯坦福大学

  • 作者:Jennifer Hu、Michael Frank

  • 论文地址:https://openreview.net/forum?id=U5BUzSn4tD#discussion

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

发展心理学家一直在争论语言理解或心理理论等认知能力何时出现。这些争论通常取决于「任务要求」的概念 —— 与执行特定评估相关的挑战。在衡量语言模型 (LM) 的能力时,任务的性能是模型基础知识的函数,再加上模型在给定可用资源的情况下解释和执行任务的能力。

陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文

该研究表明,对于类比推理、反思推理、单词预测和语法判断,任务要求较高的评估方法比要求减少的评估方法产生的性能更低。对于参数较少和训练数据较少的模型,这种「需求差距」最为明显。实验结果表明,LM 的性能不应被解释为智能(或缺乏智能)的直接表现,而应被解释为通过研究人员设计选择的视角所看到的能力反映。

以上就是陈丹琦等人组织的COLM奖项公布:被ICLR拒稿的Mamba入选杰出论文的详细内容,更多请关注其它相关文章!


# 较少  # seo营销首推11火星软件  # 商丘关键词搜索排名技术  # 网站有没有优化软件推荐  # seo关键词特点  # 广告网站建设及托管服务  # h5营销的推广要点  # 黄冈seo服务机构排名  # 教育行业活动推广营销  # 经验范围 网站建设  # 营销手段和推广形式区别  # 普林斯顿  # 产业  # 门控  # 不需要  # 进行了  # 截止日期  # 都是  # 的是  # 这一  # 等人  # type  # follow  # colmo 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: Meta发布"类人"AI图像创建模型,能解决多出手指等Bug  最大助力35公斤 外骨骼机器人或在养老、医疗领域“大展身手”  喜马拉雅在国际会议挑战赛中突破语音重叠难题斩获第一 加速AI创新  云鲸发布全新的扫拖机器人J4系列  下一个前沿:量子机器学习和人工智能的未来  2025年贵州省青少年机器人竞赛在安举行  十个AI算法常用库J*a版  如何用AI重塑你的工作流(一)  一图速览 | 十大脑机接口关键技术发布  Spotify计划推出AI驱动的音乐播放器功能  业内领先 四川大学华西第四医院甲状腺乳腺外科成功进入手术机器人时代  世界水下机器人大赛:9国青年携手逐梦深蓝  可按用户语气自动回复消息,Zoom 推出基于生成式 AI 的新功能  AYANEO AIR 1S 掌机发布:R7 7840U,预订价 4699 元起  AI生成会议纪要 百度如流升级推出超级助手、智能编码等功能  第四范式“式说”大模型入选《2025年通用人工智能创新应用案例集》  谷歌 Gmail“帮我写电子邮件”AI 功能开始向安卓和苹果设备推广  抛媚眼给瞎子看?微软、谷歌的AI广告被广告主抵制  微软为 AI 初学者推出免费网课:为期 12 周,共 24 节课  英伟达的AI领域垄断地位:一直无法撼动吗?  周鸿祎参加中美青年科技创新峰会,分享人工智能创新机遇  联通发布鸿湖图文AI大模型1.0,可实现以文生图  AI数字人业务频频获点赞,谦寻积极引领示范作用  OpenAI限制网络爬虫访问以保护数据免被用于AI模型训练  普渡机器人与变形金刚品牌合作,特别活动爆火,商品售罄!  拓普龙7188ML:轻便壁挂式工控机箱,为人工智能应用场景提供有力保障  英伟达H100霸榜权威AI性能测试 11分钟搞定基于GPT-3的大模型训练  国产医疗企业的人工智能  传Meta 2025年推出首款AR眼镜,采用军用级别材料,计划生产1000台  生成式AI引路产业加速来袭,微美全息探索“AIGC+虚拟人”融合应用  探索人工智能在物联网领域的影响与改变  五款 AI 网站构建器,任何人都能快速构建网站  小米9号员工李明宣布创业:打造首款安卓桌面机器人  创作音乐/音频的Meta开源AI工具AudioCraft,让用户通过文本提示实现  推动企业数字化转型升级!“松江智造”摘世界人工智能大会重磅奖项  MiracleVision视觉大模型  618京东3C数码趋势产品备受青睐 AR设备成交额同比增长15倍  马斯克WAIC2025演讲全文:AI将对人类文明产生深远影响  “世界人工智能之都”的新烦恼:AI热潮无法拉动大量就业  人工智能赋能广西自然资源领域监测监管  联想首发AI PC于今年秋季,英特尔CEO确认AI PC时代来临  AI大举入侵内容行业,哪些上市*及动漫公司进行了布局?  日媒关注中国推进鸟类识别 AI 普及,除监测保护外还可预防传染性疾病  社区里,孩子们体验“机器人竞技”  周鸿祎:用超级AI实现室温超导和核聚变,实现能源自由  机构研选 | 虚拟电厂是电力物联网升级版 智能电网望迎来高速发展  上天下海登极,青岛与昇腾AI握手一起探索星辰大海  2025世界人工智能大会成功召开  兆讯传媒率先全面拥抱AI 数智广告内容焕发新生机  尼康尼克尔 Z 180-600mm f/5.6-6.3 VR 镜头发布,12499 元 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司