400 128 6709

行业新闻

人类轻松看懂,顶级AI却集体翻车!文字测试暴露AI致命弱点

发布时间:2025-11-01点击次数:

人类轻而易举就能识别的文字,ai模型却集体“失明”。来自a*star、新加坡国立大学(nus)、南洋理工大学(ntu)、清华大学、南开大学等机构的联合研究团队揭示了一个令人震惊的现象:无论是openai的gpt-5、gpt-4o,谷歌的gemini系列,anthropic的claude,还是国内的通义千问(qwen)、ll*a等顶尖视觉语言模型,在面对某些“看得见但读不懂”的文字时,几乎全部表现糟糕,彻底“翻车”。

这项研究由VYU团队主导,设计了两个巧妙实验。

第一个实验选取100个常见四字成语,将每个汉字进行横切、竖切或斜切,随后打乱碎片并重新拼接。尽管这些文字在视觉上被严重破坏,人类仍能轻松还原其含义。然而,几乎所有测试中的AI模型都未能正确识别,错误率极高。

第二个实验聚焦英文,挑选100个八字母单词,将其前半部分用红色显示,后半部分用绿色显示,并将两者叠加成一张图像。由于人眼对红绿通道具有高度分辨能力,大脑可自动分离颜色信息并整合出完整词义——这对人类而言几乎毫无难度。但AI模型却频频出错,即便是最新发布的Gemini 2.5 Pro、Kimi 2(Switch to 1.5 for visual understanding)、Qwen3-Max-Preview等强大模型,也无法稳定输出正确结果。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

VYU团队深入分析指出,问题根源在于AI缺乏真正的“理解”机制。当前大模型依赖的是大规模数据中的模式匹配,而非对文字结构的认知。人类之所以能轻松解读变形或重叠的文字,是因为我们具备关于文字构成的先验知识:汉字由偏旁部首组合而成,英文单词按字母序列排列。这种结构性认知使我们能在信息残缺或干扰下依然准确解码。

而AI模型则不同,它们将文字视为整体图像块来处理,缺少符号分割与语义重组的能力。一旦文字形态发生非标准变化,哪怕只是轻微扰动,模型就会陷入混乱,无法提取有效语义。

这一发现具有深远意义,直指AI落地应用中的核心瓶颈。

在教育场景中,学生手写笔记可能存在涂改、连笔或不规范书写,若AI无法准确识别,则智能批改、个性化辅导等功能将大打折扣;在无障碍技术中,视障辅助系统若不能稳健解析复杂排版或模糊文本,用户体验将受限;在古籍数字化和科研档案整理中,面对褪色、破损或重叠书写的原始资料,AI可能远不如人工高效可靠。

GemDesign GemDesign

AI高保真原型设计工具

GemDesign 652 查看详情 GemDesign

更值得警惕的是安全风险:攻击者可能利用这一“视觉盲区”,通过构造AI无法识别但人类可读的隐蔽文本,绕过内容审核、恶意信息检测等AI驱动的安全防线。

VYU团队呼吁,要让AI获得类似人类的阅读韧性,必须重新审视现有视觉语言模型(VLMs)的设计范式。未来方向可能包括:引入更具结构感知能力的训练数据、构建强调字符分割与组合的先验知识模块,或是探索全新的多模态融合架构。

更重要的是,这项研究再次提醒我们:人类的阅读绝非简单的“看图识字”,而是一个融合视觉感知、语言结构、上下文推理乃至常识判断的复杂认知过程。我们在阅读时,大脑会调动多种神经通路协同工作,实现快速解码与深层理解。

相比之下,当前AI还停留在表层模式识别阶段,距离真正的“理解”仍有本质差距。

这也意味着,在通往通用人工智能的道路上,我们仍需持续突破基础理论与模型架构的局限。不能止步于性能提升的表面成果,而应深入探究认知机理,推动AI向更具鲁棒性、解释性和类人智能的方向演进。

论文链接:https://www.php.cn/link/2e93fad1e91614dbea27879646a09bd6

以上就是人类轻松看懂,顶级AI却集体翻车!文字测试暴露AI致命弱点的详细内容,更多请关注其它相关文章!


# git  # github  # 人工智能  # 谷歌  # ai  # switch  # gemini  # 南洋  # 网络营销实战推广  # 就会  # 云南曲靖网站建设价格  # 深圳微博营销推广  # seo优化可靠吗  # 蛋仔营销号有哪些渠道推广  # 渭南专业网站优化怎么做  # 淘小铺推广营销案例分享  # 长沙全网营销推广收费  # 朝阳抖音seo费用  # 洛阳全域营销推广招聘网  # 看懂  # 南开大学  # 直接进入  # 网址大全  # 更具  # 这一  # 官网  # 的是  # gpt-4  # gpt  # openai  # pdf 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: BLIP-2、InstructBLIP稳居前三!十二大模型,十六份榜单,全面测评「多模态大语言模型」  遵义市首次引入手术机器人,成功实施全膝关节置换术  一公司推出喷火机器狗,可喷出 9 米长火焰  OpenAI首席执行官表态支持欧盟AI监管  人工智能行业急缺人 AI人才年薪能达近42万元  阿里大文娱CTO郑勇:生成式AI将引发内容行业巨变,*制作机会挑战并存  ​日媒:AI高效解析纳斯卡地画  基于预训练模型的金融事件分析及应用  美图第二届影像节发布七款AI影像创作工具  机器人 展才能  机构研选 | 虚拟电厂是电力物联网升级版 智能电网望迎来高速发展  麦肯锡:到 2045 年左右,将有 50% 工作被 AI 接管  真全息产品,亮相深圳文博会——dipal数伴拓展元宇宙非沉浸式体验  世界人工智能大会中西部县域数字就业中心组团亮相  中美陷入囚徒困境,人工智能变得不可控?可参考核不扩散条约规范  AI生成会议纪要 百度如流升级推出超级助手、智能编码等功能  《自然》杂志拒绝刊登人工智能生成的图片和视频  从医疗康复外骨骼到通用人形机器人,傅利叶智能推动核心技术升级  阿里云推出通义万相AI绘画大模型  微软商店 AI 摘要功能开启预览,帮助用户迅速了解应用评价  配 3D 机器人头像,谷歌展示全新安卓 LOGO  斑马推出全新升级版思维机:以人工智能为核心的交互式学习体验  警惕!AI或致虚假信息泛滥  美图影像节演讲实录:191次提及AI,发布7款影像生产力工具  AI 冥想应用 Ogimi.ai 推出,可为用户提供教练级个性化指导  软通动力多项AI创新产品及应用亮相2025世界人工智能大会  AI赋能艺术 超现实达利奇幻之旅在沪开启  基于信息论的校准技术,CML让多模态机器学习更可靠  比尔盖茨:AI确实存在风险,但可控  马斯克回应人工智能拯救世界:人类已处于“半机器人”状态  如布科技发布新产品AI口袋学习机S12  “痴迷”元宇宙,魔珐科技想做什么?  “长沙造”无人机,领先的不止植保  大模型训练成本降低近一半!新加坡国立大学最新优化器已投入使用  阿里云连续两年进入Gartner云AI开发者“挑战者象限”  OpenAI更新GPT-4等模型,新增API函数调用,价格最高降75%  吉林首例!机器人辅助下搭桥手术成功实施  大模型的“黄金搭档”来了!腾讯云正式发布AI原生向量数据库,提供10亿级向量检索能力  宇宙探索下一阶段,机器代替人类,AI会在太空探索中取代人类吗?  走进首家“元宇宙”未来工厂,卡奥斯探知工业之旅出发!  “技术+实践+生态”三箭齐发,京东方抢占物联网高地  AI数字人业务频频获点赞,谦寻积极引领示范作用  云深处科技绝影 Lite3 与 X20 四足机器人亮相  乐天派AI桌面机器人提供的正能量情绪价值直接拉满,妥妥的治愈系  RoboNeo什么时候上线  看懂AI,找到增长新势能 | 笔记侠AI峰会等你来  一文看懂基础模型的定义和工作原理  七大主流AI企业包括OpenAI、谷歌等联合承诺:引入水印技术,并允许第三方审核AI内容  无人机巡检方案是什么,该如何选择适合的巡检方案  套娃不可取:研究人员证实用AI生成的结果训练AI将导致模型退化 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司