发布时间:2025-11-01
点击次数: 人类轻而易举就能识别的文字,ai模型却集体“失明”。来自a*star、新加坡国立大学(nus)、南洋理工大学(ntu)、清华大学、南开大学等机构的联合研究团队揭示了一个令人震惊的现象:无论是openai的gpt-5、gpt-4o,谷歌的gemini系列,anthropic的claude,还是国内的通义千问(qwen)、ll*a等顶尖视觉语言模型,在面对某些“看得见但读不懂”的文字时,几乎全部表现糟糕,彻底“翻车”。
这项研究由VYU团队主导,设计了两个巧妙实验。
第一个实验选取100个常见四字成语,将每个汉字进行横切、竖切或斜切,随后打乱碎片并重新拼接。尽管这些文字在视觉上被严重破坏,人类仍能轻松还原其含义。然而,几乎所有测试中的AI模型都未能正确识别,错误率极高。
第二个实验聚焦英文,挑选100个八字母单词,将其前半部分用红色显示,后半部分用绿色显示,并将两者叠加成一张图像。由于人眼对红绿通道具有高度分辨能力,大脑可自动分离颜色信息并整合出完整词义——这对人类而言几乎毫无难度。但AI模型却频频出错,即便是最新发布的Gemini 2.5 Pro、Kimi 2(Switch to 1.5 for visual understanding)、Qwen3-Max-Preview等强大模型,也无法稳定输出正确结果。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

VYU团队深入分析指出,问题根源在于AI缺乏真正的“理解”机制。当前大模型依赖的是大规模数据中的模式匹配,而非对文字结构的认知。人类之所以能轻松解读变形或重叠的文字,是因为我们具备关于文字构成的先验知识:汉字由偏旁部首组合而成,英文单词按字母序列排列。这种结构性认知使我们能在信息残缺或干扰下依然准确解码。
而AI模型则不同,它们将文字视为整体图像块来处理,缺少符号分割与语义重组的能力。一旦文字形态发生非标准变化,哪怕只是轻微扰动,模型就会陷入混乱,无法提取有效语义。
这一发现具有深远意义,直指AI落地应用中的核心瓶颈。
在教育场景中,学生手写笔记可能存在涂改、连笔或不规范书写,若AI无法准确识别,则智能批改、个性化辅导等功能将大打折扣;在无障碍技术中,视障辅助系统若不能稳健解析复杂排版或模糊文本,用户体验将受限;在古籍数字化和科研档案整理中,面对褪色、破损或重叠书写的原始资料,AI可能远不如人工高效可靠。
GemDesign
AI高保真原型设计工具
652
查看详情
更值得警惕的是安全风险:攻击者可能利用这一“视觉盲区”,通过构造AI无法识别但人类可读的隐蔽文本,绕过内容审核、恶意信息检测等AI驱动的安全防线。
VYU团队呼吁,要让AI获得类似人类的阅读韧性,必须重新审视现有视觉语言模型(VLMs)的设计范式。未来方向可能包括:引入更具结构感知能力的训练数据、构建强调字符分割与组合的先验知识模块,或是探索全新的多模态融合架构。
更重要的是,这项研究再次提醒我们:人类的阅读绝非简单的“看图识字”,而是一个融合视觉感知、语言结构、上下文推理乃至常识判断的复杂认知过程。我们在阅读时,大脑会调动多种神经通路协同工作,实现快速解码与深层理解。
相比之下,当前AI还停留在表层模式识别阶段,距离真正的“理解”仍有本质差距。
这也意味着,在通往通用人工智能的道路上,我们仍需持续突破基础理论与模型架构的局限。不能止步于性能提升的表面成果,而应深入探究认知机理,推动AI向更具鲁棒性、解释性和类人智能的方向演进。
论文链接:https://www.php.cn/link/2e93fad1e91614dbea27879646a09bd6
以上就是人类轻松看懂,顶级AI却集体翻车!文字测试暴露AI致命弱点的详细内容,更多请关注其它相关文章!
# git
# github
# 人工智能
# 谷歌
# ai
# switch
# gemini
# 南洋
# 网络营销实战推广
# 就会
# 云南曲靖网站建设价格
# 深圳微博营销推广
# seo优化可靠吗
# 蛋仔营销号有哪些渠道推广
# 渭南专业网站优化怎么做
# 淘小铺推广营销案例分享
# 长沙全网营销推广收费
# 朝阳抖音seo费用
# 洛阳全域营销推广招聘网
# 看懂
# 南开大学
# 直接进入
# 网址大全
# 更具
# 这一
# 官网
# 的是
# gpt-4
# gpt
# openai
# pdf
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
BLIP-2、InstructBLIP稳居前三!十二大模型,十六份榜单,全面测评「多模态大语言模型」
遵义市首次引入手术机器人,成功实施全膝关节置换术
一公司推出喷火机器狗,可喷出 9 米长火焰
OpenAI首席执行官表态支持欧盟AI监管
人工智能行业急缺人 AI人才年薪能达近42万元
阿里大文娱CTO郑勇:生成式AI将引发内容行业巨变,*制作机会挑战并存
日媒:AI高效解析纳斯卡地画
基于预训练模型的金融事件分析及应用
美图第二届影像节发布七款AI影像创作工具
机器人 展才能
机构研选 | 虚拟电厂是电力物联网升级版 智能电网望迎来高速发展
麦肯锡:到 2045 年左右,将有 50% 工作被 AI 接管
真全息产品,亮相深圳文博会——dipal数伴拓展元宇宙非沉浸式体验
世界人工智能大会中西部县域数字就业中心组团亮相
中美陷入囚徒困境,人工智能变得不可控?可参考核不扩散条约规范
AI生成会议纪要 百度如流升级推出超级助手、智能编码等功能
《自然》杂志拒绝刊登人工智能生成的图片和视频
从医疗康复外骨骼到通用人形机器人,傅利叶智能推动核心技术升级
阿里云推出通义万相AI绘画大模型
微软商店 AI 摘要功能开启预览,帮助用户迅速了解应用评价
配 3D 机器人头像,谷歌展示全新安卓 LOGO
斑马推出全新升级版思维机:以人工智能为核心的交互式学习体验
警惕!AI或致虚假信息泛滥
美图影像节演讲实录:191次提及AI,发布7款影像生产力工具
AI 冥想应用 Ogimi.ai 推出,可为用户提供教练级个性化指导
软通动力多项AI创新产品及应用亮相2025世界人工智能大会
AI赋能艺术 超现实达利奇幻之旅在沪开启
基于信息论的校准技术,CML让多模态机器学习更可靠
比尔盖茨:AI确实存在风险,但可控
马斯克回应人工智能拯救世界:人类已处于“半机器人”状态
如布科技发布新产品AI口袋学习机S12
“痴迷”元宇宙,魔珐科技想做什么?
“长沙造”无人机,领先的不止植保
大模型训练成本降低近一半!新加坡国立大学最新优化器已投入使用
阿里云连续两年进入Gartner云AI开发者“挑战者象限”
OpenAI更新GPT-4等模型,新增API函数调用,价格最高降75%
吉林首例!机器人辅助下搭桥手术成功实施
大模型的“黄金搭档”来了!腾讯云正式发布AI原生向量数据库,提供10亿级向量检索能力
宇宙探索下一阶段,机器代替人类,AI会在太空探索中取代人类吗?
走进首家“元宇宙”未来工厂,卡奥斯探知工业之旅出发!
“技术+实践+生态”三箭齐发,京东方抢占物联网高地
AI数字人业务频频获点赞,谦寻积极引领示范作用
云深处科技绝影 Lite3 与 X20 四足机器人亮相
乐天派AI桌面机器人提供的正能量情绪价值直接拉满,妥妥的治愈系
RoboNeo什么时候上线
看懂AI,找到增长新势能 | 笔记侠AI峰会等你来
一文看懂基础模型的定义和工作原理
七大主流AI企业包括OpenAI、谷歌等联合承诺:引入水印技术,并允许第三方审核AI内容
无人机巡检方案是什么,该如何选择适合的巡检方案
套娃不可取:研究人员证实用AI生成的结果训练AI将导致模型退化