发布时间:2023-10-16
点击次数: 本文经AI新媒体量子位(公众号ID:QbitAI)授权转载,转载请联系出处。
万众瞩目之下,今天GPT4终于推送了vision相关的功能。
今天下午抓紧和
小伙伴一起测试了一下GPT对于图像感知的能力,虽有预期,但是还是大大震惊了我们。
核心观点:
我认为自动驾驶中和语义相关的问题应该大模型都已经解决得很好了,但是大模型的可信性和空间感知能力方面仍然不尽如人意。
解决一些所谓和效率相关的corner case应该是绰绰有余,但是想完全依赖大模型去独立完成驾驶保证安全性仍然十分遥远。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

△GPT4的描述
准确的部分:检测到了3辆卡车,前车车牌号基本正确(有汉字就忽略吧),天气和环境正确,在没有提示的情况下准确识别到了前方的未知障碍物。
不准确的部分:第三辆卡车的位置左右不分,第二辆卡车头顶的文字瞎猜了一个(因为分辨率不足?)。
这还不够,我们继续给一点提示,去问这个物体是什么,是不是可以压过去。

Impressive!类似的场景测试了多个,对于未知障碍物的表现可以说非常惊人了。

没有提示能自动识别到标牌这个应该是基操了,我们继续给一些hint。

再次被震惊了。。。能自动讲出来卡车背后的雾气,也主动提到了水坑,但是再一次把方向说成了左侧。。。感觉这里可能需要一些prompt engineering能更好的让GPT输出位置和方向。

第一帧输入进去,因为没有时序信息,只是将右侧的卡车当做是停靠的了。于是再来一帧:

已经可以自动讲出,这辆撞破了护栏,悬停在公路边缘,太棒了。。。但是反而看上去更容易的道路标志出现了错误。。。只能说,这很大模型了,它永远能震惊你也永远不知道什么时候能蠢哭你。。。再来一帧:

这次,直接讲到了路面上的碎片,再次赞叹。。。只不过有一次把路上的箭头说错了。。。总体而言,这个场景中需要特别关注的信息都有覆盖,道路标志这种问题,瑕不掩瑜吧。

只能说非常到位了,相比之下之前看上去无比困难的“有个人冲着你挥了挥手”这样的case就像小儿科一样,语义上的corner case可解。




开始比较保守,并没有直接猜测原因,给了多种猜测,这个也倒是符合alignment的目标。
使用CoT之后问题发现问题是在于并不了解这辆车是个自动驾驶车辆,故通过prompt给出这个信息能给出比较准确的信息。
最后通过一堆prompt,能够输出新铺设沥青,不适合驾驶这样的结论。最终结果来说还是OK,但是过程比较曲折,需要比较多的prompt engineering,要好好设计。
这个原因可能也是因为不是第一视角的图片,只能通过第三视角去推测。所以这个例子并不十分精确。
快速的一些尝试已经完全证明了GPT4V的强大与泛化性能,适当的prompt应当可以完全发挥出GPT4V的实力。
解决语义上的corner case应该非常可期,但幻觉的问题会仍然困扰着一些和安全相关场景中的应用。
非常exciting,个人认为合理使用这样的大模型可以大大加快L4乃至L5自动驾驶的发展,然而是否LLM一定是要直接开车?尤其是端到端开车,仍然是一个值得商榷的问题。
以上就是“大大震惊”一位CTO:GPT-4V自动驾驶五连测的详细内容,更多请关注其它相关文章!
# 中国
# 海南企业seo哪家好
# 榆阳区网站建设排行
# 广西响应式网站建设报价
# seo分析
# 沈阳网站建设规范
# 特教论文网站建设
# 沧州seo怎么选
# seo权重站教程
# 津南区网络营销推广手段
# 为什么有的网站没有优化
# 技术
# 上海
# 前车
# 再来
# 腾讯
# 万元
# 华为
# 中国科学院
# 开源
# 五连
# 自动驾驶
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
海南科技职业大学第25届中国机器人及人工智能大赛海南赛区荣获一等奖等114项
美妆行业在AI时代蓬勃发展
Meta推出VR订阅服务Quest +:每月免费玩两款游戏,7.99美元/月
生成式人工智能进入产业应用!但再“聪明”仍是工具,最终目的是服务于人
华为盘古AI模型实现秒级全球气象预报时间缩短
AI智能室内效果图设计软件效果,确实惊到我了!
羚客系统即将升级,推出全新的AI数字化工具
AI在教育中的角色:AI如何改变我们的学习方式
热点资讯:家乐福推出聊天机器人;米哈游2025年营收273.4亿元…
MiracleVision视觉大模型上线时间
比尔盖茨:AI确实存在风险,但可控
静安大宁功能区企业云天励飞亮相2025世界人工智能大会,秀出AI硬实力!
对艺术家拒绝置若罔闻,Stability AI 将推出适应多种画风的开源模型
AI 冥想应用 Ogimi.ai 推出,可为用户提供教练级个性化指导
时隔 4 年:谷歌更新安卓机器人 LOGO,形象更立体
长宁这家企业在世界人工智能大会上荣获“蓝鼎奖”
普渡机器人与变形金刚品牌合作,特别活动爆火,商品售罄!
闪电快讯|京东推出言犀AI大模型 面向零售、医疗、物流等产业场景
Nature封面:量子计算机离实际应用还有两年
微软AR/VR专利提出使用时间复用谐振驱动产生双极性电源
WHEE功能介绍
大疆 Air 3 无人机售价和实物照片曝光
《爱康未来之夜嘉宾官宣,携手共赴AI未来》
会模仿笔迹的AI,为你创造专属字体
零AI含量!纯随机数学无限生成逼真3D世界火了,普林斯顿华人一作
北京公司实施AI技术,推行4.5天工作制,抵制996文化,提升员工工作幸福感
数字文明尼山对话 | 在东方圣城与AI潮流梦幻联动,看“智慧大脑”让数字山东更美好
智能机器人与话剧的完美结合:宇树四足机器人B1助力《骆驼祥子》重现经典
360°/180°双模式,佳能公布可折叠小体积的VR全景相机
爱设计PPT发布第二代AI一键生成PPT产品:智能、个性化、自动化
亚太地区 70% 的企业高管正探索生成式 AI 应用或已经进行投资
V社悄悄封禁使用AI生成美术素材的游戏
多家欧洲企业签署公开信,批评欧盟 AI 法案草案限制产业发展
Meta开源文本生成音乐大模型,我们用《七里香》歌词试了下
抢占新赛道 加快机器人产业集聚发展
解决导航“最后50米”难题 高德地图升级AR步行导航找终点功能
中美陷入囚徒困境,人工智能变得不可控?可参考核不扩散条约规范
“技术+实践+生态”三箭齐发,京东方抢占物联网高地
Meta 发布 Voicebox AI 模型:可生成音频信息,用于 NPC 对话等
喜马拉雅在国际会议挑战赛中突破语音重叠难题斩获第一 加速AI创新
万兴播爆桌面端上线,支持AI数字人搜索、视频编辑等功能
华为大模型登Nature正刊!审稿人:让人们重新审视预报模型的未来
Win11 的画图应用将包含 Windows Copilot 的 AI 工具整合
用AI技术点亮老照片:Deep Nostalgia带给照片新生动感
《共同的演化》展览启幕,重新思考人类与人工智能关系
清华系面壁智能开源中文多模态大模型VisCPM :支持对话文图双向生成,吟诗作画能力惊艳
能源电力数字化转型恰逢其时
昇思开源社区理事会成立,基于昇思AI框架的全模态大模型“紫东.太初2.0”发布
人工智能颠覆软件测试四大方式
本届人工智能大会上的这个“镇馆之宝”,来自长宁企业西井科技!