发布时间:2024-04-23
点击次数: 项目链接:https://nianticlabs.github.io/mickey/
给定两张图片,可以通过建立图片之间的对应关系来估计它们之间的相机姿态。通常,这些对应关系是二维到二维的,而我们估计的姿态在尺度上是不确定的。一些应用,例如随时随地实现即时增强现实,需要尺度度量的姿态估计,因此它们依赖于外部的深度估计器来恢复尺度。
本文提出了MicKey,这是一个关键点匹配流程,能够够预测三维相机空间中的度量对应关系。通过学习跨图像的三维坐标匹配,我们能够在没有深度测试的情况下推断出度量相对姿态。训练过程中也不需要深度测试,也不需要场景重建或图像重叠信息。MicKey仅通过图像对及其相对姿态进行监督。MicKey在无需地图的重新定位基准测试中取得了最先进的性能,同时所需的监督少于其他竞争方法。

“Metric+Keypoints(MicKey)是一个特征检测流程,解决了两个问题。首先,MicKey回归相机空间中的关键点位置,这允许通过描述符匹配建立度量量对应关系。从度量对应关系中,可以恢复度量相对姿态,如图1所示。其次,通过使用可微分的姿态优化进行端到端的训练,MicKey只需要图像对及其真实相对姿态进行监督。在训练过程中不需要深度测量。MicKey隐藏地学习关键点的正确深度,并且仅对实际找到的准确的特征区域进行学习。我们的训练过程对视觉重叠未知的图像对具有鲁棒性,因此,通过SFM获得的信息(如图像重叠)是不需要的。这种弱监督使得MicKey非常易于访问和吸引人,因为在新领域上训练它不需要除了姿态之外的任何额外信息。”
在无需地图的重新定位基准测试中,MicKey名称前茅,超越了最近最先进的方法。MicKey提供了可靠的尺度度量姿态估计,即使在由特定针对稀疏特征匹配的深度预测所支持的极端视角变化下也是如此。这种精度支持的极端视角变化下的变化下的变形匹配,使MicKey成为支持由特定针对稀疏特征匹配的深度预测所支持的深度估计匹配所必需的深度估计的理想选择。
主要贡献如下:
MicKey是一个神经网络,它可以从单张图片中预测关键点,并对它们进行描述。这种描述符可以允许在图像之间估计度量相对姿态。
这种训练策略只需要相对姿态监测即可,无需深度测量,也不需要关于图像对重叠的知识。
MicKey预测相机空间中关键点的三维坐标。网络还预测关键点的选择概率(关键点分布)和描述符,这些描述符引导匹配的概率(匹配分布)。将这两种分布结合起来,得到了在中两个关键点成为对应点的概率,并优化网络,使得对应点更有可能出现。在一个可微分的RANSAC循环中,生成多个相对姿态假设,并计算
它们相对于真实变换的损失。通过REINFORCE生成梯度来训练对应概率。由于我们的姿态求解器和损失函数是可微分的,反向传播也为训练三维关键点坐标提供了直接信号。

给定两张图像,计算它们的度量相对姿态,以及关键点得分、匹配概率和姿态置信度(以软内点计数形式)。我们的目标是以端到端的方式训练所有相对姿态估计模块。在训练过程中,我们假设训练数据为,其中是真实变换,K/K'是相机内参。整个系统的示意图如图2所示。
Remover
几秒钟去除图中不需要的元素
304
查看详情
为了学习三维关键点的坐标、置信度和描述符,我们需要系统是完全可微分的。然而,由于pipeline中的一些元素不是可微分的,例如关键点采样或内点计数,重新定义了相对姿态估计管道为概率性的。这意味着我们将网络的输出视为潜在匹配的概率,在训练过程中,网络优化其输出以生成概率,使得正确的匹配更有可能被选中。
MicKey遵循具有共享编码器的多头网络架构,该编码器可推断3D度量关键点以及来自输入图像的描述符,如图3所示。

编码器。采用预训练的DINOv2模型作为特征提取器,并在不进行进一步训练或微调的情况下直接使用其特征。DINOv2将输入图像划分为大小为14×14的块,并为每个块提供一个特征向量。最终的特征图F具有(1024, w, h)的分辨率,其中w = W/14,h = H/14。
关键点Head。这里定义了四个并行Head,它们处理特征图F并计算xy偏移量(U)、深度(Z)、置信度(C)和描述符(D)映射;其中映射的每个条目对应于输入图像中的一个14×14的block。MicKey具有一个罕见的特性,即预测关键点作为稀疏规则网格的相对偏移量。获得绝对2D坐标如下:

在无地图数据集上的相对姿态评估。报告了在90像素阈值下的VCRE指标的曲线下面积(AUC)和精度(Prec.)值,MicKey的两个版本都获得了最高结果。此外,还报告了中位误差,虽然MicKey在VCRE误差方面获得了最低值,但其他方法,例如RoMa,提供了更低的姿态误差。为了计算中位误差,基准仅使用每种方法生成的有效姿态,因此,我们报告了估计的总姿态数。最后,报告了匹配时间,并发现MicKey与LoFTR和LighGlue相当,同时显著减少了RoMa的时间,RoMa是VCRE指标方面最接近MicKey的竞争对手。匹配方法使用DPT 来恢复尺度。

MicKey生成的对应点、得分和深度图的示例。MicKey即使在大规模变化或宽基线的情况下也能找到有效的对应点。请注意,由于我们的特征编码器,深度图的分辨率比输入图像小14倍。我们遵循DPT 中使用的深度图可视化方法,其中较亮的颜色表示较近的距离。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

在ScanNet数据集上的相对姿态评估。所有特征匹配方法都与PlaneRCNN 结合使用,以恢复度量尺度。我们标明了每种方法的训练信号:深度(D)、重叠分数(O)和姿态(P)。



以上就是牛津大学最新!Mickey:3D中的2D图像匹配SOTA!(CVPR'24)的详细内容,更多请关注其它相关文章!
# 过程中
# 象山seo优化托管
# 广州酒家线下推广营销
# seo营销享誉火星
# 下载游戏网站建设方案
# 涿州市关键词排名哪家强
# SEO人才绿卡回国工作
# 温州专业网站seo优化价格
# 大连营销型网站建设推广
# 谷歌seo软件
# 惠州好的网站推广公司
# 十大
# 3d
# 也不
# 是一个
# 所示
# 如图
# 榜单
# 端到
# 不需要
# 牛津大学
# git
# 模型
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
人手一部「*」!视频版Midjourney免费可用,一句话秒生酷炫大片惊呆网友
看了天美对AI的布局,我感觉它想得是真明白
25个AI智能体源码现已公开,灵感来自斯坦福的「虚拟小镇」和《西部世界》
微软 GitHub Copilot 编程助手被投诉:换口吻改写公共代码来躲版权
国内阅读行业首款对话式AI应用“阅爱聊”封闭内测
华为余承东表示:鸿蒙可能拥有强大的人工智能大模型能力
30+大模型齐聚,大模型成世界人工智能大会“顶流”
梦想实现!硬核科幻大片VR智能头盔即将问世
AI和ML推动联网设备的增长
生成式人工智能来了,如何保护未成年人? | 社会科学报
Snap宣布研发出新技术 可大幅提升AI生成图像速度
人工智能自己玩自己
昌吉市利用无人机实现全天候河道动态巡检
科技数码圈的新物种 乐天派桌面机器人 AI +安卓+机器人 首发价1799元
复旦发布「新闻推荐生态系统模拟器」SimuLine:单机支持万名读者、千名创作者、100+轮次推荐
网易加速行业AI大模型应用,将覆盖100多个应用场景
当人工智能开始写高考作文?作家陈崇正、朱山坡谈文学与未来
卫星通信牵引物联网竞争升维,模组厂商如何决胜百亿市场?
国网辉南供电:无人机空中巡检 全力护航端午佳节
马斯克回应“人工智能让一切变得更好”:我们已经是半机器人了
马斯克WAIC2025演讲全文:AI将对人类文明产生深远影响
深度学习模型综述:用于3D MRI和CT扫描的应用
成功孵化首个大型模型解决方案的重庆人工智能创新中心
AI生成会议纪要 百度如流升级推出超级助手、智能编码等功能
OpenAI首席执行官引用《道德经》 呼吁就AI安全问题合作
真全息产品,亮相深圳文博会——dipal数伴拓展元宇宙非沉浸式体验
优化系统韧性:故障恢复与监控在RabbitMQ中的应用
人工智能框架生态峰会即将召开,聚焦AI大模型技术与科学智能探索!
特斯拉人形机器人将亮相 预计售价不超过15万元
宇宙探索下一阶段,机器代替人类,AI会在太空探索中取代人类吗?
人工智能加速走进百姓生活:从2025全球人工智能技术大会看行业新趋势
发布最新版本的 PICO OS 5.7.0:支持VR头盔录屏并跨平台分享至微信
Unity发布Sentis和Muse AI工具,助力创作游戏和3D内容
从GOXR到PartyOn,XRSPACE致力打造多元共赢的元宇宙世界
WAIC 2025|云深处科技绝影Lite3与X20四足机器人亮相
成都大运会闭幕式引入人形机器人展示表演
650亿参数,8块GPU就能全参数微调:邱锡鹏团队把大模型门槛打下来了
能走、能飞、能游泳,科学家打造全能 M4 机器人
美图设计室2.0使用教程
英伟达H100霸榜权威AI性能测试 11分钟搞定基于GPT-3的大模型训练
人工智能颠覆软件测试四大方式
华为4G5G通信物联网收费标准公布,多年研发成果,十年花费近万亿
当一切设备都受到人工智能的控制
人形机器人打开精密齿轮市场全新空间!受益上市公司梳理
网易易盾 AI Lab 论文入选 ICASSP 2025!黑科技让语音识别越“听”越准
超级智能到底是什么?
美图公司吴欣鸿:AI技术重构影像产业
统信深度deepin成立 AI SIG 社区,共同提升 Linux 下 AI 体验
美图秀秀“AI 扩图”功能上线,可根据图像生成更大画幅
智能客服进入AI 2.0时代 容联云发布语言大模型“赤兔”