发布时间:2025-07-30
点击次数: 该内容围绕文档扫描比赛展开,介绍任务为识别文档边缘并输出扫描结果。用户曾对四角点定义存疑,后明确为左上、左下、右上、右下。解题先按生成边缘heatmap处理,用SegFormer3模型分割,经二值化、去噪、提取轮廓,后将模型转为ONNX以适配提交,最终生成提交文件。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

赛题任务
生活中人们使用手机进行文档扫描逐渐成为一件普遍的事情,为了提高人们的使用体验,我们期望通过算法技术去除杂乱的拍摄背景并精准框取文档边缘,选手需要通过深度学习技术训练模型,对给定的真实场景下采集得到的带有拍摄背景的文件图片进行边缘智能识别,并最终输出处理后的扫描结果图片。
本次比赛希望选手结合当下前沿的图像处理技术与计算机视觉技术,提升模型的训练性能和泛化能力,在保证效果精准的同时,注意模型在实际应用中的性能问题,做到尽可能的小而快。
赛题数据介绍
如下图:
由于本次比赛任务的特殊性,也希望所有的参赛者能快速融入比赛,因此本次比赛设计了两种测试的方式:
注:两种评测方式的结果会放在一个排行榜内,评测脚本中预置的角点回归算法会存在一定的局限性,如果各位参赛选手希望获得更高的分数,建议采用第二种评测方式。
这里个人还是比较迷茫的,任务是回归文档区域四个角点坐标,感觉有两种理解:
但很多图像中目标区域是凸多边形,角点顺时针相连的封闭多边形可能并不会完全包含所有区域
希望百度运营同学给出部分示例的GT,或者请明白的同学答疑解惑。
由于定义不太明确,暂时按照预测文档边缘的heatmap图来处理,分为以下几步:
下面,抛砖引玉,流程走一遍,若有错漏,还请各位多多包涵
测试数据集A第一张,原图如下:
采用segformer3模型做分割,效果如下:
二值化后去噪:
提取轮廓:
至此结束,心里还在想着这个圆角怎么处理,哪里是角点?手动狗头。
咨询官方群中百度的同学,关于四个角点的坐标给定的定义是:
AdMaker AI
从0到爆款高转化AI广告生成器
65
查看详情
物体左上,左下,右上,右下四个点。
按照这个思路,坐标点是边缘上的点,用相对位置来计算
根据我的实验,不同的方法可能会影响百分之零点一左右的精度,一点点,不影响大局。
代码都在下面,一键运行
语义分割用了PaddleSeg套件,图形学操作在./work/predict.py中,详细注释
最后的提交结果在根目录下,submit.zip文件
希望同学们喜欢,fork
祝大家比赛顺利,取得好成绩
In [ ]# clone PaddleSeg的项目!git clone https://gitee.com/paddlepaddle/PaddleSeg# 安装依赖!pip install -r PaddleSeg/requirements.txt !pip install -r ./work/requirements.txtIn [ ]
#解压数据集!mkdir dataset !unzip -oq data/data140391/train_datasets_document_detection_0411.zip -d dataset/ !unzip -oq data/data140389/testA_datasets_document_detection.zip -d dataset/# 数据处理,将255变为1(PaddleSeg默认255为忽略数据)!python work/data_process.py# 数据处理,生成数据列表,tarin.txt,val.txt,test.txt,labels.txt!python PaddleSeg/tools/split_dataset_list.py dataset/train_datasets_document_detection_0411 images label --split 0.9 0.1 0 --format jpg pngIn [ ]
# # 复制segformer_b3配置文件%cp ./work/segformer_b3_doc.yml ./PaddleSeg/configs/In [ ]
# 开始训练,如果想自己训练权重,去掉下面的注释即可# !python PaddleSeg/train.py \# --config PaddleSeg/configs/segformer_b3_doc.yml \# --do_eval \# --use_In [ ]vdl \# --s*e_interval 500 \# --s*e_dir output_segformer_b3_train
# 如果你只想看看结果,运行这段代码!python PaddleSeg/predict.py \
--config PaddleSeg/configs/segformer_b3_doc.yml \
--model_path work/model.pdparams \
--image_path dataset/testA_datasets_document_detection/images# 输出效果图在output/result/added_prediction下
In [ ]
# 如果你训练更多的epoch,把下面代码的注释去掉,用自己训练的权重预测# !python PaddleSeg/predict.py \# --config PaddleSeg/configs/segformer_b3_doc.yml \# --model_path output_segformer_b3_train/best_model/model.pdparams \# --image_path dataset/testA_datasets_document_detection/images
本以为到这就结束了,但生活吧,总是充满惊喜。
开放上传已经差不多一周了,排行榜暂无结果,本以为自己是宇宙中最快的男人,然而现实又一次给我一个暴击。
我,不快~乐
回头看,发现要求提交可执行的python文件与模型,给出了环境,给出了predict.py的输入与输出,这些都是还好,重写python文件最多是有点小麻烦
但问题是,我的依赖包怎么整,难道要我用 numpy==1.21.1 onnx==1.10.1 onnxruntime-gpu==1.10 opencv-python==4.5.3.56 paddlepaddle-gpu==2.1.2 Pillow==8.3.1 scikit-image==0.18.2 scikit-learn==0.24.2 scipy==1.7.1 shapely==1.8.1.post1从零开始撸一个框架么~
当然了,我是不会放弃治疗的,于是尝试各种方法,感觉肝疼
与笠雨聆月大佬沟通,得知可以上传分割结果,边缘结果和json结构都可以,
转念一想,( 这个念转了半个月 )不依赖PaddleSeg进行实例化,不就行了,paddle2onnx搞起来
开整,上代码
In [ ]!pip install paddleseg !pip install paddle2onnx !pip install pillow==7.1.2In [ ]
# 划重点,这里是转换代码,PaddleSeg转换简单,太香了!!!!!!!!!!!from paddleseg.models import SegFormerfrom paddleseg.cvlibs import managerimport paddle
model = SegFormer(num_classes=2,
backbone=manager.BACKBONES['MixVisionTransformer_B3'](),
embedding_dim=768,
pretrained=None)# 加载预训练模型参数model.set_dict(paddle.load('work/model.pdparams'))# 将模型设置为评估状态model.eval()# 定义输入数据input_spec = paddle.static.InputSpec(shape=[None, 3, 512, 512], dtype='float32', name='image')# ONNX模型导出paddle.onnx.export(model, './work/SegFormerB3', input_spec=[input_spec], opset_version=12)
In [ ]
%cp ./work/SegFormerB3.onnx ./SegFormerB3.onnx !python ./work/predict.py dataset/testA_datasets_document_detection/images resultsIn [12]
# 输出结果在resulrs文件夹中,可视化一下import osimport numpy as npimport matplotlib.pyplot as plt
%matplotlib inlinefrom PIL import Imageimport globimport warnings
warnings.filterwarnings("ignore")
DATADIR = 'results' lst=glob.glob(DATADIR+"/*.**g")
file0 = lst[0]
file1 = lst[1]
file2 = lst[2]# 读取图片img0 = Image.open(file0)
img0 = np.array(img0)
img1 = Image.open(file1)
img1 = np.array(img1)
img2 = Image.open(file2)
img2 = np.array(img2)# 画出读取的图片plt.figure(figsize=(16, 8))
f = plt.subplot(131)
f.set_title('0', fontsize=20)
plt.imshow(img0)
f = plt.subplot(132)
f.set_title('1', fontsize=20)
plt.imshow(img1)
f = plt.subplot(133)
f.set_title('2', fontsize=20)
plt.imshow(img2)
plt.show()
<Figure size 1152x576 with 3 Axes>代码解释 In [ ]
# 压缩可提交文件%cp ./work/predict.py ./predict.py ! zip submit.zip SegFormerB3.onnx predict.py# 下载上传即可
以上就是【Paddle打比赛】百度网盘AI大赛-图像处理挑战赛文档检测优化赛ONNX方案的详细内容,更多请关注其它相关文章!
# git
# 永州抖音seo运营培训
# 青海省网站建设规划
# 茂名网站建设和优化
# 桐柏县怎么做网站优化
# 夫唯seo 快速排名
# 荆州百度网站优化
# 数据处理
# 两种
# 出了
# 如果你
# 一言
# 边缘
# 图像处理
# python
# ai
# 百度网盘
# 百度
# 为什么
# red
# igs
# fig
# type
# 文档
# 中文网
# 百度网
# 营销产品的推广流程图
# 信宜个人网站建设制作
# 南充网站推广 嶶杏hfqjwl广告稳定
# 淘宝seo有哪几部分
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
人工智能在项目管理中的作用
新闻传闻:迪士尼可能采用人工智能来控制电影制作成本
GPT-4成功战胜AI-Guardian审核系统:谷歌研究团队的人工智能抵抗人工智能
华为盘古AI模型实现秒级全球气象预报时间缩短
280万条多模态指令-响应对,八种语言通用,首个涵盖视频内容的指令数据集MIMIC-IT来了
人工智能如何帮助制造业?
周鸿祎参加中美青年科技创新峰会,分享人工智能创新机遇
AI时代,企业需要什么样的员工?
九号公司主导制定短途交通和送物机器人领域首个国际标准,标志着零的突破发布
能源电力数字化转型恰逢其时
人工智能助力精准学习,猿辅导小猿学练机满足学生个性化学习需求
普林斯顿大学推出Infinigen AI模型 可生成真实自然环境 3D场景
360发布AI数字人广场,可同孙悟空、爱因斯坦等古今中外角色对话
LinkedIn 推出生成式 AI 辅助撰写帖文功能,将向所有用户开放
Goodnotes 6推出,带来多项全新AI功能,让电子笔记更智能
从数据中心到发电站:人工智能对能源使用的影响
科普:什么是AI大模型
郭帆谈ChatGPT:电影行业需要创新,否则人工智能将让电影变得平庸
消息称苹果 iPhone 15 系列健康应用将深度融合 AI 技术
AI大模型火了!科技巨头纷纷加入,多地政策加码加速落地
马斯克发推讽刺人工智能:机器学习的本质就是统计
家电行业观察:AI加持下,全屋智能将成为智能家电未来?
高通发布长期产品计划,为工业和企业物联网产品提供全新组合方案
Meta Connect 2025已确定时间为9月27-28,主题涵盖Quest 3与AI技术
赋能金融新生态,多家银行创新应用成果亮相世界人工智能大会
中国移动主导创立元宇宙产业联盟,包括科大讯飞、芒果TV等在内,共24家成员
人工智能改变网络安全和用户体验的三种方式
网易云音乐和小冰推出AI歌手音乐创作软件,首发内置12名AI歌手
爱设计 AI 一键生成 PPT 工具上线:输入标题即可生成 PPT
码刻 | 48小时Hackathon,源码见证新生代AI创新的发生
焊接协作机器人或将成为26届埃森展最大看点
你们的开机第一屏画面要变了!安卓机器人首次3D化
揭秘AI数字人语录:抖音AI小和尚、老者语录能赚钱吗?
改变城市交通:智慧城市中的智能交通
零数科技CTO兰春嘉:区块链与人工智能的结合点在数据
猿编程参加人工智能高峰论坛,推动人工智能教育解决方案在千所学校推行
世界上第一个完全由人工智能驱动的图像编辑器!
最大助力35公斤 外骨骼机器人或在养老、医疗领域“大展身手”
超级智能到底是什么?
移远通信率先完成多场5G NTN技术外场验证,为卫星物联网应用落地提速
学而思网校推出首个基于自研大模型的《人工智能第一课》
套娃不可取:研究人员证实用AI生成的结果训练AI将导致模型退化
日本演员工会提出AI立法建议 要求建立“声音肖像权”
Meta Quest订阅服务每月7.99美元畅玩两款VR游戏应用
创新全场景清洁方案!海尔商用机器人首发上市
英伟达H100霸榜权威AI性能测试 11分钟搞定基于GPT-3的大模型训练
午报 | 字节跳动要造机器人;东方甄选首次启动自有APP|直播|
不到2S创作AI图像!Snap发布图像生成器SnapFusion
梦想实现!硬核科幻大片VR智能头盔即将问世
用人工智能技术,亚马逊为用户生成产品评论摘要,帮助他们轻松选购