发布时间:2025-12-12
点击次数: 近日,deepseek正式发布全新ocr系统,使ai能够在不突破内存约束的前提下高效处理超长文档。其开源代码已托管于github:https://www.php.cn/link/9d55db9e54e6dfb6ae280528ee34a0a1 。该系统的核心创新在于——将文字内容视作图像进行压缩,相较直接处理原始文本,图像化表征显著降低计算开销。在确保97%信息完整保留的前提下,文档体积可压缩至原大小的十分之一。例如,一本百页级pdf经该系统处理后,所需token数量仅为原先的1/10,语言模型即可实现端到端精准解析。
DeepSeek OCR系统由两大核心组件协同构成:
一是图像编码模块 DeepEncoder,参数量达3.8亿,专用于将输入的文档图像解析为高度压缩的视觉token;
二是文本生成模块,基于 Deepseek-3B-MoE 架构微调而来,负责从视觉token中重建原始文字内容与文档结构。
技术层面,系统深度融合了Meta推出的 SAM(Segment Anything Model) 与OpenAI开发的 CLIP 模型:SAM承担细粒度局部区域分割任务,CLIP则提供跨模态语义对齐能力。二者之间嵌入一个16倍压缩单元,大幅削减视觉token总量。以一张1024×1024像素图像为例,初始生成4096个token,经压缩后仅剩256个,极大缓解CLIP模块的推理压力。在低分辨率场景下,单图仅需64个视觉token;高分辨率模式下亦不超过400个,而传统OCR方案通常需数千token才能完成同等精度识别。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

DeepSeek OCR不仅支持常规文字识别,还可精准解析图表、化学分子式、几何图形等复杂非文本元素。研究团队指出,系统能直接从上市公司财报中的折线图、柱状图中抽取结构化数值,并自动输出标准Markdown表格。在“深度解析模式”下,金融图表与几何示意图更可被重绘为矢量格式,同时完整保留图注、坐标说明及上下文标注。
基准测试结果表明,DeepSeek OCR在 OmniDocBench 综合评测中表现卓越:当仅使用100个视觉token时,性能已超越GOT-OCR 2.0在256 token下的表现;在800 token预算内,全面领先MinerU 2.0(后者每页平均消耗超6000 token)。其专属的 Gundam-M模式 在中英文混合文档识别任务中斩获最低编辑距离(Edit Distance)分数,达到当前最优水平。系统具备智能模式调度能力——面对简易演示文档自动启用64-token轻量模式;普通业务报告匹配约100-token配置;而面对排版密集的报纸类多栏文档,则激活“Gundam模式”,上限设为800 token。此外,还提供 Resize、Padding、Multi-page、Sliding 四种预处理策略,灵活兼顾多页文档的压缩效率与识别准确率。
文心智能体平台
百度推出的基于文心大模型的Agent智能体平台,已上架2000+AI智能体
393
查看详情

DeepSeek OCR的训练数据规模极为罕见:总计投入三千万页PDF文档,覆盖近一百种语言。其中包含2500万页真实中英文资料、1000万张合成图表、500万条化学公式样本、以及100万幅几何图形图像。如此海量且高多样性的训练语料,赋予模型强大的跨领域泛化能力与跨语言鲁棒性,不仅能完美复现原始文档布局,输出结果还同步附带图文语义描述与内容摘要。
在当前主流多模态大模型架构中,文本上下文长度限制始终是制约长文档理解的关键瓶颈。DeepSeek另辟蹊径,跳脱传统token计数范式,以视觉token替代文本token作为语言模型的新输入载体,真正实现“边看图、边读文”的一体化感知。对研究人员而言,这相当于为AI配备了一块高性能“外接硬盘”——借助视觉压缩机制,模型的有效上下文长度近乎无界,也预示着未来AI架构或将彻底消融“文本理解”与“图像理解”的传统边界。
该模型一经开源,迅速引发全球技术社区高度关注,相关讨论迅速登上GitHub Trending、Hugging Face热门榜单及多个中文科技平台热搜榜。有开发者实测反馈:“太惊艳了!刚用这个新开源模型把400页PDF转成Markdown,全程不到4分钟!”另有AI从业者感叹:“震撼!中国DeepSeek再次打破天花板——整本《百科全书》竟能浓缩为一张高清图像!” DeepSeek OCR绝非一次简单的OCR工具升级,而是对机器如何感知、组织与利用信息的一次底层范式革新。
以上就是DeepSeek新OCR系统震撼来袭!压缩率90%信息保真97%的详细内容,更多请关注其它相关文章!
# 网站建设后期有什么好处
# 官网
# 来袭
# 压缩率
# 如何写
# 前提下
# 多个
# 安阳网站优化公司电话
# 哈密定制网站建设
# 柱状
# 独创新颖的网站优化
# seo关键词排名轰动易 速达
# 网站建设项目策划书例文
# 商业地产的营销推广思路
# seo最基础的知识
# 东城短视频seo排名
# 黔江公司网站建设招标
# deepseek
# 会议纪要
# 开源
# 文档
# 大模
# 金融
# openai
# pdf
# ai
# 工具
# 硬盘
# 编码
# github
# go
# git
# markdown
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
无人机协助盐城交通执法的协同训练
当孔子遇见AI|尼山的“数字”
百度创始人、董事长兼首席执行官李彦宏:AI原生应用比大模型数量更重要
小米又拿下国际比赛第一:AI翻译立功
华为推出两款商用 AI 大模型存储新品,支持 1200 万 IOPS 性能
第四范式“式说”大模型入选《2025年通用人工智能创新应用案例集》
AI技术加速迭代:周鸿祎视角下的大模型战略
MiracleVision视觉大模型功能介绍
「社交达人」GPT-4!解读表情、揣测心理全都会
纪录片 《寻找人工智能》全集1080P超清
眼球反射解锁3D世界,黑镜成真!马里兰华人新作炸翻科幻迷
如何用AI重塑你的工作流(一)
SnapFusion技术大幅提升AI图像生成速度
郭帆导演成功利用AI技术制作的《流浪地球3》预告片在央视热播,引发巨大反响
微软商店 AI 摘要功能开启预览,帮助用户迅速了解应用评价
稿见AI助手:提升写作效率与质量的必备工具
DeepMind用AI重写排序算法;将33B大模型塞进单个消费级GPU
J*a与人工智能结合:构建智能云服务
利用AI探索抗体“钥匙”、加速药物研发——访百图生科团队
AI技术改变*,新骗局来袭,*成功率接近100%
到中国科技馆体验“一滴油的奇妙旅行”,线上元宇宙展厅同步开启
周星驰支持的人工智能与 Web3 初创公司 Moonbox 完成 100 万美元融资
清华&中国气象局大模型登Nature:解决世界级难题,「鬼天气」预报时效首次达3小时
大疆 DJI Mini 4 Pro 无人机曝光:流线设计,有望迎来功能性提升
第 66 届格莱美奖规定,AI 作品将无法获得评奖资格
基于预训练模型的金融事件分析及应用
利好来了,AI再起一波?
大模型训练成本降低近一半!新加坡国立大学最新优化器已投入使用
“苏南 vs 苏北” AI 分胜负,娱乐性比较工具 EitherChoice 上线
击败LLaMA?史上超强「猎鹰」排行存疑,符尧7行代码亲测,LeCun转赞
“三夏”农忙保障用电,无人机高空巡视高压线
小艺将具备大模型能力,鸿蒙4加速AI普及之路
从谷歌到亚马逊,科技巨头们的AI痴迷
苹果AIGC专利:可通过语音指令生成AR/VR虚拟场景
构建数字文旅新高地!洛阳涧西区开启元宇宙时代
智能公司为何纷纷投身机器人领域?
生成式AI爆发,亚马逊云科技持续专注创新,助力企业数字化转型
数字彩排、虚拟建厂!这家顶级洗衣机工厂敲开“工业元宇宙”之门
能抓取玻璃碎片、水下透明物,清华提出通用型透明物体抓取框架,成功率极高
马斯克回应人工智能拯救世界:人类已处于“半机器人”状态
PHP和OpenCV库:如何实现人脸识别
周鸿祎参加中美青年科技创新峰会,分享人工智能创新机遇
传Meta 2025年推出首款AR眼镜,采用军用级别材料,计划生产1000台
商业智能决策技术助力降本增效,世界人工智能大会举办商业AI高峰论坛
普林斯顿Infinigen矩阵开启!AI造物主100%创造大自然,逼真到炸裂
如何利用物联网技术提高企业生产线智能化水平,提升生产效率
RoboNeo什么时候上线
再度重仓 AI 赛道,SaaS 巨头 Salesforce 扩大 AIGC 风投基金规模
无人机巡检方案是什么,该如何选择适合的巡检方案
映宇宙集团执行总编辑:元宇宙还是要以人为媒介