剪藏#PingAI 品智#剪藏

告别付费OCR!DeepSeek-OCR-2一键转 Markdown,附一键整合包

2026 年 5 月 9 日1 分钟
分享Twitter / XTelegram微博
告别付费OCR!DeepSeek-OCR-2一键转 Markdown,附一键整合包 封面

大家好,我是品智(PingAI)。

大部分 OCR 只管"认字",不管"理解结构",表格、公式、多栏排版一遇到就乱。

今天要介绍的 DeepSeek-OCR-2,DeepSeek 最新开源的文档智能识别工具,不仅能"读得准",更能"理得清"。

一、为什么说这次是真突破?

1.1、视觉因果流

传统 OCR 模型处理文档的方式类似于"拍照扫描"——把整张图片一次性编码,再解码成文字,前后文之间没有因果关联,排版结构自然丢失。

Notion image

1.2、基准测试全面领先

在权威的 OmniDocBench v1.5 文档理解基准测试中,DeepSeek-OCR-2 取得了目前最佳成绩。该测试覆盖表格识别、公式识别、文档布局分析等多个维度,是评估 OCR 综合能力的行业标准之一。

官方数据显示:在相同视觉 token 预算下,DeepSeek-OCR-2 的表现优于包括 Gemini 在内的多个主流大模型。 换句话说,它用更少的计算资源,达到更高的识别精度。

二、两种方式快速上手

方式一:Docker 一键部署(推荐,零门槛)

不需要配置开发环境,只需要电脑上装好 Docker 和 NVIDIA Container Toolkit,一条命令即可完成部署(一键安装包获取方式:在后台回复 deepseek-ocr-2,即可收到打包好的安装文件):

JAVASCRIPT
docker run ---name deepseek-ocr-2 --gpus all -7880:7880 deepseek-ocr-2:v1

容器启动后,浏览器访问 http://localhost:7880 即可使用 Web 界面,上传图片或 PDF 直接开始识别。

图片OCR结果如下:

Notion image

文件(PDF)OCR结果如下:

Notion image

方式二:源码手动安装(开发者向)

适合希望深度定制或集成到自有系统的开发者。完整步骤如下:

第一步:克隆仓库

JAVASCRIPT
git clone https://github.com/deepseek-ai/DeepSeek-OCR-2.gitcd DeepSeek-OCR-2

第二步:创建 Python 环境

JAVASCRIPT
conda create -n deepseek-ocr2 python=3.12.9 -yconda activate deepseek-ocr2

第三步:安装依赖

JAVASCRIPT
# 安装 PyTorch(CUDA 11.8 版本)pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 \
--index-url https://download.pytorch.org/whl/cu118# 安装 vLLM 推理框架pip install vllm-0.8.5+cu118-cp38-abi3-manylinux1_x86_64.whl# 安装其余依赖pip install -r requirements.txtpip install flash-attn==2.7.3 --no-build-isolation

第四步:运行识别

JAVASCRIPT
# 单张图片识别python run_dpsk_ocr2_image.py# PDF 批量识别python run_dpsk_ocr2_pdf.py

常用配置参数(在 config.py中修改):

base_size 1024 基础图像尺寸
image_size 768 输入图像尺寸
crop_mode True 启用裁剪模式,提升长文档效果
save_results True 自动保存识别结果

三、使用场景

场景一:复杂文档转 Markdown

它可以完整还原文档的层级结构,表格变成标准 Markdown 表格,标题按层级自动分级,列表对齐规整。对于经常整理文献资料、处理合同扫描件的用户来说,这个功能直接省去大量手工排版时间。

场景二:PDF 批量识别与并发处理

DeepSeek-OCR-2 支持 PDF 批量处理,并具备出色的并发能力,处理速度与上一代 DeepSeek-OCR 持平。对于需要定期处理大批量文档的用户(比如企业档案数字化、学术论文批量入库),这是不可忽视的实用优势。

场景三:动态分辨率自适应

不论是手机截图(低分辨率)还是高清扫描件(大尺寸),DeepSeek-OCR-2 都能根据输入图像的实际尺寸自动调整处理策略,最大限度保障识别质量,无需手动调参。

免责声明

本文系转载分享,版权归原创作者所有。我们尊重并保护知识产权,如无意中侵犯了您的权益,或原作者不希望被转载,请及时联系我们,我们会立刻处理。欢迎在评论区交流技术心得,也请扫码加入实战交流群,与大家一起探索 AI 自动化的无限可能。

Notion image

原文地址: https://mp.weixin.qq.com/s?__biz=MzU1NzgyMTI0Nw==&mid=2247491953&idx=7&sn=2e098b0b6cbbe826555c54e6cf7271a6&chksm=fd5abee91a91e292d3105e6346ea08627f1b195af74ab472596d231861950431b8a0ee1957e3&mpshare=1&scene=1&srcid=0509GpBxFdmNBTTC4Lij9PPr&sharer_shareinfo=27fffa3cf1358dd7e643e9525481e310&sharer_shareinfo_first=27fffa3cf1358dd7e643e9525481e310#rd

相关文章