👉 项目官网:https://www.python-office.com/ 👈

👉 本开源项目的交流群 👈

atomgit star github star gitee star

科技不高冷,AI很好用 | 我是程序员晚枫,全网 40 万+ 粉丝


📖 看本文之前,建议先读这篇
👉 《大厂 Coding Plan 价格被我扒光了!买贵的人都在偷偷看这个》

想看完整的大厂 AI Coding Plan + Token 价格对比、隐藏购买渠道、避坑提醒?这份持续更新的价格汇总表全整理好了。建议先收藏,再回来读这篇 OCR 复盘。


一句话结论

DeepSeek-OCR 用 30 亿参数,把文档识别卷到了新高度。

  • 技术党:开源 + MIT 协议 + 上下文光学压缩,可商用
  • 业务党:单卡 A100 日处理 20 万页,成本砍 10 倍
  • 不会代码:3 行 Python 用 poocr 也能跑发票批量识别

下面展开。


DeepSeek-OCR 发布

10 月 20 日,DeepSeek AI 正式发布全新多模态模型 DeepSeek-OCR

这款仅 30 亿参数的模型,以上下文光学压缩技术实现文本信息的高效压缩——
在保持 97% 识别精度的同时,将计算成本降低 10 倍,单张 A100-40G 显卡每日可处理 20 万页文档。

这是开源 OCR 领域的一次"成本腰斩"。


一、DeepSeek-OCR 关键技术点

维度DeepSeek-OCR传统 OCR
参数规模30 亿几十-几百亿
识别精度97%85-95%
成本降低 10 倍基线
处理速度(A100-40G)日 20 万页日 2-3 万页
协议MIT 开源可商用多为闭源

核心创新:上下文光学压缩 —— 用视觉 token 替代文本 token,保持精度的同时减少 7-20 倍计算量


二、5 个尺寸配置,按需选择

模型提供 Tiny / Small / Base / Large / Gundam 五种尺寸配置:

尺寸适用场景显存要求
Tiny移动端 / 嵌入式< 8GB
Small轻量服务器8-16GB
Base通用文档16-24GB
Large复杂文档24-40GB
Gundam超高清文档(1024×640 混合尺寸)40GB+

Gundam 版本专为超高清文档优化,支持 1024×640 混合尺寸处理,完美应对多栏排版、图文混杂的专业场景。


多尺寸配置


三、3 大突破:不止"认字"

1. 识别 = 认字 + 识布局
所有输出结果原生支持 Markdown 格式,配合内置的边界框检测功能,精准定位文本块、表格、插图在原图中的位置
解决传统 OCR "只认文字、不识布局"的行业痛点。

2. 复杂排版也能搞定
多栏排版、图文混杂、表格嵌套——一次识别全保留。

3. 开源可商用
MIT 许可证,免费商用,开发者可通过 transformers 库直接加载使用。


四、完整开源地址

官方同步提供 PDF 转图像、批量处理脚本等辅助工具,非专业技术人员也能快速部署。


五、代码示例:直接可跑

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
from transformers import AutoModel, AutoTokenizer
import torch
import os

os.environ["CUDA_VISIBLE_DEVICES"] = '0'
model_name = 'deepseek-ai/DeepSeek-OCR'

tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
model = AutoModel.from_pretrained(
model_name,
_attn_implementation='flash_attention_2',
trust_remote_code=True,
use_safetensors=True
)
model = model.eval().cuda().to(torch.bfloat16)

prompt = "<image>\n<|grounding|>Convert the document to markdown. "
image_file = 'your_image.jpg'
output_path = 'your/output/dir'

res = model.infer(
tokenizer,
prompt=prompt,
image_file=image_file,
output_path=output_path,
base_size=1024,
image_size=640,
crop_mode=True,
save_results=True,
test_compress=True
)

六、零基础也能玩:3 行代码发票批量识别

面对 DeepSeek-OCR 这样的专业级模型,非技术背景用户可能望而却步。
但借助腾讯云 OCR 接口封装的 poocr 工具,普通人只需 3 行 Python 代码即可实现发票批量识别,每月 1000 次免费额度完全满足个人办公需求。

准备工作:3 分钟完成环境配置

1
pip install -i https://mirrors.aliyun.com/pypi/simple/ poocr -U

注册腾讯云账号并开通 OCR 服务,在 API 密钥管理页面创建密钥,获取 SecretIdSecretKey
注意保管好密钥信息,避免泄露造成安全风险。

核心代码:一行命令搞定批量识别

1
2
3
4
5
6
7
8
9
10
11
import poocr

r_id = '你的SecretId'
r_key = '你的SecretKey'

poocr.ocr2excel.VatInvoiceOCR2Excel(
input_path=r'C:\发票图片文件夹',
output_path=r'C:\识别结果',
id=r_id,
key=r_key
)

功能细节

  • input_path 支持 JPG / PNG / PDF 等多种格式
  • 自动遍历目录下所有文件
  • 识别完成后生成 18 项关键信息的 Excel(发票代码、号码、日期、金额、税额等)
  • 准确率 99%+
  • PDF 自动按页拆分
  • 重复发票自动去重
  • 置信度评分,方便核验

这款由程序员晚枫维护的开源工具:

已整合腾讯云 OCR 的 100+ 识别场景,除增值税发票外,还支持火车票、身份证、营业执照等证件的结构化提取。配合其提供的桌面版程序,完全零代码基础的用户也能通过拖拽操作完成批量处理


📌 2026 年 4 月后续动态

本文写于 2025 年 10 月,彼时 DeepSeek-OCR 是最新开源模型。
2026 年 4 月的今天,DeepSeek 主力模型已迭代到 V4 Pro,且正在 2.5 折促销。 最新动态参考:


📚 相关阅读


👉 加我微信:aiwf365(备注:OCR)
或 👉 加入 AI 编程学习交流群


## 🎓 AI 编程实战课程

想系统学习 AI 编程?程序员晚枫的 AI 编程实战课 帮你从零上手!