百度 Unlimited-OCR 开源:32K 字符超长文档识别,碾压 DeepSeek-OCR

摘要

百度开源 Unlimited-OCR 模型,单图支持 32768 字符超长文档识别,可直接解析多页 PDF。创新采用 R-SWA 参考滑动窗口注意力机制,让 KV 缓存恒定,识别效率与输出长度彻底解耦。本文详解核心原理、应用场景与技术突破。

百度 Unlimited-OCR 开源:32K 字符超长文档识别,碾压 DeepSeek-OCR

一、百度 Unlimited-OCR 是什么?32K 字符的超长文档识别利器

百度近期开源的 Unlimited-OCR,是一款专为超长文本识别而生的 OCR 模型。最大亮点在于:单张图像最高可容纳 32768 个字符的识别容量,并原生支持多页 PDF 的端到端解析。相较于此前备受关注的 DeepSeek-OCR,Unlimited-OCR 在长文档处理能力上又向前迈进了一大步。

GitHub 项目地址:https://github.com/baidu/Unlimited-OCR


二、它解决了什么行业痛点?

当前主流的端到端 OCR 方案(包括 DeepSeek-OCR)几乎都采用大语言模型作为解码器,借助语言模型的先验知识来提升识别精度。然而,这种架构存在一个致命缺陷:

输出序列越长,KV 缓存堆积越严重,显存占用呈线性飙升,推理速度越来越慢。

人类抄写几十页材料不会越写越累,模型却会。这种"长尾衰减"现象,在长文档场景下尤为突出。


三、核心思路:模仿人脑的"工作记忆"机制

Unlimited-OCR 的设计哲学非常直观——向人脑的短时记忆机制取经

人阅读时,不会把整本书硬塞进大脑,而是聚焦于当前正在看的内容,同时在脑中保留一个"参考锚点"用于上下文衔接。Unlimited-OCR 的核心技术 R-SWA(Reference Sliding Window Attention,参考滑动窗口注意力) 正是这一思路的工程化实现:

  • 全面替换解码器:将所有标准注意力层替换为 R-SWA
  • 计算量大幅压缩:注意力计算复杂度与序列长度解耦
  • KV 缓存恒定:显存占用不再随输出长度增长

最终效果:无论处理 1 页还是 100 页文档,推理成本几乎一致。


四、三大典型应用场景


应用场景实际效果
超长文档 OCR单次前向推理即可处理数十页内容,在 32K 字符上限内无需切分
语音识别(ASR)同一机制可迁移,长音频转录无需分段,避免断句误差
机器翻译长文本翻译延迟稳定,不会因段落累积而越来越卡顿


扫描二维码

扫描二维码在手机上阅读

文章海报

常见问题

1 Unlimited-OCR 和 DeepSeek-OCR 相比有什么优势?
核心优势在于长文本处理效率。DeepSeek-OCR 等端到端方案的 KV 缓存随输出长度增长,Unlimited-OCR 通过 R-SWA 机制让 KV 缓存保持恒定,处理超长文档时显存和速度优势显著。
2 R-SWA 参考滑动窗口注意力是什么原理?
它模拟人脑的"工作记忆"机制——解码器只关注当前窗口内的内容,同时保留一个轻量级的参考锚点用于上下文关联,从而将注意力计算量从 O(n²) 降至近似 O(n)。
3 Unlimited-OCR 支持哪些输入格式?
支持单张超长图像(最高 32768 字符)以及多页 PDF 文件的直接解析,无需预处理切分。
4 能否用于语音识别和机器翻译?
可以。R-SWA 是通用注意力机制,理论上可迁移到任何自回归生成任务,包括 ASR 和长文本翻译,且效果已在百度内部验证。