一、百度 Unlimited-OCR 是什么?32K 字符的超长文档识别利器
百度近期开源的 Unlimited-OCR,是一款专为超长文本识别而生的 OCR 模型。最大亮点在于:单张图像最高可容纳 32768 个字符的识别容量,并原生支持多页 PDF 的端到端解析。相较于此前备受关注的 DeepSeek-OCR,Unlimited-OCR 在长文档处理能力上又向前迈进了一大步。
GitHub 项目地址:https://github.com/baidu/Unlimited-OCR
二、它解决了什么行业痛点?
当前主流的端到端 OCR 方案(包括 DeepSeek-OCR)几乎都采用大语言模型作为解码器,借助语言模型的先验知识来提升识别精度。然而,这种架构存在一个致命缺陷:
输出序列越长,KV 缓存堆积越严重,显存占用呈线性飙升,推理速度越来越慢。
人类抄写几十页材料不会越写越累,模型却会。这种"长尾衰减"现象,在长文档场景下尤为突出。
三、核心思路:模仿人脑的"工作记忆"机制
Unlimited-OCR 的设计哲学非常直观——向人脑的短时记忆机制取经。
人阅读时,不会把整本书硬塞进大脑,而是聚焦于当前正在看的内容,同时在脑中保留一个"参考锚点"用于上下文衔接。Unlimited-OCR 的核心技术 R-SWA(Reference Sliding Window Attention,参考滑动窗口注意力) 正是这一思路的工程化实现:
- 全面替换解码器:将所有标准注意力层替换为 R-SWA
- 计算量大幅压缩:注意力计算复杂度与序列长度解耦
- KV 缓存恒定:显存占用不再随输出长度增长
最终效果:无论处理 1 页还是 100 页文档,推理成本几乎一致。
四、三大典型应用场景
| 应用场景 | 实际效果 |
|---|---|
| 超长文档 OCR | 单次前向推理即可处理数十页内容,在 32K 字符上限内无需切分 |
| 语音识别(ASR) | 同一机制可迁移,长音频转录无需分段,避免断句误差 |
| 机器翻译 | 长文本翻译延迟稳定,不会因段落累积而越来越卡顿 |