6月23日,百度研究团队在Hacker News上扔下了一枚重磅炸弹——Unlimited OCR,一个面向「一次解析长文档」场景的开源OCR模型。发布仅24小时即斩获430分,登顶HN热门榜。这款基于Deepseek-OCR架构进一步推进的模型,核心卖点在于能够对多页PDF和长图进行端到端的结构化解析,无需分块切割。
技术突破:从单页到无限长
传统OCR模型处理长文档时通常需要将页面切分为小块分别识别,再拼接结果。这种方法不仅效率低,更重要的是破坏了跨页上下文——表格可能被从中间切断,段落的语义连贯性丢失。Unlimited OCR通过支持最大32768 token的上下文窗口和创新的No-Repeat N-Gram Logit Processor,实现了单次推理覆盖数十页文档的能力。
在技术实现上,模型支持两种配置模式:gundam(base_size=1024, image_size=640, crop_mode=True),适合单图精细解析;base(image_size=1024),面向多页/PDF批量处理。配合SGLang推理框架,可实现8路并发推理,大幅提升生产环境吞吐量。
开箱即用:从HuggingFace到SGLang
百度团队提供了极为完善的工程配套:模型已上线HuggingFace和ModelScope,支持Transformers和SGLang双推理路径。Transformers路径仅需6行Python代码即可完成单图推理;SGLang路径则提供兼容OpenAI的/v1/chat/completions API,可无缝接入现有RAG和文档理解流水线。
特别值得一提的是内置的PDF支持——使用PyMuPDF将PDF页面渲染为高DPI图片后直接送入模型,开发者无需自行编写预处理管线。配合infer.py脚本,一行命令即可完成整个目录的批量OCR。
社区反响:期待与质疑并存
HN社区对该项目的讨论主要集中在几个方向:支持者认为这是文档理解领域的重大进步,特别是对学术论文、法律合同等长文档场景;质疑者则关注中文OCR在英文文档上的泛化能力,以及32768 token是否真正够用——毕竟一份50页的PDF可能远超这个限制。
此外,由于项目来自百度,部分评论者表达了对数据隐私和开源可持续性的顾虑。不过截至发稿,项目已获得3.5k星标和223个fork,显示出社区对长文本OCR这一方向的强烈需求。
🔗 原文链接:github.com/baidu/Unlimited-OCR
💬 HN讨论:news.ycombinator.com/item?id=48643426