腾讯这次开源,最值钱的不是模型权重
做 RAG 的朋友应该都有体会,整条链路里最脏最累的活,不是调检索,也不是挑 embedding 模型(就是把文本压成向量好做相似度搜索的那一步),是最前面那道工序,把一堆 PDF 变成干净文本。
表格拦腰截断,双栏排版读成左一句右一句,公式直接变成乱码天书。检索再准、prompt 再精致,喂进去的文本本身是碎的,后面全白搭。垃圾进,垃圾出,这条古老的定律在 RAG 时代活得比谁都硬朗。
昨天晚上,腾讯混元把 HyOCR-1.5 开源了。1B 参数,在 OmniDocBench v1.6 这个文档解析基准上拿了 94.74 的总分,端到端 OCR 模型里排第一。项目在 GitHub,技术报告在 arXiv,权重在 Hugging Face,全都能直接下载。
跑分第一当然值得说一句厉害了,但坦率讲,现在各家发模型谁还没几个 SOTA 傍身。这次真正让我觉得稀罕的是另一件事,它把训练配方、数据构造方法、推理加速框架整套都开了。
这个稀罕在哪,后面细聊。先把手边这笔账算清楚,为什么一个 1B 的专家小模型,对做文档处理的人来说可能比通用大模型更值得看。
目前拿大模型解析文档,主流就两条路。
一条是传统管线,版面分析、文字检测、表格识别各管一段,级联起来跑。快是快,但每一段都有自己的脾气,换个文档类型就要重新调,遇到手写体、古怪版式就集体摆烂。用过 PaddleOCR 老全家桶的朋友知道我在说什么。
另一条是把整页扔给 GPT-5、Gemini 3.1 Pro 这类通用多模态大模型,让它看图说话。效果确实好,版式再怪也能理解。但你想想看批量场景,几十万页合同发票,每页都走一遍 API,钱包先受不了,速度也跟不上。更烦的是幻觉,比方说图里印的是个生僻地名,模型觉得语义不通顺,热心地给你改成它认为更合理的写法。OCR 场景里,这种自作聪明比识别不出来可怕多了,错得悄无声息。

专家小模型走的是第三条路。只干文本相关的活,检测识别、文档解析、信息抽取、拍照翻译、图表解析这些,别的一概不管。参数量压到 1B,一张消费级显卡绰绰有余,配合 llama.cpp 甚至能在 CPU 和普通笔记本上跑。数据不用出内网,隐私合规的老大难直接绕过去了。
这套账其实一直成立,之前的问题是专家小模型不够强、不够快。HyOCR-1.5 这一版,恰好是在这两条线上同时使了劲。
先看快。
端到端 OCR 有个老毛病,输出是自回归的,一个 token 一个 token 往外吐。文档越密、表格越大,解码就越慢,跟挤牙膏似的。一张密密麻麻的表格页,模型要老老实实吐几千个 token 才算完。
HyOCR-1.5 的解法是投机解码(speculative decoding),思路挺妙的,找一个只有 90.7M 参数的小草稿模型,一口气并行猜出一整块候选 token,再让主模型一次性验证,接受猜对的部分。猜错了也不要紧,主模型兜底,最终输出分布跟不加速时严格一致。快,但结果一个字不变。
他们管这个框架叫 DFlash。实测数据有点子牛逼,Transformers 下加速 6.37 倍,vLLM 这种本来就做过并行优化的推理引擎(vLLM,服务器部署大模型的主流选择)下也有 2.14 倍。官方在 OmniDocBench 上给的数字是,平均每页延迟从 3 秒出头压到 1.4 秒。
而且这个加速有个很舒服的特性,文档越长、结构越规整,加速越猛。表格页在 Transformers 下能冲到 7.81 倍。

原因不难理解,HTML 表格这种高度规律的输出,小模型闭着眼都能猜对一长串。以前是表格越大解码越慢,现在反过来了,越规整跑得越快。折磨源变成了加速器,我看到这组数据的时候心情挺复杂的。
横向比一下更直观,同等算力下,它比 GLM-OCR、PaddleOCR-VL 这些两阶段级联方案还快,而且人家是端到端一步出结果,不需要先切版面再分区识别。
再看准,尤其是幻觉这块。
技术报告里有个细节我很喜欢。他们自己造了个基准叫 CHAOS-Bench,专门测模型是不是「所见即所得」,做法是故意把图里的词改成无意义的扰动词,看模型会不会忠实保留这些看起来很怪但确实印在图上的字。HyOCR-1.5 拿了参评模型里的最好成绩,然后报告紧接着补了一句,绝对值仍然偏低,忠实生成这个方向还有硬仗要打。
发布稿里主动写自家短板,这个坦诚劲儿在大厂通稿里不多见,加分。
还有个数字对做工程的人很实在。面对完全没有文字的图片,老版本有两成多的概率凭空幻觉出检测框,硬说图里有字。新版在一千张无文字图的测试集上,正确处理率 99.8%。这种指标上不了发布会大屏,但流水线上每天几十万张图过境,两成误检和千分之二误检,是运维半夜被叫醒和睡整觉的区别。
顺带说个彩蛋。这模型还顺手支持古文字识别,甲骨文、金文、篆书这些,在覆盖汉字七体的 Chronicles-OCR 基准上,把 GPT-5、Gemini 3.1 Pro、Kimi K2.5 一众大模型甩在了身后。好家伙,1B 的小身板,在认甲骨文这件事上赢了参数量几百倍于它的巨无霸。专家模型的「专」字,在这个场景里具象化了。
好,现在回到开头挖的坑。为什么我觉得这次开源里,权重反而是最不值钱的部分。
大厂开源模型,行业惯例是 open weights,给你权重文件和一份推理示例代码,就算仁至义尽了。你能用,能部署,但模型怎么练出来的、数据怎么造的,那是家底,概不外传。你想在自己的领域数据上深度定制,对不起,从权重往回推训练配方,跟拿着一盘菜反推菜谱差不多。
HyOCR-1.5 这次把训练、推理、权重三样全开了。数据构造方法、分阶段训练配方、强化学习的奖励设计、DFlash 加速框架,全写进了技术报告和代码库。官方原话是,任何人都可以在此基础上复现、微调与二次开发。
这里面最有意思的是数据构造那部分,他们叫 Agentic Data Flow。传统做法是算法工程师人肉写脚本、搜语料、标数据,苦力活。这套新流程是把模型的短板直接翻译成数据需求,交给 agent 去自主完成,搜集素材、调用工具做质检、开发数据生产脚本、迭代版式模板,一条龙。覆盖 331 种语言的低资源语料、古文字的合成数据,都是这么造出来的。
我平时的工作就是给大模型搭这类工程层,让 agent 真正能干活的工具链和调度那一层,所以看这套东西职业病发作,多盯了一会儿。让 agent 全自动包办数据生产,坑其实不少,工具调用失败、质检标准漂移、生成数据分布跑偏,每一个都能让管线悄悄产出一堆垃圾数据。报告里的方案是 agent 和工程师持续迭代,人还在环里把关。这个分寸感是对的,现阶段敢把人完全摘出去的数据管线,我反正是不敢信。
对普通开发者,这套全栈开源的实际价值很具体。假设你手上有一堆行业特有的烂文档,医疗手写处方、工程图纸、老档案扫描件,通用模型啃不动,以前你只能等大厂哪天心情好覆盖你的场景。现在数据怎么造、管线怎么搭、配方怎么调,全有现成参考,1B 的体量也意味着微调成本是个人和小团队掏得起的。这跟只给权重的开源,完全是两个量级的诚意。
当然,话说回来,专家模型不是万能钥匙,这笔账得算两面。
它的多图问答成绩是 54.64,只是逼近同量级通用模型的水平,没有超过。这很正常,1B 的容量全押在文本感知上了,指望它同时具备通用理解和推理能力,不现实。所以选型逻辑其实挺清晰的,批量处理、结构化输出、成本敏感、数据不能出内网,这四条占了两条以上,专家小模型值得认真试。反过来,如果你的场景是对着一份文档反复追问、推理、总结,那还是老老实实用通用大模型,别为了省钱委屈了效果。
说实话我自己还没来得及跑,llama.cpp 的部署路径和真实文档上的表现,等我试完有值得说的再来汇报。但光是看完技术报告,我就觉得这个方向值得多聊几句,因为它跟行业主流叙事是拧着的。
这两年大家的注意力全在通用大模型上,参数越堆越多,能力越铺越广,恨不得一个模型包办天下所有事。HyOCR-1.5 给出的是另一种答案,把一件事做到极致,然后把怎么做到的完整讲给你听。94.74 分和 6.37 倍加速证明前半句,全栈开源证明后半句。
万能青年旅店唱过,是谁来自山川湖海,却囿于昼夜厨房与爱。大模型的叙事总是山川湖海,星辰大海,通用智能。但工程师的日常恰恰是厨房与爱,是那几十万页扫描件、断掉的表格、半夜误报的检测框。能把厨房里的活干利索的模型,未必上得了发布会的头条,但它离你的生产环境,比任何一个跑分屠榜的巨无霸都近。
下次再被 PDF 解析折磨的时候,你多了一个选项,还是能看到全部底牌的那种。