AI 资讯聚合 · 开源生态

Jina AI 发 jina-ocr-v1:3.4B MoE 文档解析器,带推测解码头

海外开源生态文档解析OCRJina AI · 2026-09-18 · 约1分钟 · 来源:Jina AI 官方 / MarkTechPost

Jina AI 发布文档解析模型 jina-ocr-v1:3.4B 参数的 MoE 架构,post-train 自 DeepSeek-OCR 并保留其两个效率组件——DeepEncoder(约 380M:SAM 链 16x 卷积压缩器再链 CLIP-L,把 1024×1024 页面从 4,096 个 patch 压到 256 个视觉 token,另有动态分辨率模式最多 9 个局部 tile)与 DeepSeek-3B-MoE 解码器(12 层、64 路由专家 + 2 共享专家,top-6 路由每 token 激活约 570M 参数),输出 Markdown、表格转 HTML、公式转 LaTeX。HF 仓库 9 月 1 日建库,权重约 6.8GB(BF16),CC BY-NC 4.0 授权,商业使用需联系厂商。

它的特色是推测解码:OCR 输出近确定性且结构化,天然适合做草稿——Jina 自加 FastMTP 头,递归应用 1 个稠密草稿块跑 K=3 步,解码器贪心验证、提交最长匹配前缀;提交文本与纯贪心解码完全一致,即加速无损。文档解析这个「视觉输入→结构化输出」的管线,第一次把 LLM 侧的推测解码优化搬了过来。

原文链接:Jina AI 官方 / MarkTechPost

核验记录
HF 仓库 jinaai/jina-ocr-v1 createdAt 2026-09-01(权重公开日);MarkTechPost 报道 datePublished 2026-09-18T21:21Z 直读,发布日期按媒体报道日 9/18 口径;架构数字(380M、256 token、570M 激活、K=3)取自 MTP 正文,官方模型卡未逐字核对