TeleOCR – 中国电信星辰实验室开源的文档解析模型深度评测
导读摘要:
TeleOCR 是中国电信星辰实验室开源的文档解析模型,采用约 1.2B 参数的轻量级视觉语言架构,在单一框架内统一处理数字文档与相机拍摄文档,可将文字、版面、表格、公式和科学图表解析为 Markdown、JSON 等结构化结果。该模型在 OmniDocBench v1.6 榜单中登顶,同时获得 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军,支持本地 GPU 部署,...
1. TeleOCR是什么
TeleOCR 是中国电信星辰实验室开源的文档解析模型,采用约 1.2B 参数的轻量级视觉语言架构,在单一框架内统一处理数字文档与相机拍摄文档,可将文字、版面、表格、公式和科学图表解析为 Markdown、JSON 等结构化结果。该模型在 OmniDocBench v1.6 榜单中登顶,同时获得 PureDocBench 榜首和 ICDAR-2026 科学图解析挑战赛冠军,支持本地 GPU 部署,适用于合同、论文、档案等结构化提取场景。
技术定位与领域: TeleOCR 属于文档智能(Document Intelligence)与多模态视觉语言模型(VLM)交叉领域,其核心任务是将非结构化的文档图像转化为机器可读的结构化数据。相较于传统 OCR 仅输出文本序列,TeleOCR 直接面向"版面理解 + 内容识别 + 结构重建"的复合型任务,在文档解析技术栈中处于端到端一体化方案的前沿位置。
研发背景: 该模型由中国电信星辰实验室(XingChen-AGI)研发,团队在视觉语言模型与文档理解方向有长期技术积累。研发动机源于传统"版面检测→图像校正→识别"串联流水线在复杂场景下的误差累积问题,以及数字文档与拍摄文档需要分别部署多套系统的行业痛点。星辰实验室选择以轻量级参数规模实现高精度解析,体现了面向私有化部署与行业落地的工程化导向。
核心价值: TeleOCR 解决了文档解析领域的三个关键问题:一是统一处理数字文档与相机拍摄文档,消除多系统部署的架构冗余;二是通过几何感知建模直接处理弯曲、折叠、透视畸变页面,省去独立的图像校正模块;三是以约 1.2B 参数量实现榜单领先的解析精度,大幅降低本地部署的硬件门槛,为合同、论文、档案等场景提供高性价比的结构化提取方案。
技术特点: TeleOCR 采用统一视觉语言架构,以几何感知建模与曲率引导采样显式学习文档空间结构,配合多节点共识投票与图像到图像自验证构成的数据闭环,以及渐进式四阶段训练策略,在轻量级参数约束下实现了从基础感知到精细理解的递进式能力构建。
2. 主要功能
文字识别(Text Recognition): 高精度提取文档中的文本内容,覆盖印刷体与复杂版面中的文字信息。数字文档识别准确率达 97.22,这一指标在 OmniDocBench v1.6 评测中处于领先梯队,能够满足合同、档案等对文字保真度要求较高的业务场景。
版面分析(Layout Analysis): 定位文字、表格、公式、标题等元素在页面中的位置与层级关系,输出结构化的版面树信息。模型通过几何感知建模理解页面空间布局,为后续的表格重建与公式解析提供准确的区域划分基础,避免元素错位与串行。
表格解析(Table Parsing): 精确还原跨行跨列、单元格合并等复杂表格结构,TEDS(Tree Edit Distance based Similarity)达 97.05,拍摄文档表格 TEDS(Wild)为 89.05。该能力可有效处理财务对账单、科研数据表等结构密集型文档,保持行列逻辑关系不紊乱。
公式解析(Formula Parsing): 结构化解析公式的语义与语法组织,实现符号级准确恢复,CDM(Character Detection Match)达 96.36。模型不仅识别公式字符,还理解其层级结构与运算关系,可将印刷公式转换为 LaTeX 或 Markdown 格式,支撑科研论文与教育试题的数字化处理。
科学图表解析(Scientific Chart Parsing): 识别柱状图、折线图等科学图表中的元素并提取数据,可将论文中的柱状图直接转换为结构化表格。该能力获得 ICDAR-2026 科学图解析挑战赛冠军(41.81 分),在学术文献知识库构建与科研数据复现方面具有实用价值。
拍摄文档处理(Camera-captured Document Processing): 直接处理透视畸变、页面弯曲、阴影模糊等真实拍摄退化文档,无需独立的去畸变模型。几何感知建模显式学习文档边界与空间结构,使模型能够应对手持拍摄、翻拍等非扫描仪场景,拓展了移动端文档采集的适用性。
结构化输出(Structured Output): 解析结果可生成为 Markdown、JSON、表格、公式等多种格式,便于直接接入知识检索系统、RPA 流程与业务数据库。结构化输出免去了二次解析的工程成本,提升了从文档到数据管线的端到端效率。
3. 如何使用
TeleOCR 的部署与使用流程较为清晰,以下为从环境准备到推理运行的完整步骤:
环境准备: 安装 Python 3.10 及以上版本,并确保具备支持 CUDA 的 NVIDIA GPU 环境。模型推理依赖 GPU 加速,建议显存不低于 8GB 以保证常规文档的解析效率,具体显存占用可通过
GPU_MEMORY_UTILIZATION参数调节。拉取代码: 执行
git clone https://github.com/caipeng328/TeleOCR.git将项目仓库克隆至本地,随后进入项目目录cd TeleOCR。创建环境: 使用 conda 创建名为
teleocr的虚拟环境并激活,命令为conda create -n teleocr python=3.10与conda activate teleocr,确保依赖隔离。安装依赖: 在激活的虚拟环境中运行
pip install -e .安装项目依赖,该命令会以可编辑模式安装项目及其依赖包。下载模型: 通过
pip install modelscope安装 ModelScope 客户端,然后使用 modelscope 命令将模型权重下载至本地./models/TeleOCR目录,命令格式为modelscope download --model XingChen-AGI/TeleOCR --local_dir ./models/TeleOCR。准备目录: 设置输入图片目录变量
IMAGE_SUB_PATH指向待解析的文档图片所在路径,设置结果输出目录变量RESULT_SAVE_PATH指向解析结果的保存位置。运行推理: 执行
python infer.py,传入图片路径、结果路径、--use_async、--override、模型路径及后端参数。--use_async启用异步处理模式,--override用于覆盖已有输出。选择后端: 常规使用场景选择
vllm-engine后端;高并发批量处理场景可切换为vllm-async-engine,以提升吞吐量。设置版面模式: 数字文档使用
LAYOUT_MODE="Detection"模式;弯曲或退化的拍摄页面切换为"Segmentation"模式,后者对几何形变页面具有更强的适应能力。调优参数: 按需调整
MAX_MODEL_LEN(上下文长度)、GPU_MEMORY_UTILIZATION(显存占用比例)、PDF_TOOLS(PDF 解析后端)与MAX_PIXELS(单页最大像素数),以匹配具体硬件资源与文档复杂度。获取结果: 从输出目录读取解析后的 Markdown、JSON、表格等结构化结果,接入下游知识检索或业务自动化系统。
注意事项: 首次运行需确保模型权重完整下载;在处理大批量文档时建议先在小规模样本上验证版面模式与后端参数配置,避免因参数不当导致的资源浪费或解析质量下降。
4. 优缺点分析
| 优点 |
|---|
| 榜单成绩领先: OmniDocBench v1.6 总分 96.87 登顶,超越 MinerU2.5-Pro、PaddleOCR-VL-1.6、OvisOCR2 等专业模型,综合解析能力在公开评测中处于头部位置。 |
| 参数轻量、部署门槛低: 仅约 1.2B 参数,降低本地 GPU 部署的硬件要求,适合私有化与信创场景,相较于数十亿参数的多模态大模型更具工程落地优势。 |
| 统一框架处理多源文档: 数字文档与相机拍摄文档在同一模型内解析,无需为不同来源文档部署多套系统,简化了架构并降低了运维成本。 |
| 免前置去畸变模块: 几何感知建模可直接处理弯曲、折叠、透视畸变页面,减少独立校正模块带来的误差累积,提升端到端解析精度。 |
| 数据闭环机制高效: 多节点共识投票与图像到图像自验证构建千万级训练数据池,大部分生成数据无需人工标注,数据工程效率高且具备自优化能力。 |
5. 同类工具对比
| 对比维度 | TeleOCR | PaddleOCR-VL-1.6 | MinerU2.5-Pro |
|---|---|---|---|
| 模型规模 | 约 1.2B 参数,轻量级视觉语言架构 | 0.9B 参数 | 未明确公开,专业文档解析模型 |
| OmniDocBench v1.6 总分 | 96.87,登顶榜单 | 未登顶 | 未登顶,被 TeleOCR 超越 |
| 文本识别准确率 | 97.22 | 96.7 | 未单独披露 |
| 表格解析 TEDS | 97.05(数字文档)/ 89.05(拍摄文档) | 94.76(数字文档)/ 81.31(拍摄文档) | 未单独披露 |
| 拍摄文档处理 | 几何感知建模,免独立去畸变模块,直接处理弯曲与透视畸变 | 文档未说明同类机制 | 文档未说明同类机制 |
| 科学图解析 | ICDAR-2026 挑战赛冠军(41.81 分) | 文档未提及参赛成绩 | 文档未提及参赛成绩 |
| 结构化输出 | Markdown / JSON / 表格 / 公式 | 支持结构化输出 | 支持 Markdown 等结构化输出 |
| 开源协议与生态 | GitHub 开源,ModelScope 提供权重,社区建设初期 | 百度飞桨生态,开源社区成熟,文档丰富 | 开源项目,社区活跃度较高 |
选型建议: 对于需要处理大量拍摄文档(如移动端采集的票据、现场拍摄的合同)且对表格结构还原要求较高的场景,TeleOCR 的几何感知建模与 89.05 的拍摄文档 TEDS 优势明显,推荐优先考虑。若团队已深度使用百度飞桨生态,且主要处理数字文档、对社区成熟度与中文技术支持有较高要求,PaddleOCR-VL-1.6 仍是稳妥选择。
对于追求极致解析精度、需要科学图表数据提取能力的学术文献处理场景,TeleOCR 的榜单成绩与 ICDAR-2026 冠军能力更具吸引力。而在需要快速集成且团队对 vLLM 推理引擎熟悉的场景中,TeleOCR 的 vllm-engine 后端支持可降低部署复杂度。
6. 编辑总结
TeleOCR 在文档解析领域展现了值得关注的技术创新性。其统一视觉语言架构打破了传统"版面检测→图像校正→识别"串联流水线的范式,通过几何感知建模与曲率引导采样将文档空间结构学习内化于模型参数之中,从根本上规避了误差累积问题。这一设计选择在轻量级 1.2B 参数约束下实现了 OmniDocBench v1.6 总分 96.87 的领先成绩,验证了"架构创新 + 数据工程"路径在文档智能领域的有效性。数据闭环机制——多节点共识投票筛选伪标签、图像到图像自验证自动纠错、渐进式清洗构建难例集——构成了模型持续优化的内生动力,这一方法论对同类模型的研发具有参考价值。
从实用价值看,TeleOCR 直接输出 Markdown、JSON、表格、公式等结构化结果,显著降低了文档解析到业务系统的接入成本。约 1.2B 的参数规模使本地 GPU 部署成为可能,对数据隐私敏感的政企客户与中小团队而言,这提供了可负担的私有化解析方案。其在复杂表格(TEDS 97.05)与科学图解析(ICDAR-2026 冠军)上的表现,覆盖了合同档案、科研论文、金融票据等高频高价值场景。
适用人群方面,TeleOCR 适合有文档结构化需求的开发团队、数据服务商、科研机构以及需要本地化部署的企业用户。其开源属性与 ModelScope 权重分发降低了试用门槛,技术团队可在数小时内完成部署验证。未来发展潜力上,随着社区生态的完善与更多行业场景的实测反馈,TeleOCR 有望在拍摄文档鲁棒性、多语言支持与国产算力适配方面持续迭代,成为文档智能基础设施的重要选项。
7. 应用场景
合同与档案数字化: 解析合同、档案中的跨行跨列表格与版面结构,将扫描件或拍摄件转为可检索的结构化数据。法务与档案管理部门可据此建立全文检索库,实现合同条款的快速定位与关键信息的自动抽取,提升合规审查效率。
科研论文解析: 提取论文中的公式、表格及柱状图数据,助力文献分析与知识库构建。研究人员可将论文中的实验数据图表自动转为结构化表格,便于跨论文的数据对比与元分析,同时公式的符号级恢复支持 LaTeX 改写与复现验证。
金融票据处理: 识别发票、表单等拍摄件,容忍透视畸变与模糊,自动录入业务系统。财务人员可使用手机拍摄票据完成信息采集,模型直接输出 JSON 结构化数据对接财务系统,减少手工录入错误并加速报销流程。
教育试题录入: 将试卷中的印刷公式、表格题目转为可编辑格式,支撑题库建设与智能批改。教育科技公司可批量处理历史试卷,将公式与图表题目结构化存储,为智能组卷与自动评分系统提供数据基础。
企业报表自动化: 把扫描报表、业务表单批量转为结构化表格,接入数据分析与 RPA 流程。运营团队可将纸质或传真报表数字化,通过统一的结构化输出对接数据仓库,实现报表数据的自动化归集与可视化分析。
8. 常见问题FAQ
Q:TeleOCR 与 PaddleOCR-VL-1.6 相比,核心差异是什么?
A:核心差异体现在拍摄文档处理能力与科学图解析上。TeleOCR 采用几何感知建模,可直接处理弯曲、透视畸变页面,拍摄文档表格 TEDS 达 89.05,显著高于 PaddleOCR-VL-1.6 的 81.31;同时 TeleOCR 在 ICDAR-2026 科学图解析挑战赛中夺冠,具备图表数据提取能力。PaddleOCR-VL-1.6 的优势在于百度飞桨生态的成熟度与中文技术支持。
Q:TeleOCR 对 GPU 硬件的最低要求是什么?
A:官方未公布最低显存要求,但模型仅约 1.2B 参数,结合 GPU_MEMORY_UTILIZATION 参数调节,常规文档解析建议显存不低于 8GB。高分辨率文档或批量处理场景可适当提升显存配置,并通过调整 MAX_PIXELS 控制单页像素数来平衡资源占用。
Q:是否支持 CPU 推理?
A:官方使用指南明确要求支持 CUDA 的 GPU 环境,推理依赖 GPU 加速。纯 CPU 环境下推理速度会显著下降,不建议用于生产场景。国产算力平台(如昇腾、寒武纪)的适配情况待官方公布。
Q:如何切换数字文档与拍摄文档的解析模式?
A:通过设置 LAYOUT_MODE 环境变量实现:数字文档使用 "Detection" 模式,弯曲或退化的拍摄页面切换为 "Segmentation" 模式。后者对几何形变页面具有更强的边界感知与结构恢复能力。
Q:TeleOCR 输出的 JSON 结构包含哪些字段?
A:JSON 输出通常包含文本内容、版面区域坐标、表格结构(行列合并关系)、公式语义表示等结构化字段,具体字段定义以项目文档为准。用户可将 JSON 直接接入知识检索系统或业务数据库,无需二次解析。
Q:模型权重在哪里下载?
A:模型权重托管在 ModelScope 平台,可通过 modelscope download --model XingChen-AGI/TeleOCR --local_dir ./models/TeleOCR 命令下载至本地。GitHub 仓库提供推理代码与使用文档。
9. 项目地址
- GitHub 仓库:https://github.com/caipeng328/TeleOCR (官方代码仓库,提供推理代码与使用文档)
- ModelScope 模型库:https://www.modelscope.cn/models/XingChen-AGI/TeleOCR (官方模型权重下载渠道)
- arXiv 技术论文:https://arxiv.org/pdf/2608.12898 (官方技术报告,详述架构与训练方法)
相关 AI 模型文章

Ok Work – 百度推出的 AI 随身办公工具
Ok Work是百度推出的轻量化AI随身办公工具,以微信小程序形态运行,面向学生与职场新人,聚焦碎片化办公场景。产品将AI PPT、AI写作、AI表格、AI生图四大核心能力整合于同一对话界面,内置海量模板并支持"做同款"快速套用,无需下载安装即可完成从内容生成、文档转换到视觉设计的完整轻办公流程。依托文心大模型的底层能力,Ok Work将复杂的AI能力拆解为颗粒度精细的具体小工具,以极低的上手门槛...

Ming-Image-0.1-Design:蚂蚁开源6B图像生成模型,端到端重构设计工作流
Ming-Image-0.1-Design是蚂蚁集团InclusionAI开源的一款6B参数图像生成模型,专注设计场景,支持8K长结构化提示词,能端到端生成UI、信息图、海报等完整视觉设计。配合同步开源的Design-Layer模型,该工具可将设计图拆解为2—9个可独立编辑的透明图层,实现"生成—分层—编辑—交付"全流程。Ming-Image-0.1-Design登顶Artificial Anal...
Xiaomi MiMo-V2.6 – 小米开源的全模态模型系列
Xiaomi MiMo-V2.6是小米发布并开源的全模态模型系列,包含Pro和Flash两个原生全模态模型,以可验证复杂任务为核心的大规模Agentic强化学习为技术主线。该系列通过6天在线强化学习、约75万条交互轨迹的系统训练,显著提升了软件工程、代码生成、视觉理解与网络安全等多维度能力,并将能力边界扩展至3D游戏场景构建、Blender三维建模、机械臂具身控制、Computer Use自动化操...

Qwen-Image-2.1评测:7B轻量开源模型如何兼顾文生图、图像编辑与原生透明通道
Qwen-Image-2.1 是由阿里千问团队开源的新一代图像生成模型,其视觉生成部分仅含 7B 参数,却在官方评测中以 60.28 分的综合成绩登顶开源榜单,甚至超越 Nano Banana 2.0、GPT Image 1.5 等闭源商业模型。该模型将文生图与图像编辑整合于同一架构,原生支持透明图像(RGBA)的生成与编辑,最多可输入 10 张参考图完成多主体合成,并提供圈选、涂抹、掩码三种局部...
版权声明:本文部分内容由 AI 辅助生成并经人工校准,版权归本站所有,未经允许禁止任何形式的转载。
