TeleOCR – 中国电信星辰实验室开源的文档解析模型
TeleOCR是什么
TeleOCR 是中国电信星辰实验室开源的文档解析模型,采用约 1.2B 参数轻量级视觉语言架构,在单一框架内统一处理数字文档与相机拍摄文档,可将文字、版面、表格、公式和科学图表解析为 Markdown、JSON 等结构化结果。TeleOCR 登顶 OmniDocBench v1.6 榜单,获 PureDocBench 榜首和 ICDAR-2026 科学图解析冠军,支持本地 GPU 部署,适用合同、论文、档案等结构化提取场景。

TeleOCR的主要功能
-
文字识别:高精度提取文档中的文本内容,数字文档识别准确率达 97.22。
-
版面分析:定位文字、表格、公式等元素在页面中的位置与层级关系。
-
表格解析:精确还原跨行跨列、单元格合并的复杂表格结构,TEDS 达 97.05。
-
公式解析:结构化解析公式语义与语法,实现符号级准确恢复,CDM 达 96.36。
-
科学图表解析:识别图表元素并提取数据,可转换论文柱状图为结构化表格(ICDAR-2026 冠军能力)。
-
拍摄文档处理:直接处理透视畸变、页面弯曲、阴影模糊等真实拍摄退化文档,无需独立去畸变模型。
-
结构化输出:结果可生成为 Markdown、JSON、表格、公式等格式,便于接入知识检索与业务系统。
TeleOCR的技术原理
- 统一视觉语言架构:TeleOCR 采用约 1.2B 参数的轻量级视觉语言模型,将数字文档与相机拍摄文档放入同一框架,端到端完成版面与内容解析,替代传统”版面检测→图像校正→识别”的串联流水线,避免误差累积。
- 几何感知建模:针对不规则页面形变,引入几何感知建模与曲率引导的 Douglas-Peucker 采样,显式学习文档边界与空间结构,使模型能直接处理弯曲、折叠和透视畸变页面。
- 数据工程闭环:数据体系覆盖生成、清洗、评估与优化:通过多节点共识投票筛选高置信伪标签;几何感知数据合成围绕旋转、畸变、弯曲构造样本;图像到图像自验证将解析结果重新渲染比对以自动纠错;渐进式清洗让高一致性样本进训练集、高分歧样本作难例优化,形成投票筛选—模型自训练闭环。
- 渐进式四阶段训练:训练按”视觉语言对齐→几何感知文档解析→内容-结构解耦学习→强化学习”推进,目标从基础感知过渡到精细理解。表格任务用 Structure-only强化行列结构理解,再用 Structure+Content 完成联合对齐;公式任务同样通过解耦学习语义与语法组织。

微信关注回复“开源”,加入AI开源项目交流群
如何使用TeleOCR
-
环境准备:安装 Python 3.10+ 并确保有支持 CUDA 的 GPU 环境。
-
拉取代码:执行
git clone https://github.com/caipeng328/TeleOCR.git并进入目录。 -
创建环境:用 conda 创建名为 teleocr 的虚拟环境并激活。
-
安装依赖:运行
pip install -e .安装项目依赖。 -
下载模型:通过
pip install modelscope后用 modelscope 命令下载权重到本地./models/TeleOCR目录。 -
准备目录:设置输入图片目录
IMAGE_SUB_PATH和结果输出目录RESULT_SAVE_PATH。 -
运行推理:执行
python infer.py,传入图片路径、结果路径、--use_async、--override、模型路径及后端参数。 -
选择后端:常规使用
vllm-engine,高并发批量处理可切换vllm-async-engine。 -
设置版面模式:数字文档用
LAYOUT_MODE="Detection",弯曲/退化拍摄页面切换为"Segmentation"。 -
调优参数:按需调整
MAX_MODEL_LEN(上下文长度)、GPU_MEMORY_UTILIZATION(显存占用)、PDF_TOOLS(PDF 后端)和MAX_PIXELS(单页最大像素数)。 -
获取结果:从输出目录读取解析后的 Markdown/JSON/表格等结构化结果,接入下游系统。
TeleOCR的核心优势
-
榜单成绩领先:OmniDocBench v1.6 总分 96.87 登顶,超越 MinerU2.5-Pro、PaddleOCR-VL-1.6、OvisOCR2 等专业模型。
-
参数轻量:仅约 1.2B 参数,降低本地部署门槛,适合私有化场景。
-
统一框架:数字文档与相机拍摄文档在同一模型内解析,无需为不同来源文档部署多套系统。
-
免前置去畸变:几何感知建模可直接处理弯曲、折叠、透视畸变页面,减少独立校正模块的误差累积。
-
结构化输出:直接输出 Markdown、JSON、表格、公式等可计算结果,便于接入知识检索与业务自动化。
-
复杂表格能力强:跨行跨列、单元格合并的复杂表格行列表系不乱、不串位,TEDS 达 97.05。
-
科学图解析夺冠:具备图表元素识别与数据提取能力,获 ICDAR-2026 科学图解析挑战赛冠军。
-
数据闭环高效:多节点共识投票与自验证机制构建千万级训练数据池,大部分生成数据无需人工标注。
TeleOCR的项目地址
- GitHub仓库:https://github.com/caipeng328/TeleOCR
- HuggingFace模型库:https://www.modelscope.cn/models/XingChen-AGI/TeleOCR
- arXiv技术论文:https://arxiv.org/pdf/2608.12898
TeleOCR的同类竞品对比
| 对比维度 | TeleOCR | PaddleOCR-VL-1.6 |
|---|---|---|
| 模型规模 | 约 1.2B 参数,轻量级 | 0.9B 参数 |
| OmniDocBench v1.6 总分 | 96.87,登顶榜单 | 未登顶 |
| 文本识别 | 97.22 | 96.7 |
| 表格解析 TEDS | 97.05 | 94.76 |
| 拍摄文档表格 TEDS(Wild) | 89.05 | 81.31 |
| 拍摄文档处理 | 几何感知建模,免独立去畸变模块 | 文档未说明同类机制 |
| 科学图解析 | ICDAR-2026 挑战赛冠军(41.81 分) | 文档未提及参赛成绩 |
| 结构化输出 | Markdown / JSON / 表格 / 公式 | 支持结构化输出 |
TeleOCR的应用场景
-
合同与档案数字化:解析合同、档案中的跨行跨列表格与版面结构,转为可检索的结构化数据。
-
科研论文解析:提取论文中的公式、表格及柱状图数据,助力文献分析与知识库构建。
-
金融票据处理:识别发票、表单等拍摄件,容忍透视畸变与模糊,自动录入业务系统。
-
教育试题录入:将试卷中的印刷公式、表格题目转为可编辑格式,支撑题库建设与智能批改。
-
企业报表自动化:把扫描报表、业务表单批量转为结构化表格,接入数据分析与 RPA 流程。
©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。
粤公网安备 123456789号