TeleOCR – 中国电信星辰实验室开源的文档解析模型

AI项目 2026-09-24

TeleOCR是什么

TeleOCR 是中国电信星辰实验室开源的文档解析模型,采用约 1.2B 参数轻量级视觉语言架构,在单一框架内统一处理数字文档与相机拍摄文档,可将文字、版面、表格、公式和科学图表解析为 Markdown、JSON 等结构化结果。TeleOCR 登顶 OmniDocBench v1.6 榜单,获 PureDocBench 榜首和 ICDAR-2026 科学图解析冠军,支持本地 GPU 部署,适用合同、论文、档案等结构化提取场景。

TeleOCR

TeleOCR的主要功能

  • 文字识别:高精度提取文档中的文本内容,数字文档识别准确率达 97.22。
  • 版面分析:定位文字、表格、公式等元素在页面中的位置与层级关系。
  • 表格解析:精确还原跨行跨列、单元格合并的复杂表格结构,TEDS 达 97.05。
  • 公式解析:结构化解析公式语义与语法,实现符号级准确恢复,CDM 达 96.36。
  • 科学图表解析:识别图表元素并提取数据,可转换论文柱状图为结构化表格(ICDAR-2026 冠军能力)。
  • 拍摄文档处理:直接处理透视畸变、页面弯曲、阴影模糊等真实拍摄退化文档,无需独立去畸变模型。
  • 结构化输出:结果可生成为 Markdown、JSON、表格、公式等格式,便于接入知识检索与业务系统。

TeleOCR的技术原理

  • 统一视觉语言架构:TeleOCR 采用约 1.2B 参数的轻量级视觉语言模型,将数字文档与相机拍摄文档放入同一框架,端到端完成版面与内容解析,替代传统”版面检测→图像校正→识别”的串联流水线,避免误差累积。
  • 几何感知建模:针对不规则页面形变,引入几何感知建模与曲率引导的 Douglas-Peucker 采样,显式学习文档边界与空间结构,使模型能直接处理弯曲、折叠和透视畸变页面。
  • 数据工程闭环:数据体系覆盖生成、清洗、评估与优化:通过多节点共识投票筛选高置信伪标签;几何感知数据合成围绕旋转、畸变、弯曲构造样本;图像到图像自验证将解析结果重新渲染比对以自动纠错;渐进式清洗让高一致性样本进训练集、高分歧样本作难例优化,形成投票筛选—模型自训练闭环。
  • 渐进式四阶段训练:训练按”视觉语言对齐→几何感知文档解析→内容-结构解耦学习→强化学习”推进,目标从基础感知过渡到精细理解。表格任务用 Structure-only强化行列结构理解,再用 Structure+Content 完成联合对齐;公式任务同样通过解耦学习语义与语法组织。
挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用TeleOCR

  • 环境准备:安装 Python 3.10+ 并确保有支持 CUDA 的 GPU 环境。
  • 拉取代码:执行 git clone https://github.com/caipeng328/TeleOCR.git 并进入目录。
  • 创建环境:用 conda 创建名为 teleocr 的虚拟环境并激活。
  • 安装依赖:运行 pip install -e . 安装项目依赖。
  • 下载模型:通过 pip install modelscope 后用 modelscope 命令下载权重到本地 ./models/TeleOCR 目录。
  • 准备目录:设置输入图片目录 IMAGE_SUB_PATH 和结果输出目录 RESULT_SAVE_PATH。
  • 运行推理:执行 python infer.py,传入图片路径、结果路径、--use_async、--override、模型路径及后端参数。
  • 选择后端:常规使用 vllm-engine,高并发批量处理可切换 vllm-async-engine。
  • 设置版面模式:数字文档用 LAYOUT_MODE="Detection",弯曲/退化拍摄页面切换为 "Segmentation"。
  • 调优参数:按需调整 MAX_MODEL_LEN(上下文长度)、GPU_MEMORY_UTILIZATION(显存占用)、PDF_TOOLS(PDF 后端)和 MAX_PIXELS(单页最大像素数)。
  • 获取结果:从输出目录读取解析后的 Markdown/JSON/表格等结构化结果,接入下游系统。

TeleOCR的核心优势

  • 榜单成绩领先:OmniDocBench v1.6 总分 96.87 登顶,超越 MinerU2.5-Pro、PaddleOCR-VL-1.6、OvisOCR2 等专业模型。
  • 参数轻量:仅约 1.2B 参数,降低本地部署门槛,适合私有化场景。
  • 统一框架:数字文档与相机拍摄文档在同一模型内解析,无需为不同来源文档部署多套系统。
  • 免前置去畸变:几何感知建模可直接处理弯曲、折叠、透视畸变页面,减少独立校正模块的误差累积。
  • 结构化输出:直接输出 Markdown、JSON、表格、公式等可计算结果,便于接入知识检索与业务自动化。
  • 复杂表格能力强:跨行跨列、单元格合并的复杂表格行列表系不乱、不串位,TEDS 达 97.05。
  • 科学图解析夺冠:具备图表元素识别与数据提取能力,获 ICDAR-2026 科学图解析挑战赛冠军。
  • 数据闭环高效:多节点共识投票与自验证机制构建千万级训练数据池,大部分生成数据无需人工标注。

TeleOCR的项目地址

  • GitHub仓库:https://github.com/caipeng328/TeleOCR
  • HuggingFace模型库:https://www.modelscope.cn/models/XingChen-AGI/TeleOCR
  • arXiv技术论文:https://arxiv.org/pdf/2608.12898

TeleOCR的同类竞品对比

对比维度 TeleOCR PaddleOCR-VL-1.6
模型规模 约 1.2B 参数,轻量级  0.9B 参数
OmniDocBench v1.6 总分 96.87,登顶榜单 未登顶
文本识别 97.22 96.7
表格解析 TEDS 97.05 94.76
拍摄文档表格 TEDS(Wild) 89.05 81.31
拍摄文档处理 几何感知建模,免独立去畸变模块 文档未说明同类机制
科学图解析 ICDAR-2026 挑战赛冠军(41.81 分) 文档未提及参赛成绩
结构化输出 Markdown / JSON / 表格 / 公式 支持结构化输出

TeleOCR的应用场景

  • 合同与档案数字化:解析合同、档案中的跨行跨列表格与版面结构,转为可检索的结构化数据。
  • 科研论文解析:提取论文中的公式、表格及柱状图数据,助力文献分析与知识库构建。
  • 金融票据处理:识别发票、表单等拍摄件,容忍透视畸变与模糊,自动录入业务系统。
  • 教育试题录入:将试卷中的印刷公式、表格题目转为可编辑格式,支撑题库建设与智能批改。
  • 企业报表自动化:把扫描报表、业务表单批量转为结构化表格,接入数据分析与 RPA 流程。
©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

相关文章