TeleOCR - 统一数字文档与拍照文档解析的轻量视觉语言模型
TeleOCR 是 StarDoc-AI 开源的文档解析视觉语言模型,采用 apache-2.0 许可,在 Hugging Face 上以 image-text-to-text 任务发布。项目自述其约 1.2B 参数,试图在同一框架内同时处理数字文档与相机拍摄文档,并引入多节点共识投票、几何感知建模等训练与数据技术。
TeleOCR 是一个面向文档解析的开源视觉语言模型,托管在 Hugging Face 上,任务类型为 image-text-to-text,使用 transformers 框架。按项目自述,它的目标不是只处理扫描件或只处理手机拍照件,而是把数字文档与相机拍摄文档统一到同一个解析框架里,适合需要从版面复杂的文档中抽取文字、公式、表格与阅读顺序的开发者与研究者。项目自述其规模约 1.2B 参数,定位为轻量、便于实际部署的解析模型。
维护者与状态
该项目由 StarDoc-AI 维护,仓库创建时间为 2026-08-14,最后更新时间为 2026-09-22。截至 2026-09-24 的数据读取时间,近 30 天下载量为 30783,点赞数为 172。许可证为 apache-2.0。
需要说明的是,本次可核实的事实表中没有给出正式 release 版本号,因此这里不描述具体版本发布情况;仓库的创建与更新时间如上,下载与点赞数据均以 2026-09-24 为读取时点。
主要能力
以下能力均来自项目自述(README / 模型卡),并非独立评测结论,引用时请以「项目自述」理解。
- 统一两类文档场景:项目自述 TeleOCR 把数字文档与相机拍摄文档统一在单一框架内,而不是分别针对其中一类。
- 多节点共识投票(MCV):用于自动生成伪标签,属于数据侧的技术设计。
- 几何感知的文档建模:面向相机拍摄文档,处理拍摄带来的几何形变。
- 曲率引导的 Douglas-Peucker 采样(CGDP):项目自述中列出的采样方法。
- 图像到图像的自校验:用于自动数据精炼。
- 渐进式四阶段训练流程:项目自述的训练管线设计。
- 内容与结构解耦学习:针对表格与公式的建模方式。
- 畸变文档直接解析:项目自述称,在 DocUNet、DIR300 等公开去畸变数据集上做视觉评估时,TeleOCR 可直接对畸变文档进行版面与内容解析,无需先去畸变预处理,也不需要专门的矫正模型。
项目自述还提到,模型在数字文档与相机拍摄文档的公开基准上取得了其所述的表现,并保持轻量以便实际部署。这些表述属于维护者自述,本文不引用具体分数,也不做与其他项目的横向比较。
使用入口
模型仓库地址为 StarDoc-AI/TeleOCR,可在该页面查看模型卡、权重与调用说明。
按事实表,项目使用 transformers 框架、任务类型为 image-text-to-text,因此常规的接入方式是通过 transformers 加载该仓库的模型与处理器进行图文输入推理;具体加载代码、依赖版本与推理参数请以仓库页面上的说明为准。素材中提到的其他分发形式与社区部署经验(例如 GGUF 转换、llama.cpp 支持、特定硬件上的部署分享)属于第三方或社区内容,本文不展开,也不在此给出链接。
许可与限制
许可证为 apache-2.0,使用时请遵循该许可证条款,并以仓库中的 LICENSE 文件为准。
关于限制与边界,可依据项目自述归纳如下:
- 项目自述的定位是文档解析,能力描述集中在文字、公式、表格与阅读顺序等文档结构信息上,并未声称覆盖文档解析之外的通用视觉任务。
- 项目自述强调「轻量」与「便于实际部署」,但本次可核实的事实表与素材中均未给出具体的硬件要求、显存占用或推理速度数据,因此本文不提供此类数字,部署前请自行在目标环境中验证。
- 项目自述中提到的畸变文档直接解析能力,是在其自述的评估设置下得出的,实际效果会随文档类型、拍摄条件与输入质量变化。
- 素材中出现的基准分数、竞赛名次与对比表格均为维护者自述内容,本文未做独立复现,故不引用具体数值,也不做竞品对比。
- 素材中提到的社区转换格式与第三方部署经验不由本项目维护者直接维护,可用性与兼容性需自行确认。
总体而言,TeleOCR 是一个以 apache-2.0 许可发布、由 StarDoc-AI 维护的文档解析视觉语言模型,适合关注数字文档与拍照文档统一解析流程的开发者评估使用;在正式采用前,建议结合自身文档样本与部署环境做验证。