AB
AiBoss
ニュース

小米研究团队开放 Xiaomi-OCR-0:0.8B 文档解析与 OCR 理解模型

Xiaomi-OCR-0 的技术论文和官方仓库已公开;这款 0.8B 视觉语言模型面向文档解析、关键信息抽取与 OCR 场景问答。

小米研究团队公开 Xiaomi-OCR-0 技术报告及项目仓库,模型基于 Qwen3.5-0.8B,训练数据约 1.7 亿条 OCR 相关样本。官方仓库提供模型链接、推理代码和本地演示说明。

它支持把页面解析为结构化 Markdown、按字段输出 JSON,以及回答文档图片中的文本问题。论文中的性能数字属于作者报告结果,实际效果仍需结合具体版式与独立测试判断。

参考:Xiaomi-OCR-0 研究团队原始资料