腾讯混元 OCR 模型宣布开源：参数仅 1B，多项核心能力 SOTA

11月25日讯 腾讯混元今日宣布推出全新开源模型 HunyuanOCR，参数仅为 1B，依托于混元原生多模态架构打造，获得多项业界 OCR 应用榜单 SOTA（最先进水平）成绩。

腾讯官方表示，得益于混元原生多模态大模型“端到端”的理念设计，HunyuanOCR 各项功能仅需单次前向推理即可直达最优结果。

混元 OCR 专家模型依托于混元原生多模态架构打造，主要由三大部分组建构成：原生分辨率视频编码器、自适应视觉适配器和轻量化混元语言模型。

不同于其他开源的 OCR 专家模型或系统，HunyuanOCR 模型的训练和推理均采用全端到端范式，通过规模化的应用导向数据，结合在线强化学习，模型表现出了稳健的端到端推理能力。

混元 OCR 多项核心能力达到 SOTA 效果，其中在复杂文档解析的 OmniDocBench 测评中，获得了最高的 94.1 分，效果超过了谷歌的 Gemini3-pro 等一众领先的模型；文字检测和识别能力，在自建覆盖了 9 大应用场景（文档、艺术字、街景、手写、广告、票据、截屏、游戏、视频）的基准上，大幅度领先同类开源模型以及商业 OCR 模型；在 OCRBench 榜单上，总得分为 860 分，以仅仅 1B 总参数的模型配置，取得了包括通用视觉理解模型在内总参数 3B 以下的 SOTA 成绩。

声明：魔果智讯倡导尊重与保护知识产权。如发现本站文章存在版权等问题，烦请30天内提供版权疑问、身份证明、版权证明、联系方式等发邮件至moguoai@yeah.net！我们将及时沟通与处理。

{{userData.name}}已认证

腾讯混元 OCR 模型宣布开源：参数仅 1B，多项核心能力 SOTA

QQ

微信

邮箱

{{userData.name}}已认证

关于我们

Content

About

Contact

QQ

微信

邮箱

人工智能领域全媒体矩阵