资讯动态

Sarvam Vision 2.1更新实现印度22种语言OCR突破

在智能文档处理领域,许多从业者普遍发现,英语的光学字符识别(OCR)技术已经进入瓶颈状态,而在处理印度语言时,模型效率却大打折扣,常常出现漏字或无中生有的现象。以1950年代的老报纸为例,扫描后生成的文本往往真假参半。为了解决这些问题,Sarvam Vision 2.1的更新正是朝着这个方向努力。与其继续关注英文市场,Sarvam团队则致力于解决三大明显短板:复杂表格解析、表单中的键值提取以及印度手写体识别。

在Sarvam Vision之前的版本发布于2026年2月,定位为通用视觉语言模型,主要聚焦于印度语言的OCR、表格解析和多语言视觉推理。在上线后,团队收到的反馈主要集中在两个方面:某些功能的缺失与日常使用的不便。为了提升用户体验,团队对模型进行了优化,使其服务成本降低,同时针对实际生产需求调整了API接口。在能力方面,解决的正是文档智能领域中的挑战,包括多页表格结构化抽取、表单键值提取与印度手写体的识别,而且还逐步改进了曾受到批评的误识别与一致性问题。

架构方面保持不变,依然采用"硬件与视觉语言模型相结合"的模式,主要组件包括语义布局解析器和指针阅读顺序网络。该模型能够在页面级或文档级进行直接操作,但为了精度的平衡,仍需依赖于硬件的辅助支持。最大的变化在于数据的重构。团队特别创建了大规模高质量的数据集,涵盖了合成数据和真实数据,以提升模型的能力,包括对手写和印刷表单的多语言生成以及大规模实际表单的提取。此外,视频等新数据源的引入,促进了印度手写体的识别能力。数据准备完成后,团队进行了大规模的后续训练,采用先监督微调再采用RLVR的方法。 龙8头号玩家

在基准评测方面,Sarvam继续使用olmOCR-Bench和OmniDocBench两个标准,尽管这两个榜单已经趋于饱和,但仍代表了社区认可的模型能力标准。olmOCR-Bench专注于文档层面的表现,而OmniDocBench v1.6则综合评估文本的编辑距离、表格结构及公式识别的准确性。而真正创新的是Sarvam Indic OCR Bench,这是一个专门针对22种印度官方语言准确性的评估基准,共有6909个样本,其中6609个涉及印度语言,300个为英文,旨在严格衡量字符和词的准确性。样本来源多样,包括报纸、宣传册、教科书等,涵盖1800年至今,以便更全面地反映印度语言的演变。

在文档智能的领域,评价一个系统的好坏取决于多个方面,而这些方面之间并不一定关联。例如,能否准确转录1950年代的扫描件、还原表格结构的准确性以及转录特定语言的表现,这些都是重要指标。Sarvam Vision 2.1追求的是在多目标领域中达成最佳平衡与提升。