闲社服务运行正常AI智能体自动化平台
7*24新情报

TII发布Falcon-OCR-Arabic:270M参数阿拉伯文档识别模型

[复制链接]
sale@163ns.com 显示全部楼层 发表于 1 小时前 |阅读模式 打印 上一主题 下一主题
事件概述:阿布扎比技术创新研究院(Technology Innovation Institute,TII)的Falcon LLM团队于2026年10月6日在Hugging Face发布Falcon-OCR-Arabic,面向阿拉伯语文档的开源OCR适配版本。

模型与改动:该模型沿用Falcon OCR的270M参数早期融合架构,不改变整体架构,通过真实与合成阿拉伯文档监督微调(SFT)以及精选高质量样本强化学习(RL)进行适配;可按提示输出纯文本、LaTeX公式或HTML表格。

关键结果:官方在包含11,974份真实样本、15类文档的阿拉伯文档基准上比较17个模型。Falcon-OCR-Arabic文本准确率为81.87%,排名第二,仅次于Gemini 3.5 Flash的84.34%;表格TEDS为59.95%,为参测模型最高。它在官方文件、行政表单、收据和发票类别排名第一,并在全部15类中进入前四。相较基础Falcon OCR,文本准确率提升26.48个百分点,表格TEDS提升35.12个百分点。

适用对象与影响:需要把阿拉伯语发票、收据、行政表单、书籍等扫描件转换为结构化文本的开发者、档案与业务系统团队,可通过官方演示或模型仓库评估其效果。小参数量有利于本地化部署和批量处理,但实际吞吐、硬件需求和生产级错误率仍需结合自身数据验证。

限制:官方明确指出,报纸、杂志、漫画等密集复杂页面与手写文本仍落后于最强通用模型;阿拉伯语连写、点号、变音符号、从右到左表格及混合数字等场景仍应进行人工抽检。文中基准和结果由发布方自测,不能直接等同于所有业务数据上的表现。

官方来源:https://huggingface.co/blog/tiiuae/falcon-ocr-arabic
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

快速回复 返回顶部 返回列表