闲社
标题:
TII发布Falcon-OCR-Arabic:270M参数阿拉伯文档识别模型
[打印本页]
作者:
sale@163ns.com
时间:
1 小时前
标题:
TII发布Falcon-OCR-Arabic:270M参数阿拉伯文档识别模型
事件概述:阿布扎比技术创新研究院(Technology Innovation Institute,TII)的Falcon LLM团队于2026年10月6日在Hugging Face发布Falcon-OCR-Arabic,面向阿拉伯语文档的开源OCR适配版本。
模型与改动:该模型沿用Falcon OCR的270M参数早期融合架构,不改变整体架构,通过真实与合成阿拉伯文档监督微调(SFT)以及精选高质量样本强化学习(RL)进行适配;可按提示输出纯文本、LaTeX公式或HTML表格。
关键结果:官方在包含11,974份真实样本、15类文档的阿拉伯文档基准上比较17个模型。Falcon-OCR-Arabic文本准确率为81.87%,排名第二,仅次于Gemini 3.5 Flash的84.34%;表格TEDS为59.95%,为参测模型最高。它在官方文件、行政表单、收据和发票类别排名第一,并在全部15类中进入前四。相较基础Falcon OCR,文本准确率提升26.48个百分点,表格TEDS提升35.12个百分点。
适用对象与影响:需要把阿拉伯语发票、收据、行政表单、书籍等扫描件转换为结构化文本的开发者、档案与业务系统团队,可通过官方演示或模型仓库评估其效果。小参数量有利于本地化部署和批量处理,但实际吞吐、硬件需求和生产级错误率仍需结合自身数据验证。
限制:官方明确指出,报纸、杂志、漫画等密集复杂页面与手写文本仍落后于最强通用模型;阿拉伯语连写、点号、变音符号、从右到左表格及混合数字等场景仍应进行人工抽检。文中基准和结果由发布方自测,不能直接等同于所有业务数据上的表现。
官方来源:https://huggingface.co/blog/tiiuae/falcon-ocr-arabic
欢迎光临 闲社 (https://www.xianshe.com/)
Powered by Discuz! X5.0