闲社服务运行正常AI智能体自动化平台

Fara1.5-4B

microsoft/Fara1.5-4B

发布机构微软(Microsoft)已核实

下载访问条件国内镜像可用

Fara1.5-4B是微软研究院AI Frontiers开发的多模态计算机使用代理(CUA),专为网页浏览器设计。该模型通过截图观察浏览器界面,代表用户执行结构化工具调用(如点击、输入、滚动、访问URL、网页搜索等),端到端完成各类任务。 端到端网页任务完成:可填写表单、预订餐厅、申请职位、规划行程、管理购物车等,不仅限于点击操作,而是按目标序列执行动作。 纯视觉感知:仅通过截图进行感知,无需访问DOM或无障碍树,匹配人类用户的输入模态。

文字对话图文理解
模型详情

模型介绍

中文整理

Fara1.5-4B

模型用途

Fara1.5-4B是微软研究院AI Frontiers开发的多模态计算机使用代理(CUA),专为网页浏览器设计。该模型通过截图观察浏览器界面,代表用户执行结构化工具调用(如点击、输入、滚动、访问URL、网页搜索等),端到端完成各类任务。

主要能力

端到端网页任务完成:可填写表单、预订餐厅、申请职位、规划行程、管理购物车等,不仅限于点击操作,而是按目标序列执行动作。

纯视觉感知:仅通过截图进行感知,无需访问DOM或无障碍树,匹配人类用户的输入模态。

坐标锚定动作:直接预测像素级点击和拖动目标,无需单独的锚定模型。

关键点安全设计:在涉及个人信息输入、支付、提交、登录、发送消息或其他不可逆操作前,会停止并询问用户。

长上下文:262K token,支持多截图轨迹及完整动作历史。

可本地运行:4B参数,可在单张A100/H100/B200上运行,保留截图历史空间。

输入输出

输入:用户目标(文本)、当前截图、代理历史思考和动作

输出:思维链(Chain-of-thought)区块后接工具调用区块(XML标签格式)

运行要求

依赖库:torch >= 2.11.0、transformers >= 5.2.0、vllm >= 0.19.1

硬件:GPU需有足够显存运行4B模型bf16精度(已测试A6000、A100、H100、B200)

基本用法

推荐通过MagenticLite或Github/fara CLI运行。推荐部署方案为MagenticLite,它提供沙盒隔离、域名白名单、实时监控和暂停功能。

系统提示:模型针对特定系统提示进行训练,需原样使用以获得最佳效果。完整提示(含工具schema)随MagenticLite一起分发。

工具类型:鼠标点击(左键、右键、双击、三击)、拖动、键盘输入、滚动、浏览器导航、网页搜索、暂停记忆、询问用户、等待、终止任务。

模型最常训练的屏幕分辨率为1440×900,建议在沙盒中匹配此分辨率以获得最可靠的锚定效果。

限制

语言限制:仅支持英语(训练数据仅含英文)

领域限制:不适用于高风险领域(法律、医疗、金融建议),不容忍可能导致伤害的不准确操作

部署限制:不容许无沙盒部署访问敏感账户或文件;未经验证不得用于商业或实际生产环境

感知限制:纯视觉感知可能被欺骗性或低质量页面渲染、嵌入页面的提示注入或UI元素视觉歧义所误导

累积误差:多步轨迹会累积错误,早期误点击可能影响后续操作

运行差异:多轮任务运行间存在非平凡方差,基准数据为多次运行平均值

幻觉风险:模型可能幻觉页面状态或误归因先前截图中的信息

许可证

MIT许可证

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部