模型介绍
中文整理# Fara1.5-27B 模型卡片
模型概述
Fara1.5-27B 是由微软研究院AI前沿团队开发的多模态计算机使用代理(CUA),专门用于Web浏览器操作。该模型通过截图观察浏览器界面,代表用户执行结构化工具调用(如点击、输入、滚动、访问URL、网页搜索等),完成端到端的任务。
## 主要能力
- *端到端网页任务完成**:可填写表单、预订餐厅、申请职位、规划行程、管理购物车等,不仅限于简单点击,而是按目标序列执行操作。
- *纯视觉感知**:仅通过截图操作,无需访问DOM或无障碍树,与人类用户的输入模态一致。
- *坐标定位动作**:直接预测像素级点击和拖拽目标,无需单独的定位模型。
- *关键点安全设计**:在涉及个人信息输入、支付、提交、登录、发送消息或其他不可逆操作前,会停止并询问用户。
- *长上下文支持**:262K token上下文长度,可支持多截图轨迹及完整操作历史。
输入与输出
- *输入**:用户目标(文本)、当前截图、代理之前的思考和动作历史
- *输出**:思维链(Chain-of-thought)区块 followed by 工具调用区块(XML标签包裹的JSON对象)
支持的工具调用包括:鼠标点击(单击、右键、双击、三击)、鼠标移动和拖拽、键盘输入、页面滚动、浏览器导航(访问URL、后退)、网页搜索、暂停并记录事实、询问用户问题、等待、终止任务。
运行要求
- *软件依赖**:
- torch >= 2.11.0
- transformers >= 5.2.0
- vllm >= 0.19.1
- *硬件要求**:需要足够显存运行27B模型(bf16精度)。已测试GPU包括A6000、A100、H100和B200。建议至少在2个GPU上分片运行模型。
- *推荐分辨率**:1440×900(模型训练时最常用的屏幕分辨率)
基本用法
建议通过MagenticLite运行,这是官方推荐的部署方式,可提供:
- 沙盒隔离:浏览器在Docker容器中运行,无法访问主机文件或环境变量
- 允许列表:限制导航到用户指定的域名
- 监控模式:实时监控每一步操作并记录完整日志
- 暂停功能:可随时立即停止代理活动
也可使用GitHub/fara CLI,但需自行实现安全控制措施。
## 限制与已知问题
- *感知局限**:纯视觉感知可能被欺骗性或低质量页面渲染、页面内容中的提示注入、或UI元素的视觉歧义所误导。
- *误差累积**:多步骤轨迹中,早期的误点击可能累积导致任务失败。
- *运行差异**:多轮任务的运行间方差不可忽视,基准测试数据为多次运行的平均值。
- *幻觉风险**:模型可能虚构页面状态或误归因之前截图中的信息。
- *语言限制**:训练数据仅包含英语,对非英语内容支持较差。
- *高风险领域**:不适用于法律、医疗、金融建议等高风险领域,也不适用于影响法律状态、住房、就业或信贷的分配决策。
许可证
MIT许可证
## 联系方式
欧盟AI法案相关信息请求:MSFTAIActRequest@microsoft.com
授权代表:Microsoft Ireland Operations Limited, 70 Sir John Rogerson's Quay, Dublin 2, D02 R296, Ireland
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
