模型介绍
中文整理Fara-7B:面向计算机使用的高效智能体模型
模型用途
Fara-7B是微软推出的首款面向计算机使用的小型语言模型(SLM),专门设计用于在网页上执行操作以完成高级用户任务。它是一个仅有70亿参数的紧凑型计算机使用智能体(CUA),能够完成预订餐厅、申请职位、规划行程、购买商品等高级目标。
主要能力
通过浏览器截图进行多模态理解,按步骤执行操作。能够规划并执行购物、旅行预订、餐厅预约、信息查询或账户工作流等网络任务。基于截图和完整操作历史预测下一步操作及必要参数。支持本地设备运行,提供隐私保护和较低延迟。
输入输出
输入:用户目标(文本)、当前截图、智能体历史输出(思维和操作文本)。输出:生成文本,包含思维链块和工具调用块,用于指示具体操作。
运行要求
参数规模:70亿。上下文长度:128k。GPU需求:64块H100。训练时间:2.5天。依赖包:torch >=2.7.1、transformers >=4.53.3、vllm >=0.10.0。测试环境:NVIDIA A6000、A100、H100 GPU(Ubuntu 24.04.3 LTS)。推荐配置:vLLM服务器,bf16精度。
基本用法
用于自动化网络任务,如购物、旅行预订、餐厅预约、信息查询或账户工作流。使用ChatML模板进行推理,需配合指定系统提示词。系统提示词要求智能体在关键节点停止执行,包括结账、预订、购买、打电话、发邮件、提交申请和账户登录等需要用户许可或敏感信息的操作。
限制
未对所有下游用途进行评估。必须遵守适用法律法规。仅支持英语,其他语言可能出现性能下降。可能强化刻板印象或产生不当内容。在高风险或受监管领域使用时需验证输出。模型基于Qwen 2.5 VL构建。
许可证
MIT许可证。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
