乐于分享
好东西不私藏

微软开源电脑操作

微软开源电脑操作
点击👆科技小萌👇关注我,加星标★

前言

微软 Research AI Frontiers 团队在 2026 年 5 月推出了一套完全开源的电脑操作 Agent 模型家族—— Fara1.5 。

这套模型一口气提供了 4B 、 9B 和 27B 三种不同的参数规模,全部都采用 MIT 许可证对外开源,模型权重直接托管在 HuggingFace 上。

其中,实力最强的 Fara1.5-27B 在 Online-Mind2Web 跑分测试里拿到了 72.3% 的超高成功率,直接把 OpenAI Operator 的 58.3% 以及 Google Gemini 2.5 Computer Use 的 57.3% 给比了下去。

为您推荐

新年最推荐软件之 v2026 版


Windows 11 2026 (含 7 月更新) iso 镜像

科技小萌微信群邀请函 2026


详细介绍

谁能想到,一个参数量只有 27B 的小模型,居然在网页操作任务上干掉了那些闭源的商用大模型!

纯视觉操作,根本不看源代码

Fara1.5 的运行逻辑非常直观:

模型只需要接收浏览器的屏幕截图和之前的对话历史,经过一番推理之后,就能直接输出鼠标和键盘的动作指令,比如在预测好的坐标位置上点一下、滚动页面或者是敲键盘打字。

整套流程完全不需要依赖 accessibility tree (无障碍树状结构),也不用靠额外的解析模型把网页转换成结构化数据。

说白了,这模型就是直接看像素画面,然后再输出对应的动作坐标。

它的动作空间相当全面,不仅涵盖了标准的鼠标和键盘输入,还包含了网页搜索、上下文管理这些 meta 动作。

模型能把某些关键事实记在脑子里供后续步骤使用,遇到信息不全时,还会主动开口发问。

在每一个操作步骤中,模型最多参考最近的三张截图,然后输出一个动作,以此形成“观察、思考、行动”的循环。

另外,损失函数只作用在每个操作轨迹的最后三个步骤上,这样能让模型的训练更加集中于最近的决策节点,而不是死磕很久以前的历史记录。

这种纯视觉方案最大的优势在于通用性。

跟那些依赖 DOM 树或者 accessibility tree 的方案不一样, Fara1.5 看到的画面和人类在屏幕上看到的一模一样,它的操作逻辑完全不受限于特定的网页框架或前端技术。

不管网站用的是 React 、 Vue 还是老旧的服务器端渲染,在模型眼里都只是一个个像素点而已。

不过这么做也有代价,那就是推理成本相对高一些:

毕竟每走一步都得处理一张完整的截图,所以 27B 模型在生成单个动作时的耗时,肯定会比那些轻量级的 DOM 解析方案明显更长。

三种尺寸,各自分工明确

Fara1.5 家族是基于 Qwen3.5 架构打造的,针对不同的成本和性能需求推出了三个版本:

  • Fara1.5-4B :最小的版本,在 WebVoyager 跑分测试中达到了 80.8% 的成功率。

  • Fara1.5-9B :中等身材的版本, Online-Mind2Web 成功率达到 63.4% , WebVoyager 达到 86.6% 。在同量级的模型里,成功干掉了 MolmoWeb 8B 、 GUI-Owl-1.5 8B 以及 Holo2 8B 等一众对手。

  • Fara1.5-27B :体量最大的版本, Online-Mind2Web 成功率高达 72.3% , WebVoyager 更是达到了 88.6% 。

要知道, Online-Mind2Web 包含了 136 个热门网站上的 300 项复杂任务,是目前评估浏览器 Agent 的权威标准。

Fara1.5-27B 跑出的 72.3% 成功率,几乎是它前身 Fara-7B ( 34.1% )的两倍之多。

在安全和交互方面, Fara1.5 被训练成会在三种情况下停下来询问:

一是任务需要用到未提供的个人信息;

二是任务描述含糊不清或者有遗漏;

三是准备执行无法撤销的操作但还没拿到批准。

此外,模型还需要搭配 MagneticLite 沙盒浏览器来跑,所有操作都会有日志记录方便后续审计,这个沙盒也充当了模型与个人设备之间的安全防火墙。

其实 Fara1.5 并不是微软在电脑操作 Agent 领域的头一次尝试。

早在 2025 年 11 月,微软就发布过 Fara-7B,一个只有 7B 参数的模型,当时就在部分测试里打平了 GPT-4o ,而且平均只要 16 步就能搞定任务,远优于 UI-TARS 的 41 步。

当时 Fara-7B 的模型体积是 16.6GB ,可以直接在普通 PC 上本地跑,数据完全不用传到外面。

至于实际怎么用, Fara1.5 既能通过命令行工具 fara-cli 来驱动,也能整合到 Magnetic-UI 沙盒环境里去跑。

部署方式也很灵活,可以直接从 Microsoft Foundry 获取模型端点,配上 JSON 配置文件、填写端点 URL 和 API 密钥就能启动。

如果不愿意用云端,大家也能直接从 HuggingFace 拿权重,在本地用 vLLM 等推理框架自己托管,全程完全不依赖任何云端服务。

Fara1.5 HuggingFacehttps://huggingface.co/microsoft/Fara1.5-27B

开源 AI Agent 的格局对决

在电脑操作 Agent 这条赛道上, OpenAI 走的是封闭 API 路线, Operator 只能付费通过接口调用;

Google 的 Gemini 2.5 Computer Use 也一样死死绑定在自家云端服务上。

而微软却选择把 Fara1.5 的权重通过 MIT 许可全面开源,任何人都能直接去 HuggingFace 下载并在本地部署,完全不用看云端 API 的脸色。

想省事的话,也可以选择通过 Microsoft Foundry 来托管运行。

不过, Fara1.5 也不是完全没有短板。

在针对长尾任务的 WebTailBench v1.5 测试中, Fara1.5-9B 的成功率只有 32.3% ,而 GPT-5.4 达到了 57.4% 。

这说明在面对极其罕见的网页操作场景时,大型商用模型依然保有不小的优势。

另外,微软目前把 Fara1.5 定位为研究预览版本( research preview ),距离真正能直接投产放到实际生产环境里,其实还有一段路要走。



为小妹转发和点赞

如果您喜欢小妹的分享,请点击文章末尾的点赞、分享、在看,这对您来说不会花费太多时间,但是对小妹的成长有很大的帮助,谢谢您的支持!



免费搞定 Google 官方认证证书
网络、虚拟化、任何软件问题,点这儿
新年最推荐软件之 v2026 版
唯一有效下载 BiliBili 1080p 视频的方法
终于搞定 Windows11 拖动任务栏位置
轻松破解 Windows11 登录密码