夜雨聆风学习资料网

ARTICLE · 1056387

AI 桌面伴侣开源!能操控电脑、能开直播,还能装进 QQ 微信当客服! | gitcc.com

AI 桌面伴侣开源!能操控电脑、能开直播,还能装进 QQ 微信当客服! | gitcc.com

上周五晚上十一点,我数了一下任务栏:左下角挂着 AI 聊网页,右边开着语音转文字的标签页,中间还夹着一个画图网站和一个忘关的翻译页。切了七次窗口,就为了回一条客户消息顺手配张图。那一刻我特别想有个东西把这些全收了,一个就够。

还真被我翻到了。开源的,这款 AI 桌面伴侣 ,干的事一点不含糊:桌面伴侣、电脑操控、多角色群聊、社交机器人、直播机器人,全塞在一个程序里,能装 Windows、macOS 和 Linux,最新版本 v0.4.3。

主界面,右下角是 VRM 形象,模型可以随时切换

先说第一眼。装好打开,主界面是上面这样的:中间一句 Hello, what can I help with today?,输入框右下角标着当前用的模型,我接的是 deepseek-chat,也可以换本地 Ollama。最戳我的是右下角站着一个 3D 姑娘,VRM 格式,自定义模型、表情、动作都能换。点一下 Summon Companion,她就落到你的桌面上,变成桌面伴侣。

她会说话,还能被你打断

语音这块它是本地识别加云端合成两条路都留了。识别用 Sherpa-ONNX,纯本地跑,断网也能听懂你说话;合成这边 Edge-TTS、ElevenLabs 都能接,不够还有 Pyttsx3 离线兜底。最舒服的体验是实时打断:她话说到一半,你直接开口,她会停下听你说。用过那种只能听完一整段播报的语音助手,就知道这个细节多值钱。

玩 Live2D 的朋友还有一条路:它能联动 VTube Studio,控制 Live2D 模型的表情和动作,眨眼、张嘴、摆头都能跟语音对上拍。直播推流的时候还能把画面透明推给 OBS,不用绿幕。虚拟主播的全套工具链,等于直接给你配齐了。

角色不只是换个头像

多角色群聊,每个角色有独立人格、语音和记忆

多角色群聊是它最出效果的功能。Tavern 格式的角色卡直接上传就能用,网上几万张现成卡随便挑。每个角色有独立的语音、独立的形象,拉进一个群,你抛个话题,他们自己接话,聊着聊着还会互相怼。底层记忆用 Mem0AI 做长期记忆,聊过什么、谁跟谁什么关系,它都记着,第二天接着聊不用从头自我介绍。

我建了个三个人的群试了试,一个毒舌书评人、一个程序员、一个历史爱好者。程序员和历史迷为了「古代有没有码农」吵了十几轮,一个搬出结绳记事说这就是编码思想,一个甩出《九章算术》说这叫算法,谁也不服谁,我插不上嘴,就在旁边看戏。第二天再进群,他们还记得昨天吵到哪了,接着上次的茬继续。这种连贯感和热闹劲儿,跟单聊一个角色完全是两回事。

她不光会聊,还会动手干活的

计算机控制:AI 看着屏幕,自己动鼠标动键盘

这是我认为它跟一般桌面机器人拉开差距的地方。它给 AI 配了一整套电脑控制工具链:鼠标、键盘、屏幕截图、文件系统操作全都有。AI 是看着屏幕干活的,截一张图,看懂界面在哪,然后自己挪鼠标、点按钮、敲键盘,错了还会自己回溯重来。官方 README 里有个演示是让 AI 自己玩 Wordle 猜词游戏,从打开网页、读格子到填词全程自己来,没人碰过一下鼠标,整个过程像看一个看不见手的实习生在用你的电脑。

任务中心:后台执行,每一步操作都留有时间线

耗时长的活儿不会卡住聊天窗口,全部丢进任务中心后台跑。上面这张图是它真实执行过的任务:让我帮它写一个冒泡排序的学习项目,时间线里能看到它先列文件清单、再建项目结构、写完算法实现又补可视化,最后做性能测试,每一步用了什么工具、成败与否全记着。这种透明度在同类产品里真不多见。

还有个专属 AI 浏览器,跟人用的浏览器完全分开。让它去查资料、填表单、盯页面变化,它就在自己的浏览器窗口里操作,页面元素靠视觉识别,不用你提供任何选择器。我让它去一个后台系统里导报表,它自己点开菜单、勾选日期、下载文件,全程我一眼没插手。关键是这样它不会把你正开着的十几个标签页搞乱,两边互不干扰,这点设计得很干净。

AI 专属浏览器:自动操作网页,与人工浏览器互不干扰

把她装进 QQ、微信和直播间

一键部署到各大即时通讯平台

社交平台接入是它最省事的部分。QQ、微信、飞书、钉钉、Telegram、Discord、Slack,七个平台,填个机器人 Token 就部署,群聊私聊都支持,还有消息队列做异步处理,高峰期消息挤在一起也不会漏回。我之前给客户群写过简单的 QQ 机器人,光回调配置就折腾了一下午。在这上面,前后不到十分钟。

直播这边支持 B 站、YouTube、Twitch 一键开播,配好直播间 ID 和推流密钥,选个虚拟形象就能上场。弹幕进来她实时识别、实时回复,可以设关键词过滤,敏感词挡在前面。它甚至支持 360 度全景直播,推全景视频流这种玩法,一般虚拟主播工具还真给不了。直播结束后还能把数据归档下来,哪场热闹哪场冷清,翻记录就知道。一个人撑不起直播间这事,现在一个人加一个 AI 就能日夜轮班。

能自己长出新功能的系统

扩展系统是它的另一个野心。官方维护一个插件市场,一键装卸;扩展用 HTML、CSS、JavaScript 就能写,甚至内置了让 AI 自己创建扩展的工具,等于系统会自我繁衍。对开发者它也很敞亮:提供 OpenAI 完全兼容的 API 和 MCP 服务端,你在外面写的任何程序都能把它的能力当接口调。MCP 协议的支持让工具生态几乎无边界,外面社区做什么新工具它基本都能接。

部署这事我实测过,不难。机器要求写的是 CPU 两核、内存 2GB 起,我拿一台八年的老笔记本都跑起来了。源码安装两条命令:uv sync 装后端依赖,npm install 装前端,然后拷一份 settings.json 改改模型和密钥就能起服务。想做成桌面软件,Windows 上有现成的一键打包脚本 build-windows.bat,跑完直接出 NSIS 安装包,双击装完就是正经桌面应用。模型可以全走云端 API,也能全换成本地 Ollama,一台断网的机器它照样陪你聊,这也是我把它留在常驻列表里的原因。

说句实在的使用感受:这类全能型 AI 伴侣最怕两件事,一是啥都想要结果啥都浅,二是数据全在别人服务器上。它的解法是本地优先,聊天记录、记忆、角色卡全存本地 SQLite,模型随你换本地还是云端。数据不出门这一点,对企业想做内部客服、又不敢把客户资料传第三方平台的同学,分量很重。

它还在快速迭代,得说清楚短板:扩展生态刚起步,市场里能装的东西不算多;角色卡的玩法深度比不了专门的角色扮演引擎,长对话偶尔会绕;文档以英文为主,英文不好的同学装的时候得开着翻译。但它的底子是对的:工具链全、接口开放、数据在本地。如果你想要一个不散装、能动手、能上线、数据握在自己手里的 AI 助手,它值得装一个试试。

源代码:

https://www.gitcc.com/marooncn/super-ai-browser

相关学习资料