你发现没有,我们现在指挥 AI,靠的还是打字和说话。就不能挥挥手吗???说实话,这两天我在 GitHub 上刷到一个项目,还真就是干这个的。它叫 [barehands](https://github.com/jaredrhod/barehands),翻译过来就是「裸手」,意思是啥都不戴,摄像头拍着你的手,你隔空捏一下、划一下、扔一下,屏幕上的东西就跟着动了,AI 也就懂了。
这项目是 8 月 15 号创建的,到今天刚好 6 天,已经攒了 466 个星、87 个 fork。你想想看,一个 6 天大的新项目,能在这个卷到不行的 GitHub 上冲到前几名,多少是有点东西的。我跟你说,我第一次看它的演示视频的时候,真的有被震到,不是那种炫技的酷,是那种「卧槽,原来还能这样」的酷。
先说它是什么。barehands 是一个纯网页应用,运行逻辑特别简单,你用 Chrome 打开一个本地页面,摄像头开始捕捉你的手,谷歌的 MediaPipe 负责追踪手势,three.js 负责渲染 3D 画面。你的屏幕上会出现几张半透明的「玻璃卡片」,像是飘在摄像头画面上的浮窗,里面有你的笔记、图片、3D 模型。你的手往镜头前一伸,捏住一张卡片,就能把它拖来拖去,两个手指一划,还能把一个引擎的爆炸视图给拆开。没有手柄,没有眼镜,没有手套,就是光着两只手。

安装过程简单到有点不真实,一共 3 个命令。克隆仓库,进去,跑一个 Python 服务,然后浏览器打开本地地址,允许摄像头权限,完事。它连依赖都是懒加载的,MediaPipe 和 three.js 直接从 CDN 拉,你本地只需要有 Python。说真的,我见过太多号称「开箱即用」的项目,最后装依赖装到怀疑人生,这个是真的开箱即用。
我照着试了一下,结果有点丢人。我对着摄像头挥了半天手,卡片是识别出来了,但我的手太笨,捏不准,要么捏空,要么一激动把卡片甩飞了。反正我觉得,这玩意的上限很高,但需要一点练习,就像第一次用触控板一样,肌肉记忆建立起来就好了。我自己是折腾了大概十来分钟,才能比较稳地把一张卡片从左边拖到右边。你敢信,我当年学打字都没这么费劲。

不过它真正有意思的地方,不在手势本身,而在它的设计哲学。作者把整个系统拆成了两个特别优雅的抽象,一个是「环」,一个是「板」。环是 AI 的脸,屏幕上那个悬浮的圆环,会根据 AI 的状态变换表情,它只要往一个叫 state 的文件里写一行字,比如 thinking 或者 speaking,圆环就跟着变。板是 AI 的舞台,AI 可以往板上扔卡片,把你想要的东西展示给你看。这两个抽象加起来,AI 就从一个只会回文本的聊天窗口,变成了一个有表情、有动作、能给你「看」东西的活物。
它接 AI 的方式也很有意思,任何能写文件、能访问本地服务的程序都能当它的大脑。Claude Code、本地跑的开源模型、一个定时任务,甚至一个 Stream Deck 按钮,都行。作者给 Claude Code 用户准备了一条捷径,你只要跟你的 Agent 说一句话,让它克隆这个仓库、读一下配置文件、把它自己接进来,它就全自动搞定了。这个设计我特别喜欢,它没有把 AI 绑死在某一家,而是定义了一个开放协议,谁都能来当这个身体的大脑。
这个「环」还有个特别讨巧的细节,它不只是个装饰。Claude Code 用户只要在设置文件里加两个钩子,AI 每次开始思考、开始说话,圆环的状态就会实时跟着变。你写代码的时候,能看见屏幕角落那个圆环在转圈,那就是你的 Agent 正在干活。它还会在你让 AI 展示东西的时候,把内容放大推到舞台中央,其他东西全部变暗,像开会时突然打了一束追光。这种设计不是炫技,是真的在琢磨人和 AI 之间怎么更有默契。
安全上它也动了脑子。板上能出现的文件,只能来自一个叫 media 的目录,这个目录就像一个「隔离舱」,AI 再厉害也没法越过这道墙去访问你电脑上别的文件。AI 能执行的操作也是白名单制的,只能做作者预设好的那几个动作。怎么说呢,它等于给了 AI 一双手,但又给这双手戴上了手套,想乱摸,摸不着。

作者 jaredrhod 不是什么大厂团队,GitHub 上 421 个粉丝,账号今年 3 月才注册,个人介绍写的是,别人教 AI 酷的那一半,他教 AI 能赚钱的那一半。他之前的几个项目也都在干同一件事,给 AI 加上脸、加上声音、加上手,比如一个叫 backtalk 的项目,是按住一个键就能跟 Claude Code 语音对话的。你看,这人是真的在认真研究「AI 该长什么样」这件事,barehands 算是他这一串探索里最出圈的一个。
说真的,市面上不是没有类似的东西。苹果 Vision Pro 的手势交互做得比这个精细得多,但那个眼镜要 3 万多块,Ultraleap 那种专业手势追踪硬件也要大几千。barehands 走的是另一条路,一个普通摄像头,零成本,开源免费,还能接上任何 AI。当然它也有明显的短板,单摄像头的手势精度有限,光线不好就识别得磕磕绊绊,跟 Vision Pro 那种毫米级的追踪没法比。但话说回来,一个是花钱买体验,一个是自己动手玩,本来就是两种玩法。
说到隔空手势,我想起 2002 年的科幻电影《少数派报告》,汤姆克鲁斯对着空气划拉屏幕,隔着玻璃拖拽照片,那会儿看觉得帅得不行,也觉得这辈子都等不到。结果你看,二十多年过去,同样的交互方式,一个开源项目用普通摄像头就给你实现了,还免费。电影里的未来没来,但电影里的操作方式,已经躺在你电脑里了,就缺你挥一挥手。
我觉得 barehands 最打动我的,是它把「人机交互」这件事往前推了一步。这两年 AI 的进步全在脑子里,模型越来越聪明,可我们跟它交流的方式,还停留在键盘和麦克风。barehands 试图给 AI 装上一双手,也给你装上一双手,让你能像跟同事说话一样,随手比划着就把活干了。这种尝试未必能成主流,但至少有人在认真琢磨这件事,而不是天天卷参数、卷榜单。
它适合谁玩呢,我觉得有这么几类人。一是喜欢折腾的开发者,这项目本身就是个极好的研究样本,手势追踪、3D 渲染、AI 接线,全是现成的参考。二是做演示和教学的人,开会讲到一半,挥手把一张图推到屏幕中央,比翻 PPT 有冲击力多了。三是单纯想找点乐子的普通用户,装好之后对着摄像头玩一会儿,你会重新找回第一次玩 Wii 的那种新鲜感。
如果你也对这玩意感兴趣,可以自己去玩一下,反正不花钱。打开 [GitHub 仓库](https://github.com/jaredrhod/barehands) 看 README,里面有完整的安装说明和演示视频,作者还录了个 [YouTube 演示](https://youtu.be/cV02finVi4o),看视频比看文字直观得多。装好之后,先别急着接 AI,就光用手势玩一会儿那些玻璃卡片,也挺解压的。真的就是一声叹息,AI 时代来得比我想象的快,连挥手都能指挥电脑了,我这种老胳膊老腿的,得抓紧练了。
夜雨聆风