ARTICLE · 1066715
让 AI 直接操作 Blender、Office、剪辑软件:CLI-Anything 把软件交给 Agent | GitHub今日值得看 #035
让 AI 直接操作 Blender、Office、剪辑软件:CLI-Anything 把软件交给 Agent | GitHub今日值得看 #035

让 AI 帮你在 Blender 里做一个简单的 3D 场景,它可能很快就能给出步骤:添加一个立方体,调整尺寸,放好相机,再加上灯光。 步骤都明白,但接下来打开软件、找菜单、调参数的人,往往还是你。 AI 已经能写代码、查资料、处理文件,有些 Agent 还能连续执行几十个步骤。可面对电脑里那些每天都在用的软件,它们仍然缺少顺手的操作工具。 今天介绍的CLI-Anything,就在尝试补上这一块:给现有软件增加一套 Agent 能直接调用的命令接口。 Blender、LibreOffice、QGIS、OBS、Kdenlive 这些软件都有图形界面。人通过菜单和按钮操作,熟悉以后,很多动作几乎不用想。 Agent 使用这些界面时,却得先识别屏幕内容,找到对应控件,执行操作,再判断结果。能控制鼠标和键盘的 Agent 已经能做其中一些工作,只是按钮换个位置,或者突然出现一个弹窗,流程就可能中断。 如果 AI 只能提供文字指导,那就更直接了:它负责讲,你负责点。 

CLI-Anything 选择给软件增加命令行入口。 CLI 的全称是 Command Line Interface,也就是命令行界面。原本需要点击按钮完成的操作,可以用带有明确参数的命令来表达。 以创建 3D 场景为例,添加物体、修改尺寸、设置材质、导出文件,都可以分别对应具体命令。只要适配已经覆盖这些操作,Agent 就能调用它们。 这两种方式各有适用范围。通过图形界面操作,很多软件都能尝试;使用 CLI,则需要先有对应的适配。对于已经覆盖的复杂、重复任务,命令接口能减少寻找按钮和识别界面的步骤,也更容易重复执行。 
项目里已经有多种软件的 CLI 适配,涉及的工作也不只是写代码。 Blender 用于创建和修改 3D 场景;LibreOffice 对应文档、表格等办公文件;Kdenlive 则涉及视频剪辑流程。 还有处理地图和空间数据的 QGIS,以及用于游戏项目和场景制作的 Godot。Zotero、Obsidian、OBS、Inkscape 等工具也在其中。具体覆盖哪些操作,可以查看项目仓库中的对应说明。 
这里说的办公软件是 LibreOffice。每个适配能做多少事,也需要分别看,不能因为软件出现在列表里,就认为它的所有功能都已经开放给 Agent。 对用户来说,更实际的变化是:过去需要自己照着步骤完成的部分工作,现在有机会直接交给 Agent 执行。 我对这部分更感兴趣。 实际工作经常要在几个软件之间来回切换。比如根据资料整理一份报告,把数据做成图表,最后放进演示文件。每一步单独看都不复杂,接起来却需要不少手工操作。 如果相关软件都有 Agent 能调用的接口,理论上,它就能先读取资料、处理数据,再调用办公工具生成图表、整理文档,最后输出演示文件。 当然,这只是工作流设想,具体能完成到哪一步,还得看每个工具提供了什么能力。 类似的连续操作,也会发生在同一个软件里。以 Blender 为例,创建物体之后,还要调整场景、配置相机和渲染。Agent 如果能检查输出结果,就有机会继续修改,而不是执行完第一轮命令就结束。 当这些步骤能接上,Agent 才更容易参与一项完整的工作。用户也不用每完成一步,就把结果手动搬到下一个软件里。 经常接触 Agent 工具的人,可能会想到 MCP。 两者关注的层面不同。CLI-Anything 主要解决软件能力怎样通过命令调用;MCP 则为 Agent 连接和使用外部工具提供一套协议。 所以,两者可以结合使用。CLI-Anything 提供的命令能力,可以接入相应的 Agent 工作流,也可以配合 Skill,或者通过进一步封装接入 MCP。项目本身也在增加对不同 Agent 工具的适配。 如果只是想了解这个项目,先抓住命令接口这一点就够了:软件里的一项操作有了明确的调用方式,Agent 才更容易执行它。 项目提供了 CLI-Hub,用来浏览、搜索、安装和管理已有的 CLI。把它理解成一个面向 Agent 的软件工具库,会比较直观。 先安装: pip install cli-anything-hub 再安装需要的工具: cli-hub install 其中 需要替换成对应工具的名称。这两条命令也列在项目的快速开始说明中。 CLI-Hub 也给社区提供了一个集中展示和分发适配的地方。以后能覆盖多少软件,很大程度上取决于有多少人愿意贡献新工具,并持续维护已有工具。 相比昨天介绍的 AutoClip,CLI-Anything 更偏开发者和 Agent 用户。如果你暂时不打算配置环境,先看项目主页里的 Demo 就行。3D 场景、图表和字幕等案例,能更直观地展示这些命令最终做出了什么。 CLI-Anything 这个名字很容易让人产生期待,但安装它之后,AI 能做什么,仍然取决于具体的软件适配。 每个软件都需要建立对应的 CLI,明确哪些操作能够调用。不同适配的成熟度也不一样:有些已经能完成比较完整的任务,有些还处在早期阶段。 因此,使用前还是要看清楚对应工具的功能范围。 权限也要随之设置好。Agent 一旦能直接修改文件、操作工程,错误就可能落到实际文件上。删除文件、覆盖工程、批量修改数据这类操作,仍然需要明确的权限限制和人工确认。 我会继续关注这个项目,因为它在尝试让我们已经熟悉的软件更容易被 Agent 使用。 这些软件已有的按钮、菜单和窗口,主要围绕人的操作习惯设计。随着 Agent 参与更多工作,软件也需要考虑怎样把功能清楚地暴露给它们调用。项目所说的 Agent-Native,可以从这里理解。 对于这类工具,我最关心的还是实际使用:交给它一项任务,能完成多少,中间要人接手几次,最后得到的文件能不能继续用。CLI-Anything 已经提供了一些具体案例,后续的适配和维护是否跟得上,值得继续看。 如果你也发现了有意思的 GitHub 项目,欢迎留言交流。这个系列会继续介绍那些有新想法,也能说清楚实际用途的开源项目。


01 为什么要给软件加一套命令?


图1:AI 提供操作步骤

图2:GUI 与 CLI-Anything 操作方式对比
02 已经涉及哪些软件?

图3:CLI-Anything 已有适配的软件