作为一个艺术生学习编程学了几年,别人都好奇为什么我不研究自己的舒适区。
原因很简单:因为我太了解这个舒适区了。 太了解它在大背景下的情况,也了解自己花了多少精力做了什么。
编程能做的事上限很高,它从来都不是编程本身。或许也因为,我想看更多的这个世界吧。
事实证明,这个选择是对的。
上面这段视频是我用 AI 做的。全程只给了一句提示词:什么是agent?,剩下的我都在编排流程,让它之后可以复刻。——里面所有的抽象动效,全是 AI 生成的,值得注意的是这个视频,我还几乎没用到审美。
顺便说一句:生成视频这件事,已经从漫剧扩展到更多场景了。抽象动效、MG 动画、信息可视化,这些过去必须靠动效设计师逐帧调的东西,现在都能生成。
01
门槛归零之后,剩下的是什么
做视频的门槛已经降到很低,而且会越来越低。之后会有各种一键剪辑的 skill 模板层出不穷。
于是问题就变成了:在创意缺失的大部分视频(和人)里,还能靠什么吸引注意力?
答案只剩两个:审美,和音乐。
最近我发现抖音上多了很多设计素材分享。过去圈子里的小众素材网站,现在都成了大家追捧的法宝。当然还有音乐。
这件事很有意思。大家在爆款的驱动下去提高自己的审美,速度蹭蹭的——还是钞能力比美术老师厉害。
因为 AI 把"执行"这件事变便宜之后,审美第一次有了直接的、看得见的经济回报。事物发展往往不是直接的,不是通过全民培训就能提高全民审美。
海外的说话更锋利:
AI 并没有只是降低了做内容的成本,它同时抬高了"做出让人记得住的东西"的成本。
02
那么工具本身正在发生什么
如果执行都被交出去了,那工具会变成什么样?
有一个刚出现的产品可以当模版:ChatCut。
它 2026 年 7 月 10 日在 Product Hunt 上拿了当日第一、当周第四。定位是"你在 ChatGPT、桌面端和网页里的 AI 剪辑师",Pro 版 $25/月起。
它的本质是一个 "AI 原生的非线性剪辑器":传统时间线编辑器仍然存在,但 AI Agent 是主要交互入口,而不是附加在菜单里的一个小功能。
它和 Premiere、Final Cut、剪映最大的区别在这里:
真正关键的不同不是"能聊天",而是 Agent 能理解项目状态,并对时间线执行结构化操作。
举个例子,你说一句"把口播修干净点",它要做的是:
删除口头禅 → 重新拼接音频 → 修复跳切 → 加 B-roll → 生成字幕 → 添加转场 → 调整音乐音量
这是一条跨多个工具的工作流。普通剪辑软件里,这些得你一项一项自己来。
而且Agent 每次干完粗活后,你可以拿到 Premiere 里继续精修。
这个设计它承认了 Agent 负责执行,人负责判断。
03
这不是剪辑一个行业的事
同样的转变正在多个领域同时发生,而且已经不是概念阶段了。
开发已经跑在最前面。2026 年的软件工程正在从"人写代码"迁移到"人定义意图、AI 执行实现"。自然语言正在取代 DSL 和配置文件,成为开发者与系统交互的默认方式。
有一句总结说得很准:
过去是「人写代码、人做验证、人用软件」,人的能力决定了上限。未来是「人定标准、Agent 自闭环交付、人和 Agent 一起用软件」。
2026 年最实质的变化是 MCP 从实验走向生产可用,工具正在集体长出"给 Agent 用的接口"。 现在一个 Agent 可以调用 20 多类工具——浏览器、Python、文件系统、数据库、Notion、Slack、GitHub、Figma、Excel、邮件、日历。
行业里对这个趋势的描述是:
Agent 不再只是"一个会调用工具的大模型",而是开始演化成一个可被发现、可被调用、可被编排的服务单元。
反过来说也成立:工具也在演化成可被 Agent 发现、调用和编排的对象。
翻译成人话就是:软件正在学着把自己讲清楚,好让机器能用。
04
但不是所有工具都该这么改
这里要分清两个概念,很多讨论把它们混在一起了:
Agent-ready(可被 Agent 操作) 现有工具增加稳定的接口和结构化状态,让 Agent 可以代替用户点击。几乎所有生产力工具都需要走到这一步。
Agent-native(Agent 原生) 产品从一开始就围绕"用户说目标、Agent 规划并执行"来设计,界面只是执行结果的可视化和人工修正层。只有一部分工具值得走到这一步。
值得深度改造的工具,通常有这些特征:
流程复杂、步骤多——剪辑、设计、数据分析、开发、营销运营 用户关心结果,不太关心每个具体按钮 操作可以被结构化描述,比如"删除片段""调整颜色""生成报表" 存在大量重复劳动 Agent 的结果可以预览、可以撤销、可以人工修正
而这些场景不该完全交给 Agent:
- 操作本身就是体验
——游戏、绘画、乐器,以及一部分创作工具 - 单步操作已经足够简单
——计算器、秒表 - 错误代价极高
——付款、医疗处方、生产设备控制 - 用户必须精确掌控每一步
所以合理的未来形态不是"所有软件都只剩一个聊天框",而是三层并存:
你说目标 → Agent 规划并执行 → 界面负责让你看见、微调和撤销。
回到最开始那个问题:为什么一个艺术生要去学编程?
现在我可以答得更清楚一点。
因为审美需要一个出口,而编程曾经是那个出口最窄的地方。 现在那个口子被 Agent 撑开了——执行的部分它接走了,剩下的部分,恰好是艺术生擅长的。
上限从来不在编程本身。
也不在 AI 本身。
夜雨聆风