乐于分享
好东西不私藏

AI 构建者日报 | 5月17日

AI 构建者日报 | 5月17日

AI 构建者日报 | 5月17日

追踪造物者的每日思考

Guillermo RauchVercel CEO · Next.js 创造者 · 前端基础设施先驱

Guillermo Rauch 今天连续发布了三条高互动动态,核心围绕一个主题:Agent 正在从"能写代码"进化为"能部署、能认证、能成为你手艺的放大器"。

Grok CLI + Vercel 插件。Rauch 演示了在 Grok CLI 中安装 Vercel 插件后,Agent 可以一键生成创意编程网站并直接部署到云端。他展示了一个实时的粒子效果网页,全程由 Grok 编写并自动完成 Vercel 部署。这是 Agent 从"本地写代码"走向"全链路交付"的关键一步。

"Grok CLI has great support for Plugins and Skills. Installing the Vercel Plugin gives Grok cloud deployment superpowers."

Grok CLI 对插件和技能的支持非常好。安装 Vercel 插件后,Grok 就获得了云端部署的超能力。

Agent 部署的企业级安全。第二条推文展示了 Vercel 的一个重要能力:Agent 生成的部署可以放在企业 SSO(如 Okta)后面保护。这意味着由 v0、Codex、Claude 等工具自动生成的应用,也能享有企业内网级别的访问控制。他还幽默地指出一个悖论——Agent 刚帮你建好的应用,转头就被 401 未授权拦下了,于是 Vercel 提供了 vercel curl 命令来解决这个"自己建的门自己进不去"的问题。

手艺 × Agent 的乘法效应。第三条推文是 Rauch 对 AI 时代个人竞争力最精炼的概括:

"If you become exceptional at managing agents, but are also exceptional in your understanding of the fundamentals, you will be unstoppable."

如果你既擅长管理 Agent,又对基本原理有深刻理解,你将不可阻挡。我们都更愿意与手艺精湛的人共事。新变化是:你不能错过 Agent 对你产出的放大效应。    

Aaron LevieBox CEO · 企业云存储先驱 · AI 时代企业内容管理倡导者

Aaron Levie 今天贡献了一条关于 AI 软件交付模式转变的深度长推文,并从一条引文中提炼出"无头软件"的概念。

FDE(Forward Deployed Engineering)将成为 AI 部署的核心能力。Levie 开篇直言:AI 和传统软件本质上不同。传统软件交付一个稳定产品给客户,客户采纳后就结束了。但 AI 完全不同——底层模型在不断升级、最佳实践在持续涌现,模型升级本身就可能彻底改变工作流。

因此,一个供应商跨数千家公司共享最佳实践,比每家公司自己学习和管理这些实践更高效。客户的使用数据也应当回流到核心产品中持续优化。Levie 的结论:当我们从 Chat 系统(门槛低、容易采纳)走向 Agentic 系统(需要实质性的管理和更新投入),FDE 模式将成为任何规模化 AI 部署的核心竞争力。

"the FDE model (or equivalent) essentially becomes a core competency for anyone deploying AI at scale."

FDE 模式(或等价物)本质上将成为任何规模化 AI 部署的核心竞争力。

"无头软件"的未来。在另一条推文中,Levie 引用转发了这一概念——当 AI Agent 成为主要的软件消费方,UI 不再是刚需,软件将以 API-first 的方式存在,由 Agent 来调用和管理。这是 SaaS 从 GUI 时代走向 Agent 时代的又一个信号。

Peter SteinbergerOpenClaw 创始人 · PSPDFKit 前 CEO · iOS 开源生态资深贡献者

Steinberger 今天发布了一条引发强烈共鸣的推文——当人们对他"烧 AI"的花费感到震惊时,他揭开了背后完整的 Agent 自动化体系。这条推文获得 3700+ 点赞,因为它回答了一个根本问题:如果你的 Token 预算没有上限,你会用 Agent 做什么?

他列举了 OpenClaw 项目中持续运行的约 100 个 Codex 实例的具体分工:每个 PR 和 Issue 都会被 Codex 审查;每次 commit 都会触发安全扫描;Codex 自动去重 Issue、发现集群、生成报告;Agent 可以复现复杂环境、登录 Telegram、录制视频、在 PR 上贴出修复前后的对比;新 Issue 如果符合项目愿景,Codex 会自动生成 PR;还有 Codex 扫描评论区过滤垃圾信息、验证性能基准线、在 Discord 报告回归。

他甚至提到 Agent 会监听会议,在讨论新功能的同时就开始创建 PR。这种"边聊边写"的工作流,正在从科幻变成日常。

"We constant run ~100 codex in the cloud, reviewing every PR, every issue... All that automation allows us to run this project extremely lean."

我们在云端持续运行约 100 个 Codex 实例,审查每一个 PR、每一个 Issue……所有这些自动化让我们以极简的团队运行这个项目。

他还发布了 Clawpatch 0.1.0,这是一款将代码库映射为语义功能切片、审查 Bug 和质量问题、并记录显式修复尝试与验证的工具。用他的话说:"你会惊讶于它发现多少问题。"同时,他也表示最近几个项目在用 Svelte 替代 React——更少的坑和复杂度,Codex 对它的处理也很好。     

Dan ShipperEvery CEO · AI 内容订阅平台创始人 · 技术写作者

Dan Shipper 今天分享了他尝试在 OpenClaw 之上构建 Agent-as-a-Service 平台的深度复盘,以及他对 Codex-native 应用趋势的判断。

Agent 平台的教训。Shipper 总结了两个关键发现:第一,OpenClaw 本身很强大,但作为平台构建层在上面做二次开发极其困难——它迭代太快、回归频繁,在 OpenClaw 和终端用户之间做中间层的体验并不好。第二,一个公司共享一个超级 Agent 比每人一个 Agent 更实际。Agent 目前仍需要大量(通常是技术性的)维护工作才能持续良好运转,普通员工不想整天折腾 Agent 的内部机制。但如果让一个人专门负责为全公司维护一个高质量的 Agent,效果就完全不同。

"One super agent for a company beats 1-1 agents for everyone... if you give everyone an agent that works really well and make it someone's job to make it good for the whole company...lots of good stuff ensues."

一个公司共享一个超级 Agent 胜过每人一个 Agent……如果你给每人一个运转良好的 Agent,并让一个人的全职工作就是为全公司优化它……很多好事就会发生。

Codex-native 应用。在另一条推文中,Shipper 坚定地指出 Codex-native 应用是未来——应用不再是为人类点击设计的 UI,而是为 Agent 消费和操作设计的 API 层。这与 Levie 的"无头软件"判断形成了呼应。

Nikunj KothariOpenAI 产品负责人 · AI 产品专家

Kothari 分享了一个让他"震惊"的 Codex 使用体验:他输入 /goal 命令后就去和创业者喝咖啡了,两小时后回来发现 Codex 已经遍历了 2000+ 条目的整个数据库——修复了所有产品图片、修正了因不同图片导致的前端 Bug、更新了描述、用浏览器工具获取了实时网络信息、用网页搜索做了事实核查、还编写了可复用的脚本。

"Man, /goal is just AGI if given the right tools.. Like what do you mean you went through all the entire database...and ran for 2 hours while I met founders for coffee. I'm just shook."

天,有了合适的工具,/goal 就是 AGI……你说你遍历了整个数据库……在我和创业者喝咖啡的 2 小时里完成了这一切。我真的被震撼了。

这个体验揭示了一个正在形成的模式:当 Agent 拥有足够多的工具(数据库访问、浏览器控制、网页搜索、脚本执行)和一个清晰的目标,它可以从"辅助工具"跃迁为"自主执行者"。Kothari 没有动手写一行代码,却完成了一个原本需要一整天的数据清理和修复任务。

SwyxLatent Space 创始人 · AI 工程师运动倡导者 · 前 Temporal/Cognition

Swyx 在参加一场活动后感慨:Codex 在三个月内变得面目全非。他形容团队进入了"极限创始人模式"——现场看到 Gabriel Chua 演示 Codex 时,他脱口而出"你们在 Mac 上也有 Agentic Excel 了?"三个月前的 Codex 和今天相比,几乎不是一个产品。

"gotta say Codex is completely unrecognizable from 3 months ago. guys went extreme founder mode on this thing."

得说 Codex 和三个月前完全不是同一个东西了。这帮人进入了极限创始人模式。

他还分享了一个惊人的数据点:新加坡 AI 政务负责人估计未来两年内该国将有 13 亿个 Agent,并且正在构建一个国家级的 MCP(Model Context Protocol)网关。如果这个数字准确,意味着人均 200+ Agent 的密度——这是一个关于"Agent 将无处不在"的大胆预测。

Madhu GuruGoogle 产品负责人 · Gemini/Veo/Nano Banana

Madhu Guru 发布了一条关于 AI 时代产品经理角色转变的深度观察,获得广泛认同。他的核心论点:过去二十年,少数团队发明了产品模式,大多数 PM 的工作是将其复制到自己的领域。这使得 PM 工作变得机械和枯燥——也解释了为什么市面上的软件如此相似。

但在 AI 时代,没有稳定的 Playbook 可供复制了。PM 不能靠 A/B 测试就做出突破性的 AI 产品。他们必须从"执行框架的人"转变为"发明框架的人"——这是可以做到的,但需要主动地"忘记"旧的工作方式。

"A generation of PMs is struggling to adapt to AI because they were trained to execute playbooks. AI requires inventing them... You can't A/B test your way to a breakthrough AI product."

一代 PM 正在艰难适应 AI,因为他们被训练成执行 Playbook。AI 时代要求你自己发明 Playbook……你不可能靠 A/B 测试就做出突破性的 AI 产品。

Peter YangAI 产品专家 · 前 Twitter 产品负责人 · 技术趋势观察者

Peter Yang 关注到一个隐私细节:ChatGPT 最近推出的 Finances 功能中,有一个"为所有人改进模型"的开关。他选择关闭它——不希望自己的财务数据被用于训练模型或投放定向广告。但他同时指出,界面上并没有单独的"用于广告投放"的开关,因此只能假设这个开关同时控制两者。

"This is a really great update. I just don't want my financial data to be used to train models or get targeted ads, so I turned 'improve the model for everyone' off."

这是一个很棒的功能更新。但我不想我的财务数据被用于训练模型或投放定向广告,所以关掉了「为所有人改进模型」。

在另一条推文中,他分享了对 ChatGPT Finances 的初步印象:功能很强大,但 AI 在交易分类上仍然不够准确。这反映了当前 AI 金融工具的普遍状态——整体体验令人惊喜,但在需要精确判断的具体环节上仍有明显短板。

— · —

本期播客深度

Unsupervised Learning · Ep 86

Yann LeCun 谈离开 Meta、打破 LLM 范式,以及为什么 Hinton 错了

核心洞察:LLM 是优秀的语言工具,但不是通往人类级智能的路径。图灵奖得主、Meta 前首席 AI 科学家 Yann LeCun 在这场超过一小时的深度对话中,系统阐述了他为什么在 2023 年与深度学习领域的同行分道扬镳,并押注一套完全不同的架构。

AMI 与 JEPA 架构。LeCun 在离开 Meta 后创立了 AMI Labs(Advanced Machine Intelligence),总部设在巴黎而非硅谷。公司的核心方向是"真实世界的 AI"——理解物理世界比理解语言困难得多,因为现实是高维的、连续的、嘈杂的、混乱的。他押注的 JEPA(Joint Embedding Predictive Architecture)与 LLM 的根本区别在于:不生成像素,而是在抽象表征空间做预测。

他回顾了自己五年前的"顿悟":所有成功的图像/视频表征学习方法都是非生成式的(如 DINO、iJEPA、VJEPA),而生成式方法(VAE、MAE)基本都失败了。这让他确信预测像素是一条死路,在抽象空间预测表征才是正解。

为什么需要世界模型。LeCun 用桌上的水杯举例:推杯底它会滑动,推杯顶它会翻倒——我们无法在像素级别预测这些结果,但我们的大脑在抽象层面做出预测。这就是世界模型的核心:让系统能够预测自己行动的后果,然后通过搜索和优化来规划。这与 LLM 的逐 Token 预测——本质上是"反应式"的系统一行为——完全不同。

"I cannot imagine how you can even think of building an agentic system without that system having the ability to predict the consequences of its actions."

我无法想象你怎么能考虑构建一个 Agentic 系统,却不让这个系统拥有预测自己行为后果的能力。

数据效率的终极考验。LeCun 提出了一个尖锐的问题:为什么一个 17 岁的孩子能在 20 小时内学会开车,而我们拥有数百万小时的驾驶数据,却仍然没有 L5 自动驾驶?答案指向数据效率——当前依赖模仿学习的方法需要海量数据且泛化能力有限。世界模型的目标是零样本解决新任务,这是人类和许多动物都具备的能力。

AI 安全的新范式。对话最后,LeCun 讨论了 AI 安全问题。他认为 LLM 本质上是"不安全的"——你只能通过护栏来限制它,但永远无法保证它在所有场景下都安全。他提出的替代方案是"目标驱动 AI":系统有一个世界模型来预测行为后果,通过优化来找到满足约束的行动序列。在这种架构下,系统只能做满足目标的事,而非输出任何可能的 Token 序列。

长期影响。LeCun 的观点与当前硅谷的主流路线形成了鲜明对比。他刻意将总部放在巴黎而非硅谷,以避免"所有人都在挖同一条战壕"的群体思维。无论 JEPA 架构最终是否能兑现承诺,他提出的问题——关于数据效率、世界模型、搜索式推理——都是在 LLM 范式之外的重要探索方向。在所有人都在追逐同一个方向时,最危险的正是没有人在探索别的可能。

AI 构建者日报 · 每日追踪造物者的思考