当前时间: 1970-01-01 08:00:00
分类:办公文件
评论(0)
当 AI 开始改代码、写日历、重建设计稿代码仓库里,AI 不只回答“这里有没有漏洞”,还可以扫描整个项目、验证发现、提出修复,并比较修复前后的变化。 手机上,AI Agent 不只陪你聊天。按照官方展示的用法,它可以把一顿饭记录进健康数据,把群聊中的安排变成提醒,把分享内容写入日历。 设计流程里,一张扁平截图也不再只是参考图。研究团队正在尝试把它拆回文字、颜色、矢量、分组和图层,让设计师能够继续编辑。 这三个场景指向同一个变化:AI 正在离开聊天框,进入代码、设备、设计文件和应用工作区。 过去,回答错了,损失往往只是一段没被采用的文字。现在,错误可能变成一次代码改动、一条日历事件、一组错位图层,甚至一个看起来能用、实际没有后端的应用。 真正需要评估的,已经不只是“模型聪不聪明”,而是它能读什么、能改什么、如何留下记录,以及出错后谁来收拾。 四个工具,分别动了什么 1. Codex Security:让安全扫描进入修复流程 一句话说,Codex Security 是一套面向代码仓库的安全工具:它不只寻找漏洞,也尝试验证和修复问题。 OpenAI 将它开源为 CLI 和 TypeScript SDK。根据官方仓库,它可以: 这和把一段代码复制到聊天框里问“安全吗”不是一回事。仓库级安全工作需要知道检查了哪些目录、覆盖了哪些语言、某个漏洞是否真的消失,以及修复有没有带来回归。 使用门槛也要提前写清。快速开始要求 Node.js 22.13 以上或 24/26、Python 3.10 以上,并需要相应的 Codex Security 访问权限。官方还说明,部分网络安全请求和受保护发现需要 Trusted Access for Cyber。 2. OpenMinis:把 AI Agent 放进手机系统 一句话说,OpenMinis 是一个面向 iOS 和 Android 的端侧 AI Agent,可以在手机上调用日历、提醒、健康等系统能力。 官方仓库将它描述为私有、端侧的 AI Agent。它在沙盒化的 Alpine Linux 环境中运行,支持浏览器自动化、持久记忆和 Skills,也能通过设备集成调用: 项目采用 GPLv3,用户可以用自己的 API Key 接入 Claude、GPT、Gemini 等模型。 它的价值不是把桌面聊天框缩小,而是让 Agent 接触设备事件。官方给出的示例包括:拍摄一顿饭并写入 Apple Health、把群聊中的事项变成提醒、把分享内容写入日历。 但便利和风险来自同一个入口。只要它能替你写日历,也可能写错日历;只要它能访问健康数据,就必须回答数据会经过哪里、调用什么模型、怎样撤销授权。 3. ReDesign:把截图拆回可编辑图层 一句话说,ReDesign 想做的是把一张扁平图片还原为可以继续修改的设计文件,而不只是生成一张相似图片。 论文提出 Agentic Decomposition,让 Agent 选择并组合文字、矢量几何、颜色、分组和层级相关工具,逐步恢复设计结构。过程中还会对局部结果执行接受、剪枝或重试,避免一个错误沿着长链路不断放大。 研究团队构建的 Figma Edit Replay Benchmark 包含 909 个原始 Figma 文件和 14,796 条受控编辑指令。它关注的不只是“像不像”,而是重建后还能不能改标题、换颜色、移动图标、调整分组和遮挡关系。 视觉相似适合展示,可编辑结构才决定它能不能回到真实设计流程。 4. Replit Canvas:把设计方案放进应用工作区 一句话说,Replit Canvas 让用户在同一工作区里探索界面、比较方案,再把确认后的设计推进到应用开发。 这里有一个很容易被演示视频掩盖的边界:设计框架与真实运行应用是分开的。原型里出现登录、支付、表单,不代表后端、数据库和账号系统已经存在。将设计转成带这些能力的完整应用,也需要相应的付费方案。 它们共同做了一件事:让 AI 记住自己干过什么 这四个项目看起来分散,底层变化却很一致:AI 开始持有持续状态。 Codex Security 要记住扫描历史,才能判断漏洞是新增、持续还是已经解决;OpenMinis 依靠工作区、记忆和设备工具继续任务;ReDesign 要维护一棵可验证的图层树;Replit Canvas 则要保留多个设计框架、批注和运行应用之间的关系。 简单说,就是让 AI 记住它干过什么,接着上一步继续干。 扫描历史不完整,“没发现”可能被误读为“没有漏洞”; 移动 Agent 理解错信息,可能把错误内容写进日历或健康记录; 原型看起来能登录、能支付,背后仍可能只是前端模拟。 所以,评估工作型 AI 至少要看三件事:状态怎么保存、写入怎么确认、失败怎么回滚。 如果我是技术负责人,我会这样做一个受控试点 假设任务是“把一个旧营销页改成新活动页”,我不会让四个工具一步到位接管生产环境,而会把它们串成一条可检查的测试链路。 用 ReDesign 把历史海报或页面截图还原成可编辑结构,先检查文字、颜色、分组和层级能否单独修改。 用 Replit Canvas 生成两到三个交互方向,只保留在设计框架中,不直接改运行应用。 方案确认后转成测试应用,再把测试仓库交给 Codex Security 扫描。 让 OpenMinis 负责移动端资料收集和提醒,但只开放指定文件夹、测试日历等低风险权限。 真实发布、生产数据库、客户资料和健康数据,仍然保留显式确认。 这个试点不以“一天上线”为成功标准,而要交付四样东西: 只有产物能被复查,Agent 的价值才从“演示很快”变成“工作可交付”。 四类工具,四张验收表 1. Codex Security:先查覆盖,再看修复 准备一批已经由安全团队确认的历史漏洞,看它是否发现并定位根因; 明确哪些目录、语言和提交被扫描。覆盖不完整时,缺失发现应标为 unknown,而不是直接算作 resolved。 2. OpenMinis:把沙盒权限和设备权限分开查 逐项列出日历、健康、提醒、通讯录、蓝牙、文件和浏览器权限; 分别测试“沙盒里能做什么”和“原生桥接能写什么”。端侧沙盒能隔离一部分执行环境,但设备集成恰恰位于沙盒之外。 3. ReDesign:不要只做截图对比 重建后依次修改标题、主色、图标位置、分组和遮挡顺序; 如果改一个元素会破坏其他区域,就应判定为结构不可靠,即使最终图片看起来很像。 4. Replit Canvas:标清“看起来有”和“真的能用” 给每个关键功能标注四个等级:仅视觉、前端交互、真实后端、生产数据; 登录、支付、表单和数据库不能因为出现在原型里,就被当作已经完成; 别被“一键生成”骗了:真正的效率是改到能用花了多久 团队购买的不是第一次出图速度,而是更短的交付周期。 把旧流程和 Agent 流程放在同一张表里,至少记录五项数据: 即使图层很快生成,如果设计师还要大量修复分组,它只是加速了第一屏演示;即使原型很快可点,如果工程团队必须重写状态管理和可访问性,完整交付时间也未必下降;如果安全扫描产生大量误报,安全人员的复核队列甚至可能更长。 权限越大,责任越要落到具体关口 当 AI 进入真实环境,最危险的误会是把“能够操作”写成“应该授权”。 OpenMinis 的端侧沙盒不能消除模型 API、设备权限和第三方工具的数据边界;Codex Security 不能替代完整安全评审;ReDesign 的研究指标不能保证所有商业设计都能稳定还原;Replit 的设计框架也不等于已经完成后端功能。 因此,人工确认不能只停留在一句口号里,而要放到具体关口:写入生产仓库之前、修改真实应用之前、提交安全修复之前、访问敏感设备数据之前。 工作现场采用卡
**可以采用:**读取范围、写入目标、状态存储、回滚路径和验收人都能明确写出。 **小范围试点:**能力有价值,但仍主要依赖厂商演示或研究指标;先用副本、测试账号和非敏感数据。 **暂缓接入:**工具需要广泛权限,却没有日志、撤销、隔离或复核机制。 **今天能做:**给准备采用的工具画一张权限图,标出它能读什么、能改什么、结果由谁确认。 如果把选择题摆在你面前,你现在敢让 AI 动到哪一步? 欢迎在留言区说说你的选择,以及你最担心的那个权限。
上一篇2026年第21届中国北方数学邀请赛试题分享!
下一篇别让长会话毁掉你的AI项目
基本
文件
流程
错误
SQL
调试
请求信息 : 2026-08-08 09:28:35 HTTP/1.1 GET : https://www.yeyulingfeng.com/a/913382.html 运行时间 : 0.200095s [ 吞吐率:5.00req/s ] 内存消耗:4,955.83kb 文件加载:145 缓存信息 : 0 reads,0 writes 会话信息 : SESSION_ID=ca25547addccf22c7fc2d38dce5f5114
CONNECT:[ UseTime:0.000747s ] mysql:host=127.0.0.1;port=3306;dbname=wenku;charset=utf8mb4 SHOW FULL COLUMNS FROM `fenlei` [ RunTime:0.000678s ] SELECT * FROM `fenlei` WHERE `fid` = 0 [ RunTime:0.000296s ] SELECT * FROM `fenlei` WHERE `fid` = 63 [ RunTime:0.000280s ] SHOW FULL COLUMNS FROM `set` [ RunTime:0.000490s ] SELECT * FROM `set` [ RunTime:0.000204s ] SHOW FULL COLUMNS FROM `article` [ RunTime:0.000479s ] SELECT * FROM `article` WHERE `id` = 913382 LIMIT 1 [ RunTime:0.000374s ] UPDATE `article` SET `lasttime` = 1786152515 WHERE `id` = 913382 [ RunTime:0.003742s ] SELECT * FROM `fenlei` WHERE `id` = 64 LIMIT 1 [ RunTime:0.000226s ] SELECT * FROM `article` WHERE `id` < 913382 ORDER BY `id` DESC LIMIT 1 [ RunTime:0.000406s ] SELECT * FROM `article` WHERE `id` > 913382 ORDER BY `id` ASC LIMIT 1 [ RunTime:0.004225s ] SELECT * FROM `article` WHERE `id` < 913382 ORDER BY `id` DESC LIMIT 10 [ RunTime:0.008034s ] SELECT * FROM `article` WHERE `id` < 913382 ORDER BY `id` DESC LIMIT 10,10 [ RunTime:0.001709s ] SELECT * FROM `article` WHERE `id` < 913382 ORDER BY `id` DESC LIMIT 20,10 [ RunTime:0.008031s ]
0.204024s