昨天的 AI 主线不是某个模型突然刷榜,而是 Agent 正在被塞进真实入口:GitHub 把多会话、Canvas 和 PR 处理做成工作台,Google 把 AI Mode 接到日历、购物和票务,Perplexity 开始让 Windows 电脑变成可操作环境。中国侧,豆包搜索把 Agent 查资料这件事产品化;安全侧,Microsoft 把专用模型放进漏洞扫描链路。

发生了什么: GitHub 发布 Copilot app 入门文章,并更新一篇名为 `The harness is all you need (mostly)` 的工作流文章。前者强调项目上下文、多 Agent 会话、Canvas 预览和 Agent Merge;后者把开发流程拆成原型、计划、实现和代码审查。
为什么重要: 这说明 AI 编程工具的重心正在从“问答窗口”转向“持续工作空间”。一个 Agent 负责改代码,另一个会话查上下文,Canvas 负责看结果,Agent Merge 接住 PR 后续反馈,这比单次提示词更接近真实软件开发。
对生态的影响: 对美国开发者工具生态来说,GitHub 在把 Copilot 做成工作流入口;对中国团队来说,这也提醒大家:下一个竞争点不是单个代码模型,而是谁能把 Agent、预览、测试和审查连成闭环。

发生了什么: Google 在 Search 的 AI Mode 场景文章中展示了 5 类用法:连接 Google Calendar 推荐课程,购物并查询附近库存,用 Canvas 生成策略指南和模拟,筛选并预订演出/体育票务,以及连接 Canva 生成邀请函。
为什么重要: 搜索正在从“给链接”变成“帮你把任务往下推进”。Calendar、库存、票务、Canva 这类入口接起来之后,AI Mode 不只是回答问题,而是在用户生活决策里直接承担编排角色。
对生态的影响: 美国平台会继续把 Agent 放进搜索、地图、购物和办公入口;中国做 GEO、内容营销和本地生活的团队要关注的是:内容被 AI 引用之外,服务能不能被 AI 调用。

发生了什么: Perplexity 官方 X 宣布 Personal Computer 已在 Windows 应用中可用,可在本地文件、连接应用和 Web 之间编排 Agent。The Verge 的补充报道提到,它面向 Max 和 Enterprise Max 用户,能处理文档、表格等本地工作,并会在发送邮件、删除文件等敏感动作前提醒用户。
为什么重要: 这是 Agent 入口从浏览器和 IDE 继续往操作系统移动。企业工作大多发生在本地文件、Office、浏览器和内部应用之间,谁能安全地跨这些边界执行任务,谁就更接近“个人数字员工”。
对生态的影响: 美国侧的竞争会落在桌面权限、数据边界和企业集成;中国团队如果做自动化产品,也要把“确认机制、日志、权限、回滚”当成产品能力,而不是上线后再补。

发生了什么: 据火山引擎微信公众号 7月28日消息,经中国证券报·中证金牛座转载,火山引擎上线豆包搜索服务,为 AI Agent 提供跨语言、多模态、多垂类联网信息查询。报道提到,它支持 Markdown 和结构化数据返回、精准定向查询、宽搜语义改写、多轮检索增强,并提供每月 500 次免费搜索额度。
为什么重要: Agent 不是只要接一个搜索框就能做好研究。真正难的是持续搜索、识别信息缺口、交叉验证、过滤低质 SEO 内容,并把结果变成 Agent 能继续处理的格式。豆包搜索切中的就是这个底座问题。
对生态的影响: 中国 Agent 基础设施正在补“事实输入层”。对内容生产、投研、销售线索和客服知识库来说,搜索服务如果能稳定输出结构化结果,就会变成工作流流水线里的关键节点。

发生了什么: Microsoft 的 MAI-Cyber-1-Flash 模型卡显示,这是一个面向网络安全工作流的专用模型,137B 总参数、5B 激活参数、256k 上下文,是 MAI-Code-1-Flash 的安全领域微调版本。它用于 Microsoft 代号 MDASH 的多模型漏洞扫描系统,访问限制在选定客户和 Azure AI Foundry Private Preview 场景。
为什么重要: 安全场景正在走向“专用小模型 + 多模型 harness”。模型卡披露,在 MDASH 内替换 80% 现有模型后,CyberGym 分数从 88.4% 提到 95.95%。但它也明确是防御用途,不是通用开放模型。
对生态的影响: 美国大厂会把安全模型做进内部产品和云服务,而不是简单开源一个权重。对中国安全和开发工具团队来说,机会在于把漏洞发现、优先级、修复建议、验证证据做成可审计链路。

今天选的项目是 `callstack/agent-device`:https://github.com/callstack/agent-device
它的定位很直接:让 coding agent 能验证自己改出来的应用。README 写明,它可以让 Agent 检查、控制和验证 iOS、Android、tvOS、Android TV、Vega Virtual Device、web、macOS 和 Linux 上的应用;在支持的平台上读取 token 更省的 accessibility snapshot,通过 ref 或 selector 找元素,执行动作,并保存截图、视频、日志、trace 等证据。
近期热度与核验: GitHub API 显示该仓库约 3733 stars、222 forks,MIT License,7月28日仍有更新。release `v0.20.1` 发布于 7月27日。README 的最小安装方式是:
agent-device doctor
agent-device help workflow
它解决的痛点: Agent 写代码越来越强,但移动端和桌面端的验收一直很麻烦。网页还能让 Agent 看 DOM 或截图,移动 App 往往要靠人手点、录屏、复现。`agent-device` 把“看当前屏幕、点一个控件、填输入框、保存证据”变成 CLI 命令,Agent 才能在改完之后自己验一遍。
为什么适合 Agent 调用:
最小可执行步骤:
1. 本机准备 Node.js 22.12 或更新版本,并安装对应的 iOS/Android 工具链。
2. 安装 CLI 后先跑 `agent-device doctor`,确认模拟器、ADB、XCTest 等依赖。
3. 打开一个目标应用,例如 `agent-device open Contacts --platform ios`。
4. 用 `agent-device snapshot -i` 读取当前界面,再按最新 ref 执行动作。
5. 用 `agent-device screenshot ./evidence.png` 保存证据,必要时把流程录成脚本。
适用场景: React Native、Expo、Flutter、原生 iOS/Android、TV 应用的冒烟测试;Agent 修 UI 后的自验;PR 里附带截图证据;复现移动端 bug。
限制与安全边界: 它不是 Appium、Detox 或 Maestro 的替代品,更像 Agent 现场探索和生成证据的工具。使用时要避免让 Agent 操作真实账号、真实支付、生产环境和不可回滚动作;README 也提醒 ref 会变化,必须使用最新输出里的 ref。
如果你正在做获客、内容生产或销售转化,可以试试 Huilumina 营销智能体。官网:huilumina.com
夜雨聆风