Codex双击一下,AI终于"看见"你在干什么了
打开Codex,想让它帮你看一份API文档然后写个脚本。
你得先复制文档URL,再打开浏览器,再把内容粘贴到对话框,然后跟它说:"这是我正在看的文档,请根据它帮我写……"
又或者,你在Excel里发现一组数据有问题,想让Codex帮你分析。你得截图、粘贴、再说一遍:"这是XX项目的Q2数据,第3行和第5行对不上,帮我看看……"
这些时间,加起来可能比你真正让AI干活的时间还长。
2026年7月23日,OpenAI在Codex macOS版中悄悄上线了一个功能叫Appshots。它的逻辑极其简单——
双击Command键,Codex直接"看见"你当前打开的任何窗口。
不是截图。是截图+窗口里的全部文本内容(包括你没有滚到、看不到的部分),一起塞进Codex的对话上下文。
你的光标在哪,Codex就"看"哪。一个字都不用描述。
一、先搞清楚:Appshots不是截图工具
很多人第一反应是:"不就是截图嘛,我Command+Shift+4也能截。"
不是。
截图给Codex的是一张图片。Codex需要调用视觉模型去"看"图片里的文字,识别率取决于截图清晰度,而且只能看到屏幕上的部分。
Appshots给Codex的是结构化数据:
• 窗口截图(让Codex知道布局)
• 窗口内所有可见文本(结构化提取,不是OCR)
• 滚动区域中不可见的文本(你没翻到的部分也能抓到)
这意味着什么?
假设你打开了一个10页的PDF文档,屏幕只显示第1页。传统截图只给Codex第1页的内容。但Appshots会把10页的文字全部抓出来——因为文本内容是应用层面可读的,不依赖"屏幕上显示了什么"。
这不是截图的升级版,这是"上下文传递"的范式变革。
二、五个让你效率翻倍的使用场景
场景一:对着API文档写代码
这是最典型的高频场景。
你正在看一个API文档,需要写一段调用代码。以前你得复制粘贴文档内容,或者把URL发给Codex让它去读。
现在:打开文档页面,双击Command,Codex立刻获得完整文档内容。你接着输入"根据这个文档,帮我写一个Python调用脚本"。
搞定。Codex不需要你解释"这是什么API"、"参数有哪些"——它全看到了。
场景二:报错日志直接甩给AI
程序跑崩了,终端里刷出一大段报错信息。你滚动翻看,试图定位关键错误行。
以前:你得复制报错日志、粘贴到Codex、说"帮我看看这个报错是什么意思"。
现在:切到终端窗口,双击Command。Codex直接获取整个终端的完整日志输出——不只是你当前看到的部分,还包括上面滚过去的内容。然后你只需要说"帮我定位问题"。
特别是"滚动区域之外的内容"这一点,解决了一个非常具体的痛点:很多时候报错的关键信息在最开头,但你已经滚到最底部了。手动往上翻再复制,非常反人类。Appshots直接帮你把整个日志抓全了。
场景三:设计稿秒变修改指令
你是产品经理或设计师,正在Figma里看一版设计稿。你觉得导航栏的布局有问题,想让Codex帮你调整前端代码。
以前:你得截图、标注、描述"导航栏第三个菜单项的左边距好像太大了"。
现在:双击Command。Codex同时获得设计稿截图+所有文本标注。你指着说"导航栏间距调小",Codex知道你说的是哪个导航栏。
场景四:邮件、日程、会议纪要一条龙
你打开邮箱看到一封客户的长邮件,想让Codex帮你起草回复。
双击Command。Codex获得邮件全文(包括折叠的引用部分)。你说"帮我回复,语气友好但立场坚定,我们确实无法在这个时间交付"。
你打开日历看到下周有一堆会议,双击Command,说"帮我整理下周的日程安排,找出有冲突的部分"。
任何"我打开一个应用→我需要AI帮我处理里面的内容"的场景,Appshots都能把中间那个"给AI描述背景"的步骤直接省掉。
场景五:配合手机远程操控
如果你看过我之前写的那篇《Codex手机版来了,电脑终于不用随身带了》,你就知道手机远程操控的痛点是什么——手机能发指令,但看不到电脑屏幕。
现在Appshots把这个缺口补上了。
你在外面用手机给家里的Mac发指令:"帮我看看现在打开的那个文档有什么问题。" Mac端不需要你手动操作——Codex通过Computer Use直接截取当前窗口上下文,自动获得内容,然后执行你的指令。
手机指挥+Appshots给上下文+Codex执行,三位一体,这才是完整的远程协作闭环。
三、Appshots vs Computer Use vs Annotations:别搞混
Codex现在有好几种"让AI看到东西"的方式,很多人容易搞混。简单理一下:
功能 | 核心动作 | 适用场景 |
Appshots | 抓取当前窗口上下文(截图+文本) | "让Codex看我正在看的东西" |
Computer Use | 控制鼠标键盘操作桌面应用 | "让Codex操作桌面应用" |
Annotations | 选中具体元素要求局部修改 | "让Codex改某个具体部分" |
Annotate(浏览器内) | 在内置浏览器预览中圈选元素 | "让Codex改网页的某个元素" |
一句话区分:想让AI看→Appshots;想让AI动手→Computer Use;想让AI改局部→Annotations。
这三个功能配合使用才是最佳实践:先用Appshots让Codex理解你的工作上下文,再用Annotations精准指定修改位置,最后用Computer Use执行更复杂的操作。
四、几个需要注意的坑
1. 仅限macOS
Appshots目前只在macOS版Codex桌面应用中可用。Windows和Linux用户暂时用不了。
如果你用的是Windows,替代方案是直接用截图+粘贴,或者通过Chrome扩展让Codex读取网页内容。
2. 快捷键可以自定义
默认是双击Command键(⌘⌘),但如果你和其他工具的快捷键冲突,可以在Codex设置中改成其他组合键。
建议选一个不会误触的组合。双击Command很方便,但如果你的输入法也用了类似快捷键,可能会打架。
3. 抓不到所有应用的内容
Appshots能抓取的是应用"提供的"文本内容。有些应用(比如纯图片编辑器、某些Electron应用)可能不提供结构化文本,这种情况下Appshots只能拿到截图,拿不到文字。
大多数主流应用——浏览器、终端、Figma、VS Code、Office、邮件客户端——都没问题。
4. 隐私意识要有
Appshots抓取的是你当前前台窗口的全部内容。如果那个窗口里有敏感信息(密码、密钥、私人对话),Codex会一并获取。
建议在使用前检查一下前台窗口的内容,尤其是在录屏或共享屏幕时。
五、一个更大的趋势
Appshots看起来是一个小功能——双击快捷键,截个窗口内容,有什么大不了的?
但它代表了一个重要的方向:AI正在从"你告诉它"变成"它自己看"。
第一代AI工具(ChatGPT、Claude):你复制粘贴文本给它,它基于文本回答。
第二代AI工具(ChatGPT视觉、GPT-4V):你上传图片给它,它通过视觉理解图片。
第三代AI工具(Codex + Appshots):你不需要做任何"喂数据"的动作,它直接感知你的工作环境。
从"手动喂养"到"主动感知",这一步跨越,比大多数人意识到的要深远得多。
想想看:如果AI能看到你正在看的任何东西——文档、代码、设计稿、表格、邮件、日志——那"给AI写prompt"这个动作本身就会逐渐消失。
未来的交互方式不是"你描述需求→AI执行",而是"你打开工作→AI自己知道你需要什么帮助"。
Appshots不是这个终点的完整版,但它是朝那个方向迈出的最清晰的一步。
如果你已经在使用Codex,今天就试试:打开任何应用窗口,双击Command键,然后输入一句任务指令。
你会发现,去掉"给AI描述背景"这个步骤之后,整个工作流的速度感完全不一样了。
夜雨聆风