乐于分享
好东西不私藏

每日摘要 | AI实操精选 | 2026.07.01

每日摘要 | AI实操精选 | 2026.07.01

从每日 AI 资讯中精选有实操价值的工具,帮你判断哪些值得花时间尝试

关注本号,每日推送不迷路

今日从 45 篇文章中筛选出 48 条工具实操

🛠️ Cursor Mobile — 通过手机远程管理AI编程智能体,支持创建、交互、监控和审批任务

Cursor Mobile 是一个允许开发者通过手机远程管理 AI 编程智能体的工具,支持创建新智能体、与运行中的智能体交互、查看输出、监控任务进度,并通过语音输入或斜杠命令提供指令。它解决了开发者在离开电脑时仍需掌控编码任务的痛点,传统方式依赖本地设备运行任务,无法远程监控和调整。

Cursor Mobile 与桌面版 Cursor 深度集成,支持云端部署智能体,提供 Live Activities 和推送通知,实现无缝切换和远程控制。开发者可以在候机时用手机发起一个复杂的编码任务,回到办公桌后再无缝继续查看智能体的输出结果。应用支持用户监控后台运行的智能体、查看实时进度更新,甚至可以直接在手机端将完成的修改合并进代码库。虽然体验流畅,但存在成本高和上下文保持的问题。

来源:Cursor、OpenClaw 同时出手,“口袋编程”时代来了:程序员只用“动嘴”!

来源:Cursor、OpenClaw 同时出手,“口袋编程”时代来了:程序员只用“动嘴”!

- - -

🛠️ Claude Sonnet 5 — 自主规划、使用浏览器和终端,完成编程、知识工作和多步骤任务

Claude Sonnet 5 是一个具备自主智能体能力的模型,能够制定计划、使用浏览器和终端等工具,完成编程、知识工作和多步骤任务,性能接近 Opus 4.8,但价格更低。它解决了传统模型在复杂任务中中途止步、缺乏自主性的问题,同时以更具吸引力的价格提供高性能的智能体能力。

Sonnet 5 通过优化模型结构和训练方式,在保持较低成本的同时显著提升了性能,尤其在中等努力程度下,成本效率更高,且具备网络安全护栏以保障使用安全。开发者和早期访问合作伙伴反馈 Sonnet 5 比前代更具自主智能体能力,能完成复杂任务,且在浏览器使用场景下的提示注入攻击成功率仅为 0.93%,远低于 Opus 4.8 和 Sonnet 4.6。

来源:刚刚,Claude Sonnet 5 发布

来源:Anthropic 突发 Sonnet 5,但大家更期待 Fable 5 和 Mythos 5 明天解禁

来源:刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜

来源:突发,打工版Claude 5来了!人人都能用

来源:大规模封号后,Claude 突然发布更便宜的新模型

来源:@dani_avila7 推文集

- - -

🛠️ Claude Code — 定义规则后自动对整个项目批量执行代码修改

/goal 是 Claude Code 的一个命令,让你描述一个代码修改目标(如“把所有 v1 API 调用改成 v2”),然后 AI 自动遍历项目中所有相关文件逐一执行修改。不是单文件操作,而是项目级别的批量重构。

日常开发中经常需要批量修改——接口升级、命名规范统一、废弃方法替换。以前要么写正则脚本(容易误伤),要么逐文件手动改(耗时)。/goal 理解代码语义,比正则准确,比手动快。

工作方式是先解析你的“目标描述”,扫描项目文件识别需要修改的位置,逐一生成修改并应用。作者实测 500 文件的 API 迁移 20 分钟完成,但需要把目标写得足够明确,否则容易改错位置。

来源:Cursor、OpenClaw 同时出手,“口袋编程”时代来了:程序员只用“动嘴”!

来源:刚刚,Claude Sonnet 5 发布

- - -

🛠️ Tabbit 妙招 — 定时自动化信息收集,替代每天手动浏览十几个网站

Tabbit 是一个 AI 原生浏览器,核心功能叫“妙招”:你设定信息源 URL 和筛选规则,它定时自动扫描并输出结构化报告。相当于给自己雇了个实习生每天帮你盯着这些网站。

以前做行业调研要每天手动打开一堆网站翻看,费时且容易漏。妙招把“浏览→筛选→整理”这个重复劳动自动化了,而且输出是结构化的清单,不是一堆链接。

作者用它做创业机会扫描,设定了几个信号源,每天自动输出机会清单,发现了几个值得深挖的方向。

来源:699 块的「货运版」Looki,成了卡车司机的新宠

- - -

🛠️ Kimi K2.7 Code — 在Agent工作流中参与完整的开发流程,包括代码理解、方案生成和修改决策

Kimi K2.7 Code 能够在 Agent 工作流中参与完整的开发流程,包括代码理解、方案生成和修改决策,能够修复隐蔽 Bug、生成 3D 游戏、重构遗留系统。它解决了传统开发中代码理解困难、Bug 定位复杂、重构效率低等痛点,现有方式需要大量人工时间和经验。

通过与 Claude Code 结合,利用 Kimi K2.7 Code 的代码理解能力和 Agent 执行环境,实现从代码阅读到修改决策的全流程自动化。在 1032 行陌生代码中定位并修复 3 个隐蔽 Bug,所有测试面板指示灯从红色变为绿色;生成 3D 滚球闯关游戏能直接运行并通过三个关卡;重构 2374 行 Flask 项目减少约 55%。

来源:Kimi K2.7 Code 有多能打?找 Bug,写 3D 游戏,2000 行代码砍掉 55%

- - -

🛠️ Claude Tag — 常驻Slack频道的AI同事,拥有独立权限和工具箱

Claude Tag 是一个常驻 Slack 频道的 AI 同事,有自己的账号、记忆和工具箱,能够自主在频道中旁听、解决问题,并在不同系统中使用自己的权限(如 GitHub、数据仓库等),无需借用任何人类的账号。它解决了传统 AI 助手依赖用户权限,导致权限管理混乱的问题。

Claude Tag 在每个系统中都有自己的账号,权限由频道和工作区配置决定,AI 不使用任何人类凭证,权限变更时会自动断开,避免了权限泄露和管理复杂性。作者提到,Claude Tag 能帮助产品经理在没有 GitHub 权限的情况下查看代码,还能自主排查问题并生成修复代码,极大提升了工作效率。

来源:Claude有「编制」了!Anthropic发的

- - -

🛠️ Nano Banana 2 Lite — 高速生成高质量图像,支持批量处理和实时应用场景

Nano Banana 2 Lite 输入文字描述,输出 1024x1024 的图像,自动化了快速生成图像的过程。它解决了需要快速迭代创意、频繁调整画面时的低效率问题,传统方式需要等待进度条完成,而 Nano Banana 2 Lite 可以在 4 秒内生成图像。

通过优化模型结构和计算资源,实现了极低延迟和低成本,同时保持了图像质量。作者提到该模型速度极快,成本低至 0.034 美元每张图,建议初代用户直接升级替换,普通用户也能在日常产品中体验到 4 秒出图的速度感。

来源:谷歌深夜双发!最便宜Nano Banana来了

来源:视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒

来源:谷歌贴身对标字节:最新轻量版 Nano Banana 2 四秒出图,单张仅 0.034 美元,还能直出视频

- - -

🛠️ QoderWork — 自动识别并清理僵尸进程,监控系统资源并生成报告

QoderWork 是一个能够进入真实本地环境、执行系统诊断、清理僵尸进程、创建定时任务、监控系统资源并生成报告的 AI 工具。它能自动识别并清理占用大量 CPU 和内存的 Chrome 进程,还能通过定时任务持续维护系统资源。

传统方式需要手动排查和清理僵尸进程,耗时且容易遗漏。QoderWork 能自动识别问题并执行清理,避免了手动操作的繁琐和遗漏。作者使用 QoderWork 清理了占用大量资源的 Chrome 进程,清理后 CPU 空闲从 0% 恢复到 65.8%,内存从 120MB 增加到 642MB。定时任务功能让系统资源持续保持良好状态,体验非常流畅。

来源:为拯救一台快要废了的苹果电脑,我造了个轮子……

- - -

🛠️ LLM-Wiki — 将用户的笔记编译成结构化、互相链接的Wiki

LLM-Wiki 将用户的笔记视为不可变源代码,通过大模型将其编译成结构化、互相链接的 Wiki,自动更新相关条目、修订综述、标注新数据与旧结论的冲突。它解决了传统 RAG 只能处理局部信息、无法理解全局、手动维护的知识链接容易腐烂、检索效率下降的问题。

通过三层架构(Raw 层、Schema 层、Wiki 层)解耦,大模型作为编译器,自动整理、对齐、交叉链接、矛盾检测,实现知识的结构化和逻辑自洽。Karpathy 的文档在 GitHub 获得 5000+ star,用户已将 Wiki 扩展到上百页、数十万字,自动化插件开始出现,学术研究者、独立创业者、终身学习者正在集体转向这种新的知识生产关系。

来源:Karpathy又封神!掀翻RAG,把你的笔记变成第二大脑

- - -

🛠️ Notion AI — 在终端环境中直接使用 AI 工具进行开发和实验

Notion AI 允许用户在终端环境中直接使用 AI 工具进行开发和实验,而不是直接进入整个 Notion 的正式代码库。它通过重建真实产品中的 UI 和 pattern,让用户能够快速上手尝试,无需深入复杂的代码库。

传统开发流程需要设计师和 PM 通过 Figma 等工具进行设计,再由工程师实现,这导致了大量无意义的劳动。Notion AI 提供了一个更直接、更高效的开发方式,让设计师和 PM 能够直接在代码中思考和设计,减少中间环节。Notion AI 通过创建一个小型的代码库,专门优化用于 LLM 使用,使得 AI 能够在终端环境中快速响应和执行任务。

来源:当设计师和PM都开始写代码,产品构建方式又要变天了?

- - -

🛠️ Claude Science — 集成科研工具的工作台,支持文献分析、图表生成和自动化计算

Claude Science 是一个集成科研工具的工作台,能够连接专业数据库(如 UniProt、PDB、Ensembl),原生渲染蛋白质结构、基因组轨迹等图表,并支持自动化调度计算任务到 HPC 集群或 Modal 账户,同时提供可视化和交互式追问的学习方式。

它解决了科研工具分散、操作复杂、学习成本高的问题,让科学家能更专注于思考而非工具切换,同时为非专业用户提供了结构化、可视化、交互式的学习方式,提升理解效率。作者通过 DNA 双螺旋结构的案例,发现使用 Claude Science 生成的带标注结构图并配合讲解,能显著提升对复杂结构的理解速度和记忆效果,比传统方式效率高很多。

来源:Claude Science 来了,我发现了一种更高效的学习方式

来源:@dotey 推文集

- - -

🛠️ Gemini Omni Flash — 多模态视频生成与编辑,支持对话式修改

Gemini Omni Flash 基于文本、图像和视频等多种输入,生成高质量视频并进行编辑,支持对话式视频编辑、多模态参考、现实世界知识和文字与动作同步。它解决了视频创作中需要复杂提示词、绿幕和特效的痛点,无需手动描述场景细节,提升创作效率和一致性。

通过 Gemini 的多模态推理能力,结合视频生成与编辑,利用现实世界知识自动构建视频内容,减少人工干预。作者认为其视频生成质量高,且与 Nano Banana 2 Lite 结合使用能实现图像到视频的无缝衔接,提升创作效率。

来源:视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒

- - -

🛠️ design.md — 通过设计规范文件指导 AI 生成符合特定风格的 UI

design.md 是一个设计系统规范文件,通过 YAML 前置元数据和 Markdown 正文,定义颜色、字体、间距等设计元素及其背后的设计理念,指导 AI 生成符合特定风格的 UI。它解决了传统上 AI 生成的 UI 配色和风格缺乏一致性、无法准确理解模糊的设计需求、导致生成效果与预期不符的问题。

通过机器可读的设计 token 和人可读的设计理念结合,AI 既可执行精确数值,又能理解设计意图,从而生成更符合预期的 UI。作者通过实际使用发现,使用 design.md 后,AI 生成的 UI 能更准确地反映设计意图,例如生成 Public Sans 字体的深色标题、温暖米色背景和 Boston Clay 红色 CTA 按钮的页面。

来源:2 万多 Star!Google 开源了这个神级 GitHub 项目。

- - -

🛠️ Agentic Coding Loop — AI Agent 自动写代码、运行测试、发现问题并持续修改

Agentic Coding Loop 是一个 AI Agent,根据产品文档(Spec)和评测标准(Evals)自动写代码、运行测试、发现问题并持续修改,直到符合规格且无明显 Bug。它解决了传统代码生成是单次互动、需人工持续监控的问题,实现了持续自我纠偏,大幅减少人工干预,提升开发效率。

通过自动化的代码生成、测试、调试闭环,AI Agent 能独立验证结果,比传统方式更高效且减少人为错误。Andrew Ng 举例说明,他让 AI Agent 为女儿制作打字小程序,Agent 自动完成代码编写、测试和验证,耗时约一小时,几乎无需人工干预。

来源:吴恩达对 Loop Engineering 的理解真犀利。

- - -

🛠️ Pavo — 一站式 AI 创作平台,实现从想法到成片的自动化创作

Pavo 是一个 PC 端的 AI 创作平台,整合了图片生成、视频生成、短剧创作功能,并通过一个 Agent 进行总指挥,实现从想法到成片的一站式创作。它解决了传统 AI 视频工具需要手动拼接剧本、分镜、配音、剪辑等流程的痛点,将短剧创作流程自动化,提升创作效率。

Pavo 通过自研的多模态模型和 Agent 框架,将创作流程拆解为剧本创作、角色设定、分镜设计、视频生成等步骤,实现自动化和模块化处理。作者通过测试发现,输入简单描述后,Pavo 能逐步细化创意,生成剧本、角色设定、分镜脚本,并生成视频,整体流程顺畅,但电影级质感仍有提升空间。

来源:免费 Token 烧掉 5 万亿之后,他们出了个一站式创作平台。

- - -

🛠️ Cline Token Plan — 提供经济实惠的 Token 计费方案,访问多个开源模型

Cline Token Plan 提供每月 9.9 美元的 Token 计划,允许用户以折扣价格访问包括 GLM-5.2 在内的多个开源权重模型,支持在 Cline CLI & IDE 上使用。它解决了用户需要以高昂价格单独购买每个模型的问题,提供了更经济实惠的方式访问多种大模型。

通过订阅服务,用户可以以远低于市场价的价格访问多个模型,同时支持在 Cline 的开发环境中使用。用户可以通过 npm i -g cline 注册并享受 1.99 美元的特别优惠,实际使用中可以显著降低模型调用成本。

来源:@MaxForAI 推文集

- - -

🛠️ Harbor — 评估长运行、有状态代理的框架,支持自动化评估和结果记录

Harbor 是一个用于评估长运行、有状态代理的框架,它允许用户在真实、可重复、隔离的环境中运行代理,支持与 LangSmith Sandboxes、Deep Agents 和 LangSmith Observability 的集成,实现自动化评估和结果记录。它解决了传统评估方法无法处理代理在运行过程中产生的文件和状态变化的问题。

Harbor 通过提供一个统一的评估框架,支持在隔离的环境中运行代理,并通过脚本进行评估,确保每次运行的独立性和可重复性,同时与 LangSmith 等工具集成,实现结果的追踪和分析。作者提到 Harbor 是评估代理的未来,通过与 LangSmith 等工具的深度集成,使得评估流程更加高效和可靠,能够处理复杂的代理行为,并提供详细的评估结果。

来源:@LangChain 推文集

- - -

🛠️ Pi — 最小的代理框架,提供简单、可插拔的代理流程

Pi 是一个“最小的代理框架”,它不提供完整的开发工具,而是提供一个简单、可插拔的代理框架,允许开发者或代理决定其特定的工作流程。它解决了传统开发工具过于复杂、功能过多的问题,通过提供最小的抽象,让开发者能够专注于他们真正需要的功能,而不是被过多的选项和配置所困扰。

Pi 通过提供一组基本的“原始操作”(primitives),让开发者能够构建自己的代理流程,而不是依赖于一个完整的开发环境。这种方式比传统的工具更灵活,也更易于扩展。作者表示自己“已经爱上 Pi”,并认为它是一个“最小的代理框架”,能够有效压缩复杂性,让开发者更高效地工作。

来源:@badlogicgames 推文集

- - -

🛠️ SuperNori — 面向家庭照顾者的 Proactive Family AI Agent

SuperNori 是一个面向家庭照顾者的 Proactive Family AI Agent,能够自动识别家庭需求并提出建议,但需在获得用户批准后才执行具体操作。它解决了家庭中非正式照顾者(如母亲、祖父母)在管理家庭事务时的负担,传统方式需要手动处理大量琐碎任务,效率低且容易遗漏。

它通过“观察-提问-执行”的三步流程,确保在不越界的前提下提供帮助,避免了侵入性,同时保持了实用性。作者认为 SuperNori 是首个专门为家庭照顾者设计的 AI 工具,能够真正减轻他们的负担,而不是仅仅帮助工作场景下的效率提升。

来源:@0xluffy_eth 推文集

- - -

🛠️ X MCP (X API for Agents) — 连接到 X API 获取实时信息

X MCP(X API for Agents)允许 Agent 连接到 X API,获取实时信息,无需任何设置,支持 Grok、Cursor 或任何 MCP 兼容 AI 工具。它解决了传统方式无法获取实时数据、需要手动更新或依赖其他 API 的问题,效率低且不实时。

通过 X API 提供实时信息源,直接集成到 AI 工具中,实现自动化信息获取和处理。作者提到无需设置即可连接,说明其易用性高,能显著提升 Agent 的实时信息处理能力。

来源:@canghe 推文集

- - -

🛠️ x402协议 — 自动化任务执行,通过授权支付 USDC 代币调用工具

x402 协议允许 AI 代理通过授权支付 USDC 代币来调用工具,实现自动化任务执行,输入是代理的指令和工具需求,输出是经过处理的数据结果,自动化了工具调用和支付流程。它解决了传统方式需要人工干预和 API 密钥的问题,无需账户、API 密钥或人工参与,解决了自动化工具调用的支付和授权问题。

代理发送带签名的 HTTP 请求,工具返回 402 支付请求,代理从 USDC 钱包授权支付,工具执行后返回结构化数据,整个过程无需人工干预。作者提到 Apify 工具库已扩展到 20,000+,并和 Coinbase 合作推出 x402 支持,无需账户或 API 密钥,极大简化了自动化流程。

来源:@svpino 推文集

- - -

🛠️ video-use — 通过文本描述处理视频素材,自动剪辑成 final.mp4

video-use 将视频素材通过 Claude Code 进行处理,自动剪辑成 final.mp4,包括填充词、切除死区、音频淡入淡出、字幕分块等操作,无需逐帧处理。它解决了传统剪辑中机械操作(如手动切掉废话、对齐字幕)的低效问题,替代剪辑师的重复劳动,提升效率。

通过将视频转为文本描述(如词级时间戳、说话人分离),仅用 12KB 文本和少量 PNG 图像进行 LLM 推理,避免高 token 消耗,同时通过自评机制确保输出质量。作者亲自测试并计算 token 成本,发现 video-use 比逐帧处理节省了 99.97% 的 token 使用,同时具备自动修复和渲染功能,最终效果接近专业剪辑。

来源:@aigclink 推文集

- - -

🛠️ shot-scraper — 将Storyboard YAML文件转换为视频演示,自动化录制新网页应用功能的视频

shot-scraper 将用户创建的 Storyboard YAML 文件转换为视频演示,自动化地录制新网页应用功能的视频。它解决了传统方式需要手动录制或使用复杂工具,效率低且难以自动化的痛点。

通过浏览器自动化技术,根据 YAML 脚本精确控制录制过程,实现视频的结构化生成。作者使用 Codex Desktop 和 GPT-5.5 xhigh 生成 YAML 脚本,成功录制了视频演示,展示了其在实际开发中的应用价值。

来源:@simonw 推文集

- - -

🛠️ Windows 桌面 Codex 灵动岛 — 提供直观的任务和审批状态管理

Windows 桌面 Codex 灵动岛作为 Windows 端的 Codex 工具,通过红绿灯状态显示、液态玻璃额度查看、项目卡片一键回到会话等功能,帮助用户更直观地管理任务和审批状态。它解决了在处理需审批或任务完成时,传统方式需要用户持续关注终端,容易分心或遗漏重要信息的问题。

通过桌面状态栏的动态反馈(如红绿灯闪烁、灵动岛弹跳)实现非侵入式提醒,减少用户对终端的依赖。作者表示这个工具让工作状态更清晰,无需一直盯着终端,提升了效率和专注度。

来源:@AI_Jasonyu 推文集

- - -

🛠️ SpellbookLegal — 自动化合同管理,从接收、审查到签署的全生命周期

SpellbookLegal 是一个自动化合同管理工具,从合同接收、审查、签署到续约的全生命周期,AI 自动识别需要律师处理的部分,清除重复性工作。它解决了现有合同管理流程耗时且低效的问题,通常需要数周,而 AI 可以显著加速这一过程,减少律师的工作负担。

通过 AI 原生的合同管理栈,持续运行并自动处理合同,无需人工干预,保持合同的智能管理。Spellbook 是全球使用最多的 AI 合同审查工具,拥有约 5000 名客户,覆盖 80 个国家,能够全天候处理合同,显著提升工作效率。

来源:@amasad 推文集

- - -

🛠️ Codex+Remotion — 将文字输入转换为动画广告片,自动化生成动画内容

Codex+Remotion 将文字输入转换为动画广告片,自动化生成动画内容,无需剪辑软件。它解决了产品和科技内容传播中动画制作复杂、耗时的问题,传统方式需要专业剪辑技能和软件。

Codex 生成脚本和动画结构,Remotion 将其渲染为视频,结合文字与动画表达复杂概念。作者用 20 分钟制作出高端广告片,效果流畅,节奏干净,推荐给产品和科技科普从业者。

来源:@FuSheng_0306 推文集

- - -

🛠️ AI News Radar — 自动抓取每日 AI 相关热点内容,按热度和时间排序

AI News Radar 从多个信息源自动抓取每日 AI 相关热点内容,按热度和时间排序,提供 Top123 信息列表,支持分类筛选、多维度信息源分类、优先级打分、互动数据展示(点赞、收藏、评论、转发)以及官方第一手资讯追踪。它解决了信息过多导致阅读压力,手动搜索各平台效率低且容易被算法干扰,无法及时获取 AI 圈内热点的问题。

通过自动化抓取多平台信息源,结合模型打分机制和多源认证,过滤噪音,按热度和时间排序,提供结构化、可分类的资讯流。作者每天使用该工具,认为其有效缓解了信息过载问题,能快速获取 AI 圈热点,支持移动端和暗色界面,提升阅读体验。

来源:@aiwarts 推文集

- - -

🛠️ InfiniteTalk — 语音驱动的视频生成,支持口型同步、头部运动、身体姿态和面部表情

InfiniteTalk 将图像或视频与音频结合,生成语音驱动的视频,支持口型同步、头部运动、身体姿态和面部表情的同步,可生成无限时长的视频。它解决了传统 AI 视频生成工具受限于时长,无法生成长时间视频,且缺乏自然的面部和身体动作同步的问题。

通过语音驱动生成视频,实现音频与视频内容的深度同步,突破了时长限制。作者发现该项目在 GitHub 上已有 7k 星标,说明其受欢迎程度和实用性,且功能强大,能生成高质量的视频内容。

来源:@axichuhai 推文集

- - -

🛠️ Topview — 整合 Image2 和 Seedance 2.0,实现从静态图到动态视频的无缝衔接

Topview 将 Image2 和 Seedance 2.0 串联在同一条管线里,用户上传产品图后,Image2 生成静态分镜图,Seedance 2.0 根据分镜图生成动态视频,支持数字人、口播文案生成、Live 图制作等全流程,无需自己搭 API、倒腾中间格式。

它解决了传统视频制作流程复杂、耗时,需要多个工具协作,且容易出现画面不一致、动作不连贯等问题。Topview 通过整合 AI 工具,实现从静态图到动态视频的无缝衔接,极大提升制作效率。作者通过多个实战案例验证了 Topview 的实用性,指出其生图页面直接衔接到生成视频入口,功能丰富且性价比高,尤其适合需要批量出素材的跨境电商卖家。

来源:@bggg_ai 推文集

- - -

🛠️ vida — 持续读取用户的屏幕作为上下文记忆,提供Prompt建议和信息推理

vida 能够持续读取用户的屏幕作为上下文记忆,自动捕捉当前屏幕内容并提供 Prompt 建议,还能根据屏幕内容推理、查找信息,甚至直接获取完整文章内容。它解决了 AI 无法理解用户工作背景和上下文的问题,无需每次重复交代任务背景,提升任务执行效率。

通过持续获取屏幕快照,记住用户的日常工作流程,并结合上下文提供精准建议,比传统方式更高效。作者使用 vida 后发现它能准确复盘自己昨天的工作效率,还能根据屏幕内容生成合适的回复,甚至能分析 X 主页并给出建议,体验非常良好。

来源:@aikangarooking 推文集

- - -

🛠️ cangjie-skill — 将视频、书籍等资料进行知识蒸馏,生成可调用的 skill

cangjie-skill 可以将视频、书籍等资料进行知识蒸馏,生成可调用的 skill,用于构建 Agent,辅助问答和实践。它解决了长视频和新书内容难以被 AI 训练的问题,将有价值的内容转化为可调用的方法论,提升知识利用效率。

通过视频下载、音频转文字、文案提取和蒸馏,将长内容转化为结构化的 skill,便于后续调用。作者使用 cangjie-skill 蒸馏了吴恩达的 AI 入门课和 loop engineering 视频,生成 25 个 skill,效果良好,能准确回答相关问题并提供具体方案。

来源:@aikangarooking 推文集

此内容由 AI 自动生成 · 仅微信链接可直接跳转