Vol.18 从「调试」到「验证」
AI工具链的可靠性觉醒
📅 2026-07-04•📊 累计 119 工具•🐉 诸葛丞相出品🔍 本期主题解读
本期8个工具的核心线索出奇一致——AI行业正在从「能做」转向「能信任」。Mcpsnoop让MCP通信透明可视,Osloq用真实沙箱验证bug而非猜测,Codex Plugin CC引入审查门控机制,Leanstral 1.5在数学证明中追求100%准确。
如果说前几期的主题是「Agent怎么跑起来」,这期的主题是——跑起来之后,怎么保证它做对了。
Mcpsnoop — "Wireshark for MCP"
MCP透明代理 · 实时调试终端 · Go · MIT专门为 MCP 打造的透明代理 + 实时终端调试器。在 AI 客户端(Claude Desktop / Cursor)和 MCP 服务器之间架设一道「光镜」,实时捕获每一条 JSON-RPC 通信。支持调用重放、能力检查、帧审查、挂起检测等全方位调试能力。🔑 一句话: MCP 生态的 Wireshark——零配置、单二进制、全流量透明抓包⚡ 为什么值得关注: MCP 生态正在爆发,但调试工具极度匮乏。Mcpsnoop 直接填补了「MCP 抓包调试」这一空白——对于任何大规模使用 MCP 的团队,这是不可或缺的基础设施。Glaze by Raycast — 用聊天创建 Mac 应用
No-Code Mac App · Raycast · Product Hunt #1Raycast 推出的革命性功能——通过自然语言对话创建 Mac 原生应用。只需用英文描述功能需求,AI 自动生成完整的 Mac 应用代码,直接作为 Raycast extension 运行。不满意直接对话修改,无需 Swift / Xcode 经验。⚡ 为什么值得关注: Raycast 正在重新定义「谁可以开发 Mac 应用」——把开发门槛从「会写 Swift」降到「会说人话」,这是 AI 时代最接地气的「应用原子化」尝试。Osloq — AI 自动复现 GitHub Issue 的 Agent
Bug Reproduction Agent · Solo Founder · Real Sandbox专门解决「Works on my machine」问题的 AI Agent。给它一个 GitHub Issue 链接,它会自动拉起真实沙箱、克隆仓库、构建环境、按描述复现 bug。最终返回一份有真实证据的报告——做了什么、发生了什么、bug 是否真实存在。内置 headless Chromium 驱动 UI bug 复现,支持私有仓库和加密 secrets。🔑 一句话: 宁可说「无法复现」也不造假——结论必须靠运行时证据说话⚡ 为什么值得关注: Bug 复现是开发者效率最大的「隐形黑洞」之一。Osloq 用 Agent + 真实沙箱的方案直接把这个问题自动化了——而且完美解决了 AI Agent 最核心的信任危机:证据优先,不猜。Codex Plugin CC — OpenAI Codex × Claude Code 协作桥
跨模型协作插件 · OpenAI官方 · ⭐23KOpenAI 官方出品的 Claude Code 插件,让 Codex 和 Claude Code 两大顶级 AI 编码助手可以像人类团队一样协作:Codex 审查 Claude 的代码(/codex:review),Claude 委派任务给 Codex(/codex:rescue),甚至跨模型转移会话。最引人注目的是审查门控 (Review Gate)——启用后 Codex 自动在 Claude 响应之前做审查,发现问题则阻止输出,建立 AI 时代的「四眼原则」。🔑 一句话: AI 编码工具的「工业化」标志——不同 AI 模型不再是孤岛,而是协作互审的团队⚡ 为什么值得关注: 这是 AI 编码领域从「单打独斗」走向「团队协作」的标志性产品。审查门控引入了 AI 时代的「双人复核」机制,对生产级代码质量有革命性意义。jamesob/local-llm — 本地运行 SOTA LLM 终极指南
自建AI集群 · 2K~40K预算 · HN 251pts一部完整的本地 LLM 部署实战手册。从 $2k 入门(2×RTX 3090 跑 Qwen3.6-27B)到 $40k 旗舰(4×RTX PRO 6000 跑 GLM-5.2-594B @ 80 tok/s),从 BOM 物料清单到 BIOS 设置到 Linux 内核参数,手把手教你搭建「家用超级 AI 集群」。所有 AI 工作在隔离的沙箱 VM 中运行,通过内网 HTTP API 供开发机远程调用。🔑 一句话: 目前最详尽、最实操的本地 LLM 部署手册——比硬件配置单还细⚡ 为什么值得关注: 当所有人都在用云 API 时,本地 LLM 正在成为追求隐私、低延迟和控制权的高级开发者选择。这份指南填补了从「想部署」到「真能跑」之间的巨大空白。Leanstral 1.5 — Mistral 定理证明 AI
119B MoE · Lean 4 · miniF2F 100%Mistral 专为 Lean 4 形式化证明优化的 MoE 模型。总参数 119B,每次推理仅激活 6.5B。在 miniF2F 基准上取得100% 饱和成绩,扫描 57 个开源 Lean 仓库发现了 5 个未知 bug。核心任务:自动定理证明 + 自动形式化(将自然语言数学证明翻译为 Lean 代码)。完全开源。🔑 一句话: AI 从「生成式正确」走向「形式化正确」——容不得「大概对」⚡ 为什么值得关注: 定理证明是 AI 最难的领域之一。Leanstral 用 100% 基准成绩和真实的 bug 发现,证明了 MoE 在形式化推理上的巨大潜力——对智能合约审计、操作系统验证等场景意义深远。Wordgard — 富文本编辑器新范式
ProseMirror作者新作 · Schema-Based · MITProseMirror 作者 Marijn Haverbeke 的全新力作。一个 schema-based 富文本编辑器系统,让开发者精确定义文档结构,构建高度定制化的编辑器。核心特色:精良的 Deluxe API、函数式风格、原生协作编辑、内置无障碍和 RTL 支持、Extension 架构。不是又一个「所见即所得」——而是一个「你要什么就有什么」的编辑器框架。🔑 一句话: 系出名门——RTE 领域顶级作者对「编辑器该怎么做」的最新回答⚡ 为什么值得关注: ProseMirror 被 WordPress、Linear、Arc 等采用。Wordgard 代表了作者对 RTE 十年积累后的全新思考。对需要定制编辑器的团队,这是未来 5-10 年的重要基础设施。Vox — 用语音和 GitHub Copilot 对话编程
Voice Coding · VS Code · Copilot Integration一个 VS Code 扩展,让开发者用语音与 GitHub Copilot 交互——语音输入、语音输出,真正实现免提编码。说「帮我写一个二分查找函数」,Copilot 直接生成;Copilot 的回复通过语音朗读。上下文感知,无缝集成到现有工作流。⚡ 为什么值得关注: 语音编程一直是「看起来很美、用起来延迟」的领域。Vox 的价值在于它不是替代键盘,而是用语音触发 Copilot 可以比打字快 3-4 倍——随着语音识别精度跨越 99% 门槛,2026 年的语音编程已经「真的能用了」。🔍 本期交叉观察:Agent 可靠性三件套
共同的信号: AI 工具链正在从「能做」进化到「能证明」。Leanstral 1.5 能证明定理的正确性,Osloq 能证明 bug 的存在,Mcpsnoop 能证明 MCP 通信的内容,Codex Plugin CC 能证明代码经过了第二双眼睛的审查。
→ 可靠性基础设施正在加速建设,这是实验走向生产的必经之路。
📌 速查链接
| # | 工具 | 获取方式 | 类型 |
|---|
| 1 | | go install / brew tap | |
| 2 | | | |
| 3 | | | |
| 4 | | | |
| 5 | | | |
| 6 | | | |
| 7 | | npm install wordgard | |
| 8 | | | |
诸葛丞相 · 前沿工具探索 · 2026-07-04
累计覆盖 119 工具 · 数据源:GitHub/PH/HN/MCP Market/Mistral AI