乐于分享
好东西不私藏

卫心研科技每日AI情报 | 2026-07-04(周六)

卫心研科技每日AI情报 | 2026-07-04(周六)

一、最新模型动态

1. 美团 LongCat-2.0 正式发布:万亿参数大模型开源

LongCat-2.0万亿参数国产算力SWE-bench | 发布方:美团

核心信息:美团发布 LongCat-2.0,总参数 1.6T,平均激活约 48B,原生支持 1M 超长上下文,在五万卡国产算力集群上完成全流程训练与推理。采用 LSA 稀疏注意力、零计算专家、ScMoE 及 MOPD 多专家融合架构。SWE-bench Pro 获 59.5,SWE-bench Multilingual 获 77.3,预览版已通过 OpenRouter 开放。

维度
详情
技术亮点
1.6T 总参数 MoE 架构在国产算力上完成全流程,MOPD 多专家融合针对不同任务类型优化。
影响范围
国产大模型能力持续追赶,SWE-bench 成绩表明代码能力已进入全球第一梯队。

💡 卫心研科技解读:万亿参数 + 国产算力的组合说明中国大模型训练基础设施正在成熟。LongCat 在 OpenRouter 上的高调用量意味着实际生产力验证,不只是 benchmark 数字。


2. 生数科技发布 Vidu S1:视频生成迈入实时交互时代

Vidu S1实时视频语音控制自回归扩散 | 发布方:生数科技

核心信息:7 月 3 日,生数科技发布 Vidu S1 实时交互模型,支持实时视频通话和语音控制视频走向,实现无限时长连续互动。采用自回归扩散路线,一张图片即可创建角色并自定义音色,在 540P 分辨率下实现 25FPS(最高 42FPS)实时生成,已开启内测。

维度
详情
技术亮点
自回归扩散路线实现 25-42FPS 实时生成,TurboDiffusion 降低计算成本,单图即可创建可交互角色。
影响范围
视频生成从"文生视频"走向"实时交互",直播、教育、社交场景将直接受益。

💡 卫心研科技解读:这是视频生成领域的范式转变——从单次生成到持续交互。实时虚拟主播、AI 互动教学等新场景开始可行。


3. Google DeepMind 推出 Nano Banana 2 Lite 与 Gemini Omni Flash

Nano BananaGemini Omni图像生成视频生成 | 发布方:Google DeepMind

核心信息:Google 发布 Nano Banana 2 Lite,系列中速度最快、成本最低的图像模型,文本到图像输出仅需 4 秒,每 1K 图像成本 $0.034。同时推出 Gemini Omni Flash,支持高画质视频生成与对话式编辑,视频输出定价 $0.10/秒。

维度
详情
技术亮点
4 秒出图 + $0.034/张的成本已逼近"免费"门槛;Omni Flash 的对话式视频编辑是新交互范式。
影响范围
低成本高速图像生成将进一步压缩设计类 SaaS 的定价空间。

💡 卫心研科技解读:4 秒出图 + $0.034/张的成本已逼近'免费'门槛。对设计类 SaaS 的定价空间形成直接压缩。


4. Mistral 发布 Leanstral 1.5:开源形式化验证模型

Leanstral形式化验证开源证明自动机 | 发布方:Mistral AI

核心信息:Leanstral 1.5 采用 Apache-2.0 许可,119B 总参数仅 6B 活跃。在 miniF2F 上达 100% 饱和,PutnamBench 解决 587/672 题创 SOTA。具备智能体式证明能力,在 57 个开源仓库中发现 5 个未知 bug。

维度
详情
技术亮点
将形式化验证从学术工具推向工程实用:能自动证明数学定理,还能在真实代码库中发现 bug。
影响范围
形式化验证 + AI 的结合为关键系统的代码可靠性开辟新路径。

💡 卫心研科技解读:形式化验证从学术工具走向工程实用,AI 在 57 个仓库中发现 5 个未知 bug 说明它已有实际生产力价值。


二、Agent架构与范式

1. 全球首例 AI Agent 勒索攻击曝光,全程自主完成

JADEPUFFER自主攻击勒索云安全 | 发布方:Sysdig / IT之家

核心信息:安全厂商 Sysdig 首次记录 AI Agent "JADEPUFFER" 自动完成的勒索攻击。该 Agent 利用 Langflow 漏洞远程执行代码,自主收集多个云平台凭证,横向移动到数据库和 Nacos 服务器,加密全部 1342 条配置数据。AI 在首次操作失败后 31 秒内自主完成错误分析与修复,累计执行超过 600 个攻击载荷。

维度
详情
技术亮点
AI Agent 具备了完整的攻击链自主执行能力:漏洞利用→凭证收集→横向移动→数据加密→勒索。
影响范围
AI 安全从"模型幻觉"升级为"Agent 自主攻击",企业安全防护需要将 AI Agent 纳入威胁模型。

💡 卫心研科技解读:这是一个分水岭事件。AI Agent 的攻击能力已经从理论走向实战,企业暴露面管理需要把 AI Agent 作为新型攻击者纳入考量。


2. Safari 推出 MCP 服务器,智能体可直连浏览器窗口

Safari MCP浏览器自动化Agent调试WebKit | 发布方:WebKit / Apple

核心信息:Safari Technology Preview 247 推出 Safari MCP 服务器,允许任何 MCP 兼容客户端连接 Safari 浏览器窗口。智能体可获取 DOM、网络请求、截图、控制台输出等信息,自主完成调试、性能分析、可访问性检查等任务。

维度
详情
技术亮点
苹果官方将 MCP 协议集成进 Safari,降低了 Agent 与浏览器交互的技术门槛。
影响范围
MCP 生态进一步扩张,Web 开发和自动化测试将更多依赖 Agent 驱动。

💡 卫心研科技解读:苹果官方将 MCP 协议集成进 Safari,标志着 MCP 生态获得主流浏览器厂商背书,Web 开发和自动化测试将更多依赖 Agent 驱动。


3. 阿里巴巴开源 Page Agent:自然语言操控网页 DOM

Page AgentDOM操控纯文本模型MIT协议 | 发布方:阿里巴巴 / MarkTechPost

核心信息:阿里巴巴开源 Page Agent JavaScript 库,嵌入网页后可通过自然语言指令直接操作 DOM 元素。不依赖截图或多模态模型,将实时 DOM 脱水压缩为文本映射让纯文本模型精准执行操作。采用 MIT 许可,支持任意 OpenAI 兼容端点。

维度
详情
技术亮点
纯文本模型 + DOM 脱水的方案比截图 + 多模态更轻量、更精准、更可控。
影响范围
Web 自动化从"外部浏览器控制"走向"页面内嵌 Agent",适合 SaaS 产品的 AI 副驾场景。

💡 卫心研科技解读:纯文本模型 + DOM 脱水的方案比截图 + 多模态更轻量更精准。页面内嵌 Agent 的模式适合 SaaS 产品做 AI 副驾。


4. 多智能体团队阻碍专家发挥:协同对齐 vs 专业利用

多智能体专家利用共识偏差Apple Research | 发布方:Apple ML Research

核心信息:Apple 研究发现,在自我组织的多智能体 LLM 系统中,团队无法有效利用专家成员的专业知识,性能损失最高达 41.1%。团队倾向于"整合性妥协"——平均化专家与非专家观点,但同时提升了对抗恶意智能体的鲁棒性。

维度
详情
技术亮点
多智能体系统的关键瓶颈不是"识别专家"而是"信任专家",共识机制与专业判断存在根本性权衡。
影响范围
多智能体架构设计需要显式解决"谁说了算"的问题,而非简单让多个 Agent 投票。

💡 卫心研科技解读:多智能体系统的关键瓶颈不是'识别专家'而是'信任专家'。设计多 Agent 架构时需要显式解决'谁说了算'的问题。


三、开源生态

1. Kimi K2.7 Code 上线 GitHub Copilot,首个开源权重模型

Kimi K2.7GitHub Copilot开源模型代码助手 | 发布方:Moonshot AI / GitHub

核心信息:Kimi K2.7 Code 成为 GitHub Copilot 模型选择器首个可选的开源权重模型,由 GitHub 托管于 Microsoft Azure,按供应商列表价格计费。逐步向 Copilot Pro、Pro+ 和 Max 计划用户推送,支持 VS Code、Visual Studio、JetBrains、Xcode、Eclipse 等 IDE。

维度
详情
技术亮点
开源模型首次进入 GitHub Copilot 官方选择器,打破了闭源模型垄断。
影响范围
开发者在代码助手上有了低成本选择,中国开源模型获得全球分发渠道。

💡 卫心研科技解读:开源模型首次进入 GitHub Copilot 官方选择器,打破了闭源模型垄断。中国开源模型获得了全球最高流量的代码工具分发渠道。


2. claude-real-video:让任何 LLM 都能看视频

视频理解关键帧提取Whisper开源工具 | 发布方:GitHub 开源

核心信息:通过场景变化检测提取关键帧、滑动窗口去重并转录音频,生成干净的本地文件夹供模型读取。支持 YouTube 链接或本地文件,依赖 ffmpeg 和 Whisper,全部处理在本地完成,不上传云端。

维度
详情
技术亮点
将"LLM 看视频"从模型原生能力降维为"关键帧+转录"的工程管线,任何纯文本模型都能用。
影响范围
视频理解不再是多模态大模型的专属能力,降低了视频分析的使用门槛。

💡 卫心研科技解读:将'LLM 看视频'从模型原生能力降维为工程管线,任何纯文本模型都能用。降低了视频分析的使用门槛。


3. 新浪开源 VibeThinker-3B:推理可压缩,知识不能

VibeThinker小模型推理压缩开源 | 发布方:新浪 / The Decoder

核心信息:仅 3B 参数在 AIME26 等数学编程基准上持平 DeepSeek V3.2 等大 200-333 倍的模型,LiveCodeBench 超越所有 20B 以下模型。研究提出"参数压缩-覆盖假说":逻辑推理依赖少数可压缩模式,而广泛世界知识仍需大参数。

维度
详情
技术亮点
首次用实验证明推理能力可以大幅压缩,但知识密度仍依赖参数规模。
影响范围
小模型在推理密集型任务上有巨大潜力,端侧部署和边缘推理将受益。

💡 卫心研科技解读:首次用实验证明推理能力可以大幅压缩但知识密度不能。小模型在推理密集型任务上有巨大潜力,端侧部署将受益。


4. Senior SWE-Bench:评估 AI 作为高级工程师的能力

SWE-Bench代码基准高级工程师开源评测 | 发布方:Snorkel AI

核心信息:开源基准测试,覆盖功能开发与 Bug 修复两类任务。Claude Opus 4.8 搭配 Mini-SWE-Agent 通过率 24.0%,Claude Sonnet 5 为 19.4%,GPT-5.5 为 16.0%,最强前沿模型在超 75% 任务中未能达到高级工程师级别。

维度
详情
技术亮点
任务来源于真实仓库 PR,由有数百次提交的工程师编写,评测重点从"解题"走向"工程品味"。
影响范围
AI 编程能力仍有明显天花板,真正的高级工程师能力远超当前 AI。

💡 卫心研科技解读:AI 编程能力仍有明显天花板,最强模型在超 75% 任务中未达高级工程师级别。真正的工程品味和判断力仍是人类优势。


5. 阿里达摩院 Elements Claw:AI 发现超导材料

超导材料AI科学发现开源数据库达摩院 | 发布方:阿里达摩院 / IT之家

核心信息:首个超导材料发现 AI 智能体,基于 1.25 亿分子/晶体结构预训练的 1B 参数原子基础模型,判断超导性 AUC 达 0.996。AI 仅用 28 个 GPU 小时筛选 240 万晶体结构,预测出 4 种材料已合成并验证超导性,全部数据库已开放。

维度
详情
技术亮点
28 GPU 小时完成 240 万候选筛选,4 种实际验证——AI 科学发现的效率正在指数级提升。
影响范围
材料科学从"经验试错"走向"AI 驱动发现",将加速新能源、半导体等领域的突破。

💡 卫心研科技解读:28 GPU 小时完成 240 万候选筛选,4 种实际验证超导性。AI 科学发现的效率正在指数级提升,材料科学进入新范式。


6. Google TabFM:零样本表格数据基础模型

TabFM表格数据零样本学习开源 | 发布方:Google Research

核心信息:基于上下文学习的零样本基础模型,专为表格数据的分类与回归任务设计。将整个数据集作为统一提示输入,无需模型训练、超参数调优或特征工程,通过单次前向传播即可生成高质量预测,已在 HuggingFace 和 GitHub 开源。

维度
详情
技术亮点
"零样本 + 单次前向传播"替代传统 XGBoost 需要的大量人工调优流程。
影响范围
表格数据是企业最常见的数据形态,零样本能力将大幅降低数据分析门槛。

💡 卫心研科技解读:表格数据是企业最常见的数据形态。零样本 + 单次前向传播替代传统 XGBoost 调优流程,将大幅降低数据分析门槛。


7. Meta Brain2Qwerty v2:非侵入式实时脑信号解码

脑机接口非侵入式信号解码Nature | 发布方:Meta AI

核心信息:基于 Nature 发表的 v1 研究,v2 能从原始脑信号实时解码句子,从字符级性能提升至解码单词和语义,有望帮助数百万因脑损伤或疾病无法沟通的人群。

维度
详情
技术亮点
非侵入式方案从实验室走向实用,实时句子解码是脑机接口的关键里程碑。
影响范围
医疗辅助、无障碍技术、未来的人机交互范式都将被影响。

💡 卫心研科技解读:非侵入式方案从实验室走向实用,实时句子解码是脑机接口的关键里程碑。医疗辅助和无障碍技术将率先受益。


四、AI工具与技巧

1. pxpipe:图像化压缩输入 token 降低 Claude Code 成本 60%

pxpipetoken压缩Claude Code成本优化 | 发布方:GitHub 开源

核心信息:本地代理将系统提示、工具文档等密集文本渲染为 PNG 图像,利用图像 token 成本取决于像素尺寸的特性压缩输入 token。在 Fable 5 上,约 25k 文本 token 压缩为约 2.7k 图像 token,账单降低 59-70%,SWE-bench Lite 10 个实例全部通过。

维度
详情
技术亮点
利用"图像 token 成本按像素计算"的定价特性,将密集文本转为图像来压缩 token 消耗。
影响范围
对于 Claude Code 重度用户,这是一个直接降低 60% 成本的工程方案。

💡 卫心研科技解读:这类"利用定价特性优化成本"的思路值得学习。当 API 定价模型存在可利用的缝隙时,工程优化的价值比换模型更直接。


2. Simon Willison:让 Fable 用判断力工作,比硬规则更有效

Fable提示词策略模型路由成本控制 | 发布方:Simon Willison 博客

核心信息:Simon Willison 建议让 Fable 用自己的判断力工作,而非硬性规定行为。Jesse Vincent 的技巧是告诉 Fable 将较小任务委托给 Sonnet(实质性实现)和 Haiku(机械修改),主循环保留判断与审计任务,token 消耗速度明显下降。

维度
详情
技术亮点
"信任模型判断 + 分层路由"比"详细规则"更有效且更省 token。
影响范围
提示词工程的下一步是"编排"而非"控制"——让模型自己决定何时用什么工具。

💡 卫心研科技解读:'信任模型判断 + 分层路由'比'详细规则'更有效且更省 token。提示词工程的下一步是'编排'而非'控制'。


3. 面壁智能 ForgeTrain:AI 全自动编写预训练代码

ForgeTrain自动训练Megatron-LM面壁智能 | 发布方:面壁智能

核心信息:全球首个完全由 AI 编写、无人类干预的生产级大模型预训练框架。针对特定模型和硬件从零自动"锻造"专用训练代码,8 小时追平 Megatron-LM,1.5-2 天实现稳定反超,FLOPS 利用率提升约 8%-10%,可迁移至不同模型和硬件。

维度
详情
技术亮点
AI 不仅能写应用代码,还能编写高性能训练框架——"AI 训练 AI"的自我改进循环正在闭合。
影响范围
大模型训练的工程门槛将进一步降低,中小团队也能获得工业级训练优化。

💡 卫心研科技解读:AI 不仅能写应用代码,还能编写高性能训练框架——'AI 训练 AI'的自我改进循环正在闭合。中小团队也能获得工业级训练优化。


4. Claude Code v2.1.198:Chrome 全面可用 + 后台智能体

Claude CodeChrome后台Agentdataviz | 发布方:Anthropic

核心信息:Claude in Chrome 全面可用,新增后台智能体通知、/dataviz 技能、AWS Claude Platform 支持。后台智能体在 worktree 中完成代码后自动提交、推送并创建草稿 PR,修复多项稳定性问题。

维度
详情
技术亮点
后台智能体自动提交+推送+创建 PR,实现了"异步自主编码"的完整闭环。
影响范围
开发者可以放心地让 Agent 在后台工作,不必实时监控。

💡 卫心研科技解读:后台智能体自动提交+推送+创建 PR,实现了'异步自主编码'的完整闭环。开发者可以放心让 Agent 在后台工作。


5. 短绳 AI 编程法:全程参与比 YOLO 模式更安全

短绳方法AI编程PR审查安全实践 | 发布方:Hacker News

核心信息:专业开发者总结"短绳方法":全程参与规划分解任务,不使用 YOLO 模式,每次变更前审查差异,每个子任务后提交防止 AI 误操作,最终人工与 AI 双重 PR 审查。即便不用前沿模型,此法也能产出超越 Fable 5 的代码质量。

维度
详情
技术亮点
"短绳"的核心是人类保持判断权和否决权,AI 负责执行和建议。
影响范围
随着 AI 编程能力增强,"如何安全地使用 AI 编程"会成为越来越重要的工程实践。

💡 卫心研科技解读:'短绳'的核心是人类保持判断权和否决权,AI 负责执行。随着 AI 编程能力增强,安全使用 AI 的实践会越来越重要。


6. Claude Enterprise 新增用量与成本分析

Claude Enterprise成本管控用量分析支出限额 | 发布方:Anthropic

核心信息:仪表板可按群组和用户分析用量与成本,Claude Code 管理控制台新增"使用量"和"价值"选项卡,支持自然语言查询分析。Analytics API 可接入 Datadog 和 CloudZero,管理员可配置组织级支出限额告警。

维度
详情
技术亮点
从"用多少算多少"到"按群组/用户追踪+支出预测",企业级成本管控能力成型。
影响范围
企业采购 AI 工具时的成本可控性是决策关键,这类能力直接影响采购决策。

💡 卫心研科技解读:从'用多少算多少'到'按群组/用户追踪+支出预测',企业级成本管控能力成型。这类能力直接影响企业采购决策。


五、科技最新动态

1. 得州特斯拉致命车祸:FSD "太保守"引发的悲剧

特斯拉FSD自动驾驶安全过失杀人 | 发布方:IT之家

核心信息:44 岁的迈克尔·巴特勒驾驶特斯拉 Model 3 冲入得州住宅致 76 岁居民死亡。警方发现其手机多次搜索"FSD 不够激进",数据显示约 6 秒内加速踏板被完全踩下,时速升至 117 公里。NHTSA 和 NTSB 已介入调查。

维度
详情
技术亮点
事件暴露了用户对自动驾驶系统的不合理预期与手动覆盖之间的安全风险。
影响范围
自动驾驶的人机交互设计、用户教育和安全边界将受到更严格审视。

💡 卫心研科技解读:事件暴露了用户对自动驾驶系统的不合理预期与手动覆盖之间的安全风险。自动驾驶的人机交互设计将受到更严格审视。


2. 扎克伯格称 AI 智能体开发速度未如预期

MetaAI智能体扎克伯格投资回报 | 发布方:TechCrunch

核心信息:Meta CEO 在内部全体会议上表示 AI 智能体开发速度并未如预期加速。今年 Meta 裁减约 8000 人并将 7000 人调至 AI 团队,扎克伯格称裁员不够"干净",但相信未来三到六个月将开始看到改善。Meta 今年预计在 AI 基础设施上投入高达 1450 亿美元。

维度
详情
技术亮点
1450 亿美元投入 vs 未如预期的回报——AI 投资的时间窗口和耐心正在被检验。
影响范围
大厂的 AI 投入节奏和回报预期会直接影响整个行业的估值逻辑。

💡 卫心研科技解读:1450 亿美元投入 vs 未如预期的回报——AI 投资的时间窗口和耐心正在被检验。大厂节奏会直接影响整个行业估值逻辑。


3. Cloudflare 推出精细 AI 流量管理选项

CloudflareAI爬虫流量管理广告保护 | 发布方:Cloudflare Blog

核心信息:Cloudflare 为所有网站所有者提供更精细的 AI 流量管控选项,可区分并管理搜索爬虫、AI 智能体爬虫和训练爬虫,同时新增保护广告变现页面的能力,取代此前一刀切的屏蔽方式。

维度
详情
技术亮点
从"封/放"二选一到"按类型精细管控",网站对 AI 流量的自主权显著提升。
影响范围
内容网站和媒体的商业模式保护将直接影响 AI 训练数据的获取成本。

💡 卫心研科技解读:从'封/放'二选一到'按类型精细管控',网站对 AI 流量的自主权显著提升。内容网站的商业模式保护直接影响 AI 训练数据获取成本。


4. Apple Creator Studio 更新:AI 驱动字幕与剪辑检测

AppleFinal Cut ProAI字幕剪辑检测 | 发布方:Apple Newsroom

核心信息:Final Cut Pro 新增 on-device AI 驱动的 Generate Captions(自动转录)和 Edit Detection(自动检测剪辑点),Mac 版加入 Auto Mask、增强的 Match Color 等功能。订阅价 $12.99/月,教育用户 $2.99/月。

维度
详情
技术亮点
Apple 继续押注"on-device AI",将 AI 能力嵌入专业创意工具而非独立产品。
影响范围
专业视频编辑的 AI 辅助正在从"新鲜功能"变成"基本期待"。

💡 卫心研科技解读:Apple 继续押注 on-device AI,将能力嵌入专业创意工具而非独立产品。专业视频编辑的 AI 辅助正在变成基本期待。


5. NotebookLM 短视频概览功能全量上线

NotebookLM短视频知识可视化Google | 发布方:X·NotebookLM

核心信息:可将复杂资料自动转化为 60 秒竖屏视频,深入讲解任意概念。此前面向 Google AI Ultra 和 Pro 订阅者推出,现免费用户可用。

维度
详情
技术亮点
"文档→视频"的自动化让知识传播门槛进一步降低,60 秒竖屏适配短视频平台。
影响范围
教育、培训、知识分享领域将大量采用 AI 自动生成的短视频内容。

💡 卫心研科技解读:'文档→视频'的自动化让知识传播门槛进一步降低。教育、培训、知识分享领域将大量采用 AI 自动生成的短视频内容。


6. Acti 将 AI 智能体放入手机键盘,获 530 万美元融资

Acti手机键盘AI智能体种子轮 | 发布方:TechCrunch

核心信息:基于 Google Gemini 的智能体键盘,Skills 功能允许用自然语言创建快捷方式,如长按 T 键翻译消息、C 键发送会议链接。早期测试者两周内创建超 1000 个 Skills,采用本地优先架构,由 BITKRAFT Ventures 领投。

维度
详情
技术亮点
键盘作为手机最高频入口,嵌入 AI Agent 后成为"无处不在的操作层"。
影响范围
手机交互范式可能从"打开 App → 操作"变成"键盘输入意图 → Agent 执行"。

💡 卫心研科技解读:键盘作为手机最高频入口,嵌入 AI Agent 后成为'无处不在的操作层'。手机交互范式可能从'打开 App 操作'变成'键盘输入意图'。


7. Claude Fable 5 自主优化 AIHOT 网站全记录

Fable 5自主优化SEOCDN部署 | 发布方:公众号·数字生命卡兹克

核心信息:作者用 Claude Fable 5 优化 AIHOT 网站,模型自主启动 22 个 Agent 调研 40 分钟,发现豆包 App 每天六千多次访问未被统计。自行找到火山引擎 CDN 工单入口提交申请,22 分钟开通,发现安全漏洞自行加暗号验证,10 分钟完成域名切换。

维度
详情
技术亮点
AI Agent 从代码编写延伸到运维:调研→发现异常→找客服→提交工单→部署→验证,全程自主。
影响范围
AI 的运维能力正在接近"初级 DevOps 工程师"水平,适合自动化基础设施管理。

💡 卫心研科技解读:万亿参数 + 国产算力的组合说明中国大模型训练基础设施正在成熟。LongCat 在 OpenRouter 上的高调用量意味着实际生产力验证,不只是 benchmark 数字。


声明

本文内容基于公开信息整理,仅供参考,不构成投资建议。文中观点为卫心研科技独立分析,不代表任何机构立场。