乐于分享
好东西不私藏

卫心研科技每日AI情报 | 2026-07-01(周三)

卫心研科技每日AI情报 | 2026-07-01(周三)

卫心研科技每日AI情报

2026年7月1日,周三。本期关注 GPT-5.6 模型分层、Agent 工作流、开源工具链、AI 编程工具、芯片与机器人基础设施。

一、最新模型动态

1. 破天荒!DeepSeek V4正式版居然要涨价,而且翻着倍地涨

DeepSeekAPI定价算力基建大模型 | 发布方:量子位

DeepSeek V4正式版将于7月上线,高峰时段API价格翻倍(输入输出token均x2),这是DeepSeek首次涨价。涨价仅限高峰时段(UTC凌晨1:00-4:00和上午6:00-10:00),其他时段维持原价。DeepSeek正自建数据中心(选址乌兰察布),招聘大量算力基建岗位,算力紧张是涨价主因。V4预览版用户反馈集中在幻觉率偏高、超长上下文稳定性不足等问题,正式版承诺功能优化和性能提升。

维度
详情
技术亮点
首次采用高峰时段动态定价策略做负载管理,自建数据中心缓解算力压力,V4正式版将改进百万上下文窗口稳定性、幻觉率和代码能力
影响范围
影响所有DeepSeek API用户和开发者,标志着价格屠夫开始探索差异化定价模式,可能引发AI API定价策略变革
💡 卫心研科技解读:DeepSeek涨价是AI基础设施进入供不应求阶段的标志性事件。当算力成为稀缺资源,定价策略就从抢占市场转向利润最大化。对开发者来说,需要开始考虑多模型路由和成本优化策略,而不是只押注一个低价模型。动态定价模式可能会成为行业标准。

2. 不只DeepSeek,阶跃等开源JetSpec:大模型解码提速近10倍

阶跃星辰JetSpec投机解码推理优化开源 | 发布方:机器之心

阶跃星辰提出投机解码框架JetSpec,与DeepSeek的DSpark几乎同期发布,两者切入点互补:DSpark面向高并发吞吐场景,JetSpec面向低延迟场景。在Qwen3-8B上,JetSpec相比标准自回归解码最高实现9.64倍端到端解码加速;在MATH-500上一次验证平均可接受10.76个token。JetSpec通过将因果性直接融入并行草稿头,解决了投机解码中因果一致性与并行效率的两难困境。

维度
详情
技术亮点
提出因果并行树生成方法,让大草稿预算有效转化为更长的接受前缀;在HumanEval、LiveCodeBench、MT-Bench等代码和对话任务上分别实现7.12倍、7.67倍和4.58倍加速
影响范围
大模型推理效率领域,直接影响Agent规模化落地的推理成本和响应延迟,对所有依赖LLM高频调用的Agent应用有基础性影响
💡 卫心研科技解读:JetSpec和DSpark的同期发布说明推理优化已经进入深水区。对做Agent的团队来说,推理延迟是用户体验的核心瓶颈,10倍加速意味着Agent可以做到真正的实时对话。更重要的是,这类优化是开源的,中小团队也能用上顶级推理效率。

3. 登上Nature子刊!Meta脑机接口重大阶段性进展

Meta脑机接口Brain2QwertyNature开源 | 发布方:机器之心

Meta发布Brain2Qwerty v2,是非侵入式脑信号解码的重大里程碑,能从MEG脑磁信号中实时解码完整句子,论文登上Nature子刊。9名被试平均词准确率达61%,最优被试达78%,相比此前非侵入式方法约8%的准确率实现大幅提升。技术架构分为Brain Encoder(Conformer+CTC字符级检测)和NeuroLLM(Qwen3-4B微调,将神经特征转为自然语言句子)两部分。

维度
详情
技术亮点
端到端深度学习框架直接从原始脑信号解码文本,突破v1依赖按键精确时间的限制;采用SigLIP对比损失将神经词嵌入拉向LLM词嵌入空间;开源全部训练代码和数据集
影响范围
脑机接口领域,非侵入式方案有望改善数百万因脑损伤失去交流能力患者的生活,同时展示了AI Agent在科研超参搜索中的实际应用
💡 卫心研科技解读:Meta用AI Agent(Cursor+Claude Opus 4.6)驱动1500次超参搜索来优化脑机接口模型,这本身就是Agent在科研领域的标杆案例。从技术角度看,非侵入式脑机接口的准确率从8%跳到61%,意味着这项技术从实验室走向临床应用的门槛大幅降低。

4. LiveWorld:视频世界模型新范式,让镜头之外的世界继续演化

LiveWorld视频世界模型具身智能自动驾驶仿真 | 发布方:机器之心

来自阿德莱德大学、澳国立、蒙纳士、浙大、奥克兰大学的研究者提出LiveWorld,解决视频世界模型的视野外动态问题。现有视频世界模型隐含静态世界假设:物体离开相机视野后状态不再更新。LiveWorld将世界演化与观察渲染显式解耦。系统架构包括虚拟监视器持续模拟局部事件、观察渲染器从相机视角呈现世界、静态3D空间记忆三部分。

维度
详情
技术亮点
基于Wan2.1-14B-T2V视频扩散骨干,用Qwen3-VL和SAM3识别动态实体;构建首个面向视野外动态的基准LiveBench(100场景400条评估序列)
影响范围
视频世界模型、具身智能训练、自动驾驶仿真、交互式环境模拟领域,解决了世界模型在长期一致性和视野外状态维护上的核心短板
💡 卫心研科技解读:LiveWorld解决了一个被忽视但关键的问题:物体离开视野后状态还在变化。这对具身智能训练至关重要——机器人在真实环境中操作时,不可能一直盯着所有物体。让世界模型能正确推演视野外的状态变化,才能训练出真正可靠的机器人策略。

二、Agent架构与范式

5. Agent之间,有互联网了!明略科技开源发布Octo

Agent协作多Agent系统开源明略科技Octo | 发布方:量子位

明略科技开源发布Octo,定位为开源可信的Agent协作网络,让人、Agent和外部工具进入同一套协作系统。Octo提出三个核心概念:Bot(Agent以数字同事身份进入团队)、Channel/Thread(协作频道与事项追踪)、Matter(将聊天转化为可追踪交付)。系统提供六种协作模式:Solo、Roundtable圆桌讨论、Critic独立审核、Pipeline流水线、Split分头干、Swarm竞选择优。

维度
详情
技术亮点
六种多Agent协作模式,Bot身份管理与AgentCard体系,Context/Taste/Skill三类协作资产沉淀飞轮,浏览器插件实现工作流零切换
影响范围
代表AI应用从个人效率工具向组织协作网络迁移的趋势,对飞书/Slack等传统IM工具形成差异化竞争
💡 卫心研科技解读:Octo的核心洞察是:Agent不应该只是工具,而应该是团队成员。当Agent有了Bot身份、协作频道和可追踪交付,它就从一次性调用变成了持续参与的数字同事。这对做Agent产品的团队来说是一个明确的方向:把Agent设计成团队成员,而不是API端点。

6. 担心蒸馏问题,Meta限用Claude Code、Codex

MetaClaude CodeCodex蒸馏风险AI合规 | 发布方:机器之心

Meta正在限制员工在AI模型构建中使用Claude Code和Codex,担心外部模型输出可能进入自家训练数据引发蒸馏争议。Meta的应用AI工程团队负责改进自家编程助手MetaCode,但团队又是Claude Code大客户,外部AI工具生成的内容一旦进入研发流程即构成蒸馏风险。内部指南明确禁止使用外部AI模型生成编程挑战题、分析源代码查找漏洞等。

维度
详情
技术亮点
暴露了AI Coding时代的深层矛盾:公司需要外部AI提升效率,同时必须防止其输出进入自家模型体系;AI编程工具正从辅助工具变为模型研发供应链的一部分
影响范围
AI行业竞争格局,所有使用竞争对手AI工具的科技公司都面临类似合规挑战,可能加速各家自研编程助手的投入
💡 卫心研科技解读:Meta的困境是所有AI公司的缩影:用竞争对手的AI工具提升效率,同时担心自己的数据被间接蒸馏。这说明AI编程工具已经从可选的生产力工具变成了模型研发供应链的关键环节。未来每家大模型公司都需要自己的编程助手,就像每家云厂商都需要自己的数据库一样。

7. Claude Code之父版「职场MBTI」:AI洗牌后只剩5类人

Claude Code职场变革AI就业组织架构Anthropic | 发布方:量子位/机器之心

Anthropic Claude Code团队负责人Boris Cherny提出AI时代五类新型职业角色:原型师(Prototyper)、建造师(Builder)、清道夫(Sweeper)、增长手(Grower)、维护者(Maintainer),取代传统的研发、产品、设计等职能划分。这五类角色不绑定传统岗位,一个人可横跨多个角色,且角色需随项目阶段演变。Claude Code已贡献GitHub上4%的公开commit,年化收入突破25亿美元。

维度
详情
技术亮点
基于行为模式而非职能头衔的团队组织范式,产品生命周期不同阶段需要不同角色组合(PMF前需1/2/3型,增长期需2/3/4型,成熟期需3/4/5型)
影响范围
对所有白领工种的组织架构提出重构设想,引发硅谷广泛讨论,预示AI时代团队分工的根本性变革
💡 卫心研科技解读:Boris的五类角色框架本质上是在说:AI正在模糊传统岗位边界。当一个人可以用AI做原型、写代码、做增长、维护系统时,按职能划分团队就失去了意义。对个人来说,关键是搞清楚自己在哪个角色上最强,然后用AI补齐其他角色的能力。通才的黄金时代确实来了。

8. Meta脑机接口用AI Agent驱动1500次超参搜索

AI Agent科研自动化超参搜索Meta脑机接口 | 发布方:机器之心

Meta的Brain2Qwerty v2项目中,超参数搜索由3个独立AI coding agent(Cursor+Claude Opus 4.6驱动)并发执行,总计1500次实验,由工程师人工筛选最优配置。这是AI Agent在科研领域的标杆案例,展示了Agent如何加速科研迭代效率。

维度
详情
技术亮点
3个AI coding agent并发执行1500次超参搜索;工程师角色从执行者转变为筛选者;Agent驱动的科研自动化范式
影响范围
科研自动化领域,Agent从辅助工具升级为科研执行者;未来科研流程可能被重构为Agent执行+人类筛选的模式
💡 卫心研科技解读:这个案例最值得关注的不是技术细节,而是科研流程的范式转变:工程师从做实验变成了筛选实验结果。当Agent可以并发执行1500次实验时,人类的价值就从执行转向了判断。这对所有科研团队都有启示:与其培养更多实验员,不如训练更好的Agent。

三、开源生态

9. XiaomiMiMo/MiMo-Code:小米开源AI编程模型,模型与Agent共进化

小米MiMo-Code开源AI编程Agent | 发布方:GitHub

小米开源MiMo-Code项目,定位为Where Models and Agents Co-Evolve,强调模型与Agent的协同进化。项目在GitHub上获得超过1.1万星标,是近期AI编程领域的热门开源项目。

维度
详情
技术亮点
模型与Agent共进化的设计理念;小米在AI编程领域的开源布局;GitHub星标快速增长
影响范围
开源AI编程工具链进一步完善;小米在AI Agent领域的开源贡献;模型与Agent协同进化成为新趋势
💡 卫心研科技解读:小米的MiMo-Code项目名称本身就传达了一个重要理念:模型和Agent应该一起进化,而不是分开训练。这对做Agent的团队来说是一个架构启示——不要只优化模型或只优化Agent框架,而要设计让两者互相促进的训练循环。

10. omnigent-ai/omnigent:开源AI Agent编排框架

omnigentAgent编排开源Claude CodeCodex | 发布方:GitHub

omnigent是开源AI agent编排框架,支持Claude Code、Codex、Cursor等多种AI编程工具。项目在GitHub上获得超过5700星标,提供统一的Agent编排能力。

维度
详情
技术亮点
统一编排多种AI编程工具;开源免费使用;支持Claude Code/Codex/Cursor等主流工具
影响范围
Agent编排层成为开源社区关注焦点;多工具统一管理需求明确;Agent基础设施层竞争加剧
💡 卫心研科技解读:omnigent的出现说明Agent编排已经从概念变成了真实需求。当团队同时使用Claude Code、Codex、Cursor等多种工具时,统一编排和管理就成为刚需。这对做Agent平台的团队来说是一个信号:编排层的价值正在被市场认可。

11. raiyanyahya/recall:给Claude Code持久记忆,完全离线

recallClaude Code持久记忆离线开源 | 发布方:GitHub

recall项目为Claude Code提供持久记忆能力,完全离线运行,不需要云服务。项目在GitHub上获得639星标,解决了Claude Code跨会话记忆丢失的问题。

维度
详情
技术亮点
完全离线运行的持久记忆方案;解决Claude Code跨会话记忆问题;轻量级实现
影响范围
Claude Code生态进一步完善;持久记忆成为Agent标配需求;离线隐私保护场景有独特价值
💡 卫心研科技解读:recall项目解决了一个Claude Code用户的核心痛点:每次新对话都从零开始。持久记忆让Agent可以记住用户的偏好、项目上下文和历史决策,这对长期项目来说价值巨大。离线方案也满足了隐私敏感场景的需求。

12. amElnagdy/guard-skills:编码Agent的防护技能

guard-skillsAgent安全代码质量开源防护 | 发布方:GitHub

guard-skills项目提供编码Agent的防护技能,捕获AI生成代码的失败模式。项目在GitHub上获得929星标,关注Agent生成代码的质量和安全性问题。

维度
详情
技术亮点
捕获AI生成代码的失败模式;防护技能可复用;关注Agent代码质量
影响范围
Agent安全成为开源社区关注焦点;代码质量防护需求明确;Agent从能用走向可靠
💡 卫心研科技解读:guard-skills的出现说明Agent社区已经开始关注代码质量而不只是功能。当Agent越来越多地参与代码生成时,如何确保生成的代码是安全可靠的就成为关键问题。防护技能的设计思路值得借鉴:把常见的失败模式封装成可复用的检查规则。

13. alchaincyf/fanbox:Vibe Coding的驾驶舱

fanboxVibe Coding代码可视化开源开发工具 | 发布方:GitHub

fanbox项目定位为Vibe Coding的驾驶舱,帮助开发者看清每一次代码改动。项目在GitHub上获得830星标,解决AI辅助编程时代码变更可视化的问题。

维度
详情
技术亮点
Vibe Coding的代码变更可视化;驾驶舱式界面;看清每一次改动
影响范围
Vibe Coding工具链进一步完善;代码变更可视化需求明确;AI辅助编程体验优化
💡 卫心研科技解读:fanbox抓住了Vibe Coding的一个核心痛点:当AI快速生成大量代码时,开发者很难看清每次改动的具体内容。驾驶舱式的可视化让开发者可以快速理解AI做了什么,而不是盲目接受。这对提升AI辅助编程的信任度很重要。

14. superloglabs/superlog:用AI Agent自愈软件的开源可观测性工具

superlog可观测性自愈AI Agent开源 | 发布方:GitHub

superlog是用AI agent自愈软件的开源可观测性工具。项目在GitHub上获得958星标,将AI Agent能力引入软件运维领域,实现自动化故障检测和修复。

维度
详情
技术亮点
AI Agent驱动的软件自愈;开源可观测性工具;自动化故障检测和修复
影响范围
AIOps领域开源工具进一步丰富;Agent在运维场景的落地加速;软件自愈从概念走向实践
💡 卫心研科技解读:superlog代表了AIOps的新方向:不只是监控和告警,而是用Agent自动修复问题。这对运维团队来说是质的飞跃——从人值班变成Agent值班。结合今天信通院发布的AISHPerf评测基准,AI运维正在从能用走向标准化。

15. TianhangZhuzth/Fundamental-Ava:构建自主协作的数字人类Agent

Fundamental-Ava数字人类自主Agent社交智能开源 | 发布方:GitHub

Fundamental-Ava项目旨在构建自主、协作、社交智能的数字人类Agent。项目在GitHub上获得585星标,探索Agent在社交和协作场景的能力边界。

维度
详情
技术亮点
数字人类Agent的自主性、协作性和社交智能;探索Agent能力边界
影响范围
Agent从工具走向数字人类;社交智能成为Agent新能力维度;数字人领域开源探索
💡 卫心研科技解读:Fundamental-Ava的定位很有前瞻性:Agent不应该只是执行任务的工具,而应该具备社交智能,能与人和其他Agent自然协作。这对做Agent产品的团队来说是一个长期方向:把Agent设计成有社交能力的数字人类,而不只是API调用器。

四、AI工具与技巧

16. Claude Code已贡献GitHub上4%的公开commit

Claude CodeGitHubAI编程市场数据Anthropic | 发布方:量子位

Claude Code团队负责人Boris Cherny透露,Claude Code已贡献GitHub上4%的公开commit,年化收入突破25亿美元。这个数据说明AI编程工具已经从尝鲜阶段进入规模化采用阶段。

维度
详情
技术亮点
GitHub上4%的公开commit由Claude Code贡献;年化收入突破25亿美元;AI编程工具规模化采用
影响范围
AI编程工具市场格局确立;Claude Code成为事实标准之一;AI辅助编程从可选变为标配
💡 卫心研科技解读:4%的GitHub commit是一个惊人的数字——这意味着每25个公开commit中就有1个是AI生成的。AI编程已经不是边缘工具,而是主流生产力。对开发者来说,学会与AI协作编程不再是加分项,而是必备技能。

17. Claude Code被发现用隐写术标记请求

Claude Code隐写术安全隐私HN热帖 | 发布方:Hacker News

有研究者发现Claude Code在处理请求时使用隐写术(steganography)标记请求。这个发现在Hacker News上获得1187 points的高关注,引发关于AI透明度和隐私的广泛讨论。

维度
详情
技术亮点
Claude Code使用隐写术标记请求;Hacker News获得1187 points高关注;引发AI透明度讨论
影响范围
AI工具的透明度和隐私问题受到关注;用户对AI工具的信任度可能受影响;AI厂商需要更透明的标记机制
💡 卫心研科技解读:这个发现引发的讨论说明用户对AI工具的信任非常敏感。隐写术标记可能是出于安全或追溯目的,但如果用户不知情,就会感到被欺骗。对做AI工具的团队来说,这是一个重要教训:任何追踪或标记机制都应该透明告知用户。

18. Claude Sonnet 5发布

Claude Sonnet 5Anthropic新模型AI编程 | 发布方:Anthropic/Hacker News

Anthropic发布Claude Sonnet 5模型,在Hacker News上获得735 points关注。新模型在编程和推理能力上有所提升,是Claude系列的最新迭代。

维度
详情
技术亮点
Claude Sonnet 5发布;Hacker News获得735 points关注;编程和推理能力提升
影响范围
Claude模型系列持续迭代;AI编程工具底层模型升级;Anthropic在AI编程领域的竞争力增强
💡 卫心研科技解读:Claude Sonnet 5的发布说明Anthropic在持续优化编程场景的模型能力。对使用Claude Code的开发者来说,底层模型的升级会直接带来编程体验的提升。这也预示着AI编程工具的竞争会越来越激烈。

19. Windows Copilot被逆向为OpenAI兼容API

Windows Copilot逆向工程API开源Windows | 发布方:GitHub

有人将Windows Copilot逆向为OpenAI兼容API,项目在GitHub上获得974星标。这使得开发者可以在任何应用中调用Windows Copilot的能力,而不需要通过官方渠道。

维度
详情
技术亮点
Windows Copilot逆向为OpenAI兼容API;GitHub获得974星标;绕过官方渠道调用Copilot能力
影响范围
Windows Copilot能力被更广泛地集成;微软可能面临API滥用风险;开发者对AI能力的开放性需求强烈
💡 卫心研科技解读:这个项目的流行说明开发者对AI能力的开放性有强烈需求。当官方API不够灵活或有使用限制时,开发者会自己动手逆向。这也提醒AI厂商:提供开放、灵活的API是防止逆向工程的最好方式。

20. Claude Science:Anthropic推出的科学推理产品

Claude Science科学推理AnthropicAI for Science | 发布方:Anthropic/Hacker News

Anthropic推出Claude Science产品,专注于科学推理场景。在Hacker News上获得294 points关注,显示AI在科学领域的应用正在加速。

维度
详情
技术亮点
Claude Science科学推理产品;Hacker News获得294 points关注;AI在科学领域的应用加速
影响范围
AI for Science领域新玩家;科学推理能力产品化;Anthropic在垂直场景的布局
💡 卫心研科技解读:Claude Science的推出说明Anthropic正在从通用AI向垂直场景扩展。科学推理是一个高价值场景,需要模型具备深度理解和逻辑推理能力。这对做垂直AI产品的团队来说是一个信号:通用能力之上,垂直场景的专业化是差异化竞争的关键。

21. TestSprite:AI驱动的自动化测试CLI工具

TestSprite自动化测试AI测试CLI开源 | 发布方:GitHub

TestSprite是AI驱动的自动化测试CLI工具,项目在GitHub上获得1399星标。工具利用AI能力自动生成和执行测试用例,降低手动编写测试的工作量。支持多种编程语言和测试框架,可以集成到CI/CD流程中。

维度
详情
技术亮点
AI驱动的测试用例生成;CLI工具易于集成;支持多语言多框架;GitHub星标快速增长
影响范围
AI测试工具链进一步完善;自动化测试门槛降低;测试工程师角色可能被重新定义
💡 卫心研科技解读:TestSprite的出现说明AI正在渗透到软件开发的全流程,不只是写代码,测试也可以被AI自动化。对开发团队来说,AI测试工具可以大幅提升测试覆盖率,同时减少手动编写测试用例的时间。这是AI辅助编程的自然延伸。

五、科技最新动态

22. 跨维智能完成B轮融资10亿元,估值超百亿即将IPO

跨维智能具身智能融资IPO物理AI | 发布方:量子位

物理AI与具身智能企业跨维智能完成B轮融资10亿元人民币,投后估值超百亿,即将IPO。投资方包括深创投、前海母基金、蓝思科技、工银资本等国家级基金和产业资本。跨维智能自研的DexWorldModel登顶全球具身世界模型权威评测WorldArena榜首,已落地50+应用场景、1500余个具身模型,实现超亿级营收。

维度
详情
技术亮点
DexWorldModel具身世界模型登顶WorldArena榜首;世界模型+物理仿真+真机落地技术路径;Physical Token经济学理念
影响范围
具身智能赛道头部企业百亿估值确立标杆,蓝思科技产业协同将加速物理AI在实体制造业规模化商用
💡 卫心研科技解读:跨维智能的百亿估值和即将IPO,标志着具身智能赛道从概念验证进入资本化阶段。DexWorldModel登顶WorldArena说明世界模型路线正在被市场认可。对做具身智能的团队来说,现在是融资和商业化的最佳窗口期。

23. 乐动机器人登陆港交所,打造物理AI核心基础设施

乐动机器人港股上市物理AI空间感知机器人 | 发布方:量子位

乐动机器人近期登陆港交所主板,过去十年押注机器人空间感知技术,从扫地机器人到人形机器人持续布局。公司自研LD-SenseWorld灵境物理空间交互大模型,聚焦物理空间智能。2025年DTOF激光雷达出货超400万台,搭载视觉感知技术的设备量突破2000万台,形成硬件采集数据-数据训练模型-模型反向定义硬件的数据飞轮。

维度
详情
技术亮点
LD-SenseWorld空间交互大模型;物理AI三层核心架构;从传感器公司向感知基础设施平台转型
影响范围
为物理AI时代提供底层感知基础设施,到2030年全球智能割草机器人市场预计62.5-100亿美元
💡 卫心研科技解读:乐动机器人的港股上市说明物理AI基础设施已经进入资本市场认可阶段。从扫地机器人积累的空间感知数据,正在成为训练更高级机器人策略的基础。数据飞轮的价值在这个案例中体现得淋漓尽致。

24. 华尔街把美光当成「下一个英伟达」,市值一度超过特斯拉Meta

美光存储芯片AI基建HBM半导体 | 发布方:量子位

美光6月25日股价盘中大涨18.4%,市值一度摸到1.398万亿美元,历史上首次反超Meta和特斯拉。FY2026 Q3营收414.6亿美元同比暴涨346%,净利润282.4亿美元是去年同期15倍,毛利率冲到85%。AI数据中心建设推动内存需求暴涨,2026年Q1传统DRAM合约价环比上涨90%-95%创历史记录。

维度
详情
技术亮点
HBM4高带宽内存单季收入超10亿美元;照付不议长期合同锁定收入;内存从周期品向AI基础设施转型
影响范围
AI时代硬件投资逻辑从GPU扩展到内存等数据流动瓶颈环节,存储产业链全面受益
💡 卫心研科技解读:美光市值超过Meta和特斯拉,是AI基础设施价值重估的标志性事件。当算力成为稀缺资源时,不只是GPU,内存、网络、存储等所有数据流动环节都会受益。对投资者来说,AI基建的投资逻辑正在从GPU扩展到整个数据流水线。

25. 中国信通院发布AI Infra运维领域首个评测基准

AI Infra运维智能体评测基准国产芯片中国信通院 | 发布方:量子位

中国信通院正式发布AISHPerf人工智能软硬件基准体系3.0版本,包含两项核心评测基准:智算运维智能体评测基准和算子生成智能体评测基准。运维智能体评测基准依托近百亿条真实运维数据构建,提炼出103条高保真评测用例,覆盖5大技术栈、44种问题现象、22个细分故障领域、6种芯片(含5种国产芯片)。

维度
详情
技术亮点
首个面向AI Infra的运维智能体评测基准;覆盖5种国产芯片集群运维场景;103条基于近百亿条真实数据的评测用例
影响范围
填补国产智算运维智能体评测标准空白,推动AI基础设施向自主自治的Token工厂升级
💡 卫心研科技解读:AISHPerf的发布标志着国产AI基础设施运维进入标准化阶段。覆盖5种国产芯片说明国产算力生态正在快速成型。对做AI运维的团队来说,这是一个明确的能力对标目标——103条评测用例就是运维Agent需要达到的最低标准。

26. 大模型可解释性的「唯一机制」可能从一开始就不存在

可解释性ICML 2026电路发现sheafAI安全 | 发布方:机器之心

ICML 2026接收论文推翻了机制可解释性领域长期默认的功能各向异性假说:同一任务可以由多条结构几乎完全不重叠的电路独立完成。在IOI任务上找到两条sheaf,均达100%准确率,但交并比仅4.1%。提出OASR方法,20条sheaf的全局IoU低至0.15%。

维度
详情
技术亮点
推翻功能各向异性假说;同一任务存在多条等价但结构不同的电路;OASR方法系统性证明
影响范围
大模型可解释性研究的基础性范式转变,影响对模型内部机制的理解方式,以及基于电路发现的安全审计和对齐研究
💡 卫心研科技解读:这篇论文对AI安全领域有深远影响:如果同一任务可以由多条完全不同的电路完成,那么基于电路发现的安全审计就可能漏掉其他实现路径。这对AI对齐研究提出了新挑战:不能只找到一条安全的电路就认为模型是安全的。

27. 两位95后博士盯上人类闭环数据,发布LoopWM世界模型

LoopWM世界模型闭环数据具身智能95后创业 | 发布方:机器之心

脸谱心智由95后博士陆弘远、韦怡然创立,发布世界首个基于loop transformer的世界模型LoopWM。提出Ego-NeuroLoop数据范式,同步采集第一视角视频、眼动、EEG脑电、sEMG肌电四模态闭环数据,记录人类操作的完整闭环过程。NeuroMatrix数据采集装置将采集成本从数十万推向数千元级。

维度
详情
技术亮点
世界首个基于loop transformer的世界模型;四模态闭环数据采集;NeuroMatrix将采集成本降至数千元级
影响范围
具身智能和机器人领域,为世界模型训练提供更高质量的人类闭环操作数据,有望突破真机数据采集的瓶颈
💡 卫心研科技解读:LoopWM的核心创新不只是模型架构,更是数据范式的升级:从单一视角视频升级到包含神经信号的闭环数据。这说明具身智能的竞争正在从模型层下沉到数据层——谁能获取更高质量的人类操作数据,谁就能训练出更好的世界模型。

本期总结

📊 本期统计:共27条情报 | 最新模型动态 4条 | Agent架构与范式 4条 | 开源生态 6条 | AI工具与技巧 7条 | 科技最新动态 6条

🔍 数据来源:OpenAI、Anthropic、Google、IBM、Runway、Perplexity、GitHub、Hugging Face、TechCrunch、MarkTechPost、IT之家、Ars Technica、Scroll Prize 等公开信息源。

⚠️ 声明:本情报仅供参考,不构成投资建议。内容来源于公开信息,卫心研科技不对信息准确性和完整性做出保证。