乐于分享
好东西不私藏

2026.7.2-AI前沿技术资讯

2026.7.2-AI前沿技术资讯

一、AI行业动态

1.避开VLA路线之争,Om AI用「端侧原生」给出物理AI新解法

    2026年为物理AI元年,万亿市场格局未定、技术路线分化。行业普遍缺对物理空间的持续理解,Om AI联汇推出VLX系列模型,以端侧原生思路实现持续感知、精准定位与实时决策,已在多场景落地,主张物理AI智能应看决策时延而非参数量。
    来源:万亿市场格局未定:「端侧原生」,一家中国AI公司给物理AI抛了个新解法

2.英伟达开源机器人技能库ASPIRE

    ASPIRE摒弃传统梯度下降训练,通过“写代码-看轨迹-修错误-沉淀技能”的循环,构建可复用的机器人技能库,解决Code as Policy范式的失败不透明、无经验积累痛点。实验显示双臂交接任务成功率从20%升至92%,实现跨场景高效迁移,被称机器人持续学习新范式。
    来源:具身智能的Skill时刻!英伟达开源机器人技能库,Jim Fan:范式变了

3.AI 时代组织的竞争力,在你能不能持续把 (1-P) 压下去。

    AI时代组织核心竞争力在于压缩不可加速的瓶颈。Anthropic作为第三代代表,通过人-Agent并行网络、日级迭代和无Title机制,实现ARR 80倍增长。AI Native组织需重构思维、基础设施与角色,一人公司效率可达传统10-30倍,未来属于能极致压缩(1-P)的超级组织。

    来源:Anthropic及AI Native 组织最佳实践总结(附30页PPT+万字长文)

4.a16z 合伙人:大模型没有网络效应,最后只能像运营商赚个「通道费」

    a16z 合伙人Benedict Evans指出,大模型无网络效应,恐重蹈运营商覆辙仅赚“管道费”。当前编程是唯一跑通PMF的领域,Token定价将随效率提升商品化。他强调价值将向上游应用及行业转移,历史只能解释无法预测终局,真正变革需走出技术圈。
    来源:深度|对话a16z合伙人:大模型没有网络效应,最后只能像运营商赚个「通道费」

5.3Blue1Brown创始人:技术会淘汰,但信任不会

    Grant Sanderson指出,AI缺乏实体与心智模型,能力偏科,仅能生成无灵魂的机械内容。人类不可替代性在于人际信任与情感连接,未来教育、策展等依赖社会关系的角色仍稳固,数学研究也将转向定义创造与价值筛选,AI仅是加速探索的工具。
    来源:AGI时代最稳的饭碗是什么?3Blue1Brown创始人:技术会淘汰,但信任不会

6.Claude 官方推出来的一个新概念——Loop Engineering(循环工程)

    Claude官方提出Loop Engineering(循环工程),核心是设计系统让AI自主循环完成任务,替代人工反复提示。其分回合制、目标型、时间型、主动型四类循环,效果依赖配套系统设计,但需警惕Token成本爆炸,被视为将人力时间成本转为算力成本的新范式。
    来源:Claude Code创始人和龙虾之父都在用循环工程?Claude官方给疯狂烧Token的Loop工程下了一个定义

7.世界模型与元宇宙、数字孪生、物理AI等热门科技概念的关系

    元宇宙是“虚拟目的地”,世界模型是其低成本生成可交互内容的“发动机”;数字孪生核心是1:1镜像当下物理世界,世界模型额外具备“预测未来”的推演能力,是数字孪生的能力延伸;物理AI指能在物理世界行动的智能体(自动驾驶、机器人等),世界模型是其理解规律、预判结果的“认知核心”。

    来源:世界模型、元宇宙、数字孪生、物理AI:它们是一回事吗?

8.格隆:怎样不辜负这个千年不遇的时代

    格隆在演讲中指出,时代是决定人生的核心基础概率。他回顾各时代标志性投资标的物,强调当下硅基AI革命已至,是人类千年未有的机遇。建议普通人摒弃过度关注个人努力的误区,认清趋势,All in AI,锚定时代红利,避免在旧赛道留恋,方不负此时代。
    来源:格隆:怎样不辜负这个千年不遇的时代

9.明略科技推出的开源Agent协作平台Octo,编织起了Agent「互联网」

    明略科技推出的开源Agent协作平台Octo,定位是Private AI时代的人机协作基础设施,把分散在各工作流里的Bot聚合到同一空间,让Agent从个人工具变成可共享的企业数字资产。它用Matter沉淀任务决策过程,用Taste让Agent在实战中对齐团队偏好,提供六种协作拓扑匹配不同任务。
    来源:一个开源平台,编织起了Agent「互联网」

10.地瓜机器人推流式Uranus世界模型:逐帧控制重构仿真

    地瓜机器人推出流式Uranus世界模型,无需3D建模,凭图像、文本和动作逐帧生成逼真视频流,实现帧级闭环控制。它以数据驱动缩小仿真与现实差距,解决传统仿真穿模、数据贵等痛点,计划下半年开源,还将研发流式策略模型,目标打造具身智能“数字试炼场”。
    来源:独家对话|地瓜机器人让仿真进入「逐帧控制时代」,流式 Uranus重构训练闭环!

二、AI+钢铁动态

1.中天钢铁:中天钢铁启动热轧排产排程智能体项目,以线材厂5号线为落点,通过日计划排产智能体、运营分析智能体、知识工程模块协同,构建覆盖排产编制、评审、生产分析、成材率测算、知识复盘的全业务闭环,最终形成1个智能排产示范场景、1套排产智能体工程方法、1个企业级知识底座、1条持续优化路径。
    来源:中天钢铁热轧排产排程智能体项目正式启动
2.2026年AI-MES正从“记录型系统”升级为车间“自主大脑”,通过感知-认知-执行三层架构,实现排产、质量、设备等八大模块的联动闭环。企业应分步落地,以缩短排产时间、降低能耗等业务结果而非功能清单验收,推动生产从“事后记录”迈向“提前预判”。
    来源:2026 AI-MES 核心功能全解从记录系统到车间自主大脑,让车间运行进入“感知、判断、执行、优化”的闭环。
3.流程工业智能化落地难,根源非算法硬件不足,而是缺标准化EPCS-BIM时空数据底座。可用体系需“底层数据-中层决策-上层执行”三层闭环。2026-2028年将迎AI原生训练、机器人集群协同等趋势,企业转型应优先筑数据基座,而非盲目购终端。
    来源:行业洞察|流程工业AI与机器人来临,你的工程数据,正在变成最值钱的“生产资料”
4.优艾智合:发布工业具身智能新品,含工业大模型FabriX及轮式人形机器人“隙锋”,主张“一脑多态”路线,以分层架构破解工业场景泛化、稳定、效率的“不可能三角”,依托十年800余场景积累,目标三年赋能万厂,推动工业具身从单机向系统协同演进。
    来源:从优艾智合的系列新品,看懂工业具身智能的下半场
5.罗克韦尔自动化推出的工业AI执行架构FactoryTalk ResilientEdge,基于FactoryTalk Optix平台构建,与Plex MES系统深度集成,提供边缘侧低延迟执行能力与云端协同分析功能,支持AI驱动的自主化运营。
    来源:新品速览 | 罗克韦尔自动化推出 FactoryTalk ResilientEdge,助力实现自主化、可扩展的制造运营
6.中国移动联合中天钢铁发布全国首个“5G+AI+新型工业控制”工厂创新实践成果,携手信通院实现三大创新:10ms内确定性专网、云化PLC承载4000套设备、AI中台落地多个智能应用,为钢铁等行业数智化转型提供标杆。
    来源:中国移动联合中天钢铁发布首个“5G+AI+新型工业控制”工厂创新成果
7.用友:基于iuap数智底座推出钢铁行业“1+3+N”方案,针对行业重资产、数据散、转型难痛点,构建统一数据底座与指标体系,通过四层架构落地,覆盖全层级场景,分步实现数据治理与AI融合,助力企业降本增效、完成数据驱动智能运营升级。
    来源:基于iuap数智底座构建钢铁行业智能运营能力

三、最新学术论文

1.《Critique of Agent Model》

邢波指出当下多数"智能体"只是嵌在外部工作流里的agentic,并非真正有能动性的agentive——规则活在提示词里而非决策结构中。他提出GIC 架构,主张通过分层目标、活身份、世界模型推演与元认知让判断力内化,先在模拟学再进现实,使安全可审查。
    来源:Critique of Agent Model.pdf

2.T-Rex: Tactile-Reactive Dexterous Manipulation》

李飞飞、英伟达Jim Fan、徐丹飞等指出过往灵巧手硬加触觉反降性能,提出T-Rex触觉反应灵巧操作框架。其采用MoT架构给触觉单开通道,通过三阶段训练结合时序编码,真机测试12项任务平均成功率65%,较基线翻倍,证明触觉应成可学习的软件能力,为赛道指明新方向。

    来源:T-Rex- Tactile-Reactive Dexterous Manipulation.pdf

3.LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models》

     阿德莱德大学、澳大利亚国立大学等学者针对现有视频世界模型“视野外动态”缺失问题,提出LiveWorld,将世界演化与观察渲染解耦:用静态3D记忆存背景,虚拟监视器推演动态实体,渲染时融合状态生成视频。自建LiveBench基准测试显示,其重访时事件推进、身份与空间一致性显著优于现有模型,推动世界模型从生成视频向模拟持续运行世界迈进。

    来源:LiveWorld- Simulating Out-of-Sight Dynamics in Generative Video World Models.pdf

4.PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking》

    武汉大学等学者针对多轮视觉推理中目标定位失败导致轨迹冗余的问题,提出多轮视觉推理智能体PixelEyes,通过解耦推理与感知,结合掩码引导搜索与语义区域BFS机制,构建PixelEyes-6K数据集及Pinpoint-Bench基准。实验表明其在多项视觉搜索任务中准确率与效率均优于现有基线方法

    来源:PixelEyes- Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking.pdf

5.Typography-Based Monocular Distance Estimation for Advanced Driver-Assistance Systems》

    密歇根大学提出T-MDE单目测距方法,利用美国车牌标准化字符尺寸,融合字符高、笔画宽、间距、安装孔距及单目深度估计,结合方差加权与卡尔曼滤波,实现前车距离、接近速度与碰撞预警。实测2265帧数据检测率近99%,中位误差约0.13米,可作为低成本辅助感知方案。

    来源:Typography-Based Monocular Distance Estimation for Advanced Driver-Assistance Systems.pdf

6.LIST3R: Long-sequence Instance-aware 3D Reconstruction》

    北交大等提出LIST3R长序列实例感知三维重建框架,模仿人类以物体锚定空间记忆的机制。它将长视频切分为重叠子序列,构建局部实例库,通过跨序列匹配物体实例实现片段对齐与全局融合。实验表明其在相机轨迹精度与点云质量上均优于现有基线方法。

    来源:LIST3R- Long-sequence Instance-aware 3D Reconstruction.pdf

7.X-Mind: Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving》

    小鹏发布世界模型X-Mind,补全主动思考能力,通过RBD循环块扩散将去噪嵌入大模型层级,结合驾驶专属抽象草图压缩Token,仅增10%推理延迟即可实现12帧未来推演,打破“画面越真越好”误区,走出区别于特斯拉、小米的车载实时认知推理路线。

    来源:X-Mind- Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving.pdf