今日核心信号
科研 AI 的竞争重心正在从“会不会调用工具”转向“能否给出可复现、可审计、可评价的高质量判断”。
产品线竞争明显进入“智能体化 + 降成本 + 内建治理”阶段,教育与科研成为高密度落地赛道。
企业级落地开始从 PoC 转入组织改造,驻场工程、统一协作底座与高质量数据集正在成为真正的护城河。
监管侧开始把焦点从通用 AI 风险转向代理型 AI 的系统性影响,金融与地方治理正在率先收紧规则与配套。
前沿研究 / 论文
01
🔥重要
OpenAI 发布 GeneBench-Pro,瞄准计算生物学“研究品味”评测
OpenAI 上线 GeneBench-Pro,尝试把 AI 是否真正具备科研判断力这件事做成可测量问题。该基准包含 129 道题、覆盖 10 个领域与 21 个子领域,题目采用合成构造并内置已知因果结构,用来检验模型能否在含糊数据里选择正确分析路径,而不只是背答案。官方称顶级模型 GPT-5.6 Sol 在高推理配置下通过率约 28.7%,开启 Pro 后为 31.5%,而单题人工成本常在 20 至 40 小时、价值可达数千美元。这意味着科研 AI 的竞争焦点正从“会不会调用工具”转向“是否具备接近研究者的判断质量”。
02
⚡值得关注
Anthropic 推出 Claude Science,把科研工具链做成可审计工作台
Anthropic 发布 Beta 版 Claude Science,试图把 PubMed、Jupyter、R、远程集群与专业数据库整合进一个统一研究工作台。官方称其可连接 60 多个科研数据库,覆盖基因组学、单细胞、蛋白质组学、结构生物学与化学信息学,并保留代码、环境、消息历史和自然语言说明,形成可审计记录。它还支持评论家式审核代理检查引用、数字与图表一致性,并能在本地或远程集群扩展到数百 GPU。对科研机构而言,真正有价值的不只是写代码,而是把实验、计算、审计和复现串成闭环,这类产品可能加速 AI 从助手走向研究基础设施。
03
⚡值得关注
华东师大“AI 一作”实验进入正式出版阶段,学术规则受压测试
华东师范大学披露,“AI 一作”社会实验将在 2026 年 8 月的核心期刊栏目正式刊出多篇由 AI 作为第一作者的论文。该实验自 2025 年 9 月启动,共收到 724 篇有效投稿,最终有 5 篇进入刊发名单,主题涉及教师轮岗政策、多轮对话分析、教育改革观点演化等。校方给出的数据是:AI 审稿与人类专家一致性达到 76%,在识别高质量与明显不合格论文时超过 80%。这条消息的重要性不在于“AI 替代学者”,而在于学术共同体开始把作者署名、责任归属、文献真实性和人机协作伦理放到真实出版流程中检验。
产品与发布动态
04
🔥重要
Claude Sonnet 5 发布,主打更强智能体能力与更低执行成本
Anthropic 正式发布 Claude Sonnet 5,将其定位为最具智能体特征的 Sonnet 版本:更擅长制定计划、调用浏览器与终端、在长链路任务中持续执行并自检结果。价格上,推广期输入 2 美元/百万 tokens、输出 10 美元/百万 tokens,9 月后恢复到 3 美元和 15 美元。官方同时强调它在拒绝恶意请求、抗提示词注入、减少幻觉与讨好式回答方面优于 Sonnet 4.6,并默认启用实时网络安全防护。对市场而言,这意味着大模型竞争正在从“谁更强”转成“谁能把代理执行能力做得足够稳且足够便宜”。
05
⚡值得关注
微软扩充教育 AI 工具,把课堂管理与 AI 治理一起产品化
微软在 Microsoft 365 Education 中新增 Unit Plans、Student AI Guidelines、Learning Zone、Learning Groups、Copilot Notebooks 与 Study and Learn 等工具,目标用户覆盖 K-12 到高等教育教师、学生和管理者。更值得关注的是它给出一组行业数据:92% 学生和 88% 教师已经用过 AI,但 77% 学生与 53% 教师尚未接受正式培训,41% 学生和 42% 教师把学术诚信列为主要担忧。也就是说,教育 AI 的下一步已不只是“能不能进课堂”,而是产品是否把规范、权限、培训和评估机制内建进去。微软把这一缺口直接做成产品能力,说明教育场景的竞争正在进入制度化落地阶段。
06
⚡值得关注
学而思发布培优 AI 家教与 T6 学习机,教育硬件继续押注闭环辅学
学而思在新一轮发布中推出“培优 AI 家教”、“国际学院”英语体系以及 T6 系列旗舰学习机,重点不再是单点问答,而是把诊断、规划、互动课堂和硬件体验打成一套闭环。官方信息显示,系统可通过拍照识别错题,结合历史数据与自然对话生成诊断报告和个性化学习路径,配合 AI 双师课堂、口语陪练、AI 笔记及升级后的“小思屏”形成持续陪学。硬件侧则引入与 TCL 华星联合设计的护眼屏和 15 英寸大屏版本。国内教育 AI 正在从“工具插件”转向“内容、模型、设备、服务一体化”竞争,家长付费决策会更看重长期效果与使用粘性。
行业应用落地
07
🔥重要
AWS 砸 10 亿美元组建嵌入式 AI 工程团队,企业落地进入“驻场交付”阶段
路透披露,AWS 将投入 10 亿美元成立新的前沿部署工程团队,把工程师直接嵌入客户现场,帮助企业更快把智能体 AI 写进真实工作流。报道提到,这些团队通常以 5 至 6 人小组形式驻场 45 天,首批客户包括 NBA 与理光,AWS 目标是为该部门配备数千名员工。更关键的是市场信号:2023 到 2025 年间,类似“forward-deployed engineer”岗位需求增长 42 倍。企业如今缺的不是模型体验,而是能跨业务、数据和系统边界把 AI 交付为生产能力的人,这说明大模型商业化正从 PoC 走向组织级改造。
08
⚡值得关注
南钢宣布全员上飞书并推进“AI 平权”,钢铁场景出现成体系复制路径
南京钢铁在数字化论坛上宣布全员使用飞书作为统一底座,并把“AI 平权”作为组织升级方向。公开材料显示,其已举办 AI 效率先锋大赛,吸引千余名员工参与、沉淀 200 余份业务创新案例,并开展超过 100 场 AI 培训。业务层面,炼铁环节的高炉专家计算模型把核算时间从 30 分钟压缩到 5 分钟,效率提升 85%;能源板块的数字化双重预防机制覆盖 6 个生产单位和 1220 余个风险点,隐患月度汇总效率提升 6 至 10 倍。传统制造业开始证明:AI 真正落地依赖统一平台、培训机制和一线人员自助搭建能力,而不是少数试点团队表演。
09
⚡值得关注
镇江推进高质量数据集建设,AI 应用开始从“做模型”转向“做底座”
江苏镇江披露其高质量数据集建设进展,给出的信号很明确:AI 应用竞争正在从单一模型能力,转向数据、算力和城市级数据空间的系统工程。当地今年计划建设不少于 10 个高质量数据集,已有国家级与省级试点项目落地,场景覆盖光伏能源能耗调控、港口智能装卸调度、医疗健康与民生服务。配套措施还包括智算中心布局,以及未来可能发放的“算力券”“数据券”“模型券”。这类地方实践说明,真正能形成规模化 ROI 的 AI 项目,越来越依赖可信数据供给与跨部门协同,而不是简单采购一个模型接口就结束。
政策与监管
10
🔥重要
英国央行首次明显转向:代理型 AI 可能需要专门金融监管
英国央行副行长 Sarah Breeden 表示,现有金融监管框架并非为自主型 AI 代理设计,单纯依赖“人类在回路中”已不现实。这番表态意味着监管口径出现明显变化:英国央行过去更强调现有规则足以覆盖 AI 风险,如今则开始讨论定制化规则、增强恢复机制,甚至在 AI 引发市场异常时启用类似熔断或关断开关。路透援引调查称,已有 52% 金融公司在使用代理型 AI。随着模型从辅助分析迈向自主执行,监管不再只关心模型偏见或隐私,而是担心同质化响应在压力环境下放大系统性波动,金融业很可能率先迎来针对智能体的硬约束。
11
🔥重要
国务院常务会议部署人工智能:加快超大规模智算集群与“人工智能+”
6 月 29 日召开的国务院常务会议听取人工智能发展情况汇报,并提出一组高度明确的政策方向:一是加快关键技术攻关和超大规模智算集群建设,二是强化高质量数据供给、人才和资金保障,三是深入实施“人工智能+”行动,推动智能产品与服务实现规模化商业应用,四是完善科技伦理、测试认证与分级分类安全监管体系,并加强国际治理合作。对产业界而言,这不是单点扶持,而是把算力、数据、应用、治理四条主线同时推进。接下来各地围绕智算中心、行业场景和测试认证体系的配套动作,大概率会进一步提速。
12
⚡值得关注
郑州发布“人工智能+”行动方案,地方政府开始把场景目标写成量化指标
郑州印发《深入实施“人工智能+”行动方案》,提出科技、产业、消费、民生、治理、开放六大行动,并同步建设算力、数据、模型、人才、技术创新和产业集聚六类支撑能力。方案把地方推进逻辑写得非常具体:到 2027 年全市人工智能产业规模突破 700 亿元,形成 50 个以上典型应用场景,覆盖智能车间、智能工厂、辅助驾驶、智慧商圈、医疗、教育、机器人与脑机接口等方向。相比笼统表态,这类量化目标意味着地方政府正把 AI 从“政策口号”推进为可考核的产业工程,未来比拼的关键将是场景转化率与公共要素供给效率。
夜雨聆风