夜雨聆风学习资料网

ARTICLE · 1031679

AI前沿进展跟进-20260918

AI前沿进展跟进-20260918

今天最值得看的,不是谁又把模型做大了一圈,而是AI开始进入两种更深的循环:一边参与研发下一代AI、从真实实验中取得新数据;一边进入造船设计、影视制作、法律文书和购物推荐。能力越深入工作流程,成果归属、推荐是否可信、错误由谁把关,就越不能留到最后再谈。

今日Top 10速览

序号
事件
一句话影响
报道媒体
1
Claude参与下一代模型研发的比例上升
AI开始深度参与制造下一代AI,但并非独立研发
Reuters
2
Periodic Neon把材料实验接成学习循环
新模型能力可能来自不断产生真实数据的实验室
新智元
3
数学界讨论AI公司是否积压未公开证明
研究型AI的发表、署名和成果开放规则面临压力
新智元
4
WPS把船厂文档和专业规范接入Agent
企业AI的难点正从聊天能力转向理解业务上下文
智东西
5
新闻机构提交AI版权诉讼的新材料
“训练材料”与“替代原作品”的界线成为争点
Reuters
6
美国政府网站曾使用通义千问搜索工具
开源模型的实际部署与地缘政治立场出现碰撞
Reuters
7
两部长篇AI影片披露制作与回款情况
AI影视开始接受制作周期和商业收入的检验
36氪
8
美国法院继续出现AI编造材料
专业工作流不能把流畅输出当成事实核查
Reuters
9
智东西实测HiDream视频模型
视频生成开始比拼理解动作、声音与模糊创意
智东西
10
美国议员质疑购物AI的产地推荐
代人挑商品的AI需要说清推荐依据
Reuters

今日Top 10

1. 【报道:Reuters】Claude参与下一代模型研发的比例上升

AI正在成为AI研发团队的日常合作者,但还没有独立接管研发。 Anthropic于9月17日披露,按其采用的统计口径,Claude在公司约26%的AI研发工作中承担主导角色;超过90%的研究工作有人与AI协作。这比“工程师偶尔让模型写一段代码”深入得多。真正值得追问的是:模型提出的实验、修改和判断,由谁验证,又怎样进入下一代系统?

a)这里的“主导”不等于自主决定研究目标、独立批准实验并发布模型。Anthropic明确表示,在所统计的工作中,Claude没有完全脱离人类独立运作。公司称,这一比例从3月的约1%上升而来;统计口径本身仍需要随时间保持一致,数字才便于比较。

b)研发任务适合拆成许多可检查的小步骤:分析实验结果、修改代码、运行测试、比较不同方案。Anthropic称,其主要内部平台在8月同时有约3万个Agent进行研究和工程工作。可以把它理解为大量数字助手并行做实验,但研究目标和结果筛选仍由人负责。

c)公司还称,Agent的每项动作在执行前都会经过筛查,8月超过十亿次决策中,约每4.7万次有一次被拦下。这个比例描述的是内部拦截,并不能单独说明未拦下的动作都安全;判断效果还需知道规则是什么、误报和漏报有多少。

d)对普通用户,今天不会因此立刻出现一款“自行发明下一代模型”的产品。它影响的是模型更新背后的研发速度。如果实验提出、执行、复盘逐步连起来,版本改进可能加快;如果评价方法有偏差,错误也可能被更快地复制。

这项披露提供了观察“AI改进AI”的少见量尺。接下来比主导比例更重要的,是这些AI参与的实验有多少经独立验证后确实改善能力,以及人类研究员能否看清并纠正失败路径。

AI产业阶段判断

a)更接近第一阶段:AI基础设施成熟,因为它首先改变模型研发的能力供给方式。

b)它也触及第二阶段:Agent已进入真实研发工作流,而不只是提供建议。

c)AI Native信号是“执行实验—收到结果—提出下一轮改进”的闭环;目前尚不能称为无人研发组织。

继续阅读:Reuters:Anthropic披露Claude参与下一代模型研发。

2. 【报道:新智元】Periodic Neon把真实材料实验接成模型的学习循环

让AI研究材料,关键可能不是再喂它更多网页,而是让实验室不断给它新的、可测量的结果。 新智元9月17日报道Periodic Labs的Neon模型:团队把材料合成、仪器测量、图谱分析和下一轮实验连起来。AI不只回答“这是什么材料”,还尝试利用真实世界的反馈修正判断。这条路线的价值,比拿训练芯片数量与通用模型硬比更具体。

a)团队重点展示的任务是X射线衍射分析。仪器测出的图谱像材料的“指纹”;但实际样品常由多种物质混合,峰线相互重叠。研究人员必须从一张复杂图谱里推断究竟做出了什么,这直接关系下一轮要不要改变配方。

b)在Periodic自建的134道难题测试中,团队报告Neon成功率为55.3%。报道还列出它与其他前沿模型的成本和成绩比较。由于题目、可用工具和执行环境都由团队构建,这说明该系统在所设任务上有潜力,不能直接推出“全面超过”通用模型。

c)更值得看的是实验循环:模型提出候选材料与合成办法,设备实际制作和测量,再将结果送回系统。实验会产生网上找不到的新数据,错误猜测也可能成为有用反馈。与只在公开论文上训练相比,这是另一种能力增长来源。

d)真实实验并不便宜,也没有软件测试那样快速、明确的标准答案。设备故障、杂质和模糊图谱都可能误导系统。即使模型善于解读测量结果,也不等于已经独立发现具有商业价值的新材料。

如果这套流程能持续产出可复现的发现,未来的竞争单位可能从“一个科学大模型”变成“模型、仪器、实验设计和数据回流构成的整座实验室”。下一步应看外部研究团队能否复现,以及发现能否经后续实验证实。

AI产业阶段判断

a)同时连接第一阶段第二阶段:专门模型改善能力供给,实验Agent进入真实科研流程。

b)它改变的不只是调用模型的方法,而是取得训练和验证数据的方法。

c)AI Native信号较强:真实实验产生新反馈,再影响下一次实验;但闭环是否带来持续、有价值的发现仍待证明。

继续阅读:新智元:Neon模型与材料实验闭环。

3. 【报道:新智元】数学界讨论AI公司是否积压未公开证明

研究型AI越来越能处理难题,“答案何时公开、归谁署名”也开始变成现实争论。 新智元9月18日援引计算机科学家Scott Aaronson的文章及其他学者说法,讨论AI公司可能持有尚未发表的重要证明。其中“数百个证明”的数字,是数学家转述其获知的信息,不是已经公开清点、核验的事实。这一条值得关注的是学术规则受到的压力,不能把传闻写成已证实的突破。

a)数学研究通常靠及时公开论证,让同行检查、引用并继续推进。如果一个机构能并行运行许多研究Agent,却长期不说明已经得到哪些结果,外部研究者可能花数月重复工作;反过来,仓促公布未经充分审阅的证明,也会制造混乱。

b)这里至少有三件不同的事:模型生成了一份看似完整的证明;形式化工具检查了其中某种严格表达;数学界确认它解决了原来提出的问题。后两步也不能自动回答思路来自哪里、哪些人作出了关键贡献。

c)尤其要防止把相近问题混为一谈。Aaronson在原文中区分了相关流体方程的不同条件,并指出仍有未解决的情形。针对某一条件得到的论证,不等于所有对应的悬而未决问题均已解决。

d)目前公开材料不足以确认OpenAI确有“数百个”有效、未公开证明,也不足以据此推断其保留成果的具体动机。更有用的后续材料将是可阅读的完整证明、清楚的时间线、贡献说明及独立同行审查。

对科研助手产品而言,真正的新要求可能是成果可追溯:输入过哪些未发表材料、模型使用了哪些工具、谁检查了关键步骤。能力越强,这些记录越不能只留在机构内部。

AI产业阶段判断

a)更接近第一阶段的能力与规则建设:高难度研究能力的进步,迫使成果管理跟上。

b)它尚未证明某个完整研究Agent已经稳定解决开放问题,因此不能直接归为应用爆发。

c)AI Native信号在于并行研究可能改变学术发表节奏;是否形成可被信任的新研究组织方式,取决于公开与署名机制。

继续阅读:新智元:数学证明发表争议;Scott Aaronson:涉及相关问题及公开争论的原文。

4. 【报道:智东西】WPS把船厂文档和专业规范接入Agent

企业AI最难的一步,常常不是让模型会写字,而是让它知道“我们公司说的这个词究竟是什么意思”。 智东西对金山办公制造业案例的报道,展示了WPS Comate如何处理船厂文档、设计规范、业务数据和权限。对工程师来说,价值不在多一个聊天框,而在查到现行规范、看见出处,再把正确要求用进工作。

a)中船动力拥有近50万份研发制造文档,且资料分布在不同系统和网区。黄埔文冲的设计人员需要查询200余本技术规范。将这些材料直接塞进模型,既可能丢失版本、表格和图纸关系,也可能让员工看到本无权访问的信息。

b)WPS的方案先尽量保留文档的章节、图片和表格结构,再按含义组织供AI查找;业务数据则要事先定义指标和计算规则。比如“某部门靠谱的业绩是多少”,难点不在加法,而在先说明哪些订单应计入“靠谱”。

c)报道援引案例称,黄埔文冲单次规范查找时间缩短60%以上,专业软件操作指引复用率达到80%。这是受访企业与方案方提供的场景数据,不等于所有设计任务的效率都提高同一幅度。保留规范出处,仍是让工程师复核的必要一步。

d)这与通用办公助手的区别,在于把企业积累的资料、术语和审批限制变成可持续调用的工作上下文。模型可以回答问题,业务系统还要规定它能读什么、改什么,以及引用的是哪个版本。

制造业Agent能否长久有用,要看复杂图纸和规范更新后是否仍答得准确,以及出错时能否追到来源。企业多年积累的知识只有经过整理、授权和反馈,才可能成为AI的实际优势。

AI产业阶段判断

a)更接近第二阶段:AI应用爆发,因为AI已进入工程师查询和分析的真实工作流。

b)改变的是应用方式:从搜文档、问老师傅,转向带出处、按权限使用企业知识。

c)AI Native信号是把企业经验做成可反复调用的“专业能力”;要形成复利,还需证明工程师的纠错会改善下一次结果。

继续阅读:智东西:WPS如何让AI读懂制造业资料。

5. 【报道:Reuters】新闻机构提交AI版权诉讼的新材料

AI把新闻读进去,又可能把读者留在自己的界面里;这两件事正在同一场诉讼中相遇。 Reuters于9月17日报道,《纽约时报》等新闻机构提交新公开的诉讼材料,援引OpenAI和微软高管过去谈及AI产品可能替代新闻阅读的内部表述。新闻机构认为,这削弱了两家公司关于训练属于“合理使用”的抗辩;这仍是诉讼一方的论证,并非法院结论。

a)争议不只是“训练时有没有复制文章”。两家公司主张,模型将材料转化成新用途,并不直接取代新闻机构的作品;媒体方则强调,如果AI产品已经承接用户原本会去新闻网站完成的阅读与查询,经济影响不能被忽略。

b)新公开材料的变化,在于新闻机构试图用当事方自己对产品市场作用的描述,支持其竞争替代论点。内部表述怎样对应具体训练方式、具体输出和实际读者流失,仍需由诉讼程序审理,不能只靠一句引人注意的话决定。

c)对普通用户而言,AI摘要确实省时;对内容生产者而言,读者不再访问原站,可能影响订阅、广告和继续采编的资金来源。产品可以很方便,但信息最初由谁投入成本获得,也应进入商业计算。

d)这不是9月17日才开始的案件。当天的新进展是部分此前未公开的材料进入公众视野。也不能把所有出版商、所有训练用途和所有AI回答当作同一种法律事实。

未来应看法院如何区分训练、生成回答及市场替代影响。无论判决如何,AI搜索与研究助手若长期依赖高质量媒体内容,都需要更清楚地处理来源、引流和补偿关系。

AI产业阶段判断

a)更接近第三阶段:AI原生时代萌芽中的产业规则重排

b)它触及用户关系和产业结构:读者可能直接向AI获取答案,不再先进入内容网站。

c)新的内容入口已经出现,但能否建立让内容生产持续受益的商业闭环,仍是未解决的问题。

继续阅读:Reuters:版权诉讼中新公开的高管表述。

6. 【报道:Reuters】美国政府网站曾使用通义千问搜索工具

模型一旦开放下载,实际由谁部署、数据去了哪里,比模型出自哪个国家更能说明具体风险。 Reuters于9月17日报道,美国《联邦公报》网站曾提供基于阿里巴巴通义千问模型的搜索功能,之后将其撤下。事件引发争论,原因是美国联邦调查局此前曾指控阿里巴巴不当复制Anthropic技术;中方否认相关指控。搜索工具的使用,并不能证明该指控成立。

a)《联邦公报》提供公开的拟议规则等资料。报道所述工具用于帮助用户搜索公开评论,尚无材料表明它接触了敏感政府数据,也不清楚该功能最早何时上线。把它写成“政府机密已被传走”,没有依据。

b)通义千问有开放权重版本,开发者可以下载并在自己的环境运行。使用一种模型,不必然等于把每次用户查询送到模型开发者的服务器。实际部署方式和数据流向,是评估安全性的第一步。

c)政治争论的另一面是采购一致性:政府一边对中国模型提出强硬警告,旗下网站却出现了相关工具。对管理者来说,这提示AI组件可能经承包商、开源软件或二次集成进入产品;采购清单要能追到模型版本和运行位置。

d)报道援引的专家没有据现有事实判断存在即时国家安全风险。网站撤下工具,也不自动证明它曾造成危害。后续需要的是部署说明及安全审查结果,而不是只从国别标签推断技术事实。

此事对全球开源模型生态有现实意义:开放能力容易跨国进入产品,政治和采购规则却未必同步。未来企业与公共部门都更需要一张清楚的“AI组件清单”。

AI产业阶段判断

a)更接近第一阶段:调用与部署方式成熟后出现的治理问题

b)改变的是能力供给范围:开放模型可以被不同机构快速纳入已有网站。

c)它本身不是新AI入口;可追溯的模型来源、运行环境和数据边界,是更多入口获得信任的前提。

继续阅读:Reuters:《联邦公报》网站的通义千问搜索功能。

7. 【报道:36氪】两部长篇AI影片开始按制作与回款接受检验

AI影视能不能成为生意,终于有了比演示片更具体的账本线索。 36氪9月17日采访《灵魂摆渡·浮生梦》制作方:两部各超过60分钟的作品于8月22日在爱奇艺上线,制作方称项目不到四个月完成、团队不到40人,上线首周收回制作成本。影片不是昨天才发布;本期新增价值是制作周期、人员和收入被放在一起讨论。

a)制作方披露,两部影片上线三天的会员分账票房超过300万元,十天超过600万元。这是特定平台、特定分账口径下的项目数据;报道没有提供足够信息,让读者独立核算完整成本、营销投入及长期利润。

b)AI主要压缩了部分置景、转场和视效制作环节,而不是自动写完剧本、做完表演、完成审美判断。人物、场景等资产仍要先设计,后面也需要大量挑选和修改。将其理解为“十几个人坐在办公室按一下按钮拍完电影”,会低估实际劳动。

c)这组作品还借助已有影视IP、平台发行和固定观众。它们有利于项目被发现并获得收入,因此不能推断一部没有观众基础的原创AI电影也能一周回本。

d)真正改变的可能是资金周转:制作时间缩短后,团队可以更早上线、看观众反馈,再决定下一部作品怎么拍。但更快试错不保证故事更好看,持续订阅和观众评价仍是关键。

这一案例把讨论从“AI画面有没有穿帮”推进到“作品是否有人看、投入能否收回”。如果更多项目公开可比较的成本与收入,AI影视才会形成比宣传样片更可靠的商业判断。

AI产业阶段判断

a)更接近第二阶段:AI应用进入完整交付,并触及第三阶段的制作组织方式。

b)它改变的是影视生产周期和团队分工,而非单纯提高一段视频的生成速度。

c)AI Native信号在于更短的“创作—发行—观众反馈”循环;已有IP和平台优势使这一信号尚不能普遍化。

继续阅读:36氪:AI长篇影视的制作与商业账。

8. 【报道:Reuters】美国法院继续出现AI编造材料

法律文件里,一条不存在的证词比一段不漂亮的文字危险得多。 Reuters于9月17日梳理近期美国案件:有律师提交了虚构的警员证词,有法官命令援引虚构判例,还有律师因多份文件中的错误引证受罚。生成式AI进入法律工作多年后,问题仍在出现;这不是“AI写得不够像律师”,恰恰是它写得很像,因而更容易混过第一眼检查。

a)模型可以快速整理问题、提出检索方向和草拟文本,但它也可能生成格式正确、内容不存在的判例或引语。“幻觉”在这里就是系统给出看似有出处、实际查不到的内容。律师仍有责任核对提交给法院的材料。

b)Reuters援引一名研究人员持续整理的记录称,美国州和联邦法院至少已有1395起涉及AI错误的案例。这个数字是被发现并收录的案例数,不是所有法律文件的错误率,也不能证明每起案件造成相同后果。

c)事后罚款和警告已存在数年,错误仍在增加。原因可能不仅是模型能力不足,还包括交件压力、流程中缺少逐条核验,以及使用者把流畅的初稿误认成已经查过来源的最终文件。

d)更实用的产品改进是让每个关键引证都连向可打开的原始判决或卷宗;找不到来源就禁止进入终稿。模型负责起草,证据系统负责核验,签字的人负责最终判断。

这条新闻不是宣布法律AI不可用,而是给专业Agent划出边界:越接近正式提交、对外承诺和不可逆决定,越需要能够独立检查的依据。下一步应观察律所是否把这种核验做进流程,而不只是再发一次提醒邮件。

AI产业阶段判断

a)属于第二阶段的可靠性考验:AI已经进入真实专业流程。

b)改变应用方式的同时,错误也从内部草稿传到了正式文件。

c)AI Native机会不在“自动写更多文书”,而在起草、逐条引证核验和责任审阅形成可追溯闭环。

继续阅读:Reuters:AI错误持续进入美国法院文件。

9. 【报道:智东西】实测HiDream视频模型:能补足模糊创意,也仍会在复杂动作上出错

视频生成的竞争,正在从“画面够不够漂亮”,转向“是否理解人想拍什么、动作能不能接得上”。 智东西对智象HiDream-O1-Video进行了实际任务测试,包括日常叙事、说唱与复杂运动。模型本身于9月15日发布;本期关注的是媒体在覆盖期内给出的体验与分析,不把旧发布当成今天的新产品。

a)用户常只说“下班后路过一只狗”这样的模糊念头,却希望得到包含动作、镜头和情绪的片段。报道介绍,HiDream会先把需求拆成人物、动作、镜头、台词和声音安排,再生成画面。它相当于先拟一份简短分镜,而不只是逐字照画。

b)模型允许依内容安排约5至20秒的片段。固定时长容易让动作还没做完就突然结束;按事件节奏规划,可能让一个镜头更完整。但时长更灵活,不代表多镜头叙事和人物一致性问题已经解决。

c)智东西的几组实测提供了比厂商精选样片更具体的观察:简单叙事与部分声音画面配合较自然,复杂运动和细节仍可能不准。少量媒体测试不能算普遍成功率,排行榜名次也无法替代创作者自己的任务验收。

d)对广告和短片团队,重要指标应是“得到一条能用的镜头需要修改几次”,而非最好的一条能有多惊艳。如果模型更懂口语化需求,就能减少写冗长提示词的负担;如果运动仍常出错,后期挑选成本也会回来。

这项体验说明,视频模型开始争夺创作理解层。但从单个好镜头到整部作品,仍要解决角色连续、修改方便和成本可控。下一步值得看普通创作者连续制作多个镜头时的返工量。

AI产业阶段判断

a)更接近第一阶段向第二阶段过渡:基础视频能力改善,并开始服务具体制作任务。

b)它主要改变创作者表达需求和取得素材的方式,尚未独立承接整部作品的生产。

c)AI Native信号是“模糊想法直接变成可讨论的动态镜头”;稳定编辑与反馈复用仍处早期。

继续阅读:智东西:HiDream视频模型实测。

10. 【报道:Reuters】美国议员质疑购物AI的产地推荐

当购物助手开始替人筛商品,“没告诉你什么”可能和“推荐了什么”一样重要。 Reuters于9月17日报道,两名美国参议员要求监管机构调查亚马逊和沃尔玛的购物AI,援引研究质疑它们对“美国制造”商品信息的处理,以及是否提示可疑的产地标注。这里是议员提出的调查请求,不是监管机构已经认定平台故意压低某类商品曝光。

a)传统购物页让用户自己筛选、比较商品详情;AI助手则先替用户缩小选择。如果一个买家特别在意产地,助手是否展示该条件、怎样处理卖家标签,都会影响最终候选商品。

b)议员引用的研究认为,相关助手没有充分提供产地筛选或提醒可疑标注。亚马逊否认故意隐瞒产地信息,表示目前会引导询问者查看商品详情页以优先保证准确性。沃尔玛在Reuters发稿时未立即回应。

c)AI在回答中对商业动机的解释,不能直接当成平台真实决策理由。助手可能给出听起来合理却未经证实的说法;要判断是否系统性偏向,仍需看重复测试、商品数据库、排序规则和实际运营政策。

d)对消费者而言,购物Agent应能说明“按什么条件筛的、哪些信息无法核实、推荐是否受佣金或自营业务影响”。对平台而言,仅把错误商品标签归咎于卖家,未必能解决AI再次放大错误的问题。

这起争论预示,购物AI一旦从回答问题走向代人选择,推荐理由就会成为产品的一部分。下一步要看调查是否启动,以及平台能否提供可检查的产地信息与推荐规则。

AI产业阶段判断

a)更接近第三阶段的早期治理问题:AI可能成为购物决策的新入口。

b)它改变用户与商品平台的关系——先由助手筛选,用户才看到剩下的选项。

c)AI Native信号是代人比较商品;要形成可信闭环,还需要让购买、退货和用户纠错反馈改进推荐,而非只提高点击率。

继续阅读:Reuters:购物AI产地推荐引发调查呼吁。

AI产业趋势判断

如果三年后回看,今天值得记住的可能不是某一款模型的分数,而是AI开始同时进入“能力从哪里来”和“结果由谁负责”两个环节。第一阶段仍在成熟:Claude参与研发,Neon试图从真实实验获得新数据,视频模型学习把含糊需求变成可用镜头。第二阶段的考验更具体:船舶设计要读对规范,影视制作要算清成本,法律文书要查到真正存在的证据。第三阶段已有入口变化的苗头——新闻和商品可能先由AI筛选,用户才接触原始内容,但这也会改变流量、收入和选择权。今天尚不足以断言这些入口会由谁掌握,更不能因为一次实验或一个成功项目就宣称产业阶段已经完成切换。真正可能成为关键节点的,是可复用的真实反馈:实验结果能否改进下一轮研究,工程师纠错能否让Agent下次少犯错,用户能否知道AI为什么推荐某项内容,并在需要时把决定权拿回来。

AI Native机会扫描

a)从增强旧产品到重新定义产品:最强信号出现在科学工作。 Periodic不是给实验室加一个问答框,而是把提出假设、实际合成、测量和修正连成工作循环。若这套循环持续产生经过验证的新材料数据,产品的核心就不再只是模型接口,而是“会学习的实验流程”。影视案例则显示另一种可能:缩短从制作到观众反馈的周期。不过,一个依托成熟IP的回本项目,尚不能证明全行业都能照做。

b)新入口正在争夺“先替用户筛一遍”的位置。 新闻摘要、购物助手和企业知识Agent都可能站在原始信息与用户之间。入口价值来自节省查找时间,风险则是漏掉重要来源、隐藏筛选条件,或误读企业规范。未来值得观察的不是聊天入口多不多,而是用户能否看到依据、修改条件,并顺畅回到原始材料。

c)智能复利需要真实结果,不是积累对话量。 材料实验的测量结果、工程师核对规范后的纠错、创作者对镜头的修改,都可能成为下一轮改进信号;它们比“用户多聊了十次”更有价值。但数据能否合法复用、反馈能否准确归因、改进能否在陌生任务中保持有效,都尚未解决。

d)难复制的部分可能是工作现场,而非模型名称。 经授权的实验数据、带版本的企业规范、完整的制作与收入记录,往往不能靠调用同一基础模型立即获得。机会因此存在于懂任务、能取得可靠反馈、也肯把权限和责任设计清楚的产品团队;仅仅把旧软件菜单换成聊天框,还不够。

相关学习资料