夜雨聆风学习资料网

ARTICLE · 1126711

AI资讯速览(10.05)

AI资讯速览(10.05)
国内发展洞察

彭博行业研究:中美模型基准得分差距缩至3%,变现仍承压

彭博行业研究10月5日发布中国AI产业研究报告,称头部中国模型与美国模型的基准得分差距已缩至约3%,低于5月的约9%。报告引用LiveBench测试,DeepSeek模型得分81.1,Anthropic领先模型为83.4;这是特定基准比较。分析师Robert Lea同时指出,低毛利Token供应及价格竞争使变现承压,预计中国AI行业可能在2030年前难以盈利;该时间为研究预测。

2026-10-05 · 彭博社

PPIO披露68万注册开发者,日均Token调用量达2.2万亿

据科创板日报10月4日报道,PPIO近日披露,其全球注册开发者已超过68万,日均Token调用量达到2.2万亿。Token是模型处理文本等内容的计量单位,调用量反映推理工作负载。该公司AI产品专家谢晋指出,在线推理服务还包含算力、推理优化、稳定性保障和合规架构,模型下载量与调用量不能直接等同于收入。

2026-10-04 · 科创板日报

中国科学技术大学研究长程智能体,历史安全约束可能被遗漏

中国科学技术大学研究团队10月5日公开GHOST研究:用户没有恶意、原安全要求仍有效时,智能体可能完成新任务却违反此前约束。研究用103个可执行场景、每场景五次重复评估七个模型,GPT-5.5的严格GHOST发生率为11.5%。提出的STAR-Guard先恢复适用约束,再审查即将执行的操作;GPT-5.5在该组测试中未再观察到此类事件,其他模型仍有残余失败。

2026-10-05 · arXiv · 中国科学技术大学

上海交通大学提出文本为主的多模态训练,纯文本路径少用56.6%算力

上海交通大学研究团队10月5日公开多模态模型训练研究,先用文本强化推理,再以少量原生音视频数据修复感知能力。在Qwen2.5-Omni-7B实验中,纯文本路径的九项推理得分几何平均提升25.83%,较完整音视频训练少用56.6%的GPU小时(显卡数量乘训练时长),但感知得分有所下降。追加精简音视频训练后,感知平均分高于基础模型,保留了93.5%的原推理增益;并非所有能力无损。

2026-10-05 · arXiv

东南大学与华为提出DepGPO,让终端智能体训练奖励追到有效操作

东南大学与华为诺亚方舟实验室研究团队10月5日公开DepGPO方法,通过追踪终端命令的读写依赖,把训练奖励分配给确实影响任务验收的操作及其支持步骤。在两个千问模型、两套训练数据和Terminal-Bench两个版本的八种设置中,任务一次成功率较GRPO基线提升4.34至14.53个百分点。研究采用受控训练与基准测试,尚未证明对任意工具环境均有效。

2026-10-05 · arXiv

广州南站披露国庆AI客流预测应用,智慧调度支撑高密度开行

据央视网10月4日报道,广州南站近日在国庆客流保障中运用智慧调度平台和AI客流预测,支持动车组高密度公交化开行。报道指出,该站最短接、发车间隔为40秒,可满足单日到发旅客100万人次的运力需求。同一报道还介绍,全国交通部门打通交警、运营和导航数据,提前2至4小时预测高速公路流量峰值,联动实施客货分流和应急车道开放。

2026-10-04 · 央视网

前沿趋势观察

白宫宣布17国支持《京都愿景》,扩大AI科研工具与算力获取

白宫10月4日宣布,美国、日本、英国、德国、新加坡等17国支持《京都愿景》,推动AI加速科学研究。声明提出扩大研究人员获取AI工具、数据集、计算资源和实验设施的机会,并支持将实验、分析和假设修订连接起来的自动化研究。各方还提出结合长期资助、快速拨款和奖励机制,培养青年科研人员;声明未公布统一拨款金额或具有约束力的执行时间表。

2026-10-04 · 白宫

特朗普宣布组建超级智能工作组,拟协调AI企业与公共利益机构

特朗普10月4日在社交媒体宣布组建“超级智能”工作组,并公布领导团队。新华社报道,该工作组将协调联邦政府与消费者、非政府组织、宗教团体、关键基础设施运营商和AI企业等方面的工作,向总统及白宫幕僚长报告。领导成员包括国家情报总监杰伊·克莱顿、联邦贸易委员会主席安德鲁·弗格森等;公告尚未披露具体监管措施。

2026-10-04 · 新华社

Reflection据报筹备开放权重模型,拟支持企业自建AI系统

据Axios10月4日报道,Reflection近日向潜在合作方介绍首个开放权重模型及企业自建AI系统的方案。企业可结合自有数据、模型与算力进行定制。该模型尚待发布,报道未披露确切上线日期、参数规模或测试成绩;公司发言人拒绝置评。

2026-10-04 · Axios

Chick-fil-A首席执行官明确不采用AI语音点餐,保留人工接待

据CNBC10月4日报道,Chick-fil-A首席执行官Andrew Cathy近日表示,旗下餐厅不会在免下车点餐通道采用AI语音下单,希望保留人与人之间的接待。公司同时探索在后台使用AI,并未放弃自动化技术。这家约有3000家门店的连锁企业,把前台服务与后台技术应用分开;采访未披露后台AI的具体产品、部署数量或效果数据。

2026-10-04 · CNBC

麻省理工学院审计AI裁判,同组工作输出合格率判定相差近95个百分点

麻省理工学院研究团队10月5日公开O*NET-Bench审计,使用既有45796份美国劳动者评价,检验六类模型的33种AI裁判配置。在4501份测试评价对应的同组工作输出上,各配置判为合格的比例从3.0%到97.9%,劳动者评价为61.1%。能较好排列回答优劣,并不意味着能准确估计职业任务完成水平;这些评价也不代表全体职业人口或客观无误的标准。

2026-10-05 · arXiv

杜克大学测量逐词元计算需求,最昂贵10%占约64%至80%估算算力

杜克大学等机构研究团队10月5日公开逐词元计算需求研究,词元是模型处理文本的计量单位。研究比较三类共15个模型。在数学与代码基准的已验证正确文本上,最昂贵的10%词元约占估算计算量的64%至80%。研究还发现,0.5B小模型可在给定正确前文时复现约92%至95%的参考词元,但持续交由小模型生成会降低答题正确率。这揭示按需分配算力的空间,实际调度仍需解决提前识别难词元的问题。

2026-10-05 · arXiv

斯坦福大学提出多方偏好训练,让模型减少迎合用户

斯坦福大学等机构研究团队10月5日公开PlurPO训练方法,让模型模拟用户及其他受影响者,偏好各方均可接受的回答。论文在四组数据、四类模型中测试,称对有害行动的附和率平均降低89%;一般建议中,模型附和率与人类回答的差距从17.8%缩至8.0%。训练主要使用模型自生成反馈,指标针对指定测试集,尚未证明真实咨询中的社会与心理收益。

2026-10-05 · arXiv

明尼苏达大学测试临床模型,沿用先前判断更常使风险预测变差

明尼苏达大学研究团队10月5日公开临床模型评估,基于2000名重症患者的6580份连续记录比较独立判断与沿用模型上一轮判断。在主要Qwen3-8B实验中,后续预测误差增加的比例为46.20%,减少为30.28%。固定当前临床证据、仅把提供的先前风险由10%改至90%,新估计相差约26.2个百分点。研究属于回顾性与受控测试,未开展真实诊疗部署验证。

2026-10-05 · arXiv

佐治亚大学等提出BitNest,共享模型权重实现解码提速与显存节省

佐治亚大学等机构研究团队10月5日公开BitNest,把低精度的预测草稿嵌入高精度模型权重,由后者批量核验候选输出,减少另存草稿模型的显存开销。在RTX A6000上的四个7B至8B模型、六类负载中,解码速度为同引擎16位基线的1.48至1.61倍。测试质量接近基线但部分指标下降,如Qwen2的数学题准确率由79.4%降至77.6%;速度增益不等于能力完全无损。

2026-10-05 · arXiv

南加州大学等用程序校验自生成数据,四轮训练提升图表生成得分

南加州大学等机构研究团队10月5日公开多模态模型自改进实验,让模型识别自己生成图表中的错误,再编写程序构造经执行校验的训练样本。基于BAGEL-7B-MoT的四轮训练后,在BasicChartBench基础级测试中得分从45.7%升至60.2%,同预算沿用原数据训练仅达46.3%。更难的现有图表基准改善有限,部分通用理解指标下降;结果尚不能推广为模型全面自我升级。

2026-10-05 · arXiv

融资事件追踪

科创板日报周报追踪机器人与脑机接口企业,拟募资合计50.03亿元

科创板日报10月4日发布9月28日至10月4日IPO周报,其中机器人企业云深处与脑机接口企业博睿康的拟募资额分别为25.03亿元和25亿元,合计50.03亿元。云深处本轮材料更新日期为9月28日,博睿康问询回复为9月29日;后者将研发投入拟使用募资额从15.4亿元增至17.76亿元。两家公司仍处上市审核阶段,合计金额为拟募资目标。

2026-10-04 · 科创板日报

科创板日报访谈产业出资人,AI基金募资更看重退出回报与项目份额

据科创板日报10月4日报道,科创板日报近日采访产业出资人及基金从业者发现,部分传统产业资本增配AI和半导体基金,同时更关注基金实际退出项目与现金回报。受访者表示,募资除了历史业绩,还需解释能获得哪些项目及投资份额。一些产业出资人会具体追问前几期基金哪些项目已退出、多少收益已实际分配,已落袋回报在新出资决策中占据较高权重。

2026-10-04 · 科创板日报

彭博社访谈投行,部分AI企业香港再融资间隔缩至约三个月

据彭博社10月4日报道,彭博社近日采访香港投行人士发现,部分AI企业在上市锁定期结束后更快返回资本市场。高盛亚洲(日本除外)股权资本市场负责人James Wang表示,过去企业融资后可能等待一至两年,如今有些约三个月便再次融资。报道列举IPO、配售和可转债等方式,并指出近期交易表现与债券收益率上升,使投资者更谨慎地选择项目。

2026-10-04 · 彭博社

财联社周报追踪港股智算与机器人企业,三家公司推进上市程序

财联社10月4日发布9月28日至10月4日港股IPO周报,其中九章云极、一微科技、本末科技分别处于递表、通过聆讯和挂牌阶段。九章云极为模型训练与推理提供智算服务,一微科技提供智能移动机器人方案,本末科技从事直驱机器人业务。三家公司对应动作分别发生于9月29日、9月30日、9月29日;统计仅涵盖该周报中的相关企业子集,并非港股全市场AI融资总量。

2026-10-04 · 财联社

Value Add Pulse观察近两周AI交易,四轮股权融资合计19.5亿美元

Value Add Pulse于10月4日发布近两周AI相关资本交易观察,列出Instinct、Island、Cyera和Supabase四轮融资,金额分别为10亿、4亿、4亿和1.5亿美元,合计19.5亿美元。同组还列入AMD以82亿美元全股票收购World Labs的交易,该金额未计入股权融资合计。统计覆盖文章选取的五笔交易,涉及智能体、安全和数据基础设施,并非同期全市场AI融资总额。

2026-10-04 · Value Add Pulse

极客资讯速递

PromptArmor披露Genie恶意Skill风险,四类控制未阻止钓鱼与数据外泄

PromptArmor10月5日公开对Databricks Genie Code的安全测试:恶意Skill(可装载的任务能力包)可引导智能体查询数据,再把记录嵌入网页展示内容,由用户浏览器发起外部请求。测试发现,目录管理、提示词约束、计算环境出站限制与展示沙箱四类控制未阻止这条路径,也可被用于伪造登录页面。Databricks回应,安装不安全的Skill由用户负责;报告未披露真实受害客户。

2026-10-05 · PromptArmor

Quickchat AI负责人用Claude Code复盘2000局棋谱,五次校验失败后修订

Quickchat AI首席执行官Piotr Grudzień10月4日公开一项实验,让Claude Code调用Stockfish 19棋力引擎,分析自己的2000局快棋记录。流程在双核、4GB内存服务器上用时4小时13分钟,整理出九个反复出错的局面和11页报告。发布前的规则与引擎校验五次失败,随后修正棋步及分析;作者还人工检查了文字解释,未提供棋力提升的后续实测。

2026-10-04 · Quickchat AI

Strata发布并发推理实测,四请求缩短排队但总解码速度下降11%

Strata10月4日发布v0.1.39,并公布本地模型并发推理实验。在RTX 5070及指定量化配置下,同时处理四个请求,让最后一个请求开始输出的等待从11.2秒降至1.8秒,但总体解码速度由每秒70.7个词元降至63.1个,下降约11%。并发选项需要额外缓存,单请求也有开销;发布说明同时提示,长提示词测试并未获得普遍提速。

2026-10-04 · Strata作者

SCM作者展示本地照片与视频搜索,回应OCR速度与跨平台取舍

SCM作者10月4日在Hacker News展示本地媒体搜索工具,并回应识别速度质疑。项目结合图像语义模型、文字识别和语音转录,支持搜索照片内容、视频场景及对白;视频采用场景抽样,处理在模型下载后于本机进行。针对Tesseract文字识别较慢的反馈,作者解释首版优先选择跨平台方案,正探索苹果专用实现,尚未给出大型视频库的完整耗时测试。

2026-10-04 · SCM作者

RemoveMacAI引发安装信任争议,社区指出构建证明未覆盖可变脚本

RemoveMacAI10月5日在Hacker News引发安装信任讨论。有开发者指出,项目提供的签名构建证明能覆盖发布包,却未覆盖安装过程中从主分支读取的可变脚本,因此不能据此保证整条安装路径。项目说明,其通过配置描述文件限制Apple Intelligence及模型下载,撤销配置可恢复,且无需关闭系统完整性保护。社区讨论尚不能替代对工具的完整独立安全审计。

2026-10-05 · RemoveMacAI社区

孙正义在京都谈AI下一阶段,预计明年走向机器人与物理世界

孙正义10月4日在京都科学技术与社会论坛期间表示,AI已从聊天走向浏览网页和编写代码,预计从明年开始进入帮助机器人及其他机器与物理世界交互的阶段。彭博社报道,他同时强调,能力快速增长使安全与国家间信任更加重要,需要协作控制强大AI被滥用的风险。这是孙正义对技术路径的判断,报道未给出对应产品的发布日期或实测能力。

2026-10-04 · 彭博社

奥尔特曼谈AI开放与风险:支持广泛使用,拒绝严重失控代价

据Business Insider与POLITICO记者10月5日公开的访谈报道,奥尔特曼近日表示,AI应继续向公众广泛开放,社会可能需要承担部分误用风险以获得技术收益。他认为,将强大AI集中交给少数实验室管理是不可接受的权衡,同时明确拒绝灾难性风险,包括人类对AI严重失去控制。报道指出,OpenAI近期也支持加强安全评估,双方分歧涉及开放与管控之间的取舍,并非是否需要安全措施。

2026-10-05 · Business Insider/POLITICO

本文基于Axios、Business Insider/POLITICO、CNBC、PromptArmor、Quickchat AI、RemoveMacAI社区、SCM作者、Strata作者、Value Add Pulse、arXiv、中国科学技术大学、央视网、彭博社、新华社、白宫、科创板日报、财联社等多方公开信息整理而成,仅作信息分享与观点交流,不代表任何机构立场;文中引用数据及案例均来自公开来源,相关版权归原作者和原发布机构所有。

相关学习资料