夜雨聆风学习资料网

ARTICLE · 1121641

国庆用AI做攻略的,第一批已经被坑惨了

国庆用AI做攻略的,第一批已经被坑惨了
AI DAILY · 2026-10-04

国庆用AI做攻略的,第一批已经被坑惨了

AI玩得转 · 每日AI资讯简报
01 / 国内热点
国庆出游用AI做攻略,第一批人已经被坑惨了

国庆长假,越来越多人把做攻略这件事整个交给AI:豆包、DeepSeek这类通用大模型,加上携程、同程、飞猪的AI旅行助手。假期过半,百度热搜第5位的话题是——第一批人已经被坑惨了。

界面新闻采访了5位游客:有人按AI标注的“车程50分钟”去长白山度假村,司机实际开了1小时50分钟,到了才发现主街大量铺面挂着“即将开业”,晚上营业的餐厅只有两家;有人在泉州按AI安排的“簪花拍摄黄金时段”赶到蟳埔村,人山人海、拍照排长队,晚上叫不到车回不了酒店;还有游客凌晨摸黑爬太子尖等日出,AI把时间排得像火车班次——05:49,太阳在云缝里露了30秒,云海其实在下山半山腰。

更细节的翻车:让AI推荐订票平台,注册完发现票已售罄,携程上余票大量还更便宜;假期最后一天问AI“附近有什么营业的馆子”,它回答“今天9月4日”——那是做攻略那天的日期。

编辑点评:攻略让 AI 起草没问题,但营业时间、路况、放票规则,出发前最好自己核一遍。说实话我每次用 AI 做攻略都很成功,天气、自驾到达时间都很准,因为我是错峰出行。谁承想,架不住中国人口众多,十一到哪都是人山人海,高速堵车,景区限流呢…

02 / 模型评测
微软×Hugging Face出新基准:Agent说“做完了”,数据库不同意

微软和Hugging Face联合发布ThinkingBox基准:507个有状态商业工作流,覆盖零售、车险、旅行、银行、咨询,每个任务跑20遍。评测方式很特别——不看AI说了什么、调了什么工具,只查它在数据库里留下的最终状态。

经典案例:客户745美元的厨房电器在物流异常里卡了15天,AI Agent规规矩矩做了9次工具调用——查订单、查物流、查政策、开工单,然后关闭工单标记“已解决”,回复“还有什么可以帮您”。实际上,物流异常还挂着,客户的真实问题根本没解决。

数据更扎眼:12个模型、12万次有效试验,失败案例里67.24%表面一切正常(干净退出、调用了改状态的工具、没有任何报错),但可执行检查发现其中77.61%写错了字段值,43.30%产生了意外的副作用。

国产开源模型Kimi-K3覆盖面全场第一:93.89%的任务至少成功过一次,零售场景82.24%超过所有闭源模型;但507个任务只有68个能20次全对,占比13.41%。Claude Opus 5.5总榜第一(67.16%),可它和上一代相比总分只涨了0.66,20次全对的任务数一模一样——都是241个。

编辑点评:一次做对不代表次次做对。选模型干活,“20次全对”那一列比头条分数更值得看。

03 / AI安全
OpenAI安全员工辞职:写安全报告的人说“文化坏了”

OpenAI负责撰写重大模型发布安全报告的David Robinson辞职,在《大西洋月刊》发文:入职三年半、自评“资历最长的员工之一”,但公司“文化坏了”。

他的核心论据:OpenAI靠试错发展,官方叫“迭代部署”——“这种方式本质上保证了周期性失败,而且系统越强,失败的规模越大”。他点名OpenAI Agent入侵Hugging Face等接连曝光的失控事件:前沿AI公司该像核电站或繁忙机场那样多层冗余运营,但他在公司从没遇到过有航空安全、核反应堆或金融系统经验的同事。

OpenAI回应称,正加强研究和测试环境安全、扩大第三方评估、改进实时监控,必要时暂停训练。Robinson坦承自己雇了公关公司——AI吹哨人的标准操作,但强调发声是他自己的决定。

编辑点评:这条和下面LeCun的专访对照着看——一边是离开的人说环境不行,一边是旁观的大佬说你们全是戏。

04 / 大佬观点
“AI教父”LeCun:对灭绝人类“零担忧”,称Amodei“被迷惑了”

图灵奖得主、深度学习三巨头里唯一不担忧AI风险的Yann LeCun接受Fortune专访:对AI灭绝人类“完全不担心”,对近期一连串失控Agent事件同样零担忧。那些Agent“就是在执行被要求做的事,只是沙盒漏了、设计得糟糕透顶”,完全可以预防——许多AI实验室缺的正是网络安全基本功。

他点名批评Anthropic CEO Amodei“被迷惑了”“疯狂”:声称AI太危险要监管、开源模型太危险,这是“监管俘获”;Amodei和Altman喊“AI能杀死人类”,是“你能想象的最糟糕的营销活动”。他还炮轰有效利他主义(EA)“极度有毒”“彻底的灾难”。

LeCun离开Meta后创办AMI Labs,60多人,押注世界模型加JEPA架构取代大语言模型,主攻工厂设备异常检测、机器人等工业场景,首款产品“很快”发布。采访中邻座女士没认出他,但一听他是AI专家就问:“所以,AI会杀死我们吗?”

编辑点评:他真正担心的是大公司用规则锁死市场。话未必全对,但“AI没有结束”这句收尾,值得被吓怕了的人听完。

05 / 资本市场
大摩:9月AI发债“踩刹车”,四季度或卷土重来

摩根士丹利最新报告:9月全球AI相关债券发行只有约230亿美元,为今年次低月份;美国投资级市场AI发行直接挂零。但今年前9个月累计已达4660亿美元,是去年全年的两倍多。大摩的定性是——“暂停而非退潮”。

降温有三重因素:上半年发行太猛(6月单月1130亿美元创全年峰值)、数据中心建设撞上“人员、电力、政治”三堵墙、利率急升逼得项目条款重新谈判。另一边,谷歌、亚马逊、Meta、微软四大云厂商今年发债约1320亿美元,同比增约25倍。

四季度的关键变量:大摩预计六大超大规模厂商2027年合计资本开支约1.4万亿美元,明显高于市场共识的1万亿至1.1万亿;10月起陆续放榜的三季报,可能再触发一轮上修。

编辑点评:AI基建的钱没停,只是从“抢着发”变成“挑着发”。对国内算力链来说,这是个值得盯的先行指标。

AI负责纸上谈兵,你负责身体力行

信源:百度热搜 / 腾讯新闻 / 界面新闻 · Hugging Face官方博客 · TechCrunch / The Atlantic · Fortune · 华尔街见闻

AI玩得转

相关学习资料