追踪AI领域KOL账号的推文更新,生成摘要,每日推送。
AI相关推文202篇,来自79个账号
🤖 今日看点
Anthropic重磅发布Claude Fable 5:首个Mythos级公开模型,编程能力大幅跃升,Stripe用它一天完成5000万行Ruby代码迁移 Google推出Gemini 3.5 Live Translate:实时语音翻译支持70+语言,被称为"现代巴别鱼",有望消除语言障碍 苹果Siri AI与Google Gemini深度合作:新Siri由苹果自研基础模型驱动(经Gemini蒸馏训练),支持个人上下文、应用操作、视觉智能等五大能力
🤖 LLM与大语言模型
Claude Fable 5 / Mythos 5 重磅发布
Anthropic正式发布Claude Fable 5(公开版)和Claude Mythos 5(受限版),两者共享同一底层模型。Fable 5面向所有用户开放,内置安全分类器,在检测到网络安全、生物化学或模型蒸馏相关请求时会透明降级到Opus 4.8;Mythos 5则移除了部分安全限制,仅提供给Project Glasswing网络安全合作伙伴。Fable 5定价为输入50/百万Token,在编程、科学研究、知识工作等多个基准上达到SOTA。Stripe使用Fable 5在一天内完成了原本需要团队两个月完成的5000万行Ruby代码库迁移。
摘要:Anthropic发布了Fable 5和Mythos 5两款旗舰模型,均基于同一Mythos级底座,区别在于安全限制程度。Fable 5为公开版本,通过内置分类器在敏感领域自动降级来确保安全;Mythos 5仅限Glasswing网络安全合作伙伴使用。Fable 5在长程复杂任务上优势显著,定价50每百万Token,已在GitHub Copilot、Cursor、Cognition Devin等平台同步上线,被认为是Claude历史上最大的一次能力跃升。
原文链接:
Anthropic官方发布Fable 5(Claude@claudeai):https://x.com/claudeai/status/2064394146916229443 宝玉详细解读(宝玉@dotey):https://x.com/dotey/status/2064397772103528771 Andrej Karpathy评价(Andrej Karpathy@karpathy):https://x.com/karpathy/status/2064409694761054332
Gemini 3.5 Live Translate:实时语音翻译新突破
Google发布Gemini 3.5 Live Translate,这是其最新的语音到语音实时翻译模型,支持超过70种语言和2000多个语言对。模型在用户说话的同时就开始流式翻译,保持说话人的语调、节奏和音高,实现接近自然的跨语言对话体验。支持自动语言检测、多语言混合输入和嘈杂环境降噪。该功能已在Google Translate应用(Android和iOS)、Gemini API(公开预览)和Google Meet(私人预览)中上线。
摘要:Google推出Gemini 3.5 Live Translate,实现真正的实时语音翻译,支持70多种语言和2000多个语言对。模型在用户说话时即开始流式翻译,并能保持原始语音的语调、节奏和音高,让跨语言交流更加自然流畅。目前该功能已在Google Translate、Gemini API和Google Meet中上线,被认为是消除语言障碍的重要里程碑。
原文链接:
Google官方介绍(Google DeepMind@GoogleDeepMind):https://x.com/GoogleDeepMind/status/2064366504745828689 Patrick Loeber测评(Patrick Loeber@patloeber):https://x.com/patloeber/status/2064371086741938350
👁️ 计算机视觉与多模态
NotebookLM重大升级:每个笔记本都配云端电脑
Google的NotebookLM迎来重大更新:底层模型升级为Gemini 3.5与Antigravity联合驱动,每个交互式笔记本现在配备专属云端计算机,内置100多项软件技能,支持更深度的研究和复杂数据分析。新增十几种输出格式,包括PDF、docx、Excel、PPT、图表、图片等。同时打通了Google搜索,用户无需自带资料也能直接开工。欧洲用户现可100%使用NotebookLM功能。
摘要:Google NotebookLM全面升级,底层切换为Gemini 3.5 + Antigravity,每个笔记本现在都配备专属云端计算机和100+内置技能,支持代码执行和复杂数据分析。输出格式大幅扩展至PDF、docx、Excel、PPT等多种格式,并打通了Google搜索实现免资料研究。欧洲地区已100%全面上线。
原文链接:
小互报道(小互@imxiaohu):https://x.com/xiaohu/status/2064236027812933836 NotebookLM官方(NotebookLM@NotebookLM):https://x.com/NotebookLM/status/2064410506287538387
Gemini Live图像生成与编辑功能上线
Google在Gemini Live中直接上线了图像生成与编辑功能,用户可以在使用Gemini应用时通过实时摄像头共享,实时生成或修改图片。用户可以给Gemini展示眼前的事物,让它现场创建、调整或解读画面。
摘要:Gemini Live新增实时图像生成与编辑能力,用户通过摄像头分享画面后,Gemini可实时理解场景并生成或修改图像。这一功能将多模态交互提升到新高度,使AI助手能真正"看见"用户眼前的世界并进行创意生成。
原文链接:
AI Will报道(AI Will@FinanceYF5):https://x.com/FinanceYF5/status/2064239253241086196
💼 AI行业与商业
苹果与Google在AI领域深度合作
苹果在WWDC上宣布,其新版Siri AI由苹果自研基础模型驱动,该自研模型通过Google Gemini蒸馏训练而来。苹果强调其AI功能采用设备端处理+私有云架构,数据不存储、无人可访问。新Siri支持个人上下文理解、应用操作、屏幕感知、图像理解和世界知识五大核心能力,通过系统编排器连接Apple Intelligence。
摘要:苹果与Google在AI领域达成深度合作——苹果自研Siri基础模型通过Gemini蒸馏训练而来,但实际由苹果自有服务提供世界知识。新Siri定位为独立应用,支持个人上下文、应用操作、视觉智能等差异化功能,隐私方面强调设备端处理加私有云、数据不存储。Google的Gemini模型仅在iCloud中提供额外支持。
原文链接:
小互报道(小互@imxiaohu):https://x.com/xiaohu/status/2064346455905906992 AI Will整理(AI Will@FinanceYF5):https://x.com/FinanceYF5/status/2064240270133346520
OpenAI秘密提交IPO申请
据《华尔街日报》报道,OpenAI已秘密提交IPO申请,正式启动上市流程。"秘密提交"可让SEC先审核招股书,暂不公开营收、亏损、客户、算力成本及薪酬等敏感数据。上周Anthropic也秘密提交了IPO。AI行业已从"比模型"进入"比资本"的竞争阶段。
摘要:OpenAI和Anthropic相继秘密提交IPO申请,AI行业正式进入资本竞赛阶段。继Anthropic上周提交IPO后,OpenAI也启动了上市流程,两家AI巨头从技术竞争转向融资能力比拼。
原文链接:
AI Will快讯(AI Will@FinanceYF5):https://x.com/FinanceYF5/status/2064239024659947924
Google Colab CLI:终端直接调用GPU/TPU
Google发布Colab CLI,用户现可在终端中直接调用Colab的GPU/TPU算力,支持A100等高端显卡、远程脚本执行、交互式REPL访问,以及内置Agent Skill功能。用户只需对Agent说"在这个数据集上微调Gemma 3 1B",Agent即可自动完成GPU分配、训练运行和权重下载。
摘要:Google Colab CLI让用户可以在终端直接使用Colab的GPU/TPU算力,支持A100等高端显卡、远程脚本执行和交互式控制台。更重要的是内置Agent Skill——用户用自然语言描述任务,Agent即可自动完成从算力分配到模型训练的全流程,实现真正的AI辅助深度学习开发。
原文链接:
Philipp Schmid介绍(Philipp Schmid@_philschmid):https://x.com/_philschmid/status/2064240919021228351
🛠️ AI工程与工具
Cursor发布重大更新:成本与Token可视化
Cursor发布重要更新,cursor.com/evals页面新增成本、输出Token数量和执行步骤的可视化图表,每个模型的这些指标都可以在图表中直观对比。这一更新让开发团队能更精确地评估不同模型的性价比和效率。
摘要:Cursor的Eval页面新增成本、输出Token数量和执行步骤的可视化功能,帮助开发团队更直观地对比不同模型在效率和经济性上的差异。这一产品细节的优化反映出AI编码工具正从单纯追求性能向性能与成本综合优化演进。
原文链接:
eric zakariasson发布(eric zakariasson@ericzakariasson):https://x.com/ericzakariasson/status/2064404502053294565
Claude Code新增嵌套子Agent支持
Claude Code正式推出嵌套子Agent支持,允许Agent启动Agent来更好地管理上下文,深度上限设为5层。这一功能让复杂任务可以分解为多个子任务并行或串行执行,大幅提升了长程复杂工作的可管理性。
摘要:Claude Code新增嵌套子Agent功能,支持Agent启动子Agent来处理复杂任务,深度可达5层。这是AI编码助手在自主性和任务分解能力上的重要突破,使单个AI可以协调多个子Agent完成更复杂的工程任务,让AI编程助手向真正的软件工程团队协作方向演进。
原文链接:
Boris Cherny发布(Boris Cherny@bcherny):https://x.com/bcherny/status/2064327225504403752
LlamaIndex发布Granular网络:精准溯源到单元格
LlamaIndex发布Granular网络,解决AI文档提取中的溯源难题。当合规团队审查AI提取结果或审计员需要签字确认时,仅说"它来自这份文档"是不够的——他们需要看到精确来源:表格中的具体单元格、页面上的具体行、模型使用的具体词语。Granular可溯源到表格单元格级别。
摘要:LlamaIndex推出Granular网络,实现文档解析的精细化溯源——不仅能告诉用户数据来自哪份文档,还能精确到表格中的具体单元格和页面上的具体行。这对需要AI辅助处理金融文件、合规审查等高要求场景意义重大,改变了AI文档解析"只返回结果、不返回来源"的历史问题。
原文链接:
LlamaIndex官方(LlamaIndex 🦙@llama_index):https://x.com/llama_index/status/2064355983292240066
🔬 AI研究与突破
Mayo Clinic用AI提前3年检测胰腺癌
Mayo Clinic研究人员开发了一款名为REDMOD的AI模型,可以在常规CT扫描中检测胰腺癌,比临床诊断提前最多3年。该研究发表在Gut期刊,模型在近2000次扫描上测试,包括最初被读片为正常的诊断前扫描。REDMOD识别出73%的隐藏癌症,中位提前时间为诊断前475天,是专家放射科医生检测率的近两倍。
摘要:Mayo Clinic在Gut期刊发表突破性研究,其AI模型REDMOD可在常规CT扫描中提前最多3年检测胰腺癌,识别率达73%、中位提前时间475天,性能约为专家放射科医生的两倍。这是AI在癌症早筛领域的重大进展,胰腺癌因早期症状不明显而被称为"沉默杀手",AI辅助早筛有望显著改善患者预后。
原文链接:
The Rundown AI报道(The Rundown AI@TheRundownAI):https://x.com/TheRundownAI/status/2064416920191869191
SWE-Explore:代码Agent仓库探索能力基准
有研究提出SWE-Explore基准,专门评估AI编程Agent在代码仓库探索方面的能力。该基准测试Agent如何理解代码库结构、定位相关文件和理解跨模块依赖关系,对提升AI编码助手的实用性至关重要。
摘要:SWE-Explore成为评估代码Agent仓库探索能力的新基准,填补了现有基准忽视"Agent如何在陌生代码库中导航"这一关键能力的空白。优秀的仓库探索能力决定了AI编码助手能否在实际工程环境中发挥作用,是从"能用"到"好用"的关键差距。
原文链接:
AK分享(AK@_akhaliq):https://x.com/_akhaliq/status/2064383240824066256
SpatialWorld:多模态Agent空间推理基准
SpatialWorld基准发布,专门评估多模态Agent在真实世界任务中的空间推理能力。AI在三维空间理解、多视角推理和物体关系判断等能力上的进展,对机器人、智能家居、自动驾驶等应用至关重要。
摘要:SpatialWorld基准专门评估多模态Agent的空间推理能力,涵盖三维空间理解、多视角推理和物体关系判断等维度。这是AI从二维图像理解向三维世界交互迈进的重要指标,对机器人、自动驾驶和增强现实等需要空间智能的应用领域具有直接指导价值。
原文链接:
AK分享(AK@_akhaliq):https://x.com/_akhaliq/status/2064379320932413664
🛡️ AI安全与伦理
Gary Marcus持续质疑Anthropic"两个月戏剧"
Gary Marcus持续批评Anthropic的营销策略——从两个月前称Mythos"危险到不能发布"到如今"Fable 5让所有人用",他认为这是精心策划的媒体公关操作。同时Gary Marcus还指出Anthropic的新安全分类器存在争议:用户报告Fable 5 refusals频率过高,实际使用中可能影响体验。
摘要:Gary Marcus从怀疑论角度持续审视AI行业,对Anthropic"Mythos从危险到公开"的两极化叙事提出质疑,认为存在精心策划的媒体策略。同时他也指出Fable 5的安全分类器可能过于严格,误报率问题值得关注——用户需要权衡模型能力与使用体验之间的取舍。
原文链接:
Gary Marcus质疑(Gary Marcus@GaryMarcus):https://x.com/GaryMarcus/status/2064395350509793612 马东锡NLP分析(马东锡 NLP@dongxi_nlp):https://x.com/dongxi_nlp/status/2064429115017478342
公众号不支持外链跳转,请复制链接打开原文
夜雨聆风