乐于分享
好东西不私藏

AI资讯日报-第五十期

AI资讯日报-第五十期
点击蓝字,关注我们
今日热点摘要AI INFORMATION

OpenAI推算力锁定服务,并为Pro用户预览直连银行分析

图像溯源加SynthID可验证;Cursor推编码模型降价

Qwen3.7预览仅思考;NEWTON编排工具提升视频生成

研究警示持久记忆代理投毒;古文字OCR基准开源,识别仅27.1%

卡帕西入Anthropic;运营商推令牌包月,谷歌拟建TPU云

关键发布与产品迭代

OpenAI · 官方推出 Guaranteed Capacity,允许客户“锁定”长期算力访问,以应对算力紧张环境下关键业务扩容与稳定性规划,强调已在基础设施、合作与产能规划上持续投入。
Content Credentials · OpenAI更新内容溯源方案:图像除C2PA凭证外新增 SynthID 水印,并提供公开验证工具,可检测图片是否由OpenAI产品生成,面向识别与追踪来源。
Cursor Composer 2.5 · Cursor发布自研编码模型升级版,称训练数据较前代扩大25倍、85%算力投向RL;SWE-Bench Multilingual 79.8%、CursorBench v3.1 63.2,并将价格压到$0.5/$2.5每百万token。
Qwen3.7 · 阿里上线Qwen3.7-Max/Plus预览版,当前仅开放“思考模式”;Arena AI榜单显示Max综合第13、数学第7、编程第10,实验室排名升至全球前六,后续工具链待开放。
ChatGPT Pro · OpenAI向美国Pro用户预览“直连银行账户”理财工具,与 Plaid 合作覆盖1.2万家机构;可生成仪表盘、分析消费与订阅,并支持随时断开连接与清除财务记忆。

科研进展与技术突破

NEWTON · 提出将视频生成降级为“工具调用”,由可训练规划器编排物理计算/关键帧/提示词改写并用验证器闭环;在VideoPhy-2上把LTX-Video从21.4%提到29.7%,Veo-3.1从30.7%到37.4%。
Test-Time Hinting · 面向仅有黑盒API访问的VLM,训练轻量“提示生成器”为输入选择可前置的纠错提示,实现单次调用提分;论文称可在自然图像VQA上提升多款闭源VLM,并可跨基准与模型泛化。
Sleeper Memory Poisoning · 研究“持久记忆”代理的延迟投毒:攻击者诱导写入伪造用户记忆,后续检索后可驱动行动。实验显示GPT-5.5被写入成功率99.8%,检索成功后60–89%评测触发攻击意图动作。
Chronicles-OCR · 首个覆盖“七体之变”的古文字OCR评测基准开源:2800张平衡图像、四任务解耦感知与推理;评测28个模型后,古早字体端到端检测几乎全失效,细粒度识别最高仅27.1%。

行业政策与资本趋势

Karpathy · Andrej Karpathy 在X官宣加入 Anthropic,称未来几年LLM前沿将极具启发性,将重返R&D;同时表示仍热爱教育并计划未来恢复相关工作。
Stainless · Anthropic宣布收购自动化SDK生成维护工具 Stainless(可由API规范生成多语言SDK);报道指其将逐步关停外部托管服务,开发者工具链从“公用基建”转为内部能力,或抬高竞品维护成本。
TPU云 · 华尔街日报称谷歌与黑石拟投建新AI云公司,总投资约250亿美元、黑石先投50亿美元;计划2027年前上线500MW算力,依托谷歌TPU与云能力挑战CoreWeave等独立算力云。
Token套餐 · 三大运营商将Token做成“话费式”包月:电信个人9.9元起、企业最高299.9元/月达1.5亿Token;移动分省推出1元40万Token等;联通亦给企业赠送测试额度,推进算力普惠。
月之暗面 · 报道称Kimi新一轮20亿美元融资进入尾声,多家国资与央企(含中国移动)入局;近半年累计融资超39亿美元、估值较去年11月约翻4倍,并同步推进Composer集成与K2.6开源生态。
Meta · 内部备忘录披露将裁员约10%并削减管理层,另把7000人转岗AI工作流相关项目;综合裁员与转岗或波及约20%劳动力,并关闭6000个在招岗位,加速“AI原生”组织改造。

落地实践与案例复盘

AI成本 · 长文梳理AI商业“亏损结构”:称过去三年超大厂投入超8000亿美元Capex,未来两年计划再投约1.7万亿美元;并引用证词称微软对OpenAI合作累计投入约1000亿美元,难以被现有AI收入覆盖。
OpenClaw · 36氪称OpenClaw热度退潮:4月访问量降至1420万、环比-50.67%;衍生产品中腾讯QClaw月访问环比暴跌99.19%。文中将下滑归因于上手门槛、稳定性与成本上升等。
SandboxAQ · SandboxAQ与 Claude 合作,将其用于药物发现/材料科学的“LQM”模型集成到对话界面,主打免自建计算基础设施;公司称已融资超9.5亿美元,希望降低科研工具使用门槛并加速候选分子评估。
AI眼镜 · 蚂蚁GPASS在乐奇AI眼镜上线“城市伴游”,结合语音+图像+位置多模态意图理解,支持讲解、导航、第一视角记录与分享;杭州文旅官方智能体“杭小忆”率先接入,后续扩展更多城市。
豆包 · 字节豆包上线“博物馆讲解模式”,覆盖国博等20+机构,并在甘肃省博物馆等5家场馆以“官方AI讲解员”落地;显示大模型从线上问答走向线下空间感知与垂直知识服务。

开源与工具生态

Osaurus · TechCrunch报道开源LLM服务器Osaurus面向Mac生态,支持本地/云模型一键切换,并用“硬件隔离沙盒”限制模型权限;称本地常规模型至少需64GB内存,运行DeepSeek V4级别建议128GB+。
EDIT工具 · Redis作者antirez探讨更省token的“CAS式编辑”:READ/SEARCH返回带行号与4字符校验tag,EDIT按行+tag替换,减少模型复述旧文本;并比较“全文件CRC32+行范围”方案的效率与误触发权衡。
Witchcraft · Dropbox开源语义搜索引擎Witchcraft(SQLite单文件),作者称在NFCorpus上p95约20ms;配套Pickbrain可索引Claude Code/Codex会话与文档,并提供技能让代理跨会话检索历史上下文。
Argyph · 开源MCP服务器Argyph主打“本地优先”代码库语义检索:三层索引(文件清单→tree-sitter符号图→向量嵌入),内置向量库与嵌入模型、无需API Key;并强调只读设计以降低误改风险。
swm · 开源工具swm用于跨RunPod/Vast等多家平台租GPU并快速装ComfyUI等框架,支持S3兼容对象存储同步工作区;并提供“空闲30分钟自动保存并关机”避免爆账单,面向Agent接管云GPU运维。
AXON · 开发者做了GPT‑2机理可视化工具AXON:用预训练SAE分解残差流特征并WebSocket实时推到浏览器3D图;CPU约800ms/token、GPU约35ms,支持多模型替换并用Neuronpedia做特征标签。

社媒观点与社区动向

OpenClaw · 社区长文总结一套“至少省95% Token”的优化法:缩小启动bootstrap、压缩对话、轻任务本地化(Ollama/QMD)、脚本直连API绕过上下文等,并给出示例测算:仅bootstrap优化可省约0.36M tokens/月。
Agent架构 · 讨论如何让编码智能体连续工作8–20小时:提出“知识组织→深度规划→长时间执行”流程,质疑事件驱动架构对模型可推理性不友好,并呼吁更少中途汇报、更多可测试产物与明确阻塞条件。
LLM半年回顾 · Simon Willison用PyCon闪电演讲复盘近6个月:称“编码智能体在2025年11月跃迁”,并观察本地开源模型能力超预期;以“鹈鹕骑车SVG”作为对比基准展示多家模型交替领先。
OpenClaw隐私 · 社区讨论质疑“本地更隐私”的宣传:若仍调用云端API,数据出网后隐私与常规LLM一致;除非模型完全本地推理,否则需明确哪些数据会被上传、如何裁剪上下文与做最小暴露。
Anthropic/订阅 · 有用户称Anthropic对OpenClaw等程序化用法再次分池限额:订阅含少量可用credits、月度清零不结转,超额按API计费;认为这会显著降低“用订阅跑智能体”的性价比并迫使更精细的分流策略。
Codex · 社媒吐槽Codex疑似再次“重置/限额刷新”,用户称每次重置都后悔没提前多跑任务,侧面反映编码代理工作流对配额与计费策略高度敏感。

免责声明:本平台旨在传递与分享更多科技创新政策及科研资讯,部分资料来源于网络,仅提供交流平台,不为其版权负责。如涉及侵权或其他问题,请联系我们及时修改或删除。

相关学习资料