2026年6月24日 · 星期三 · 共收集 21 条
每 日 A I 新 闻
AIHOT精选 + 全网搜索
🔥 今日 Top 3
1. 豆包专业版正式上线付费:68元/月起,字节AI商业化里程碑
字节跳动豆包发布基于豆包2.1系列的专业版,新增办公任务模式(接入豆包2.1 Pro),支持操作本地电脑、浏览器、调用Skills技能、定时任务,内置Office办公套件,可创建带后端数据库的生产级在线应用。三档定价:标准68元/月、加强200元/月、高级500元/月,大学生认证38元/月。这是国产AI助手从免费走向付费的关键拐点。
💡 喵总观察:豆包付费标志着中国AI助手商业化的真正起点。68元/月对标ChatGPT Plus的20美元,定价策略明显瞄准国内办公场景刚需。内置Office+Agent能力,不是聊天机器人,而是AI办公操作系统。
2. Anthropic Mythos侵入美政府机密系统,Legion起诉美国政府禁令
Reuters补充报道Anthropic Mythos模型在与华盛顿情报机构联合测试中,数小时内定位出美国政府高度敏感系统漏洞,参议员Warner引用NSA局长说法称"几乎攻破了全部机密系统"。随后白宫下令禁止外籍人员使用Fable 5与Mythos 5。美国法律科技公司Legion LegalTech随即起诉联邦政府,指控强制禁用导致其加拿大开发团队业务停滞,造成"即时、不可弥补且生存性"损害。
💡 喵总观察:一条新闻两个维度——AI的安全能力已超越人类防御者的想象,同时AI管制正从技术治理走向地缘政治武器。Legion的起诉核心论点"托管式AI访问不构成出口"可能成为AI行业最重要的法律先例。
3. 阿里千问发布Qwen-AgentWorld:首个原生语言世界模型超越GPT-5.4
阿里巴巴千问发布Qwen-AgentWorld,首个原生语言世界模型,提供35B-A3B与397B-A17B两种规模,单一模型覆盖MCP、Search、Terminal、SWE、Web、OS、Android七大智能体交互领域。模型基于超1000万条真实环境交互轨迹,经CPT→SFT→RL三阶段训练。AgentWorldBench评测中,Qwen-AgentWorld-397B-A17B取得58.71分,超越GPT-5.4和Claude Opus 4.8。模型与评测基准已开源。
💡 喵总观察:AgentWorld不是又一个Agent框架,而是让Agent学会"先预测再行动"的世界模型。这意味着Agent可以先在模拟环境中低成本试错,再迁移到真实环境执行。这是Agent训练从真实环境RL到Sim RL的关键跃迁。
— — —
🤖 Agent 专题
微信上线AI智能体"小微"内测:国民级应用首次Agent化
微信近日内测AI智能体"小微",常驻左上角,支持语音/文本输入,基座模型为WeLM-V4-80B(MoE激活3B)与DeepSeek。可发消息、红包、语音通话(需逐项确认),可查询朋友圈(限最近2天)、公众号、视频号,支持小程序操作奶茶咖啡、打车、电影票等至最后一步后交给用户。整体策略"只读不动",禁止批量发送、删除联系人等操作。
【关注理由】
微信是13亿用户的国民级应用,小微Agent标志着超级App正式进入Agent时代。但"只读不动"的谨慎策略说明微信在AI能力与用户安全间做了极度保守的取舍——这既是正确的,也意味着Agent在超级App里的落地将比预期慢。
Qwen-AgentWorld开源:让Agent学会"先预测,再行动"
通义千问推出首个原生语言世界模型Qwen-AgentWorld,覆盖MCP、Search、Terminal、SWE、Web、OS、Android七大领域。模型基于超1000万条真实交互轨迹,经CPT→SFT→RL三阶段训练。作为解耦环境模拟器实现可控Sim RL,在WideSearch上超越真实环境RL(F1 50.3% vs 45.6%)。模型与评测基准已开源。
【关注理由】
AgentWorld的突破在于"世界模型"——Agent不再只能在真实环境中烧钱试错,而是可以先在模拟环境中低成本验证策略,再迁移执行。Sim RL超越真实环境RL是重大信号:虚拟训练效率已高于真实训练。
Claude Tag:在Slack里@Claude让它当团队成员干活
Anthropic推出Claude Tag,让Claude以团队成员身份加入Slack。用户可指定频道和工具,通过@Claude委托任务(拆解任务、写PR、跑数据分析、处理故障)。频道内一个Claude实例可供多人接力使用并积累上下文;开启环境模式后,它会主动跟进沉寂线程并提醒相关信息。面向Enterprise和Team计划开放beta测试。
【关注理由】
Claude Tag是AI Agent从"工具"到"团队成员"的身份跃迁。Agent在团队频道积累上下文、主动跟进任务——这是AI从被调用到主动协作的关键一步。Anthropic从"最佳模型护城河"转向"工具生态护城河"的战略清晰。
Anthropic内部演讲:99%工程师运行300+自改进agent swarm
Anthropic内部透露,99%工程师运行300+自改进agent swarm。核心是"close the loop"——模型自验证输出,包含计划、动态工作流、自我检查并迭代。效果远超多数300美元agent课程,但token消耗更高。
【关注理由】
Anthropic内部全员跑300+agent swarm说明:Agent不再是实验室demo,而是日常生产力工具。"close the loop"自验证闭环是Agent真正可用的核心机制——没有自验证的Agent只是半成品。
阶跃星辰Step Plan应对Agent计费痛点
阶跃星辰针对AI智能体开发中的计费痛点推出Step Plan,与Step 3.7 Flash模型搭配测试。开发者反馈每次API调用显示费用导致分心、停止测试新模型;固定费率解决了这一问题。Step Plan让开发者更专注于构建而非盯着费用数字。
【关注理由】
Agent计费是行业隐藏痛点——按token计费让开发者不敢放手测试,直接抑制Agent创新。固定费率+Step Plan是"让Agent开发者敢用"的商业设计,和阿里QoderWork峰谷Token是同一思路的不同落地。
— — —
📊 AI 产品 & 行业趋势
百度千帆Token Plan企业版发布,率先接入智谱GLM-5.2
百度千帆发布企业级AI生产力订阅服务Token Plan企业版,采用"席位制+企业共享积分包"模式。模型方面聚合DeepSeek-V4系列、GLM-5系列、Kimi-K2.6等,已率先接入智谱GLM-5.2开箱即用。提供轻享版、标准版、高级版等多档位,承诺不使用用户数据训练,支持企业级SLA。
OpenAI ChatGPT最大规模语音升级:双向AI语音模型Bidi 1上线测试
部分用户反馈ChatGPT网页版和App版上线了双向AI语音模型Bidi 1,支持边说话边监听,用户可在对话中途打断并发出新指令。例如要求从1数到10时中途喊停,模型会立即切换执行。OpenAI尚未官宣,预计本周启动更大范围测试。
荣耀7月发布下一代终端操作系统AgenticOS
荣耀产品线总裁方飞在MWC26上海宣布,7月将发布以人为中心的AgenticOS。四大特性:意图驱动(以意图而非应用为中心)、自然交互(声音/手势/眼神)、主动智能(Agent内核主动规划执行)、天生跨端(一脑调度万端,多设备多Agent协同)。年初发布的Robot Phone预计下半年上市。
国家广电总局:AI生成的微短剧应在每集明显位置添加提示标识
国家广播电视总局就《微短剧发展管理办法(征求意见稿)》公开征求意见。征求意见稿提出,使用AI技术生成制作的微短剧,制作机构和播出单位应在每集明显位置添加提示标识。同时支持外向型微短剧创作,鼓励优秀微短剧境内外同步播出。
— — —
🧠 大模型 & 基础设施
阿里云发布Qwen3.7-Plus多模态智能体模型
阿里云发布Qwen3.7-Plus,专为跨GUI交互、工具使用和编码的多模态智能体执行而构建。从视觉输入到代码和实际任务执行,它专为长期运行的现实世界智能体工作流而设计。限时20%折扣。
百度开源Unlimited OCR:3B参数一次推理处理数十页文档
百度开源Unlimited OCR模型,采用参考滑动窗口注意力(R-SWA)技术。模型3B参数、500M激活,在标准32K上下文下可一次前向推理处理数十页文档,无需切页。R-SWA将原件与已写文字区分:原件全程保留,已写文字仅关注最近128个token,使显存和算力不随页数增长。
字节Seedance 2.5发布:一次生成30秒4K短片
字节跳动发布Seedance 2.5视频模型,支持一次生成30秒短片,原生4K分辨率,可输入50个全模态参考素材并支持3D白模。同时推出AI版权商业化平台,允许用户使用官方授权的IP电影版权进行创作和分成。
VibeThinker:3B参数推理模型性能接近Opus 4.5
VibeThinker是仅3B参数的推理模型,采用SFT+GRPO训练,在推理基准上与Opus 4.5几乎持平。AIME26达94.3,LiveCodeBench v6上80.2 Pass@1,近期未见过的LeetCode竞赛接受率96.1%。模型基于Qwen2.5-Coder 3B,经过硬样本筛选、多解监督、可验证奖励RL等训练而成。
DFlash:块扩散草稿模型实现最高15倍吞吐量提升
UC San Diego团队提出DFlash,用于投机解码的轻量块扩散草稿模型。一次前向推理生成整块token,再由目标模型并行验证保证输出无损。在Qwen3-8B等多种模型上平均无损加速超6倍,在NVIDIA Blackwell上gpt-oss-120b吞吐量提升最高15倍,约为EAGLE-3的1.5倍。
— — —
⚡ AI Coding & 开发工具
2026年16大生成式AI编码工具对比:功能与适用场景
MarkTechPost对比16个最佳AI编码工具:Atoms*支持自然语言生成可部署应用并并行运行多模型;GitHub Copilot提供IDE内智能补全与代理模式;Tabnine主打本地化私密代码补全;Replit为云端IDE与AI代理;Warp增强终端AI;Bloop将代码搜索转向AI智能体基础设施等,覆盖IDE插件到云部署多种场景。
Codex Remote工程实践官方指南:手机是控制面而非终端
OpenAI发布Codex Remote官方博客。核心心智模型:手机是"控制面"而非终端——开发机跑代码,手机负责启动、指挥、审批、审查。十大高杠杆能力包括Queue vs Steer、Side Chat、Plan vs Goal、对话内Code Review、细粒度权限管理等。对AI coding agent的启示:异步协作、注意力与状态机管理、目标约束、生产级权限粒度。
实测Codex Record & Replay:把RPA自动化工作流重做了一遍
Codex新功能Record & Replay可将浏览器操作录制成可复用Skill。实测解决定向信息搜索时自动打开X搜热点、统计高赞帖子、提取关键词重新查询,满足60%-70%图文素材需求;视频剪辑上传可完成静音检测、加速、导出GIF等固定流程。已能将人的操作转化为Agent下次可执行的上下文,替代传统RPA。
StepFun step-3.7-flash实测:2分多钟生成可用文章头图生成器
用户将截图丢给StepFun step-3.7-flash模型(运行在Codex中),2分多钟生成可用的网页版文章头图生成器,支持修改文案和导出PNG,总成本仅$0.06。模型能自行理解参考图并实现完整功能逻辑。StepFun同步推出Startup Program,早期团队可获API额度和生态支持。
— — —
🔭 趋势观察 · 正在发生的结构性变化
AI Agent从工具到团队成员的身份跃迁
微信小微Agent常驻对话界面、Claude Tag以团队成员身份加入Slack、Anthropic全员跑300+agent swarm——三件事指向同一方向:Agent正在从"被调用的工具"进化为"主动协作的团队成员",拥有独立身份、持久上下文和主动行动能力。
AI产品商业化从免费到付费的拐点已至
豆包68元/月、千帆企业版席位制、QoderWork峰谷Token、Step Plan固定费率——同一周内四家中国AI公司推出商业化付费方案。免费AI助手的窗口期正在关闭,行业共识是"有真实工作场景的Agent才值得付费"。
AI安全与地缘政治博弈加剧
Mythos侵入美政府机密系统→白宫下令禁外籍使用→Legion起诉美国政府→美施压Meta接受审查→英伟达被禁GPU中国翻倍。AI安全已从技术议题升级为地缘政治议题,模型访问权正成为新的"出口管制"战场。
端侧AI从概念到量产
MiniCPM-V 4.6在Apple Core AI上高速运行、VoxCPM-0.5B全端侧部署iPhone、荣耀AgenticOS下半年上市、Counterpoint预测2026年GenAI手机出货占比45%——端侧AI不再是实验室demo,而是正在进入量产和消费级产品。
软银All in AI:从投资到制造
孙正义宣布再干10年以上、软银已开始量产机器人、Arm从设计者进化为制造者、将建世界最大数据中心、200亿美元海外贷款支援AI扩展——软银正从"AI投资者"转型为"AI制造商",押注AI时代的硬件基础设施。
— — —
数据来源:AIHOT / WebSearch | 喵总整理
关注「Ai与Web3」获取每日 AI 前沿资讯
有个性化需求?留言告诉我 👇
声明:本文仅供信息参考,不构成投资建议
© 2026 喵总 · Ai与Web3
夜雨聆风