说实话,这周节奏有点猛。
阿里甩出2.4万亿参数旗舰+企业级Agent公测,字节直接让AI"边看边听边说",蚂蚁把千亿模型压到单卡能跑,Sand.ai把视频生成开源的大门一脚踹开……多模态+开源+Agent三线齐发,一周的更新量抵得上去年一个季度。
周六惯例——帮你筛出本周值得放进收藏夹的工具和更新,每个附一句大实话评分。
开整。
🥇 阿里 Qwen3.8 + 千问办公公测
一句话评分:⭐️⭐️⭐️⭐️⭐️ 阿里今年最狠的一拳,模型和工作台一起出
8月3日,阿里一天两条重磅:2.4万亿参数的Qwen3.8,编程和办公能力大幅跃升,在Arena榜单稳居全球第一梯队;同期,企业级Agent产品"千问办公"开启公测。这两个不是分开的事,是一个组合拳——模型是发动机,千问办公是驾驶舱。
Qwen3.8最让人坐不住的数据:能从一个空文件夹出发,自主完成一个十几天周期的真实项目,全程不需要人插手。还能读懂200页财报PDF、看懂100小时长视频,把"看到的"信息反馈到整个工作流程里。千问办公则支持一键把工作流程沉淀为"组织级Skill",团队其他人直接复用。
👉 怎么用:千问办公官网 qwenwork.com 申请公测,Qwen3.8 API已上线千问AI平台;下周开源Qwen3.8-Max和3.8-27B
🥈 阿里 Wan 3.0 视频模型公测
一句话评分:⭐️⭐️⭐️⭐️⭐️ 30秒原生一镜到底,还支持喂PPT/网页当参考
8月7日(对,就是昨天),阿里Wan 3.0开启公测。最大亮点是原生30秒一镜到底的1080P视频,不需要拼接。但更骚的是"Omni-Reference"能力——你不光可以喂图片、音频做参考,还能喂文档、表格、PPT、网页、Markdown。这意味着你可以上传一份产品手册,让AI直接生成产品宣传片。
定价也比较透明:480p起步$0.05/秒,1080p最高$0.20/秒。在视频模型里算中等偏下价位。
👉 怎么用:Qwen Cloud 或 Model Studio 申请公测
🥉 蚂蚁 Ling-3.0-Flash 正式开源
一句话评分:⭐️⭐️⭐️⭐️⭐️ 极致"智效比",8卡就能跑,成本只有旗舰的1/12
7月24日发布,免费期到8月3日,免费期一结束立刻开源权重,说到做到。124B总参数,激活只有5.1B,却能在多步任务执行中跑赢自家万亿级旗舰。核心设计是"规划-执行分离":复杂任务交给大模型做规划,Ling-3.0-Flash只负责高频执行,在Agent场景里比旗舰模型自己的执行层性能高42.9%。
单机8卡就能部署,首Token延迟降60%-80%。对于做Agent产品的公司来说,这可能是目前性价比最高的执行节点。
👉 怎么用:HuggingFace搜 inclusionAI/Ling-3.0-flash,或OpenRouter免费调用
🏅 Sand.ai MAGI-2 Preview 开源
一句话评分:⭐️⭐️⭐️⭐️⭐️ 千亿视频模型开源第一人,意义不亚于LLaMA当年
8月5日,Sand.ai扔出一颗炸弹:全球首个千亿级开源MoE视频生成模型MAGI-2 Preview。总参数114B,但每次推理只激活6B参数,直接冲进Artificial Analysis视频生成榜前六。
权重和代码全部公开,不需要申请、不需要排队,任何人都能下载部署微调。这意味着视频生成领域终于有了自己的"LLaMA时刻"——之前这个赛道被API封闭了两年,现在门开了。视频模型的MoE路线被验证可行,以后"千亿参数、百元成本"的视频生成不再是天方夜谭。
👉 怎么用:HuggingFace直接下载权重,GitHub有完整推理代码
🏅 字节 SeedRealtime 全量上线豆包
一句话评分:⭐️⭐️⭐️⭐️⭐️ AI从"打字聊天"变成"边看边听边聊",体验降维打击
8月5日,字节发布原生音视频全双工大模型SeedRealtime,已在豆包App全量上线。它的核心突破是:不再把音频转文字→AI理解→文字转语音,而是一个模型原生融合音频、视频和文本,在连续多模态信息流上实时交互。
这意味着豆包现在能"看"着你说话,感知你的表情和环境,甚至会主动发起话题——比如看到你换了新发型会主动夸一句。不是传声筒了,是个有眼力见的AI助手。延迟极低,说话节奏自然,交互体感上了一个台阶。
👉 怎么用:更新豆包App到最新版,对话时打开摄像头即可体验
🏅 京东 JoyAI-Video-Edit 开源
一句话评分:⭐️⭐️⭐️⭐️ 边播边改的实时视频编辑,电商卖家神器
8月5日,京东开源了实时流式视频编辑模型JoyAI-Video-Edit。跟传统"先剪后看"不同,你可以一边看视频一边实时修改人物和场景——比如一段带货视频,边播边换背景、换产品配色、加特效。
对电商商家来说这是效率核弹:直播切片实时美化、商品展示秒换场景。更深一层的是它的具身智能数据合成能力——能把人手操作的视频自动转化成机械臂训练数据。京东在"物理世界模型"这条线上的布局越来越清晰了。
👉 怎么用:GitHub搜 JoyAI-Video-Edit,MIT协议开源
🏅 Meta Muse Code 编程智能体
一句话评分:⭐️⭐️⭐️⭐️ 百万行代码里加新功能,Copilot看了沉默
8月5日,Meta推出Muse Code,定位是"AI软件工程师"而非"代码补全工具"。它能理解整个代码仓库的架构和依赖关系,执行跨文件、跨语言的复杂任务。内部测试中成功完成了"为Instagram后端加端到端加密"和"重构WhatsApp消息路由"这种量级的任务——高级工程师几天的活,它几小时搞定。
同期还发布了Muse Spark 1.2,能力逼近Claude Opus 4.8但成本只有五分之一。Meta在开源AI编程这条赛道上,开始认真了。
👉 怎么用:Meta AI平台申请Muse Code测试资格,Muse Spark 1.2已上线Meta API
🏅 Cloudflare OS:Agent的"操作系统"
一句话评分:⭐️⭐️⭐️⭐️ 让AI Agent有电脑可用,开源当天冲上GitHub第一
8月6日,Cloudflare开源了@cloudflare/computer——一个给AI Agent用的虚拟电脑执行层。简单理解:你写的Agent以前只能调API和读写文件,现在Cloudflare给它配了一台可以操作浏览器、编辑文档、运行命令的虚拟电脑。
上线当天冲上GitHub Trending第一,3400+ Star。Cloudflare自己已经狗粮了三个月,数千员工在用。配套的Cloudflare OS则是一个完全由AI Agent动态生成的工作空间系统,没有固定的文件/表格/幻灯片概念,按项目按团队动态创建"工件"。
👉 怎么用:GitHub搜 cloudflare/computer,可部署到自己的Cloudflare账号或完全自托管
🏅 Cursor 4.0 大版本更新
一句话评分:⭐️⭐️⭐️⭐️ Agent默认开,写代码彻底不用动脑了
8月1日,Cursor发布了4.0大版本。最大的变化:Agent模式默认开启。以前你要手动切换"补全模式"和"Agent模式",现在AI自己判断该改代码、查文档还是跑终端命令。写一个带登录功能的网页应用,从零到能跑,全程只需要描述你想要什么——它自己调API、写前后端、建数据库表。
价格没变,Pro版还是$20/月。对于不想啃框架文档、想直接出东西的人来说,这可能是目前体验最顺滑的AI编程工具。
👉 怎么用:cursor.com 下载更新,Agent模式已默认开启
🎁 彩蛋区:本周还有这些值得瞄一眼
🔧 小米 Xiaomi-Robotics-1 开源 — 具身机器人基座模型,普通人录一段演示视频就能教会机器人新动作。10万小时实景操作数据训练,免费商用。评分:⭐️⭐️⭐️⭐️ 机器人学习门槛被拉到了"拍视频就行"
🐛 腾讯科维斯AI挖出Linux 18年漏洞 — TencentOS安全团队的AI智能体自动发现潜伏18年的内核提权漏洞CVE-2026-64564,完成root利用和跨发行版迁移。评分:⭐️⭐️⭐️⭐️ AI搞安全,比人快、比人狠
🤖 Google DeepMind Gemini Robotics 2 — 最先进的视觉-语言-动作模型,能控制从桌面机械臂到全尺寸人形机器人的各类形态,支持多机器人协同。评分:⭐️⭐️⭐️⭐️ 让机器人"理解"物理世界,而不是机械执行指令
🚀 Jeff Dean离职创业Discovery Loop — 谷歌27年老将Jeff Dean携核心团队出走,创办科学发现自动化公司,把科研实验抽象为可并行数千次的自动循环。评分:⭐️⭐️⭐️⭐️ 用AI加速科学发现本身,这格局比做聊天机器人大多了
🔮 Kivine神秘模型持续发酵 — LMArena上的匿名模型Kivine,被社区一致认定为Kimi K3的"影子分身"。充值活动页面泄露显示7月15日-8月11日为促销期,正式发布可能就在这几天。百万上下文+逼近Fable级的编程能力,值得蹲。评分:⭐️⭐️⭐️⭐️⭐️(预评)国产下一个王炸,随时可能发布
本周总结一句话:
多模态不再"未来可期",而是"今天就能用"。视频生成的开源大门被踹开,Agent从对话走到了执行,AI正在长出眼睛和手。
哪个工具你最想试?留言告诉我,下周实测安排上。👋
— AI君
每周六更新 · 推荐给用得上的朋友 · 往期回顾请点头像
夜雨聆风