乐于分享
好东西不私藏

AI日报|AI建模工具Hi3D V3.0明日上线,限免48H;阿里AI音乐模型「快乐虾米」;Cursor代码托管平台Origin;豆包工作任务支持手机遥控电脑

AI日报|AI建模工具Hi3D V3.0明日上线,限免48H;阿里AI音乐模型「快乐虾米」;Cursor代码托管平台Origin;豆包工作任务支持手机遥控电脑

2026年8月18日 AI资讯日报

🤖【AIGC】

  • • 阿里发布AI音乐模型 HappyShrimp 1.0「快乐虾米」:无需专业乐理术语,只需描述情绪、故事或记忆,即可端到端完成作词、作曲、编曲和演唱,并生成完整歌曲。
  • • 开源社区开放 MiniMax H3 Latent Upscaler:直接在 H3 的 24 通道 VAE Latent 中升频,减少传统“解码→放大→重新编码”流程,并降低简单插值产生的重影问题。
  • • AI建模工具Hi3D V3.0 确认 8 月 19 日上线,提供免费体验:官方预告新版本将达到 2048³ 体素分辨率,并提供 48 小时免费体验。
  • • 腾讯 ARC 等团队发布 SCoPE:通过给每个视频 Token 加入对应摄像机射线坐标,使视频扩散模型可以直接依据真实 Camera Trajectory 控制推拉、环绕、升降和复杂运镜。

🧠【大模型】

  • • Qwen-Audio 3.0 语音模型体系进入千问AI平台:覆盖 ASR 语音识别、TTS 语音合成和 Realtime 实时语音对话,现均可通过官方 API 使用,并进入 Token Plan 模型体系。

🏠【行业信息】

  • • Claude Code推出 /design:Anthropic团队将Claude Design的画布式设计工作流进一步带入Claude Code CLI和Desktop,付费用户升级最新版后即可体验。
  • • Cursor推出代码托管平台 Origin:所有付费方案开始获得Early Beta,首发支持原生仓库、Pull Request、代码浏览与GitHub实时同步,Agent原生功能继续上线中。
  • • Cumora开源“人类+Agent”团队聊天平台:Agent拥有独立人设、长期记忆和任务认领能力,可主动协作,还能选择云端运行或直接把本地Claude Code、Codex作为“大脑”。
  • • 豆包工作任务支持手机遥控电脑:同账号完成授权后,手机可向电脑Agent下达任务、读取本地资料并操作软件,执行进度和结果实时回传手机。

【其他】

  • • OpenAI发布《The Defender’s Window》安全文章:在Hugging Face入侵事件后,OpenAI提出代码安全、基础设施AI防御、主动攻击面探测和基础安全控制四大防御支柱,并呼吁各组织尽快利用AI强化安全团队。
  • • 字节跳动与美国电影协会达成AI版权保护协议:协议覆盖Seedance视频模型与Seedream图像模型,此前MPA曾针对相关模型发出停止侵权函。需要注意,这是一项加强版权保护措施的协议,并不等同于好莱坞向字节授予完整影视IP训练许可。
  • • OpenAI加入俄亥俄 PORTS-Pike 超大型AI数据中心项目:园区整体规划约 8GW IT 容量,OpenAI作为长期租户使用相关容量;首期4.25GW获得NVIDIA特定信用支持并部署NVIDIA AI计算。

每天的AI资讯⬇️在这里


🤖️ AIGC

HappyShrimp 1.0:不会乐理,也能从一句话生成完整歌曲

阿里巴巴正式发布AI音乐模型 HappyShrimp 1.0,中文名“快乐虾米”。它的重点不是要求用户堆叠 BPM、调性、配器等专业标签,而是直接理解自然语言中的情绪、故事、人物关系和时代氛围,再把这些信息转换成完整歌曲。

  • • 一句自然语言即可开始创作

用户可以输入“想写一首送给高中好友的歌”“一个人在凌晨城市里走路的感觉”等描述,模型会自行把这种叙事转成音乐方案。

  • • 端到端完成整首歌曲

HappyShrimp并不是先单独写歌词、再调用作曲模型、最后合成人声,而是将音乐视为具有语法、语义和上下文的一种连续语言,对歌词、旋律、编曲和演唱进行整体规划。

  • • 支持专业音乐指令

虽然主打低门槛,但模型同样能够理解:

人声性别演唱方式调性BPM配器组合曲风年代感情绪推进

  • • 重点改善AI歌曲常见问题

阿里在发布材料中特别提到人声机械、词曲错位和声音混杂等AI音乐常见痛点,并表示HappyShrimp针对声音细节与整体音乐性进行了优化。

  • • 国内外PC网页端同步上线

HappyShrimp已经提供独立网页创作平台,国内与海外用户均可通过PC网页端体验,新用户目前还提供免费积分。

🌟官方平台:

https://www.happyshrimp.cn/

🌟原始消息:

HappyShrimp 1.0来了!让想象,成为音乐


MiniMax H3 Latent Upscaler:直接在潜空间把低清视频放大

开发者 LBH-123-AI 发布 MiniMax H3 Latent Upscaler。

需要特别说明,这是一款社区工具,并非 MiniMax 官方模型。它针对H3的24通道VAE潜变量设计,允许创作者先快速生成低分辨率视频,再直接在Latent空间中放大并进行高分辨率细化。

  • • 直接处理24通道H3 Latent

它不需要先把潜变量解码成普通RGB视频,而是直接提高Latent的空间分辨率,同时保持时间维度不变。

  • • 目标是加快高分辨率H3生成

推荐流程为:低分辨率生成 → Latent Upscale → 高分辨率重新采样/细化。这样可以减少一开始就在高分辨率下运行完整扩散过程所需要处理的Token数量。

  • • 跳过昂贵的VAE往返
  • • 减少普通插值产生的双像

简单对Latent进行双线性或双三次插值容易产生Ghosting和Double-image。该项目使用训练得到的神经网络Upscaler来完成放大。

  • • 支持1×至4×连续放大
  • • 使用大量Latent数据训练

作者称训练集包含约7万组视频Latent Pair和约8000组2K图片Pair,并覆盖1×至4×多种倍率。

  • • 已经提供ComfyUI节点

开发者可以直接在ComfyUI工作流中添加2D或3D版MiniMax H3 Latent Upscaler。项目使用Apache 2.0许可证。

🌟模型:

https://huggingface.co/LBH-123-AI/Minimax_h3_latent_Upscaler

🌟ComfyUI节点:

https://github.com/LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler


Hi3D V3.0:8月19日上线,达到2048³体素分辨率

Hi3D官方预告,V3.0将于8月19日正式上线

官方将其重点定位在更高几何细节和更精细的3D模型结构。(视频:stefan 3D AI)

已关注
关注
重播 分享
  • • 最高达到2048³ Voxel Resolution

官方称Hi3D V3.0将达到:2048³体素分辨率。

更高的体素密度主要有利于小型结构、边缘和复杂曲面的重建。

  • • 目标是减少后期修模

更高分辨率可以减少输入参考图到最终3D资产过程中丢失的小型几何细节,从而降低游戏、影视、3D打印等场景中的人工修Mesh工作。

  • • 8月19日起免费体验48小时

🌟官方动态:

https://x.com/Hitem3D/status/2089418408916033865


SCoPE:把摄像机轨迹直接写进视频Token的坐标

香港大学、香港科技大学与腾讯ARC Lab联合提出 SCoPE(Sightline-Coordinate Positional Encoding)

已关注
关注
重播 分享

它试图解决AI视频中的一个核心难题:模型虽然能听懂“镜头环绕角色”这样的文字,但并不知道摄像机在真实3D空间中到底应该如何移动。

  • • 输入不再只有图片和Prompt

SCoPE的生成条件包括:

一张输入图片目标Camera Trajectory

因此用户可以给出精确的摄像机运动路径,而不仅是使用“Dolly In”“Orbit”等语言描述。

  • • 给每个视频Token增加第二套位置坐标

普通Video DiT主要知道某个Token位于画面的哪个(x,y,t)位置。

SCoPE还给每个Token加入对应的 Camera Ray,也就是这个像素在3D空间中的视线方向。

  • • 让摄像机几何直接进入Attention

研究团队将Ray Geometry注入Transformer的Query和Key,使不同帧之间的Attention能够理解两条摄像机射线之间的几何关系。

这比在模型外围再添加一个独立Camera Control模块更加直接。

  • • 支持复杂运镜和WASD式控制

Dolly In / OutOrbitCraneS-CurveTruckSpiral真实Camera TrajectoryWASD第三人称移动

  • • 同一个地方重新回来时更稳定

摄像机离开一个区域后再返回,由于复用了相同的Camera Ray坐标,原本看到的建筑和空间更容易保持一致,而不是重新生成一套不同结构。

🌟项目主页:

https://visual-ai.github.io/scope/

🌟开源仓库:

https://github.com/TencentARC/SCoPE


🏭 行业信息

Claude Code /design:设计画布直接进入CLI

Anthropic团队宣布为Claude Code加入新的/design入口,把Claude Design中更加视觉化的画布工作流带入Claude Code CLI和Desktop。

官方团队动态显示,该能力面向付费用户推出,需更新至最新版本。

  • • Claude Code与Claude Design进一步打通

Claude Design本身可以根据描述制作交互原型、视觉设计、Slides和One-pager,并支持直接在Canvas上继续修改。

/design让开发者不必离开Claude Code工作流,就可以快速进入设计阶段。

  • • 适合先设计、再实现

例如开发一个新页面时,可以先让Claude根据需求探索多个UI方向,再将确定的设计继续交给Code实现。

此前Claude Code和Claude Design已经支持双向工作流程,这次进一步降低两者切换成本。

  • • 面向付费用户开放

ClaudeDevs官方表示,Paid Plans用户更新Claude Code至最新版本即可使用。

具体支持范围仍以最新版CLI和Desktop中的实际功能为准。

🌟官方动态:

https://x.com/ClaudeDevs/status/2089471692762673408

https://x.com/nateparrott/status/2089470636796059754


Cursor Origin:Cursor开始自己托管Git代码

Cursor发布 Origin Code Hosting

从8月17日起,该功能作为Early Beta向所有付费方案逐步开放。Cursor不再只是读取GitHub里的代码,而开始直接提供自己的代码仓库、Pull Request和代码浏览系统。

已关注
关注
重播 分享
  • • 可以直接创建Origin Repo

新的Codebase页面允许用户创建仓库,再通过CLI Clone或将现有本地项目Push到Cursor。

仓库地址直接位于Cursor自己的Codebase空间中。

  • • GitHub仓库也能同步进来

用户可以连接GitHub组织,将已有仓库同步到Origin。

对于从GitHub同步的项目,GitHub仍然是Source of Truth。

  • • 同步是实时的

Cursor中的Repo Copy会跟随GitHub更新。

用户可以在Origin里浏览、搜索和Pull代码,但原本从GitHub开始的Repo继续Push回GitHub。

  • • PR实现双向同步

用户在Cursor PR中可以:

查看Diff评论Merge查看Checks

在GitHub上进行的Reply、Reaction等变化也会同步回Cursor。

  • • 开始集成部署与CI

首发已经提供Vercel、Depot、Buildkite等Origin App。

  • • 真正Agent-native能力仍在后续

Cursor明确表示Agent原生功能仍会继续推出。

因此当前Origin核心仍然是代码托管与PR,而不是已经完全取代GitHub的Agent代码平台。

🌟消息地址:

https://cursor.com/changelog/origin-code-hosting

🌟官方动态:

https://x.com/cursor_ai/status/2089399057659596847


Cumora:AI Agent真正进入团队聊天室

开源项目Cumora将AI Agent设计成团队聊天中的“正式成员”。

它们和人类出现在同一Roster、DM、群聊、Kanban和Calendar中,不必等待用户每次主动@它,而是可以拥有自己的记忆、人设和长期工作状态。

  • • Agent拥有Persona和Memory

每个Agent可以保持自己独立的角色、长期记忆和职责,而不是每一轮重新作为一个无状态Chatbot出现。

  • • 可以主动认领任务

Agent能够Claim真实任务,并通过任务认领机制降低多个Agent同时做同一项工作的冲突。

  • • Agent之间可以自行协调

它们可以主动发送消息、交换任务信息,并在发现其他Agent已经更新上下文后重新决定自己的动作。

  • • 支持发送和接收Email

Cumora支持Agent参与真实Email工作流,让它进一步接近普通团队成员。

  • • 提供两种Agent“大脑”方案

第一种是 Cumora Cloud

每个Agent运行在独立云端环境中,通过OpenAI Responses API调用:

BashFilesBrowserEmailMemorySkills

等工具。

第二种是 BYOA(Bring Your Own Agent)

用户可以直接把自己的Claude Code或Codex CLI作为Agent的大脑,并使用自己的订阅。

  • • 完整支持本地部署

项目提供Web与跨平台客户端,并开放完整源代码和本地部署方案。

  • • 采用MIT许可证

项目代码已在GitHub公开。

🌟项目主页:

https://cumora.ai

🌟GitHub:

https://github.com/yetone/cumora


豆包工作任务:手机正式成为电脑Agent遥控器

豆包升级“工作任务”模式。

用户在电脑和手机登录相同账户并完成授权后,可以在手机端向已连接的电脑直接下发任务,让电脑端Agent继续读取本地文件、操作应用和浏览器。

  • • 手机可以接管已有电脑任务

用户离开工位后,可以在手机上继续桌面端尚未完成的任务,也可以直接发起一个新的任务。

  • • 电脑端继续使用本地文件环境

真正执行文件读取、软件操作和复杂桌面动作的仍然是已经授权的电脑。

因此手机更接近远程Agent指挥入口。

  • • 支持多台电脑

此次更新还支持关联多台电脑,并在不同设备之间调用对应运行环境。

  • • 进度实时回传手机

任务执行状态和最终结果会显示在移动端,用户不必一直保持在电脑旁。

  • • 需要更新两端客户端

使用前需要安装最新版豆包电脑版,并把手机App更新至最新版本,再在“工作任务”的电脑环境中完成设备授权。

🌟消息地址:

豆包工作任务上新,手机也能远程操作电脑了


🧠 大模型

Qwen-Audio 3.0:ASR、TTS和实时语音对话形成完整产品线

千问AI平台目前已经形成完整的Qwen-Audio 3.0语音模型体系,覆盖“听懂声音、生成声音、直接实时对话”三条路线,并支持API调用和Token Plan。

  • • Qwen-Audio-3.0-ASR:负责语音转文字

ASR系列负责把输入语音转换为文字,并针对专业术语、上下文和不同语言进行优化。

  • • 实时ASR支持边说边出字

Streaming版本专门针对低延迟、高并发场景优化,可用于:

会议客服实时字幕语音助手

  • • Qwen-Audio-3.0-TTS:负责文字变声音

TTS系列支持多语言和中文方言,并可以控制:

情绪语气角色语速音量声音风格

  • • Realtime负责实时语音到语音

Qwen-Audio-3.0-Realtime可以持续接收声音并直接生成语音响应。

开发者不必自行串联:

ASR → LLM → TTS

三套独立API。

  • • 支持多轮语音上下文

实时模型可以在连续对话中保留此前的语音和文本上下文,用于语音助手、客服和实时Agent。

  • • 完整进入Token Plan

千问Token Plan当前已覆盖:

Qwen-Audio-3.0-ASRQwen-Audio-3.0-TTSQwen-Audio-3.0-Realtime

🌟原始消息:

Qwen-Audio-3.0系列语音模型正式上线千问AI平台

🌟模型市场:

https://www.qianwenai.com/models


📜 其他

OpenAI:Hugging Face事件后,“防御窗口”已经打开

OpenAI发布《The Defender’s Window》。

文章认为,前沿AI模型正在快速提升网络安全与网络攻击相关能力,因此防守方需要尽快把AI Agent纳入日常安全体系,趁攻击能力进一步普及之前扩大防御优势。

  • • AI正在降低真实网络攻击门槛

OpenAI认为,前沿模型已经越来越能够自动完成:

漏洞发现代码分析凭证利用攻击路径分析复杂网络任务

中的部分环节。

  • • 第一支柱:让AI检查AI时代的软件

Codex及安全工具可以参与Code Review、漏洞扫描和修复。

目标不是制造更多需要人工阅读的告警,而是缩短:

发现真实问题 → 生成修复 → 安全上线

之间的时间。

  • • 第二支柱:AI持续防守基础设施

AI系统可以首先处理大量Security Alert,再决定什么时候把人类安全工程师拉入调查流程。

部分检测结果还可以连接受到严格限制的自动响应机制。

  • • 第三支柱:持续主动寻找攻击路径

模型可以不断枚举和检查:

漏洞错误配置权限过大的账户意外Trust Boundary

目标是在攻击者真正利用之前发现并关闭路径。

  • • 第四支柱:传统安全基本功仍然重要

OpenAI仍强调:

最小权限网络隔离防御纵深Workload Hardening监控安全补丁与部署

AI没有取代这些基础措施。

  • • 呼吁安全团队现在就使用Agent

OpenAI将当前阶段称为“Defender’s Window”。

核心判断是,防守方目前仍有机会先于攻击方大规模使用AI,因此组织不应等待全部业务完成AI转型后,才开始为Security Team配备Agent。

🌟消息地址:

https://openai.com/index/the-defenders-window/


字节跳动与MPA达成协议:Seedance和Seedream加强版权保护

据路透社报道,字节跳动与美国电影协会 Motion Picture Association(MPA) 达成协议,将加强旗下AI视频和图像生成模型的版权保护措施。

协议覆盖Seedance与Seedream。

  • • 事件源于此前版权争议

MPA此前曾向字节跳动发送Cease-and-desist Letter,质疑相关AI生成工具处理电影IP和受版权保护角色的方式。

  • • Seedance与Seedream均在协议范围

此次协议涉及:

Seedance视频生成Seedream图像生成

  • • 核心是加强版权Safeguards

双方合作方向是强化生成式AI工具对受版权保护素材的防护与控制。

  • • 并不等于获得全部好莱坞IP训练授权

路透社将其描述为版权保护协议,而不是向字节提供完整影视内容库训练许可证。

🌟消息地址:

https://www.reuters.com/legal/litigation/bytedance-signs-ai-copyright-pact-with-hollywood-trade-group-2026-08-17/

PORTS-Pike:OpenAI锁定约8GW算力园区,首期4.25GW获NVIDIA支持

OpenAI、SB Energy与NVIDIA宣布推进俄亥俄州 PORTS-Pike Technology Campus

需要区分两个数字:

OpenAI协议锁定的是园区 约8GW IT总容量

其中首期约 4.25GW 获得NVIDIA针对相关基础设施的信用支持。

  • • 整个项目约8GW

OpenAI已经签署协议,计划使用PORTS-Pike约8GW IT容量。

NVIDIA拥有把当前支持范围从4.25GW继续扩展至剩余容量的选项。

  • • 首期4.25GW

NVIDIA公布的Initial Deployment目标约为:

4.25 IT-GW

因此,“初期4.25GW”是正确的,但不能把它理解成整个PORTS-Pike只有4.25GW。

  • • SB Energy负责建造、持有与运营

SB Energy将:

BuildOwnOperate

整个数据中心,并与OpenAI签订长期租约。

OpenAI主要作为算力园区长期租户,而不是数据中心主体所有者。

  • • 采用NVIDIA AI计算设施

PORTS-Pike将部署NVIDIA AI Compute基础设施,包括GPU、CPU、Networking及软件栈。

  • • NVIDIA同时投资SB Energy

NVIDIA同时向SB Energy进行投资,并针对首期4.25GW的土地、电力和部分基础设施建设提供信用支持。

  • • 担保不是替OpenAI承担全部租金

NVIDIA的支持覆盖租约、电力及指定Residual-value承诺中的特定部分,并不等于承担OpenAI所有租赁和数据中心建设成本。

  • • 首批约800MW预计2028年上线

OpenAI预计首批约800MW容量将在2028年投入使用,后续扩建需要新增发电、输电和配套基础设施。

🌟OpenAI官方公告:

https://openai.com/index/openai-joins-ports-pike-project/

🌟NVIDIA官方公告:

https://nvidianews.nvidia.com/news/nvidia-guarantees-sb-energy-s-ports-pike-technology-campus-in-ohio-to-exclusively-host-nvidia-ai-compute

文章由AI生成,存在错误,请谨慎阅读