

ChatGPT桌面端上线GPT-Live语音
OpenAI正式为ChatGPT桌面应用推出GPT-Live语音模式,覆盖macOS和Windows平台。该功能基于7月8日发布的新一代语音模型GPT-Live,支持实时双向对话——用户可随时打断,AI接着最新指令继续执行,告别传统“先录音、再转文字”的笨办法。

更关键的是,语音不仅用于聊天,还能直接指挥Work和Codex中的多个AI智能体协同干活。用户开口就能启动任务、查询进度、协调多个Agent各司其职。macOS用户还可借助Appshots功能,让ChatGPT读取当前屏幕窗口内容,结合本地文件一起理解。
Claude语音模式全面升级,支持Opus与Sonnet
Anthropic宣布对Claude语音模式进行重大升级,将其最强大的Opus和Sonnet模型引入语音交互。此前语音模式仅支持轻量级Haiku模型,虽然响应快但深度不足。升级后,用户可在Opus、Sonnet和Haiku三档模型间自由切换,语音模式默认沿用文字聊天中最近使用的模型。

更关键的是,语音模式现已接入Gmail、Google Calendar、Slack、Canva、Notion等工具。用户可直接通过语音指令更新会议时间、起草邮件或总结对话生成简报。支持语言扩展至英语、法语、德语、日语、韩语等10种语言。
OpenAI版“阿福”上线:ChatGPT Health全美开放
OpenAI面向全美18岁及以上用户正式推出ChatGPT Health功能。经用户授权后,ChatGPT可连接Apple Health数据及美国部分医疗机构的电子病历,涵盖用药记录、化验结果、就诊信息、睡眠和运动等多维度健康数据。


该功能可在日常对话中自然调用健康信息——用户规划膳食时可考虑食物过敏,安排活动时可参考近期受伤情况。早期测试中,超过70%的健康相关对话发生在专门的健康页面之外。在OpenAI的健康评测中,GPT-5.6 Sol在准确度(91%)、沟通清晰度(86.7%)和健康决策帮助性(83%)上均领先医生撰写的回答。
Flux3发布:首个原生生成音频的多模态模型
由Stable Diffusion创始团队组建的德国黑森林实验室,正式发布多模态基础模型Flux3。该模型采用统一架构联合学习图像、视频与音频,是首个支持原生音频生成的多模态模型,单次可输出最长20秒音画同步的720p视频。

能力覆盖文生视频、图生视频、视频续写、关键帧转场及多角色对话等场景。早期评测中,Flux3以93%的胜率压制Luma Ray3.2,对Runway Gen-4.5也有77%的胜率优势。
腾讯Miora全量上线:多智能体协同重构内容生产流程
腾讯宣布首个自研创意智能体Miora(腾讯设计妙境)正式全量上线。Miora基于与WorkBuddy同源的智能体架构,采用多AI Agent协作模式——用户提出创作目标后,系统自动拆解任务,将图片、视频、3D、UI等需求分派给对应的专家智能体处理,在同一画布内输出风格统一的整套创意资产。

Miora具备智能体记忆系统,能记录用户的创作习惯、审美偏好及品牌规范,在使用中逐步形成个性化创作能力。编辑层面支持框选、圈画、字体编辑等操作,用户可直接选中区域并通过自然语言完成修改。
三星Galaxy Glasses亮相,内置Gemini全天候助理
三星正式发布首款AI智能眼镜Galaxy Glasses,由三星联合谷歌、Gentle Monster、Warby Parker联合研发。整机重量仅50克,未搭载传统AR显示屏,依靠镜框两侧高清摄像头捕捉实景,将视觉信息传输至Gemini大模型完成识别分析,通过镜内音频单元播报结果。

硬件搭载高通骁龙AR1 Gen1芯片、1200万像素传感器,支持30帧全高清视频录制。依托Gemini多模态能力,覆盖办公、出行、沟通场景——会议中可自动拍摄白板文字并归档至三星笔记,出行时提供实景语音导航,支持多国语言实时翻译。手机消息可由AI提炼朗读,通话时可免提分享第一视角画面。眼镜单次续航9小时,配套充电盒可完成7次补电。
阿里发布Qwen-Image-3.0
阿里正式发布第三代图像生成基础模型Qwen-Image-3.0。核心突破在于将文本输入长度提升至4.5K Token,较前代提升4.5倍。用户无需压缩需求,可像给设计师写需求文档一样完整描述画面结构、文字内容、视觉风格和排版细节。

模型可一次生成涵盖公式符号、几何图形、逻辑推导步骤的知识图解及复杂UI界面。支持12国语言和20多款字体原生渲染,可精准还原低至10像素的小字。实测中,模型能根据一条复杂指令同时生成VSCode编程界面、千问App界面、聊天界面和咖啡海报等多层UI嵌套画面。目前已在阿里云百炼、千问AI平台开启API邀测。
本文素材来源互联网,如有侵权请联系删除
END


夜雨聆风