📋 今日要点
- 🔥 今日聚焦—— DeepSeek开源Harness:AI Agent的"安卓时刻" · Codex半夜喊人
- 📰 AI新闻—— 🧠 智谱GLM-5.3 · OpenAI营收破400亿 · 苹果×阿里自研中国模型
- 🤖 AI+机器人与多模态—— LG×英伟达人形机器人 · FLUX 3多模态模型
- 💡 AI落地案例—— LG×英伟达工厂人形机器人 · 苹果×阿里Apple Intelligence中国版
- 🔧 AI小妙招—— AI画的主体还行,但总像贴纸?因为你少了这一步
- 🧰 AI百宝箱—— Trellis 2:2D草图秒变3D模型
- 🎙️ 播音员寄语—— 月亮姐姐的早安寄语
🔥 今日聚焦
一、DeepSeek开源Harness:AI Agent的"安卓时刻"
8月13日晚,DeepSeek正式开源Agent运行框架DeepSeek Harness(命令行名dsh),采用MIT协议。上线12小时GitHub Star破5万,增速超过当年OpenClaw(史上增长最快仓库)的80倍。这不是一个普通的技术发布,而是AI Agent生态格局的分水岭。此前,Agent开发高度依赖闭源平台,开发者在工具选择上受制于人。Harness采用MIT协议完全开源,任何人——从大厂团队到独立开发者——都可以免费使用、修改和部署,Agent开发从此有了真正的"公共基础设施"。它打破了"最强模型=最强Agent"的逻辑:模型可以各家自选,真正决定Agent能力的是框架层的工程水平。
核心公式:Model + Harness = Agent
DeepSeek用一句话概括了Harness的定位:模型是脑子,负责推理和判断;Harness是手脚,负责上下文管理、工具调用、任务调度、权限审批。核心架构基于Cordis插件系统,信条是"一切皆插件"。值得一提的是,这个框架由DeepSeek核心团队成员崔添翼主导开发,他本科毕业于浙大计算机系,是DeepSeek创始人梁文锋的校友。同一天,DeepSeek V4 Pro正式版上线,8月17日起API实行峰谷定价。
二、为什么说这是"AI Agent的安卓时刻"?
在此之前,Agent开发是一片"各自为战"的荒地。OpenAI有自己的Assistant API,Anthropic有自己的Computer Use,Google有自己的Vertex AI Agent——每家都是"模型+平台"打包绑定,开发者选了一个平台就被锁死在一个生态里。想做Agent,首先得想好用谁家的"全家桶",这和大厂自建机房的时代如出一辙。
Harness的出现,相当于在手机行业混沌期扔出了一个安卓系统。当年安卓出现之前,诺基亚用塞班、苹果用iOS、微软用WP,开发者得为每个平台重写应用。安卓统一了底层,开发者只需要写一次代码,就能跑在所有安卓手机上。Harness要做的,是让Agent开发者不再为"底层怎么接工具、怎么管上下文、怎么调度任务"这些重复劳动发愁——框架层统一了,开发者可以把精力集中在业务逻辑上。
更关键的是,这打破了"最强模型=最强Agent"的垄断逻辑。过去大家默认:谁家的模型最强,谁家的Agent就最聪明。但Harness证明了一件事——模型是大脑,框架是手脚,大脑再聪明,没有灵活的手脚也干不了活。这意味着中小团队用开源模型+Harness框架,完全可能做出比大厂闭源平台更好用的Agent产品。Agent的竞争维度从"谁的模型强"变成了"谁的框架工程做得好"。
对中国AI产业而言,这是模型层突破之后的又一关键拼图。DeepSeek-V3在模型层已经证明了开源可以超越闭源,现在Harness在Agent工程层又补上了"基础设施"这一环。从此中国开发者做Agent,从模型到框架都有了自主可控的开源选择,不再完全依赖美国平台。12小时5万Star的爆发式增长,正是全球开发者对这种"开源基础设施"的渴求——大家等的,就是这样一个东西。
📚 延伸阅读推荐:如果你想系统学习Harness框架和Agent工程,强烈推荐那云阳的《Harness工程:从上下文管理到Agent系统构建》(人民邮电出版社),从基础到实战全面讲解。点击下方商品卡片即可直达👇
▼ 点击下方卡片购买 ▼
三、Codex半夜用扬声器把人喊醒了
一位开发者睡前让OpenAI Codex自己跑任务,交代它在需要时自己点重置,实在不行再叫他。结果Codex因用户未插入YubiKey导致SSH连接卡住,先尝试系统通知(notify-send)提醒,3分钟没回应;再让屏幕疯狂闪烁,还是没人;最终直接调用spd-say语音合成命令,让电脑扬声器大喊"请摸YubiKey",凌晨2点把人从床上喊起来救场。
网友评价:AI自己解决不了,就把能解决的人叫醒来帮我吧。这件事暴露了Agent自主性的边界问题——当AI碰到权限/硬件瓶颈时,升级式求助(通知→闪屏→语音)的设计很聪明,但也提醒我们:给Agent配权限和通知边界要提前设好。
📰 AI新闻
🧠 大模型发布与迭代
智谱发布旗舰模型GLM-5.3,编程能力提升50%——8月14日,智谱正式发布新一代旗舰模型GLM-5.3,拥有7430亿参数(MoE架构),与GLM-5.2共用基座,所有能力提升均来自后训练Scaling优化。科技日报报道,GLM-5.3编程能力提升约50%,在多项主流基准测试中位居所有开源模型第一,网络安全领域表现更超出预期。智谱宣布模型将在两周内开源,进一步巩固国产大模型在开源生态中的领先地位。
OpenAI年化营收突破400亿美元——彭博社8月14日报道,OpenAI在IPO前夕交出亮眼成绩单:年化营收已超400亿美元,较2025年底约200亿美元实现翻番。增长引擎主要来自AI编程工具Codex——用户规模三个月增长5倍,周活跃用户突破200万。此外,订阅业务持续渗透,广告业务开始贡献增量收入。OpenAI拒绝就具体数字置评。
🌐 AI应用与战略布局
苹果联合阿里自研中国专属大模型——路透社8月14日独家报道,苹果已专门面向中国市场训练了一款自研大语言模型,由苹果与阿里巴巴合作研发并在阿里支持下完成训练。这标志着苹果在华AI策略的重大转折——此前苹果一直依赖第三方模型为中国市场提供AI功能,如今首次转向自研路线。该模型预计将在未来几个月随iOS系统更新在中国正式上线,Apple Intelligence国行体验即将落地。
🤖 AI+机器人与多模态
LG与英伟达联手推出人形机器人,2027年Q1亮相——LG电子与英伟达8月13日在英伟达加州总部签署战略合作备忘录,LG集团董事长具光模与英伟达CEO黄仁勋出席签字仪式。双方宣布将于2027年第一季度推出一款基于英伟达Isaac GR00T开放人形机器人基础模型和Jetson Thor芯片的下一代双足行走人形机器人。合作覆盖机器人、AI工厂和移动出行三大领域,LG将在昌原工厂设立试点产线。
Black Forest Labs发布FLUX 3多模态基座模型——德国AI初创公司Black Forest Labs发布FLUX 3,基于Self-Flow统一架构,集成图像、视频、音频和动作四种专用编解码器,首次实现原生音频生成——可一次性产出最长20秒的高清同步音视频内容。FLUX 3在Arena文生视频榜单中冲至第二名,官方宣布限时免费开放至8月16日。
💡 AI落地案例
💡 案例一:LG×英伟达——人形机器人进入工厂产线
LG电子与英伟达的合作不仅停留在实验室阶段,而是明确瞄准了制造业场景。LG将在昌原工厂设立试点产线,部署基于Isaac GR00T和Jetson Thor芯片的人形机器人,承担双足行走、物料搬运、产线巡检等任务。这是全球范围内头部电子制造企业首次与AI芯片巨头联手,将通用人形机器人基础模型直接部署到真实工厂环境中。
落地亮点:不是概念验证,而是直接在生产线上试点。英伟达Isaac GR00T提供"大脑"(具身推理+全身控制),Jetson Thor提供"小脑"(实时运动控制),LG提供真实的工厂数据和场景。三方资源协同,有望在2027年实现人形机器人在制造业的规模化部署。
💡 案例二:苹果×阿里——Apple Intelligence中国版即将落地
苹果与阿里巴巴联合训练的中国专属大语言模型,是Apple Intelligence入华的关键一步。此前Apple Intelligence在中国市场长期缺位,用户无法享受AI功能。此次合作意味着苹果首次放弃纯第三方路线,转向深度定制自研模式——由阿里提供训练支持和中文语料优化,苹果负责模型架构和端侧部署。
落地亮点:该模型将随iOS系统更新在中国正式上线,覆盖Siri增强、邮件智能回复、照片编辑等核心场景。对国内2亿iPhone用户而言,这意味着Apple Intelligence终于不再是"别人家的功能"。
🔧 AI小妙招:AI画的主体还行,但总像贴纸?因为你少了这一步
💡 痛点:主体描述写得不错了,但画面看起来总是「悬浮在白底上」,没有沉浸感——因为你还没给它一个「世界」。
🛠 工具:任意AI生图工具(即梦、通义万相、Midjourney等均可)
⏱ 耗时:5分钟学会
【AI生图咒语公式·五天精通 Day 2/5】
📢 系列预告:AI生图咒语公式·五天精通
你是不是经常觉得AI生图很「玄学」——同样的工具,别人的图像大片,自己的图像废稿?问题不在工具,在提示词。
我们用一个五段式公式来拆解:
每天深讲一步,5天下来你就能写出专业级提示词,不管用什么AI生图工具都通用。
下面是今天的课程。
昨天讲了第1步「主体」——怎么把你想画的人说清楚。今天进入第2步:环境。
很多人写的提示词只有主体——「一个女孩」「一只猫」「一栋房子」——然后奇怪为什么生成的图看起来像证件照,或者像把人物抠下来贴在白色背景上。
答案就两个字:没有环境。
环境是什么?就是你把主体放在哪里。同样的主体,放在不同环境里,画面传达的信息完全不同。一个穿红裙子的女孩——在樱花树下是浪漫,在废墟中是末日感,在霓虹街头是赛博朋克。主体没变,但环境讲了一个完全不同的故事。
为什么环境这么重要?
三个原因:
第一,环境给画面"锚点"。没有环境的画面是悬浮的,观众不知道该把注意力放在哪。有了环境,主体就有了"根"。
第二,环境制造氛围。咖啡馆的温暖、雨天的忧郁、山顶的壮阔——这些都是环境自带的"情绪标签",不需要你额外写"温暖的氛围",环境本身就是氛围。
第三,环境增加故事感。一个坐在书桌前的人,和一坐在山顶上的人——你会自动脑补他们截然不同的故事。环境是无声的叙事者。
环境描述的万能框架:三问法
不知道怎么描述环境?问自己三个问题:
1. 在哪?——具体的地点类型(咖啡馆/街道/森林/太空站/图书馆) 2. 什么时间?——时间段带来光线和氛围变化(清晨/午后/黄昏/深夜) 3. 周围有什么?——环境中的关键元素(木桌上有咖啡杯/地上有落叶/远处有霓虹灯牌)
三个问题回答完,你的环境描述就有了。
举个例子: - 在哪:日式咖啡馆 - 什么时间:午后 - 周围有什么:阳光从落地窗洒进来,木桌上放着一杯拿铁
合在一起:「午后阳光从落地窗洒进日式咖啡馆,木桌上放着一杯拿铁,旁边坐着一个看报纸的人」。画面感马上就来了。
环境描述的三个层次
层次1:只写地点类型 「在咖啡馆里」——这是最基础的,AI知道大概在咖啡馆,但具体长什么样它瞎猜。
层次2:地点 + 时间 + 氛围关键词 「午后的复古咖啡馆,暖黄色灯光,墙上挂着老照片」——画面立刻有了质感。
层次3:地点 + 时间 + 具体细节 + 互动元素 「午后的复古咖啡馆,阳光从百叶窗投射出条纹光影,老式唱片机在角落播放黑胶,咖啡杯上的拉花还没散开,旁边翻开的书页被风微微掀起」——这种级别的描述,AI生成的图能直接当壁纸。
新手建议从层次2开始练,熟练后自然过渡到层次3。
正反对比
❌ 反面:「一个女孩在城市里」——"城市"太宽泛了,是纽约还是东京?白天还是夜晚?繁华大道还是老旧小巷?AI只能给你一个模糊的城市轮廓。
✅ 正面:「一个女孩站在东京涩谷的十字路口,夜晚,霓虹灯倒映在雨后的柏油路上,周围是撑着透明雨伞的人流」——具体到哪个城市、哪条路、什么天气、什么时间、什么细节。这才是AI能"看到"的环境。
❌ 反面:「一个人坐在公园里」——没有季节、没有天气、没有时间段,AI给你一个"标准公园"。
✅ 正面:「深秋的公园,金黄银杏叶铺满了长椅旁边的石板路,夕阳从树冠间隙照下来,长椅上放着一杯外带咖啡和一本翻开的书」——有季节感、有时间感、有细节。
常见误区
误区1:环境写得太满。把每个角落都描述得密密麻麻,AI反而不知道重点在哪。环境是给主体服务的,写3-5个关键元素就够了。
误区2:环境和主体风格冲突。你写了一个仙侠风的女侠,环境是纽约时代广场——除非你刻意追求这种反差,否则AI会很困惑。确保环境和主体在同一个"世界观"里。
误区3:忘了光线来源。环境描述里最好暗示光线方向。「阳光从左侧窗户照进来」——这给AI一个明确的光源,画面会有更强的立体感。
今日作业
找一个你喜欢的场景——咖啡馆、海边、山顶、老街、图书馆——用三问法描述它:在哪?什么时间?周围有什么?
写完后,把同一个主体放进三个不同环境里,生成三张图做对比。比如同一个"短发女孩看书"的画面,分别放在「雨天咖啡馆」「春日樱花树下」「深夜天台」——看看环境是怎么彻底改变一张图的气质。
做完这个练习,你会真正理解"环境是画面的第二主角"这句话。
明天第3步:光线——AI图有没有"高级感",80%取决于光线的写法。
🧰 AI百宝箱 —— Trellis 2:2D草图秒变3D模型的免费神器
你脑子里有个超酷的机甲草图,想把它变成3D打印出来。以前你得花几千块找建模师,或者苦学Blender半个月。现在?把图丢进Trellis 2,喝口水的功夫,一个360度可旋转、带贴图的3D模型就出来了。不管是3D打印爱好者、独立游戏开发者,还是想给女朋友做3D盲盒的直男,这工具都能让你瞬间变身大师。
🎯 解决什么问题
专业3D建模软件学习成本极高,普通人难以入门 找外包建模师价格昂贵且沟通成本高 2D概念图转化为3D资产耗时长,难以快速验证创意
👥 适合谁用
⭐ 核心优势
真正的傻瓜式操作,无需任何3D基础,上传图片即可生成 生成速度快,通常几十秒内就能输出带有完整贴图的3D资产 支持导出GLB/OBJ等通用格式,无缝接入Blender、Unity等主流工作流
⚖️ 同类对比
🎙️ 播音员寄语 —— 月亮姐姐的早安寄语
今天是2026年8月15日,感谢收听学伴驿站AI日报。 本期我们关注了DeepSeek开源Harness框架——这是首个面向AI Agent开发的开源运行框架,让开发者可以基于它快速搭建Agent系统。也看到了Agent自主性的边界——Codex半夜喊人救场,提醒我们给AI设权限边界的重要性。 今天还有几条重磅新闻:智谱GLM-5.3以7430亿参数拿下开源编程SOTA,苹果与阿里联手打造中国专属大模型,LG和英伟达宣布2027年推出工厂人形机器人,OpenAI年化营收在IPO前夕突破400亿。AI正在加速从实验室走向真实世界。 Trellis 2让2D草图秒变3D模型,3D打印和独立游戏开发的门槛再次降低。AI生图咒语公式系列进入第2天,今天学的是"环境"——给画面一个世界。 新的一天,一起加油。
夜雨聆风