“养龙虾”这波热闹,真正把一件事讲透了:很多人并不是不想用智能体,而是装不起、养不起、也不敢把数据随手丢上云。
所以AMD这次抛出的“智能体主机”(Agent Computer)概念,关键不在新名词,而在它把一台专门跑AI的机器,从“发烧友玩具”往“可计算的生产工具”上推了一步。

翻译成人话:一台电脑给人用,另一台电脑给Agent用。
前者还是熟悉的PC逻辑——人坐在屏幕前,开软件、点按钮、一步一步下命令。后者换了驱动方式,它不等你盯着屏幕发号施令,而是持续在线,收到微信、Slack、Messages里的任务就开始干活,再把结果回给你。
这不是科幻,倒更像“专机专用”的回归。过去公司有文件服务器、打印服务器、渲染工作站,现在只是多了一个AI工种,它也开始要求独立硬件资源。

这件事为什么偏偏现在被单独拎出来说?因为智能体和普通本地模型最大的区别,不只是“能不能跑”,而是“能不能同时跑、持续跑、带着记忆跑”。
素材里给了一个很实在的算法。基础版“龙虾”,为了记忆文件、技能规范、自学习上下文这些东西齐活,显存不能小于10GB;如果你想一人带多个AI员工,不同方向并发工作,那就是N个10GB往上叠;再加私有知识库,不少于20GB;如果还想把至少35B参数的大模型留在本地,避免Token费用失控,又要吃掉25GB以上显存。
这几项加起来,结论就出来了:可用显存至少64GB。
这是什么概念?不是“能亮机”的64GB,也不是参数表上写着好看的64GB,而是能真正留给模型、上下文、知识库和并发任务调度的那部分空间。很多人聊本地AI时只盯TOPS,真正卡住体验的,往往是显存和内存池。

也正因为如此,AMD这套说法里最有杀伤力的,不是Zen 5、RDNA 3.5、XDNA 2这些架构名词本身,而是128GB统一内存、最多96GB可划分显存这组配置。
算术很简单:当你要喂一个35B级别模型、再挂上知识库、再开多个智能体,传统独显方案很容易进入“卡够强,但显存不够;显存够了,成本又上去了”的局面。AMD锐龙AI Max平台的思路,是直接用统一内存把这道门槛压低,让“多Agent并发”这件事至少在账面上成立。

素材里还给了几组跑分口径。基于Qwen 3.5 35B A3B,单个OpenClaw智能体输出速度可达45 tokens/s,10,000个输入token处理大约19.5秒,最大上下文长度26万;并发时最多6个智能体,每个都能跑到9.5万上下文。换更大的Qwen 3.5 122B A10B,单个智能体仍接近20 tokens/s,还能同时跑两个9.5万上下文智能体。Qwen3-coder-next超过40 tokens/s,GPT-OSS-120B超过50 tokens/s。
这些数字先别急着当成所有场景下的通用答案,它们首先是厂商给出的测试结果,价值在于证明一件事:这类机器不再只是“能本地启动一个模型”,而是开始碰到“能不能当AI工位长期用”的门槛线。

更关键的在后面。
如果你只是偶尔问问模型、写写摘要、生成几段代码,那真不一定需要第二台电脑,普通PC加云端服务照样够用。可一旦你的需求变成固定流程、私有数据、长期在线、多人协作,智能体主机的意义就出来了:它买的不是极限性能,而是把成本、安全和稳定性放到一台专门机器里统一解决。
这才是“养龙虾”给行业留下的真正启发:AI普及的下一步,不只是模型继续变大,而是设备开始分工,PC继续服务人,另一台机器开始服务Agent。
名字可以再讨论,账已经算明白了。
温馨提示:文中参数、显存划分、推理速度等信息整理自公开资料与厂商展示口径,后续量产配置或测试环境若有调整,请以官方发布和实际产品页面为准。
夜雨聆风