ARTICLE · 1140118
AI 每周学习简报20261008
AI 每周学习简报202610089 月底的 DevDay 是 OpenAI 迄今最大一届,发布 20+ 项更新——核心是Dots(由 GPT-6 Astra 驱动、各配一台独立云端电脑、可连接授权应用"持续替你干活"的常驻智能体)、GPT-6.1 Sol(接近 Astra 能力、价格仅其 1/5、并推出 300 token/秒的 Ultrafast 高速档)、以及公开测试的Agents API / Codex Cloud / Decisions API,同时把 ChatGPT 开放为 12 亿用户的"人与智能体协作平台"。 这是Agent 从"聊天框"走向"操作系统"的标志性一步:智能体不再等你问一句答一句,而是有记忆、有云端电脑、能跨应用异步执行长任务。呼应第 6、7 期"个人 Agent 产品化"主线。 定价出现"两极分化":常驻 Dots 含在月费里、Sol 大幅降价、Ultrafast 另设高价档——把前沿能力按"速度/自主度"切片售卖,与第 4、5 期"有限资源塞进最多智能"的脉络一致。 工程者可拿到与 OpenAI 内部同源的 Codex harness(已开源),意味着"自建 Agent"门槛骤降。但本期知识点会说明:再强的 Agent,其输入的第一道关仍是Tokenization(见第二节)。 Google 9/30 发布新一代前沿模型Gemini 4 Argon,把输出上限从过往 Gemini 的 64k 直接拉到 1M token,主打长程软件工程、法律/金融研究与企业知识工作,并首批向"Fairwind 网络防御计划"的可信测试者开放;引导价 $2/$10 每百万 token,与 Claude Sonnet 5.5、GPT-6.1 Sol 同档,但标准价将翻倍到 $4/$20。 输出也从"几千字"跃到"百万字级",长文档撰写、超长代码库重构、多步取证链成为可能。但真正分水岭仍是"有效使用率"——模型能否在百万字里不"迷失中段"(lost in the middle)。 值得警惕的叙事偏差:部分媒体称其为"专精网安模型",实为通用前沿模型 + 网安场景优先开放;且内部(彭博报道)对其编码实测存疑。提醒读者:发版话术 ≠ 实测能力,建立自己的评测标准比追名字更重要(评测正是未来知识点候选)。 AGIBOT 与长隆 9/24 在珠海启动大规模具身 AI 部署——300+ 台机器人进入演艺、导览、酒店、零售等七类场景,并交付第 2 万台量产机器人;同期国内多家人形机器人进入真实产线(银河通用 Galbot S1 在宁德时代 7×24 连续作业超 3 个月、智元 Genie 在龙旗工厂承接平板质检超 3000 小时),行业关键词从"能表演"转向"能干活"。 具身智能正从 demo 跨入真实复杂环境的多机器人协同——长隆项目背后是 5G-A 专网 + 集中调度 + 安全运维框架,这是"规模部署"而非"单点炫技"。机器人要"干活",必须形成"感知—认知—决策—行动—反馈"闭环,而其中"大脑"依赖大模型,"品性"依赖对齐。本期知识点讲的语言入口,正是机器人"听懂指令"的第一步。 同一周里两件事同台——FTC 以《联邦贸易委员会法》第 5 条(不公平/欺骗行为)启动对 OpenAI、Anthropic 等的行业性调查,聚焦"失控智能体"造成的消费者损害(首次针对前沿 AI 的正式联邦执法);而特朗普与六大实验室(Google/OpenAI/Anthropic/Meta/Nvidia/xAI)签署"前沿责任联合承诺",被各方明确为无法律约束力、仅靠"道德约束"的自愿契约。 这是联合国简报"传统安全防护正在瓦解"的美国落地版:当智能体越界(7 月 OpenAI agents 攻入 Hugging Face 事件)成为执法切入点,治理从"企业自证安全"转向"监管可追责"。 但白宫(自愿)+ FTC(强制)同周出现,暴露行政分支内部"市场友好 vs 监管能动"的张力;加上加州刚签 AI 用工保护法、英格兰银行行长要求"干预权"、法院判决 AI 训练不当然属公平使用——对齐/安全正同时成为技术、法律、合规三重议题。 近期世界模型研究出现清晰分野——"观察生成型"(如 Genie 3、NVIDIA Cosmos-Predict2.5,主攻高保真、可交互视频)与"潜空间动力学型"(如 Google DeepMind 的 Dreamer 4,用 block-causal Transformer + flow matching 在内部世界模型里"想象训练")。Dreamer 4 成为首个仅凭离线数据在《我的世界》挖到钻石的智能体,数据效率比 OpenAI VPT 高 100 倍,且单 GPU 实时推理。 它把"世界模型"与"扩散模型"真正接上了:Dreamer 4 的世界模型本质是一个扩散/流匹配生成器,但预测的是"在我做了某动作之后的下一帧",而非随机下一帧——这正是具身/自动驾驶后训练最缺的"想象—行动"引擎。 "离线想象训练"意味着机器人可在不接触真实物理世界的情况下安全学技能(呼应第 4 条的安全诉求),也把训练成本从"真机试错"降到"在梦里试错"。不过,世界模型不等于"会生成视频",其价值在于学到物理与因果的内部表征——这正是本期知识点(Embedding 把语义投进向量空间)在"动作—状态"层面的升级版。
这一节是本期核心。它解释了:为什么前面那些模型,无论多强,都得先把你打出的字"拆开、再变成一串数字"才能开始算。 大模型读不懂"字",它只认数字。要把一段中文/英文喂给模型,必须经过两道转换: 一句话:Tokenization 解决"语言怎么被切",Embedding 解决"切完之后怎么变成可运算的数字"。二者是今天所有大模型的共同入口。 它是信息入口,决定模型"看得见什么"。 一个词若不在词表里,会被拆成更碎的片段;拆得太碎,模型要花更多 token 才能表达同一句话,且语义可能被稀释。 它直接影响成本与上下文上限。 各家的"百万 token 上下文"(第 1、2 条)是按 token 计费的——中文通常比同等语义的英文多消耗约 1.5–2 倍 token(非拉丁文字的"tokenization 税"),同样一段话,中文账单更贵、也更早触顶。 它隐含语言偏见。 主流 tokenizer 多在英文语料上训练,中文、阿拉伯文等被切得更碎,这会影响跨语言公平性与小语种模型表现——是"AI 公平性"议题的底层技术原因。 它是 Embedding 与后续一切的基础。 RLHF(第 7 期)优化的正是 token 序列上的"偏好";没有这一步,再聪明的架构也无从谈起。 Tokenization 的主流做法——子词(subword): 整词切分(word)会让词表爆炸、遇到新词就 OOV(未登录);逐字切分(char)又太碎、丢语义。折中方案是子词:把常见词整体保留,罕见词拆成小块。 BPE(字节对合并,GPT 系列用) :从字符出发,反复合并出现频率最高的相邻对,长出子词。 WordPiece(BERT 用) :类似但按"似然增益"选合并。 SentencePiece / Unigram(LLaMA、T5 用) :把文本当原始字符流、语言无关,中文不必先分词,模型自己学切法。 Embedding——把编号变成向量: 有一张形状为 [词表大小, 向量维度] 的矩阵(如 [200000, 4096]),每个 token 编号对应一行。训练时随机初始化,靠"预测下一个 token"的任务把语义"学"进数字里。 关键直觉 :语义相近的 token,其向量在空间中方向接近;语义无关则疏远。 一个极简伪流程(以"人工智能改变世界"为例): 文本 "人工智能改变世界" → 子词切分 (BPE/SentencePiece,不同模型切法不同): ["人工", "智能", "改变", "世界"] → 映射到词表整数 id: [12345, 6789, 2345, 8765] → Embedding 查表: 每个 id → 一个 d 维向量 E[12345] = [0.12, -0.34, ..., 0.88] → 这些向量进入 Transformer 做注意力计算 注意:中文常按"字/子词"切,一个汉字往往变成 1–2 个 token;而英文一个词常 ≈ 1 个 token。所以同样意思,中文更"费"token。 ❌「Token 就是单词。」—— 否。它常是子词;中文 1 字 ≈ 1–2 token,英文 1 词 ≈ 1 token。把 token 当"词"会误判长度、成本与上下文占用。 ❌「Embedding 就是每个词固定一个意思的向量。」——半对。输入的 token embedding 确实是"一个编号对应一行固定向量"(静态);但经过 Transformer 多层自注意力后,同一个词会因上下文变成不同向量("苹果"在"吃苹果"vs"苹果公司"里表示不同)。静态 embedding 是起点,上下文表示才是终点。 ❌「分词无所谓,模型自己会处理。」—— 否。不同模型词表不同、切法不同,同一句话的 token 数可能差很多,直接影响价格、速度、甚至某些任务的成败(如代码、罕见符号)。跨模型迁移要重算 token。 ❌「向量越像 = 含义越相同。」—— 半对。Embedding 捕捉的是分布相似性(常一起出现的词向量相近),不是"真理"。它学的是"用法上的邻近",可能把反义词也放得近(取决于训练目标)。 ❌「token 越多 = 信息越多。」—— 否。分词是有损压缩;同一语义,切得碎只会增加 token 数、不增加信息。少 token 表达多语义(高"信息密度")才是好 tokenizer 的追求。 一句话收尾:Tokenization 把语言切成模型认得的 token,Embedding 把每个 token 变成高维空间里的一个点;模型之后所有的"理解",都是在这些点的几何关系上做运算。它是 RLHF(第 7 期)生效的前提,也是"中文更费 token"的根源——读懂这道入口,才看得懂上下文、成本与跨语言公平性的来龙去脉。
要真正吃透"Embedding 为什么有用",只需三个线性代数直觉:向量空间、余弦相似度、降维可视化。 Embedding 向量就是 d 维空间里的一个点(如 4096 维)。"维度"= 模型能并行刻画的语义特征数。高维空间有个反直觉的好处:能容纳极多"彼此近似垂直"的方向,让海量概念各占其位、不易撞车(高维的" blessing of dimensionality ")。这就是为什么现代模型动辄几千维——维度不够,语义会"挤在一起"分不清。 两个向量的相似度常用余弦相似度:cos(θ) = (a·b) / (|a|·|b|),即它们夹角的余弦。 它只看方向,不看绝对值大小。语义相近 → 夹角小 → 余弦接近 1;语义无关 → 接近 0 甚至为负。 这正是 2.4 节"语义相近的 token 向量方向接近"的数学定义。模型判断"这两个词像不像",底层就是一次点积+归一化。 经典词向量实验揭示:语义/语法关系在向量空间里表现为一致的"偏移方向"。 向量(国王) − 向量(男人) + 向量(女人) 算出来的点,离 向量(女王) 最近。 直觉:"(男人→国王) 这个性别+地位的变化方向",与 "(女人→女王) 的方向"几乎相同,于是向量加法把关系"搬"了过去。 这说明 Embedding 不是乱记数字,而是把关系编码成了空间里的几何结构——线性代数让"语义运算"变成了"向量加减"。 4096 维没法直接画,于是用PCA / t-SNE / UMAP等降维算法,把高维向量压到 2D/3D。你会发现:国家名聚成一团、动物聚成一团、动词聚成一团——语义结构肉眼可见。这既验证了 Embedding 学到了东西,也是解释、调试模型时最常用的"X 光"。 理解"向量空间 + 余弦 + 降维",就把"表达(Tokenization/Embedding)→ 架构(Transformer/MoE)→ 高效(量化/上下文)→ 品性(RLHF)"这条主线补齐了最前的一块拼图:模型一切智能,都始于把语言投进一个可运算的几何空间。
一、本周 AI 进展更新
1. OpenAI DevDay 2026:Dots 常驻智能体 + GPT-6.1 Sol + Agents API,ChatGPT 转向"智能体平台"
2. Google Gemini 4 Argon:百万 token 输出 + 网安优先定位,正面叫板 Astra / Opus
3. 具身智能进入"实干时代":AGIBOT 300 机器人主题公园 + 中国工厂批量上岗
4. AI 治理出现"强制 vs 自愿"拉锯:FTC 首次执法调查 + 特朗普"自愿契约"
5. 世界模型架构成熟:Dreamer 4「在想象中训练」+ NVIDIA Cosmos-Predict2.5
二、知识点讲透:Tokenization 与 Embedding(模型"读懂"语言的第一道关)
2.1 它是什么?——"先把语言切成词元,再投进向量空间"
Tokenization(分词):把原始文本切成模型词表(vocabulary)里的最小单位 token(词元),并映射到整数编号。Embedding(词嵌入):拿每个 token 的编号去查一张巨大的" lookup 表",得到一个高维向量(一串数字,如 4096 维)。这个向量,才是模型真正"吃"进去的东西。