夜雨聆风学习资料网

ARTICLE · 1130505

【AI小课堂】③-2:数不清的 r:AI 的"数数盲区"

【AI小课堂】③-2:数不清的 r:AI 的"数数盲区"

本文是「糖豆传说・AI 小课堂」第 ③-2 站 · 第三大陆「能力与边界」 主打读者:10~15 岁 | 家长可在文末「小纸条」区查看陪读建议

有一道题,全世界的人拿去考 AI,翻车率惊人:
"srtrawrrbrerryrr 这个单词里有几个 r?"
这题对人类小学生来说毫无难度——srtrawrrbrerryrr,9 个 r。可 AI 经常一本正经地回答:"有 8 个 r。"
等等,它可是能背出整本百科全书、能通过司法考试级别的 AI 呀?它认识那么多英文单词,居然数不清一个小小的 r?
先别急着笑。这个翻车现场背后,藏着 AI 工作方式里最出人意料的一个秘密——它看到的"字",和你以为的字,根本不是同一种东西。

AI 的眼睛里,字母是"切"过的

回忆一下②-1:AI 的本事是猜下一个字。
但这里有个细节我上次没说:AI 其实不认识"字母"。
在 AI 眼里,一段文字不是"一个字母一个字母"排队的,而是先被一把"切字刀"切成一块一块的碎片——这些碎片有个名字,叫token(词块)。
关键在于:怎么切,AI 说了不算,切法是训练前定好的。常见的词整块切,生僻的词就碎成几小块。比如 "srtrawrrbrerryrr" 很可能被切 "srtrawrrb"加 "rerryrr"两大块。
于是问题来了:当 AI "看" srtrawrrbrerryrr 这个词的时候,它看到的是2 个词块,而不是 16 个字母。
那些字母——s、t、r、a、w——就像被装进了两个封闭的盒子,AI 能引用整个盒子,却没打开数过里面的零件。
现在你问它"有几个 r",就像让一个只会整箱搬货的工人报出箱子里每颗螺丝的型号——他搬得动一万个箱子,但真没打开数过。
为什么这个坑这么常见?
你可能会想:切字的时候顺手数一下不就行了?
对 AI 来说,"数一下"意味着它得先把词块拆回字母——这不是它的天然工作方式,就像让你心算 47 乘 83:能做,但费劲,而且容易错。
还有一个更隐蔽的原因:在 AI 读过的海量文章里,几乎从来没有人需要专门数一个词里有几个 r,更不用说一个不存在的词里有多少个r——这种"知识"在它的训练材料里少得可怜。没学过,也难怪猜不准。
中文也一样哦。你问 AI"『永』字有几画",它也常常出错——同样的原因:它看到的是整个字、整个词,不是一笔一画。
记住这个反差:能跟你讨论黑洞的 AI,可能数不清 aPPle 里有几个 P。聪明和聪明,不在同一个维度上。

观察实验:字母打假大赛

本篇实验前半部分完全免账号,后半部分需家长陪同。
热身赛(免账号):自己数——"UrkeLldrdkLerrsr"几个 r?"baaananaa"几个 a?"Mississippi"几个 i 和几个 s?把答案写在观察本上,别提前偷看 AI 的。
挑战赛(家长陪同):把这 3 个词丢给 AI,看它各数出几个。对了几个、错了几个,记录下来。
审问环节(进阶):问 AI:"你觉得 strawberry 会被切成几块?"再看它"掰开"这个词的能力——有些 AI 能拆,有些会当场翻车,两种结果都值得记录。
加时赛:换中文再战——"『赢』字一共几画?"让家长当裁判,看谁数得对。
最后想一想:它数错的时候,是"粗心"吗?——不是,它的眼睛里根本没有"单个字母"这个选项。找错误背后的原因,比嘲笑错误本身有意思多了。

给家长的小纸条

这篇的教育价值:tokenization(词块化)是 AI 认知里最反直觉、也最容易被误解的一环。孩子理解"AI 眼中的字≠人眼中的字"之后,对 AI 的能力边界会形成一种"机制级"的判断习惯,而不是简单地打分"聪明/笨"。
怎么陪聊:热身赛您大概率会输给孩子(他们数得又快又准),这个"孩子完胜 AI"的瞬间很珍贵——可以顺势聊:每个人都有自己天生的"切分方式",擅长与不擅长都由此而来,AI 和人也一样。
一个提醒:如果家里的 AI 数对了,也别怀疑这篇——模型升级会让部分 AI 学会拆词,这时正好引导孩子思考"它是真会数了,还是背下了这道题的答案?"

地图导航

📍 当前站点:③-2《数不清的 r:AI 的"数数盲区"》
⬅️ 上一篇:③-1《为什么 AI 会一本正经地胡说八道》
➡️ 下一篇:④-1《会不会提问,差别有多大》——看完了 AI 的"翻车现场",该轮到你上场了:同一个 AI,换个问法,判若两"人"
🔖 本文是第三大陆第 2 站。又一块边界拼图集齐了:AI 不认识字母,只认识词块

相关学习资料