AI 真的“认识”文字和图片吗?
万物皆数字
从 0 和 1 说起
二进制 · 编码 · 像素 · 采样
AI 底层三件套 · 第一讲
📦 4 Parts + Conclusion
👉 滑动
PART 01
0 和 1 怎么表示数字
二进制与小数
PART 02
文字怎么变数字
ASCII 与 Unicode
PART 03
图片声音也是数字
像素与采样
PART ///
写在最后
下一层是“视神经”
计算机的底层是 0 和 1,这句话你可能早就听说过。
可你有没有认真想过:屏幕前的这篇文章、相册里的照片、耳机里的音乐,这些活生生的万物,究竟是怎么被两个符号 0 和 1 变出来的?
今天这篇,我们就从这块最底层的砖开始,一层层往上搭。
01
PART
只有 0 和 1,怎么表示数字?
BINARY NUMBERS
第一块砖,先解决最基础的问题:0 和 1 是两个符号没错,可它们怎么“拼”出屏幕前那些具体的数字?
好在晶体管天生就是“二进制选手”——它只有“开/关”两种状态,天然和 0 和 1 相配:开 = 1,关 = 0。
所以,“表示一个数字”就成了:用多个开关组合。
我们平时用的是十进制,规则是“逢十进一”:
0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11……
二进制只有两个数字,规则是“逢二进一”:
0 = 0
1 = 1
2 = 10 (1 个“二”,0 个“一”)
3 = 11
4 = 100 (1 个“四”,0 个“二”,0 个“一”)
5 = 101
6 = 110
7 = 111
8 = 1000
十进制用 10 个符号写数字,二进制用 2 个符号写数字——符号少,但写出来的“串”更长。
就像:
摩尔斯电码只有“点”和“划”两种符号,但靠长短组合,它能传递一切信息。
“开开关关、开关开开……”几个开关排成一排,就能拼出任意一个数字。
100 个开关排一排,能表示多大的数?2 的 100 次方,也就是约 126 万亿亿亿亿……个不同的数。你根本数不完。

所以对芯片来说,数字不是问题,开开关关就完事了。
我们刚拼的都是整数。小数呢?比如 0.5,怎么用 0 和 1 表示?
逻辑其实一样,只是方向反过来了。十进制的小数点后面,是“十分位、百分位、千分位……”;二进制的小数点后面,就变成了“二分之一、四分之一、八分之一……”:
0.1(二进制)= 二分之一 = 0.5
0.01(二进制)= 四分之一 = 0.25
0.11(二进制)= 二分之一 + 四分之一 = 0.75
二进制的小数,就是用 1/2、1/4、1/8…… 这些“一半的一半的一半”拼出来的。
所以不管是整数还是小数,只要肯拼、肯近似,0 和 1 都能表示。
一句话记住
整数靠“逢二进一”排开关,小数靠“二分之一、四分之一”来拼——0 和 1,什么数都能表示。
02
PART
数字搞定了,文字怎么办?
ENCODING
好,现在芯片会表示数字了。但你要它读一篇文章、回你一句“你好”,它总不能把“你”字也变成开开关关吧?还真能。
办法是:约定一张翻译表,每个文字分配一个固定的编号。
A = 65
B = 66
C = 67
……
这套给字母编号的方案,是最早的编码标准之一,叫 ASCII(美国信息交换标准代码)。那中文呢?汉字成千上万,65、66 显然不够用。没关系,后来的 Unicode(统一编码)给世界上几乎所有文字都分配了编号:
“你” = 20320
“好” = 22909
“你好”这俩字,本质就是两个数字。这张翻译表,你可以理解成一本字典:
电脑想“读”字
查字典,把编号变成字形显示出来
电脑想“写”字
把字变成编号存进去
所以当你打出“你好”两个字,传到对面,其实传的是 20320、22909 这两串 0/1 编码。
冷知识:你在键盘上敲下的每一个字符,在计算机内部都只是 0 和 1 的排列组合。

每个字 = 一个编号 = 一串 0 和 1,字典(编码表)让芯片“认识”字。
一句话记住
文字 = 编号 = 0 和 1。字典(编码表)让芯片“认识”字。
03
PART
图片、声音也是数字?
PIXELS & SAMPLING
你说:行,文字能变数字,但照片呢?声音呢?那些总不能也变成 0 和 1 吧?能,而且就是这么干的。
图片:马赛克拼图
任何一张照片,放大放大再放大,你会发现它是一格格的小方块,叫像素。比如一张 1000×1000 的照片,就是 100 万个像素点。每个像素点什么颜色?用三个数字描述:RGB(红、绿、蓝):
纯红 = (255, 0, 0)
纯绿 = (0, 255, 0)
纯蓝 = (0, 0, 255)
白色 = (255, 255, 255)
黑色 = (0, 0, 0)
你手机里任何一张照片,本质上就是一张巨大的数字表格:
第 1 格:(120, 80, 30)
第 2 格:(121, 81, 31)
第 3 格:(122, 82, 30)
……

一张“照片”被拆成像素后,每个格子只是 3 个数字
这就是为什么“图片太大”会让手机变慢——因为那是海量数字在排队。
声音:心电图
声音是什么?是空气的振动。电脑记录声音的方法很朴素:每隔一小会儿,采一个“音量”数字。
一秒的声音,被切成几万个时间点,每个点记一个数字。把这些数字连起来,就是一条波浪线,跟医院的心电图长得一模一样。
手机录音 1 分钟,存储里多出来的,就是这一串串“音量数字”。
一句话记住
图片 = 像素的颜色数字,声音 = 采样点的音量数字。万物皆可数字化。
///
LAST
写在最后:万物皆数字
EVERYTHING IS NUMBERS
现在回头看,整条逻辑链是这样的:
芯片只会开/关
↓
用 0 和 1 拼出数字
↓
用编号表示文字
↓
用网格表示图片、用采样表示声音
↓
一切信息,最终都是 0 和 1
而 AI 能“理解”世界的第一步,靠的就是这块地基——把现实世界的文字、图片、声音,统统翻译成它能算的 0 和 1。
但这一步,只是把光收进了眼睛里——相当于给 AI 装上了一层“视网膜”。
视网膜能感知光,却还不认识光里照到的是什么。就像此刻的 AI:它确实“看到”了海量数字,可这些数字分别意味着什么,它一无所知。
哪些数字是在说“猫”?
哪些数字是在说“汽车”?
“猫”和“汽车”,在 AI 眼里谁跟谁更熟?
一串数字本身,什么都不表示。要把“视网膜”里的光,变成大脑真正“看懂”的画面,中间还缺一层——视神经。
这层“视神经”,就是我们下一篇的主角:向量。它会把孤零零的数字组织起来,让 AI 第一次“看懂”含义。
我们下篇见 🐼
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING
夜雨聆风