上篇文章发完,有读者私信我:
"看了半天,机器学习确实不神秘了。但你说在Excel里就能跑模型——这我真不信。"
说实话,要不是我亲手试过,我也不信。
打开Excel,点几个按钮,跳出来一堆数字——然后你用这些数字,猜中了一套你没见过的房子的价格。
听起来像黑魔法?
今天带你亲手操作一遍。不用装任何软件,不用写一行代码,就你电脑里那个天天用来做报表的Excel。
你可能天天打开Excel做表、拉公式、画柱状图。但你大概率没注意到,Excel里藏着一个"数据分析工具库"。
这个工具库,是Excel内置的迷你机器学习引擎。
你不需要知道它怎么算的。你只需要知道:给它一堆"已知答案"的数据,它能自己总结出规律,然后用这个规律去猜"未知答案"。
这不就是上篇文章说的——监督学习?
对,一模一样。只不过今天我们不调sklearn,我们点鼠标。
说白了就一句话:用已知找规律,用规律猜未知。
假设你知道了20套房子的面积和价格:
| 面积(㎡) | |
你盯着这些数字看一会儿,脑子里大概会浮现一个感觉:"面积越大,价格越高,大概是每平米……七八千块?"
Excel做的就是这件事。只不过它不靠"感觉",它靠数学公式算出一条线。这条线,就是"面积和价格之间的关系"。
有了这条线,你输入一个新面积——比如75平米——它就顺着线算出对应的价格。
一句话概括:机器学习不是什么玄学,就是一个"找规律→套规律"的自动化过程。

下面每一步都很简单。你打开Excel,跟着点就行。
新建一个Excel文件,A列写"面积",B列写"价格"。
然后输入这20行数据(直接复制就行):
| 面积(㎡) | |
这20套房子就是你的"训练数据"——也就是上篇文章说的"有标准答案的例题"。
Office 365用户:
点击菜单栏"数据"→ 看最右边有没有"数据分析"这个按钮。
如果有→恭喜,直接跳到Step 2
如果没有→需要手动加载,两步搞定:
点击"文件"→"选项"→"加载项"
在底部"管理"下拉框选"Excel加载项",点"转到"
勾选"分析工具库",确定
WPS用户注意:
路径略有不同。点击"数据"菜单→找"数据分析"按钮。如果找不到,在功能搜索框搜"数据分析"四个字,一般都能调出来。
加载完之后,"数据分析"按钮就会出现在数据菜单栏的最右边。点下去,一个新世界的大门就打开了。
在弹出的对话框里,找到"回归",选中,确定。
然后又弹出一个框,需要填几样东西:
Y值输入区域:选中你的"价格"那一列(不含表头,只选数字)
X值输入区域:选中你的"面积"那一列(不含表头,只选数字)
输出选项:选"新工作表组",这样结果会单独放在一个新表里,不搞乱原始数据
然后点确定。
不出意外,Excel唰啦一下生成了一大片数字——看起来很吓人对吧?
别慌。90%的数字你不用管。
在输出结果里,你只需要找3样东西。
① R²(R平方)
找到写着"R Square"的那一行。你的输出结果里,这个值是0.998478639。
人话解读:这个值越接近1,说明面积和价格的关系越紧密。0.998意味着"面积能解释房价99.8%的变化"——也就是说,光看面积,几乎就能完全猜中价格。
② 面积系数(X Variable 1)
在表格下半部分,找到"X Variable 1"那一行,看"Coefficients"(系数)那一列。
你的输出结果里,这个值是0.770827068。
人话解读:面积每增加1平米,价格大约涨0.77万(也就是7700块)。这个数字是不是很眼熟?你刚才在脑子里估的"七八千块",和Excel算出来的几乎一样。只不过Excel算了20组数据的加权平均,比你的感觉更精确。
③ 截距(Intercept)
就在"X Variable 1"上面一行,写着"Intercept"。同样看"Coefficients"(系数)列。
你的输出结果里,这个值是3.460902256。
人话解读:即使房子面积是0,也有这个底价——可以理解成土地价值或者地段基础价。
找到了吗?好。现在你已经拥有了一个完整的房价预测模型:
预测价格 = 0.7708 × 面积 + 3.46
就这么简单。
这里还有一个关键数字:标准误差 = 0.914425376,也就是平均预测误差不到1万块。只用一个变量,做到这个精度,已经很能打了。
在正式开始预测之前,先做个验证。
75平米在你的训练数据里是出现过的(第10条,价格63万)。我们先用这个已知数据来验证模型是不是靠谱。
用我们刚才得到的公式:
预测价格 = 0.7708 × 75 + 3.46
计算一下:0.7708 × 75 = 57.81,再加上3.46,得到61.27万。
75平米的真实价格是63万,模型算出来61.27万,差了不到1.8万。
这个误差远小于标准误差0.91万——验证通过。
验证通过:如果连已知数据都算不对,模型就是废的。现在通过了,我们进入真正的预测环节。
刚才我们验证了75平米——但它出现在训练数据里,不算真正的"盲测"。
现在来做一次真正的考核:用两组模型从没见过的面积,看它猜得准不准。
在你的数据后面,想象有两套新房:
28平米(比训练数据里最小的30平米还小)
135平米(比训练数据里最大的125平米还大)
用公式算一下:
28平米:0.7708 × 28 + 3.46 = 21.58 + 3.46 = 25.04万
135平米:0.7708 × 135 + 3.46 = 104.06 + 3.46 = 107.52万
这个价格合理吗?
跟前面20套数据比一比:
28平米比30平米还小 → 25.04万≈25万,合理
135平米比125平米还大 → 107.52万>99万,合理
看到没?
模型没见过28平和135平的房子,但它猜出来的价格,跟真实市场的趋势完全一致——面积越大价格越高,而且涨幅是线性的、有规律的。
这就是机器学习的全部意义。
它没背答案。它学会了规律。
上篇文章我说过一个词——过拟合。
当时用人话解释是:"死记硬背,学会的不是规律,是答案。"
现在让你在Excel里亲手体验一把。
实验操作:
回到最开始,这次不要用全部20条数据。
只选前10条(面积30到65那10套),重复上面的回归操作。
看R²——是不是比刚才低了一些?可能只有0.96左右,比0.998低。但这不是最大的问题。
最大问题是:预测值漂移了。
还记得刚才用20条数据预测75平米是多少吗?61.27万。
现在用前10条数据训练出来的系数重新算75平米——你可能得到63万甚至更高。因为前10条全是小户型,斜率更陡,模型"以为"房价涨得比较快。
差距不大?那再预测一下135平米:
用20条数据:107.52万
用前10条数据:可能变成120万以上
差了将近13万。
为什么会这样?
因为数据太少,模型过度相信了前10套房子的模式。它以为所有房子都像小户型一样,面积一涨价格就猛涨。
但真实世界的规律是:房子大到一定程度,每平米的单价会下降。
补充一句业务逻辑:大户型总价高,接盘的人少,开发商为了卖出去会在单价上让步——这就是所谓的"面积折价效应"。如果数据覆盖不到大户型,模型就学不到这个规律,会傻乎乎地按小户型的斜率一路涨上去。
数据少的时候,模型学到的不是"真实规律",而是"这一小堆数据的巧合"。
数据多了,巧合就藏不住了,真实规律才会浮现出来。
这就是为什么上篇文章我说:
脏数据进,垃圾模型出。数据不够,模型一样废。
就这么简单。
还记得上篇文章我说的监督学习吗?
给你的训练数据(面积+价格),模型自己学会规律,然后预测新数据——这就是监督学习的全部。你今天在Excel里亲手做的,就是这件事。
你不需要知道矩阵乘法,不需要理解梯度下降。你只需要知道:
机器学习不是魔法,是算出来的。而Excel就能算。
下篇预告:
当你只用"面积"这一个变量预测房价,标准误差是0.91万,平均误差不到1万——已经相当不错了。
但如果想做到误差压到5000块以内呢?
下篇我会教你:再加两个变量——房龄和楼层。还是在Excel里,步骤只多三步。
让你的预测从"靠谱"变成"真能打"。
📌 点个关注,系列第三篇见。
如果觉得有用,帮我转发给那个天天用Excel做表、但总喊着"想学AI"的朋友——也许今天就是他入门的第一步。
夜雨聆风