每天一个 AI 术语 · 第 02 期

机器学习:从大量案例中发现规律
为什么邮箱能自动识别垃圾邮件?
为什么音乐软件越来越懂你的喜好?
为什么地图能根据历史数据预测堵车?
这些能力背后,往往都离不开同一项技术:机器学习。
一句话解释
机器学习,是让计算机从数据和案例中学习规律,再用这些规律判断新情况的一种方法。
传统程序主要依靠人提前写好规则;机器学习则让机器通过观察大量样本,自己找到可以完成任务的规律。
生活类比
想象一下,你正在教一个孩子认识苹果。
你不会先给他写一套复杂规则:
直径在多少厘米以内
红色占比达到多少
表面弧度应该是多少
你通常会直接给他看很多苹果,并告诉他:“这些都是苹果。”

机器学习像人类一样通过大量案例归纳共同特征
孩子看得多了,就会逐渐发现苹果常见的形状、颜色和纹理。当他再次看到一个从未见过的苹果时,也能作出判断。
机器学习的思路与此类似:
不是把所有判断规则逐条写给机器,而是给机器足够多的案例,让它从中归纳规律。
工作原理
机器学习的完整过程可以简化为五步:

机器学习的基本流程:准备数据、训练模型、评估改进和进行预测
收集数据:准备与任务相关的文字、图片、数字或行为记录。 整理数据:清理错误和重复内容,必要时为样本添加标签。 训练模型:让算法反复分析数据,寻找输入与结果之间的关系。 评估改进:用模型没有见过的数据测试效果,并根据错误调整模型。 进行预测:把新的数据交给训练好的模型,得到分类、数值或推荐结果。
以垃圾邮件识别为例:
我们可以给模型看大量“垃圾邮件”和“正常邮件”。模型会从发件方式、用词习惯、链接特征等信息中寻找规律。
训练完成后,当一封新邮件到来时,模型不会去查找某条固定规则,而是根据已经学到的模式,计算它更像垃圾邮件还是正常邮件。
这个从案例中总结出来、用于处理新数据的系统,就叫作模型(Model)。
三种常见学习方式
机器学习并不只有一种学习方法。
监督学习
训练数据带有明确答案。
例如,图片已经标注为“猫”或“狗”,房屋数据已经附带真实成交价格。模型根据这些已知答案学习如何分类或预测。
无监督学习
训练数据没有现成答案,模型自己寻找其中的结构。
例如,电商平台可以根据用户行为自动把顾客分成不同群体,而不是提前规定每个人属于哪一类。
强化学习
模型通过尝试、反馈和奖励不断改进行为。
例如,游戏 AI 在一次次行动中,根据输赢结果学习更有效的策略。
实际用途
机器学习早已进入我们的日常生活:
机器学习在安全、推荐、出行、金融和医疗等场景中的应用

邮箱过滤垃圾邮件
短视频和音乐内容推荐
电商平台推荐商品
地图预测路况与到达时间
银行识别异常交易
手机相册自动识别人脸和场景
医疗影像辅助分析
企业预测销量和用户流失
搜索引擎优化结果排序
这些系统看起来用途不同,但核心逻辑相似:
利用过去的数据学习规律,再对新的情况进行判断或预测。
常见误区
误区一:机器学习就是人工智能
人工智能是一个更大的概念,机器学习是实现人工智能的重要方法之一。
可以把人工智能理解为目标,把机器学习理解为通往这个目标的一条主要技术路线。
误区二:数据越多,模型一定越好
数据数量很重要,但数据质量同样关键。
如果数据错误、重复、存在偏见,模型可能学到错误规律。大量低质量数据并不一定比少量高质量数据更有价值。
误区三:训练完成后,模型永远有效
现实环境会变化。
用户习惯、市场情况和欺诈方式都可能发生改变。模型如果长期不更新,原来有效的规律可能逐渐失效,这种现象常被称为“模型漂移”。
误区四:机器学习真的理解了问题
模型通常是在数据中寻找统计关系,并不意味着它像人一样理解事物的含义。
一个模型可以准确识别猫的图片,却不一定知道猫在真实世界中如何生活。
代表产品与应用
机器学习通常隐藏在产品背后,而不是单独以一个按钮出现。
常见案例包括:
Netflix、YouTube 和 Spotify 的推荐系统
Google 搜索与广告排序
支付平台的风险控制系统
手机相册的人脸与物体识别
地图软件的路况预测
电商平台的商品推荐
企业使用的销量预测工具
ChatGPT 等生成式 AI 模型的训练过程
今天流行的大语言模型,本质上也建立在机器学习和深度学习技术之上。
一句话总结
机器学习不是让机器记住所有答案,而是让机器从大量案例中找到规律,并把规律用于没有见过的新问题。
下一个术语:深度学习(Deep Learning)
夜雨聆风