乐于分享
好东西不私藏

每天一个 AI 术语 · 第 2 期 机器学习(Machine Learning)

每天一个 AI 术语 · 第 2 期 机器学习(Machine Learning)

每天一个 AI 术语 · 第 02 期

机器学习:从大量案例中发现规律

为什么邮箱能自动识别垃圾邮件?

为什么音乐软件越来越懂你的喜好?

为什么地图能根据历史数据预测堵车?

这些能力背后,往往都离不开同一项技术:机器学习

一句话解释

机器学习,是让计算机从数据和案例中学习规律,再用这些规律判断新情况的一种方法。

传统程序主要依靠人提前写好规则;机器学习则让机器通过观察大量样本,自己找到可以完成任务的规律。

生活类比

想象一下,你正在教一个孩子认识苹果。

你不会先给他写一套复杂规则:

直径在多少厘米以内

红色占比达到多少

表面弧度应该是多少

你通常会直接给他看很多苹果,并告诉他:“这些都是苹果。”

机器学习像人类一样通过大量案例归纳共同特征

孩子看得多了,就会逐渐发现苹果常见的形状、颜色和纹理。当他再次看到一个从未见过的苹果时,也能作出判断。

机器学习的思路与此类似:

不是把所有判断规则逐条写给机器,而是给机器足够多的案例,让它从中归纳规律。

工作原理

机器学习的完整过程可以简化为五步:

机器学习的基本流程:准备数据、训练模型、评估改进和进行预测

  1. 收集数据:准备与任务相关的文字、图片、数字或行为记录。
  2. 整理数据:清理错误和重复内容,必要时为样本添加标签。
  3. 训练模型:让算法反复分析数据,寻找输入与结果之间的关系。
  4. 评估改进:用模型没有见过的数据测试效果,并根据错误调整模型。
  5. 进行预测:把新的数据交给训练好的模型,得到分类、数值或推荐结果。

以垃圾邮件识别为例:

我们可以给模型看大量“垃圾邮件”和“正常邮件”。模型会从发件方式、用词习惯、链接特征等信息中寻找规律。

训练完成后,当一封新邮件到来时,模型不会去查找某条固定规则,而是根据已经学到的模式,计算它更像垃圾邮件还是正常邮件。

这个从案例中总结出来、用于处理新数据的系统,就叫作模型(Model)

三种常见学习方式

机器学习并不只有一种学习方法。

监督学习

训练数据带有明确答案。

例如,图片已经标注为“猫”或“狗”,房屋数据已经附带真实成交价格。模型根据这些已知答案学习如何分类或预测。

无监督学习

训练数据没有现成答案,模型自己寻找其中的结构。

例如,电商平台可以根据用户行为自动把顾客分成不同群体,而不是提前规定每个人属于哪一类。

强化学习

模型通过尝试、反馈和奖励不断改进行为。

例如,游戏 AI 在一次次行动中,根据输赢结果学习更有效的策略。

实际用途

机器学习早已进入我们的日常生活:

机器学习在安全、推荐、出行、金融和医疗等场景中的应用

邮箱过滤垃圾邮件

短视频和音乐内容推荐

电商平台推荐商品

地图预测路况与到达时间

银行识别异常交易

手机相册自动识别人脸和场景

医疗影像辅助分析

企业预测销量和用户流失

搜索引擎优化结果排序

这些系统看起来用途不同,但核心逻辑相似:

利用过去的数据学习规律,再对新的情况进行判断或预测。

常见误区

误区一:机器学习就是人工智能

人工智能是一个更大的概念,机器学习是实现人工智能的重要方法之一。

可以把人工智能理解为目标,把机器学习理解为通往这个目标的一条主要技术路线。

误区二:数据越多,模型一定越好

数据数量很重要,但数据质量同样关键。

如果数据错误、重复、存在偏见,模型可能学到错误规律。大量低质量数据并不一定比少量高质量数据更有价值。

误区三:训练完成后,模型永远有效

现实环境会变化。

用户习惯、市场情况和欺诈方式都可能发生改变。模型如果长期不更新,原来有效的规律可能逐渐失效,这种现象常被称为“模型漂移”。

误区四:机器学习真的理解了问题

模型通常是在数据中寻找统计关系,并不意味着它像人一样理解事物的含义。

一个模型可以准确识别猫的图片,却不一定知道猫在真实世界中如何生活。

代表产品与应用

机器学习通常隐藏在产品背后,而不是单独以一个按钮出现。

常见案例包括:

Netflix、YouTube 和 Spotify 的推荐系统

Google 搜索与广告排序

支付平台的风险控制系统

手机相册的人脸与物体识别

地图软件的路况预测

电商平台的商品推荐

企业使用的销量预测工具

ChatGPT 等生成式 AI 模型的训练过程

今天流行的大语言模型,本质上也建立在机器学习和深度学习技术之上。

一句话总结

机器学习不是让机器记住所有答案,而是让机器从大量案例中找到规律,并把规律用于没有见过的新问题。

下一个术语:深度学习(Deep Learning)