辟道AI
分类_AI入门:扫盲手册

机器学习是什么?

管理员
/2026.07.16

如果说人工智能是一座宏伟的建筑,那么机器学习就是它的地基。

在很长一段历史时期里,人工智能和机器学习几乎是同义词。因为除了让机器从数据中学习之外,人类没有找到任何其他有效的方法来制造智能系统。

即使在深度学习和大语言模型如日中天的今天,机器学习的基本思想、基本方法和基本逻辑依然是整个AI大厦的承重墙。这一章,我们就来好好理解一下机器学习的核心逻辑。

让我们从一个最简单的问题开始。

假如你是一名房产经纪人,你手中有一堆已经成交的房子的数据,每套房子你知道它的面积、卧室数量、建造年份、到地铁站的距离,以及它最终的成交价。

现在来了一套新房子,你有它的所有特征,但没有价格。那么你怎么预测它的价格?

在机器学习出现之前,人类分析师的做法可能是凭经验自己琢磨出一个公式,比如"每平米单价乘以面积,然后根据新旧程度打个折,再根据交通便利性加点价"。

这个公式的每一项的系数(比如每平米多少钱、新旧折扣多少、交通加成多少)都由人来主观设定。

但机器学习的方法完全相反。

它不依赖人的主观判断来设定这些系数,而是让算法自动从已有的成交数据中"学习"出最优的系数。

算法做的事情很简单,它先随便猜一组系数,然后用已有的数据去验证。

那么用这组系数预测出来的价格和真实成交价之间的差距有多大呢?

这个差距就叫"预测误差"。

算法的目标就是不断调整这组系数,让预测误差越来越小、越来越小,直到找到一个最小误差的那个点。这个过程本质上就是在数据中寻找规律、拟合规律。

这就是机器学习最核心的逻辑。

这种用已有的、标注好的数据来训练模型的方法,在机器学习中被称为"监督学习"。这个"监督"指的是数据中有"正确答案",模型的学习过程有"参考答案"可对照。

监督学习解决的问题可以分为两大类:

回归问题——预测一个连续数值(房价、温度、股价)

分类问题——判断属于哪个类别(这封邮件是垃圾邮件吗?这张图片里有肿瘤吗?这个客户会流失吗?)。

在回归问题中最基础的算法是线性回归,它假设输入特征和输出值之间存在一个线性关系,你画一条直线(或一个平面)来拟合数据点。

在分类问题中最经典的算法包括逻辑回归(别被名字骗了,它其实是做分类的)、支持向量机(SVM)——它的思想是在两类数据之间找到一条"最宽的分界线",决策树——通过一系列"如果满足条件A就向左、否则向右"的分支判断来做出决策,以及随机森林——它种很多棵树,让每棵树从数据的随机子集中学习,最后投票决定答案。

XGBoost和LightGBM这类梯度提升算法则是更加进阶的版本,它们通过一棵树接一棵树地逐步修正前面树的错误,在很多结构化数据的比赛中表现出色。

但世界上的数据并不总是带有正确答案的标签。

设想,你是一个电商平台,你有海量的用户浏览和购买数据,你想把用户分成不同的群体来做精准营销,但你并不知道"正确的分组"是什么样的,因为根本不存在一个客观的正确答案。这种情况下你就需要另一类机器学习方法——无监督学习。

无监督学习处理的是没有标签的数据,它的目标不是预测,而是发现数据中隐藏的结构和模式。

最典型的无监督学习任务是聚类——把相似的数据点分到同一个组里。

K-means就是一种经典直观的聚类算法:

你事先指定你想分成几个组,算法随机初始化几个"中心点",然后把每个数据点分配给离它最近的中心点,接着重新计算每个组的中心位置,再重新分配,反复迭代直到稳定。

一个电商平台可以用聚类算法把用户按照浏览和购买行为分成"价格敏感型""品牌忠诚型""冲动消费型"等几个群体,然后针对不同群体制定不同的营销策略。

无监督学习的另一个重要应用是降维——当数据有几十个甚至几百个维度(特征)时,很难直观地理解和可视化,降维技术可以把高维数据"压缩"到两维或三维的平面上,同时尽可能保留数据的内部结构,让人可以"看到"数据的模样。

还有一种非常独特的学习范式叫做强化学习。

强化学习的灵感来自于行为主义心理学——一只老鼠在迷宫中探索,碰到奶酪就获得奖励,碰到电击就受到惩罚,经过多次尝试之后它学会了走正确的路线。这个实验非常出名。

在强化学习中,一个"智能体"在一个"环境"中执行"动作",环境根据动作的好坏给予"奖励"或"惩罚",智能体的目标是通过不断尝试和学习,找到一个能最大化长期累积奖励的行动策略。

2016年AlphaGo击败李世石,就是强化学习和深度学习结合的一个经典案例。AlphaGo通过和自己下了几千万盘围棋,不断根据胜负结果优化策略,最终达到了超越人类顶尖棋手的水平。

强化学习也应用在机器人控制、自动驾驶、工业优化等领域。最近几年,它在大语言模型的训练中也扮演了重要角色——我们前面提到的RLHF(基于人类反馈的强化学习)就是强化学习思想的延伸。

理解了这三种学习范式之后,你可能已经注意到一个贯穿始终的主题:数据。

数据就是机器学习的燃料。没有燃料,再好的发动机也发动不了。

在机器学习领域有一句流传很广的话:"垃圾进,垃圾出",意思是如果你的训练数据质量很差,那么不管你的算法多先进、模型结构多精巧,训练出来的模型也不会有好的表现。

数据质量主要体现在几个方面:

准确性(数据本身有没有错误)、完整性(有没有大量的缺失值)、代表性(数据是不是全面地覆盖了你关心的各种场景)、平衡性(不同类别的数据量是否严重不均——比如一个疾病检测模型的训练数据中,99%的样本都是健康的,只有1%是患病的,模型就可能学会"偷懒",总是预测"健康",反正准确率也有99%)。

但是比数据质量更难搞的问题是数据偏见——在吃掉人类数据的同时,机器也吃掉了人类的偏见。如果你用来训练的招聘数据中,历史上被录用的高管大多数是男性,那么模型学到的模式就可能是"高管=男性",在筛选简历时系统性地歧视女性候选人。

这倒不是模型"故意"要歧视,而是它诚实地"学习"了数据中反映的历史偏见。

在AI伦理中的一个核心议题就是如何识别和纠正这种数据中的偏见,但这是我们在后面社会篇中会详细讨论的话题,在此不做赘述。

最后,我想用一种非常朴素的方式来帮助你建立对机器学习的“本能”理解。

如果你有Excel或者类似的电子表格软件,你其实可以自己做一次微型"机器学习实验"。

假设你有一列数据是广告投入金额,另一列数据是产品销售额。你想知道广告投入和销售额之间的关系。你把这两列数据画成散点图——横轴是广告费,纵轴是销售额。你会看到那些点大致呈现一种向上的趋势。

右键点击数据点,选择"添加趋势线",选择"线性"。Excel就会自动帮你算出那条最"贴合"所有数据点的直线——这条直线的斜率和截距,就是你用最小二乘法做出来的最简单的线性回归模型。

然后你可以用这条线来预测:

假如我投入5000块广告费,大概能产生多少销售额?

这个流程就是一次完整的机器学习流程。你有数据(广告费和销售额的历史记录),你有目标(找到两者之间的关系),算法帮你找到了最优的参数(那条直线的位置),然后你可以用这个模型来做预测。

当你使用更复杂的算法(比如深度学习)本质上做的事情是一样的,只是模型不再是简单的直线,而是一个极其复杂的、有几十亿个参数的非线性函数,能够捕捉数据中非常微妙和复杂的模式。

但机器学习它经常会失败。

它可能因为数据太少而学不到可靠的规律(欠拟合),也可能因为过度记忆训练数据中的噪音而无法泛化到新数据上(过拟合)。

它也可能因为数据分布发生了变化而迅速失效(一个在夏天训练出来的服装推荐模型,到了冬天可能完全不适用,因为用户的购买模式完全变了)。

这些都是机器学习从业者在日常工作中需要不断面对和解决的问题。

但尽管有这些局限,机器学习依然是迄今为止人类发明的最强大的从数据中提取规律的工具。它为后面的一切——深度学习、大语言模型、多模态AI——奠定了基础。

互动讨论区

0 条记录

No data in communication log.

相关推荐