2026年7月

大型语言模型已经掌握了新闻周期,但还有许多其他类型的机器学习和深度学习,具有许多不同的应用场景。
在关于ChatGPT、Bard和其他生成式大型语言模型(LLMs)的所有炒作和狂热之中,值得退后一步,看看AI算法的种类及其用途。毕竟,许多“传统”的机器学习算法已经解决了数十年的重要问题——而且它们仍然表现出色。为什么LLMs应该得到所有关注呢?

在我们深入探讨之前,请记住,机器学习是从数据中自动创建预测模型的一类方法。机器学习算法是机器学习的引擎,也就是说,是算法将数据集转化为模型。哪种算法效果最好(有监督、无监督、分类、回归等)取决于你要解决的问题类型、可用的计算资源以及数据的性质。

在下文中,我将简要介绍不同类型的机器学习和机器学习模型。然后,我将讨论14种最常用的机器学习和深度学习算法,并解释这些算法如何与预测、分类、图像处理、语言处理、游戏和机器人技术以及生成式AI的模型创建相关。

机器学习的种类

机器学习可以解决非数值分类问题(例如,“预测这位申请人是否会违约其贷款”)和数值回归问题(例如,“预测我们零售点未来三个月食品加工器的销售量”)。这两种类型的模型主要使用监督学习进行训练,这意味着训练数据已经被标记了答案。

标注训练数据集既耗时又昂贵,因此通常在监督学习中增强半监督学习。半监督学习将小规模标注数据集的监督学习模型应用于更大规模未标注数据集,并将预测数据中正确概率高的部分添加到模型中以进行进一步预测。然而,半监督学习有时可能会偏离正轨,因此可以通过人类在循环(HITL)对可疑预测进行审查来改进该过程。

虽然监督学习的最大问题是训练数据标注的费用,无监督学习(数据未被标注)的最大问题在于它往往效果不佳。然而,无监督学习也有其用途:它可以有时对减少数据集的维度、探索数据的模式和结构、发现相似对象的群组以及检测数据中的异常值和其他噪声有所帮助。

一个以学习为目的而学习的代理人的潜力远大于一个将复杂图片简化为二进制决策(例如,狗或猫)的系统。揭示模式而不是执行预定义的任务可以产生令人惊讶且有用的结果,正如劳伦斯伯克利国家实验室的研究人员在数百万材料科学摘要上运行文本处理算法(Word2vec)来预测新热电材料的发现时所展示的那样。

强化学习训练一个行动者或代理,以通过试错的方式对环境做出反应,从而最大化某些价值。这与监督学习和非监督学习不同,但经常与它们结合使用。它已被证明对于训练计算机玩游戏和训练机器人执行任务非常有用。

神经网络最初受到生物视觉皮层结构的启发,由一系列称为人工神经元的连接单元组成,这些单元按层组织。人工神经元通常使用sigmoid或ReLU(修正线性单元)激活函数,而不是早期感知器所使用的阶跃函数。神经网络通常通过监督学习进行训练。

深度学习使用具有大量“隐藏”层的神经网络来识别特征。隐藏层位于输入层和输出层之间。模型中的层数越多,可以识别的特征就越多。同时,模型中的层数越多,训练所需的时间就越长。神经网络的硬件加速器包括GPU、TPU和FPGA。

通过在新标记的数据上训练最后几层而不修改其余层级的权重,微调可以显著加快模型的定制速度。适合微调的模型被称为基础模型或基础模型。

视觉模型通常使用深度卷积神经网络。视觉模型能够识别照片和视频帧中的元素,并且通常在非常大的照片数据集上进行训练。

语言模型有时使用卷积神经网络,但最近倾向于使用循环神经网络、长短期记忆或转换器。语言模型可以构建为从一种语言翻译到另一种语言,分析语法,总结文本,分析情感,以及生成文本。语言模型通常在非常大的语言数据集上进行训练。

流行的机器学习算法

以下列表并不全面,算法大致按照从简单到复杂的顺序排列。

线性回归

线性回归,也称为最小二乘回归,是预测数值的最简单的监督式机器学习算法。在某些情况下,线性回归甚至不需要优化器,因为它可以以封闭形式解决。否则,使用梯度下降法(见下文)可以轻松进行优化。线性回归的假设是目标函数与自变量呈线性相关。对于您的数据,这一假设可能成立也可能不成立。

让数据科学家们感到绝望的是,业务分析师们经常轻松地使用线性回归来解决预测问题,然后停止,甚至不制作散点图或计算相关性,以查看基本假设是否合理。不要陷入这个陷阱。进行探索性数据分析并不难,然后让计算机尝试所有合理的机器学习算法,看看哪些效果最好。无论如何,尝试线性回归,但将结果视为基准,而不是最终答案。

梯度下降

机器学习中的优化方法,包括神经网络,通常使用某种形式的梯度下降算法来驱动反向传播,通常具有一种机制来帮助避免陷入局部最小值,例如优化随机选择的小批量数据(随机梯度下降)以及对梯度应用动量修正。一些优化算法还通过查看梯度历史来调整模型参数的学习率(AdaGrad、RMSProp和Adam)。

逻辑回归

分类算法可以解决监督学习问题,这些问题要求在两个或多个类别之间进行选择(或确定概率)。逻辑回归是一种解决分类问题的方法,它使用sigmoid或logit函数内的线性回归,将值压缩到0到1的范围内并给出概率。就像数值预测中的线性回归一样,逻辑回归是进行分类预测的好方法,但不应该是你尝试的最后一个方法。

支持向量机

支持向量机(SVM)是一种参数化分类模型,是一种几何上分离和分类两个标签类的方法。在两个变量之间良好分离的类最简单的情况下,SVM会找到一个平面上的直线,最好地分离这两组点。

在更复杂的情况下,点可以被投射到更高维度的空间中,而支持向量机(SVM)会找到最佳分离两个类别的平面或超平面。这种投射被称为核函数,这个过程被称为核技巧。在您反向投射后,所得的边界通常是非线性的。

当存在多于两个类别时,SVMs会成对应用于这些类别。当类别重叠时,可以对错误分类的点添加惩罚因子;这被称为软间隔。

决策树

决策树(DTs)是一种非参数化监督学习方法,用于分类和回归。其目标是创建一个模型,通过从数据特征中推断出的简单决策规则来预测目标变量的值。可以将一棵树视为分段常数近似。

决策树易于解释且部署成本低廉,但训练时计算成本高昂且容易过拟合。

随机森林

随机森林模型生成了一个随机决策树的集合,用于分类和回归。该集合通过模态投票或对决策树中的概率进行平均来聚合。随机森林是一种袋装集成方法。

XGBoost

XGBoost(极端梯度提升)是一个可扩展的、端到端的树增强系统,它在许多机器学习挑战中取得了最先进的结果。Bagging和Boosting经常被一起提及。不同之处在于,梯度树提升不是生成随机树(RDF)的集合,而是从一个单一的决策树或回归树开始,对其进行优化,然后从第一棵树的残差中构建下一棵树。

K-means 聚类

k-means聚类问题尝试使用欧几里得距离度量将n个观测值分为k个簇,目的是最小化每个簇内的方差(平方和)。这是一种无监督的向量量化方法,对于特征学习和为其他算法提供起点非常有用。

Lloyd算法(迭代聚类合并并更新质心)是解决此问题最常用的启发式算法。虽然它相对高效,但不能保证全局收敛。为了改进这一点,人们通常会多次运行算法,使用由Forgy或随机分区方法生成的随机初始聚类质心。

K-means假设的是可分离的球形簇,使得均值向簇中心收敛,并且假设数据点的顺序无关紧要。期望簇的大小相似,以便将分配给最近的簇中心是正确的分配。

主成分分析

主成分分析(PCA)是一种统计程序,它使用正交变换将一组可能相关的数值变量观测值转换为称为主成分的一组线性不相关变量的值。卡尔·皮尔逊于1901年发明了PCA。PCA可以通过数据协方差(或相关)矩阵的特征值分解,或数据矩阵的奇异值分解(SVD)来实现,通常在应用于初始数据的一个归一化步骤之后。

流行的深度学习算法

有许多非常成功且广泛采用深度学习范式,其中最新的是今天生成式AI模型背后的Transformer架构。

卷积神经网络

卷积神经网络(CNNs)是一种常用于机器视觉的深度神经网络。它们具有令人满意的与位置无关的特性。

对图像应用卷积层时,可以这样理解:它在空间上滑动,计算点积;层中的每个单元共享一组权重。卷积网络通常使用多个卷积层,并在激活函数之间交替使用。虽然存在去除这些类型层的趋势,但卷积神经网络也可以具有池化和全连接层。

循环神经网络

虽然卷积神经网络在分析图像方面做得很好,但它们并没有真正具备处理时间序列和序列的机制,因为它们是严格的前馈网络。另一种深度神经网络——循环神经网络(RNNs),明确地包含了反馈回路,这有效地赋予了它们一些记忆和动态时间行为,并允许它们处理如语音等序列。

这并不意味着卷积神经网络(CNNs)在自然语言处理方面没有用处;它确实意味着循环神经网络(RNNs)能够模拟卷积神经网络无法捕捉的时间信息。而且,这并不意味着RNNs只能处理序列。RNNs及其衍生品在多种应用领域中都有应用,包括语言翻译、语音识别与合成、机器人控制、时间序列预测与异常检测以及手写识别。

虽然从理论上讲,普通的RNN可以在无数个步骤中携带信息,但在实践中,它通常无法在没有失去上下文的情况下进行多个步骤。造成这一问题的原因之一是网络的梯度在许多步骤后趋于消失,这干扰了基于梯度的优化器(如随机梯度下降(SGD))的收敛能力。

长短期记忆

长短时记忆网络(LSTMs)被明确设计为避免梯度消失问题并允许长期依赖。与循环神经网络(RNN)的单元设计相比,LSTM的设计增加了一些复杂性,但对于长序列的处理效果要好得多。

在LSTM中,网络既能遗忘(控制)先前信息,也能记住它,这两种情况都是通过改变权重来实现的。这实际上赋予了LSTM长期和短期记忆,并解决了梯度消失问题。LSTM能够处理数百个过去输入的序列。

Transformers

Transformer是一种仅使用注意力机制的神经网络,完全摒弃了递归和卷积。Transformer是在谷歌(Google)发明的。

注意力单元(和转换器)是谷歌的BERT(基于转换器的双向编码器表示)算法和OpenAI的GPT-2算法(带有无监督预训练的转换器模型)的一部分,用于自然语言处理。转换器继续是最新大型语言模型(如ChatGPT/Bing Chat(基于GPT-3.5或GPT-4)和Bard(基于LaMDA,代表对话应用语言模型))神经架构的重要组成部分。

与循环神经网络(RNNs)不同,注意力单元对句子中两个词出现的接近程度并不十分敏感;这使得它们擅长处理RNNs处理不好的任务,例如识别代词的前置词,这些代词可能与指代代词被几个句子隔开。注意力单元擅长关注比当前词前几个词更大的上下文。

Q-learning

Q-learning是一种无模型、基于价值的、离线策略的强化学习算法,它基于当前状态寻找最佳的动作序列。这里的“Q”代表质量。质量表示动作在最大化未来奖励中的价值。Q-learning本质上是通过经验学习。

Q-learning通常与深度神经网络相结合使用。它使用经过训练的卷积神经网络从视频帧中提取特征,例如用于教导计算机玩电子游戏或学习机器人控制。AlphaGo和AlphaZero是来自Google DeepMind的著名成功的游戏程序,它们是通过结合强化学习和深度神经网络进行训练的。

正如我们所见,机器学习问题有许多种类,每种问题都有许多算法。这些算法的复杂程度从用于数值预测的线性回归到用于图像处理的卷积神经网络,再到基于变换器的生成式人工智能模型,以及用于游戏和机器人技术的强化学习。