大型语言模型已经掌握了新闻周期,但还有许多其他类型的机器学习和深度学习,具有许多不同的应用场景。
在关于ChatGPT、Bard和其他生成式大型语言模型(LLMs)的所有炒作和狂热之中,值得退后一步,看看AI算法的种类及其用途。毕竟,许多“传统”的机器学习算法已经解决了数十年的重要问题——而且它们仍然表现出色。为什么LLMs应该得到所有关注呢?

在我们深入探讨之前,请记住,机器学习是从数据中自动创建预测模型的一类方法。机器学习算法是机器学习的引擎,也就是说,是算法将数据集转化为模型。哪种算法效果最好(有监督、无监督、分类、回归等)取决于你要解决的问题类型、可用的计算资源以及数据的性质。

在下文中,我将简要介绍不同类型的机器学习和机器学习模型。然后,我将讨论14种最常用的机器学习和深度学习算法,并解释这些算法如何与预测、分类、图像处理、语言处理、游戏和机器人技术以及生成式AI的模型创建相关。

机器学习的种类

机器学习可以解决非数值分类问题(例如,“预测这位申请人是否会违约其贷款”)和数值回归问题(例如,“预测我们零售点未来三个月食品加工器的销售量”)。这两种类型的模型主要使用监督学习进行训练,这意味着训练数据已经被标记了答案。

标注训练数据集既耗时又昂贵,因此通常在监督学习中增强半监督学习。半监督学习将小规模标注数据集的监督学习模型应用于更大规模未标注数据集,并将预测数据中正确概率高的部分添加到模型中以进行进一步预测。然而,半监督学习有时可能会偏离正轨,因此可以通过人类在循环(HITL)对可疑预测进行审查来改进该过程。

虽然监督学习的最大问题是训练数据标注的费用,无监督学习(数据未被标注)的最大问题在于它往往效果不佳。然而,无监督学习也有其用途:它可以有时对减少数据集的维度、探索数据的模式和结构、发现相似对象的群组以及检测数据中的异常值和其他噪声有所帮助。

一个以学习为目的而学习的代理人的潜力远大于一个将复杂图片简化为二进制决策(例如,狗或猫)的系统。揭示模式而不是执行预定义的任务可以产生令人惊讶且有用的结果,正如劳伦斯伯克利国家实验室的研究人员在数百万材料科学摘要上运行文本处理算法(Word2vec)来预测新热电材料的发现时所展示的那样。

强化学习训练一个行动者或代理,以通过试错的方式对环境做出反应,从而最大化某些价值。这与监督学习和非监督学习不同,但经常与它们结合使用。它已被证明对于训练计算机玩游戏和训练机器人执行任务非常有用。

神经网络最初受到生物视觉皮层结构的启发,由一系列称为人工神经元的连接单元组成,这些单元按层组织。人工神经元通常使用sigmoid或ReLU(修正线性单元)激活函数,而不是早期感知器所使用的阶跃函数。神经网络通常通过监督学习进行训练。

深度学习使用具有大量“隐藏”层的神经网络来识别特征。隐藏层位于输入层和输出层之间。模型中的层数越多,可以识别的特征就越多。同时,模型中的层数越多,训练所需的时间就越长。神经网络的硬件加速器包括GPU、TPU和FPGA。

通过在新标记的数据上训练最后几层而不修改其余层级的权重,微调可以显著加快模型的定制速度。适合微调的模型被称为基础模型或基础模型。

视觉模型通常使用深度卷积神经网络。视觉模型能够识别照片和视频帧中的元素,并且通常在非常大的照片数据集上进行训练。

语言模型有时使用卷积神经网络,但最近倾向于使用循环神经网络、长短期记忆或转换器。语言模型可以构建为从一种语言翻译到另一种语言,分析语法,总结文本,分析情感,以及生成文本。语言模型通常在非常大的语言数据集上进行训练。

流行的机器学习算法

以下列表并不全面,算法大致按照从简单到复杂的顺序排列。

线性回归

线性回归,也称为最小二乘回归,是预测数值的最简单的监督式机器学习算法。在某些情况下,线性回归甚至不需要优化器,因为它可以以封闭形式解决。否则,使用梯度下降法(见下文)可以轻松进行优化。线性回归的假设是目标函数与自变量呈线性相关。对于您的数据,这一假设可能成立也可能不成立。

让数据科学家们感到绝望的是,业务分析师们经常轻松地使用线性回归来解决预测问题,然后停止,甚至不制作散点图或计算相关性,以查看基本假设是否合理。不要陷入这个陷阱。进行探索性数据分析并不难,然后让计算机尝试所有合理的机器学习算法,看看哪些效果最好。无论如何,尝试线性回归,但将结果视为基准,而不是最终答案。

梯度下降

机器学习中的优化方法,包括神经网络,通常使用某种形式的梯度下降算法来驱动反向传播,通常具有一种机制来帮助避免陷入局部最小值,例如优化随机选择的小批量数据(随机梯度下降)以及对梯度应用动量修正。一些优化算法还通过查看梯度历史来调整模型参数的学习率(AdaGrad、RMSProp和Adam)。

逻辑回归

分类算法可以解决监督学习问题,这些问题要求在两个或多个类别之间进行选择(或确定概率)。逻辑回归是一种解决分类问题的方法,它使用sigmoid或logit函数内的线性回归,将值压缩到0到1的范围内并给出概率。就像数值预测中的线性回归一样,逻辑回归是进行分类预测的好方法,但不应该是你尝试的最后一个方法。

支持向量机

支持向量机(SVM)是一种参数化分类模型,是一种几何上分离和分类两个标签类的方法。在两个变量之间良好分离的类最简单的情况下,SVM会找到一个平面上的直线,最好地分离这两组点。

在更复杂的情况下,点可以被投射到更高维度的空间中,而支持向量机(SVM)会找到最佳分离两个类别的平面或超平面。这种投射被称为核函数,这个过程被称为核技巧。在您反向投射后,所得的边界通常是非线性的。

当存在多于两个类别时,SVMs会成对应用于这些类别。当类别重叠时,可以对错误分类的点添加惩罚因子;这被称为软间隔。

决策树

决策树(DTs)是一种非参数化监督学习方法,用于分类和回归。其目标是创建一个模型,通过从数据特征中推断出的简单决策规则来预测目标变量的值。可以将一棵树视为分段常数近似。

决策树易于解释且部署成本低廉,但训练时计算成本高昂且容易过拟合。

随机森林

随机森林模型生成了一个随机决策树的集合,用于分类和回归。该集合通过模态投票或对决策树中的概率进行平均来聚合。随机森林是一种袋装集成方法。

XGBoost

XGBoost(极端梯度提升)是一个可扩展的、端到端的树增强系统,它在许多机器学习挑战中取得了最先进的结果。Bagging和Boosting经常被一起提及。不同之处在于,梯度树提升不是生成随机树(RDF)的集合,而是从一个单一的决策树或回归树开始,对其进行优化,然后从第一棵树的残差中构建下一棵树。

K-means 聚类

k-means聚类问题尝试使用欧几里得距离度量将n个观测值分为k个簇,目的是最小化每个簇内的方差(平方和)。这是一种无监督的向量量化方法,对于特征学习和为其他算法提供起点非常有用。

Lloyd算法(迭代聚类合并并更新质心)是解决此问题最常用的启发式算法。虽然它相对高效,但不能保证全局收敛。为了改进这一点,人们通常会多次运行算法,使用由Forgy或随机分区方法生成的随机初始聚类质心。

K-means假设的是可分离的球形簇,使得均值向簇中心收敛,并且假设数据点的顺序无关紧要。期望簇的大小相似,以便将分配给最近的簇中心是正确的分配。

主成分分析

主成分分析(PCA)是一种统计程序,它使用正交变换将一组可能相关的数值变量观测值转换为称为主成分的一组线性不相关变量的值。卡尔·皮尔逊于1901年发明了PCA。PCA可以通过数据协方差(或相关)矩阵的特征值分解,或数据矩阵的奇异值分解(SVD)来实现,通常在应用于初始数据的一个归一化步骤之后。

流行的深度学习算法

有许多非常成功且广泛采用深度学习范式,其中最新的是今天生成式AI模型背后的Transformer架构。

卷积神经网络

卷积神经网络(CNNs)是一种常用于机器视觉的深度神经网络。它们具有令人满意的与位置无关的特性。

对图像应用卷积层时,可以这样理解:它在空间上滑动,计算点积;层中的每个单元共享一组权重。卷积网络通常使用多个卷积层,并在激活函数之间交替使用。虽然存在去除这些类型层的趋势,但卷积神经网络也可以具有池化和全连接层。

循环神经网络

虽然卷积神经网络在分析图像方面做得很好,但它们并没有真正具备处理时间序列和序列的机制,因为它们是严格的前馈网络。另一种深度神经网络——循环神经网络(RNNs),明确地包含了反馈回路,这有效地赋予了它们一些记忆和动态时间行为,并允许它们处理如语音等序列。

这并不意味着卷积神经网络(CNNs)在自然语言处理方面没有用处;它确实意味着循环神经网络(RNNs)能够模拟卷积神经网络无法捕捉的时间信息。而且,这并不意味着RNNs只能处理序列。RNNs及其衍生品在多种应用领域中都有应用,包括语言翻译、语音识别与合成、机器人控制、时间序列预测与异常检测以及手写识别。

虽然从理论上讲,普通的RNN可以在无数个步骤中携带信息,但在实践中,它通常无法在没有失去上下文的情况下进行多个步骤。造成这一问题的原因之一是网络的梯度在许多步骤后趋于消失,这干扰了基于梯度的优化器(如随机梯度下降(SGD))的收敛能力。

长短期记忆

长短时记忆网络(LSTMs)被明确设计为避免梯度消失问题并允许长期依赖。与循环神经网络(RNN)的单元设计相比,LSTM的设计增加了一些复杂性,但对于长序列的处理效果要好得多。

在LSTM中,网络既能遗忘(控制)先前信息,也能记住它,这两种情况都是通过改变权重来实现的。这实际上赋予了LSTM长期和短期记忆,并解决了梯度消失问题。LSTM能够处理数百个过去输入的序列。

Transformers

Transformer是一种仅使用注意力机制的神经网络,完全摒弃了递归和卷积。Transformer是在谷歌(Google)发明的。

注意力单元(和转换器)是谷歌的BERT(基于转换器的双向编码器表示)算法和OpenAI的GPT-2算法(带有无监督预训练的转换器模型)的一部分,用于自然语言处理。转换器继续是最新大型语言模型(如ChatGPT/Bing Chat(基于GPT-3.5或GPT-4)和Bard(基于LaMDA,代表对话应用语言模型))神经架构的重要组成部分。

与循环神经网络(RNNs)不同,注意力单元对句子中两个词出现的接近程度并不十分敏感;这使得它们擅长处理RNNs处理不好的任务,例如识别代词的前置词,这些代词可能与指代代词被几个句子隔开。注意力单元擅长关注比当前词前几个词更大的上下文。

Q-learning

Q-learning是一种无模型、基于价值的、离线策略的强化学习算法,它基于当前状态寻找最佳的动作序列。这里的“Q”代表质量。质量表示动作在最大化未来奖励中的价值。Q-learning本质上是通过经验学习。

Q-learning通常与深度神经网络相结合使用。它使用经过训练的卷积神经网络从视频帧中提取特征,例如用于教导计算机玩电子游戏或学习机器人控制。AlphaGo和AlphaZero是来自Google DeepMind的著名成功的游戏程序,它们是通过结合强化学习和深度神经网络进行训练的。

正如我们所见,机器学习问题有许多种类,每种问题都有许多算法。这些算法的复杂程度从用于数值预测的线性回归到用于图像处理的卷积神经网络,再到基于变换器的生成式人工智能模型,以及用于游戏和机器人技术的强化学习。

历经一段时间的筹备、页面调试与内容架构规划,知悟AI求索个人技术网站今日正式上线开通!目前全站正处于首期学习资料归集、内容排版优化、专栏栏目搭建的阶段,部分板块内容尚未完善,后续我会持续更新干货内容,打造一个专注AI学习、技术深耕、实战复盘的个人技术自留地,也欢迎每一位热爱人工智能、想要深耕AI开发与智能体领域的同行、爱好者常来交流、共同求索成长。

一、知悟AI求索建站初心:以知悟道,求索AI本源
当下人工智能行业迎来爆发式迭代,大模型持续更新、AI智能体从概念走向落地、各类AI开发框架层出不穷,AI技术彻底融入软件开发、办公提效、业务自动化、垂直行业赋能等各个场景。但在海量碎片化信息充斥网络的当下,很多AI学习者都会遇到共同的痛点:全网教程参差不齐,新手入门找不到系统路线;前沿技术更新太快,跟不上行业迭代节奏;理论知识繁多,缺少可直接复用的实战案例;AI智能体这类新兴方向资料零散,很难形成完整的知识体系。
与此同时,我自身在长期学习AI、落地AI开发项目、搭建专属AI智能体的过程中,积累了大量笔记、踩坑记录、实战代码与学习方案。为了告别零散的本地笔记,系统化沉淀自己的技术成长之路,同时也希望把自己踩过的坑、总结的经验、梳理的体系分享给更多同行,因此搭建了知悟AI求索个人网站。
网站取名“知悟AI求索”,寓意十分清晰:知是学习前沿AI理论知识,夯实技术底层根基;悟是透过技术表象领悟AI底层逻辑与落地思维;求索是紧跟行业发展,持续探索AI新技术、新玩法、新落地场景。本站不追逐流量热点,不堆砌无效水文,只做纯粹、干货、接地气的AI技术分享,让每一位访客都能在这里学有所获、少走弯路。

二、网站核心定位:聚焦三大AI核心学习方向
知悟AI求索全站内容将精准聚焦三大核心板块,覆盖从新手入门到高阶实战的全流程AI学习路径,所有内容均结合个人真实学习经历与项目实战经验撰写,拒绝搬运网络同质化内容,保证原创性与实用性。

  1. 前沿AI技术动态与基础体系学习
    紧跟全球最新人工智能行业动态,实时同步大模型迭代、多模态AI、AI应用生态、行业政策与技术趋势,帮助大家第一时间把握行业风向。同时搭建系统化的AI基础学习专栏,从零开始梳理人工智能底层知识,涵盖大模型原理、提示词工程进阶、多模态AI应用、AI基础知识科普、新手避坑指南等内容。
    区别于网上碎片化的短视频教程,本站会把零散知识点串联成完整的学习链路,针对AI新手量身打造循序渐进的学习方案。无论是零基础想要入门AI的初学者,还是想要补齐理论短板的实战开发者,都可以在这里找到适配自己阶段的学习内容。后续我还会整理专属的AI入门学习路线图、必看书单、优质学习工具合集,一站式解决新手不知道学什么、怎么学的难题。
  2. AI智能体全流程技术深耕(本站核心重点板块)
    2025-2026年,AI智能体已经成为人工智能领域最核心的风口,从单任务智能体到多智能体协作,从本地轻量化智能体部署到云端企业级智能体搭建,AI智能体正在彻底改变人机交互模式与自动化工作流搭建方式。但目前市面上完整、通俗易懂、落地性强的智能体教程十分稀缺,很多开发者只能看懂概念,却无法独立完成智能体搭建、调试与优化。
    因此,AI智能体技术将是本站长期深耕的核心内容。后续专栏会全方位覆盖AI智能体从入门到高阶的全部内容:智能体核心工作原理、记忆模块设计、工具调用机制、规划与反思机制、主流智能体框架(LangChain、AutoGPT、Dify、Coze等)实战教学、私有化本地智能体部署、行业专属垂直智能体定制、多智能体协同项目实战。
    我会完整还原每一个智能体项目的搭建全过程,包含完整代码、详细注释、报错解决方案、性能优化技巧,解决大家搭建智能体过程中报错闪退、调用失败、逻辑混乱、效率低下等常见问题,让所有人都能从零上手,独立开发属于自己的专属AI智能体。
  3. 一线AI开发实战经验与踩坑复盘
    纸上得来终觉浅,AI技术最终需要落地到实际项目中。本站第三大核心内容,就是真实可复用的AI开发实战经验分享,涵盖桌面端AI应用开发、网页端AI工具搭建、企业AI工作流落地、AI接口二次开发、大模型微调实战、私有化大模型部署等全场景开发内容。
    相较于通用的理论教程,我会重点分享项目落地过程中的真实踩坑记录、优化方案、成本控制技巧与工程化开发思维。很多AI教程只讲成功流程,却忽略了开发中90%的报错与兼容问题,而我会把自己实战中遇到的每一个问题、排查思路、最终解决方案完整记录下来,帮助开发者大幅降低项目试错成本,提升AI项目落地效率。同时也会持续分享AI提效工具、编程辅助方案,帮助开发者借助AI提升自身开发效率。

三、当前网站进度:资料整理中,后续更新规划说明
目前网站刚刚完成基础架构搭建,首页、文章专栏、分类目录、关于我、留言交流板块均已正式上线,但海量原创学习笔记、实战教程、代码资源、学习合集仍在整理与排版过程中,近期会保持高频更新,逐步补齐全站内容。
接下来短期更新计划如下:第一阶段,上线AI新手入门零基础系列文章,搭建完整入门学习框架;第二阶段,更新主流AI智能体框架零基础搭建教程,从最简单的单工具智能体开始,循序渐进带领大家上手实战;第三阶段,上线完整AI开发项目复盘,同步开源部分实战代码,配套图文+步骤详解;长期来看,还会推出专属学习合集、免费资源下载专区、读者问答专栏,解答大家在AI学习和开发中遇到的各类问题。
同时网站会保持轻量化、无广告、无冗余弹窗的设计,坚持干净纯粹的阅读体验,所有原创技术内容永久免费公开,致力于打造一个纯粹的AI技术交流与学习平台。

四、写在最后:与同路人一起,持续求索AI未来
人工智能行业依旧处在高速发展的上升期,技术每天都在迭代,没有人能掌握全部的AI知识,我们都是持续学习、不断求索的同行者。搭建这个网站,一方面是沉淀自我、记录自己的AI学习成长轨迹,见证技术学习路上的每一步进步;另一方面也是搭建一个开放的交流空间,欢迎各位技术爱好者留言交流、提出内容建议、分享学习心得,也可以提出想要学习的AI技术方向,我会根据大家的需求定制对应的教程内容。
知悟于心,求索于行。未来很长,AI之路漫漫,我会持续深耕技术、持续输出干货,稳步完成全站学习资料的整理与更新。感谢每一位访客的遇见与陪伴,期待在这里和大家一起读懂AI本质、玩转智能体开发、积累实战开发经验,在人工智能的浪潮中,稳步前行,共同成长。

知悟AI求索
2026年6月