什么是朴素贝叶斯?
什么是朴素贝叶斯?
朴素贝叶斯是一种机器学习算法,在使用标记的数据对其进行训练后,可以将其用于分类任务。分类算法通常通过确定训练数据集中特征值和标签之间的关系来预测元素的类别。例如,要将电子邮件归类为垃圾邮件与否,分类算法可能会考虑优惠、折扣和点击等词语的出现频率以及主题标题等其他特征。
朴素贝叶斯假设:在给定类别标签的条件下,各个特征是相互独立的。这意味着特定特征的存在与否不会影响任何其他特征的存在与否,从而简化了计算。尽管朴素贝叶斯简单,且其独立性假设并不现实,但它在许多实际应用中表现良好,尤其是在文本分类问题上。
什么是贝叶斯统计?
贝叶斯统计是一项应用条件概率来解决统计问题的数学研究。条件概率是根据另一个事件分析特定事件发生的可能性。
我们可以将贝叶斯统计中的条件概率公式表示为:
P(A ∣ B) = P(B ∣ A) x P(A) / P(B)
其中:
-
P(A ∣ B) 是在发生给定事件 B 的情况下,事件 A 发生的概率。
-
P(B ∣ A) 是在发生给定事件 A 的情况下,事件 B 发生的概率。
-
P(A) 和 P(B) 是事件 A 和 B 的独立概率。
为了理解贝叶斯统计数据,我们考虑一下掷出公平骰子时获得小于 3 的奇数的条件概率。在本例中,
-
事件 A 是掷出 1、3 和 5 的行为。
-
事件 B 是掷出 1 和 2 的行为。
因此,
P (A) = 3/6 = 1/2。
P (B) = 4/6 = 2/3。
P (B ∣ A) = 1/3。
因此,当骰子显示的数字小于 3 时,得到奇数的概率为
P(A ∣ B) = ( 1/3 x 1/2 ) / 1/3。
= 1/6 / 1/3。
= 1/2。
从小于 3 的数字中掷出一个奇数(即 1)的概率为 50%。
什么是贝叶斯定理?
贝叶斯定理通过根据各种预测因子预测特定结果,扩展了贝叶斯统计中表达的条件概率。这样数据科学家就可以通过将主要贝叶斯表达式扩展为以下形式,从而研究影响某一事件的多种原因:
P(Ai ∣ B) = P(B ∣ Ai)P(Ai) / ( P(B ∣ A1)P(A1) + (P(B ∣ A2)P(A2) + ⋯ + P(B ∣ An)P(An) )
与基本的条件概率公式不同,贝叶斯定理允许在获得更多证据后对未来结果进行后续计算。例如,考虑从以下随机选择的盒子中取出黑球的概率:
-
1 号盒子:10 个黑球,5 个白球。
-
2 号盒子:10 个黑球,10 个白球。
-
3 号盒子:10 个黑球,15 个白球。
然后,我们将 B 定义为取出黑球的事件。
我们可以将挑选特定盒子的初始概率定义为
P(A1) = P(A2) = P(A3) = 1/3。
然后,我们可以按如下方式表示从相应的盒子中取出黑球的概率。
P(A1/B) = 10/15
P(A2/B) = 10/20
P(A3/B) = 10/25
这样,我们就可以计算出我们取出黑球时选择特定盒子的可能性。
朴素贝叶斯如何修改贝叶斯定理?
朴素贝叶斯重新利用了贝叶斯定理,为分类任务启用了监督式机器学习。与贝叶斯定理一样,朴素贝叶斯算法通过条件概率预测事件的结果。但是,朴素贝叶斯稍微改变了贝叶斯定理的应用方式。
假设
朴素贝叶斯分类器不同于逻辑回归等判别性分类器,后者评估在对数据进行分类时哪个特征更重要。相反,朴素贝叶斯分类器假设:
-
每个特征或预测因子都是独立的。
-
所有预测因子在确定最终结果时都具有同等的权重。
-
使用朴素贝叶斯进行预测时,没有哪个特征比其他特征更重要。一个特征的变化不会影响其他预测因子的概率。
修改
考虑到新的假设,我们可以用符合以下朴素贝叶斯原理的惯例来表示贝叶斯定理 P(A ∣ B) = P(B ∣ A) x P(A) / P(B):
后验概率 = 条件概率 x 先验概率/证据
通过这样做,我们得到以下定义。
-
P(A ∣ B) 是后验概率。
-
P(B ∣ A) 是类别条件概率。
-
P(A) 是类别先验概率。
-
P(B) 是先验概率的证据或预测因子。
示例
我们想根据申请人的年龄、职业和收入来计算成功批准贷款的可能性。通过应用朴素贝叶斯,数据科学家根据相应的预测因子估算贷款批准的概率。该算法将每个分类变量平等地分别考虑,排除了一个变量可能影响另一个变量的任何可能性。
通过这样的修改,朴素贝叶斯成为一种用于分类任务的简单而高效的机器学习算法。尽管如此,值得注意的是,朴素贝叶斯显然过于简化的假设并不能准确代表预测因子在现实生活中的行为。例如,大多数收入较高的申请人可能在某个行业工作了更长的时间。尽管过于简化,朴素贝叶斯模型仍然非常准确,非常适合情绪分析、垃圾邮件过滤和文本分类应用程序。
朴素贝叶斯如何运作?
为了更好地理解朴素贝叶斯分类器及其组件,想象一下使用 10 封标记的电子邮件训练的垃圾邮件过滤器。每封电子邮件都根据特定词语的出现次数、发件人的 IP 地址和域名进行标记。根据垃圾邮件和非垃圾邮件的类别变量,垃圾邮件过滤器应用朴素贝叶斯分类器来预测每个特征的条件分布。
后验概率
后验概率是一种在考虑新信息后会自行更新的预测。在上面的示例中,后验概率是电子邮件由于包含折扣等特定词语而被归类为垃圾邮件的可能性。
类别条件概率
类别条件概率是各种特征或预测因子影响结果的可能性。它将特征类别与目标类别分开。特征类别是由词语、IP 地址和域名等预测因子确定的类别。而目标类别是垃圾邮件或非垃圾邮件的分类结果。假设在 4 封垃圾邮件中,有 3 封包含“折扣”一词。因此,垃圾邮件中“折扣”一词的类别条件概率为 3/4。
类别先验概率
类别先验概率计算特定特征在整个数据集中出现的可能性。例如,7 封电子邮件(包括垃圾邮件和普通电子邮件)包含“折扣”一词。因此,“折扣”一词的类别先验概率为 7/10。
证据
证据或类别预测因子概率根据可用数据样本计算推断出目标结果的机会。假设数据集包含 4 封垃圾邮件和 6 封普通电子邮件。因此,垃圾邮件的类别预测因子概率为 4/10。
朴素贝叶斯分类器有哪些类型?
朴素贝叶斯不仅限于单一的机器学习算法,还包括一系列具有相同条件概率原理的不同模型。我们在下面介绍三种类型的朴素贝叶斯分类器。
高斯朴素贝叶斯分类器
高斯朴素概率分类器假设所有特征均为正态分布。每个特征或预测因子都分布在对称的钟形曲线上,在中位数达到峰值,并在接近下尾和上尾时逐渐减小。数据科学家使用此模型通过沿高斯曲线对连续值进行取样来对连续值进行分类。
多项式朴素贝叶斯分类器
多项式朴素贝叶斯模型通过对多项式分布的特征进行取样来进行预测。多项式分布是一个由有限或离散结果组成的数据集。例如,用骰子掷出特定数字的可能性是多项式。数据科学家经常使用这种类型的朴素贝叶斯进行文档分类。
伯努利朴素贝叶斯分类器
伯努利朴素贝叶斯分类器的工作原理与多项式朴素贝叶斯分类器类似。但是,伯努利朴素贝叶斯分类器使用布尔预测因子而不是离散数据点及其频率。布尔值是一种将信息表示为真或假的逻辑表示方式。您可以使用伯努利朴素贝叶斯分类器来确定客户反馈是正面还是负面。
朴素贝叶斯分类器有哪些优势?
与其他分类模型相比,朴素贝叶斯更易于训练和实现。即使训练样本有限,数据科学家也可以轻松训练朴素贝叶斯学习器。
通过假设条件独立性,朴素贝叶斯忽略了数据集中其他特征的影响因素。这意味着与逻辑回归等判别模型相比,朴素贝叶斯所需的计算能力更少。
朴素贝叶斯擅长对具有大量特征的数据集进行分类。还可以使用连续数据一致、准确地执行多分类任务。
朴素贝叶斯分类器的局限性是什么?
虽然朴素贝叶斯是一种多功能分类算法,但您应该注意一些局限性。
-
为了提高速度和简便性,朴素贝叶斯会解耦所有类别的条件特征分布。它假设所有预测因子都是独立的,这一点在现实应用中基本不成立。
-
朴素贝叶斯容易受到零频率的影响,在这种情况下,训练数据集中不存在特定的类别预测因子。除非对数据集应用平滑技术,否则零频率可能会导致预测不准确。
AWS 能提供哪些帮助?
Amazon SageMaker 是一项完全托管的服务,汇集了大量工具,可为任何使用案例提供高性能、低成本的机器学习(ML)。Amazon SageMaker 线性学习器算法为分类和回归问题提供了解决方案。与朴素贝叶斯技术相比,线性学习器算法提高了速度。使用 SageMaker 算法,您可以同时探索不同的训练目标,并从验证集中选择最佳解决方案。
对于寻求更现成解决方案的客户,Amazon Comprehend 是一项自然语言处理(NLP)服务,使用机器学习为寻求更现成解决方案的客户寻找文本中的含义和见解。您可以提取关键短语、理解情绪或识别文本文档中的主要主题。Amazon Comprehend 提供文档处理 API,可帮助您轻松地大规模处理文档,而无需使用朴素贝叶斯进行文本分类。
立即创建免费账户,开始在 AWS 上使用朴素贝叶斯分类器使用案例。
Browse all cloud computing concepts
Browse all cloud computing concepts content here:
Did you find what you were looking for today?
Let us know so we can improve the quality of the content on our pages