我的编程空间,编程开发者的网络收藏夹
学习永远不晚
位置:首页-资讯-运维

统计学在人工智能中的地位?

短信预约 -IT技能 免费直播动态提醒
省份

北京

  • 北京
  • 上海
  • 天津
  • 重庆
  • 河北
  • 山东
  • 辽宁
  • 黑龙江
  • 吉林
  • 甘肃
  • 青海
  • 河南
  • 江苏
  • 湖北
  • 湖南
  • 江西
  • 浙江
  • 广东
  • 云南
  • 福建
  • 海南
  • 山西
  • 四川
  • 陕西
  • 贵州
  • 安徽
  • 广西
  • 内蒙
  • 西藏
  • 新疆
  • 宁夏
  • 兵团
手机号立即预约

请填写图片验证码后获取短信验证码

看不清楚,换张图片

免费获取短信验证码

统计学在人工智能中的地位?

为什么统计学在机器学习中如此重要?人工智能亦称智械、机器智能,指由人制造出来的机器所表现出来的智能。通常人工智能是指通过普通计算机程序来呈现人类智能的技术。通过医学、神经科学、机器人学及统计学等的进步,有些预测则认为人类的无数职业也逐渐被人工智能取代。

统计学和机器学习是两个密切相关的领域。实际上,两者之间的界限有时可能非常模糊。但是,有一些方法显然属于统计领域,不仅在机器学习项目中有用,而且非常有价值。可以公平地说,需要统计方法才能有效地通过机器学习预测建模项目工作。

统计学在人工智能中的地位_AI_人工智能_机器学习_编程学习网

统计学是先决条件

机器学习和统计学是两个紧密相关的研究领域。因此许多统计学家将机器学习称为“ 应用统计学 ”或“ 统计学习 ”,而不是以计算机科学为中心的名称。

所有的机器学习初学者都应该学习一点统计学的知识。下面有几个精心挑选的例子来具体说明。

从一本流行的应用机器学习书《 Applied Predictive Modeling 》的开头看一下这句话:

… the reader should have some knowledge of bASIC statistics, including variance, correlation, simple linear regression, and basic hypothesis testing (e.g. p-values and test statistics).

— Page vii, Applied Predictive Modeling, 2013

这是流行的《 Introduction to Statistical Learning 》一书中的另一个示例:

We expect that the reader will have had at least one elementary course in statistics.

— Page 9, An Introduction to Statistical Learning with Applications in R, 2013.

即使不是统计学的先决 条件,也需要一些原始的先验知识,这可以从广泛阅读的“ Programming Collective Intelligence ”的引用中看出:

… this book does not assume you have any prior knowledge of […] or statistics. […] but having some knowledge of trigonometry and basic statistics will help you understand the algorithms.

— Page xiii, Programming Collective Intelligence: Building Smart web 2.0 Applications, 2007.

为了能够理解机器学习,需要对统计信息有一些基本的了解。

想要知道为什么会这样,我们必须了解为什么首先需要统计领域。

为什么要学习统计?

原始观测值本身就是数据,但它们不是信息或知识。

数据引发了一些问题,例如:

  • 最常见或最期望的观察是什么?
  • 观察的极限是什么?
  • 数据是什么样的?

尽管它们看起来很简单,但必须回答这些问题才能将原始观察结果转化为我们可以使用和共享的信息。

除了原始数据,我们还可以通过设计实验来收集观察数据。从这些实验结果中,我们可能会遇到更复杂的问题,例如:

  • 哪些变量最相关?
  • 两次实验的结果有何不同?
  • 差异是真实存在的还是因为数据噪声产生的?

这些问题很重要。问题的答案对项目,利益相关者以及有效的决策都是至关重要的。

需要统计方法来找到关于数据的问题的答案。

我们可以看到,为了了解用于训练机器学习模型的数据并解释测试不同机器学习模型的结果,都需要统计方法。

这只是冰山一角,因为预测建模项目中的每个步骤都将需要使用统计方法。

什么是统计学?

统计学是数学的一个子领域。

它指的是处理数据和使用数据回答问题的方法的集合。

Statistics is the art of making numerical conjectures about puzzling questions. […] The methods were developed over several hundred years by people who were looking for answers to their questions.

— Page xiii, Statistics, Fourth Edition, 2007.

这是因为该领域包括处理数据的方法包,对于初学者而言,它看起来像是很大的东西,而且是不确定的。很难看出属于统计方法的方法与属于其他研究领域的方法之间的界限。通常,技术既可以是统计中的经典方法,又可以是用于特征选择或建模的现代算法。

尽管统计工作知识不需要深入的理论知识,但一些重要的且易于理解的定理可以为统计和概率之间的关系提供有价值的基础。

两个例子包括大数定律和中心极限定理;第一个有助于理解为什么较大的样本通常更好,第二个则为我们如何比较样本之间的期望值(例如平均值)提供了基础。

对于我们在实践中使用的统计工具,将统计领域分为两大类方法可能会有所帮助:用于汇总数据的描述性统计和用于从数据样本中得出结论的推论统计。

Statistics allow researchers to collect information, or data, from a large number of people and then summarize their typical experience. […] Statistics are also used to reach conclusions about general differences between groups. […] Statistics can also be used to see if scores on two variables are related and to make predictions.

Pages ix-x, Statistics in Plain English, Third Edition, 2010.

描述统计

描述性统计指的是将原始观察汇总为我们可以理解和共享的信息的方法。

通常,我们将描述性统计视为对数据样本的统计值的计算,以便总结数据样本的属性,例如共同的期望值(例如,均值或中位数)和数据的传播范围(例如,方差或标准差)。

描述性统计信息还可能涵盖可用于可视化数据样本的图形方法。图表和图形可以对观察的形状或分布以及变量之间如何相互关联提供有用的定性理解。

推论统计

推论统计是一些方法的统称,这些方法可以帮助从较小的一组称为样本的观测值中量化域或总体的属性。

通常,我们认为推论统计是根据总体分布估算的数量,例如期望值或传播数量。

更复杂的统计推断工具可用于量化在给定假设的情况下观察数据样本的可能性。这些通常被称为统计假设检验的工具,其中检验的基本假设称为原假设。

给定我们可以假设的假设范围以及我们可能施加在数据上的约束条件,以提高检验结果正确的能力或可能性,推理性统计方法的例子很多。

统计方法在机器学习项目中的使用示例

在下面的内容中,展示了统计方法的一些特定示例,这些示例在预测建模问题的关键步骤中非常重要。可以公平地说,需要统计方法才能有效地通过机器学习方法完成预测建模的工作。

1.问题框架

在预测建模问题中较大的影响力也许就是问题的框架。

这是问题类型的选择,例如回归或分类,也许是问题的输入和输出的结构和类型。

问题的框架并不总是很明显。对于某个领域的新手,可能需要对该领域中的观察结果进行大量探索。

对于可能不从常规角度看问题的领域专家,他们也可能会从多个角度考虑数据而获取一些有用信息。

可以在问题分类期间帮助探索数据的统计方法包括:

  • 探索性数据分析。进行汇总和可视化以探索数据的临时视图。
  • 数据挖掘。自动发现数据中的结构化关系和模式。

2.数据理解

数据理解意味着对变量的分布以及变量之间的关系有密切的了解。

其中一些知识可能来自领域专业知识,或者需要领域专业知识才能进行解释。尽管如此,研究领域的专家和新手都将从实际处理领域问题中的实际观察有所受益。

统计方法的两个大分支用于帮助理解数据。他们是:

  • 摘要统计。使用统计量总结变量之间的分布和关系的方法。
  • 数据可视化。使用图表和图形等可视化方法总结变量之间的分布和关系的方法。

3.数据清理

来自某个领域的观察通常不是原始的。

尽管数据是数字的,但会受到可能破坏数据保真度的过程的影响,进而可能会影响使用该数据的任何下一步过程或模型。

一些示例包括:

  • 数据损坏。
  • 数据错误。
  • 数据丢失。

识别和修复数据问题的过程称为数据清理

统计方法用于数据清理,例如:

  • 离群值检测。识别与分布中的期望值相差甚远的观测值的方法。
  • 归责。修复或填充观测值中损坏或缺失的方法。

4.数据选择

建模时,并非所有观察值或所有变量都可能相关。

将数据范围缩小到对做出预测最有用的那些元素的过程称为数据选择。

用于数据选择的两种统计方法包括:

  • 数据样本。从较大的数据集中系统创建较小的代表性样本的方法。
  • 特征选择。自动识别与结果变量最相关的那些变量的方法。

5.数据准备

数据通常不能直接用于建模。

通常需要进行一些转换,以更改数据的形状或结构,使其更适合问题的选定框架或学习算法。

使用统计方法进行数据准备。一些常见的示例包括:

  • 缩放比例。标准化和归一化等方法。
  • 编码。整数编码和One-hot编码等方法。
  • 转换。诸如Box-Cox方法之类的幂变换方法。

6.模型评估

预测建模问题的关键部分是评估学习方法。

在对模型训练期间未看到的数据进行预测时,通常需要估计模型的技能。

通常,训练和评估预测模型的过程的计划称为实验设计。这是统计方法的整个子领域。

  • 实验设计。设计系统实验以比较自变量对结果的影响的方法,例如选择机器学习算法来提高预测精度。

作为实施实验设计的一部分,使用方法对数据集进行重新采样,以便经济地利用可用数据,从而估算模型的技能。

  • 重采样方法。为了训练和评估预测模型而将数据集系统地分为子集的方法。

7.模型超参数配置

给定的机器学习算法通常具有一整套超参数,这些超参数允许使用者根据特定问题而定制学习方法。

超参数的配置在本质上通常是经验性的,而不是分析性的,需要大量的实验才能评估不同的超参数的取值对模型效果的影响。

使用两个统计子字段之一对不同的超参数配置之间的结果进行解释和比较:

  • 统计假设检验。给定对结果的假设或期望,量化观察结果的可能性的方法(使用临界值和p值表示)。
  • 估计统计。使用置信区间量化结果不确定性的方法。

8.模型选择

对于给定的预测建模问题,可能有不止一个机器学习算法适合于此问题。选择一种方法作为解决方案的过程称为模型选择。这可能涉及项目利益相关者的一套标准,也包括对问题评估方法的估计技能的仔细解释。

与模型配置一样,出于模型选择的目的,可以使用两类统计方法来解释不同模型的估计技能。他们是:

  • 统计假设检验。给定对结果的假设或期望,量化观察结果的可能性的方法(使用临界值和p值表示)。
  • 估计统计。使用置信区间量化结果不确定性的方法。

9.模型介绍

一旦对最终模型进行了训练,就可以在使用或部署最终模型以对实际数据进行实际预测之前将其呈现给利益相关者。

呈现最终模型的一部分涉及呈现模型的估计方法。

估计统计领域的方法可用于通过使用公差区间和置信区间来量化机器学习模型的估计技能中的不确定性。

  • 估计统计。通过置信区间量化模型技能不确定性的方法。

10.模型预测

最后,是时候开始使用最终模型对我们不知道实际结果的新数据进行预测了。

作为进行预测的一部分,量化预测的置信度很重要。

就像模型表示过程一样,我们可以使用估计统计领域的方法来量化此不确定性,例如置信区间和预测区间。

  • 估计统计。通过预测区间量化预测不确定性的方法。

从上面的例子可以看到统计方法在整个预测建模项目过程中的重要性。 探索性的数据分析,数据汇总和数据可视化可用于帮助构建预测性建模问题并更好地理解数据。统计方法可用于清理和准备用于建模的数据。统计假设检验和估计的统计数据可以在模型的选择和从最终模型展示的技能和预测帮助。

人工智能(Artificial Intelligence),英文缩写为AI。它是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新的技术科学。

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

统计学在人工智能中的地位?

下载Word文档到电脑,方便收藏和打印~

下载Word文档

猜你喜欢

统计学在人工智能中的地位?

编程学习网:统计学和机器学习是两个密切相关的领域。实际上,两者之间的界限有时可能非常模糊。但是,有一些方法显然属于统计领域,不仅在机器学习项目中有用,而且非常有价值。可以公平地说,需要统计方法才能有效地通过机器学习预测建模项目工作。
统计学在人工智能中的地位?

人工智能将占据主导地位的十年

编程学习网:AntWorks预测,在未来十年中,很难找到一个没有利用AI来智能地自动化业务流程的行业。在所有行业中都有无数的AI用例,这是我们对2020年及以后的预测。
人工智能将占据主导地位的十年

人工智能在能源领域中的挑战

编程学习网:能源领域追赶当今创新的一个方法是使用人工智能。人工智能可以给能源领域带来什么,以及如何使其更高效、更安全?
人工智能在能源领域中的挑战

人工智能在安防行业的探索和落地

编程学习网: 在安防行业5G+AI赋能下,高清视频将为安防行业带来重要的发展机遇期。5G具有增强移动宽带、高可靠低时延和广覆盖大连接的优势,使AI能与物联网融为一体。AI和5G近80%的典型应用是重叠的,5G能够支撑AI应用的大规模落地。
人工智能在安防行业的探索和落地

人工智能智能视频分析在零售业中的应用

编程学习网:在现代世界中,零售业正在迅速增加人工智能在所有可能的工作流程中的应用。因此,通过应用分析来利用机会无疑可以改善零售行业中的各种运营。
人工智能智能视频分析在零售业中的应用

人工智能数据机器学习在故障检测中的应用

编程学习网:本文将简要介绍几种在故障诊断领域广泛应用的机器学习技术及其各自的应用方向,并对每种技术的优缺点进行简单分析。包括:贝叶斯网络(BN),人工神经网络(ANN),支持向量机(SVM)和隐马尔可夫模型(HMM)技术。
人工智能数据机器学习在故障检测中的应用

人工智能掌握在垄断者的手中真的可怕

编程学习网:我至今还记得2016年那场旷世人机大战,人工智能软件“阿尔法狗”战胜世界围棋冠军李世石,那是一场标志性的比赛,打破了人们对人工智能的想象。
人工智能掌握在垄断者的手中真的可怕

人工智能机器学习如何在不久的将来改变教育

编程学习网:如果你目前在学校或者在教育领域工作,那么对即将到来的变化有所了解是非常必要的。在这篇文章中,我们将探讨机器学习在未来几年改善教育的五种途径
人工智能机器学习如何在不久的将来改变教育

人工智能在网络安全中发挥作用的新机会

编程学习网:新技术的应用通常伴随着积极和消极的影响。在网络世界中,不断发展的技术随之带来更多的风险,新技术也会为网络攻击者提供更多网络攻击的机会。尽管很多组织制定了反击和应对策略,但网络攻击者始终会在造成损害和破坏关键系统方面领先一步。
人工智能在网络安全中发挥作用的新机会

人工智能统计调查:86%的消费者更喜欢人工客服

编程学习网:美国消费者越来越不愿意与聊天机器人聊天,人们对人工智能作为关键业务组成部分的期望越来越高,由于部署这项新技术导致员工技能差距越来越大。
人工智能统计调查:86%的消费者更喜欢人工客服

人工智能在数据中心的广泛应用做好准备了吗?

编程学习网:如今,越来越多的服务器供应商正在努力地开发由人工智能驱动的服务器自动化技术。那么企业为此准备好了吗?
人工智能在数据中心的广泛应用做好准备了吗?

人工智能中国学者首次实现基于无人机的量子纠缠分发

编程学习网:量子纠缠是一种奇异的量子力学现象,处于纠缠态的两个光子不论相距多远都存在一种关联,其中一个量子状态发生改变,另一个的状态会瞬时发生相应改变。
人工智能中国学者首次实现基于无人机的量子纠缠分发

编程热搜

  • 人工智能你要知道的那些事
    编程学习网:早在1g时代我们只能接打电话。2g时代可以打电话发短信,玩早期的qq,但网络十分不稳定。3g时代带给我们很大的改变就是宽带上网,视频通话,看视频,听歌玩游戏。那时的人们认为4g无用,认为不会有什么改变,但当4g出来时我们才发现这是一次质的飞跃。
    人工智能你要知道的那些事
  • 人工智能无人机管制到底有多难?
    编程学习网:近日,一段“重庆网红列车遭无人机撞击逼停”的视频,在网络热传。
    人工智能无人机管制到底有多难?
  • 人工智能与人类
    欢迎各位阅读本篇,人工智能是计算机科学的一个分支,它企图了解智能的实质,并生产出一种新的能以人类智能相似的方式做出反应的智能机器,该领域的研究包括机器人、语言识别、图像识别、自然语言处理和专家系统等。本篇文章讲述了人工智能与人类,编程学习网教育平台提醒各位:本篇文章纯干货~因此大家一定要认真阅读本篇文章哦!
    人工智能与人类
  • 两小时 Elasticsearch 性能优化,直接把慢查询干团灭了……
    公共集群的机器负载分布不均衡的问题,业务的查询和流量不可控等各种各样的问题,要节省机器资源就一定会面对这种各种各样的问题,除非土豪式做法,每个业务都拥有自己的机器资源,这里面有很多很多颇具技术挑战的事情。
    两小时 Elasticsearch 性能优化,直接把慢查询干团灭了……
  • 关于OpenStack的架构详细讲解
    欢迎各位阅读本篇文章,OpenStack是一个开源的云计算管理平台项目,由几个主要的组件组合起来完成具体工作。本篇文章讲述了关于OpenStack的架构详细讲解,编程学习网教育平台提醒各位:本篇文章纯干货~因此大家一定要认真阅读本篇文章哦!
    关于OpenStack的架构详细讲解
  • AI &神经网络
    欢迎各位阅读本篇,本篇文章讲述了AI &神经网络,人工智能(Artificial Intelligence),英文缩写为AI。它是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新的技术科学。神经网络内容丰富,反映了当前国内外该领域的最新研究成果和动向,编程学习网教育平台提醒各位:本篇文章纯干货~因此大家一定要认真阅读本篇文章哦!
    AI &神经网络
  • 人工智能对于网络安全的优缺点
    编程学习网:如今,产生的数据比以往任何时候都要多。由于数据分析工具的发展,各行各业的组织都更加重视大数据的收集和存储。
    人工智能对于网络安全的优缺点
  • Bash 初学者系列 7:bash 中的条件语句(if else)
    今天我们介绍一下如何在 bash 中使用条件语句。
    Bash 初学者系列 7:bash 中的条件语句(if else)
  • 人工智能机器学习的重要趋势是什么?
    编程学习网:在竞争日益激烈的技术市场中,从高科技初创公司到全球跨国公司都将人工智能视为关键竞争优势。但是,人工智能行业发展如此之快,以至于很难跟踪最新的研究突破和成就,甚至很难应用科学成果来实现业务成果。
    人工智能机器学习的重要趋势是什么?
  • 人工智能为什么会觉得Matplotlib用起来困难?
    编程学习网:Matplotlib是一个流行的Python库,可以很容易地用于创建数据可视化。
    人工智能为什么会觉得Matplotlib用起来困难?

目录