机器学习笔记(1):统计学习概论与监督学习
前言 主要参考为 《统计学习》—李航(蓝皮) 《机器学习》—周志华(西瓜书) 部分来自网络的内容(liaohuiqiang的博客为主,感谢他!) 统计学习(机器学习) 学习:Herber A. Simon曾对“学习”给出以下定义:“如果一个系统能够通过执行某个过程改进它的性能,这就是学习”。 统计学习:统计学习就是计算
从统计学习基础到 Transformers 的系统学习笔记
共 24 篇文章:统计学习概论与监督学习-封面.jpg)
前言 主要参考为 《统计学习》—李航(蓝皮) 《机器学习》—周志华(西瓜书) 部分来自网络的内容(liaohuiqiang的博客为主,感谢他!) 统计学习(机器学习) 学习:Herber A. Simon曾对“学习”给出以下定义:“如果一个系统能够通过执行某个过程改进它的性能,这就是学习”。 统计学习:统计学习就是计算
:线性模型-封面.jpg)
前言 参考: 机器学习—周志华(西瓜书) 部分网络的内容(主要是CHH3213的博客) 线性回归 介绍 线性:两个变量之间的关系是一次函数关系的——图象是直线,叫做线性。 非线性:两个变量之间的
:感知机-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 部分来自网络的内容(主要是liaohuiqiang的博客) 感知机 模型 基本模型:感知机1957年由Rosenblatt提出,是神经网络与SVM的基础。它是一个二分类的线性分类模型,其输入为实例的特征向量,输出为实例的类别,取+1和1二值。 假设向量$\mathbf{x}$是
:KNN-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 部分来自网络的内容(主要是liaohuiqiang的博客,以及CSDN上其他博主有关数据结构的部分内容) KNN(K近邻算法) 基本模型 给定一个训练数据
:朴素贝叶斯-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 部分来自网络的内容(主要是liaohuiqiang的博客) 朴素贝叶斯 简介 朴素贝叶斯法是基于贝叶斯定理与特征条件独立假设的分类方法。对于给定的训练数据集,首先基于“特征条件独立”的假设学习输入/输出的联合概率分布。然后基于此模型,对给定输入$x$,利用贝叶斯定理求后验概率最
:决策树-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 部分来自网络的内容(主要是liaohuiqiang的博客 决策树 模型 决策树可以认为是ifthen规则的集合,也可以认为是定义在特征空间与类空间上的条件概率分布。其主要优点是模型具有可读性,分类速度快。 从根节点出发 每个“内部结点”一个数据特征 每个分支结点对应于该特征“测
:对数线性模型(逻辑回归与最大熵模型)-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 部分来自网络的内容(主要是liaohuiqiang的博客) 逻辑回归 模型 关于对数几率和logit函数的引入我们在感知机的文章中已经提到 下面正式介绍逻辑回归(又称逻辑斯蒂回归) 逻辑斯谛分布 :设$X$是连续随机变量,$X$服从逻辑斯谛分布,则具有以下分布函数和密度函数。其
:SVM简介及线性SVM-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 部分来自网络的内容(主要是liaohuiqiang的博客) 支持向量机(SVM) 简介 支持向量机是一种二分类模型,它的基本模型是定义在特征空间上的间隔最
:非线性SVM与序列最小最优化算法(SMO)-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 部分来自网络的内容(主要是liaohuiqiang的博客) 支持向量机(SVM) 非线性SVM与核技巧 核技巧 左图分类问题无法用直线(线性模型)将正负实例正确分开,但可以用一条椭圆曲线(非线性模型)将它们正确分开。 如果能用一个超曲面将正负例正确分开,则称这个问题为非线性可分
:提升方法(AdaBoost与提升树)-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 部分来自网络的内容(主要是liaohuiqiang的博客) 提升方法 简介 提升方法(Boosting)是一种常用的统计学习方法,应用广泛且有效。在分类问题中,它通过改变训练样本的权重,学习多个分类器,并将这些分类器进行线性组合,提高分类的性能。 基本思路:Boosting基于
:期望最大化算法(EM算法)-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 期望最大化算法(EM算法) 引入 简介 概率模型有时既含有观测变量(Observable Variable)又含有隐变量或潜在变量(Latent Variable) e.g.购物网站,用户浏览商品行为包括点击促销广告/浏览高价商品/购买了一定频次,这些行为的关键点都在于平台只能
:监督学习方法总结-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 部分来自网络的内容(主要是liaohuiqiang的博客) 10种监督学习方法 注:笔者的笔记中并未整理最后两种 适用问题 感知机,KNN,朴素贝叶斯,决策树(排除CART回归树),逻辑斯谛回归与最大熵模型,SVM,提升方法(包括AdaBoost)是分类方法。原始的感知机,SV
:无监督学习概论-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 无监督学习 无监督学习基本原理 无监督学习是从无标注的数据中学习数据的统计规律或者说内在结构的机器学习,主要包括: 1. 聚类 2. 降维 3. 概率估计 无监督学习可以用于数据分析或者监督学习的前处理 无监督学习使用无标注数据$U=\{x1,x2,\cdots,xN\}$学习
:聚类方法-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 聚类的基本概念 聚类的基本概念包括:样本之间的距离或相似度,类或簇,类与类之间的距离 相似度或距离 简介 聚类的对象时观测数据,或样本集合。假设有$n$个样本,每个样本由$m$个属性的特征向量组成,样本集合可以用矩阵$X$表示 ::: aligncenter $X=[x{ij}
:SVD-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) SVD(奇异值分解) 定义与定理 定义(奇异值分解) 矩阵的奇异值分解是指,将一个非零的$m\times n$实矩阵$A,A\in\mathbf{R}^{
:PCA-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) PCA(主成分分析) 简介 主成分分析(Pricipal Component Analysis, PCA)是一种常用的无监督学习方法,这一方法利用正交变换
:无监督方法总结-封面.jpg)
前言 参考: 《统计学习》—李航(蓝皮) 另注:受笔者时间影响,此系列的笔记只有聚类方法、SVD和PCA,其余暂时不更新 无监督学习方法总结
:深度学习-封面.jpg)
人工智能的发展过程 人工智能: 机器学习表示学习深度学习 机器学习 通过硬编码的知识体系面对的困难表明,AI系统需要具备自己获取知识的能力,即从原始数据中提取模式的能力,这种能力被称为机器学习。 机器学习算法的性能很大程度上依赖于给定数据的表示,在整个计算机科学乃至日常生活中,对表示的的依赖是一个普遍的现象,表示的选择
:全连接前馈神经网络-封面.jpg)
(全连接)前馈神经网络 简介 前馈神经网络(Feedforward Neural Network, FNN)作为神经网络的一种,把每个神经元按接收信息的先后分为不同的组,每一组可以看作是一个神经层。每一层的神经元接收前一层神经元的输出,并输出到下一层神经元。整个网络中的信息是朝着一个方向传播的,它可以看作是一个函数,通
:卷积前馈神经网络-封面.jpg)
卷积(前馈)神经网络 简介 卷积神经网络(Covolutional Neural Network, CNN)是一种在计算机视觉领域取得了巨大成功的深度学习模型。它们的设计灵感来自于生物学会总得视觉系统,旨在模拟人类的视觉处理方式。 图像原理与为什么需要CNN 灰白图像在计算机中是一堆按顺序排列的数字,数值为0到255,
:循环神经网络-封面.jpg)
循环神经网络 前馈神经网络的缺陷 前馈神经网络每次输入都是独立的,即网络的输出只依赖于当前输入,且要求输入和输出都维度都是固定的,不能任意改变 但现实情况下,要求网络输出不仅和当前时刻输入相关,也和其过去一段时间输出相关,并且时序数据的长度一般式不固定的,比如视频、语音、文本等 给网络增加短期记忆能力 针对上面的问题,
:网络优化和正则化-封面.jpg)
引言 当神经网络模拟应用到机器学习时,往往会遇到下面两个问题 优化问题 全局最优解困难 训练效率通常比较低 梯度消失/爆炸问题 这导致神经网络的网络优化十分困难 泛化问题 模型复杂度高 拟合能力很强 容易产生过拟合问题 需要通过正则化方法提高泛化能力 网络优化 简介 网络优化指寻找一个神经网络模型来使得经验(或结构)风
:注意力机制-封面.jpg)
前言 人脑每个时刻接收的外界输入信息非常多,包括来自于视觉、听觉、触觉的各种各样的信息,人脑中的工作记忆并不能同时处理这些过载的输入信息,大脑神经系统有个重要机制可以解决信息过载问题,即注意力 借鉴人脑解决信息过载的机制,提高对神经网络处理信息的能力 注意力机制 简介 注意力是一种人类不可或缺的复杂认知功能,可以关注一
:Transformers Encoder-Decoder架构-封面.jpg)
前言 这是笔者在结束科班课程后对此系列笔记的接续更新,此后该系列的笔记主要以论文解析为主,值得注意的是,在之前CNN领域有诸多创新,例如2012年的AlexNet,2014年的VGGNet,2015年