【西瓜书】阅读笔记 1. 绪论

绪论 引言 机器学习:假设用P来评估计算机程序在某任务类T上的性能,若一个程序通过经验E在T中任务上获得了性能改善,则我们就说关于T和P,该程序对E进行了学习。 基本术语 数据相关: 数据集(dataset)包含了一系列的记录,每条记录就是一个示例(instance)或者是样本(sample)。反应某些性质的是属性(attribute)或者是特征(feature)。属性取值称为属性值(attribute value),其张成空间称为属性空间(attribute space)或者样本空间(sample space)或者输入空间。空间中每一个点称为特征向量(feature vector)。 训练相关: 从数据学习到模型的过程称为学习(learning)或训练(training)。使用的数据称为训练数据(training data),每个样本为训练样本(training sample),整个集合称为训练集(training set)。学的模型对应了关于数据的某种潜在规律称为假设(hypothesis)。规律本身称为真相(ground truth)。模型也可以称为学习器(learner)。 训练之后,需要进行预测(prediction),关于示例结果的信息称为标签(label),拥有标签的示例是样例(example)。标签张成的空间为标记空间或者输出空间。 分类任务(classification):预测值为离散值。回归任务(regression):预测值为连续值。二分类任务(binary classification):输出为正类和负类。 学的模型后进行预测的阶段为测试(testing),被预测的样本称为测试样本(testing sample),同理还有测试集(testing set) 有监督学习(supervised learning):用拥有标记的数据训练,如分类和回归。 无监督学习(unsupervised learning):无标签的数据训练,如聚类(clustering),将训练样本分成若干个簇(cluster)。 泛化(generalization):模型适用于新样本的能力 独立同分布(iid):样本都从同一个分布上独立采样获得。 假设空间 归纳(induction):从特殊到一般。(generalization) 演绎(deduction):从一般到特殊。(specialization) 归纳学习(inductive learning):广义:从样本中学习。狭义:从数据中获得概念(concept),称为概念学习。 版本空间(version space):与训练集一致的假设集合 归纳偏好 归纳偏好(inductive bias):机器学习算法在学习过程中对某种类型假设的偏好,对应了学习算法本身所做出的关于“什么样的模型更好的”假设

June 24, 2020 · 1 分钟 · 38 字

【西瓜书】阅读笔记 2. 模型评估与选择

模型评估与选择 经验误差与过拟合 错误率(error rate):分类错误的总占比 精度(accuracy):分类正确的占比 误差(error):实际输出与真实输出的差异,在训练样本上为经验误差或训练误差,在新样本上的为泛化误差 过拟合(overfitting):泛化性能下降 欠拟合(underfitting):对训练样本效果不好 评估方法 通常使用测试集合(testing set)测试模型的性能,以测试误差(testing error)作为泛化误差近似 留出法 将数据集D分为两个互斥的集合,一部分为训练集S,一部分为测试集T。当S较大T较小的时候可能评估不够准确。如果T变大了,那么用S训练的模型可能和用D训练的模型相比差别太大,评估的结果也不够准确。 交叉验证法 将数据集D分为k个互斥的集合,将k-1个子集作为训练集,剩下的集合做为测试集合,这样就可以获得k组数据,最终返回这k组数据测试结果的平均值。极端情况就是留一法,留一法结果更为准确,但是计算开销大。 自助法 采用自助采样法(bootstrapping)有放回的采样一个新的数据集D′D'。用这个新数据集做训练,剩下的做测试。优点:该方法在数据集较小,难以有效的划分训练/测试集的时候有用。缺点:改变初始数据集分布,引入估计偏差。 调参与最终模型 算法参数(parameter)对算法的性能有很大影响。除了对算法进行选择,还需要对参数进行调整,就是调参(parameter tuning)。其中在对模型利用验证集对模型评估选择之后,确定模型和参数配置后,需要用数据集D整体重新训练一次模型才能进行测试,这才是最后提交的模型。模型评估时用的数据为了区分,称为验证集(validation set)。用验证集来评估算法的选择和调参,用测试集来评估算法的泛化性能。 性能度量 性能度量(perfomance measure):衡量模型泛化能力的评价标准 回归任务中最常用的性能度量是mse 均方误差: E(f;D)=1m∑i=1m(f(xi)−yi)2E(f ; D)=\frac{1}{m} \sum_{i=1}^{m}\left(f\left(x_{i}\right)-y_{i}\right)^{2}更一般的可以写成: E(f;D)=∫x∼D(f(x)−y)2p(x)dxE(f ; D)=\int_{x \sim D}(f(x)-y)^{2} p(x) d x错误率与精度 最常用的两种性能度量:错误率和精度 错误率:E(f;D)=1m∑i=1mI(f(xi)≠yi)E(f ; D)=\frac{1}{m} \sum_{i=1}^{m} I\left(f\left(x_{i}\right) \neq y_{i}\right) 精度:acc⁡(f;D)=1m∑i=1mI(f(xi)=yi)=1−E(f;D)\begin{aligned} \operatorname{acc}(f ; D) &=\frac{1}{m} \sum_{i=1}^{m} \mathbb{I}\left(f\left(x_{i}\right)=y_{i}\right) \\ &=1-E(f ; D) \end{aligned} 查准率、查全率与F1 在信息检索领域,通常关心“检索的信息有多少用户感兴趣”,“用户感兴趣的有多少被检索”。因此有查准率(precision)和查全率(recall)的概念。 二分类问题, 查准率 = 真正例/(真正例+假正例) 查全率 = 真正例/(真正例+假反例) ...

June 24, 2020 · 2 分钟 · 290 字