关于如下这本书的知识总结:) 动手学机器学习
初探机器学习
机器通过经验数据 对任务目标做出优化的自动化过程,学习就是 系统基于数据来提升既定指标分数的过程,这个也是目前LLM领域比较突出问题,就是 数据质量,对于传统的机器学习和深度学习的模型检测都有一些标准的人为划分的数据集用来进行模型的训练,但是 LLM 需要的数据很庞大,而且需要进行不断的迭代更新,尤其是 标准的文本式问答,这种数据集并没有一个 固定单一的答案,缺乏一个 明确的监督信号是 大模型目前一个深刻的问题。
机器学习是一门研究算法的学科,能够非显式编程(显示编程是自己有一个解决方案用代码实现,非显式是自迭代拟合实验数据)的形式,通过经验数据来提升性能指标,数学描述机器学习的形式是:
数据集为 D,在给定的模型空间 中,寻找最大化性能指标的预测模型 , 对于上述的优化范式中,我们在一个 模型空间中寻找最优模型 ,可以理解成一个 持续迭代的形式,这个寻找最优模型的过程就是 机器学习,我的理解就是**让模型去拟合数据,提高在数据集上的表现能力。

机器学习类别
监督学习
训练集D中每个数据样本(x,y)由特征和标签组成,模型任务是根据这个 数据特征 来预测 这个标签样本,模型的性能用损失函数来评估,就是
无监督学习
其实无监督相当于有监督,就是 数据样本没有标签,每个数据集只有 特征 x,我们方法要根据概率分布p(x),去建模数据的分布,可以理解成没有标准答案,让模型自己去找数据中的规律,比如:1000 张图片中可能有很多动物,让你根据这些图片的特征去进行分类(同一类别会有相似性),其实就是去学习数据特征
这个p(x) 其实是表示 数据的概率
参数化/非参数化模型
模型需要多少个自由度来描述,是否随着训练数据量的增加二增加 参数化模型:其实就是相当于参数矩阵(向量)是固定的,将数据的特征压缩到固定大小的参数中
非参数化模型:其实就是将数据特征通过聚合处理变成一个更适合模型的数据特征