binglu’s blog
← 返回文章
机器学习

机器学习基础知识

冰露4 分钟

构建机器学习模型包括数据收集和准备、选择合适的算法、在准备好的数据上训练模型,以及通过测试和迭代评估其性能。

训练数据 –> 机器学习算法 –> 模型

机器学习过程始于训练数据的收集和处理。糟糕的数据通常被称为 “垃圾进垃圾出” ,因此机器学习模型的质量完全取决于用于训练它的数据。虽然数据准备和处理有时是例行公事,但它无疑是决定模型能否按预期运行或导致其性能崩溃的最关键阶段。

训练机器学习模型时会用到几种不同类型的数据。首先,了解标记数据和未标记数据之间的区别非常重要。

Labeled data 标记数据

标注数据是指每个实例或示例都附带一个标签或目标变量的数据集,该标签或目标变量代表所需的输出或分类。这些标签通常由人类专家提供,或通过可靠的流程获得。

例如: 在图像分类任务中,标记数据将包含图像及其对应的类别标签(例如, 汽车 )。

Unlabeled data 未标记数据

无标签数据是指实例或示例没有任何关联标签或目标变量的数据集。该数据仅包含输入特征,没有任何相应的输出或分类信息。
例如: 一组没有任何标签或注释的图像

训练中使用的主要数据类型是结构化数据和非结构化数据。它们又包含各种子类型,您可以通过展开以下类别找到这些子类型。

Structured data 结构化数据

结构化数据是指以预定义方式组织和格式化的数据,通常以表格或数据库的形式呈现,包含行和列。这类数据适用于需要明确定义特征和标签的传统机器学习算法。以下是一些结构化数据的类型。
表格数据: 这包括存储在电子表格、数据库或 CSV 文件中的数据,其中行代表实例,列代表特征或属性。
时间序列数据: 这类数据由在连续时间点测量的一系列值组成,例如股票价格、传感器读数或天气数据

Unstructured data 非结构化数据

非结构化数据是指缺乏预定义结构或格式的数据,例如文本、图像、音频和视频。这类数据需要更高级的机器学习技术才能提取出有意义的模式和洞见。
文本数据: 包括文档、文章、社交媒体帖子和其他文本数据。
图像数据: 包括数字图像、照片和视频帧。

编译后的训练数据被输入到机器学习算法中。机器学习过程传统上分为三大类: 监督学习无监督学习强化学习

监督学习中,算法使用已标记的数据进行训练。其目标是学习一个映射函数,该函数能够预测新的、未见过的输入数据的输出。

无监督学习是指从未标记数据中学习的算法。其目标是发现输入数据中固有的模式、结构或关系。

强化学习中,机器仅被赋予一个性能评分作为指导;而在半监督学习中,只有一部分训练数据被标记。反馈以奖励或惩罚的形式提供给机器,机器通过这些反馈来学习,从而随着时间的推移改进其决策。

模型训练完成后,就可以开始利用模型学习到的信息进行预测或决策了。这个过程称为推理。

机器学习中有两种主要的推理类型:批量推理和实时推理。

批量推理是指计算机一次性处理大量数据(例如图像或文本),并对其进行分析以提供一组结果。这种推理方式常用于数据分析等任务,在这些任务中,决策速度不如结果的准确性重要。

实时推理是指计算机必须根据不断涌入的新信息快速做出决策。这对于需要即时决策的应用至关重要,例如聊天机器人或自动驾驶汽车。计算机必须处理传入的数据并几乎瞬间做出决策,而无需花费时间分析庞大的数据集。

批量推理和实时推理各有其独特的优势和应用场景。具体使用哪种推理方式将取决于您的应用场景。