binglu’s blog
← 返回文章
机器学习

简单科普什么是机器学习

冰露5 分钟

机器学习作为人工智能(AI)的一个子集,主流范式通常概括为三大类,那就是有监督学习、无监督学习强化学习。细分的话行业里还有半监督学习、自监督学习、迁移学习等分支,感兴趣可自行了解…

机器学习核心定义

让计算机从数据中自动学习规律,并用规律预测未知或做出决策的技术。

机器学习分类(以《王者荣耀》为例)

1. 有监督学习 (Supervised Learning)

  • 核心机制: “带标签的训练” —— 输入数据时,同时提供“正确答案”。

  • 王者荣耀例子:

    • 任务:分类 (Classification)

      • 目标: AI 实时识别小地图上的敌方英雄是谁。
      • 训练: 喂给 AI 大量小地图截图,每张图都标注了“这是鲁班七号”、“那是安琪拉”。
      • 结果: AI 学会看小地图上的移动轨迹、技能特效等特征,能预测新截图里的英雄身份。
    • 任务:回归 (Regression)

      • 目标: AI 预测玩家下一步最可能使用的召唤师技能(闪现/净化/斩杀)。
      • 训练: 记录大量玩家对战片段,每个片段(血量、位置、敌人状态等)都标注了玩家实际使用的技能。
      • 结果: AI 分析状态,能预测在当前局面下,玩家用闪现的概率是 70%,用净化的概率是 30%。
  • 关键特征: 依赖标注数据(正确答案),学习输入 -> 输出的映射。

2. 无监督学习 (Unsupervised Learning)

  • 核心机制: “无标签的探索” —— 只给数据,让 AI 自己找结构或分组。

  • 王者荣耀例子:

    • 任务:聚类 (Clustering)

      • 目标: 自动给玩家分行为类型(如“野王”、“射手”、“辅助”、“混子”)。

      • 训练: 喂给 AI 大量匿名玩家数据(KDA、参团率、经济、常用位置、英雄池等),不告诉 AI 该分几类或怎么分。

      • 结果: AI 根据数据相似性自动分组,比如:

        • 组 1: 高 KDA、高经济、主玩刺客/战士 -> “野王/战边”
        • 组 2: 高参团、低 KDA、主玩软辅 -> “功能辅助”
        • 组 3: 低参团、低输出、死亡率高 -> “混子”
    • 任务:降维 (Dimensionality Reduction)

      • 目标: 简化复杂的战局评估(几十个因素:经济差、兵线、状态、技能 CD 等)。
      • 训练: 喂给 AI 大量历史对局数据(包含所有复杂因素)。
      • 结果: AI 提炼出最关键的几个核心指标(如“经济压制指数”、“兵线压力值”、“关键技能可用度”),用这几个指标就能代表大部分战局信息,辅助决策。
  • 关键特征: 无标注数据,目标是发现数据内在模式(分组、简化)。

3. 强化学习 (Reinforcement Learning)

  • 核心机制: “在奖励中试错” —— AI 在环境中不断尝试,根据结果好坏(奖励/惩罚)调整策略。

  • 王者荣耀例子:

    • 目标: 训练一个能自主对战的 AI(比如“绝悟人机”)。

    • 过程:

      1. AI (智能体): 控制一个英雄。

      2. 环境: 游戏本身(地图、敌人、小兵、防御塔)。

      3. 状态: 当前游戏情况(位置、血量、经济、敌人位置等)。

      4. 动作: AI 可以做的操作(移动、攻击、放技能、回家)。

      5. 奖励 (核心!): 环境对 AI 动作的反馈:

        • 正奖励(激励): 击杀小兵(+1)、击杀英雄(+10)、推塔(+50)、赢比赛(+1000)。
        • 负奖励(惩罚): 被击杀(-10)、丢塔(-30)、输比赛(-1000)。
      6. 学习: AI 不断尝试动作。如果动作带来高奖励(比如成功蹲草击杀),它就记住这个状态下的好动作;如果带来低奖励(比如莽撞送人头),它就避免下次再做。目标是最大化长期总奖励(赢比赛)。

    • 结果: 经过海量自我对战(试错),AI 学会复杂策略:发育、Gank、团战、带线、守家,最终达到顶尖水平,等级越高说明尝试次数越高。

  • 关键特征: 智能体与环境交互,通过奖励信号自我评价,学习最优决策策略。

一句话总结:

  • 有监督学习: “看答案学习” —— 像教 AI 认英雄、猜技能,靠标注数据训练。
  • 无监督学习: “自己找规律” —— 像让 AI 自动给玩家分群、简化战局,靠数据内在结构
  • 强化学习: “在奖励中成长” —— 像训练“绝悟”AI 自己打比赛,靠赢/杀/推塔的奖励不断试错变强。