人工智能
人工智能是指让机器模拟人类智能行为的技术。它通过算法和数据训练模型,使计算机具备一定能力,能够完成一些原本需要人类智慧才能处理的任务,如垃圾邮件过滤器。总的来说较为严谨且互斥的核心方向有12个
机器学习
传统机器学习-人负责设计表示和结构(特征、规则条件、分裂方式),机器只在这个人为划定的空间里做简单拟合
机器学习核心模型
广义上的机器学习分为三类:监督学习、无监督学习和强化学习。而半监督学习、自监督学习和弱监督学习可以看作是以上三种学习的组合概念/子概念/衍生概念。⚠️, 持续学习等概念bear认为它更多算是一种模型应该具有的能力,所以不纳入以上学习范式的分类。
监督学习通常有两类经典任务,回归和分类,无监督学习也有两类经典任务,聚类和降维
按能力种类/维度划分
- 感知与表征:看、听、读,并形成内部表示;
- 理解与推理:识别语义、建立关系、进行推断;
- 生成与表达:生成文本、图像、音频、视频、代码;
- 预测与评估:预测结果、估计风险、判断状态;
- 决策与规划:选择行动方案、制定步骤;
- 执行与交互:调用工具、操控环境、与人或机器协作;
- 学习与适应:从新数据、反馈或经验中更新能力。
- 迁移、少样本与元学习:利用已有知识快速适应新任务;
- 持续学习或在线学习:随着新数据持续更新。 8.111
- 类别开放:识别已知类,走向能够发现未知类-同任务跨类别
- 知识开放:从静态模型走向持续学习-跨任务跨类别
- 环境开放:从固定场景走向开放世界和开放任务-跨模态跨场景跨任务跨类别➕感知物理规律————世界模型
能力范围划分
- 专用智能-特定任务助手
- 领域通用智能-特定领域助手
- 通用智能-基本上适配任何领域的助手
- 识别类任务:分类、检测、分割、识别;
- 匹配类任务:检索、推荐、排序、对齐;
- 预测类任务:回归、时序预测、状态估计;
- 生成类任务:文本、图像、语音、视频、代码生成;
- 转换类任务:翻译、摘要、风格转换、图像编辑;
- 决策类任务:规划、控制、策略学习;
- 交互类任务:问答、对话、视觉问答、工具调用。
通过分析大量邮件数据,学习垃圾邮件的特征(如特定关键词、发件人信息等),接着判断新邮件是否为垃圾邮件。
| 核心方向 | 定位 | 时代属性 | 具体案例 |
|---|---|---|---|
| 机器学习与深度学习 | 从数据中学习表示、预测与决策 | 传统 → 现有基础 | 垃圾邮件分类;房价预测;工业异常检测;用户点击率预测 |
| 知识表示与符号推理 | 用符号、逻辑和结构化知识进行推理 | 传统 | 医疗知识图谱问答;法律规则推理;自动定理证明;企业规则引擎 |
| 搜索、规划与优化 | 在状态空间中寻找最优解或行动序列 | 传统 | 棋类博弈搜索;机器人路径规划;物流配送调度;生产排程优化 |
| 概率建模与因果推理 | 建模不确定性、变量依赖与因果关系 | 传统 → 现有 | 贝叶斯疾病诊断;天气概率预测;广告因果归因;金融风险推断 |
| 计算机视觉 | 理解图像、视频与三维视觉信息 | 传统 → 现有 | 自动驾驶目标检测;医学影像分割;人脸身份识别;三维场景重建 |
| 自然语言与语音 | 理解、生成和处理文本及语音信息 | 传统 → 现有 | 神经机器翻译;智能客服问答;会议语音转写;文本情感分析 |
| 强化学习与决策智能 | 通过交互和奖励学习长期决策策略 | 传统 → 现有 | Atari 游戏智能体;机器人抓取策略;自动驾驶决策;推荐系统在线优化 |
| 机器人与具身智能 | 在物理环境中完成感知、推理和行动闭环 | 传统 → 现有前沿 | 家庭服务机器人;仓储搬运机器人;人形机器人操作;自主无人机导航 |
| 基础模型与生成式 AI | 通过大规模预训练获得通用生成与理解能力 | 现有核心 | 大语言模型对话;扩散模型文生图;代码自动生成;视频内容生成 |
| 多模态智能 | 联合理解和生成文本、图像、视频、语音等信息 | 现有核心 | 图文视觉问答;视频内容理解;语音视觉助手;医学图文联合诊断 |
| 推理与智能体(Reasoning & Agent) | 进行复杂推理、规划、记忆、工具调用与自主执行 | 现有核心 | 数学多步推理;自动编程 Agent;网页任务执行;科研文献分析 Agent |
| AI 安全、对齐与可信 AI | 提升模型安全性、可控性、鲁棒性与可解释性 | 现有核心 | 有害内容防护;模型红队测试;对抗样本防御;大模型幻觉评测 |
各形式的数学表示对比如下:
| 形式 | 模型类别 | 数学形式 | 典型例子 |
|---|---|---|---|
| 层级分叉 | 决策树 | 把特征空间切成轴对齐矩形区域 ,每个区域输出一个常数:(嵌套的分段常数函数) | C4.5 / CART |
| 离散逻辑匹配 | 专家规则、风控规则 | 每条规则是若干谓词的合取 ,输出按命中规则加权汇总:(MYCIN 中以置信度因子并行合成) | MYCIN、银行风控 |
| 加权求和 | 逻辑回归、线性 SVM | 先做特征变换 ,再线性组合打分: | Deep Blue 的评估函数 |
- 范式:使用包含输入变量和已知输出标签的数据集进行训练,让模型从带标签的例子中学习,并为新数据预测标签。
- 实例:
- 根据房屋面积和位置预测房价
- 将电子邮件分类为垃圾邮件或非垃圾邮件
- 识别图像中的动物是猫还是狗
- 范式:数据没有已知标签,算法需要自己发现其中的结构或模式
- 实例:
- 聚类-根据客户的购买行为进行分组,而事先并不知道这些组别分别代表什么
- 聚类-给孩子一堆图片,让他把相似的图片放在一起,却不告诉他具体类别
- 范式:算法不从带标签的样本中学习,而是通过与环境互动,接收奖励或惩罚来学习。
- 实例:
- 训练一只狗时,不会给它一个带标签的数据集,而是奖励好的行为、制止不好的行为,经过一段时间后,它就会逐渐学会哪些动作能够带来奖励。
- 游戏人工智能、机器人技术、自动驾驶系统和其他决策系统: 一个智能体会采取行动、观察结果、接收奖励,并不断更新自己的策略,以最大化未来获得的总奖励。
- 范式:监督学习和无监督学习的结合,适合数据标注困难或成本较高的场景
- 实例:
- 医学场景:有一万张医学影像,但只有五百张经过医生标注。半监督学习会利用这部分有标签数据指导模型训练,同时从大量无标签数据中提取结构。
- 范式:从数据本身构造学习目标。
- 范式:bear认为该范式在追求用粗粒度的标注(分类)作为模型的监督信号,让模型能够完成细粒度的下游任务(分割)
- 迁移、少样本与元学习:利用已有知识快速适应新任务;
- 持续学习或在线学习:随着新数据持续更新。
- 目标:预测一个连续数值
- 常见算法:
- 线性回归
- 范式:试图学习一个方程(拟合一条最能描述输入变量与输出之间关系的直线,并通过最小化预测值与实际值之间的平方差来实现)
- 实例:收集许多人的身高和鞋码数据后,线性回归模型可能发现,鞋码每增加一个单位,身高平均增加约两英寸。此时,拟合出的直线可以解释身高如何随鞋码变化。现实中身高还会随其他特征变化,例如性别、年龄或种族。
- 线性回归
- 目标:预测一个类别
- 逻辑回归
- 范式: 寻找一条分类边界
- 分类中最基本的算法之一是逻辑回归。它不是直接用直线预测数值,而是使用一条 S 形曲线,估计样本属于某个类别的概率。例如,根据身高和体重预测一个人属于类别 A 还是类别 B 时,逻辑回归不会只给出“是”或“否”,而是计算一个概率。身高 180 厘米、体重 75 千克的人,可能被预测为属于类别 A 的概率为 0.8。通常情况下,如果概率大于 0.5,就将其归为 A 类;如果小于 0.5,则归为 B 类,具体类别取决于问题的定义。
- K 近邻算法/ KNN
- KNN它不像线性回归那样试图学习一个方程,也不像逻辑回归那样寻找一条分类边界,而是直接保存训练数据。当一个新样本出现时,算法会寻找与它最接近的 K 个样本,并根据这些邻居的标签进行预测。例如,已有一个包含身高、体重和性别标签的数据集。现在来了一个身高 175 厘米、体重 70 千克的人。如果设置 K=5,算法就会查看数据集中身高和体重最接近的五个人。假设其中三人是男性、两人是女性,那么模型就会通过多数投票,将新样本预测为男性。K 值的选择非常重要。如果 K 太小,例如 K=1,模型只会复制最近数据点的结果,因此对噪声和异常值非常敏感,这容易导致过拟合,也就是模型过度记忆训练数据,泛化能力较差。如果 K 太大,模型会对过多邻居进行平均,忽略局部结构,变得过于平滑,从而导致欠拟合。因此,实际使用 KNN 时,通常会尝试不同的 K 值,并在验证数据上测试哪一个效果最好。
- SVM 1.支持向量机简称 SVM。假设我们要根据动物的体重和鼻子长度,将狗和大象分成两类。把数据点画在图上后,可能会发现狗在一侧、大象在另一侧。虽然有许多条线可以将它们分开,但 SVM 不会随意选择一条线,而是寻找能够让两个类别之间距离尽可能大的分类边界,这个距离叫作间隔。间隔越大,分类边界通常越稳健。当新数据带有噪声或发生轻微偏移时,较大的间隔可以降低误分类的可能性。距离边界最近的那些数据点被称为支持向量,它们决定了分类边界的位置。即使其他数据点消失,只要支持向量仍然存在,边界也不会发生变化。如果数据不是线性可分的,例如一个类别分布在圆圈内部,另一个类别分布在圆圈外部,那么单条直线就无法将它们分开。这时可以使用核函数,将数据隐式地转换到更高维空间,使原本非线性的分离问题变成线性分离问题。例如,在二维空间中无法用直线分开的圆形数据,转换到三维空间后,可能就能用一个平面分开。这个技巧让 SVM 在处理复杂的非线性问题时非常强大。
- 朴素贝叶斯
- 朴素贝叶斯是一种基于概率和贝叶斯定理的分类算法,可以根据数据的概率关系进行分类。
- 决策树
- 决策树是最直观的机器学习算法之一。它通过一系列“是”或“否”的问题,一步一步地分割数据。每一步都会选择最能区分数据的问题。例如,在预测患者属于高风险还是低风险时,第一个问题可能是“年龄是否大于 50 岁”。根据答案,数据被分成两组,之后继续提出问题,最终形成一个由分支和叶节点组成的树状结构。决策树的目标是让叶节点尽可能纯净,也就是说,一个叶节点中的大多数数据点都属于同一类别。对于分类任务,这意味着尽量减少被错误分类的样本;对于回归任务,则意味着尽量减少每个叶节点内的预测误差。单棵决策树易于理解和解释,但有时会过拟合,并且对数据的微小变化比较敏感。
- 集成法一:随机森林
- 为了让决策树更强大、更稳定,我们可以使用集成方法。集成方法会结合许多简单模型,构建出更强大的整体模型。装袋法就是一种常见的集成技术,而随机森林是它的著名代表。随机森林不会只训练一棵决策树,而是在不同的随机数据子集上训练许多棵树,使每棵树看到的数据略有不同,从而增加模型多样性。在随机森林中,每棵树都会给出自己的预测,最终结果由分类任务中的多数投票决定,或由回归任务中的平均值决定。此外,每棵树在进行分割时,只考虑随机选择的一部分特征。这种随机性可以降低树与树之间的相关性,避免它们重复犯下相同的错误。
- 集成法二:提升法
- 提升法是另一种强大的集成技术,但它的工作方式与随机森林不同。提升法不是独立、并行地训练许多棵树,而是按顺序训练模型。每个新模型都会重点纠正前面模型犯下的错误。随着训练进行,许多弱学习器被组合起来,形成一个更强的学习器。梯度提升和 XGBoost 都是著名的提升算法,它们通常能够达到很高的准确率,但需要仔细调整,以避免过拟合。
- 神经网络
- 神经网络则是在输入和输出之间加入一个或多个隐藏层。隐藏层包含许多相互连接的节点,也就是神经元。神经网络不需要手动决定哪些特征重要,而是利用微积分和线性代数,从数据中自动学习有用的内部特征,这些特征通过权重和偏置表示。每一层都会对数据进行一定的转换,再传递给下一层,因此神经网络非常灵活。当我们堆叠多个隐藏层时,就得到了深度学习。通过多层结构,网络能够学习越来越抽象的数据表示。以图像识别为例,网络首先发现线条、曲线和图案等简单特征,再将这些特征组合成更大的部分,例如斑马的条纹和身体轮廓,最后整合所有信息,判断图像是斑马、马还是其他对象。这也是深度学习在图像识别、语音识别和自然语言处理等任务中取得成功的原因之一。
- 逻辑回归
- 目标:发现数据中自然形成的分组或簇。
- 常见算法:
- K-means:试图发现数据中的簇,并将相似的数据分到一起。
- 目标:数据集包含许多相关或冗余特征,这些特征会拖慢模型速度、引入噪声。降维通过减少特征数量的方式在保留信息的前提下简化数据,比如图像识别,并不一定需要保留图像的全部高分辨率信息。
- 常见算法:
- PCA(主成分分析):寻找能够捕捉数据最大方差的新方向,以此实现数据压缩和简化。