来源链接:https://www.bilibili.com/video/BV13bZYBREgr?spm_id_from=333.788.videopod.sections&vd_source=e73a152dada4626bad49c30d848902f7


0. 课程引言与智能的本质

本课程面向人工智能入门学习者,旨在厘清领域内繁杂的概念边界,建立体系化的认知框架,避免初学者被复杂的数学公式与概念劝退。
screenshot*

0.1 智能的核心定义

智能的本质可以提炼为两个核心能力的结合:

智能 = 学习能力 + 迁移(泛化)能力

  • 学习能力:从有限的经验/数据中总结规律的能力
  • 迁移能力:将总结出的规律推广到陌生场景、解决未知问题的能力
  • 通俗案例:儿童被冒热气的热水杯烫伤后,无需试遍所有高温物体,就能推断所有冒热气的物体都可能造成烫伤,这就是典型的智能表现。

0.2 AI时代的核心命题

随着互联网发展与算力的提升,人类已经可以大规模获取数据与计算资源,当前人工智能领域的核心问题转化为:

如何把这些数据变成可学习的任务,让机器在反复试错中自动总结出描述世界规律的函数(即模型)?


1. 核心概念层级:AI、ML、DL的包含关系

人工智能领域的核心概念存在清晰的层级包含关系:
screenshot*

概念 全称 核心定义 定位
AI 人工智能(Artificial Intelligence) 让机器表现出类似人类的智能的技术与产品的总称,是最宽泛的概念 顶层目标
ML 机器学习(Machine Learning) 无需人工编写硬规则,让机器自动从数据中寻找规律的技术体系,是实现AI的核心路径 核心实现方法
DL 深度学习(Deep Learning) 机器学习的一个分支,采用多层神经网络架构,能够自动提取数据的深层抽象特征 当前主流的技术落地路径
  • 日常语境中的AI同时包含两层含义:① 实现智能的理论与方法;② 具备智能的应用载体(如ChatGPT、智能机器人)。

2. 机器学习(ML):让机器从数据中学习规律

2.1 机器学习与传统编程的本质区别

传统编程的逻辑是:人类编写所有规则,计算机输入数据、执行规则、输出结果,仅适合规则明确的简单任务,对于“识别图片中的苹果”这类复杂任务,人类无法穷举所有可能的规则(比如不同颜色、不同形状、被咬过的苹果等),因此传统编程无法实现通用智能。
screenshot*

机器学习的逻辑完全反转:人类给机器提供大量数据与对应的结果(标注数据),让机器自动从数据中学习得到规律(也就是规则),再用学到的规律解决未知问题。

2.2 机器学习的类比:模拟人类决策逻辑

人类的决策逻辑是「积累经验→总结规律→预测新场景」,机器学习完美复刻了这个逻辑:

  • 人类的“经验”对应机器的“训练数据”
  • 人类总结的“规律”对应机器的“模型”
  • 人类用规律做判断对应机器的“推理预测”
    screenshot*

2.3 模型的本质:拟合描述世界的函数

从数学视角看,机器学习的核心是拟合一个函数 y = f(x):

  • 输入 x 可以是图片、文本、语音等任意形式的数据
  • 输出 y 是对应的分类结果、生成内容、预测值等
  • 训练模型的过程,就是在海量参数空间中反复试错优化,找到那个最能解释数据背后规律的函数 f。

拓展:从天才直觉到规模化寻律

印度天才数学家拉马努金可以凭直觉写出极其精准却无推导过程的数学公式,比如其发现的圆周率计算公式:
$$
\frac{1}{\pi} = \frac{2\sqrt{2}}{9801} \sum_{k=0}^{\infty} \frac{(4k)!(1103 + 26390k)}{(k!)^4 396^{4k}}
$$
这是人脑探索世界规律的极限;而机器学习将这种探索规模化、可重复化,突破了人脑记忆与算力的限制,能够通过海量计算持续逼近描述世界本质规律的函数。
screenshot*


3. 人工智能发展的三个核心阶段

人工智能的落地演化经过了三个特征鲜明的阶段,也是AI技术学习的核心脉络:
screenshot*

3.1 第一阶段:传统机器学习——统计学的胜利

  • 核心特征:数据驱动,不再依赖人工预设的硬规则,但仍然依赖人工定义需要模型关注的特征,本质是在人类划定的框架内做优化。
  • 擅长场景:处理表格类结构化数据,算力需求较低。
  • 典型应用:垃圾邮件分类(人工指定“恭喜”“中奖”等高风险词作为特征,模型统计词频判断是否为垃圾邮件)、金融风控、商品推荐。
  • 局限性:仅为专用智能,无跨任务迁移能力,泛化性极弱。

3.2 第二阶段:深度学习——感知智能的觉醒

  • 核心特征:模拟人脑的神经网络架构,无需人工指定特征,输入原始数据后,模型可以自动逐层提取抽象特征(从边缘到纹理再到整体语义)。
  • 擅长场景:处理图片、文本、音频等非结构化数据,需要海量数据与大算力支撑。
  • 典型应用:AlphaGo(结合强化学习)、人脸识别、自动驾驶。
  • 局限性:仍然属于专用智能,仅能完成训练时设定的单一任务,缺乏跨场景迁移能力。

3.3 第三阶段:大语言模型——生成式AI的兴起

  • 核心特征:从“做选择题”升级为“写作文”,具备推理、创造、跨任务迁移的能力,核心技术为Transformer架构+下一词预测(Next Token Prediction)。
  • 核心意义:人类历史上首次出现接近通用人工智能(AGI)的技术形态,具备跨领域解决问题的能力。

4. 为什么大语言模型率先逼近通用智能?

4.1 语言是人类对世界认知的压缩编码

哲学家维特根斯坦提出:“我的语言之界限,即我世界之界限。”
screenshot*

  • 人类50万年的语言演化过程中,所有的因果逻辑、社会规范、时空规律、情感共识都被编码进了文本中:
    • “因为…所以…”编码了因果律
    • “虽然…但是…”编码了逻辑转折
    • 故事、历史文本编码了时间、空间与社会规则
  • 学习人类所有的公开文本,本质上就是学习人类对整个世界的全量认知。

4.2 简单任务背后的深层要求:预测下一个词

大语言模型的训练目标看起来极其简单:根据上文预测下一个最合理的词(Next Token Prediction)。
screenshot*
但为了准确完成这个任务,模型必须被迫掌握所有领域的深层逻辑:

  • 要准确预测物理题的答案,必须学会物理规律
  • 要准确预测代码的下一行,必须学会编程逻辑
  • 要准确预测故事的结局,必须学会人物动机与社会共识
    最终大模型会自发涌现出理解、推理、创作、模仿情感的通用能力。

5. 通往AGI的另一条路径:空间智能

并非所有学界研究者都认为单靠语言模型可以实现通用人工智能,以斯坦福教授李飞飞、图灵奖得主杨立坤为代表的学者提出,空间智能才是实现AGI的最优路径。
screenshot*

5.1 语言智能的局限性

语言只有50万年的演化史,只是世界的“镜像”而非世界本身,大模型本质上仍然被困在符号与像素的统计规律中,不具备真实的物理直觉:比如大模型可以在文本层面描述“球离开桌子会掉落”,但无法真正理解重力规则。

5.2 空间智能的核心逻辑

空间智能已有5亿年的演化史:从寒武纪生物演化出视觉开始,“看见世界”驱动了大脑的爆发,生物为了生存必须感知距离、速度、重力等三维物理规则,这种基于物理世界的空间认知才是智能的核心基础。

5.3 缺失的拼图:物理直觉

要实现真正的AGI,必须让AI具备物理直觉:真正理解“球被推下桌子会掉落”这类物理规则,而不是仅在文本层面统计到这个表述。李飞飞创立的World Labs就致力于构建具备物理一致性的世界模型,探索空间智能路径。

5.4 学界共识

语言智能与空间智能是认知的双翼,二者缺一不可,最终的通用人工智能大概率是两条路径融合的成果。


6. 后续学习路径

本系列课程将遵循AI技术的演化脉络,按照以下路径展开:

机器学习 → 深度学习 → NLP与大语言模型
从基础的机器学习原理入手,逐步深入到深度学习架构,最终落地到当前最前沿的自然语言处理与大语言模型技术。
screenshot*


AI 总结

本视频是人工智能领域的入门导学课程,核心目标是帮助初学者厘清概念边界,建立体系化认知,避免被复杂公式劝退。课程首先提炼了智能的本质:智能是学习能力与迁移能力的结合,人类智能的核心是从有限经验中总结规律并推广到陌生场景。
随后课程梳理了AI领域核心概念的层级关系:人工智能(AI)是顶层目标,机器学习(ML)是实现AI的核心路径,深度学习(DL)是当前主流的机器学习技术分支,三者是包含与被包含的关系。
接着课程介绍了AI发展的三个阶段:从依赖人工定义特征、擅长结构化数据的传统机器学习,到自动提取深层特征、擅长非结构化数据的深度学习,再到具备生成推理能力、首次接近通用智能的大语言模型,清晰呈现了技术演化的脉络。
课程解释了大语言模型实现通用能力的核心逻辑:语言是人类对世界全量认知的压缩编码,而“预测下一个词”的简单训练目标迫使模型自发掌握了各领域的深层规律,最终涌现出通用智能。同时课程也介绍了学界的另一种AGI技术路径——空间智能,指出单靠语言模型无法实现真正的通用智能,语言智能与空间智能是AGI的双翼,缺一不可。
最后课程明确了AI学习的核心命题:如何将数据转化为可学习的任务,让机器自动拟合出描述世界规律的模型,并给出了循序渐进的学习路径:机器学习→深度学习→NLP与大语言模型。


refer

-

声明:

  1. 若文章存在错误,望诸君不吝指正^

  2. blog仅供个人记录学习所用

  3. 部分笔记由于年代久远,做的笔记找不到最初是引用谁的,若是不允许引用转载,请联系我