返回
查看原链接原链接
Bilibili16分55秒 · —

人工智能入门:从机器学习到大语言模型的认知框架

人工智能入门:从机器学习到大语言模型的认知框架

人工智能的核心本质是让机器通过海量数据与计算,在学习能力基础上获得迁移能力,最终实现能够跨领域解决复杂问题的通用人工智能(AGI)。

引言与背景

学习人工智能的痛点

  • 许多同学对人工智能充满兴趣,但常被复杂概念和数学公式吓退,觉得门槛过高、不知从何学起。
  • 本视频的目标是以简单清晰的方式,结合实际案例,逐步建立对人工智能的认知。

人工智能的常见学习路径

  • 通常的人工智能课程体系顺序为:机器学习 → 深度学习 → NLP/CV → 大语言模型
  • 在进入正式技术学习之前,需要先讨论一个根本问题:什么是智能?机器的智能从何而来?

核心要点

智能的定义

追溯智能的历史根源
  • 制造会思考的机器是人类最古老的梦想之一,早在两千多年前古希腊神话和中国的《列子》中就有相关记载。
  • 但这些早期尝试主要停留在空想阶段,没有变成现实的条件。
  • 直到计算机发明后,人们逐渐意识到计算机除了计算之外,还有模拟人类思考的巨大潜力
人工智能发展关键时间线
时间事件意义
1956年人工智能概念正式提出以计算机为核心展开AI研究
1959年亚瑟·塞缪尔提出机器学习定义定义了一个让机器不用精准编程就能学习的研究领域
1997年IBM发明深蓝(Deep Blue)学会国际象棋并击败人类国际象棋冠军,但国际象棋策略相对简单
2016年DeepMind的AlphaGo通过策略网络和强化学习学会围棋,击败人类围棋冠军,震惊世界
2020年AI广泛进入应用领域人脸识别、智能驾驶等广泛应用
专用智能 vs 通用智能
  • 局限性:AlphaGo虽然击败了人类围棋冠军,但不会下五子棋或军棋,只能执行单一任务。
  • 专用人工智能:只能在特定任务上表现出色,难以像人一样具备跨任务、跨场景的迁移能力。
  • 通用人工智能(AGI):具备人类的理解、推理和学习能力,能够在不同领域解决各种问题的系统。

人类智能的案例:泛化能力

  • 经典案例:一个小孩被热水杯烫了一次后,不仅会避开那个杯子,还会警惕所有冒着热气的物体
  • 人类不需要把所有有害事物都试一遍才知道其危险,而是能够从有限经验中抽取规律,在陌生环境中做出正确判断。
  • 泛化能力正是智能的核心特征之一——学习能力 + 举一反三的迁移能力

详细解析

人类如何识别物体:仿生学启示

人类识别苹果的案例
  • 我们可以轻松识别苹果,却说不出苹果的精确几何参数、颜色或纹理定义。
  • 识别过程的本质:见的次数足够多后,大脑自动从海量样本中提取特征。
  • 大脑中的神经元连接在反复刺激中自行调整,最终形成虽模糊却足够精准的概念。
为什么“模糊”反而更重要?
  • 我们记忆的特征并非极其精准,而是稍微模糊的。
  • 正因特征模糊,才能识别从未见过的品种(如颜色不同、形状不同),甚至抽象出简化图形。
  • 现代AI的仿生方向正是如此:给计算机足够大的数据量,让其也能“模糊地”学习。

人工智能的40年弯路:符号主义

专家系统路线
  • 早期AI走的是专家系统路线,工程师以上帝视角写代码,通过写规则定义整个世界。
  • 在一些领域取得了一定成功,如客服系统、医院影像识别等。
  • 但这一路线注定无法实现AGI,因为世界过于复杂,规则永远写不完。
关键问题
  • 被咬了一口的苹果、坏了一半的苹果、光影变化的苹果,这些还算苹果吗?
  • 无法穷举完整个世界的所有规则,规则驱动的方法注定实现不了AGI
  • 这一阶段被称为符号主义

连接主义:让机器自主从数据中学习

机器学习的正式定义
  • 亚瑟·塞缪尔在1959年提出了机器学习的定义:一种无需精准编程就能让计算机获得学习能力的领域。
  • 核心理念:让机器不再依赖人类硬编码的规则,从海量数据中自行归纳特征、自主学习。
为什么1959年提出,经历很久才实现?
  • 虽然机器学习概念提出得早,但大语言模型的实现需要两大前提条件:
  1. 海量数据
  • 随着互联网的发展,人类知识被大规模数字化(维基百科、社交网络、数字化典籍页面记录等)。
  • 这些数据为AI提供了规模空前的训练集,打破了早期AI数据不足的瓶颈。
  • 没有足够数据,机器就无法学习(“它看的苹果太少学不会”)。
  1. 超强算力
  • 深度神经网络训练涉及数十亿、百亿甚至万亿级别的参数优化。
  • 每次权重更新都需要海量的矩阵运算,过去的计算机性能不足。
  • 直到近年GPU快速发展、谷歌TPU的突破,硬件才足以支撑如此庞大的运算任务。

机器学习与模型的本质

从数学视角理解模型
  • 在数学中,平面坐标系上分布的点可以通过函数 Y=f(X) 来模拟,从而预测下一个点的大致位置——这就是函数的作用。
  • 机器学习的本质也是拟合一个函数,只不过远比简单的函数更为复杂:
  • 输入一张图片X → 输出分类Y(苹果/非苹果)
  • 输入一段语音X → 输出对应文字
  • 输入一句话的前半句 → 输出后半句
模型的精确定义
  • 模型 = 机器学习找到的那个超级复杂的函数
  • 训练AI模型,本质上是在海量的参数空间中,通过不断试错与优化,搜索到最能解释数据背后规律的函数。

机器学习的核心任务

拉马努金公式的启示
  • 印度天才数学家拉马努金写出的计算π的公式(含有9801、1103、396等数字)非常无厘头,当时的数学家都不明白,但计算π却极为精准。
  • 这显示了世界背后存在各种深藏的规律,但由于人脑算力与记忆有限,难以穷尽所有秩序。
  • 机器学习正是将寻找世界规律这件事规模化、可重复化,突破人脑算力与记忆的极限。
  • 在庞大的参数空间中,通过海量计算持续逼近能描述世界规律的函数——这就是机器学习核心的任务

方法与路径

人工智能发展的三个阶段

这是学习人工智能的主脉络:

第一阶段:通用机器学习
  • 不再依赖预设规则,让机器从数据中学习概率。
  • 典型案例:邮件分类——机器并不知道什么是垃圾邮件,但通过统计词频组合(如“恭喜”“中奖”同时出现)判定垃圾邮件。
  • 局限性:高度依赖人工设计的特征,本质上是在人划定的框架内优化。
第二阶段:深度学习
  • 在机器学习基础上衍生,主要模拟人脑的神经网络
  • 典型架构是深度神经网络(DNN)。
  • 对算力要求更高,能够完成更复杂的任务。
  • 典型案例:结合强化学习的AlphaGo、人脸识别、智能驾驶。
  • 局限性:仍是专用智能,缺乏泛化迁移能力,不能跨任务。
第三阶段:大语言模型(生成式AI)
  • 之前AI主要做的是“选择题”(判断是或非、往南走或往北走),而大语言模型则可以“写作文”,具备推理和创造能力。
  • 核心机制基于Google在2017年发布的论文《Attention Is All You Need》提出的Transformer架构
  • 通过不断预测下一个token,即可完成各种生成式任务。
  • 这是人类离AGI最近的一次

为什么语言模型率先突破?

初期判断的逆转
  • 最初,研究者认为识别图片的计算机视觉(CV)领域最有可能实现通用人工智能。
  • 但最终是语言模型(NLP领域)率先取得了突破。
“语言即世界”哲学观点
  • 奥地利哲学家维特根斯坦的观点:“我的语言之界限,即我世界之界限”
  • 语言是世界的压缩——人类几千年的文字记录编码了对世界的全量认知:
  • “所以”编码了因果律
  • “但是”编码了逻辑转折
  • 讲述故事时编码了时间、空间、人类情感、社会规范等
  • 通过学习人类的语言,AI就能认知到人类的世界。
大语言模型的工作机制
  • 大语言模型的任务极其简单:根据已有prompt或输入,不断预测下一个输出(用token更精准)——一个词一个词地往外蹦。
  • 看似简单,但为了精准预测下一句,模型被迫理解各种深层逻辑:
  • 要预测物理题答案 → 必须学会物理规律
  • 要预测代码的下一行 → 必须学会编程
  • 要预测故事结局 → 必须理解人物动机
  • 通过学习人类所有文字,大语言模型学到了人类对世界的全量认知,进而涌现出惊人能力:理解逻辑因果、具备常识、进行推理创作代码,甚至模仿人类情感。

限制与待确认问题

语言模型是否足以实现AGI——存有争议

空间智能派的观点
  • 持反对意见者的身份:斯坦福大学的李飞飞、图灵奖得主杨立昆(Yann LeCun)等人。
  • 李飞飞的核心论点
  • 语言只是最近50万年才诞生的事物,相对于地球生命历史“年轻的就像昨天”。
  • 语言是世界的镜子,但并非世界本身
  • 大语言模型仍旧困在像素与符号(图片与文字表达)的统计规律之中。
  • 空间智能的进化基础
  • 从寒武纪开始,各种生物看见这个世界已有5亿年
  • 看见世界驱动了大脑的爆发——无论是捕食还是逃生,都需要感知与猎物/天敌之间的距离、相对速度、重力、预测轨迹等。
  • 这是一个有空间概念的智能。
  • 实现AGI的必要条件:AI必须理解物理世界的一致性(如球推下桌子就会掉下去),否则无法真正理解世界。
  • 李飞飞的实践:创建了World Labs,致力于构建具有物理一致性的世界模型。

语言智能与空间智能的关系——缺乏定论

  • 语言智能和空间智能可能都不可或缺,实现AGI可能的路径仍属未知。
  • 原文观点:对实现AGI,应采取拭目以待的态度。

总结

人工智能的根本认知

  • 智能 = 学习能力 + 迁移能力
  • 当前时代,数据与经验可被大规模获取,算力也因互联网发展和摩尔定律的推动而充足。
  • 关键问题在于:如何将这些数据变成可学习的任务,让机器在反复试错中总结出对世界的认知函数(模型)。

学习路线图

接下来的学习核心是理解如何实现这一过程:

  • 机器学习出发
  • 深度学习
  • 再到NLP与大语言模型

这构成了从感知到认知、从专用到泛化的完整智能演进路径。