人工智能入门:从机器学习到大语言模型的认知框架
人工智能的核心本质是让机器通过海量数据与计算,在学习能力基础上获得迁移能力,最终实现能够跨领域解决复杂问题的通用人工智能(AGI)。
引言与背景
学习人工智能的痛点
- 许多同学对人工智能充满兴趣,但常被复杂概念和数学公式吓退,觉得门槛过高、不知从何学起。
- 本视频的目标是以简单清晰的方式,结合实际案例,逐步建立对人工智能的认知。
人工智能的常见学习路径
- 通常的人工智能课程体系顺序为:机器学习 → 深度学习 → NLP/CV → 大语言模型。
- 在进入正式技术学习之前,需要先讨论一个根本问题:什么是智能?机器的智能从何而来?
核心要点
智能的定义
追溯智能的历史根源
- 制造会思考的机器是人类最古老的梦想之一,早在两千多年前古希腊神话和中国的《列子》中就有相关记载。
- 但这些早期尝试主要停留在空想阶段,没有变成现实的条件。
- 直到计算机发明后,人们逐渐意识到计算机除了计算之外,还有模拟人类思考的巨大潜力。
人工智能发展关键时间线
| 时间 | 事件 | 意义 |
|---|---|---|
| 1956年 | 人工智能概念正式提出 | 以计算机为核心展开AI研究 |
| 1959年 | 亚瑟·塞缪尔提出机器学习定义 | 定义了一个让机器不用精准编程就能学习的研究领域 |
| 1997年 | IBM发明深蓝(Deep Blue) | 学会国际象棋并击败人类国际象棋冠军,但国际象棋策略相对简单 |
| 2016年 | DeepMind的AlphaGo | 通过策略网络和强化学习学会围棋,击败人类围棋冠军,震惊世界 |
| 2020年 | AI广泛进入应用领域 | 人脸识别、智能驾驶等广泛应用 |
专用智能 vs 通用智能
- 局限性:AlphaGo虽然击败了人类围棋冠军,但不会下五子棋或军棋,只能执行单一任务。
- 专用人工智能:只能在特定任务上表现出色,难以像人一样具备跨任务、跨场景的迁移能力。
- 通用人工智能(AGI):具备人类的理解、推理和学习能力,能够在不同领域解决各种问题的系统。
人类智能的案例:泛化能力
- 经典案例:一个小孩被热水杯烫了一次后,不仅会避开那个杯子,还会警惕所有冒着热气的物体。
- 人类不需要把所有有害事物都试一遍才知道其危险,而是能够从有限经验中抽取规律,在陌生环境中做出正确判断。
- 泛化能力正是智能的核心特征之一——学习能力 + 举一反三的迁移能力。
详细解析
人类如何识别物体:仿生学启示
人类识别苹果的案例
- 我们可以轻松识别苹果,却说不出苹果的精确几何参数、颜色或纹理定义。
- 识别过程的本质:见的次数足够多后,大脑自动从海量样本中提取特征。
- 大脑中的神经元连接在反复刺激中自行调整,最终形成虽模糊却足够精准的概念。
为什么“模糊”反而更重要?
- 我们记忆的特征并非极其精准,而是稍微模糊的。
- 正因特征模糊,才能识别从未见过的品种(如颜色不同、形状不同),甚至抽象出简化图形。
- 现代AI的仿生方向正是如此:给计算机足够大的数据量,让其也能“模糊地”学习。
人工智能的40年弯路:符号主义
专家系统路线
- 早期AI走的是专家系统路线,工程师以上帝视角写代码,通过写规则定义整个世界。
- 在一些领域取得了一定成功,如客服系统、医院影像识别等。
- 但这一路线注定无法实现AGI,因为世界过于复杂,规则永远写不完。
关键问题
- 被咬了一口的苹果、坏了一半的苹果、光影变化的苹果,这些还算苹果吗?
- 无法穷举完整个世界的所有规则,规则驱动的方法注定实现不了AGI。
- 这一阶段被称为符号主义。
连接主义:让机器自主从数据中学习
机器学习的正式定义
- 亚瑟·塞缪尔在1959年提出了机器学习的定义:一种无需精准编程就能让计算机获得学习能力的领域。
- 核心理念:让机器不再依赖人类硬编码的规则,从海量数据中自行归纳特征、自主学习。
为什么1959年提出,经历很久才实现?
- 虽然机器学习概念提出得早,但大语言模型的实现需要两大前提条件:
- 海量数据
- 随着互联网的发展,人类知识被大规模数字化(维基百科、社交网络、数字化典籍页面记录等)。
- 这些数据为AI提供了规模空前的训练集,打破了早期AI数据不足的瓶颈。
- 没有足够数据,机器就无法学习(“它看的苹果太少学不会”)。
- 超强算力
- 深度神经网络训练涉及数十亿、百亿甚至万亿级别的参数优化。
- 每次权重更新都需要海量的矩阵运算,过去的计算机性能不足。
- 直到近年GPU快速发展、谷歌TPU的突破,硬件才足以支撑如此庞大的运算任务。
机器学习与模型的本质
从数学视角理解模型
- 在数学中,平面坐标系上分布的点可以通过函数 Y=f(X) 来模拟,从而预测下一个点的大致位置——这就是函数的作用。
- 机器学习的本质也是拟合一个函数,只不过远比简单的函数更为复杂:
- 输入一张图片X → 输出分类Y(苹果/非苹果)
- 输入一段语音X → 输出对应文字
- 输入一句话的前半句 → 输出后半句
模型的精确定义
- 模型 = 机器学习找到的那个超级复杂的函数。
- 训练AI模型,本质上是在海量的参数空间中,通过不断试错与优化,搜索到最能解释数据背后规律的函数。
机器学习的核心任务
拉马努金公式的启示
- 印度天才数学家拉马努金写出的计算π的公式(含有9801、1103、396等数字)非常无厘头,当时的数学家都不明白,但计算π却极为精准。
- 这显示了世界背后存在各种深藏的规律,但由于人脑算力与记忆有限,难以穷尽所有秩序。
- 机器学习正是将寻找世界规律这件事规模化、可重复化,突破人脑算力与记忆的极限。
- 在庞大的参数空间中,通过海量计算持续逼近能描述世界规律的函数——这就是机器学习核心的任务。
方法与路径
人工智能发展的三个阶段
这是学习人工智能的主脉络:
第一阶段:通用机器学习
- 不再依赖预设规则,让机器从数据中学习概率。
- 典型案例:邮件分类——机器并不知道什么是垃圾邮件,但通过统计词频组合(如“恭喜”“中奖”同时出现)判定垃圾邮件。
- 局限性:高度依赖人工设计的特征,本质上是在人划定的框架内优化。
第二阶段:深度学习
- 在机器学习基础上衍生,主要模拟人脑的神经网络。
- 典型架构是深度神经网络(DNN)。
- 对算力要求更高,能够完成更复杂的任务。
- 典型案例:结合强化学习的AlphaGo、人脸识别、智能驾驶。
- 局限性:仍是专用智能,缺乏泛化迁移能力,不能跨任务。
第三阶段:大语言模型(生成式AI)
- 之前AI主要做的是“选择题”(判断是或非、往南走或往北走),而大语言模型则可以“写作文”,具备推理和创造能力。
- 核心机制基于Google在2017年发布的论文《Attention Is All You Need》提出的Transformer架构。
- 通过不断预测下一个token,即可完成各种生成式任务。
- 这是人类离AGI最近的一次。
为什么语言模型率先突破?
初期判断的逆转
- 最初,研究者认为识别图片的计算机视觉(CV)领域最有可能实现通用人工智能。
- 但最终是语言模型(NLP领域)率先取得了突破。
“语言即世界”哲学观点
- 奥地利哲学家维特根斯坦的观点:“我的语言之界限,即我世界之界限”。
- 语言是世界的压缩——人类几千年的文字记录编码了对世界的全量认知:
- “所以”编码了因果律
- “但是”编码了逻辑转折
- 讲述故事时编码了时间、空间、人类情感、社会规范等
- 通过学习人类的语言,AI就能认知到人类的世界。
大语言模型的工作机制
- 大语言模型的任务极其简单:根据已有prompt或输入,不断预测下一个输出(用token更精准)——一个词一个词地往外蹦。
- 看似简单,但为了精准预测下一句,模型被迫理解各种深层逻辑:
- 要预测物理题答案 → 必须学会物理规律
- 要预测代码的下一行 → 必须学会编程
- 要预测故事结局 → 必须理解人物动机
- 通过学习人类所有文字,大语言模型学到了人类对世界的全量认知,进而涌现出惊人能力:理解逻辑因果、具备常识、进行推理创作代码,甚至模仿人类情感。
限制与待确认问题
语言模型是否足以实现AGI——存有争议
空间智能派的观点
- 持反对意见者的身份:斯坦福大学的李飞飞、图灵奖得主杨立昆(Yann LeCun)等人。
- 李飞飞的核心论点:
- 语言只是最近50万年才诞生的事物,相对于地球生命历史“年轻的就像昨天”。
- 语言是世界的镜子,但并非世界本身。
- 大语言模型仍旧困在像素与符号(图片与文字表达)的统计规律之中。
- 空间智能的进化基础:
- 从寒武纪开始,各种生物看见这个世界已有5亿年。
- 看见世界驱动了大脑的爆发——无论是捕食还是逃生,都需要感知与猎物/天敌之间的距离、相对速度、重力、预测轨迹等。
- 这是一个有空间概念的智能。
- 实现AGI的必要条件:AI必须理解物理世界的一致性(如球推下桌子就会掉下去),否则无法真正理解世界。
- 李飞飞的实践:创建了World Labs,致力于构建具有物理一致性的世界模型。
语言智能与空间智能的关系——缺乏定论
- 语言智能和空间智能可能都不可或缺,实现AGI可能的路径仍属未知。
- 原文观点:对实现AGI,应采取拭目以待的态度。
总结
人工智能的根本认知
- 智能 = 学习能力 + 迁移能力。
- 当前时代,数据与经验可被大规模获取,算力也因互联网发展和摩尔定律的推动而充足。
- 关键问题在于:如何将这些数据变成可学习的任务,让机器在反复试错中总结出对世界的认知函数(模型)。
学习路线图
接下来的学习核心是理解如何实现这一过程:
- 从机器学习出发
- 到深度学习
- 再到NLP与大语言模型
这构成了从感知到认知、从专用到泛化的完整智能演进路径。