返回
查看原链接原链接
Bilibili14分46秒 · —

AI 发展 75 年史:从图灵测试到具身智能的完整复盘

AI 发展 75 年史:从图灵测试到具身智能的完整复盘

从 1950 年图灵提出"机器能思考吗"这一哲学问题,到 2025 年大模型、智能体与具身智能全面爆发,AI 的七十五年历史是一场跨越算法、数据、算力三大支柱逐步汇聚,最终从模仿人类走向理解真实世界的接力赛。

核心要点

  • AI 的学科定义从一开始就被"工程化"了:图灵没有陷入"什么是思考"的哲学争论,而是将其转化为一个可测试的工程问题——如果一台机器隔着屏幕聊天,让人分不清对面是人还是机器,那它就算会思考。这奠定了 AI 学科"追求的不是灵魂,是表现"的根本基调。
  • AI 在发展早期就分化为两条路线:符号主义(人类手把手把知识和规则写死)与连接主义(神经网络,机器自己从数据中学习)。后者就是今天深度学习的前身。
  • AI 经历了两次"寒冬":第一次源于 1969 年《感知机》一书对单层感知机局限性的系统批评,导致神经网络研究资金断裂;第二次源于 1980 年代专家系统因规则过于复杂、维护困难而失宠。
  • AI 真正复兴靠的是三样东西缺一不可:好的算法(反向传播、CNN)、大规模数据集(ImageNet)、以及强大的并行算力(GPU + CUDA)。
  • 2012 年是整个 AI 历史最关键的转折点:AlexNet 在 ImageNet 竞赛中取得断崖式胜利,一次性验证了神经网络的有效性、数据集的价值和 GPU 的潜力。
  • 大模型时代的根基是 2017 年谷歌提出的 Transformer 架构:其核心优势是适合并行训练、能处理海量数据,并展现出"模型越大、数据越多、效果越离谱"的反直觉特性。
  • ChatGPT 的上线(2022 年 11 月 30 日)是 AI 进入普通人生活的分水岭:五天用户破 100 万,两个月破 1 亿,成为人类历史上增长最快的消费级产品。
  • AI 的能力演进方向是多模态 → 智能体 → 空间智能 → 具身智能:从只会打字的大脑,逐渐长出眼睛、耳朵、嘴、手和身体,最终走进物理世界。

详细解析

AI 的起点:图灵测试(1950 年)

1950 年,英国数学家阿兰·图灵(Alan Turing)提出了一个当时被认为天方夜谭的问题:机器能思考吗? 这个问题在当时更像哲学系大一新生的论文题目,非常抽象。

图灵的聪明之处在于,他没有纠结于"思考"的定义,而是把这个辩论赛式的问题改写成工程化版本:如果有一天,一台机器隔着屏幕和你聊天,而你能聊到分不清对面是人还是机器——那它算不算会思考? 这就是著名的图灵测试(Turing Test)

这一步极其关键,等于把一个哲学问题硬生生拧成了产品问题。AI 这门学科的基因从此刻就定下来了:我们追求的不是灵魂,是表现。

学科的命名:达特茅斯会议(1956 年)

1956 年夏天,美国达特茅斯学院一群年轻科学家召开了一场改变世界的会议,名为"达特茅斯人工智能夏季研究计划"(Dartmouth Summer Research Project on Artificial Intelligence)。会议上,约翰·麦卡锡(John McCarthy) 正式拍板,给这门学科命名为 Artificial Intelligence(人工智能),"AI"这两个字母从这一刻正式确立了身份。

与会者的心态当时相当膨胀,他们觉得给一个夏天和一点经费,AI 就能被彻底拆明白。这种乐观情绪后来被证明为时过早——第一次 AI 寒冬很快就会来。

早期的两条技术路线

AI 从一开始就分成了两条路线:

  1. 符号主义(Symbolicism):人类手把手地告诉机器什么是猫、什么是狗、什么情况下得肺炎、什么情况下该割肉股票。知识和规则全部写死。好处是清楚、可解释,坏处是人类常识太多,永远写不完
  2. 连接主义(Connectionism):也就是神经网络。1958 年,弗兰克·罗森布拉特(Frank Rosenblatt) 发明了感知机(Perceptron)。这个思路非常理想化:不用人教,机器自己从数据里学。这本质上就是今天深度学习的"祖宗"。但当时的现实约束是——数据没有、算力没有、算法也没调明白。

两次 AI 寒冬

  • 第一次寒冬(1969 年起):1969 年,两位大佬 马文·米斯基(Marvin Minsky)西摩·佩珀特(Seymour Papert) 出版了《感知机》一书,系统性地指出了单层感知机的缺陷。学术圈得出的结论是"神经网络这条路不行",于是资金断了、项目砍了、论文没人看了,AI 的第一次寒冬来临。
  • 第二次寒冬(1980 年代末至 1990 年代初):1980 年代 AI 曾凭借专家系统(Expert System) 再次火了一轮——找一个行业大牛,把他的经验全部塞进电脑,用于医疗诊断、设备维修、金融决策等场景。起初企业看到能赚钱就疯狂砸钱,但问题很快暴露:规则越写越多,维护越来越难,世界稍微一变系统就开始掉链子。于是第二次寒冬又来了。

深度学习复兴的三大支柱

AI 真正"活过来"依赖于三样东西:算法、数据、算力,三者缺一不可,如同集齐龙珠才能召唤神龙。

算法:反向传播(1986 年)

1986 年,杰弗里·辛顿(Geoffrey Hinton)大卫·鲁梅尔哈特(David Rumelhart)罗纳德·威廉姆斯(Ronald Williams)反向传播(Backpropagation) 这套训练方法推向神坛。从此,机器第一次学会了"复盘"——做错题之后,知道错在哪儿、该怎么改。

辛顿后来被全世界称为"深度学习教父",他在后续历史中还会多次出场。

算法:卷积神经网络与 LeNet

杨立昆(Yann LeCun) 从 1980 年代末到 90 年代一直死磕卷积神经网络(Convolutional Neural Network,CNN) 这条路线,做出了 LeNet 模型,能够识别手写数字,后来被银行和邮政系统实际采用。这是一个重要的里程碑——神经网络第一次不再只是论文里的名词,而是真的在现实世界打工了

数据:ImageNet(2009 年)

华裔科学家李飞飞(Fei-Fei Li) 解决了一个最底层的问题:AI 没有足够好的训练数据。

2009 年,她推动了 ImageNet 项目——一个超大规模的图像数据集,最终做到上千万张图片、上万个类别。这件事的意义不可小觑:以前研究者做视觉研究像是在村口小水塘里练游泳,ImageNet 一出来等于直接把人拖到了太平洋。如果没有这个训练场,后面的故事根本不会发生。

算力:GPU 与 CUDA(2006 年)

英伟达(NVIDIA) 最早是做显卡的公司,大家买它的卡是为了打游戏、做特效,跟 AI 可以说毫无关系。但 GPU 芯片有一个关键特点:特别擅长并行计算。而神经网络最需要的恰恰就是并行计算。

2006 年,英伟达推出了 CUDA。表面上是给 GPU 开了一个编程接口,实际上相当于告诉全世界:这些拿来渲染游戏画面的卡,也可以拿来大规模计算矩阵。从这一刻起,GPU 和 AI 的命运绑死了。这也是后来全球大厂都在抢英伟达的卡、甚至抢到要美国政府出面管控的根源所在。


2012 年:AI 历史的分水岭

如果要从整个 AI 发展史中挑一个最关键的年份,那一定是 2012 年

这一年,在 ImageNet 竞赛 上,一位老师带着两个学生拿出了名为 AlexNet 的模型。老师就是杰弗里·辛顿;两个学生分别是 亚历克斯·克里泽夫斯基(Alex Krizhevsky)伊利亚·苏茨克维(Ilya Sutskever)——后者就是后来 OpenAI 的首席科学家、ChatGPT 背后的那位伊利亚。

表面上看,他们做的只是识别图片,但结果极不寻常:他们不是赢了一点点,而是断崖式领先所有用传统方法的对手。这套模型跑在英伟达 GPU 上训练。

这一仗一次性验证了三件事:

  1. 神经网络不是不行,是以前条件不够
  2. 大规模数据集(ImageNet)真的有用
  3. GPU 就是 AI 时代的"产子"(生产力工具)

从这一年起,整个 AI 圈集体转向深度学习。


关键里程碑:AlphaGo(2016 年)

深度学习起飞后,AI 先在图像、语音领域横扫。但真正让全球普通人意识到"事情开始不对了"的,是 AlphaGo

故事主角是一家叫 DeepMind 的公司,2010 年在伦敦成立,2014 年被谷歌收购。2016 年 3 月,AlphaGo 以 4 比 1 的成绩击败了世界顶尖围棋选手李世石(Lee Sedol)

围棋在 AI 圈被认为是块硬骨头,因为围棋的变化数量多到远超暴力计算能处理的范围。在 AlphaGo 之前,业内普遍预测 AI 要战胜人类顶尖棋手至少还需要 10 年时间。结果 AlphaGo 用深度神经网络 + 搜索算法 + 强化学习三板斧,不到一年就把人类顶尖棋手击败。

最震撼的是著名的 Move 37(第 37 手棋):这一步棋下出后,全世界的围棋高手都懵了——按照人类几千年的经验,这一步根本不该下在那里。但事后复盘发现,它竟然是"神之一手"。那一刻,很多人第一次真切地感受到:AI 可能不只是模仿人类,它可能在走一条人类从未走过的路


大模型时代:Transformer 与 GPT

AlphaGo 让 AI 震撼了一次,但真正让 AI 进入普通人生活的,是最后一块拼图:Transformer

Transformer 架构(2017 年)

2017 年,谷歌发表了一篇名为《Attention Is All You Need》(你只需要注意力)的论文,提出了 Transformer 这一新架构。今天所有的大模型,往根儿上刨都源自它——包括 ChatGPT、Claude、Gemini、Llama、千问、DeepSeek、豆包、Kimi 等,一个都跑不掉。

Transformer 强大的原因在于:

  • 特别适合并行训练,能够吃下巨大的数据量;
  • 有一个反直觉的特点:模型越大、数据越多,效果就越离谱——这就为后来"大力出奇迹"的说法铺好了路。

OpenAI 与 GPT 系列

把 Transformer 真正用到极致的,反而不是谷歌,而是一家叫 OpenAI 的创业公司。其发展节奏为:

  • 2018 年:GPT-1 发布
  • 2019 年:GPT-2 发布
  • 2020 年:GPT-3 发布
  • 2022 年 11 月 30 日:ChatGPT 正式上线

GPT 全称是 Generative Pre-trained Transformer。翻译成大白话就是:先拿海量文本把模型喂饱,让它学会语言的规律,再拿它去做各种任务

以前的思路是:如果要训练 AI 做会计、翻译、客服、老师,得分别招四个人。而 GPT 的思路是:先培养一个超级聪明的全才,再把他派到不同岗位。这条路一开始没多少人相信,连 OpenAI 自己都被业内嘲笑了好几年,直到 ChatGPT 上线。

2022 年 11 月 30 日:人类与 AI 关系的分水岭

这一天,OpenAI 将 GPT-3.5 包装成一个聊天框放到了网上,取名 ChatGPT。结果:

  • 5 天用户突破 100 万
  • 2 个月用户突破 1 亿
  • 成为人类历史上增长最快的消费级产品

很多人第一次打开手机输入一句话,它立刻回复一整段看起来像真人写的内容,那种感觉就像收到一条来自外星智慧物种的信息。


行业军备竞赛与多方格局

ChatGPT 一出,整个行业瞬间进入军备竞赛。几乎所有大厂都意识到:如果 PC 和移动互联网定义了上一代平台,那么大模型很可能正在定义下一代平台——掉队意味着整个生态位都要重写。

  • 谷歌:端出了 Gemini
  • Anthropic:一帮人从 OpenAI 离职另起炉灶,推出了 Claude
  • Meta杨立昆领军,选择开源路线,搞出了 Llama
  • 马斯克(Elon Musk):不甘示弱,成立 xAI,推出 Grok
  • 国内厂商:百度文心、阿里通义千问、字节豆包、腾讯元宝、月之暗面 Kimi 等
  • DeepSeek:2025 年初以极低成本震撼全球 AI 圈,甚至对英伟达股价造成冲击

那段时间隔三差五就出现一家公司说自己是最好的模型,并端出一堆 benchmark 数据。


AI 能力的演进方向

多模态:让 AI 长出五官

大模型光会说话还不够,很快它开始"长出五官":

  • 视觉生成:Sora、即梦(可灵)等视频模型可以从一段文字生成电影级别的画面;Midjourney、Stable Diffusion、FLUX 让每个人都能当美术总监
  • 音频生成:MiniMax 等语音模型已经可以生成带情感和语调的音频

可以粗暴地理解为:以前的 AI 只是个会打字的大脑,现在的 AI 有眼睛、有耳朵、有嘴、有手

智能体(Agent):让 AI 有了手和脚

到了 2024 年、2025 年,行业焦点从大模型转向了智能体(Agent)

  • 以前用 ChatGPT:像跟一个聊天框对话,问一句答一句
  • 现在用智能体:给它一个目标,它自己拆任务、自己打开浏览器查资料、写代码调工具,最后把结果交给你

举例:以前让 AI 帮你订机票,它顶多推荐几个航班;现在让 Agent 订机票,它可以自己打开携程比价、在下单前向你确认、自己下单并发邮件给你——你从使用者变成了老板

这条路线里发展出了 Manus、Claude Code、Cursor(Windsurf)、OpenAI 的 Codex,以及之前全民养的龙虾 Devin。如果说大模型是 AI 的大脑,那么智能体就是给大脑装上了手和脚——AI 不再只是回答问题,而是真的开始替代人类完成工作。

空间智能:李飞飞的新方向

就在大家都在卷语言模型时,科学家李飞飞转向了另一条道路。2025 年,她成立了新公司 World Labs,提出了空间智能(Spatial Intelligence) 的概念。

她说了一句很有分量的话:"语言是人类的发明,但空间不是。"

现在的 LLM 本质上活在文字里——它理解"一只猫坐在桌子上"靠的是文本中这些词的统计规律。但真实世界不是文字:真实世界是三维的,有重力、有物理规则、有因果关系。如果 AI 真的要与世界交互——开车、做手术、搬东西、陪老人——它必须先理解空间。 空间智能就是让 AI 学会像婴儿一样去感知三维世界,这是下一场硬仗。

具身智能:给 AI 一个身体

空间智能再往前走一步就是具身智能(Embodied Intelligence)——把 AI 塞进一个机器人的身体里。代表性玩家包括 特斯拉(Tesla)Figure AI1X智元机器人宇树科技银河通用等。一夜之间,人形机器人赛道卷成了"新能源汽车 2.0"。

为什么大家突然都在做机器人?因为大模型解决了脑子的问题,接下来最缺的是一个可以行动的身体。 想象那个画面:一个机器人能听懂你说的话、能看懂环境、能自己拆解任务、能用手去做事——这不就是 1950 年图灵提出的那个问题的终极形态吗?


总结:一场跨越 75 年的接力赛

回看这段历史,AI 是一场跨越 75 年的接力赛

  1. 图灵(1950):提出问题——机器能思考吗?
  2. 麦卡锡(1956):给学科起了名字——人工智能
  3. 前两代研究者:经历了两次寒冬,验证了什么路走不通
  4. 辛顿:把深度学习这条线从坟墓里拖了回来
  5. 杨立昆:让神经网络真的走进了现实世界
  6. 李飞飞:用 ImageNet 给整个行业盖好了训练场
  7. 英伟达:用 GPU 和 CUDA 变成了 AI 时代的"电和铁路"
  8. DeepMind 的 AlphaGo(2016):告诉全世界 AI 已经不是玩具了
  9. 谷歌的 Transformer(2017):打好了大模型的地基
  10. OpenAI 的 GPT 和 ChatGPT(2022):把 AI 拉下神坛,塞进每个人的手机里
  11. 大厂内卷:AI 变成了新的基础设施
  12. 智能体:让 AI 有了手和脚
  13. 空间智能与具身智能:让 AI 理解真实世界,走进物理世界

图灵在 1950 年提出"机器能思考吗"时,这是一个论文里的思辨问题。而今天,这个问题已经变成了发生在每个人手机、电脑、工位上的现实。今天的问题不再是机器能不能通过一个聊天测试,而是:它能不能看懂这个世界、能不能替我们做决定、能不能走进物理世界、如果真的比我们聪明,我们该怎么办?

AI 是全人类花了 75 年时间,替它准备了一副能看、能听、能说、能思考、能行动的身体。现在我们恰好站在它"刚刚睁眼"的这一瞬间。接下来的十年,可能是人类历史上最奇怪、最刺激、最值得一看的十年。机器能不能思考,我们可能很快就不用再问了——因为问题已经变成了我们想让它替我们思考什么