AI 发展 75 年史:从图灵测试到具身智能的完整复盘
从 1950 年图灵提出"机器能思考吗"这一哲学问题,到 2025 年大模型、智能体与具身智能全面爆发,AI 的七十五年历史是一场跨越算法、数据、算力三大支柱逐步汇聚,最终从模仿人类走向理解真实世界的接力赛。
核心要点
- AI 的学科定义从一开始就被"工程化"了:图灵没有陷入"什么是思考"的哲学争论,而是将其转化为一个可测试的工程问题——如果一台机器隔着屏幕聊天,让人分不清对面是人还是机器,那它就算会思考。这奠定了 AI 学科"追求的不是灵魂,是表现"的根本基调。
- AI 在发展早期就分化为两条路线:符号主义(人类手把手把知识和规则写死)与连接主义(神经网络,机器自己从数据中学习)。后者就是今天深度学习的前身。
- AI 经历了两次"寒冬":第一次源于 1969 年《感知机》一书对单层感知机局限性的系统批评,导致神经网络研究资金断裂;第二次源于 1980 年代专家系统因规则过于复杂、维护困难而失宠。
- AI 真正复兴靠的是三样东西缺一不可:好的算法(反向传播、CNN)、大规模数据集(ImageNet)、以及强大的并行算力(GPU + CUDA)。
- 2012 年是整个 AI 历史最关键的转折点:AlexNet 在 ImageNet 竞赛中取得断崖式胜利,一次性验证了神经网络的有效性、数据集的价值和 GPU 的潜力。
- 大模型时代的根基是 2017 年谷歌提出的 Transformer 架构:其核心优势是适合并行训练、能处理海量数据,并展现出"模型越大、数据越多、效果越离谱"的反直觉特性。
- ChatGPT 的上线(2022 年 11 月 30 日)是 AI 进入普通人生活的分水岭:五天用户破 100 万,两个月破 1 亿,成为人类历史上增长最快的消费级产品。
- AI 的能力演进方向是多模态 → 智能体 → 空间智能 → 具身智能:从只会打字的大脑,逐渐长出眼睛、耳朵、嘴、手和身体,最终走进物理世界。
详细解析
AI 的起点:图灵测试(1950 年)
1950 年,英国数学家阿兰·图灵(Alan Turing)提出了一个当时被认为天方夜谭的问题:机器能思考吗? 这个问题在当时更像哲学系大一新生的论文题目,非常抽象。
图灵的聪明之处在于,他没有纠结于"思考"的定义,而是把这个辩论赛式的问题改写成工程化版本:如果有一天,一台机器隔着屏幕和你聊天,而你能聊到分不清对面是人还是机器——那它算不算会思考? 这就是著名的图灵测试(Turing Test)。
这一步极其关键,等于把一个哲学问题硬生生拧成了产品问题。AI 这门学科的基因从此刻就定下来了:我们追求的不是灵魂,是表现。
学科的命名:达特茅斯会议(1956 年)
1956 年夏天,美国达特茅斯学院一群年轻科学家召开了一场改变世界的会议,名为"达特茅斯人工智能夏季研究计划"(Dartmouth Summer Research Project on Artificial Intelligence)。会议上,约翰·麦卡锡(John McCarthy) 正式拍板,给这门学科命名为 Artificial Intelligence(人工智能),"AI"这两个字母从这一刻正式确立了身份。
与会者的心态当时相当膨胀,他们觉得给一个夏天和一点经费,AI 就能被彻底拆明白。这种乐观情绪后来被证明为时过早——第一次 AI 寒冬很快就会来。
早期的两条技术路线
AI 从一开始就分成了两条路线:
- 符号主义(Symbolicism):人类手把手地告诉机器什么是猫、什么是狗、什么情况下得肺炎、什么情况下该割肉股票。知识和规则全部写死。好处是清楚、可解释,坏处是人类常识太多,永远写不完。
- 连接主义(Connectionism):也就是神经网络。1958 年,弗兰克·罗森布拉特(Frank Rosenblatt) 发明了感知机(Perceptron)。这个思路非常理想化:不用人教,机器自己从数据里学。这本质上就是今天深度学习的"祖宗"。但当时的现实约束是——数据没有、算力没有、算法也没调明白。
两次 AI 寒冬
- 第一次寒冬(1969 年起):1969 年,两位大佬 马文·米斯基(Marvin Minsky) 和 西摩·佩珀特(Seymour Papert) 出版了《感知机》一书,系统性地指出了单层感知机的缺陷。学术圈得出的结论是"神经网络这条路不行",于是资金断了、项目砍了、论文没人看了,AI 的第一次寒冬来临。
- 第二次寒冬(1980 年代末至 1990 年代初):1980 年代 AI 曾凭借专家系统(Expert System) 再次火了一轮——找一个行业大牛,把他的经验全部塞进电脑,用于医疗诊断、设备维修、金融决策等场景。起初企业看到能赚钱就疯狂砸钱,但问题很快暴露:规则越写越多,维护越来越难,世界稍微一变系统就开始掉链子。于是第二次寒冬又来了。
深度学习复兴的三大支柱
AI 真正"活过来"依赖于三样东西:算法、数据、算力,三者缺一不可,如同集齐龙珠才能召唤神龙。
算法:反向传播(1986 年)
1986 年,杰弗里·辛顿(Geoffrey Hinton)、大卫·鲁梅尔哈特(David Rumelhart) 和 罗纳德·威廉姆斯(Ronald Williams) 将反向传播(Backpropagation) 这套训练方法推向神坛。从此,机器第一次学会了"复盘"——做错题之后,知道错在哪儿、该怎么改。
辛顿后来被全世界称为"深度学习教父",他在后续历史中还会多次出场。
算法:卷积神经网络与 LeNet
杨立昆(Yann LeCun) 从 1980 年代末到 90 年代一直死磕卷积神经网络(Convolutional Neural Network,CNN) 这条路线,做出了 LeNet 模型,能够识别手写数字,后来被银行和邮政系统实际采用。这是一个重要的里程碑——神经网络第一次不再只是论文里的名词,而是真的在现实世界打工了。
数据:ImageNet(2009 年)
华裔科学家李飞飞(Fei-Fei Li) 解决了一个最底层的问题:AI 没有足够好的训练数据。
2009 年,她推动了 ImageNet 项目——一个超大规模的图像数据集,最终做到上千万张图片、上万个类别。这件事的意义不可小觑:以前研究者做视觉研究像是在村口小水塘里练游泳,ImageNet 一出来等于直接把人拖到了太平洋。如果没有这个训练场,后面的故事根本不会发生。
算力:GPU 与 CUDA(2006 年)
英伟达(NVIDIA) 最早是做显卡的公司,大家买它的卡是为了打游戏、做特效,跟 AI 可以说毫无关系。但 GPU 芯片有一个关键特点:特别擅长并行计算。而神经网络最需要的恰恰就是并行计算。
2006 年,英伟达推出了 CUDA。表面上是给 GPU 开了一个编程接口,实际上相当于告诉全世界:这些拿来渲染游戏画面的卡,也可以拿来大规模计算矩阵。从这一刻起,GPU 和 AI 的命运绑死了。这也是后来全球大厂都在抢英伟达的卡、甚至抢到要美国政府出面管控的根源所在。
2012 年:AI 历史的分水岭
如果要从整个 AI 发展史中挑一个最关键的年份,那一定是 2012 年。
这一年,在 ImageNet 竞赛 上,一位老师带着两个学生拿出了名为 AlexNet 的模型。老师就是杰弗里·辛顿;两个学生分别是 亚历克斯·克里泽夫斯基(Alex Krizhevsky) 和 伊利亚·苏茨克维(Ilya Sutskever)——后者就是后来 OpenAI 的首席科学家、ChatGPT 背后的那位伊利亚。
表面上看,他们做的只是识别图片,但结果极不寻常:他们不是赢了一点点,而是断崖式领先所有用传统方法的对手。这套模型跑在英伟达 GPU 上训练。
这一仗一次性验证了三件事:
- 神经网络不是不行,是以前条件不够。
- 大规模数据集(ImageNet)真的有用。
- GPU 就是 AI 时代的"产子"(生产力工具)。
从这一年起,整个 AI 圈集体转向深度学习。
关键里程碑:AlphaGo(2016 年)
深度学习起飞后,AI 先在图像、语音领域横扫。但真正让全球普通人意识到"事情开始不对了"的,是 AlphaGo。
故事主角是一家叫 DeepMind 的公司,2010 年在伦敦成立,2014 年被谷歌收购。2016 年 3 月,AlphaGo 以 4 比 1 的成绩击败了世界顶尖围棋选手李世石(Lee Sedol)。
围棋在 AI 圈被认为是块硬骨头,因为围棋的变化数量多到远超暴力计算能处理的范围。在 AlphaGo 之前,业内普遍预测 AI 要战胜人类顶尖棋手至少还需要 10 年时间。结果 AlphaGo 用深度神经网络 + 搜索算法 + 强化学习三板斧,不到一年就把人类顶尖棋手击败。
最震撼的是著名的 Move 37(第 37 手棋):这一步棋下出后,全世界的围棋高手都懵了——按照人类几千年的经验,这一步根本不该下在那里。但事后复盘发现,它竟然是"神之一手"。那一刻,很多人第一次真切地感受到:AI 可能不只是模仿人类,它可能在走一条人类从未走过的路。
大模型时代:Transformer 与 GPT
AlphaGo 让 AI 震撼了一次,但真正让 AI 进入普通人生活的,是最后一块拼图:Transformer。
Transformer 架构(2017 年)
2017 年,谷歌发表了一篇名为《Attention Is All You Need》(你只需要注意力)的论文,提出了 Transformer 这一新架构。今天所有的大模型,往根儿上刨都源自它——包括 ChatGPT、Claude、Gemini、Llama、千问、DeepSeek、豆包、Kimi 等,一个都跑不掉。
Transformer 强大的原因在于:
- 特别适合并行训练,能够吃下巨大的数据量;
- 有一个反直觉的特点:模型越大、数据越多,效果就越离谱——这就为后来"大力出奇迹"的说法铺好了路。
OpenAI 与 GPT 系列
把 Transformer 真正用到极致的,反而不是谷歌,而是一家叫 OpenAI 的创业公司。其发展节奏为:
- 2018 年:GPT-1 发布
- 2019 年:GPT-2 发布
- 2020 年:GPT-3 发布
- 2022 年 11 月 30 日:ChatGPT 正式上线
GPT 全称是 Generative Pre-trained Transformer。翻译成大白话就是:先拿海量文本把模型喂饱,让它学会语言的规律,再拿它去做各种任务。
以前的思路是:如果要训练 AI 做会计、翻译、客服、老师,得分别招四个人。而 GPT 的思路是:先培养一个超级聪明的全才,再把他派到不同岗位。这条路一开始没多少人相信,连 OpenAI 自己都被业内嘲笑了好几年,直到 ChatGPT 上线。
2022 年 11 月 30 日:人类与 AI 关系的分水岭
这一天,OpenAI 将 GPT-3.5 包装成一个聊天框放到了网上,取名 ChatGPT。结果:
- 5 天用户突破 100 万
- 2 个月用户突破 1 亿
- 成为人类历史上增长最快的消费级产品
很多人第一次打开手机输入一句话,它立刻回复一整段看起来像真人写的内容,那种感觉就像收到一条来自外星智慧物种的信息。
行业军备竞赛与多方格局
ChatGPT 一出,整个行业瞬间进入军备竞赛。几乎所有大厂都意识到:如果 PC 和移动互联网定义了上一代平台,那么大模型很可能正在定义下一代平台——掉队意味着整个生态位都要重写。
- 谷歌:端出了 Gemini
- Anthropic:一帮人从 OpenAI 离职另起炉灶,推出了 Claude
- Meta:杨立昆领军,选择开源路线,搞出了 Llama
- 马斯克(Elon Musk):不甘示弱,成立 xAI,推出 Grok
- 国内厂商:百度文心、阿里通义千问、字节豆包、腾讯元宝、月之暗面 Kimi 等
- DeepSeek:2025 年初以极低成本震撼全球 AI 圈,甚至对英伟达股价造成冲击
那段时间隔三差五就出现一家公司说自己是最好的模型,并端出一堆 benchmark 数据。
AI 能力的演进方向
多模态:让 AI 长出五官
大模型光会说话还不够,很快它开始"长出五官":
- 视觉生成:Sora、即梦(可灵)等视频模型可以从一段文字生成电影级别的画面;Midjourney、Stable Diffusion、FLUX 让每个人都能当美术总监
- 音频生成:MiniMax 等语音模型已经可以生成带情感和语调的音频
可以粗暴地理解为:以前的 AI 只是个会打字的大脑,现在的 AI 有眼睛、有耳朵、有嘴、有手。
智能体(Agent):让 AI 有了手和脚
到了 2024 年、2025 年,行业焦点从大模型转向了智能体(Agent)。
- 以前用 ChatGPT:像跟一个聊天框对话,问一句答一句
- 现在用智能体:给它一个目标,它自己拆任务、自己打开浏览器查资料、写代码调工具,最后把结果交给你
举例:以前让 AI 帮你订机票,它顶多推荐几个航班;现在让 Agent 订机票,它可以自己打开携程比价、在下单前向你确认、自己下单并发邮件给你——你从使用者变成了老板。
这条路线里发展出了 Manus、Claude Code、Cursor(Windsurf)、OpenAI 的 Codex,以及之前全民养的龙虾 Devin。如果说大模型是 AI 的大脑,那么智能体就是给大脑装上了手和脚——AI 不再只是回答问题,而是真的开始替代人类完成工作。
空间智能:李飞飞的新方向
就在大家都在卷语言模型时,科学家李飞飞转向了另一条道路。2025 年,她成立了新公司 World Labs,提出了空间智能(Spatial Intelligence) 的概念。
她说了一句很有分量的话:"语言是人类的发明,但空间不是。"
现在的 LLM 本质上活在文字里——它理解"一只猫坐在桌子上"靠的是文本中这些词的统计规律。但真实世界不是文字:真实世界是三维的,有重力、有物理规则、有因果关系。如果 AI 真的要与世界交互——开车、做手术、搬东西、陪老人——它必须先理解空间。 空间智能就是让 AI 学会像婴儿一样去感知三维世界,这是下一场硬仗。
具身智能:给 AI 一个身体
空间智能再往前走一步就是具身智能(Embodied Intelligence)——把 AI 塞进一个机器人的身体里。代表性玩家包括 特斯拉(Tesla)、Figure AI、1X、智元机器人、宇树科技、银河通用等。一夜之间,人形机器人赛道卷成了"新能源汽车 2.0"。
为什么大家突然都在做机器人?因为大模型解决了脑子的问题,接下来最缺的是一个可以行动的身体。 想象那个画面:一个机器人能听懂你说的话、能看懂环境、能自己拆解任务、能用手去做事——这不就是 1950 年图灵提出的那个问题的终极形态吗?
总结:一场跨越 75 年的接力赛
回看这段历史,AI 是一场跨越 75 年的接力赛:
- 图灵(1950):提出问题——机器能思考吗?
- 麦卡锡(1956):给学科起了名字——人工智能
- 前两代研究者:经历了两次寒冬,验证了什么路走不通
- 辛顿:把深度学习这条线从坟墓里拖了回来
- 杨立昆:让神经网络真的走进了现实世界
- 李飞飞:用 ImageNet 给整个行业盖好了训练场
- 英伟达:用 GPU 和 CUDA 变成了 AI 时代的"电和铁路"
- DeepMind 的 AlphaGo(2016):告诉全世界 AI 已经不是玩具了
- 谷歌的 Transformer(2017):打好了大模型的地基
- OpenAI 的 GPT 和 ChatGPT(2022):把 AI 拉下神坛,塞进每个人的手机里
- 大厂内卷:AI 变成了新的基础设施
- 智能体:让 AI 有了手和脚
- 空间智能与具身智能:让 AI 理解真实世界,走进物理世界
图灵在 1950 年提出"机器能思考吗"时,这是一个论文里的思辨问题。而今天,这个问题已经变成了发生在每个人手机、电脑、工位上的现实。今天的问题不再是机器能不能通过一个聊天测试,而是:它能不能看懂这个世界、能不能替我们做决定、能不能走进物理世界、如果真的比我们聪明,我们该怎么办?
AI 是全人类花了 75 年时间,替它准备了一副能看、能听、能说、能思考、能行动的身体。现在我们恰好站在它"刚刚睁眼"的这一瞬间。接下来的十年,可能是人类历史上最奇怪、最刺激、最值得一看的十年。机器能不能思考,我们可能很快就不用再问了——因为问题已经变成了我们想让它替我们思考什么。