文章人工智能

人工智能的前世今生

从图灵测试与早期路线之争,到深度学习、Transformer、大模型与未来。先用画布看清框架,再沿正文理解 AI 的演进。

进入画布后可拖动、滚动或双指缩放;方向键平移,Escape 返回页面滚动。

如果我们要为 AI 去定义一个起点,我认为可以是 1950 年阿兰图灵提出的图灵测试的概念。那么什么是图灵测试呢?我相信这个概念已经在互联网上被重复过很多遍了。简而言之,图灵认为当一台机器与人类进行文字交流的时候,如果这个人无法判断对方是机器还是人的话,那么我们就可以认为这台机器是有智能的。机器是否具有智能,不再只是哲学层面的思辨,而逐渐成为一个可以工程化度量与验证的问题。科学界对机器智能的工程路线,大体上经历了从控制论到符号主义的演变,再到连接主义与统计学习并行发展,最终以深度学习为代表的连接主义成为主导范式。

控制论:控制论最早被提出是在 1948 年维纳的《控制论》一本书当中。他一开始其实并不是要去解决机器智能的问题,而是想要去建立一门关于控制与通信的普遍学科。控制论最核心的理论在于它的信息反馈控制的循环系统。比如说现在比较常见的空调控制器,就是一个典型的控制论产品,比如说我们首先会有一个温度传感器,传感器将当前的温度与目标温度进行比对。如果发现温度高了,就会释放冷气。释放冷气的行为又会导致新的环境温度,并且这个温度会被传感器所感知,然后进行下一步的决策。以上就是控制论最核心的理念。控制论是一门影响非常深远的学科。它揭示了,一个复杂系统并不一定要有复杂机制,可能是简单的目的性行为通过反馈回路的。这一点对于神经网络后续的很多研究都有启发和指导意义。但是控制论有一个内在问题,就是目标太宽且路径不聚焦。它并不是聚焦于机器智能这一个问题,因此到了 1950 年,中期控制论虽然还热,但是已经被分流。

符号主义:实现机器智能的关键转折来自于 1956 年的达特茅斯会议。在这个会议上,机器智能被证实命名为“artificial intelligence 人工智能”,并且把实现路线确立为符号主义。它主张通过人类手工编写所有的知识和规则来定义智能,其代表产品是上世纪 80 年代炙手可热的专家系统。所谓专家系统,就是将各个领域内的专家集中起来,手动将规则输入到系统中,然后通过 if-then 等逻辑计算自动生成决策。专家系统曾被普遍视为AI 从实验室走向企业、产生实际商业价值的最有潜力的路径,然而伴随着各行各业五花八门的专家系统落地,人们越来越发现,真实的环境中规则无穷无尽,很难做到完全的穷尽,这其中伴随着巨大的收集成本,并且知识和规则之间可能还会产生互相冲突的情况,进而导致系统的可维护性变得非常差。因此,专家系统伴随着符号主义在 1980年末逐步走向了没落。然而,符号主义虽然退居二线,其留下的遗产仍然非常多,例如面向对象思想、本体工程、规则引擎和知识图谱等。

连接主义:与符号主义需要手工编写规则不同,连接主义主张让机器从数据中自主学习,从而实现人工智能。而神经网络,就是连接主义最主要的实现形式。从 1943 年的麦卡洛克-皮茨神经元模型,到 1958 年的罗森布拉特感知机,神经网络经历了一轮热度上升周期。直到 1969 年因明斯基的《感知机》分析指出,单层感知机存在根本局限,且当时没有可行的多层训练方法,于是整个连接主义路线被学界和资方看衰。连接主义的复兴开始于1986 年,杰弗里辛顿等人提出并推广了反向传播算法,解决了多层网络难以训练的问题,让神经网络在经历感知机低谷后短暂回到人工智能学界的视野中,但在当时那个年代,神经网络仍受困于梯度消失、非凸优化、过拟合与算力不足,虽能训练,却并不好用。

统计学习:自 1990 年中期,统计学习路线悄然崛起,并在接下来的十余年里压过神经网络。统计学习主张用统计和优化方法,从有限数据中学出一个能对新数据做出可靠判断的模型。其代表性方法包括支持向量机(SVM)、核方法以及概率图模型。它们以理论完备、凸优化、小样本表现好、可解释性强等优势,恰好契合了当时的学术审美与数据规模,因而备受学界青睐。

统计学习的主导地位并非终局。彼时压制神经网络的算法、数据和算力等问题,也在 2000 年代后得到逐步解决。

算法侧,杨立昆的 LeNet-5 早在 1998 年就证明了卷积神经网络CNN可以识别手写数字;此后,ReLU 激活函数缓解了梯度消失,Dropout 抑制了过拟合,BatchNorm 稳定了深层训练,残差连接让网络可以真正做深,Adam 优化器让训练更稳更快。这些改进单独看都不算颠覆,但叠在一起,让深层网络从“能训”变成了“好训”。

算力侧,英伟达的 CUDA 在 2007 年把 GPU 从图形渲染变成了通用并行计算平台;此后,GPU 集群、TPU、分布式训练、混合精度等技术相继成熟,让深层网络的训练从不可能变成可行,也让模型规模可以持续扩大。

数据侧,李飞飞的 ImageNet 在 2009 年建成了超大规模标注图像库ImageNet,让模型第一次有了足够的数据可学;与此同时,互联网文本、维基百科、网页语料以及后来的多模态数据集不断涌现,为不同任务提供了充足的训练素材。数据不再是瓶颈,反而成了推动模型变强的燃料。

算法、数据、算力都已到位,神经网络领域正站在爆发的临界点上。2012 年,后来的诺贝尔物理学奖得主杰弗里·辛顿带领学生亚历克斯和伊利亚推出 AlexNet,在 ImageNet 比赛中以断层式优势领先。它没有提出全新范式,而是第一次把卷积神经网络、大规模标注数据和 GPU 训练完整地组合在一起,验证了“神经网络 + 大数据集 + GPU”模式的可行性。至此,三驾马车第一次合流,深度学习正式起飞。

AlexNet 之后,深度学习进入了一段以 CNN 和 RNN 为主角的扩张期。CNN 在视觉领域迅速确立统治地位,从 VGG、GoogLeNet 到 ResNet,网络越做越深,图像分类、目标检测、图像分割等任务被逐一攻克;RNN 与 LSTM 则在序列建模上占据主流,从语音识别到机器翻译,再到文本分类与语言建模,几乎所有和时间顺序相关的任务都绕不开它。2012 后的几年,业界常把它概括为“CNN 管视觉,RNN 管序列”。而这段深度学习的高光,在 2016 年 AlphaGo 击败李世石时达到了巅峰:DeepMind 用 CNN 加蒙特卡洛树搜索,在第 37 手走出被人类称为“神之一手”的招法,第一次让大众直观感受到 AI 可以创造出超越人类经验的策略。

然而,高光之下,CNN 与 RNN 的局限也逐渐显现:CNN 难以建模长距离依赖,RNN 必须逐步递推、无法并行。深度学习要继续突破,就需要一个新架构。2017 年,Google 团队发表《Attention Is All You Need》,提出 Transformer 架构,用自注意力机制取代循环结构,让序列中任意两个位置直接相连,所有位置可以同时计算。它既解决了 RNN 无法并行的问题,也缓解了 CNN 长距离依赖的短板,同时不再绑定单一数据形态。Transformer 提出后,迅速从 NLP 扩散到其他领域,并很快成为深度学习的默认架构。与此同时,深度学习进入“预训练 + 规模放大”时期:2018 年 BERT 与 GPT-1 确立预训练加微调范式,2020 年 GPT-3 以 1750 亿参数验证 Scaling Law 与 in-context learning,直接为后来大模型路线提供了依据;同期 ViT、扩散模型、CLIP 等把 Transformer 带向视觉和多模态。架构、方法、规模三者合流,一条通往 ChatGPT 的路就此铺好。

2022 年 11 月 30 日,ChatGPT 正式上线,凭借自然流畅的对话能力,它成为史上增长最快的消费级应用,并迅速引发全球 AI 军备竞赛。伴随 ChatGPT 的问世,OpenAI 在 2024 年提出了 AI 智能的 L1 到 L5 分级,为这场技术演进给出了清晰的路线图。从 ChatGPT 发布至今,AI 已经完成了 L1 对话与 L2 推理的能力跨越,不仅能流畅交流、完成复杂的逻辑推理与内容生成,还在这个过程中进化出“眼、耳、口、手”,具备了理解图像、视频和音频的多模态能力,代表性应用如 Sora、Midjourney、Seendance 等。而当下,我们正处于 L3 智能体(Agent)阶段,AI 正从被动问答转向主动执行,能自主拆解任务、调用工具,成为能完成实际工作的“数字员工”。

面向未来,AI 仍在两条轨道上推进。智能层级上,L4 创新意味着 AI 能自主提出假设、发现新知,L5 组织则要求它协调多智能体与人类、运营复杂组织。数字世界之外,李飞飞提出的“空间智能”强调 AI 必须理解三维世界、物理规则与因果关系,而“具身智能”则把 AI 大脑与机器人身体结合,使其能看、能听、能行动,真正完成物理任务,并与机器人产业深度融合。当然,支撑这一切的 Transformer 仍面临平方复杂度、推理慢、缺乏持久记忆等瓶颈。稀疏与线性注意力、Mamba 等状态空间模型、混合架构以及检索增强,正在从不同方向尝试修复。Transformer 未必会被立刻取代,但它的升级与混合化,已是通往 L4、L5 与具身智能时代的必经之路。

从图灵测试的哲学追问,到控制论、符号主义、统计学习与连接主义的交替演进,机器智能一路从思辨走向工程。这背后是无数人的智慧与努力,也说明 AI 的发展从不是一帆风顺,而是螺旋上升。今天的大模型浪潮同样会有泡沫,但唯有经过市场检验,经过足够多人的探索与研究,真正的价值才会浮现,真正的问题才会暴露,新的架构与方法才会孕育。能够见证这个波涛澎湃的时代,已是幸运。