一部跌宕起伏的AI简史
一部跌宕起伏的AI简史
人工智能的故事,是一个关于人类野心的故事。
AI的历史绝不是一条平滑的、持续向上的曲线。真实的发展历史更像是一片波涛汹涌的海域,充满了狂热的浪潮与刺骨的寒潮,戏剧性的突破与令人沮丧的停滞交替上演,乐观的预言一次又一次地在冒险中落空。而真正改变世界的成果总是在意想不到的时刻、以意想不到的方式悄然降临。
人工智能的这段历史不仅关乎技术本身,也关乎人类在面对"创造智能"这个古老梦想时的执着、天真、傲慢与韧性。
人工智能的史前史,远比大多数人以为的要漫长。
在"人工智能"这个术语被发明之前,甚至在电子计算机诞生之前,人类就已经在严肃地思考机器能否思考这个问题。
我们想要——也试图创造一种东西,它像我们一样思考,甚至比我们思考得更好。这个梦想如此古老,以至于你可以在古希腊的赫菲斯托斯锻造的黄金机器人、中世纪的泥人传说、以及十九世纪玛丽·雪莱笔下的弗兰肯斯坦中找到它的踪迹。
而人类为什么会拥有这样的“欲望”,人类历史上有各种各样答案——人类在宇宙中是如此渺小与孤独,于是诞生了存在主义孤独与对同类的渴求,亦或者是古老的危险始终刻在我们的DNA之上,让人类一直保持着繁衍的本能与造物主情节........
这种欲望促使着每个历史阶段都产生了一些有关思考机器的新发明。
比如十七世纪的哲学家莱布尼茨梦想着发明一种"通用字符",这是一种一套能够表达所有人类知识的符号系统,以及一种能够在这套符号上进行推理的"思想演算",从而让哲学争论可以通过计算来解决。
十九世纪,查尔斯·巴贝奇又设计了分析机,一台机械式的通用可编程计算机,而艾达·洛夫莱斯在为这台从未建成的机器编写算法注释时,曾写下了一段惊人的预见:
她指出,分析机的运算对象不限于数字,它可以处理任何能够用符号表示的关系,因此原则上可以用来作曲、绘图,甚至进行科学发现。
但她同时写下了一个著名的保留意见:机器只能做我们命令它去做的事情,它本身没有原创性。
这个论断后来被称为"洛夫莱斯异议",在此后一个多世纪里都笼罩着关于机器智能的讨论。
直到二十世纪上半叶,数理逻辑和计算理论的发展为人工智能的诞生奠定了真正的理论基础。
但作为一个严肃的科学领域,人工智能的历史通常被认为是从1936年开始的,它的起点是一篇论文和一个问题。
1936年,年仅二十四岁的艾伦·图灵(他我就不用介绍了吧)在《伦敦数学学会学报》第42卷上发表了他那篇划时代的论文《论可计算数》。
在其中,他提出了"图灵机"的抽象概念。
图灵机,一种可以执行任何可计算任务的通用计算模型。
图灵证明了存在一些数学问题是图灵机无法解决的,但图灵机的存在第一次给出了"计算"这个概念的严格定义,因此这一概念也被认为是计算机科学的基石。
十年后的1946年,第一台通用电子计算机ENIAC在宾夕法尼亚大学投入运行。紧接着在1948年,诺伯特·维纳出版了《控制论》,提出了反馈、信息和通信的统一理论框架,试图将机器、生物和社会的运行统摄在同一个概念体系之下。而克劳德·香农则在同年发表了《通信的数学理论》,创立了信息论。
这些思想交汇在一起,催生了一个当时令人兴奋的观念:
智能——无论是人类的还是机器的——也许都可以被理解为一种信息处理过程。
到了1950年,艾伦·图灵在哲学期刊《Mind》上又发表了一篇名为《计算机器与智能》的论文。
论文的开篇是一个极其大胆的问题:"机器能思考吗?"
图灵知道,"思考"这个词太难定义了,于是他提出了一个替代方案——一个思想实验,这就是后来大名鼎鼎的"图灵测试"。
设想有一个人通过文字终端同时与一个真人和一台机器对话,如果这个人无法可靠地区分出哪个是机器哪个是人,那么我们就应该承认这台机器具有智能。
这个测试的巧妙之处在于它避开了"什么是思考"这个哲学泥潭,直接用一个可操作的、行为主义的标准来定义智能。
直到今天,图灵测试仍然是衡量AI智能水平的一个参照点——尽管在ChatGPT时代,很多对话式AI已经能在短时间的文字交流中让不少人难以分辨,但要说它们是否真正通过了图灵测试,学术界对此争论颇多。
不过截止到这一时期,AI还不算是正式登场。
图灵播下了种子,直到1956年,人工智能作为一个独立的研究领域正式登上了历史舞台。
那一年夏天,在美国新罕布什尔州的达特茅斯学院,一群年轻的学者聚在一起开了一个为期两个月的研讨会。
召集人是计算机科学家约翰·麦卡锡,那时候他还是一位年轻的数学助理教授。他给这次会议起了一个雄心勃勃的名字:"人工智能夏季研究项目"——
"人工智能"这个词就是在这里被正式提出的。
这个名称来区别于当时已有的"控制论"和"自动机理论",以此强调他们关注的是让机器表现出"智能行为",而不仅仅是自动化的信息处理。
会议的发起者们包括几位后来的大人物:
马文·明斯基,他后来成为MIT人工智能实验室的创始人,
克劳德·香农,信息论之父,
以及纳撒尼尔·罗切斯特,IBM的首席工程师。
还有一位关键人物,赫伯特·西蒙,这位未来的诺贝尔经济学奖得主和他的合作者艾伦·纽厄尔带来了一个名为"逻辑理论家"的程序,这个程序能够证明罗素和怀特海《数学原理》中的数学定理。
逻辑理论家是这个世界上第一个人工智能程序,它的存在向世人宣告:机器可以执行通常被认为是人类智力专属的任务了。
但达特茅斯会议在其召开之时算不上成功。当时与会者们并未就任何统一的理论框架达成一致,讨论松散而发散。不过显然,达特茅斯会议的历史意义还是无可估量的。它命名了一个领域,聚集了一群关键人物,播下了无数在未来几十年里生根发芽的种子。
更重要的是,它开启了一个被称为"人工智能黄金时代"的阶段,大约从1956年持续到1974年。
虽然当时达特茅斯会议的这群人没有讨论出一个结果,但却有一个共同的信念,那就是他们相信人类的智能可以被精确地描述,因此也就可以被机器模拟。他们当时乐观地认为也许一个夏天的时间,就能在一些关键问题上取得重大突破。
对于彼时的他们来说,这并不是盲目自大。而在那个时期,AI研究确实取得了一些令人瞩目的成果。
除了"逻辑理论家"的这样的程序外,当时的AI系统还能解代数应用题、下跳棋、证明几何定理。
当然,这个时候的AI就能“谈恋爱”了。
当时最著名的AI系统之一是约瑟夫·魏岑鲍姆在1964年至1966年间开发的ELIZA,这是一个模拟心理治疗师的对话程序。
ELIZA的运作原理在今天看来极其简单:它主要依靠模式匹配和模板替换来生成回应,比如当你提到"我妈妈"的时候,它会回应"告诉我更多关于你家庭的事情"。
但令魏岑鲍姆震惊和不安的是,使用者(包括他的秘书)很快就对ELIZA产生了情感依恋,坚持认为这个程序真正"理解"了他们。这个现象后来被称为"ELIZA效应",即人类倾向于将比实际更深的智能归因给表现出类人行为的系统。
这个发现既揭示了人机交互中深刻的心理学维度,也预示了半个世纪后大语言模型引发的情感争议。
但不管怎么说,AI的出现是让人激动的,因此政府和研究机构大量投入资金,媒体上充满了对智能机器人的美好想象。这个从五十年代末到七十年代初的时期,被称为AI的第一个黄金时代。
但热度退去,问题也在悄悄累积。
早期AI系统依赖的是"符号主义"的方法,即把世界简化为逻辑符号和规则,然后用搜索和推理来解决问题。
这种方法在处理定义清晰的、有限范围的问题时表现不错,但一旦面对现实世界的复杂性,就立刻捉襟见肘。
比如机器翻译。当时的研究者们认为,只要有足够大的双语词典和一套语法规则,就能实现高质量的翻译。但这显然是不可能的。
语言充满了模糊性、文化背景和上下文依赖——"The spirit is willing but the flesh is weak"(心有余而力不足 )如果先直译成俄语再译回来,会变成"The vodka is good but the meat is rotten"(伏特加不错,但肉烂了)。
这样的问题比比皆是,显然并不能正式投入到大规模的生产活动之中。
1973年,英国数学家詹姆斯·莱特希尔受政府委托发布了一份报告,严厉批评AI研究"在任何领域都没有产生它所承诺的重大影响"。这份报告直接导致了英国政府大幅削减AI研究经费,也正式宣布AI的第一个寒冬来临。
但冬天并不意味着死亡,而是蛰伏。
在八十年代,一种新的AI范式开始崛起:
专家系统。
它的思路是不要试图让机器具有通用智能,而是聚焦于非常具体的专业领域,把这个领域内专家的知识提炼成大量的"如果-那么"规则。
比如一个医疗诊断专家系统,可能包含几千条这样的规则:
如果病人有发烧和咳嗽的症状,那么可能是感冒;如果还伴有皮疹,那么可能是某种特定疾病......
这种系统在特定领域内确实取得了商业上的成功,比如DEC公司的XCON系统据说每年为公司节省了数千万美元。日本政府也因此雄心勃勃地启动了"第五代计算机"计划,投入巨资研发能够进行逻辑推理的智能计算机。
但好景不长,专家系统的致命弱点也逐渐暴露。
这种范式构建和维护规则库的成本极其高昂,系统一旦遇到规则库没有覆盖的情况就完全失效,且这种系统在处理不确定性和模糊信息时表现极差。
到了八十年代末九十年代初,专家系统的商业泡沫破灭,加上日本第五代计算机计划没有达到预期目标,AI进入了第二个冬天。
然而,就在符号主义AI陷入困境的同时,另一条研究路线却正在地下悄悄发展。
这条路线比较特殊,它不依赖于人类手工编写的规则,而是让机器从数据中自动学习规律。而这,就是我们之前提到的机器学习。
尤其是其中的神经网络方法。
事实上神经网络的概念其实很早就有了,早在1958年,弗兰克·罗森布拉特就发明了"感知机",那是一个非常简单的神经网络模型。
不过感知机的能力极其有限,甚至无法解决"异或"这样简单的逻辑问题。
1969年,马文·明斯基和西蒙·派珀特出版了一本名为《感知机》的书,从数学上证明了单层感知机的局限性,这几乎给神经网络研究判了死刑,导致了神经网络研究在后续的十几年里陷入了停滞——尽管他们知道多层网络能解决这个问题。
在这一阶段,少数研究者还是没有放弃继续研究,其中最著名的是杰弗里·辛顿。这位英国出生的认知心理学家坚信,大脑是通过多层神经网络工作的,那人工神经网络也应该是多层的。
只不过问题在于,多层神经网络的训练在当时没有有效的算法。直到1986年,辛顿和同事发表了一篇论文,重新推广了"反向传播"算法,它终于提供了一种有效训练多层网络的方法。
九十年代到新世纪初,机器学习在实用主义的道路上稳步前进。
比如IBM的深蓝在1997年击败了国际象棋世界冠军卡斯帕罗夫,这是AI历史上的一个标志性事件——尽管深蓝依赖的是海量搜索和专门设计的硬件,而不是现代意义上的"学习",但它向世界证明了机器可以在人类引以为傲的智力游戏中获胜。
在商业领域,数据挖掘、推荐系统、垃圾邮件过滤等基于统计机器学习的技术开始大规模应用。互联网的兴起贡献了海量数据,摩尔定律的推进持续降低了计算成本,这两个趋势为接下来更大的突破做好了铺垫。
进入新千年后,由数据驱动的机器学习方法在各种任务上不断取得进步,但人工智能作为一个领域,仍然在公众认知的边缘徘徊。
语言识别越来越好用,但仍然差强人意。
推荐系统,从亚马逊的商品推荐到Netflix的电影推荐——这些推荐系统在商业上大获成功,但它们更多被视为电子商务的基础设施,而非"人工智能"。
搜索引擎变得越来越智能,但人们往往不把它视为AI。
在这一阶段,人工智能的突破性时刻变成了平淡无奇的日常,它只是安静地从实验论文迁徙到生产线上然后再自然融入人们生活,以至于人们不再认为它是"人工智能"。而这种现象也有一个专门的名字——"AI效应",即每当我们解决了一个曾经被认为是需要"智能"才能完成的问题,我们就倾向于重新定义智能,把这个问题排除在智能的范围之外。
直到2012年,请记住这个时间,一个真正改变一切的事件发生了。
在那一年的大型视觉识别挑战赛(ILSVRC)上,辛顿和他的两个学生提交了一个叫AlexNet的深度卷积神经网络。
它的图像识别错误率比第二名低了近一半,这个结果在当时令整个计算机视觉界为之震动,从此它被誉为深度学习革命的开端。
AlexNet的成功并非源于某个单一的理论突破,而是几个关键要素的汇聚:
由李飞飞团队创建的ImageNet数据集提供了数百万张经过标注的图像,足够大的数据量使得训练深度网络成为可能;
NVIDIA的图形处理单元提供了强大的并行计算能力,使得训练一个拥有六千万参数的网络在时间上变得可行;
ReLU激活函数和Dropout正则化等训练技巧解决了深度网络中的梯度消失和过拟合问题。
这些要素的组合,加上辛顿团队对深度学习多年来的不懈坚持,终于在那个瞬间产生了质变。
AlexNet的成功像一声惊雷,唤醒了整个产业界,并且在接下来的几年里,深度学习几乎横扫了人工智能的每一个子领域。
Google意识到了这件事的商业价值,几乎是立刻出手,以4400万美元收购了辛顿创立的公司——这家公司只有三个人,没有产品,有的只是一篇论文和一套代码。
从此之后,深度学习不再是学术圈的小众兴趣,而成为了整个科技行业最炙手可热的技术方向。
之后的十年是深度学习高歌猛进的十年。
2014年,生成对抗网络(GAN)诞生,让机器可以生成以假乱真的图像。
2016年,DeepMind的AlphaGo击败了围棋世界冠军李世石,围棋曾经被认为是计算机最难攻克的人类智力堡垒,因为它的可能盘面数量比宇宙中的原子数还多。
2017年,Google的研究者在论文《Attention Is All You Need》中提出了Transformer架构,这篇论文用短短的八个字做标题,却开启了AI历史上最大的范式革命。
Transformer的注意力机制使得模型可以高效地处理长文本序列,而且天然适合在GPU上并行训练。这个架构成为了后来所有大语言模型的基础——从OpenAI的GPT系列,到Google的BERT和Gemini,到Anthropic的Claude,到所有的国产大模型,全部建立在Transformer的基础之上。
2018年,OpenAI发布了GPT-1,用了1.17亿参数。同年,谷歌发布了BERT,采用了双向Transformer编码器,在十一个自然语言处理基准测试上刷新了记录。
此后,模型规模的增长进入了一种近乎疯狂的时期:
2020年,GPT-3横空出世,参数膨胀到了1750亿,表现出了许多研究者没有预料到的"涌现能力"——模型不只是能续写文本,还能做翻译、写代码、答问题,这些能力并没有被明确地训练过。
2022年11月,ChatGPT发布,它将GPT-3.5包装成一个简洁的对话界面,两个月内用户突破1亿,成为历史上增长最快的消费产品。
从这一刻开始,AI不再是科技公司的专利,而是变成了每个人都可以触达的工具。
而2023年到2026年,AI则进入了加速迭代的新阶段。
OpenAI、Anthropic、Google、Meta之间的模型竞赛不断升温,模型的推理能力、多模态理解能力、编程能力都取得了飞跃式的进步。
与此同时,中国的大模型产业也迅速崛起——DeepSeek以极————————高的性价比和开源策略震动了全球市场(说实话,如果没有梁文峰,没有deepseek,这个时代绝对会变成一个我们不想要的局面)。
通义千问、GLM、豆包、Kimi等国产模型也在中文能力上展现了非常强劲的实力。更重要的是,AI开始从"会聊天的模型"进化成"会做事的智能体"。
与此同时,生成式AI在视觉和音频领域也取得了令人目不暇接的进展。扩散模型——Stable Diffusion、Midjourney、DALL-E——能够根据文本描述生成令人惊叹的图像;而2024年初OpenAI发布的Sora,则将扩散模型与Transformer架构结合,展示了从文本生成高度逼真视频的能力,其效果之逼真震撼了全球。如今多模态AI正在成为新的前沿........
AI Agent的诞生更是让模型能够自主地使用工具、规划任务、执行多步操作。2026年被Capgemini称为"AI的真相之年",标志着AI从概念验证走向规模化落地,从"能做demo"走向"能创造实际价值"......
一切正在发展,一切已走入未来。
回顾这段不到七十年的历史,最令人感慨的也许不是技术进步的绝对速度,而是我们从反复的希望与失望中获得的教训。
人工智能的历史不断地告诉我们:技术的发展几乎总是比乐观者预期的要慢,但又总是比悲观者敢于相信的要出人意料。
我们对AI的想象(无论是乌托邦式的还是世界末日式的)往往反映的是我们自身时代的焦虑和渴望,而非技术真实的发展轨迹。
然而,如果当前的趋势持续下去,如果大语言模型和生成式AI确实代表了通往更通用智能的一条可行路径,那么我们或许正在见证人类历史上最重要的技术变革之一,其影响力可能与印刷术、工业革命或互联网的发明相提并论。
无论未来如何展开,这段历史都还远远没有写完。而理解它从何而来,将帮助我们更清醒地思考它正在走向何方。
图灵在1950年的论文结尾曾写道:"我们只能看到前方很短的一段路,但我们可以看到有很多事情要做。"
今天,我想这段话依然适用。
互动讨论区
0 条记录No data in communication log.
从小白到入门的路线图
**在一本AI入门手册里,这一章可能是最特殊的一篇。** 前面十七章,我们从"什么是AI"讲到了全球产业格局,从机器学
AI时代的人才与职业
当人工智能从实验室里的论文走进每一个人的日常工作流,当一行自然语言就能生成可运行的程序,当一段语音描述就能产出一段堪比专
中国AI产业基础解读
在全球AI产业的棋盘上,中国毫无疑问是最值得深入观察的变量之一。 如果只看原创基础研究和技术突破的"首发"数量,中国与
全球AI产业格局:中美欧的角力
如果你在2022年底(也就是ChatGPT刚刚发布的那段时间)去参加任何一场科技行业的会议,你会发现所有人都在讨论同一个