AI基础设施:算力、芯片与数据的"三国演义"
AI基础设施:算力、芯片与数据的"三国演义"
在前面几章中,我们聊了算法、模型、应用。但你有没有发现一个贯穿始终但一直隐在幕后的东西?
那就是训练一个大模型,始终需要巨大的计算量。
GPT-4级别的模型训练一次的电费据说高达数千万美元。运行这些模型来服务全球的亿级用户,需要的服务器规模足以媲美一个中小型城市的用电量。
那些精美的AI生成图像、流畅的Agent对话、毫秒级的语音识别,背后都有庞大的物理基础设施在默默支撑。这也就是为什么说中美AI战背后的本质是比拼国家基建实力。
这一章,我们来揭开AI基础设施的面纱,理解算力、芯片和数据这三股力量如何共同构成了AI世界的存在支柱。
我们先聊算力。
在AI的世界里,算力就是"生产力"。就像工业时代衡量一个国家的工业能力要看它的钢铁产量和发电量一样,在AI时代,一个国家在AI上的竞争力,首先体现在它拥有多少算力、能以多快的速度新增算力。
算力的基本单位是"浮点运算次数"——也就是计算机一秒钟能做多少次小数运算。你不要被这个定义吓到,重要的是理解量级。
训练一个大语言模型需要的算力,通常以"百亿亿次"来计。这个量级大到什么程度呢?如果让一台普通的笔记本电脑来训练GPT-3,根据估算,大概需要几百年——或者等鸡吃完了米,等狗舔完了面,火烧断了锁。
而现实中的训练是在成千上万张GPU组成的集群上完成的,需要大概几周甚至几个月的时间。
那么问题来了:为什么是GPU而不是我们更熟悉的CPU来做这件事?
这是因为这两种芯片的设计哲学完全不同。
CPU(中央处理器)是为"通用计算"设计的,它什么都能做,但单次操作的能力有限,就像一个有十八般武艺但一次只能做一件事的手艺人。CPU擅长处理逻辑复杂、分支繁多的串行任务。
而GPU(图形处理器)最初是为了游戏渲染而生的。我想玩游戏的人一定或多或少对GPU有一定的了解。
而渲染一个3D游戏场景需要同时对几百万个像素做几乎相同的数学运算。为了满足这种需求,GPU被设计成有几千个简单的小计算核心,能够同时处理大量并行任务。这就像一条流水线上有几千个低级工匠,每个人只做一件简单的事,但几千个人一起做,效率就极其惊人。
深度学习的核心计算“矩阵乘法”恰好就可以完美地利用GPU的这种并行架构。
把两个大矩阵相乘,可以拆成无数个小乘法同时进行,GPU几千个核心一起上,速度比CPU快几十到几百倍。这个看似偶然的"缘分"成为了本轮AI浪潮最重要的技术前提之一。
而说到GPU,就不能不说NVIDIA和它的CUDA生态。
NVIDIA公司成立于1993年,最初就是做游戏显卡的。
2006年,NVIDIA推出了CUDA(统一计算设备架构),这是一个让开发者可以在GPU上做通用计算的编程平台。CUDA的意义远不止于"让GPU能算矩阵"——它提供了一整套开发工具、库、调试器和优化工具,让几十万、上百万的开发者学会了用NVIDIA的"语言"来编程。
这十多年的积累,形成了一个极强的正反馈循环。因为用NVIDIA的人多,所以更多的教程、论文、开源项目都基于NVIDIA;因为生态丰富,更多开发者选择NVIDIA;因为开发者多,NVIDIA有更多的需求反馈和生态投入。
这个护城河的深度,远远超过了单纯的硬件性能指标。
到今天,NVIDIA在全球AI训练加速市场的份额超过百分之九十,它的GPU成了AI时代的"数字石油"。
这也是为什么美国要芯片出口管制,首先瞄准的就是高端NVIDIA GPU对华销售。他们知道,卡住了高端GPU,就卡住了大模型训练的根本。
但压力也催生了变革。
在美国的芯片管制之下,中国加速了国产AI芯片的研发和替代进程。
华为的昇腾系列AI处理器是国产AI芯片中最具代表性的产品,其最新的昇腾910B在硬件性能上已经接近国际主流水平。
寒武纪、天数智芯、壁仞科技、燧原科技等一批国产AI芯片企业也在奋起直追。
但正如我们刚才说的,芯片的竞争不只是硬件的竞争,更是生态的竞争。
一个国产芯片即使算力指标很好看,但如果开发者需要重新学习一套完全不同的编程框架,如果已有的模型不能方便地迁移过来,如果常见的深度学习框架不支持它,那么市场接受度就会大打折扣。
而这也是中国算力自主化面临的核心困境之一。"替代CUDA"某种程度上来说要比"做出高性能芯片"更难。
而对于这个问题,国内选择多管齐下:
一方面,华为通过CANN计算架构和昇思MindSpore框架来构建自己的软件生态;另一方面,一批做"兼容CUDA"方案的公司在帮助开发者用最小的改动把NVIDIA上的代码迁移到国产芯片上;此外,国家层面在推进AI框架和算力的标准化工作,减少碎片化。
支撑大规模AI训练和推理的,不只是散落在各地的GPU服务器,还有"智算中心",这个词我们之前也有所提及,即专门为AI计算建设的大型数据中心。
一个智算中心里可能部署着几万张GPU,它们通过网络高速互联,形成一个超大规模的计算集群。智算中心的建设和运营成本极其高昂,电力消耗、散热需求、网络架构、运维管理都是巨大的挑战。但也正因为如此,智算中心正在成为国家级的战略基础设施。
到2026年,中国已经建成42个万卡智算集群,智能算力规模达到每秒1882百亿亿次浮点运算,位居全球前列。“十五五”时期,我国新型电网的投资更是将超过5万亿元,带动上下游总规模超10万亿元,与新型电网相关的基建投资,可直接创造就业岗位超过百万。
可见国家在此方面投资力度之大。
这些算力不只是被大公司用来训练基础模型,也正在通过云服务的方式向中小企业甚至个人开发者提供,你或许买不起一张GPU,但你可以花几十块钱租用一个小时的云端GPU来训练你自己的小模型。这种算力普惠化的趋势,正在大大降低AI创新的门槛。
说完了算力和芯片,我们来看看“数据”。
如果说算力是AI的"发动机",那么数据就是AI的"汽油"。没有数据,再大的算力也训练不出有用的模型。
大语言模型之所以能达到现在的水平,很大程度上是因为它"读过"了几乎整个互联网——所有公开的网页、书籍、论文、代码、对话记录。预训练数据的规模通常以TB(太字节)来计,GPT-3的训练数据大约是45TB的文本。如果把45TB的纯文本打印成书,大约需要两亿五千万本中等厚度的书,排起来能绕地球好几圈。
但"数据"不只是"量大就行"。数据的质量、多样性、新鲜度同样至关重要。
低质量的数据,也就是充满错误、重复、垃圾信息的文本,不仅不会让模型变好,反而会让模型学偏。
数据的多样性不够,模型就可能在某些领域或人群上表现很差。
数据不够新鲜,模型就会"过时"。
高质量数据集的构建是一个极其费力的工作,需要大量的清洗、标注、校对。到2026年,中国全国高质量数据集已经超过10万个,总量超过890PB(拍字节),相当于中国国家图书馆数字资源总量的310倍。
这些高质量数据集覆盖了制造、医疗、金融、法律、教育等各个专业领域,为行业大模型的训练提供了关键的基础资源。
未来有个值得关注的方向是合成数据的兴起。
所谓合成数据,就是用AI来生成训练AI用的数据。
比如用一个强大的模型来生成问答对,然后用这些问答对来训练一个更小的、更聚焦的模型。或者用生成式AI来创建虚拟的医疗影像、自动驾驶训练场景。
合成数据的优势在于成本,人工标注数据既贵又慢,而合成数据却可以快速、大量、低成本地生产。
而它的另外一个优势在于可以规避隐私问题,毕竟真实用户数据涉及隐私保护,而合成数据不涉及真实个人。
但合成数据也有风险:
如果生成数据的"老师模型"本身有偏见或局限,那这些偏见会被"蒸馏"到"学生模型"中;合成数据还可能导致模型输出变得"模式化",因为训练数据本身就是AI生成的,缺乏真实世界的那种多样性和不可预测性。
关于合成数据的利弊,业界内的争论还是很激烈的,但在某些数据稀缺或隐私敏感的领域,合成数据确实提供了一种非常实用的解决方案。
最后,我们来谈谈一个正在改变算力格局的方向:边缘AI。
到目前为止,我们讨论的AI推理都是在云端大型服务器上完成的。
你的手机把语音指令上传到云端,云端的GPU跑完模型推理,然后把结果传回你的手机。但这种模式有几个问题:
一是延迟(网络传输需要时间),二是隐私(你的数据离开了你的设备),三是离线不可用。
但边缘AI的思路正好相反,这种形式把AI模型直接部署在你的设备(手机、汽车、智能家居、工业传感器)上,在本地完成推理。
这听起来有点不切实际,但技术发展却正在使其成为可能。
一方面,模型压缩技术(如量化、剪枝、知识蒸馏)可以大幅降低模型的大小和计算需求,同时把性能损失控制在可接受范围。
另一方面,手机芯片厂商(苹果的A系列和M系列、高通的骁龙、华为的麒麟)都在芯片中集成了专门的AI加速单元(NPU,神经网络处理单元),让手机能在低功耗下高效运行AI推理。
到2026年,在旗舰手机上本地运行十亿到几十亿参数级别的小语言模型已经成为现实,这些模型可以做实时翻译、照片智能处理、语音助手、文字润色等任务,而且完全不需要联网。
在汽车领域,自动驾驶系统需要在毫秒级别内做出决策,这让边缘AI在该领域变得不可或缺。而边缘AI的崛起意味着AI的计算版图正在从"完全中央集权"走向"云端和终端协同"。比如大型复杂任务在云端完成,低延迟、隐私敏感的轻量任务在终端完成,两者各司其职。
算力、芯片、数据,这三者是AI这座大厦的地基和支柱。地基打得多深,决定了大厦能盖多高。当前全球AI竞争的表层是比拼谁的大模型更强、谁的应用更广,但深层竞争的焦点正在下沉到基础设施层面,谁的算力更充沛、谁的芯片更自主、谁的数据更优质。
理解了这一点,你就能理解为什么中国在大力建设智算中心、推动国产芯片研发、构建高质量数据集。因为在这场智能竞赛中,基础设施的比拼,将最终决定你能跑多远。
互动讨论区
0 条记录No data in communication log.
从小白到入门的路线图
**在一本AI入门手册里,这一章可能是最特殊的一篇。** 前面十七章,我们从"什么是AI"讲到了全球产业格局,从机器学
AI时代的人才与职业
当人工智能从实验室里的论文走进每一个人的日常工作流,当一行自然语言就能生成可运行的程序,当一段语音描述就能产出一段堪比专
中国AI产业基础解读
在全球AI产业的棋盘上,中国毫无疑问是最值得深入观察的变量之一。 如果只看原创基础研究和技术突破的"首发"数量,中国与
全球AI产业格局:中美欧的角力
如果你在2022年底(也就是ChatGPT刚刚发布的那段时间)去参加任何一场科技行业的会议,你会发现所有人都在讨论同一个