AI世界的语言:从零开始的AI“黑话”
AI世界的语言:从零开始的AI“黑话”
每一个领域都有自己的语言。
当你走进一个陌生的圈子时,最先让你感到格格不入的往往不是你不知道什么,而是你听不懂别人在说什么。
AI领域尤其严重!
什么大语言模型、深度学习、参数、Token、Transformer、强化学习、对齐、幻觉……这些词仿佛构成了一套只有圈内人才能听懂的密码,让外部的观察者望而生畏,俨然已经成了新时代春典。
这个行业以制造新词汇的速度闻名,每天都有新的缩写、新的术语、新的黑话从论文和社交媒体中涌出来。
今天你还可以说自己已经了解AI,明天你将两眼一黑——是的,一切都是因为AI这可怕的发展速度。
尽管对此我怨念颇深,但事实上,这些名词背后的思想并不像它们看起来那么难以接近。
如果你愿意花一些耐心,一个一个地拆开来看,你会发现它们大多是对一些相当朴素的思想的精确命名。
这一章,我们来一次系统而基础的"AI语言扫盲"。让你在理解它们之间关联的同时,自然地掌握它们的含义。
让我们从最外围、也是最常被混淆的一组概念开始(我们之前已经提过,但不妨再复习一遍)。
当人们谈论"AI"的时候,他们可能指的是三件完全不同的事情。
人工智能,也就是AI,是最宽泛的伞形概念,它涵盖了一切试图让机器展现出智能行为的技术和尝试,从最简单的计算器到最复杂的大语言模型,都在这个范畴之内。
而机器学习,则是人工智能的一个子集,它指的是一种特定的实现智能的方法:不通过手工编写规则,而是通过让计算机从数据中自动发现模式和规律。换句话说,所有的机器学习都属于人工智能,但并非所有的人工智能都采用了机器学习——比如早期基于专家规则的国际象棋程序。
接下来,深度学习又是机器学习的一个子集,它的特征是使用多层的、通常非常深的神经网络来学习数据的层次化表示。而今天占据头条的大语言模型,又是深度学习的一个特定应用方向。
这个嵌套关系——AI包含机器学习,机器学习包含深度学习,深度学习包含大语言模型——看似简单,但实际上,在日常讨论中,人们经常随意地互换这些词汇,把一个深度学习模型就称为"AI",或者把大语言模型就叫做"深度学习"。了解它们之间的精确关系,是了解人工智能的第一步。
接下来的一个重要概念是模型。
是的,很多人并不明白自己嘴里说的“模型”到底是什么玩意。
在人工智能的语境中,"模型"这个词被使用的频率之高,几乎与"AI"本身相当。
那么,究竟什么是模型?
在最根本的层面上,模型就是一个函数。这是一个接受输入并产生输出的数学映射。
训练数据是模型的教材,训练过程是模型从教材中学习规律的阶段。当训练完成后,我们得到的模型文件本质上是一组庞大得惊人的数字,也就是参数。每个参数都是一个数值,代表神经网络中两个节点之间的连接权重。在学习之前,这些数字是随机的。在学习过程中,算法反复调整这些数值以减少模型的预测误差。最终学到的这组数值(有时高达数千亿甚至上万亿个)就是模型应对特定任务的核心资产。这个核心资产凝聚了训练数据的内部规律,使模型在收到从未见过的新问题时,也能给出合理的回应。
这就是为什么这些模型被视为宝贵的知识产权:
训练它们需要巨大的计算资源和精心策划的数据,而一旦训练完成,得到的那组参数就成为了无价之宝。
如果以上这段内容你听不懂,那么我们不妨更简单一些。
一个AI模型就是一个"函数"——给它输入,它计算输出。
一个图像识别模型,输入是一张图片的像素值,输出是"这是猫"或"这是狗"的概率。
一个大语言模型,输入是一段文本,输出是接下来最可能出现的词语。
模型能学会这个映射关系,在于"训练"这个过程。
训练的本质是让模型反复地看标注好的例子上(浏览器的各种图片验证就是在让用户训练数据),然后不断调整自己的参数,使得它的输出越来越接近正确答案。
每一次调整参数,模型都会计算当前输出和正确答案之间的差距,这个差距用一个"损失函数"来量化。
然后通过"梯度下降"这个优化算法,模型找到降低损失的方向,把参数往那个方向微调一点。
这个过程重复几百万次、几十亿次,模型的参数就逐渐从一堆随机数变成了一套能够捕捉数据内部规律的精密配置。
这个过程就像是让一个孩子看了几百万张标注了"猫"或者"狗"的照片,看了无数次之后,他自然就知道了猫和狗的区别。
那么参数是什么?
你可以把它理解成模型中无数个可以被调节的旋钮。
一个现代大语言模型有数千亿甚至上万亿个这样的旋钮,正是这么庞大的旋钮数量,让它能够捕捉语言中极其微妙的规律。
模型训练完成后,真正投入使用的时候叫做"推理"——这个阶段的模型不再更新参数,只是根据输入进行计算并给出输出。
好,现在理解了模型、训练、推理、参数这些基础概念后,我们再来看一组与大语言模型密切相关的术语,因为大语言模型(LLM) 是当前AI浪潮中绝对的主角。
LLM中的第一个L代表"大"。
LLM,Large Language Model。
有多大?
GPT-3有1750亿个参数,GPT-4的参数量没有公开但据估计超过万亿级别,DeepSeek-V4采用了MoE(混合专家)架构,总参数量巨大但每次推理只激活其中一部分。
LLM中的第二个L代表“语言”。
那么"语言"是什么意思?
LLM处理的对象是自然语言——就是我们日常使用的英语、中文、日语等等。
它之所以叫"语言模型",因为它的核心任务看似极其简单:预测一句话中下一个词是什么。这个任务在学术界被称为"下一个Token预测"(Next-token Prediction)。
但你千万不要因为任务简单就小看它。
想象一下,如果你能做到在任何上下文中都完美地预测下一个词,那你必然已经深刻地理解了语言的结构、世界的知识、逻辑推理的规则。
比如当你读到"太阳从东边升",模型要预测下一个词——如果它知道地球自转的方向,它就会预测"起";如果它还知道这可能是诗句,它可能会预测"起"或者"落"取决于上下文。
这种"预测下一个词"的能力,在规模大到一定程度之后,就会神奇地衍生出了翻译、写作、推理、编程等一系列看似完全不同的能力,而这就是所谓的"涌现"。
Token(2026年3月23日,在中国发展高层在“中国发展高层论坛2026年年会”上,国家数据局局长刘烈宏正式将 Token 的中文名称定为“词元”), 这个词需要特别解释一下。
Token是大语言模型理解和生成文本的最小单位,它不一定是完整的单词。
在英文中,一个Token大约相当于0.75个单词;"apple"可能是一个Token,"apples"可能会被拆成"apple"和"s"两个Token。
一个汉字通常是一个或两个Token。
*补充知识:
*之所以会出现这种情况,是因为英文采用的是子词分词法(Subword Tokenization),其中最常用的是 BPE(Byte Pair Encoding,字节对编码) 算法。英语由 26 个字母加空格组成,常用单词(如 the, is, and)在语料中出现频率极高,分词器会将它们整合成一个独立的Token。而遇到不常见的长单词或衍生词时,算法会将其拆分为前缀、词根或后缀。例如,tokenization 可能会被拆分为 token 和 ization 两个 Token。在大规模英文语料中,经过这种“高频整词、低频拆分”的算法处理后,平均下来 100 个英文单词会被切分成大约 133 个 Token。反过来计算,就是 1 个 Token 约等于 0.75 个单词(或者说 1 个英文单词平均占用 1.33 个 Token)。
*那为什么一个汉字通常是1到2个Token呢?
*这里需要将 早期/国际大模型(如早期 OpenAI) 与 现代/国产大模型 分开来看。
*在 OpenAI Help Center等早期海外模型的标准中,确实会出现 “一个汉字等于 1~2 个 Token”(甚至更多)的现象,原因主要是因为三个方面。
*一是底层字节的消耗(UTF-8 编码): 计算机底层使用字节(Byte)存储字符。英文字母只占 1 个字节,而一个汉字通常占用 3 个字节。
*二是词表里的“汉语盲区”: 早期海外模型的词表(Vocabulary)主要针对英文设计,词表里存放的几乎全是不完整的英文片段和高频英文单词。当这种分词器遇到汉字时,由于词表里找不到对应的中文词汇,它只能被迫退化到最底层的字节级别去切分。一个汉字的 3 个字节可能会被拆成 2 个或 3 个 Token 来表达。这就导致了中文在海外模型中的 “Token 税”,即输入同样意思的话,中文比英文要贵得多。
*但现在的,1 个 Token 可以等于 1.5 到 2 个汉字
*对于现代大模型(特别是专门针对中文优化的国内大模型,如阿里通义千问、DeepSeek等),这个情况已经有了很大的改善。现代模型的词表扩充到了 10 万甚至 15 万以上,里面直接塞满了大量的常用汉字、双字词、四字成语 此时分词器看到“人工智能”,可以直接把它识别为 1 个 Token(而不是按字或字节拆开)。因此现在的中文高效分词器下,1 个 Token 通常可以代表 1.5 到 2 个汉字
我们常说的,一个模型的"上下文窗口",就是指的是它一次能处理多少个Token。早期的模型只能处理几千个,而现在Claude和Gemini都能处理百万Token,这意味着你可以把一整部《战争与和平》扔给它让它分析。
理解了Token,你就能理解为什么AI服务通常按Token计费,以及为什么长对话进行到一定程度时模型会"忘记"之前说过的话——因为超出了上下文窗口的限制。
接下来我们需要走进模型内部,理解让它如此强大的核心架构。
几乎当今所有的大语言模型都建立在一个叫做Transformer的架构之上(我们在上一章中已经有所提及)。
Transformer是Google的团队在2017年提出的,那篇经典论文的标题就叫做《Attention Is All You Need》——注意力是你所需要的一切。
Attention(注意力机制) 是Transformer的灵魂所在。
你可以这样理解注意力机制:当你读"小明把苹果递给小红,她咬了一口"这句话时,你自然地知道"她"指的是小红而不是小明,这是因为你的大脑在理解"她"这个词的时候,对前文中不同的候选对象分配了不同的"注意力权重"——"小红"获得了最高的注意力,所以"她"指代的是小红。这是一种理解上的“重音”。
Transformer的注意力机制做的正是这件事,只不过它是在高维向量空间中用矩阵运算来完成的。
它能同时计算文本中每一个词和其他所有词之间的关联强度,这使得模型能够捕捉长距离的依赖关系。即使两个相关的词相隔几百个Token,注意力机制也能把它们关联起来。
在Transformer诞生之前,处理序列数据主要依赖RNN(循环神经网络)和LSTM(长短期记忆网络),这些架构必须一个词一个词地按顺序处理,不仅速度慢,而且在处理长文本时效果急剧下降。Transformer的关键优势之一就在于它彻底去掉了顺序依赖,使得整个序列可以并行处理,为在GPU上进行大规模训练打开了大门。
可以说,没有Transformer就没有GPT,也就没有我们今天的AI时代。
除了模型架构本身,另外一组必须了解的概念是关于模型训练和优化的。
如果你听到有人在讨论"预训练"和"微调",这是在说大模型训练的两个阶段。
预训练是在海量的、通常是未标注的文本数据上进行的,这个阶段模型学习的是语言的统计规律和世界知识——就像是一个广泛阅读了大量书籍但没有专门训练任何技能的人。
微调则是在预训练完成之后,在一个更小、更专业、标注更精细的数据集上进行的额外训练,目的是让模型在某个特定任务或领域表现得更好。就像是在广泛阅读的基础上,花了一段时间专门学习法律文书写作。所以不少人会选择对开源模型进行微调,以便做出专属模型。
还有一个经常被提到的复杂概念是RLHF,即基于人类反馈的强化学习。
它的工作方式是,先预训练一个语言模型 (LM),然后让人类评估者对模型的多个输出进行偏好排序,然后用这些偏好数据来训练一个奖励模型 (Reward Model,RM) ,最后用强化学习(RL) 的方式微调语言模型(LM),让它朝着更符合人类偏好的方向优化。
ChatGPT之所以比GPT-3更"好用"、更"听话"、更不容易胡说八道,很大程度上就是RLHF的功劳。
而在大语言模型之上,出现了几个重要的产品化概念——也是我们在实际使用AI时会频繁遇到的概念。
排在首位的无疑是Prompt(提示词)。
在传统软件中,你用按钮、菜单、命令行来和计算机交互。在AI时代,Prompt就是你的交互界面,也就是它就是你输入给AI模型的那段文字,用来告诉模型你想要什么。
Prompt可以是一个简单的问题("北京到上海的飞行距离是多少"),也可以是一段精心设计的指令("你现在是一位资深的品牌营销顾问,请帮我为一个新上市的智能手表写三版推广文案,每版不超过100字,第一版走温情路线,第二版走科技硬核风,第三版走幽默风格")。
Prompt的质量直接影响模型输出的质量,同一个模型,对于稍有不同的提问方式可能产生质量差异巨大的回答。好的提示包括清晰的指令、必要的背景信息、输出格式的要求,甚至有时包括示范样例。
提示工程师这个岗位因此应运而生,不过也有很多人认为提示工程的技巧会随着模型本身对指令理解能力的提升而逐渐失去必要性。
另外一个可以了解一下的概念是检索增强生成,通常缩写为RAG,则是指将大语言模型与一个外部知识库(比如公司的内部文档、某个专业的文献库)连接的架构:当用户提问时,系统首先将问题在知识库中进行搜索,找出最相关的文档片段,然后将这些片段连同问题一起送入语言模型,要求模型基于这些可靠的外部信息来生成答案。
RAG的价值在于赋予模型接入最新知识或私有知识的能力,从而在一定程度上弥补模型训练数据时间滞后和领域偏向的不足,并减少模型不懂装懂的幻觉风险。
"幻觉",这是大语言模型最令人头疼的问题之一。
幻觉是指模型自信地输出了一个看起来合理但实际上完全错误的内容,比如它会编造一个不存在的论文引用、虚构一个历史事件、或者把两个不同的人的信息混淆在一起。
而幻觉的产生有很多原因:训练数据中本身就包含错误信息,模型的学习方式是统计性的而不是事实性的,推理时的随机采样机制等等等等等等。
但说一千道一万,这个问题的本质在于大语言模型的核心是“预测下一个词“,而不是验证事实。
训练数据中,关于事实陈述和虚构故事的语法模式往往是相同的,模型没有被赋予区分"符合语言模式的表述"和"符合事实的表述"的固有能力。
而当模型遇到一个它没有足够信息来准确回答的提问时,它不会简单地回答"我不知道",因为在不计其数的训练样本中,"我不知道"的序列往往不会有下一句话或者下一个字产生,而那些编造细节的序列确实是"正常出现"的文本,于是模型倾向于生成最"语言上合理"的序列,而这一序列就很可能恰好与事实不符。
减少幻觉是目前AI研究中最核心的课题之一,大家都在寻找各种解决策略:从RAG式的检索增强,到为模型引入事实核查和自我反思的机制,再到训练数据的精心净化,但是究竟能不能找到解决方法,这个再议。
最后,当我们的视线从单个模型转向整个AI产业时,有几个区分必须掌握。了解它们在当下的中国还是比较重要的。
首先是开源模型与闭源模型的区别。
闭源模型指的是模型背后的权重参数不对公众开放,用户只能通过官方提供的API或应用界面来使用,比如OpenAI的GPT-4、Anthropic的Claude、谷歌的Gemini。闭源的好处是服务商可以进行严格的安全控制、持续的性能优化和稳定的商业变现。
开源模型则是将模型权重公开,任何人都可以下载、在自己的硬件上运行、进行微调和二次开发,比如Meta的Llama系列、Mistral系列以及中国的Qwen(通义千问开源系列)、DeepSeek等。开源模型的优势包括更强的可审计性。研究者可以检查模型的安全性和偏见,以及拥有更大的灵活性和自主权,企业可以在自己的服务器上部署而无需依赖外部API,这对于数据敏感的行业尤为重要。
在开源和闭源之间还存在一个灰色地带——有些模型使用"开放权重"的许可,允许研究用途但限制商业用途;有些模型则使用对公众开放的API但不提供模型下载。
这场开闭源之争,是当前AI产业中最活跃的议题之一,因为它同时涉及技术、商业、安全和治理层面。
比如DeepSeek在2024年底到2025年以开源策略和高性价比震动了全球AI市场,被认为是中国AI"开源创新"路线的标志性事件——事实上如果没有deepseek这些开源模型的强势压力,AI将彻底变成资本的玩物。
智算中心是中国语境下频繁出现的一个词,它指的是专门为AI计算建设的大型数据中心,里面装备着大量的GPU服务器,为企业和研究机构提供算力服务。
在算力被美国限制出口的背景下,中国加速了智算中心的建设,到2026年已经建成了42个万卡集群,智能算力规模位居全球前列。
但AI芯片是另一个卡脖子的问题,大家或多或少听说过芯片战这件事。
目前全球AI训练和推理主要依赖NVIDIA的GPU,NVIDIA通过其CUDA软件生态建立起了极其牢固的护城河。中国的华为昇腾、寒武纪、天数智芯等企业正在奋力追赶,在硬件指标上已经逐渐逼近国际主流水平,但软件生态的迁移是一个相当长期、复杂的挑战。
至于2026年的另一个高频词——AI Agent(智能体),我们将单独另讲。
以上这些核心概念覆盖了从基础原理到产业生态的各个层面。它不是全部,你也不必一次全部记住,事实上没有人能一次记住,这只是一个说明手册罢了。
在阅读后续章节的过程中,当遇到不熟悉的术语时就回到这一章来查找。
随着时间的推移,这些概念会从陌生的"行话"变成你思考问题时自然而然使用的语言——到那个时候,你就真正跨入了AI世界的门槛。
互动讨论区
0 条记录No data in communication log.
从小白到入门的路线图
**在一本AI入门手册里,这一章可能是最特殊的一篇。** 前面十七章,我们从"什么是AI"讲到了全球产业格局,从机器学
AI时代的人才与职业
当人工智能从实验室里的论文走进每一个人的日常工作流,当一行自然语言就能生成可运行的程序,当一段语音描述就能产出一段堪比专
中国AI产业基础解读
在全球AI产业的棋盘上,中国毫无疑问是最值得深入观察的变量之一。 如果只看原创基础研究和技术突破的"首发"数量,中国与
全球AI产业格局:中美欧的角力
如果你在2022年底(也就是ChatGPT刚刚发布的那段时间)去参加任何一场科技行业的会议,你会发现所有人都在讨论同一个