大语言模型是什么?
大语言模型是什么?
如果说深度学习是AI的发动机,那么大语言模型(LLM,全称Large Language Model)就是这台发动机被装进了一辆精心设计的跑车之后,真正开上了高速公路。
这是重点。
大语言模型所代表的,不仅仅是技术上的一次迭代,更是人机交互方式的一次革命。
在人类历史的大部分时间里,我们与机器的沟通方式是高度"非人类" 的,你需要学习机器的语言,而不是机器来学习你的语言。你要会写代码、用命令行、操作按钮和菜单。
显然,这并不“以人为本”。
而大语言模型第一次让机器学会了人类的语言。
你可以用普通话、英语、日语,用正式的语气或随意的口吻,用完整的句子或破碎的短语,随便你怎么说,机器都能理解你的意图,并用同样自然的语言回应你。
而要理解大语言模型的工作原理,最好的入门方式是来做一个简单的小游戏。
你可以想象你正在玩一个"下一个词预测"的游戏。
我给你一句话的开头:"中国的首都是",然后请你猜下一个词。
你几乎是瞬间就能猜出"北京"。
现在改成:"小明今天早上起床晚了,他匆忙刷牙洗脸,然后抓起书包冲向",这时你的大脑开始同时评估多个可能性。
"学校?"、"公交站?"、"门口?"。
并在这些词与词之间权衡。
你之所以能做到这一点,是因为你的大脑在过去的阅读和生活经验中,内化了大量的语言统计规律和世界知识。
你知道中国的首都是北京,你知道上学通常在早上,你知道起床晚了之后的一般行为连锁反应。而大语言模型做的事情跟你刚才做的完全一样,只不过它的"阅读经验"是**整个互联网。
它几乎读过了人类在互联网上公开的所有文字!(众所周知,互联网上没有隐私,只是AI还没有榨干人类隐私)
通过对这些天文数字级别的文本进行"下一个词预测"的训练,模型学会了语言的模式、事实知识、推理链条、写作风格,以及隐含在文字背后的人类思维习惯。
当然,"下一个词预测"还需要一些补充才能帮助你全面理解它。
一个现代大语言模型的训练实际上经历了几个阶段。
第一阶段是预训练。
这个阶段的目标就是让模型学会"语言本身"。你给它看的是一段段的文本,训练的方式是"完形填空"或"下一个词预测"。这个阶段的数据量是天文数字的。GPT-3的预训练数据大约有45TB的文本,相当于几百万本书。
预训练完成后,你得到的模型叫"基础模型",它已经掌握了语言的规律和大量知识,但它有一个问题:它只会续写文本。
如果你问它"如何做西红柿炒鸡蛋",它可能会续写出一段像维基百科介绍一样的东西,也可能会续写出一个奇怪的对话,因为它没有被训练成"回答问题的助手",而是被训练成"续写文本的机器"。
这就进入了第二阶段——指令微调。
研究者在预训练好的模型基础上,用大量"问题-答案"对、按照人类指令格式组织的数据,来进一步训练模型,让它学会"理解并遵循指令"。
这个阶段教会了模型把用户的输入当作"指令"来对待,而不是当作要续写的文本。经过指令微调之后,你问"如何做西红柿炒鸡蛋",模型才开始输出一份正儿八经的菜谱,因为它学会了"当有人问如何做某事时,应该给出步骤化的解答"。
第三阶段是人类反馈强化学习,也就是RLHF。
这个阶段的目标是让模型的输出不仅在内容上正确,而且在风格上更符合人类偏好。比如更有用、更诚实、更无害....或者更偏激,更阴暗,没事儿回怼两句.......
这一阶段的具体做法是让人类评估员对模型的多个回答进行偏好评比,用这些偏好数据来训练模型朝着"更受欢迎的回答风格"优化。所以你在Boss直聘上也能看到有人在招聘相关职位。
也就是这个第三阶段让ChatGPT从一个在技术上很厉害但行为上经常出格的系统,变成了一个相对稳定、礼貌、有用的助手。
好了,在你了解这三个阶段之后,我们又要提到涌现了。
涌现,大模型的特性。
涌现的意思是,某些能力在模型规模较小的时候是观测不到的,但当参数规模和数据规模超过某个临界点之后,这些能力突然"冒"出来了。
比如GPT-2(15亿参数)并不会做数学推理,GPT-3(1750亿参数)就能做一些了,而GPT-4(据估计万亿级别)的推理能力有了质变。
同样,代码生成、多语言翻译、类比推理、笑话理解、逻辑谜题等能力,都是在足够大的规模下才浮现的。
那么这些能力是"学"来的还是"涌现"来的?
答案模棱两可。
模型的底层学习机制并没有变,一直是下一个词预测,但这些低层的统计学习,在足够大的规模下,似乎"相变"出了高层认知能力的雏形。
这个现象至今缺乏完美的理论解释,但它却是驱动全球科技公司疯狂追求"更大模型"的动力。
接下来说一说全球公司。
大语言模型的世界不是只有OpenAI一家。
过去几年一个繁荣且多元的模型生态已经形成,而且在开源领域尤其生机勃勃。
在闭源阵营,OpenAI的GPT系列依然占据着公众认知的高地,Anthropic的Claude系列在长文本理解和安全对齐方面走在前面,Google的Gemini在多模态能力上展现了巨大野心——谷歌在生态上一如既往狠发力。
在开源阵营,Meta的Llama系列持续迭代,吸引了全球开发者社区的注意力。但真正搅动全球格局的,是中国的DeepSeek。
DeepSeek-V3和V4系列采用MoE(混合专家)架构,在推理性能和效率之间找到了平衡点。
而所谓的MoE架构,就是不让模型的所有参数都参与每一次计算,而是将模型分成多个"专家"子网络,每次只激活其中一部分。
就像一家公司里有各领域的专家,处理法律问题时叫法律专家,处理技术问题时叫技术专家,不需要所有人都上。MoE让模型的总参数量可以非常巨大(从而拥有丰富的知识和能力),同时每次推理的实际计算量保持可控。
DeepSeek的另一个特点是便宜量大——它的API定价一度只有业界同行的几十分之一,直接拉低了全球大模型的使用门槛。
谁见过永久降价啊,一个V4 Pro永远2.5折的操作,让业内戏称梁文峰在A股里赚的钱全在AI里面还回来了。
属于是取之于民用之于民了。
而Deepseek的存在也迫使各大闭源模型升级的升级,降价的降价——毕竟全球的人民群众也不是傻子。
除了DeepSeek,中国的国产大模型阵营在2026年也已经非常丰富。
阿里的通义千问(Qwen)系列在开源社区也拥有很高的声誉,是Hugging Face上下载量最高的开源模型之一。智谱的GLM系列在中文理解和多模态方面有独到之处。
字节跳动的豆包背靠庞大的产品生态,用户规模庞大,在基层拥有一系列好评(比如带孩子)。
月之暗面的Kimi则在长文本处理上独树一帜,率先支持了百万Token级别的上下文,k2.6的存在更是令全球瞩目。
至于MiniMax则在一个相对低调的路径上默默打磨产品——总之,这些模型各有各的定位和优势,共同构成了一个非常有活力的中国大模型生态。
时至今日——尤其是2026年,当我们跟一个大语言模型对话时,真正让人兴奋的不仅在于它能"听懂"了,更在于它所带来的可能性。
在现在,一个有理解能力和生成能力的大语言模型,“真的”可以不再只是一个工具,而更像是一个可以对话的伙伴。
它能帮你梳理思维的脉络、组织零散的想法、提供不同视角的观点。这种伙伴式的互动,让人机协作上升到了一个新的层次。
而大语言模型的影响力之所以如此广泛,根源在于语言本身在人类文明中无可替代的位置。
从法律到文学、从科学研究到商业合同、从教育到社交,语言是人类社会最基础的"操作系统"。
而当一个技术能够真正理解和生成语言时,它对整个社会的渗透力就远远超过了一项普通工具的范畴。
当然,大语言模型远非完美。
幻觉问题(我们在第三章中提到过的"一本正经地胡说八道")依然是所有大语言模型共同面对的原生挑战。
对齐问题(如何确保模型的行为和人类的价值观一致)随着模型能力的增强也变得越来越紧迫。
推理的可靠性(模型有时能在复杂推理中表现出色,有时却会在简单的常识问题上犯低级错误),这种不一致性让人难以完全信任它。
还有成本问题。这是最重要的。
部署和维护一个千亿参数级别的模型对于中小企业和个人开发者来说仍然是一笔相当大的开销。
凡此种种,正是下一波AI技术创新正在攻坚的前沿。
但无论如何评价,大语言模型已经永远地改变了人类与计算机之间的关系,从现在开始,我们可以用自己最自然的语言,和这个星球上最强大的信息处理系统对话了。
互动讨论区
0 条记录No data in communication log.
从小白到入门的路线图
**在一本AI入门手册里,这一章可能是最特殊的一篇。** 前面十七章,我们从"什么是AI"讲到了全球产业格局,从机器学
AI时代的人才与职业
当人工智能从实验室里的论文走进每一个人的日常工作流,当一行自然语言就能生成可运行的程序,当一段语音描述就能产出一段堪比专
中国AI产业基础解读
在全球AI产业的棋盘上,中国毫无疑问是最值得深入观察的变量之一。 如果只看原创基础研究和技术突破的"首发"数量,中国与
全球AI产业格局:中美欧的角力
如果你在2022年底(也就是ChatGPT刚刚发布的那段时间)去参加任何一场科技行业的会议,你会发现所有人都在讨论同一个