你有没有用过手机输入法?你打出一个字的开头,它能帮你猜出下一个字、下一个词,甚至一整句话。比如你打出“今天天”,它会猜“气真好”。
LLM(大语言模型),本质上就是一个被“喂”了海量人类文字(几乎整个互联网的书籍、网页、对话)后,练就了“超级接话能力”的巨型程序。你现在熟悉的 ChatGPT、文心一言、Kimi 等,底层都是 LLM。
你可以从这三个层面来轻松理解它:
它到底是什么?(“读过万卷书的文字大师”)
想象你身边有一个朋友,他这辈子什么也不干,就是疯狂读书——读完了全世界的维基百科、几百万册图书、所有新闻网站和论坛帖子。读完之后,他虽然不像人类那样真正“理解”世界的物理规则,但他掌握了一个超能力:根据你给的上文,预测出最合理、最通顺的下文。你问他“怎么煮鸡蛋?”,他凭借读过的所有菜谱,能像模像样地把步骤给你“背”出来。它不是真的去厨房煮了鸡蛋,而是把人类写过的答案,用最自然的方式重组给你。
它是怎么工作的?(“超级自动补全”,不是“搜索引擎”)
很多人误以为 LLM 像个数据库,你问它问题,它就去“查找”标准答案。其实不是的!它的工作方式更像是极度高级的“自动补全”。
当你输入“1+1=?”时,它不是在抄答案,而是基于它学过的万亿个文本片段,一个字一个字地“猜”最应该接下去的词:先猜“2”,再猜“。”。这背后依赖极其复杂的数学计算和“Transformer”神经网络架构(你可以把它想象成一张巨大的、有几千亿个节点的“关系网”),让它能关注到你问题里的每一个字,并找出字与字之间深层的逻辑关联。
它凭什么这么“聪明”?(“规模”就是王道)
LLM 中的“大”(Large)体现在两个方面: 参数量巨大:它大脑里的“神经元”连接数,高达几千亿甚至上万亿(比如 GPT-4)。参数越多,它的“记忆力”和“推理链条”就越复杂。数据量巨大:它学习的文本,总量超过人类历史上所有纸质书籍的总和。正因如此,它才涌现出一些令人惊喜的能力,比如上下文学习(你举几个例子,它就能照猫画虎)和思维链(让它“一步一步想”,它能解出复杂的数学逻辑题)。
它有什么“硬伤”?(“博学”不等于“全知”)
会“一本正经地胡说八道”:科学家称之为“幻觉”。因为它只在乎文字通不通顺,而不在乎事实真不真。如果它读过的资料里有错误,或者它“猜”偏了,它会用极其自信的语气编造出一个虚假信息。没有“常识”和“身体体验”:它不知道“烫”是什么感觉,也不懂“饥饿”。它只是在玩弄文字符号。知识有时效性:它的知识截止于它的训练时间(比如 2023 年),对于最新的实时信息,它需要联网搜索工具来辅助。
LLM 是 AI 领域的一次“语言革命”,它让机器第一次能用人类最自然的方式和我们流畅对话,虽然它本质上只是个“读过万卷书、但从未行过万里路”的超级文字接龙大师。
评论