AI技术通识

大模型是怎么工作的?token、预训练、对齐一次讲清

91学AI·2026/8/14·7 阅读

token:大模型的计量单位

模型读的不是字也不是词,是 token,可以理解成切碎后的文本片段。英文大概一个单词一个 token 出头,中文的经验值是:GPT 系列一个字 1 到 1.5 个 token,国产模型对中文做了优化,大概一个字 0.6 到 1 个 token。

PM 为什么要关心这个?因为计费、限速、上下文长度全按 token 算。你看到的「128K 上下文」指的是一次对话能塞进去的 token 总量,输入输出都算在内。Kimi 当年靠长上下文出圈,主打的 200 万字说的就是这个窗口。做产品方案时,把一份 50 页文档塞进对话要花多少钱、会不会顶爆窗口,都是 token 账。

粗略算笔账:一次客服问答,输入输出加起来几百到一两千 token,按主流 API 的刊例价,单次调用成本在几厘到几分钱人民币。看着便宜,乘上日活和人均对话轮次,就是产品定价表里真实的一行。设计免费额度之前,这笔账要先算清楚。

预训练:把互联网压成一个概率模型

预训练干的事一句话说完:给模型看海量文本,让它反复练习「给定上文,猜下一个 token 是什么」。几千张 GPU 练几个月,它就成了一台高度压缩了语言和世界知识的概率机器。

这个本质决定了它的脾气。它不是在数据库里查答案,是按概率往下续写,所以语言流畅是天生的,事实准确是碰巧的。见过一万遍的东西说得又顺又对,只见过一两回的长尾知识就容易一本正经地编。理解了「概率续写」这四个字,你就不会再问「它为什么不承认自己不知道」——训练目标里从来没有「诚实」这一项。

这个机制也解释了「知识截止日期」:模型只见过训练数据里的世界,训完之后发生的事它一概不知,你问它上个月的新闻,它要么老实说不知道,要么现场编一个。需要时效信息的产品,必须给它外接搜索或知识库。

训练成本也值得记个数:外界估计 GPT-4 量级在几千万到上亿美元。这个数字告诉你,为什么自研基座模型是少数公司的游戏,绝大多数 PM 的舞台在应用层。

对齐:从补全机器变成助手

光有预训练的模型只会续写,你问「怎么做西红柿炒蛋」,它可能续一段菜谱,也可能续一句「这个问题在美食论坛上很常见」。对齐就是把它调教成助手:先用人工写的高质量问答做监督微调(SFT),教它听懂指令;再用人类反馈强化学习(RLHF)或 DPO 这类方法,教它说人话、守规矩、别教人干坏事。

对齐解释了很多日常现象:为什么模型会拒答敏感问题,为什么它有时客气得啰嗦,为什么各家模型「性格」不一样——那是对齐数据和偏好的差异。也有代价,安全约束收紧一点,某些正常能力就钝一点,业内叫对齐税。

对齐也不是铁板一块。用户用巧妙话术绕过限制(越狱)的事一直存在,所以涉及安全的场景不能指望模型自觉,产品侧要再加一层输入输出过滤。

原理怎么落到产品决策

懂了机制,很多产品问题就有答案了。prompt 为什么管用?因为你给的上下文改变了概率分布,把模型引导到你要的区域。为什么同一句话问两次结果不同?因为输出是采样出来的,有随机性,temperature 这个旋钮管的就是随机程度,写代码场景调低,写文案场景调高。为什么不能让模型为事实背书?因为它没有「查证」这个动作,除非你给它接上搜索或知识库。

成本账也一样:上下文越长,每次调用的钱和延迟越高,长文档场景不能无脑塞全文。这就是 RAG 存在的理由之一。

模型选型时这套理解也用得上。参数规模大致决定能力和价格档位:7B 级别的开源模型做意图分类、信息抽取够用,复杂推理和长文写作得上旗舰模型。先看任务难度,再看钱包,别一上来就全用最贵的那档。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.