LuAITools.com
提交工具
AI
Token Throughput

词元吞吐量

AI 系统每秒能「吐出」多少个词元。它决定了回答快不快、能不能扛住高并发,是衡量推理性能的核心指标。

词元吞吐量是什么?

问你一个 AI 服务「有多快」,看的就是词元吞吐量(Token Throughput)——单位时间内系统能处理的 Token 数量,通常说「每秒多少 Token」(tokens/s)。数字越大,同样的活儿干得越快。

它和「延迟」是一回事吗?

不是,但相关
延迟(latency)是「一个请求从发出到收到要多久」,吞吐量是「整体每秒能处理多少」。就像快递:延迟是「你这一单多久送到」,吞吐量是「仓库一天能发多少单」。吞吐量高,系统才扛得住很多人同时用。

吞吐量受什么影响?

硬件与算力
GPU 越多越强,能同时算的 Token 就越多。
模型大小
大模型每算一个 Token 更贵,同样的硬件,吞吐量通常更低。
批处理与并行
把多个请求合在一起算(batching),能大幅提高吞吐。
优化技术
量化、投机解码、KV 缓存等手段,也能把吞吐量顶上去。

为什么它很重要?

对用户来说,吞吐量不足意味着排队、卡顿、等很久。对服务商来说,吞吐量直接决定成本:同样算力下吞吐越高,单个 Token 的服务成本越低,产品才能又便宜又能扛流量。

一句话记住:词元吞吐量,就是 AI 的「出活速度」——每秒处理的 Token 越多,服务越快、越扛得住流量。

评论