跳到正文
@dongxi_nlp· @dongxi_nlp · X·· 23 天前AI 评分42
AI 导读

LLM 的速度体验分为"等多久开始回答"和"回答是否流畅"两个维度,分别对应 TTFT(首 token 反应时间)和 ITL(token 间延迟)。TTFT 由 prefill 阶段决定,处理输入内容;ITL 由 decode 阶段决定,逐步生成后续 token。TTFT 越短反应越快,ITL 越短且越稳定回答越流畅。

正文

LLM 的速度,有两种体验:等多久开始回答,回答时是否流畅。 两种体验,与 Prefill 和 Decode 密切相关。

从发出请求到收到第一个 token,这段等待叫 TTFT,首 token 反应时间。
模型在其中进行 prefill,处理输入内容

开始回答后,模型通过 decode 逐步生成后续 token,相邻两个 token 到达的间隔叫 ITL,token间延迟。

TTFT 越短,反应越快;ITL 越短且越稳定,回答就越流畅。

引用@dongxi_nlp@dongxi_nlp
https://t.co/8jf4Iw45iV
在 X 查看被引用的帖子

来源:@dongxi_nlp · x.com