跳到正文
@dongxi_nlp· @dongxi_nlp · X·· 2026-09-03AI 评分27
AI 导读

马东锡 NLP 指出 tokenizer 只关心“流星雨”这类字符串的出现频率,不关心语义或情感。中文“流星雨”虽是三个字,编码后只占 1 个 token。他借此对比人类从“流”“星”“雨”逐层组合理解意义,而 AI 起点只是 token 与编号的对应关系,再靠神经网络从海量文本的关系中逼近语言意义。

正文

看看无情的 tokenizer,它根本不关心你在流星雨下许下的愿望,它只关心“流星雨” 出现的频率。

所以你明白了么,“流星雨”,在中文里即是是三个字,但编码后是 1 个 token。 https://t.co/zhfyUbudeY https://t.co/By8fKRapf5

引用@dongxi_nlp@dongxi_nlp
人类常常先学会一个个单词,随后在漫长的经历中,把它们组合起来,表达越来越复杂的意义。 比如,从“流”“星”“雨”,慢慢理解“流星”,又理解“流星雨”。 人通过组合,观看、想象和使用,逐渐理解语言的意义。 反观 AI,起点非常粗暴。它从庞大的语料中建立 token 与编号之间的对应关系: 1,流;2,星;3,雨;4,流星;5,流星雨。 在最初的这一刻,那里只有 1、2、3、4、5,还没有夜空,没有坠落的光,也没有人在流星雨下许愿。 随后,庞大的神经网络开始学习这些编号在无数文本中的联系,由此逐渐建立 token 与 token 之间的关系,并从关系之中逼近语言的意义。 但无论如何,AI 的这种苍白感,在一开始就注定了。
在 X 查看被引用的帖子

来源:@dongxi_nlp · x.com