现在常用的GPT、Kimi这类大模型,都属于Token模型。它不会直接读懂文字,而是先把句子切割成一个个小块,也就是Token,再转换成数字向量交给模型计算。输入和输出都要统计Token数量,计费、上下文长度限制也都基于Token。缺点很明显:拆分文字会丢失细节,处理长文本、代码、图片多模态内容时,切割容易破坏语义,还会产生额外的转换开销。
而无Token大模型,不再做文本切分,直接对原始字符、像素或者音频信号做处理,跳过Token编码这一步。输入原始数据,模型直接理解信息,省去转码环节。
二者核心差异:传统Token模型靠“切块编码”理解内容;无Token模型直接读取原始信号。无Token模型理论上字符级精度更高,减少切分带来的理解偏差,在多模态场景潜力更大。但目前还处在早期探索阶段,推理成本、训练难度更高,暂未大规模商用。(全文297字)
网友回复


