不一样。同一个中英混合文本,在不同大模型里算出的 token 数量通常不一致,原因在于"分词规则"不同。
你可以把 token 想象成模型识字的最小单位。英文方面,有的模型把 "unhappy" 拆成 "un" + "happy"(2个token),有的直接认作1个;中文差异更大:有的模型按字切("你好"=2 token),有的按词切("你好"=1 token),还有的混合处理。中英混合时,空格、标点、数字的归属规则也不同,进一步拉大差距。
举个栗子网友回复
最新的国内外ai大模型能力排行榜有吗?
国产图片大模型seedream-5及qwen-image-3都无法生成360度全景图片?
听说OpenAI的Astra太强了可能会失控?
qwen3.8-max比较适合那些场景?
python有没有免费的股市行情数据api可用?
UUIDv7、nanoid、Snowflake、ULID与sparkid这些id生成器区别?
get请求报错NS_BINDING_ABORTED是什么原因?
happyhorse与seedance及minmax h3到底哪个更好?
scriptc为啥能生成一个不带nodejs的原生二进制可执行程序?
为啥huggingface那么多ai图片和视频模型都能一键脱衣没人管呢?


