人工智能

Token(词元)

Token / 词元

大模型处理文本的基本单位,决定上下文长度上限,也是按量计费的依据。

Token 是大语言模型读取和生成文本时的基本单位。模型会先用分词器把文字切分成一个个 Token,一个 Token 可能是一个汉字、半个词、一个英文单词或一段标点。同样长度的文字在不同模型中切出的 Token 数量并不相同。

Token 与两件事直接相关。一是上下文窗口:模型单次能处理的输入加输出总长度以 Token 计,超过上限的内容会被截断或报错。二是费用:国内外主流模型 API 基本按输入和输出的 Token 数量分别计费,输出通常比输入更贵。

在应用设计中,控制 Token 用量既是成本问题也是效果问题。常见做法包括:只把检索到的相关片段放进上下文,而不是整份文档;为输出设置最大长度;对重复请求做缓存;在调用日志中记录每次的 Token 消耗,便于核算和排查异常。

估算项目的模型成本时,应按实际业务的平均输入长度、输出长度和调用频次测算,并留出余量。部分厂商对缓存命中的输入有单独计价规则,具体以各家当前价格说明为准。上线初期建议设置用量告警,防止异常调用造成超出预期的费用。

相关词条

免费咨询

聊聊你的项目

留下联系方式,我们一个工作日内联系你。先沟通需求和现状,再给方案;报价当面沟通。

  • 一个工作日内回复
  • 需求沟通免费,不强推方案
  • 交付管理后台与文档,可自行维护
仅用于本次咨询联系,不会用于其他用途。