行业科普丨一文读懂词元:概念、政策与市场

发布于:2026-09-30 作者:数小宝 来源:数据宝平台
21367人看过

词元(Token)是 AI 模型处理信息的最小数据单元,也是衡量算力消耗的统一计量单位。随着大模型从技术探索走向规模化应用,词元正从一项技术概念,演变为智能经济中可计量、可定价、可交易、可复用的基础单元与价值锚点。本文从词元的基本定义出发,梳理其发展脉络与市场格局,并系统整理国家与地方两级相关政策,呈现词元产业的完整图景。

在这一进程中,数据宝已完成词元业务的布局并进入规模化运营,以数据原生 AI Token服务商的定位,处于国内词元服务产业化的前列;词元业务订单量从年初的数万单增长到数十万单。稳定的词元供给,正成为企业使用 AI 的一项基础服务。


一、词元基本概念与原理


(一)词元定义

从技术层面看,词元是大模型处理信息的最小单位,也是智能设备中信息存储、处理与交换的基本符号单元;它把文字、图像、音视频等各类信息切成统一的最小碎片,送进模型参与运算。

从经济层面看,词元是衡量智能服务交易量的核心指标,具备可计量、可定价、可交易的特性,为人工智能服务的计量、定价、交易与结算提供了标尺,正成为智能经济时代重要的基础计量单位与价值锚点。

(二)训练与推理机制

大模型的运行分为训练与推理两个环节:

训练环节,向模型输入海量文本,模型不断调整内部参数,逐步获得准确预测文本的能力,最终形成一个可用的模型。

推理环节,模型接收用户输入,基于训练所得逐词元生成回复内容。推理是词元的产出过程,也是算力持续消耗的主要场景。

训练与推理都以词元为单位,通常所说的“词元成本”指推理环节的算力消耗。

(三)词元计价逻辑

词元数量与算力消耗呈线性关系,因此按词元计费能够直接反映实际成本。按调用次数计费则无法区分单次调用中词元消耗量的差异,同等收费下成本偏差可达数十倍。词元由此成为计价单位。

(四)相关核心概念

一次调用中,词元分为两类:输入词元是用户提供给模型的内容(提问、历史对话、上下文),输出词元是模型生成的内容。生成输出比处理输入消耗更多算力,因此输出词元的计费单价通常为输入的2-5倍。

模型单次可处理的词元总量存在上限,即上下文窗口,主流已扩展到128K,部分模型达1M。重复出现的输入内容可复用已有计算结果,命中部分按折扣价计费,称为缓存命中;对时效要求不高的任务可离线异步处理,价格最低,称为批处理。



二、词元市场发展现状


(一)词元演进脉络

图片

图2.词元演进脉络


(二)国内大模型市场格局

竞争格局呈梯队分布。

第一梯队是字节跳动豆包、DeepSeek、阿里通义千问:豆包依托字节生态,C端月活跃用户达3.15亿,在各厂商中排名第一;DeepSeek以开源与高性价比建立起开发者生态,其开源模型在全球开发者社区得到广泛使用;通义千问依托阿里云,模型数量达86个,为国内最多。

第二梯队是百度文心一言、腾讯混元、智谱GLM等,分别在搜索、社交、学术与政企市场形成差异化优势。

整体来看,国内大模型市场已形成“头部集中、差异化并存”的格局,竞争重心正从模型能力转向应用生态与算力成本。

图片

图3.产业链全景


(三)词元价格趋势

价格整体大幅下降,但近期出现分化。2024至2025年,国产大模型百万词元价格由数十元降至1元级。近期以DeepSeek为代表的头部模型开始上调价格,并推行高峰时段加价、低谷时段优惠的差异化定价。

这一轮涨价并非个别厂商的孤立调价,而是国内大模型行业的阶段性拐点。一方面,持续的价格竞争使算力供给难以支撑低价模式;另一方面,行业竞争逻辑正从低价竞争转向能力竞争,过去一年“以价换量”的竞争方式,正逐步让位于“模型能力优先、价格次之”的价值导向。




三、词元相关国家级政策


国家级政策从算力扩容、数据提质、模型协同三个方向对词元产业作出部署;地方政策则以词元券、算力券、训力券为主要工具推动落地。

国家层面尚无直接以“词元”命名的专项政策,但对词元的三个上游要素,即算力、数据、模型,均有部署。

图片

四、词元相关地方政策


2026年最显著的变化是“词元”进入地方政策名称,北京、上海、扬州、杭州等地已将其写入政策文件或补贴条款,标志着词元从技术概念升级为产业政策对象。

图片


五、词元供给:数据宝的实践


词元从技术计量单位走向可交易的数字资产,产业竞争的焦点也随之从模型能力转向词元的稳定供给与成本效率。对企业而言,真正的门槛不在于接入某一个模型,而在于能否持续、稳定、低成本地获得覆盖多模型的词元供给。

数据宝全资子公司词元宝独立运营词元业务,其主运营的 TopenRouter.com 平台已集成 90% 以上主流大模型,从客户需求的演进看,企业由最初采购数据 API,转向主动寻求 Token API,进而要求按需求分层匹配不同模型以降低成本,并延伸至算力 API 的统一记录与结算。平台日均词元调用量从 2026 年初不足 30 亿增长到如今的 5000 亿。

支撑这一供给能力的是数据宝长期积累的数据与算力基础。公司已在贵州、重庆、海南、湖南、湖北、江苏、上海、福建、甘肃、北京 10 个省级单位取得公共数据二级开发利用资质,构建起由 50 多个权威的全国性数据、10 余省市公共数据及百余企业多源数据组成的“全国—省市—企业”三级数据资源体系;并以数据宝、智算宝、词元宝的产业矩阵,形成“数据+算力+Token 三合一”的 API 平台能力。

词元业务改变了传统数据“一锤子买卖”的交易方式,让其转向持续可计量的服务模式。为各类企业提供持续、可计量的词元供给,正是数据宝词元业务的着力方向。


- END -


编辑:杨洁

一审:杨锐

二审:肖斌



推荐资讯
行业资讯
    公司动态
      领导参访

        行业科普丨一文读懂词元:概念、政策与市场

        新闻中心/行业资讯 2026-09-30

        词元(Token)是 AI 模型处理信息的最小数据单元,也是衡量算力消耗的统一计量单位。随着大模型从技术探索走向规模化应用,词元正从一项技术概念,演变为智能经济中可计量、可定价、可交易、可复用的基础单元与价值锚点。本文从词元的基本定义出发,梳理其发展脉络与市场格局,并系统整理国家与地方两级相关政策,呈现词元产业的完整图景。

        在这一进程中,数据宝已完成词元业务的布局并进入规模化运营,以数据原生 AI Token服务商的定位,处于国内词元服务产业化的前列;词元业务订单量从年初的数万单增长到数十万单。稳定的词元供给,正成为企业使用 AI 的一项基础服务。


        一、词元基本概念与原理


        (一)词元定义

        从技术层面看,词元是大模型处理信息的最小单位,也是智能设备中信息存储、处理与交换的基本符号单元;它把文字、图像、音视频等各类信息切成统一的最小碎片,送进模型参与运算。

        从经济层面看,词元是衡量智能服务交易量的核心指标,具备可计量、可定价、可交易的特性,为人工智能服务的计量、定价、交易与结算提供了标尺,正成为智能经济时代重要的基础计量单位与价值锚点。

        (二)训练与推理机制

        大模型的运行分为训练与推理两个环节:

        训练环节,向模型输入海量文本,模型不断调整内部参数,逐步获得准确预测文本的能力,最终形成一个可用的模型。

        推理环节,模型接收用户输入,基于训练所得逐词元生成回复内容。推理是词元的产出过程,也是算力持续消耗的主要场景。

        训练与推理都以词元为单位,通常所说的“词元成本”指推理环节的算力消耗。

        (三)词元计价逻辑

        词元数量与算力消耗呈线性关系,因此按词元计费能够直接反映实际成本。按调用次数计费则无法区分单次调用中词元消耗量的差异,同等收费下成本偏差可达数十倍。词元由此成为计价单位。

        (四)相关核心概念

        一次调用中,词元分为两类:输入词元是用户提供给模型的内容(提问、历史对话、上下文),输出词元是模型生成的内容。生成输出比处理输入消耗更多算力,因此输出词元的计费单价通常为输入的2-5倍。

        模型单次可处理的词元总量存在上限,即上下文窗口,主流已扩展到128K,部分模型达1M。重复出现的输入内容可复用已有计算结果,命中部分按折扣价计费,称为缓存命中;对时效要求不高的任务可离线异步处理,价格最低,称为批处理。



        二、词元市场发展现状


        (一)词元演进脉络

        图片

        图2.词元演进脉络


        (二)国内大模型市场格局

        竞争格局呈梯队分布。

        第一梯队是字节跳动豆包、DeepSeek、阿里通义千问:豆包依托字节生态,C端月活跃用户达3.15亿,在各厂商中排名第一;DeepSeek以开源与高性价比建立起开发者生态,其开源模型在全球开发者社区得到广泛使用;通义千问依托阿里云,模型数量达86个,为国内最多。

        第二梯队是百度文心一言、腾讯混元、智谱GLM等,分别在搜索、社交、学术与政企市场形成差异化优势。

        整体来看,国内大模型市场已形成“头部集中、差异化并存”的格局,竞争重心正从模型能力转向应用生态与算力成本。

        图片

        图3.产业链全景


        (三)词元价格趋势

        价格整体大幅下降,但近期出现分化。2024至2025年,国产大模型百万词元价格由数十元降至1元级。近期以DeepSeek为代表的头部模型开始上调价格,并推行高峰时段加价、低谷时段优惠的差异化定价。

        这一轮涨价并非个别厂商的孤立调价,而是国内大模型行业的阶段性拐点。一方面,持续的价格竞争使算力供给难以支撑低价模式;另一方面,行业竞争逻辑正从低价竞争转向能力竞争,过去一年“以价换量”的竞争方式,正逐步让位于“模型能力优先、价格次之”的价值导向。




        三、词元相关国家级政策


        国家级政策从算力扩容、数据提质、模型协同三个方向对词元产业作出部署;地方政策则以词元券、算力券、训力券为主要工具推动落地。

        国家层面尚无直接以“词元”命名的专项政策,但对词元的三个上游要素,即算力、数据、模型,均有部署。

        图片

        四、词元相关地方政策


        2026年最显著的变化是“词元”进入地方政策名称,北京、上海、扬州、杭州等地已将其写入政策文件或补贴条款,标志着词元从技术概念升级为产业政策对象。

        图片


        五、词元供给:数据宝的实践


        词元从技术计量单位走向可交易的数字资产,产业竞争的焦点也随之从模型能力转向词元的稳定供给与成本效率。对企业而言,真正的门槛不在于接入某一个模型,而在于能否持续、稳定、低成本地获得覆盖多模型的词元供给。

        数据宝全资子公司词元宝独立运营词元业务,其主运营的 TopenRouter.com 平台已集成 90% 以上主流大模型,从客户需求的演进看,企业由最初采购数据 API,转向主动寻求 Token API,进而要求按需求分层匹配不同模型以降低成本,并延伸至算力 API 的统一记录与结算。平台日均词元调用量从 2026 年初不足 30 亿增长到如今的 5000 亿。

        支撑这一供给能力的是数据宝长期积累的数据与算力基础。公司已在贵州、重庆、海南、湖南、湖北、江苏、上海、福建、甘肃、北京 10 个省级单位取得公共数据二级开发利用资质,构建起由 50 多个权威的全国性数据、10 余省市公共数据及百余企业多源数据组成的“全国—省市—企业”三级数据资源体系;并以数据宝、智算宝、词元宝的产业矩阵,形成“数据+算力+Token 三合一”的 API 平台能力。

        词元业务改变了传统数据“一锤子买卖”的交易方式,让其转向持续可计量的服务模式。为各类企业提供持续、可计量的词元供给,正是数据宝词元业务的着力方向。


        - END -


        编辑:杨洁

        一审:杨锐

        二审:肖斌



        免费试用