ARTICLE · 1159067
2026 服贸会|高品质 AI Token 是怎样炼成的?

“模型跑起来”只是起点,能否持续产出满足业务要求的高品质 AI Token,才是企业将大模型带入生产环境的关键。
9月9日至13日,中国国际服务贸易交易会在北京召开,趋境科技创始人兼 CEO 艾智远出席中国国际服务贸易交易会·中国AIGC创新应用交流会,发表题为《高品质 AI Token 工厂建设实践》的主旨演讲,围绕模型深度优化、Token工厂建设与国产异构 PD 落地,介绍如何将模型能力转化为可衡量、可持续交付的高品质 AI Token 产能。


趋境科技创始人兼 CEO
艾智远
01 少模型、深优化 .
提供生产级高品质 AI Token 服务
高品质 AI Token,不是单项指标跑得快,而是时延、输出速度、稳定性和单位成本在真实生产负载下同时过关。
随着 AI 从问答助手、推理助手走向工具型智能体和自主业务智能体,一次任务可能触发数十次甚至数百次模型调用,Token 需求也由单次调用转向持续性、规模化增长。
模型能够生成 Token,只代表完成了基础部署;要进入核心生产系统,还需要在真实负载下综合考量时延、输出速度、服务稳定性以及在长上下文场景下仍可保障服务等级目标。这正是趋境科技对高品质 AI Token 的理解:不追求某一项指标的单点峰值,而是让多项生产指标共同满足具体业务要求。

基于这一判断,趋境科技选择“少模型、深优化”的技术路径。“少”不是限制模型选择,而是聚焦能够持续承接核心业务负载的高需求模型;“深”则是围绕模型结构、参数规模和请求特征,对推理引擎、模型切分、显存管理、通信链路与异构协同进行系统优化,让模型、硬件、推理系统和生产运营形成完整链路,推动高品质 AI Token 从“可以生成”走向“持续生产、稳定交付”。
这些工程能力也在通过开源走向更广泛的产业实践。趋境科技参与推动 KTransformers、Mooncake 等开源项目建设,并在社区协作和真实场景中持续验证、完善相关技术。
但单个模型的深度优化解决的主要是局部生产效率问题。如何把单点能力进一步标准化、体系化,形成能够长期运行并规模化交付的生产体系,成为下一个需要解决的问题。
02 平台化生产、专业化运营 .
建设日均万亿级高品质 AI Token 工厂
Token 工厂不是设备与软件的简单叠加,而是把模型、硬件、推理系统和持续运营组织成可衡量、可保障的 Token 产能。
为将单点优化能力转化为可持续供给,趋境科技提出高品质 AI Token 工厂的生产模式。
艾智远指出,Token 工厂不是机房,不是模型接口的集合,也不是一次性交付的软件平台,而是面向真实业务负载,将模型、异构资源、推理技术与运营服务组织起来,持续生产高品质 AI Token 的完整体系。
在这一体系中,异构资源底座提供资源供给,ATaaS 平台连接模型与基础设施,专业 Token 运营服务则围绕业务负载、服务质量、故障恢复和单位成本开展持续运营。其核心能力可以概括为:
高品质 AI Token 工厂 = ATaaS 生产平台 + 异构资源底座 + 专业 Token 运营服务

其中,ATaaS 平台将芯片适配、推理引擎、模型优化、流量治理、资源统筹和服务运维等工程能力进行标准化封装;系统上线后,再根据业务高峰、请求结构和模型变化,持续开展负载管理、弹性伸缩、运行监控与故障恢复,使单点技术能力转化为稳定、可靠、可衡量的高品质 AI Token 产能。
从技术验证到单点投产,再到日均千亿级、万亿级生产,趋境科技的高品质 AI Token 生产能力正由单项目实践走向多项目供给。截至目前,趋境科技已形成1个日均万亿级、多个日均千亿级高品质 AI Token 项目实践。艾智远表示,这一规模增长并非来自硬件或模型数量的简单叠加,而是源于对模型、推理系统、基础设施和生产运营全链路的持续优化。
03 国产异构 PD .
性价比优于国际先进算力方案
在特定模型、设备配置和业务负载下,趋境科技国产异构 PD 方案的综合投入产出表现优于采用单一国际主流高性能 GPU 的同类方案。
在 Token 工厂中,国产设备能否进入核心生产环节,关键不只是模型能不能运行,还要看能否在真实业务负载下持续承担生产任务。异构 PD 分离,正是趋境科技推动不同设备形成能力互补的一项重要工程路径。
艾智远特别谈到,在高端设备供给相对集中的背景下,异构 PD 的价值并不是对不同设备进行简单拼接,而是依据推理阶段的负载特征重新组织生产链路,根据模型结构、上下文长度和请求分布,持续优化两类资源池的配比。在趋境科技的国产异构 PD 架构中,由国产 GPU 承担更适合的 Prefill 任务,高性能设备承担 Decode 任务,并通过统一生产编排引擎完成任务路由、负载均衡、弹性伸缩及 KV Cache 跨阶段传输。
在已验证的特定模型、设备配置和生产负载下,趋境科技国产异构 PD 方案在满足 Token 输出速度、服务稳定性等生产级要求的同时,能够提升国产 GPU 的有效利用水平、优化单位 AI Token 成本,综合性价比已优于采用单一国际主流高性能 GPU 的同类方案。
目前,趋境科技已围绕国产 GPU 开展异构适配和项目验证,推进相关方案的千卡级工程部署,并面向万卡级集群持续开展规模化验证。

大模型真正进入业务深处,企业需要的不是一次性能展示,而是经得起复杂负载和长期运行检验的生产能力。
把模型能力转化为稳定的 Token 产能,依靠的不是某个单点突破,而是模型、芯片、推理系统与生产运营的长期协同。
从模型深度优化到 Token 工厂建设,再到国产异构 PD 的规模化验证,趋境科技正在把分散的技术能力组织成完整的生产体系,推动高品质 AI Token 从技术产出走向业务生产,让企业用得起、用得好、用得久,持续践行“算力更高效,智能更普惠”的使命。






