AI 模型服务
软硬协同、训推一体,提供 AI 大模型、训推一体机与 Token 算力,助力企业快速构建 AI 服务能力。
训推一体机
AI Stack 训推一体机
软硬协同、训推一体,快速构建 AI 服务能力。
超大容量
- 1.5TB+ 显存
- 单机 16 卡 1.5TB+ 超大显存
- 卡间互联 700GB/s
超大带宽
- 1.6T 带宽
- 支持机间 1.6T 通信带宽
- 低时延无拥塞通信
超强性能
- 单机可支持 DeepSeek BF16 精度满血版高并发
- 3000+ Tokens/s 吞吐
性能指标压测结果
| 模型 | 精度 | 显存 | 总吞吐(tokens/s) | 并发数 |
|---|---|---|---|---|
| DeepSeek-R1/V3 | BF16 | 1536 GB | 3708 | 256 |
| DeepSeek-R1/V3 | INT8 | 1536 GB | 5872 | 512 |
备注:数据来源于实验室实测,实际性能以交付环境为准。
满足数据敏感性需求
一体机支持本地化私有部署,确保敏感数据(如政务、金融信息)无需上传云端即可完成处理,满足行业数据主权和隐私监管要求。
满足私有化部署的扩展性需求
预置行业优化模型与全栈工具链(数据知识处理、蒸馏微调训练、智能体搭建与应用模板),实现开箱即用,部署周期从数周缩短至小时级。
满足实时推理的高并发算力需求
单机 16 卡全精度 16/8/4 bit 下,支持高并发满血版 DeepSeek-R1/V3;BF16 精度下 8K+ Tokens 输入每秒解析延迟保持在 50 毫秒;自研推理引擎相比开源 vLLM 可提升吞吐量 50%、延时降低 50%。
Token 算力
按 Token 计费的弹性算力
无需自建集群,按实际用量付费,快速调用大模型推理能力。
按量计费
以 Token 为计量单位,用多少付多少,成本透明可控。
弹性扩缩
算力资源按需弹性伸缩,轻松应对业务高峰。
多模型接入
支持 DeepSeek 等主流大模型统一接入与调度。
高并发低延时
优化推理链路,保障高并发下的稳定低延时响应。



