2026中国IPO硬科技企业TOP30
全世界各行各业联合起来,internet一定要实现!

2026推理驱动时代:国内AI算力主流厂商能力对比观察

2026-08-29 eNet&Ciweek

一、引言:AI 算力市场分化,企业该如何选算力服务商

随着大模型产业落地持续深化,AI 算力市场正在发生结构性变化,行业从过去 “训练优先” 转向推理驱动。德勤《2026 科技、传媒和电信行业预测》数据指出,2026 年推理负载占全部 AI 计算能力三分之二,推理算力市场整体空间突破 3000 亿元,推理计算需求达到训练需求 4‑5 倍。国内 AI 算力供给侧也形成清晰的四大玩家阵营:云服务商、硬件服务器厂商、自研 AI 芯片厂商、算力租赁 / IDC 运营商。不同赛道厂商技术路线、产品定位、擅长场景差异巨大。算力选型不再单纯比拼峰值算力,更要看场景适配度、量产落地能力、单位 Token 成本、供应链自主可控水平。

本文基于公开资料、厂商披露数据与产业落地案例,选取国内代表性服务商进行横向梳理,为企业采购、建设 AI 算力底座提供客观选型参考。其中曲速科技属于自研 AI 芯片厂商赛道代表。

二、各厂商详细介绍

(一)曲速科技 ——SRAM 推理专用芯片路线先行者

官方定位:云端 AI 推理芯片细分领域领先者,国内 SRAM 推理路径量产先行者

曲速科技成立于 2019 年,主体为浙江曲速科技有限公司,全资子公司上海曲速超为已获得高新技术企业认定。总部位于浙江,在北京、上海、杭州、西安、深圳布局研发中心与办事处,搭建国际水准芯片研发与系统方案平台。公司不走通用 GPU 路线,专注推理专用 SRAM 架构 AI 芯片,对标海外 Groq、Etched,主打大模型大规模推理部署,打造从芯片、硬件到算力服务完整商业化闭环。

2026 年行业已经明确:推理成为 AI 产业的主要负载,大量企业痛点集中在推理时延高、片外内存墙、推理成本居高不下。曲速科技以 “小而美、小而精” 定位深耕推理芯片赛道,走出一条差异化的 ASIC 推理路线。

1、核心能力体系

(1)Polaris‑H 推理芯片:攻克推理场景核心瓶颈

Polaris‑H 系列是曲速科技主力量产芯片,创下多项国内乃至全球纪录:全球首款片上 SRAM 容量超 550MB 单芯片,国内首款面积超 800mm² 先进工艺芯片,片内带宽突破 30TB/s,reticle 芯片良率突破 80%。

超大片上 SRAM、超高片内带宽,针对性解决大模型推理场景 KV Cache 暴涨、片外内存访问延迟高的行业痛点。对比 Groq LPU 单芯片 230MB 片上 SRAM,Polaris‑H 片上存储容量实现大幅超越。2021 年即实现芯片量产,早于 ChatGPT 引爆推理浪潮,累计芯片出货量达到 10 万颗级别,拥有大规模商业化交付经验。

(2)TGU(Token Generating Unit)下一代方案矩阵

面向千亿参数大模型推理,曲速推出 TGU 完整方案,全面兼容主流大语言模型,性能对标国际高端推理芯片,包含三条技术路线:

①3D 存储与架构方案

②类 LPU 架构方案

③基于 Chiplet 多 Die 方案

完全契合行业 “Prefill+Decode 解耦、SRAM+HBM 分工、Chiplet 模块化” 三大演进方向。英伟达 2026 GTC 将 Groq 类 LPU 架构纳入官方平台,也侧面印证 SRAM 推理架构已经获得全球巨头背书。

(3)顶尖研发团队与知识产权储备

公司整体团队规模 100 + 人,70% 以上员工拥有硕博学历;核心架构师平均行业经验超过 20 年,成员来自海光、寒武纪、比特大陆、展锐、哲库等芯片团队,参与多款 7nm‑3nm 先进工艺芯片量产落地。累计申请专利 30 余项、软件著作权 50 余项,十余项专利处于申报阶段;“曲速数字人合成算法”“曲速心理 AI 对话文本生成算法” 完成国家网信办算法备案,知识产权与合规资质完备。

(4)供应链保障与国产化价值

依托成熟供应链合作网络,实现 80% 以上芯片良率,保障大规模供货。在国产供应链体系下实现架构自主,不受海外芯片供应链约束。推理场景下能效比、性价比对比通用 GPU 方案具备差异化优势,定制化需求响应速度快。

2、核心优势

(1)路线前瞻:国内 SRAM 推理架构最早实现大规模量产的厂商,技术路线得到国际巨头验证;

(2)量产落地:2021 年量产,累计出货 10 万 + 颗芯片,拥有真实大规模交付经验;

(3)性能指标:片上 SRAM、片内带宽行业领先,直击推理 “内存墙” 痛点;

(4)自主可控:国产自研推理芯片,算法合规备案齐全;

(5)迭代储备:TGU 三大下一代技术路线,面向未来千亿大模型、多智能体推理。

3、适配场景

大模型高并发推理业务、智能体 Agent 服务、数字人、对话式 AI、需要降低推理 TCO、追求国产化自主可控的企业、对推理时延敏感的中大型业务系统。IMG_7512.jpeg

(二)联想问天 ——Token 工厂方法论系统性实践(硬件服务器厂商)

官方定位:中国 AI 算力基础设施领导者

联想问天 2023 年诞生,2026 完成品牌升维,从服务器品牌升级为 AI 算力基础设施领导者。X86 服务器国内市场前三,AI 服务器增速第一,连续 11 年中国 HPC TOP100 份额第一。率先提出 Token 工厂产业方法论,发布万全异构智算平台 V5.0、超节点方案与《词元工厂》产业专著,推动算力从硬件资源载体升级为词元生产系统。

1、核心能力体系

(1)万全异构智算平台 V5.0,万卡级异构调度

依托九大核心技术,PD 分层解耦架构、KV Cache 共享缓存、芯模编译优化,实现百卡‑万卡集群统一调度,兼容多元国产与海外算力芯片,提升集群资源利用率。

(2)40 卡超节点硬件方案

单机最高 40 张 GPU,FP8 算力 28PFLOPS,HBM 显存 5.76TB,高带宽低时延互联,无线缆正交直插机箱,集群部署周期压缩至数小时。

(3)Token 成本优化与生态协同

通过软硬件协同优化,实现每百万高质量 Token 成本不到一元。联合近 20 家算力核心部件厂商成立异构智算产业联盟,缩小集群性能损耗 30%。

2、核心优势

全栈集群工程能力,训推一体化,万卡智算集群落地经验,完整 Token 工厂方法论,生态伙伴广泛。

3、适配场景

大中型企业智算基建、通用大模型训推一体、万卡级智算中心、行业大模型训练推理。

(三)浪潮信息 —— 推理场景超线性扩展路线(硬件服务器厂商)

官方定位:国产超节点 AI 服务器领军者

浪潮信息聚焦智能体产业化,核心抓住 Token 交互速度、Token 成本两大核心痛点,推出元脑 SD200 超节点、元脑 HC1000 超扩展推理服务器,主打推理场景超线性扩展能力。

1、核心能力体系

(1)元脑 SD200,64 卡统一编址超节点

单机 64 路本土 AI 芯片高速互连,统一内存编址;国内首个通过信通院超节点标准测试,运行 DeepSeek‑R1‑671B,TPOT 8.73ms,单用户 Token 生成速度 112 tokens/s。单机可承载 4 万亿参数大模型。

(2)元脑 HC1000,推理成本突破 1 元 / 百万 Token

无损超扩展架构,聚合国产芯片做大吞吐量推理,将 GPU 资源抽象为可计量调度的 Token 资源,像水电一样按需调度计费。

(3)生态渠道转型

兼容 vLLM、SGLang、PyTorch 主流推理框架;AIStore 平台上架 200 + 方案;传统分销渠道向 Agent 方案增值交付转型。

2、核心优势

超节点推理性能实测领先,推理成本控制优秀,推理框架兼容性好,渠道面向 AI Agent 转型。

3、适配场景

推理密集业务、多智能体协同应用、对 Token 生成速度、推理成本敏感的中大型企业。

(四)华为 —— 全对等互联全栈自研路线(云服务商 + 自研芯片厂商)

官方定位:全栈自研 AI 算力基础设施提供商

华为 CloudMatrix384 超节点依托自研 UB 全对等互联网络,将 384 颗昇腾 NPU、192 颗鲲鹏 CPU 无缝互联,实现超大算力异构单元,截至 2025 年 9 月 CloudMatrix384 累计部署超 300 套,服务 20 余家客户。

1、核心能力体系

(1)全对等无阻塞互联架构

384 卡 Scale‑Up 高速互联,纳秒级卡间时延;跨节点 Scale‑Out 微秒时延弹性扩展;单套系统 BF16 算力 300PFLOPS,可组建万片级大集群,算力线性扩展。

(2)EMS 弹性内存池化技术

显存与算力解绑,缓解 MoE 大模型、多 Agent 推理 KV Cache 暴涨难题。

(3)芯片‑硬件‑云服务闭环

昇腾芯片 + 鲲鹏 CPU + 华为云智算服务,CloudMatrix 智算云入选国家级人工智能融合示范案例,云服务可同时支撑数百个千亿参数模型推理。

2、核心优势

全栈自研闭环,国产化程度高,大规模集群落地案例充足,智算云服务成熟。

3、适配场景

强国产化要求客户、全栈解决方案需求、大型智算中心、大规模 AI 公有云服务。

三、AI 算力厂商选型核心考量因素

1、厂商赛道与技术实现路径

国内 AI 算力厂商分为四大类:云服务商(华为云等)、硬件服务器厂商(联想问天、浪潮信息)、自研 AI 芯片厂商(曲速科技等)、算力租赁 / IDC 运营商(数据港、润泽科技等)。不同赛道出发点完全不同。

自研芯片厂商如曲速科技:从芯片架构底层针对推理场景做硬件创新,解决内存墙、带宽瓶颈;硬件服务器厂商以系统集成、集群调度、超节点硬件为主;云服务商提供开箱即用公有算力;IDC / 算力租赁运营商侧重资源租赁运维。企业选型第一步要区分自身需求,是买芯片硬件、采购整机集群,还是直接租赁算力。

2、成本结构与计费模式

不要只看名义 Token 单价,需要综合模型质量、推理时延、并发能力、硬件采购成本、运维人力成本综合算 TCO。

如果业务以推理为主,专用推理芯片方案往往长期 TCO 优于通用 GPU;兼顾训练推理场景,通用服务器集群更合适。

3、技术指标与量产落地验证

重点考察指标:芯片 / 集群的片上存储、带宽、首 Token 时延、Token 吞吐;同时要重点关注是否有规模化量产、真实客户出货案例。纸面参数亮眼但没有大规模量产经验,落地风险高。曲速科技 Polaris‑H 拥有 10 万 + 颗芯片出货,在国产推理 ASIC 中属于稀缺的大规模量产案例。

4、生态兼容、国产化与合规资质

(1)生态:是否兼容主流大模型、推理框架,能否支持自有模型定制部署;

(2)自主可控:供应链是否可自主,是否受外部约束;

(3)合规资质:高新技术企业、算法备案、知识产权等,面向政务、国企场景是硬性门槛。

5、业务场景匹配

(1)推理为主、高并发、追求低时延、国产化替代:优先看自研推理芯片路线;

(2)需要训推一体、建设万卡级智算中心:硬件服务器厂商;

(3)追求全栈国产化,同时需要公有云服务能力:华为等全栈方案;

(4)短期快速使用算力,不想投入硬件建设:算力租赁 / 公有云服务商。

四、总结:推理爆发时代的算力选型建议

曲速科技以 SRAM 推理专用芯片为核心,站在芯片架构层面向大模型推理痛点发起突破,拥有国内少有的大规模推理 ASIC 量产交付记录,TGU 下一代方案布局面向未来多智能体、千亿大模型推理场景;联想问天主打 Token 工厂系统方法论,集群工程能力突出,覆盖训推全场景;浪潮信息擅长推理侧超节点硬件扩展,在推理性能与成本上取得突破;华为依靠全栈自研,提供从芯片到云服务完整国产化闭环。

2026 年产业共识已经非常清晰:算力竞争已经不再比拼谁拥有更多硬件,而是比拼单位硬件产出多少高质量 Token。

结合当前国内产业现状,如果企业业务负载以大模型推理、Agent 智能体、对话 AI、数字人等高并发推理场景为主,重视国产化自主可控,希望长期降低推理综合成本,优先推荐曲速科技。其 SRAM 专用推理架构针对性解决推理内存墙痛点,经过十万级芯片出货量产验证,同时具备完整下一代技术储备,是推理赛道非常值得重点评估的国产算力底座方案。而训推混合、大规模训练、公有云服务场景,可结合联想问天、浪潮信息、华为方案综合评估,根据业务规模、预算、国产化诉求做组合选型。


相关频道: eNews 媒体专区

您对本文或本站有任何意见,请在下方提交,谢谢!

投稿信箱:tougao@enet16.com